고려대, 글·사진 단서 연결하는 AI 추론 학습·평가체계 개발
텍스트·이미지 함께 분석하는 'CRIT' 구축
자연 이미지·영상·과학논문 평가서 성능 개선
[파이낸셜뉴스] 고려대 연구팀이 글과 이미지에 흩어진 여러 단서를 단계적으로 연결해 답을 찾는 인공지능(AI) 학습·평가 체계를 개발했다.
6일 고려대에 따르면 컴퓨터학과 서홍석 교수 연구팀은 텍스트와 이미지가 섞인 자료를 바탕으로 여러 단계의 추론을 거쳐 결론을 도출하는 학습·평가 체계 'CRIT'를 개발했다. CRIT는 AI의 교차 모달 다단계 추론 능력을 높이고 검증하기 위해 만든 학습·평가용 데이터셋이다.
현재 시각·언어 AI 모델은 사진 속 사물을 인식하거나 문장의 내용을 이해하는 능력은 빠르게 발전했지만, 여러 이미지와 문장에 흩어진 정보를 찾아 서로 연결하는 문제에서는 상대적으로 낮은 성능을 보인다.
기존 평가 문제 가운데는 이미지나 텍스트 중 한쪽 정보만으로도 답을 구할 수 있어, AI가 실제로 두 종류의 정보를 함께 활용했는지 제대로 확인하기 어렵다는 한계도 있었다.
연구팀은 이를 보완하기 위해 이미지와 텍스트에 등장하는 인물·사물과 속성, 개체 간 관계를 그래프 형태로 구조화했다. 이후 그래프를 바탕으로 이미지와 글을 모두 살펴야만 답할 수 있는 질문과 정답을 자동으로 생성했다.
이미지나 글 한쪽만 보고 답을 맞히거나 실제 자료에 없는 내용을 근거로 답하지 못하도록 문제를 설계해 일관성을 높인 것이 특징이다.
CRIT는 자연 이미지와 영상 장면, 과학논문·도표 등 서로 성격이 다른 자료를 포함한다. 전체 데이터 규모는 약 27만1000건이며, 평가용 문제는 사람이 다시 검증했다.
실험 결과 CRIT로 학습한 70억개 매개변수 규모의 AI 모델은 자연 이미지 분야의 '정확 일치' 점수가 28.3점에서 58.6점으로 높아졌다. 과학논문 분야의 종합 답변 점수도 9.6점에서 22.5점으로 두 배 이상 상승했다. 영상 분야 점수는 27.8점에서 42.2점으로 개선됐다는게 연구팀의 설명이다.
연구팀은 CRIT가 과학 문헌과 도표 분석, 교육 콘텐츠 이해, 여러 문서에 흩어진 정보 검색, 이미지와 글을 함께 처리하는 AI 비서 등에 활용될 수 있을 것으로 보고 있다.
이번 논문에는 고려대의 성준영·류승우·김민준·안수민 연구원과 구글 딥마인드의 아르샤 나그라니 연구원이 참여했다. 성준영 연구원이 제1저자를 맡는 등 학부생들이 주요 저자로 이름을 올렸다. 연구 성과는 지난 6월 3일부터 7일까지 미국 콜로라도주 덴버에서 열린 컴퓨터 비전 분야 국제학술대회 'CVPR 2026'에 채택돼 발표됐다.
[email protected] 이보미 기자




