'독파모' 평가 논란에 과기정통부 세부 점수도 공개…SKT 1위
4개 정예팀 참여 2차 평가점수 공개
탈락한 모티프 공개 이의 제기 여파
모티프 AAII 1위에도 나머지 항목서 최하위
[파이낸셜뉴스] 과학기술정보통신부가 독자 인공지능(AI) 파운데이션 모델(독파모) 사업 2차 평가 세부 점수를 공개했다. 4개 정예팀 중 최하위로 탈락한 모티프테크놀로지스가 세부 평가를 공개해달라고 공식 이의를 제기하면서다. 모티프는 아티피셜 애널리시스 지능지수(AAII)에서 최고점을 받았지만, 한국지능정보사회진흥원(NIA) 기준 벤치마크는 가장 낮은 점수를 받았다. 또 전문가 평가와 일반 국민 평가에서도 최하위를 기록한 것으로 나타났다.
과기정통부는 27일 이 같은 내용이 포함된 독파모 프로젝트 2차 단계평가 세부 평가 결과를 공개했다. 과기정통부는 지난 18일과 20일 두 차례에 걸쳐 주요 평가를 공개했으나, 모티프의 이의 제기로 잡음이 커지자 이를 해소하기 위해 세부 평가까지 외부에 꺼내기로 한 것으로 보인다.
앞서 모티프는 이날 입장문을 통해 독파모 2차 평가 결과에 대한 이의신청을 과기정통부에 제출했다고 전했다. 모티프는 이의신청에서 전문가·사용자 평가의 기준과 항목별 평가 내용 등을 공개하고 결과를 재심의해 달라고 요청했다. 과기정통부가 모티프 탈락 이유를 설명하면서 벤치마크 평가만 높고, 전문가·사용자들의 실제 평가는 낮았다고 공개하면서 모티프가 앞으로 시장에서 경쟁하는데 사용성에 문제가 있는 것으로 오인될 수 있다는 우려가 반영된 것으로 보인다.
독파모 2차 평가는 벤치마크 평가 40점(AAII 25점·NIA 15점), 전문가 평가 35점, 사용자 평가 25점으로 구성됐다. 모티프는 글로벌 AI 모델 종합 성능 지표인 AAII에서 참여 모델 중 가장 높은 47점을 기록했다. 업스테이지는 37점, SK텔레콤은 35점, LG AI연구원은 31점이었다. 모티프에 따르면 모티프3는 모델 업체 기준 글로벌 10위이자 미국과 중국을 제외하면 1위에 해당한다.
다만 과기정통부가 공개한 세부 평가를 보면 모티프는 주요 항목에서 모두 최하위를 기록했다.
NIA 벤치마크 평가 점수는 SK텔레콤 정예팀이 13.4점으로 1위, 업스테이지 정예팀이 13.3점으로 2위, LG AI연구원 정예팀이 12.8점으로 3위, 모티프 정예팀이 12.7점으로 4위를 기록했다.
전문가 평가에서도 모티프 정예팀은 27.1점으로 4위를 나타냈다. LG AI연구원 정예팀이 29.5점으로 1위, SK텔레콤 정예팀이 29.3점으로 2위, 업스테이지 정예팀이 29.1점으로 3위였다.
49명의 AI 스타트업 대표들이 참여한 AI 전문 사용자진 평가는 SK텔레콤 정예팀이 11.6점으로 1위, LG AI연구원 정예팀이 11.3점으로 2위, 업스테이지 정예팀이 10.8점으로 3위, 모티프 정예팀이 8.4점으로 4위를 기록했다.
185명이 참여한 일반 국민 평가에서는 LG AI연구원이 7.6점으로 1위, SK텔레콤 정예팀이 7.5점으로 2위, 업스테이지 정예팀이 7.3점으로 3위, 모티프 정예팀이 5.7점으로 4위에 이름을 올렸다.
종합 평가 점수에서는 SK텔레콤 정예팀이 70.6점으로 1위, 업스테이지 정예팀이 69.9점으로 2위, LG AI연구원 정예팀이 69.0점으로 3위, 모티프 정예팀이 65.8점으로 4위를 기록했다.
[email protected] 장민권 기자




