"레시피만 찾는 韓…‘재료 데이터’ 빠진 독자 AI는 껍데기" [AI월드 2026]
이정수 플리토 대표가 전하는 AI시대, 데이터의 중요성
글로벌 데이터 확보 경쟁 치열
영화 매드맥스 속 ‘물 전쟁’ 방불
韓 독자모델 개발 열 올리지만
외산 데이터 학습 땐 편향 위험
플리토, 구글·메타에 통번역 공급
전문용어·발화 습관 등 맞춤학습
사진 등 데이터 거래 플랫폼 구축
평범한 사진 한장도 기업엔 자산
"맛있는 요리를 만드는 데 좋은 재료가 중요하듯, 인공지능(AI)의 경쟁력을 결정하는 핵심도 결국 데이터다."
이정수 플리토 대표는 지난달 9일 서울 송파구 롯데월드타워 롯데시네마에서 파이낸셜뉴스와 과학기술정보통신부가 공동 개최한 'AI월드 2026'에서 '데이터가 만드는 AI 경쟁력, 솔루션이 만드는 가치'를 주제로 발표하며 이같이 강조했다. 그래픽처리장치(GPU)를 조리기구, 알고리즘을 요리 능력, 데이터를 재료에 빗댄 이 대표는 AI 경쟁의 무게중심이 양질의 데이터를 확보하는 쪽으로 이동하고 있다고 진단했다.
■GPU·모델 쏠린 韓…데이터 논의 부족
AI가 학습할 수 있는 디지털 데이터가 빠르게 소진되면서 글로벌 시장에서는 데이터 확보 경쟁이 치열해지고 있다. 이 대표는 "데이터가 고갈되면서 데이터를 만들고 파는 전쟁이 일어나기 시작했다"며 "미국에서는 어마어마하게 많은 데이터 회사들이 나오기 시작했다"고 말했다.
반면 국내 AI 산업에서는 데이터에 대한 투자가 상대적으로 부족하다는 게 이 대표의 진단이다. 정부와 기업이 GPU 확보와 독자 파운데이션 모델 개발 등에 속도를 내고 있지만 정작 모델을 학습시킬 데이터에는 충분히 관심을 기울이지 않는다는 것이다. 이 대표는 "레시피나 화구에 대한 이야기를 하는데 재료에 대한 논의는 하지 않고 있다"며 "한국 AI를 만들면서 이를 중국 데이터로 학습시킨다면 무의미할 것"이라고 지적했다.
이 대표에 따르면 글로벌 AI 기업들도 대규모 학습 데이터를 확보하는 과정에서 중국에서 생산된 데이터를 활용하고 있다. 데이터 구축에는 대규모 인력이 필요한 만큼 상대적으로 낮은 비용으로 대량의 데이터를 생산할 수 있는 중국이 주요 공급처가 되고 있다. 다만 이 대표는 한국이 이 같은 데이터 생산 구조에 의존할 경우 '한국형 AI'의 의미가 퇴색할 수 있다고 지적했다.
특히 데이터 확보처에 따라 AI가 특정 국가의 관점과 가치에 편향될 위험이 있다고도 강조했다. 이 대표는 "한국에서 만든 AI를 중국 데이터로 학습시키면 중국에 편향된 정보를 주는 인공지능이 될 수 있다"며 "외산 데이터로 AI를 학습시키는 것이 외산 AI를 쓰는 것보다 훨씬 더 위험하다"고 지적했다.
국내 데이터 시장의 수요 부족은 플리토 매출 구조에서도 나타난다. 2012년 설립 이후 음성과 텍스트를 중심으로 언어 데이터를 구축해 온 플리토는 현재 전체 매출의 90%를 미국에서 올리고 있다. 국내에서는 데이터를 구매·활용하려는 수요가 상대적으로 부족해 시장 기반을 확대해야 한다는 게 이 대표의 설명이다.
■언어 데이터로 맞춤형 AI 고도화
이 대표는 국내에서도 데이터를 지속적으로 생산하고 기업들이 이를 활용할 수 있는 환경을 만들어야 한다고 강조했다. 플리토는 데이터 활용과 거래로 사업 영역을 넓히고 있다. 축적한 언어 데이터를 AI 통번역 기술 고도화에 활용하는 한편, 개인과 기업이 보유한 데이터를 거래 가능한 자산으로 연결하는 데이터 마켓플레이스도 구축했다.
플리토가 주력하는 대표적인 분야는 AI 통번역이다. 이 대표는 "생성형 AI와 오픈소스 기술의 발달로 통번역 서비스를 구현하는 것 자체는 쉬워졌지만 실제 현장에서는 어떤 데이터를 학습시키느냐에 따라 정확도 차이가 벌어진다"며 "사람 이름이나 기업명, 전문용어 등 고유명사는 범용 모델만으로 정확하게 인식하기 어려워 별도의 학습 데이터가 필요하다"고 전했다.
플리토는 행사 전 발표자의 논문과 기존 발표 내용, 음성, 자주 사용하는 고유명사 등을 AI에 사전 학습시켜 오역을 줄이고 있다. 발표자의 발화 습관과 자주 사용하는 용어까지 학습하는 방식이다. 이 대표는 "발표자의 논문과 발화, 음성 등을 AI에 학습시켜 어떤 고유명사가 많이 나오고 어떻게 번역해야 하는지를 미리 학습시킨다"고 설명했다. 플리토의 통번역 솔루션은 구글과 메타가 사내에서 사용하고 있으며, 시스코의 화상회의 플랫폼 웹엑스에도 탑재됐다. 지난 5월 미국에서 열린 IBM 행사에서는 동시통역에 사용됐다.
분야별 특화 데이터를 활용하는 작업도 진행하고 있다. 대학에는 외국인 학생을 위한 강의 통역 솔루션을 제공하고, 강의와 토론 과정에서 생성된 내용을 데이터화해 교수별 '디지털 도서관' 형태로 제공한다. 의료학회에서는 일반 AI가 인식하기 어려운 전문용어나 의료진의 특수한 발음 등을 데이터로 추출해 학습시키고, 논문 발표 등에 포함된 전문지식도 데이터화해 학습에 활용하고 있다.
이처럼 이용 환경에 맞는 데이터를 학습시키는 방식은 개인 단위로도 확장된다. 이용자가 자신의 PDF와 유튜브, 논문, 링크드인 등 자료를 연결하면 자주 사용하는 용어나 고유명사를 학습한다. 이 대표는 "영어 이름은 사이먼 리인데 번역기에 '안녕하세요. 이정수입니다'라고 하면 목소리를 인식해 사이먼 리라고 나온다"며 "초개인화된 번역이 가능한 이유는 결국 데이터에 대한 기술을 갖고 있기 때문"이라고 말했다.
■데이터 활용·거래 생태계 키워야
이 대표는 데이터 자체를 거래 가능한 자산으로 연결하는 사업도 추진 중이다. 플리토는 개인이나 기업이 보유한 데이터를 거래할 수 있는 플랫폼 '데이터 마켓플레이스'를 구축했다. 데이터의 일부 샘플을 제공하면 플리토가 가치를 평가해 수요처에 판매하고 중개 수수료를 받는 방식이다.
이 대표는 매일 경희궁 사진을 수천장씩 촬영한 개인의 사례를 들었다. 개인에게는 경제적 가치가 없어 보이는 사진도 특정 데이터를 필요로 하는 기업에는 자산이 될 수 있다는 설명이다. 이 대표는 "돈도 안 되는 사진이라고 생각하지만 그런 사진들이 실제로 필요한 업체에는 비싸게 팔린다"며 "개인도 데이터를 통해 돈을 벌 수 있고 기업도 자신들이 판매할 수 있는 데이터를 모아 수익화할 수 있다"고 설명했다.
끝으로 이 대표는 영화 '매드맥스'에서 사람들이 생존에 필요한 물을 차지하기 위해 싸우는 장면을 현재의 데이터 확보 경쟁에 빗댔다. 글로벌 AI 시장이 데이터 선점전에 돌입한 만큼 국내에서도 데이터 확보를 넘어 생산과 활용, 유통까지 아우르는 산업 기반을 갖춰야 한다는 지적이다. 이 대표는 "지금 글로벌 시장은 데이터를 찾아서 전쟁을 하고 있다"며 "데이터가 부족하다는 이야기만 할 것이 아니라 어떻게 데이터를 만들어 기업들이 사용하게 할지, 데이터 역량을 바탕으로 어떤 기술을 만들어낼 수 있을지 고민해야 할 시점"이라고 강조했다.
[email protected] 최혜림 기자




