카카오, AI 학습비용 줄이고 성능 높이는 기술 공개
학습 비용 1%로 최적 학습률 예측
[파이낸셜뉴스] 카카오가 대규모 인공지능(AI) 모델의 학습 비용을 줄이고 모델 크기를 최대 40% 경량화하는 기술을 공개했다. 전체 학습 비용의 약 1%만으로 최적의 학습률을 예측하고, 모델의 매개변수 수를 줄이면서도 성능을 높이는 방식이다.
카카오는 언어모델링 국제 학회 'COLM 2026'에서 대규모 전문가 혼합(MoE) 모델의 학습 효율화 및 경량화 연구 성과를 발표했다고 8일 밝혔다.
COLM은 대규모언어모델(LLM)과 언어모델링 연구를 전문으로 다루는 국제 학회로 2024년 신설됐다. 카카오는 메인 컨퍼런스와 토크나이제이션 워크숍 'TokShop'에서 각각 연구 결과를 소개했다.
메인 컨퍼런스에서 발표한 논문은 대규모 MoE 모델의 사전학습에 필요한 최적의 학습률을 전체 학습 비용의 약 1% 수준으로 예측하는 방법론을 담았다. 학습률은 AI 모델이 학습 과정에서 매개변수를 조정하는 폭을 결정하는 값으로, 학습의 안정성과 성능에 영향을 미친다.
MoE는 여러 전문가 모델 가운데 필요한 일부만 선택적으로 활용하는 구조다. 고성능 LLM의 핵심 기술로 주목받고 있지만 기존 밀집형 모델보다 학습 설정에 관한 공개 연구가 부족해 대규모 학습 과정에서 시행착오와 비용 부담이 발생할 수 있다.
카카오는 소규모 모델에서 찾은 최적의 학습 설정을 대규모 모델에 적용하는 '뮤-매개변수화' 기법을 MoE 구조에 맞게 개선했다. 모델 크기와 학습 데이터량을 단계적으로 늘리면서 최적의 학습률을 탐색하는 방식이다. 해당 기술은 자체 AI 모델 'Kanana-2.6-155b-a17b'의 사전학습에 적용돼 10조개 토큰까지 안정적으로 학습하는 데 활용됐다.
모델 경량화 연구에서도 성과를 거뒀다. 카카오는 TokShop에서 바이트(Byte) 단위로 텍스트를 처리하는 'BBT' 기술을 공개했다. 기존 모델이 단어나 단어 조각별 정보를 저장하는 것과 달리 더 작은 단위인 바이트를 활용해 모델 크기를 줄이면서도 효율적인 정보 처리 구조를 유지하는 방식이다.
BBT는 비교 실험에서 매개변수 수를 20.2~40.4% 줄이면서도 테스트 성능을 2.7~6.6% 개선했다. 오탈자나 문자 변형에 대한 대응력과 학습하지 않은 언어를 처리하는 능력도 높였다. 카카오는 이를 통해 스마트폰 등 온디바이스 AI 환경에서 메모리 부담을 줄이고 다국어 서비스의 안정성을 높일 수 있을 것으로 기대하고 있다.
카카오 관계자는 "앞으로 다양한 모델 구조와 멀티모달 및 다국어 환경으로 연구를 확장해 실제 서비스 활용 가능성을 높이겠다"고 말했다.
[email protected] 최혜림 기자




