IT 인터넷/SNS

사투리 척척… 'AI카나나-오' 표현력 UP

주원규 기자
파이낸셜뉴스

카카오, 음성 생성기술 고도화
말투·감정·억양 등 반영해 수행

"슬픈 목소리로 읽어줘", "경상도 사투리로 말해줘" 카카오가 자연어 명령만으로 말투와 감정, 억양까지 제어하는 자체 인공지능(AI) 음성 생성 기술을 공개했다.

카카오는 4일 테크블로그를 통해 자체 개발 옴니 AI 모델 '카나나-오(Kanana-o)'의 음성 생성 기술을 고도화했다고 밝혔다.

이 모델은 자연어 지시 만으로 속도와 음량, 음높이 뿐 아니라 감정과 억양, 강도까지 세밀하게 반영해 음성을 생성할 수 있다. 이용자가 "아주 빠르게 읽어줘", "낮은 목소리로 읽어줘", "슬픈 목소리로 읽어줘", "경상도 사투리로 읽어줘"와 같이 원하는 발화 방식을 입력하면 이에 맞춰 음성을 만들어낸다. 단순한 말투 변경을 넘어 "스포츠 중계하듯", "아나운서처럼", "동화책을 읽어주듯"과 같은 역할 기반 지시도 수행할 수 있다.

"톤을 낮춰서 빠르게 슬픈 목소리로 읽어줘"와 같이 여러 조건을 결합한 복합 명령도 수행 가능하다. 한국어 중심으로 학습했음에도 영어 음성 생성에서도 동일한 수준의 발화 지시를 수행한다는 것이 카카오 설명이다. 성능도 향상됐다. 카나나-오는 발화 지시 이행 능력을 평가하는 한국어 벤치마크에서 94.50점을 기록했다. 음성 생성 속도와 효율을 높이기 위해 자체 개발한 음성 토크나이저 'LM-SPT(LM-aligned SPeech Tokenizer)'도 새롭게 적용했다.

LM-SPT는 AI가 음성을 더 적은 수의 토큰으로 압축해 표현하는 기술로, AI가 처리해야 하는 데이터의 양을 줄여 더 빠르고 효율적으로 음성을 생성할 수 있도록 한다. 카카오는 앞으로 웃음과 한숨, 감탄 등 비언어적 표현까지 자연스럽게 생성하는 기술을 개발해 음성 AI를 고도화할 계획이다.

노병석 카카오 유니파이드 파운데이션 모델 성과리더는 "이번 카나나-오 음성 기술 고도화는 사람처럼 자연스러운 음성 생성은 물론, 이용자가 원하는 말투와 감정, 억양까지 자연어 지시에 따라 표현할 수 있는 능력을 갖추는 데 초점을 뒀다"며 "향후 다양한 서비스에 적용해 더욱 자연스럽고 편리한 AI 음성 경험을 제공할 것"이라고 말했다.

주원규 기자


#카카오 #자연어 #음성 생성 #인공지능
※ 저작권자 © 파이낸셜뉴스, 무단전재-재배포 금지

기자 정보