IT 인터넷/SNS

메타, 차세대 대규모 언어모델 ‘라마3’ 오픈소스 공개

조윤주 기자

파이낸셜뉴스

입력 2024.04.19 08:37

수정 2024.04.19 08:37

메타, 차세대 대규모 언어모델 ‘라마3’ 오픈소스 공개

[파이낸셜뉴스] 메타가 다양한 목적으로 사용 가능한 최신 대규모 언어모델(LLM) ‘라마3(Llama 3)’를 오픈소스로 공개했다고 19일 밝혔다.

메타의 차세대 대규모 언어모델 라마3는 사전훈련과 미세조정을 마친 80억 개(8B)와 700억 개(70B) 매개변수 모델 두 가지로 공개됐다. 이 두 모델은 현재 동급의 오픈소스 모델 중 최고 수준의 성능인 것으로 평가받는다. ‘대규모 다중작업 언어 이해(MMLU)’를 포함한 다양한 업계 표준 벤치마크에서 높은 성적을 받았으며 추론과 코드 생성, 지시 수행에 있어 전보다 성능이 크게 개선됐다.

메타에 따르면 라마3의 성능 향상은 모델의 사전 훈련과 사후 훈련 과정을 고도화함으로써 이뤄졌다. 사전 훈련을 위해 데이터셋의 양을 늘리고, 필터링 과정을 거쳐 고품질 데이터만을 선별했다.
라마3는 15조 이상의 토큰으로 훈련됐고 이는 라마2 대비 7배 이상, 코드량은 4배 많다.

라마3의 사전 훈련에는 일상적인 질문부터 과학, 기술, 공학, 수학(STEM) 분야, 코딩, 역사 지식에 이르기까지 다양한 분야의 데이터셋이 사용돼 모델이 보다 여러 영역에서 활용될 수 있도록 했다. 아울러 사전훈련의 규모를 확대하고 보다 고도화된 ‘지시 미세조정’ 과정을 진행했다.

오픈소스인 라마3 모델의 안전하고 책임감 있는 개발과 사용을 위한 다양한 안전장치도 마련했다. 지시 미세조정된 모델은 전문가와 자동화된 도구를 활용한 레드팀 훈련을 통해 부적절한 답변의 가능성을 최소화했다. 또한 ‘라마 가드2’, ‘코드 쉴드’, ‘사이버 보안 평가 기준2’와 같은 안전 장치와 더불어 새로운 안전 도구들도 도입했다.

메타는 보다 투명하고 안전한 AI 개발을 위한 개방형 접근 방식에 따라, 8B와 70B 매개변수 모델을 먼저 선보이며 연구원과 개발자의 피드백을 통해 지속 발전시켜나갈 방침이다. 현재 훈련 중인 더 큰 규모의 모델 역시 추후 오픈소스로 공개할 계획이다.


메타측은 "라마3를 더 긴 컨텍스트를 이해하는 다국어 멀티모달 모델로 발전시키고, 전반적인 성능을 지속 개선시키는 것이 궁극적인 목표"라고 말했다.

yjjoe@fnnews.com 조윤주 기자

fnSurvey