카카오는 언어모델링 학회 COLM 2026에서 두 가지 연구를 공개했다. 하나는 대규모 전문가 혼합(MoE) 모델의 사전학습 효율을 높이는 방법이다. 이 연구는 최적의 학습률을 전체 학습 비용의 약 1% 수준으로 예측하는 방법론을 다룬다. 학습률은 매개변수를 얼마나 조정할지 정하는 값으로, 모델의 안정성과 성능에 직접 영향을 준다. 카카오는 소규모 모델에서 찾은 학습 설정을 대규모 모델로 확장하는 뮤-매개변수화 기법을 MoE 구조에 맞게 적용했고, 짧은 학습 구간에서 찾은 설정이 대규모 학습에도 유효하다는 점을 검증했다.
이 방법은 Kanana-2.6-155b-a17b의 사전학습에 적용돼 10조 토큰까지 안정적으로 학습하는 데 활용됐다. 함께 공개된 BBT는 기존 BPE 기반 구조를 바이트 단위 중심으로 바꿔 모델 크기를 줄이는 경량화 기술이다. 여러 문자를 묶어 처리하는 장점은 유지하면서 필요한 정보를 더 작은 단위로 다뤘다. 비교 실험에서는 파라미터 수를 20.2~40.4% 줄이면서 테스트 성능을 2.7~6.6% 높였고, 오탈자나 문자 교란에 대한 강건성과 학습하지 않은 언어로의 전이 성능도 개선됐다. 이는 온디바이스 환경과 다국어 입력 조건에서 메모리 부담을 낮추는 데 의미가 있다.
