카카오는 국제 학회 COLM 2026 메인 컨퍼런스와 토크나이제이션 워크숍 TokShop에서 AI 모델 학습 효율과 경량화 관련 연구를 공개했다. 메인 컨퍼런스 논문은 대규모 전문가 혼합(MoE) 모델의 사전학습에 필요한 최적 학습률을 전체 학습 비용의 약 1% 수준으로 예측하는 방법을 다뤘다. 학습률은 학습 안정성과 성능을 좌우하는 설정값인데, MoE는 공개 연구가 적어 최적값을 찾는 비용 부담이 큰 구조다. 카카오는 소규모 모델의 최적 학습 설정을 대규모 모델로 확장하는 뮤-매개변수화 기법을 MoE에 맞게 적용했고, 이를 '카나나-2.6-155b-a17b'의 10조 토큰 사전학습에 활용했다고 밝혔다.

TokShop에서는 경량화 기술 BBT(BPE 가이드 바이트 트랜스포머)를 발표했다. 이 방식은 기존 BPE 대신 더 작은 단위인 바이트를 쓰면서도 여러 문자를 묶어 처리하는 효율은 유지하도록 설계됐다. 비교 실험에서는 파라미터 수가 20.2~40.4% 줄고 성능은 2.7~6.6% 개선됐다. 오탈자와 문자 교란에 대한 강건성, 미학습 언어로의 전이 성능도 함께 나아졌다고 설명했다. 메모리 제약이 큰 온디바이스 환경과 다국어 입력 환경에서 모델 운영 부담을 낮추는 데 의미가 있는 결과다.