샤오미는 21일(현지시간) 차세대 오픈소스 AI 모델 ‘미모-V2.6(MiMo-V2.6)’ 시리즈를 공개했다. 이번 시리즈는 ‘미모-V2.6-프로’와 ‘미모-V2.6-플래시’ 두 모델로 구성된다. 샤오미는 대규모 강화학습 컴퓨팅을 투입해 추론과 코딩 성능을 높였고, 여기에 3D 공간 추론과 멀티모달 인식, 컴퓨터를 직접 조작하는 에이전트 능력까지 강화했다고 설명했다.
미모-V2.6-프로는 아티피셜 애널리시스 지능 지수(AAII)에서 46.32점을 기록했다. 기사에 따르면 이는 그록 4.6과 비슷한 수준이며, 중국에서 개발된 AI 모델 가운데 가장 높은 성적이다. 오픈소스 모델 가운데에서도 최고 수준의 지능 점수로 소개됐다. 가격 면에서는 이전 V2.5 시리즈의 API 가격 체계를 유지했고, 아티피셜 애널리시스 분석에서는 지능 지수 과제당 약 0.13달러 비용으로 평가돼 지능과 비용을 함께 고려한 ‘파레토 프런티어’에 올랐다.
모델 구조는 총 1조200억개의 매개변수와 420억개의 활성 매개변수를 사용하는 전문가 혼합(MoE) 방식이다. 샤오미는 실제 훈련 과정을 실시간으로 공개하면서 프로와 플래시에 각각 75만개의 학습 궤적을 적용하고, 30단계의 강화학습을 6일 동안 진행했다고 밝혔다. 이 과정에 투입된 비용은 프로 262만달러, 플래시 85만달러였다. 강화학습 이후 장기 소프트웨어 엔지니어링 능력을 평가하는 ‘딥SWE v1.1’ 점수도 프로는 58.4점에서 72.57점으로, 플래시는 48.8점에서 65.68점으로 올랐다.
샤오미는 학습 효율과 일반화 성능을 높이기 위해 대규모 배치와 높은 처리량, 다양한 작업 환경, 더 많은 검증 연산을 함께 확대했다고 설명했다. 또 강화학습 과정의 ‘보상 해킹’에 대응하기 위해 보상 설계, 적대적 평가, 이상 징후 탐지, 복수 검증기 간 교차 확인을 적용했다고 밝혔다. 활용 범위는 코딩에 머물지 않는다. 샤오미는 이를 ‘바이브 월드(Vibe World)’라는 개념으로 확장해, 텍스트나 이미지, 영상을 입력하면 모델이 더 풍부한 환경을 만들고 상호작용하는 방향을 제시했다.






