MS는 엔비디아 RTX 스파크 기반 '서피스 랩톱 울트라' 등 차세대 PC 출시 시점에 맞춰 코딩 특화 AI 모델 'MAI-Code-1.1-Flash'의 온디바이스 최적화 버전을 내놨다. 지난 8월 공개한 모델을 PC 로컬 환경에 맞게 다시 다듬은 형태다. 목표는 고성능 단말기에서 별도 클라우드 연결 없이 복잡한 코딩 작업을 처리하게 하는 것이다. 이를 위해 양자화와 추측 디코딩을 적용해 가중치를 평균 약 3비트 수준으로 압축했고, 모델 크기는 53GB로 줄였다.

클라우드용 원본(BF16)보다 용량을 약 80% 낮추면서도 256K 컨텍스트 창 기준 최대 메모리 사용량을 75.5GB 수준으로 제어했다. 성능도 크게 떨어지지 않았다. SWE-벤치 베리파이드에서는 로컬 최적화 버전이 70.8%로 원본 72.6%에 근접했고, 터미널-벤치 2.1에서는 66.3%로 원본 62.9%를 넘었다. 또 윈도우 안에 로컬 샌드박스 '마이크로소프트 실행 컨테이너(MXC)'를 구축해 파일·네트워크 무단 접근 위험을 낮췄다. 깃허브 코파일럿은 이 로컬 모델로 작업을 넘겨 연산 비용을 줄일 수 있다.