PrismML은 추론 성능을 갖춘 대형언어모델이 반드시 커야 하는 것은 아니라는 가정 아래, 더 작은 기기에서 돌아가는 모델을 만들고 있다. 이번에 공개한 Bonsai 2 27B는 Alibaba의 오픈소스 모델 Qwen3.8 27B를 압축한 버전으로, 용량을 5.9GB까지 줄였다. 회사 설명에 따르면 이는 원본 대비 메모리를 9~10배 줄인 수준이며, PC는 물론 고성능 스마트폰에도 들어갈 수 있는 크기다.
이 기술의 핵심은 단순히 모델을 작게 만드는 것이 아니라, 성능 저하를 거의 없이 압축하는 데 있다. PrismML에 따르면 Bonsai 2는 Qwen의 종합 벤치마크 점수의 98%를 유지했다. 몇 달 전인 3월 공개된 첫 Bonsai가 95% 수준이었던 것과 비교하면, 같은 계열의 압축 결과가 한 차례 더 개선된 셈이다.
PrismML은 Caltech 연구자들이 세운 스타트업으로, 압축 기술 전문가인 Caltech 교수 Babak Hassibi가 이끌고 있다. 이 회사는 LLM 압축을 다루는 유일한 곳은 아니지만, 원본 성능을 거의 유지한 채 소형화했다는 점을 차별점으로 내세운다. 첫 Bonsai는 1,100만 회 이상 내려받았고, 더 작은 모델들도 추가로 260만 회 다운로드됐다고 회사는 밝혔다. 이 소식에서 기억할 부분은, LLM 활용 범위를 데이터센터 밖의 PC와 스마트폰으로 넓히려는 압축 기술이 실제 배포 단계까지 와 있다는 점이다.
