제논은 컴퓨터 화면을 읽고 직접 조작하는 인공지능 모델 ‘훈민(Hunmin) VLM 397B’를 오픈소스로 공개했다. 이 모델은 3970억 파라미터 규모의 오픈소스 모델 ‘큐원3.5-397B’를 바탕으로, 화면 속 버튼이나 입력창 같은 조작 대상을 찾는 그라운딩과 실제 과업 수행 능력을 강화한 것이 특징이다. 기존 범용 AI 모델의 성능을 유지하면서 실제 업무에 필요한 실행 능력을 더하는 방향으로 훈민 시리즈를 고도화했고, 이번 모델은 그 흐름을 초거대 규모로 확장한 후속작이다.
성능 평가는 화면 인식과 컴퓨터 조작 두 측면에서 제시됐다. 훈민 VLM 397B는 화면 속 조작 대상 위치를 식별하는 5개 벤치마크에서 기반 모델인 큐원3.5-397B와 컴퓨터 조작 특화 모델 큐원-CUA를 모두 앞섰다. 고난도 화면 인식 벤치마크인 ‘ScreenSpot-Pro’에서는 정확도 75.6점을 기록해 허깅페이스 공식 리더보드 2위에 올랐다. 기사에 따르면 현재 등재된 48개 모델 가운데 국내 기업이 개발한 모델은 이 모델이 유일하다.
실제 작업 성능도 함께 개선됐다. 리눅스 데스크톱에서 360개 과제를 수행하는 ‘OSWorld’에서는 70.5점을 기록해 기본 모델보다 22.3점 높았고, ‘WindowsAgentArena’에서도 9.1점 향상됐다. 제논은 이런 고도화 과정에 양자화 상태의 지도학습(SFT)과 강화학습(RL)을 적용했고, 후학습에는 엔비디아 B200 GPU 8장을 활용했다고 밝혔다. 모델은 Apache 2.0 라이선스로 공개되며, 원본과 함께 용량을 절반 수준으로 줄인 FP8 버전, 개발·평가 방법론도 함께 제공된다.






