Cloudflare가 Clef 계열에 새 모델인 Clef-omni를 추가했다. 이 모델은 텍스트와 이미지뿐 아니라 오디오와 비디오도 함께 입력받는 오픈웨이트 의사결정 모델이다. 지원 형식으로는 오디오의 wav, mp3와 비디오의 mp4, webm이 제시됐다. 기존 Clef는 이미지와 비디오 프레임 배열을 다뤘지만, 이번 모델은 소리와 영상 자체를 함께 받도록 범위를 넓혔다. 회사는 모델 가중치를 HuggingFace에도 공개했고, 관련 사용법은 개발자 문서로 안내했다.
기술적으로 중요한 점은 여러 단계를 잇는 구성을 줄일 수 있다는 데 있다. 음성을 먼저 텍스트로 바꾸거나, 비디오에서 오디오와 이미지를 따로 분리한 뒤 각각 다른 모델에 보내는 대신, 하나의 모델 호출로 여러 형식의 입력을 함께 판단할 수 있다는 설명이다. Cloudflare는 Clef-omni가 Qwen3-Omni-30B-A3B-Instruct 기반의 mixture-of-experts 구조 위에 구축됐다고 밝혔다. 함께 Clef-flash의 가격을 Jev보다 낮췄고, Clef의 속도 개선도 진행했다고 덧붙였다.






