마이크로소프트 AI는 실시간 음성 인식 모델 'MAI-Transcribe-2-Streaming'과 음성 합성 모델 'MAI-Voice-2.1', 고속 버전 'MAI-Voice-2.1-Flash'를 공개했다. 음성 인식은 100밀리초 수준의 지연으로 발화가 끝나기 전 첫 텍스트를 내보내고, 음성 합성은 23개 언어를 하나의 목소리와 현지 발음으로 지원한다. 음성 대화에서 응답 대기 시간을 줄이는 데 초점을 둔 구성이다.

코히어는 기업용 검색과 RAG에 맞춘 임베딩 모델 'Embed 5'를 프로와 패스트 두 등급으로 내놨다. 128K 문맥 창, 100개 이상 언어, 텍스트·이미지 입력을 지원하며 표와 금융 문서 검색에서 경쟁 모델보다 높은 성능을 제시했다. 두 모델이 같은 임베딩 공간을 공유해 한쪽으로 색인한 데이터를 다른 쪽으로 검색할 수 있다. 타버스는 시각·음성·표정·제스처를 실시간 결합하는 아바타 모델 'Griffin'을, 신세시아는 인터뷰·코칭·가이드용 대화형 아바타 기능 'Sessions'를 발표해, 멀티모달 상호작용이 실제 업무 흐름으로 확장되는 모습을 보여줬다.