오픈아트는 15일(현지시간) 이미지·비디오 생성 모델을 용도별로 비교하는 공개 벤치마크 '오픈아트 아레나'를 공개했다. 이 벤치마크는 영화 제작, 전자상거래, 그래픽 디자인, 모션 디자인, 영상 편집, 립싱크처럼 실제 작업 단위로 순위를 나누는 방식이다. 여러 모델의 성능을 한 줄로 세우기보다, 어떤 작업에 더 맞는지를 보여주려는 목적이 분명하다.
평가는 모델 이름을 가린 상태에서 두 결과물을 비교하는 방식으로 진행된다. 오픈아트는 창작 전문가와 외부 평가자 등 800~1000명 규모의 '테이스트메이커'를 모집해 결과물을 보고 투표하게 했고, 순위는 1952년 개발된 브래들리-테리 통계 모델로 산출했다고 밝혔다. 평가 기준도 용도에 따라 다르다. 영화 제작에서는 카메라 움직임과 조명, 영화적 완성도가 중요하고, 광고에서는 읽기 쉬운 텍스트와 로고 정확성, 제품 배치가 더 중요하게 반영된다.
초기 결과를 보면 비디오 부문 전체 1위는 바이트댄스의 '시댄스 2.5'였고, 영상 편집에서는 알리바바의 '완 3.0'이 근소하게 앞섰다. 이미지 부문에서는 오픈AI의 'GPT-이미지-2'가 그래픽 디자인과 이미지 편집에서 1위를 기록했고, '시드림 5.0 프로'는 영화용 이미지와 전자상거래 이미지에서 1위에 올랐다. 같은 모델이 모든 작업에서 가장 좋은 결과를 내는 것은 아니라는 점이 수치로 드러난 셈이다.
이 벤치마크는 생성 AI를 고를 때 '최고의 단일 모델'보다 '용도별로 맞는 모델'을 찾는 흐름을 보여준다. 오픈아트는 일부 평가 프롬프트를 비공개로 유지해 공개 테스트 맞춤 최적화를 막겠다고 했지만, 전체 프롬프트 수와 실제 투표자 수, 총평가 횟수는 아직 공개하지 않았다. 또 평가 대상 모델을 자체 플랫폼에서 직접 제공하고 있어, 기업은 순위를 절대 기준으로 보기보다 비용, 데이터 보안, 저작권, 배포 방식 같은 조건을 함께 봐야 한다.
