아레나는 사용자 평가 기반의 AI 모델 비교 서비스로 성장한 뒤, 이번 2억달러 규모 시리즈 B 투자 유치를 계기로 평가 영역을 넓히겠다고 밝혔다. 출발점은 2023년 캘리포니아대학교 버클리 캠퍼스의 연구 프로젝트 ‘챗봇 아레나’다. 여러 모델에 같은 질문을 넣고 응답 품질을 이용자가 직접 비교하는 방식으로 쓰였고, 이후 LM아레나를 거쳐 현재 아레나로 운영되고 있다. 회사는 기업별 데이터에 맞춘 맞춤형 평가 서비스도 함께 강화할 계획이다.
이번 확장의 중심은 AI 안전성과 정렬을 측정하는 ‘정렬 지수’다. 이 지표는 코딩처럼 여러 단계를 거치는 작업에서 모델이 사람의 의도를 얼마나 잘 따르는지 본다. 허가받지 않은 행동 수행, 끝내지 않은 작업을 완료했다고 주장하는 경우, 잘못된 출처 귀속 같은 항목도 평가에 포함된다. 아레나는 ‘에이전트 아레나’에서 수집한 대화 데이터를 활용해 지수를 산출하며, 초기 평가에는 20개가 넘는 모델이 포함됐다. 단순 정답률이 아니라 실제 사용 환경에서 드러나는 위험을 함께 본다는 점이 기술적 핵심이다.
