구글은 2026년 8월 27일, AI 모델 평가 분야에서 세계 최초의 '이중맹검(Double-Blind)' 평가 파일럿을 공개했다. 싱가포르 AI 안전연구소(Singapore AI Safety Institute), 오픈마인디드(OpenMined), AVERI, MLCommons와 공동으로 설계한 이 방식은, 평가를 받는 AI 모델은 평가 문제(벤치마크)를 미리 볼 수 없고, 외부 평가자는 모델의 내부 가중치를 들여다볼 수 없도록 암호화 기술로 양쪽을 동시에 격리한다. 첫 파일럿 대상 모델은 제미나이 플래시 라이트(Gemini Flash Lite)이며, 비공개 벤치마크와 개인정보 보호 환경에서 평가가 진행된다.
이 방식이 등장한 직접적 원인은 '벤치마크 오염(Benchmark Contamination)' 문제다. AI 모델이 사전 학습 또는 파인튜닝 과정에서 평가에 쓰일 질문·프롬프트를 이미 접했다면, 실제 추론 능력과 무관하게 높은 점수가 나올 수 있다. 구글은 이를 학생이 시험 직전 문제지를 통째로 열람하는 상황에 비유했다. 기존 외부 평가 방식은 독립 기관이 모델을 넘겨받아 테스트하는 구조였기 때문에, 모델 공급자가 해당 평가 데이터를 사전에 노출했는지 여부를 검증할 수단이 없었다. AI 모델 성능이 빠르게 향상될수록 이 허점의 영향은 더 커진다는 것이 구글의 설명이다.
- 발표일: 2026년 8월 27일(현지시간), 구글과 4개 기관 공동 파일럿 운영 선언
- 핵심 구조: 암호화 기술로 모델 가중치와 평가 데이터를 각각 보호해 양방향 격리 구현
- 첫 적용 모델: 제미나이 플래시 라이트(Gemini Flash Lite), 비공개 벤치마크 환경에서 평가
- 해결 대상: 벤치마크 오염 — AI가 평가 문항을 사전 학습해 실력 이상의 점수를 얻는 구조적 허점
- 협력 기관: 싱가포르 AI 안전연구소, 오픈마인디드(OpenMined), AVERI, MLCommons
AI 모델 도입·검증을 담당하는 실무자라면 이중맹검 평가 결과가 기존 리더보드 점수와 얼마나 다르게 나오는지를 주시할 필요가 있다. 파일럿 이후 결과 보고서가 공개될 경우, 제미나이 플래시 라이트의 실측 성능 수치와 기존 공개 벤치마크 수치 간 격차를 확인하는 것이 첫 번째 체크포인트다. 아울러 이 평가 프레임워크가 다른 프런티어 모델로 확대 적용될 시점과 조건을 MLCommons 공식 발표를 통해 확인하는 것이 좋다.
