스탠다드 에이전트의 의사결정 특화 AI 모델 '제브'는 앤트로픽의 클로드 오퍼스 5 지원을 받아 '포켓몬스터 레드'를 클리어하고 명예의 전당에 올랐다. 창립자 앤드류 보이드에 따르면 제브는 사천왕과 챔피언을 모두 이겼고, 완료까지 걸린 시간은 1주일이었다. 포켓몬 시리즈는 이동, 전투, 아이템 관리, 장기 목표 설정이 함께 요구돼 AI 에이전트의 환경 적응과 계획 능력을 시험하는 과제로 쓰여 왔다.
제브는 화면을 읽거나 직접 생성하는 일반 챗봇형 모델이 아니라, 게임 정보와 미리 준비된 선택지 중에서 다음 행동을 고르는 방식으로 작동했다. 클로드 오퍼스 5는 실시간으로 게임 로그를 살피며 제브가 교착 상태에 빠질 때 전달 데이터 구조와 선택지 표현을 수정하는 코치 역할을 맡았다. 실제로 474건의 하네스 변경이 있었고, 입력 텍스트를 3분의 1 수준으로 줄이거나 반복 루프 때 결정 주기를 1초 안팎에서 6초로 늘리는 식으로 비용과 효율도 조정했다. 여기에 시청자 힌트까지 반영되면서, 특화 모델과 범용 LLM의 역할 분담이 장시간 게임 수행에 어떤 효과를 내는지 보여줬다.






