구글 클라우드 AI 리서치 연구진은 스탠퍼드대학교, 워싱턴대학교 등과 함께 에이전트의 실행 환경인 하네스를 반복적으로 수정하고 평가하는 RRSI 프레임워크를 공개했다. 대상은 모델 가중치가 아니라 프롬프트, 도구 사용 방식, 제어 흐름, 메모리와 컨텍스트 관리, 기술 모듈, 하위 에이전트 같은 주변 시스템이다. 에이전트가 스스로 변경안을 만들고 실제 작업에 적용한 뒤, 성능 향상이 확인된 구성만 남기는 방식으로 개선을 이어간다.
핵심은 제안과 선택으로 나뉜 이중 정규화 구조다. 제안 단계는 실패한 아이디어의 반복을 줄이고 탐색 자원을 제어하며, 선택 단계는 평가 잡음을 걸러 추가 추론 비용 대비 효과가 있는 변경만 유지한다. 연구진은 8개 벤치마크에서 성능 향상을 확인했고, 최적화에 쓰지 않은 외부 평가 세트와 미학습 환경에서도 개선이 나타났다고 밝혔다. 별도 실험에서는 정책 토큰 사용량이 380만개에서 242만개로 줄었고, 코드는 깃허브에서 아파치 2.0 라이선스로 공개됐다.






