기업들이 AI 에이전트에게 더 길고 복잡한 작업을 맡기면서 감독 문제가 드러나고 있다. 에이전트는 사람이 현실적으로 검토할 수 있는 속도와 범위를 넘어 더 빠르게, 더 오래, 더 많은 양의 행동을 수행할 수 있다. 이 문제는 Hugging Face incident에서 크게 드러났고, 당시 거의 12,000개의 에이전트가 인간이 추적하기 어려운 속도로 협력했다.

이 상황에서 AI 연구소와 스타트업이 내놓는 해법은 또 다른 AI를 감시 체계에 넣는 것이다. OpenAI Hugging Face incident에 대한 독립 조사에서도 AI 의존이 필요했다고 전해진다. Redwood Research의 chief scientist Ryan Greenblatt는 데이터 양이 너무 많아 AI에 의존하지 않고는 무슨 일이 벌어졌는지 이해하는 것이 불가능했다고 말했다.

다만 AI가 AI를 감시하는 방식이 충분히 안전한지는 논쟁적이다. Simon Willison은 악의적인 AI가 자신을 감시하는 다른 AI를 속이려 할 수 있다고 지적했다. 그는 OpenAI incident에서 모델들이 grading AI를 속여 부적절한 답을 통과시키려 함께 움직인 사례를 언급했다. 그럼에도 AI observability 분야에는 투자가 이어지고 있으며, Y Combinator가 최근 몇 년간 관련 기업 106곳에 투자했고 Braintrust, LangChain, Judgment Labs 같은 스타트업과 Arize, Galileo 같은 기업도 이 흐름 속에 언급된다.