구글 딥마인드의 디스코RL(DiscoRL) 연구는 AI에게 특정 문제를 푸는 법을 직접 주입하는 대신, 더 잘 학습하는 규칙 자체를 찾게 한 사례다. 2025년 《네이처》에 발표된 이 연구에서 AI는 사람이 미리 수식으로 정해주지 않은 새로운 학습 규칙을 발견했다. 그리고 그 규칙으로 훈련한 에이전트는 아타리 벤치마크에서 비교 대상이 된 기존 강화학습 알고리즘보다 높은 성능을 보였다.

이 변화는 AI 개발의 자동화가 한 단계 더 깊어졌다는 뜻이다. 과거에는 사람이 중요한 특징을 직접 설계했지만, 신경망은 그런 특징을 데이터에서 스스로 찾기 시작했다. 이제는 무엇을 배울지뿐 아니라 어떻게 배울지까지 AI가 찾아내는 방향으로 연구가 옮겨가고 있다. 기사에서 설명한 ‘AI 빌드 AI’라는 흐름도 여기에 닿아 있다.

이 연구를 이끈 오준혁 연구자는 딥마인드를 떠나 데이비드 실버와 함께 회사를 창업해, 사람의 데이터 없이 AI가 자기 경험만으로 배우는 기술을 개발하고 있다고 밝혔다. 기사에 따르면 앞으로는 AI에게 답을 알려주는 일보다, 어떤 문제를 풀게 할지 설계하는 역할이 더 중요해질 수 있다. 이 사례의 핵심은 AI가 더 이상 주어진 방식만 따르는 도구가 아니라, 학습 방법 자체를 탐색하는 단계로 들어섰다는 점이다.