2026.09.03

0903 일간호VOL.0903매거진

공간 추론·환각 원인·자율 에이전트·자기진화 AI까지 — 2026년 9월 3일 AI 기술 브리핑

IT·AI 소식

2026년 9월 3일, AI 업계에서 굵직한 기술 뉴스가 한꺼번에 쏟아졌습니다. 단 한 장의 사진으로 3D 공간을 재구성하는 옴니 월드 모델, LLM 환각의 진짜 원인이 '기억 인출 실패'라는 연구 결과, 오픈웨이트 에이전트 모델의 경량 고성능 경쟁, 사이버 특화 플래시 모델 등장, AI가 스스로 자신의 코드를 고쳐 성능을 높이는 재귀적 자기개선 가능성, 그리고 AI 위험 수위에 대한 거시적 경고까지 — 오늘 하루 AI 기술의 현재와 미래를 가르는 주제들이 동시에 보도됐습니다.

9월 3일 하루, 공간 지능·에이전트·언어 모델 환각·자기진화 AI에 이르기까지 서로 맞물린 기술 이슈들이 한꺼번에 등장했습니다. 단순한 신제품 발표를 넘어, AI가 세계를 이해하고 스스로를 개선하는 방식 자체가 변화하고 있음을 보여주는 하루였습니다.

이 브리핑은 2026년 9월 3일(목) 국내외 AI·IT 전문 매체에서 수집한 기사를 바탕으로 작성되었습니다. 기업 실적·인사 중심 보도는 제외하고 기술 동향과 연구 성과를 중심으로 정리했습니다.

사진 한 장으로 3D 세계를 만든다 — 월드랩스의 아틀라스

페이페이 리가 이끄는 AI 스타트업 월드랩스(World Labs)가 차세대 옴니(Omni) 월드 모델 '아틀라스(Atlas)'를 공개했습니다. 아틀라스는 텍스트·이미지·비디오·3D 데이터를 처음부터 함께 학습한 멀티모달 자가회귀 확산 트랜스포머(Autoregressive Diffusion Transformer) 기반 모델로, 각각의 이미지를 3D 공간상의 위치와 연결해 하나의 공유된 '공간 컨텍스트'로 구성합니다.

가장 주목할 만한 성능은 '신규 시점 합성(Novel View Synthesis)'입니다. 단 한 장의 참조 이미지만으로도 그 이미지에 나타나지 않은 새로운 시점을 생성할 수 있으며, 사용자가 지정한 카메라 위치와 각도를 기반으로 픽셀 단위에 가까운 정밀한 카메라 제어가 가능합니다. 입력 이미지가 늘어날수록 실제 공간에 대한 정보가 축적되면서 상상과 현실 사이의 간극이 좁아지는 구조입니다.

최대 1440p 해상도, 최장 1분 길이의 영상 생성도 지원합니다. 이 기술은 단순 영상 생성 모델을 넘어 공간 구조와 시간 흐름을 함께 이해하고 시뮬레이션한다는 점에서, 로봇공학·게임·자율주행·가상현실 등 공간지능이 요구되는 다양한 분야에 파급 효과를 미칠 것으로 평가됩니다.

LLM이 거짓말하는 진짜 이유 — '기억 인출 실패' 연구

대형언어모델(LLM)의 환각(hallucination)이 지식 부재가 아닌 '기억 인출 실패' 때문이라는 연구 결과가 발표됐습니다. 구글 리서치와 이스라엘 테크니온 연구진이 공동 발표한 논문 '빈 선반인가, 잃어버린 열쇠인가(Empty Shelves or Lost Keys?)'에 따르면, GPT-5와 제미나이 3 프로 같은 최신 프런티어 모델들은 테스트 사실의 95~98%를 파라미터 안에 이미 인코딩(저장)하고 있습니다.

문제는 지식이 없는 것이 아니라 꺼내지 못하는 것입니다. 별도의 추론 과정 없이는 저장된 사실의 25~33%를 직접 회상하지 못하는 '잃어버린 열쇠(Lost Keys)' 현상이 확인됐으며, 모델이 고도화될수록 전체 오류 중 지식 부재보다 인출 실패가 차지하는 비중이 오히려 더 커지는 경향도 나타났습니다. 연구진은 2150개의 위키피디아 사실 기반 벤치마크 '위키프로파일(WikiProfile)'과 '지식 프로파일링(knowledge profiling)' 평가 방식을 제안하고, 13개 LLM을 대상으로 450만 건의 응답을 분석했습니다.

이 연구는 환각 대응 전략의 방향을 바꿀 수 있습니다. 기존처럼 모델 크기를 키우거나 외부 검색(RAG)에 의존하기보다, AI에게 '스스로 생각할 시간'을 부여하는 추론 중심 접근법으로의 패러다임 전환이 필요하다는 결론입니다. 질문의 표현이나 방향이 조금만 달라져도 동일한 정보에 접근하지 못하는 현상은 프롬프트 설계와 평가 기준 모두에 시사점을 던집니다.

오픈웨이트 에이전트 모델의 경량 고성능 경쟁 — 뮤즈 스파크 1.3

메타(Meta)가 AI 모델 '뮤즈 스파크 1.3(Muse Spark 1.3)'을 출시하며 소프트웨어 코딩과 장기 에이전트 작업 성능을 대폭 강화했습니다. 이전 버전인 뮤즈 스파크 1.2 대비 여러 단계에 걸친 작업에서 사용자의 요구사항을 더 안정적으로 유지하고, 여러 워크플로를 하나의 긴 대화 흐름에서 동시에 처리할 수 있도록 설계됐습니다.

특히 개방형 목표가 주어졌을 때 필요한 도구를 활용해 충돌하거나 정리되지 않은 정보에서 자체적으로 작업 맥락을 구성하고, 계획의 부족한 부분을 스스로 수정하는 방식이 두드러집니다. 작업이 불명확할 경우 사용자에게 추가 질문을 하고, 작업 도중 막히면 도움을 요청하며, 되돌리기 어려운 중요한 작업을 수행하기 전에 사전 확인하는 판단 능력도 개선됐다고 메타는 밝혔습니다.

연산 효율 측면에서는 이전 버전 대비 도구 호출을 약 20%, 토큰 사용량을 약 25% 줄이면서도 성능은 향상됐습니다. 뮤즈 코드(Muse Code)와 메타 모델 API(Meta Model API)를 통해 오픈웨이트로 제공되며, 프런티어급 성능을 낮은 비용으로 제공한다는 점이 핵심 포지셔닝입니다.

6주 만에 세 번째 플래시, 사이버 특화 모델까지 — 제미나이 3.8 플래시

구글은 현지시간 9월 2일 차세대 경량 추론·코딩 모델 '제미나이 3.8 플래시(Gemini 3.8 Flash)'와 사이버보안 특화 버전 '제미나이 3.8 플래시 사이버(Gemini 3.8 Flash Cyber)'를 동시에 공개했습니다. 지난 3.7 플래시 출시 이후 불과 3주 만이며, 구글이 6주 동안 세 번째 플래시 계열 모델을 내놓은 것입니다.

제미나이 3.8 플래시의 핵심은 '장기 실행 에이전트 루프(long-running agentic loops)' 설계입니다. 한 번의 답변 생성에 그치지 않고, 작업을 수행하고 결과를 평가한 뒤 다시 작업하는 반복 과정을 거칩니다. 복잡한 작업 수행 시 이전 모델보다 더 많은 추론 단계를 거치고 필요한 도구를 반복 호출하며 결과를 개선하는 방식입니다. 장기 소프트웨어 엔지니어링 벤치마크 'DeepSWE v1.1'에서 더 큰 규모의 프런티어 모델 상당수를 앞서는 성과를 보였습니다.

가격은 기존과 동일하게 유지하면서 장기 코딩·자율형 에이전트 성능을 높였다는 점이 시장에서 주목받는 요소입니다. 사이버보안 특화 버전인 제미나이 3.8 플래시 사이버는 보안 분석·위협 탐지 등 특수 목적 에이전트 수요를 겨냥한 것으로, 범용 모델과 특화 모델의 동시 출시라는 전략이 눈에 띕니다.

AI가 스스로 코드를 고쳐 더 강해진다 — 재귀적 자기개선의 현재

'다윈 괴델 머신(Darwin Gödel Machine·DGM)'은 사람이 개선 방법을 일일이 알려주지 않아도 스스로 시행착오를 거치며 자신의 코드를 수정해 성능을 높이는 시스템입니다. 실제 개발 현장의 코딩 문제를 모은 평가에서 DGM은 반복적인 자기수정을 통해 성능을 20%에서 50%까지 끌어올렸으며, 더 나은 코드 편집 도구를 만들고 여러 답안을 생성한 뒤 다른 AI에게 평가를 맡기는 방법까지 스스로 찾아냈습니다.

이 기술의 핵심은 수치 자체보다 'AI가 자신의 성능을 높일 방법 자체를 탐색하기 시작했다'는 사실입니다. AI가 더 나은 AI를 만들고, 개선된 AI가 다시 다음 AI를 만드는 순환이 가능해질 수 있으며, AI 연구개발의 일부를 AI에게 맡기는 'AI 생성 알고리즘(AI-Generating Algorithms, AI-GA)' 패러다임이 현실화되고 있습니다. 실패한 버전도 버리지 않고 보존해 나중에 더 좋은 결과의 디딤돌로 활용하는 방식도 DGM의 특징입니다.

다만 아직 완전한 의미의 재귀적 자기개선(Recursive Self-Improvement)이라고 부르기에는 갈 길이 멀다는 평가도 함께 나옵니다. AI가 점수만 높이려고 평가 기준의 허점을 이용하는 '보상 해킹(Reward Hacking)' 문제, 그리고 정렬(Alignment) 유지 여부에 대한 우려가 여전히 남아 있기 때문입니다.

기술 가속의 이면 — AI 위험과 사회적 준비에 대한 경고

MIT 테크놀로지 리뷰와의 인터뷰에서 자선사업가이자 전 마이크로소프트 CEO 빌 게이츠는 AI가 이미 위험한 수준을 넘어섰다는 우려를 표명했습니다. 그는 AI가 생물테러·사이버 공격·일자리 감소·심리적 의존 등 여러 분야에서 심각한 문제를 일으킬 수 있다고 경고하며, 특히 화이트칼라 직업의 상당수가 2년 안에 AI로 대체될 수 있다고 전망했습니다.

게이츠는 이에 대한 대응 방안으로 사람만 수행할 수 있는 직업 영역을 제도적으로 확보하자는 제안, 그리고 로봇세(Robot Tax)·AI 토큰세(AI Token Tax) 같은 조세 아이디어를 제시했습니다. 동시에 AI가 의료·교육·행정 등에서 큰 긍정적 효과를 낼 수 있다는 점도 함께 언급하며, 기술 자체보다 사회가 이를 어떻게 다루느냐가 핵심 문제라고 강조했습니다. 그는 자신의 블로그 게이츠노트에 '격동의 AI 시대가 왔다. 지금 우리가 내리는 선택이 중요하다'는 글도 함께 공개했습니다.

오늘 하루 공개된 기술들, 즉 스스로 공간을 재구성하는 월드 모델, 자율적으로 에이전트 루프를 도는 코딩 모델, 자신의 코드를 수정해 진화하는 AI 등은 게이츠의 경고가 추상적 우려가 아님을 구체적으로 보여줍니다. AI가 빠르게 발전하는 속도만큼, 이를 통제할 안전장치와 사회적 합의를 갖추는 속도도 함께 높아져야 한다는 메시지가 오늘 뉴스 전체를 관통합니다.

주의점

  • 환각 대응 전략 재점검 필요: LLM 환각의 주요 원인이 지식 부재가 아닌 인출 실패로 밝혀짐에 따라, RAG나 파인튜닝만으로 환각을 해결하려는 기존 접근법의 효과가 제한적일 수 있습니다. 추론 단계를 부여하는 방식의 병행이 권장됩니다.
  • 에이전트 자율성과 통제 범위: 뮤즈 스파크 1.3과 제미나이 3.8 플래시 모두 장기 에이전트 루프를 강조하는데, 자율 에이전트가 '되돌리기 어려운 작업'을 수행하기 전 확인 절차를 실제로 잘 작동시키는지 운영 환경에서 별도 검증이 필요합니다.
  • 자기개선 AI의 보상 해킹 리스크: DGM 같은 재귀적 자기개선 시스템은 평가 기준의 허점을 이용한 보상 해킹 현상이 발생할 수 있어, 평가 지표 설계와 사람의 감독 체계가 함께 갖춰지지 않으면 의도치 않은 방향으로 최적화될 위험이 있습니다.
  • 공간 지능 모델의 저작권 및 개인정보: 아틀라스처럼 단 한 장의 이미지에서 공간 전체를 재구성하는 모델은 개인 공간이나 특정 장소의 무단 3D 재현 가능성을 열어두므로, 활용 범위에 대한 법적·윤리적 논의가 선행되어야 합니다.

오늘 바로 확인할 것

  • 아틀라스 데모 영상과 월드랩스 공식 기술 블로그에서 신규 시점 합성(Novel View Synthesis) 예시를 직접 확인해 보세요.
  • 구글 리서치 논문 '빈 선반인가, 잃어버린 열쇠인가(Empty Shelves or Lost Keys?)' arXiv 원문을 통해 위키프로파일 벤치마크 구성 방식과 13개 모델별 지식 프로파일 비율을 살펴보세요.
  • 뮤즈 스파크 1.3은 뮤즈 코드(Muse Code)와 메타 모델 API에서, 제미나이 3.8 플래시는 구글 AI Studio 및 버텍스 AI(Vertex AI)에서 직접 테스트할 수 있습니다.
  • 게이츠노트(Gates Notes)에 공개된 '격동의 AI 시대가 왔다' 원문과 MIT 테크놀로지 리뷰 인터뷰 전문도 함께 읽어 보시길 권장합니다.

참고 자료

클로징 인사이트

이 호의 카드와 원문을 이어서 보면 같은 이슈의 결이 더 분명해집니다.