메타는 2026년 8월 24일(현지시간) 대규모 AI 모델 학습·추론 과정에서 발생하는 네트워크 병목을 잡기 위해 기존 RDMA(Remote Direct Memory Access) 기술을 전면 재설계한 전송 프로토콜 'MetaRoCE'를 공개했다. 메타는 현재 수십만 개의 고성능 GPU를 운영 중이며, 단일 AI 학습에만 3만 2000개 이상의 GPU를 수주일씩 동시 투입한다. 기존 고속 통신 방식은 패킷 손실이 없어야 한다는 전제로 설계되어, 네트워크 일부가 막히면 전체 트래픽을 정지시키는 구조였다. 이 때문에 병목이 생기면 네트워크 전체가 멈추는 '데드락' 현상이 반복됐다.

MetaRoCE는 이 문제를 스위치(도로) 중심 제어 대신 NIC(네트워크 카드, 차량)에 지능을 부여하는 엔드투엔드 구조로 해결했다. 데이터 패킷이 여러 경로로 분산되어 순서 없이 도착해도 수신 NIC가 직접 메모리에 적재하고, 누락 패킷이 발생하면 전체 흐름을 멈추지 않고 해당 패킷만 재전송 요청하는 방식을 택했다. 스위치를 단순화한 덕분에 고가의 전용 장비 대신 범용 대용량 이더넷 장비를 그대로 사용할 수 있다.

  • 공개 일자: 2026년 8월 24일(현지시간)
  • 배경: 단일 AI 학습에 GPU 3만 2000개 이상을 수주일간 동시 운용하는 환경에서 기존 RDMA의 데드락 반복 발생
  • 핵심 변화: 스위치 중심 혼잡 제어 → NIC 중심 엔드투엔드 구조로 전면 전환
  • 패킷 무순서 도착·누락을 '정상 상태'로 수용, 수신 NIC가 직접 메모리 적재 및 선택적 재전송 처리
  • 범용 대용량 이더넷 장비 호환으로 수십만 GPU 규모 확장 시 비용·복잡성 절감

대규모 GPU 클러스터를 구축하거나 운영하는 인프라 엔지니어, 그리고 AI 학습 파이프라인의 통신 계층을 설계하는 담당자라면 MetaRoCE의 엔드투엔드 혼잡 제어 메커니즘과 기존 RoCEv2 대비 구조적 차이를 구체적으로 살펴볼 필요가 있다. 메타가 공개한 기술 상세 문서에서 NIC 측 재전송 로직과 패킷 순서 복원 방식을 확인하고, 자사 이더넷 스위치 사양과의 호환성을 검토하는 것이 다음 단계다.