NYU AMI 랩, INRIA Paris, 브라운 대학교 등이 참여한 연구진은 로봇의 장기 목표와 세부 동작을 나눠 계획하는 계층형 월드 모델 H-제파(H-JEPA)를 공개했다. 기존 JEPA 기반 월드 모델은 하나의 잠재 공간에서 짧은 동작과 긴 목표를 함께 다뤄 장거리 예측과 진행 판단에 한계가 있었다. H-제파는 이를 분리해 각 계층이 서로 다른 시간 범위의 미래 상태를 예측하도록 설계됐다. 1단계는 5프레임 단위의 변화를, 상위 단계는 10프레임과 20프레임처럼 더 긴 구간을 맡는다.
학습은 종단 간으로 이뤄지며, 상위 계층은 빠르게 바뀌는 세부 정보는 줄이고 위치처럼 느리게 변하는 핵심 정보는 유지한다. 정규화 장치 SIGReg는 계층 간 학습 안정성을 맡는다. 계획은 상위 계층이 큰 방향을 정하고, 하위 계층이 이를 중간 목표와 구체적 동작으로 풀어가는 방식이다. 시뮬레이션 4개 환경 평가에서 3계층 H-제파는 AntMaze에서 성공률을 18%에서 73%로 높였다. 다만 일부 짧은 조작 환경에서는 데이터 부족으로 성능이 떨어졌고, DROID 평가는 오프라인 재현 결과라 실제 로봇 제어 향상은 추가 검증이 필요하다.
