멀티모달Zheng-Hui Huang 외
비디오 월드모델이 장시간 상호작용에서 지속적 상태를 유지하지 못하는 문제를 겨냥해 세계 상태 진화와 시각 관…
비디오 월드모델이 장시간 상호작용에서 지속적 상태를 유지하지 못하는 문제를 겨냥해 세계 상태 진화와 시각 관측 생성을 분리한 Programmable World Model 을 제안함. 에이전트가 자연어 지시를 엔티티 상태와 상태 전이 규칙을 명시하는 실행 가능한 프로그램으로 번역하고, 경량 엔진이 이를 실행해 화면 밖 엔티티와 비시각적 속성까지 포함한 명시적 전역 상태를 유지하며, 상태가 증강된 3D OBB 를 중간 표현으로 삼아 목표 카메라 궤적과 함께 사전학습 비디오 모델용 픽셀 정렬 시공간 조건 신호로 결정론적으로 컴파일함. 저자 주장으로 자체 제안 벤치마크 CombatStateBench 에서 Count Accuracy 94%, State Accuracy 98% 를 기록해 기존 상호작용형 비디오 월드모델을 크게 앞섰다고 밝힘.
왜 중요한가
생성형 렌더링과 상태 관리를 분리하는 설계로, 월드모델이 '그럴듯한 영상'을 넘어 규칙이 강제되는 플레이 가능한 시뮬레이터로 가는 길을 제시한다.
출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요
논문arxiv.orghttps://arxiv.org/abs/2609.105402026년 9월 14일에 더한 조각 · 그 주 보기
같은 주에 나온 조각09.11'Scaling Storage for 1 Billion ChatGPT Users (Part I)' 공개공식 발표09.10Agents API 퍼블릭 베타 공개공식 발표09.10ChatGPT Work 에 Data agent 를 공개함공식 발표09.10클라우드 샌드박스에서 실제 셸을 과제당 300턴 이상 조작하며 각 과제 자체의 검증기로 보상을 받는 122B…논문