한국어EN
툴·에이전트Shuang Sun 외 (Renmin University of China)

Agent-Editing World Model(AEWM) 공개

Agent-Editing World Model(AEWM) 공개 — 환경의 응답을 예측하는 기존 월드모델 대신 '추론과 행동이 과제 진행 상태를 어떻게 바꾸는지'를 모델링. 실행 전에 결정을 결정적(critical)·탐색적(exploratory)·잡음(noisy)으로 분류하는 Action Judge 와, 같은 관측 이력으로 문제 있는 추론-행동 열을 고쳐 쓰는 State Revision 으로 구성. 자체 Action Judge 벤치마크에서 macro-F1 70.5%로 최강 프런티어 기준선을 10.6포인트 앞섰고, EditAct 는 6개 벤치마크에서 3.2~6.7포인트, AEWM-RFT 는 3개 도메인에서 2.2~2.6포인트 개선

왜 중요한가

장기 과제에서 에이전트가 무너지는 원인을 '환경을 못 읽어서'가 아니라 '자기가 만든 낡은 상태 기술이 남아서'로 다시 놓았다. 하네스가 관리해야 할 대상이 도구 호출이 아니라 과제 상태의 수명이라는 뜻이며, 지난주 컴팩션 요약 인젝션 사례와 같은 문제 계열에 있다

출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요 공식 발표huggingface.cohttps://huggingface.co/papers/2609.284162026년 9월 28일에 더한 조각 · 그 주 보기