평가·벤치마크Amir Taubenfeld 외 (Google)
Verifiable Social Reasoning 공개
Verifiable Social Reasoning 공개 — 다중 에이전트 시뮬레이션으로 LLM 의 사회적 추론을 검증 가능하게 만드는 Fuse 프레임워크. 사람 주석 24,000건으로 충실도를 검증하고 예제 21,000건을 공개함. 모델 12종 평가에서 정보가 사용자를 거쳐 전달되는 상황이 난도를 가중시키고, 모델이 편향된 사용자 프레이밍에 체계적으로 흔들리며 사람보다 더 많은 맥락을 요구함을 보임. 대화가 길어져도 성능이 일관되게 오르지는 않았다.
왜 중요한가
에이전트가 사람 사이에 끼어 일할 때의 실패를 '능력'이 아니라 '중개된 정보'의 문제로 분리해 측정한 벤치마크.
출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요
논문arxiv.orghttps://arxiv.org/abs/2609.174962026년 9월 21일에 더한 조각 · 그 주 보기
같은 주에 나온 조각09.18업데이트를 원자적(atomic)으로 바꿈공식 발표09.18Grok Voice Transcribe 2.0 공개공식 발표09.18임베디드 평가 파트너십 발표공식 발표09.18호주 청소년 안전 청사진(Australian Youth Safety Blueprint) 공개공식 발표