⑦3건
멀티모달
- 2026-09-03Chuyan Chen 외 — LLaDA-Image 공개 — 6B 규모 Diffusion Transformer 에 LLaDA2.0-Mini 기반 시각-언어 이해 모듈을 붙인 통합 이미지 생성 프레임워크와 학습 레시피 전체를 공개. 2~4 스텝 추론용 LLaDA-Image-Turbo 를 함께 냈고 parameter-free RMSNorm 과 Muon 최적화기를 사용 출처확산 언어모델 계열이 이미지 생성 쪽으로 넘어온 사례로, 관찰 주제 「확산 언어모델」의 누적을 늘린다. 저자 자체 보고로 Qwen-Image-Bench 영어 53.53 · 중국어 53.38 로 오픈소스 중 양쪽 최고라고 주장
- 2026-09-03Hongyu Qu 외 — LatentStream 공개 — 스트리밍 영상 이해에서 "저장하고 검색한다"는 기존 구도를 "검색해서 내재화한다"로 바꾸는 프레임워크. 질의와 무관한 계층적 스트리밍 메모리로 시각 이력을 단기·중기·장기로 조직하고, 잠재 메모리 토큰의 수용 영역을 넓혀 과거 증거를 흡수하며, 그룹별 예측 엔트로피로 계층적 보상을 만들어 메모리를 최적화 출처긴 영상을 컨텍스트에 다 넣는 대신 메모리를 진화시키는 갈래로, RAG 의 검색-생성 분리를 시계열 입력에서 무너뜨린다. 저자 자체 보고로 온라인·오프라인 영상 벤치마크에서 최고 성능이라 주장하나 구체 수치는 초록에 없다
- 2026-09-03Kang Liao 외 — Puffin-World 공개 — 물리 이해·공간 시뮬레이션·3D 세계 생성과 재구성을 하나의 멀티모달 아키텍처로 묶고, 물리(중력장)·기하(깊이)·외관(이미지) 세 상태를 동시에 모델링. 비전-언어-카메라 삼중항 1,500만 개(Puffin-16M)와 동작 궤적 100만 개를 함께 공개 출처멀티모달 모델에 3D 세계 상태를 부가 조건이 아니라 네이티브 표현으로 넣은 갈래. 관찰 주제 「월드 모델」의 최근 사례이며 코드·모델·데이터셋을 함께 공개해 외부 재현이 가능하다