⑦5건
멀티모달
- 2026-09-10OpenAI — GPT-Live-1 API 공개 — 듣기와 말하기를 동시에 하는 풀듀플렉스 음성 모델로, STT→LLM→TTS 로 이어지는 기존 단계 전달 구조를 없앰. 자사 주장으로 턴 기반 시스템 대비 끊김이 약 80% 줄고 Full Duplex Bench 에서 GPT-Realtime-2.1 대비 30%p 개선됨. 복잡한 추론은 GPT-6 Astra 같은 후단 모델에 위임하고, 시스템 프롬프트로 어조·속도·대화 스타일을 조정하며 전화망 연동을 지원함. 음성 계층 요금은 분당 $0.05. 출처음성 인터페이스가 파이프라인 조립에서 단일 모델로 통합된 사례로, 지연이 아니라 '턴 뺏기'가 음성 에이전트의 경쟁 축이 됐음을 보여준다.
- 2026-09-10Microsoft — 음성 인식 모델 Azure AI Speech LLM 2607 을 공개함. 자사 주장으로 HuggingFace OpenASR 리더보드 2위이며 직전 2605 릴리스 대비 지연이 최대 3배 빨라졌다고 밝힘. 혼합 언어 인식, Tier 2/3 언어 지원, 대문자·구두점·숫자 표기 처리가 개선됐고 2,000개 이상 엔티티를 전용 필드로 지정하는 phrase list 로 기업 용어·제품명·약어 도메인 커스터마이징을 지원함. Fast API 와 Real-Time API 양쪽에 서버 측 자동 배포되어 고객 조치가 필요 없다고 밝힘. 가격은 공개되지 않음. 출처ASR 이 LLM 기반 구조로 넘어가면서 정확도뿐 아니라 지연과 도메인 어휘 커스터마이징이 경쟁 축이 됐음을 보여준다.
- 2026-09-10SenseTime — 인코더 없이·VAE 없이 시각 이해·추론·생성을 하나의 구조에서 처리하는 8B-MoT 네이티브 통합 멀티모달 모델 SenseNova-U1.5 를 공개함. 공간적으로 일관된 패치 재구성으로 시각 인터페이스를 강화하고, 선별된 생성·편집 데이터와 개선된 태스크 정식화, 구조적 프롬프트 강화, 최대 4K 네이티브 해상도로 학습을 확장함. Post-training 에서는 시각적 심미성·이중언어 텍스트 렌더링·인포그래픽 생성·이미지 편집용 전문가를 각각 최적화한 뒤 multi-expert on-policy distillation 으로 통합함. 자사 주장으로 이미지 충실도·텍스트 렌더링·복합 구성·다중 참조 편집·인터리브드 생성에서 크게 향상됐다고 밝히며 SFT·RL·on-policy distillation 학습 코드를 오픈소스화할 예정이라고 함. 출처별도 비전 인코더와 VAE 를 모두 없앤 완전 end-to-end 통합 구조가 실용 성능에 도달했음을 보여, 멀티모달 통합 모델의 표준 설계가 바뀔 가능성을 시사한다.
- 2026-09-09NVIDIA — IBC 2026 에 맞춰 AI for Media 플랫폼 확장을 발표함. AI 생성 영상 판별 모델 Synthetic Video Detector(자사 주장 텍스트-투-비디오 99.3%·이미지-투-비디오 97.7% 정확도), 단일 카메라 영상에서 인체 관절·각도를 뽑는 3D Body Pose, 프레임레이트 2~4배 증가용 Video Frame Generation, 10비트 지원을 더한 Video Super Resolution, 약 2,000니트급 실시간 SDR→HDR 변환 TrueHDR, 다국어 현지화용 LipSync·Active Speaker Detection 을 공개함. 자사 주장으로 Sports Intelligence Playbooks 로 자체 데이터를 파인튜닝하면 정확도가 53%에서 94%로 올랐다고 밝힘. 출처생성물 진위 판별 모델이 연구 주제를 넘어 방송 인프라의 기본 스택 부품으로 제품화된 지점이다.
- 2026-09-09Zheng-Hui Huang 외 — 비디오 월드모델이 장시간 상호작용에서 지속적 상태를 유지하지 못하는 문제를 겨냥해 세계 상태 진화와 시각 관측 생성을 분리한 Programmable World Model 을 제안함. 에이전트가 자연어 지시를 엔티티 상태와 상태 전이 규칙을 명시하는 실행 가능한 프로그램으로 번역하고, 경량 엔진이 이를 실행해 화면 밖 엔티티와 비시각적 속성까지 포함한 명시적 전역 상태를 유지하며, 상태가 증강된 3D OBB 를 중간 표현으로 삼아 목표 카메라 궤적과 함께 사전학습 비디오 모델용 픽셀 정렬 시공간 조건 신호로 결정론적으로 컴파일함. 저자 주장으로 자체 제안 벤치마크 CombatStateBench 에서 Count Accuracy 94%, State Accuracy 98% 를 기록해 기존 상호작용형 비디오 월드모델을 크게 앞섰다고 밝힘. 출처생성형 렌더링과 상태 관리를 분리하는 설계로, 월드모델이 '그럴듯한 영상'을 넘어 규칙이 강제되는 플레이 가능한 시뮬레이터로 가는 길을 제시한다.