멀티모달StepFun
StepAudio 3 Realtime 기술 보고서 공개
StepAudio 3 Realtime 기술 보고서 공개 — 듣기·대화·사고·행동을 하나의 연속 루프로 돌리는 실시간 음성 모델. 대화를 끊지 않고 도구를 비동기로 실행한다. 자사 주장으로 StepAudioChat 매크로 평균 73.0, MMSU 90.6, Artificial Analysis Full-Duplex Bench Overall 98.9, τ-Voice 매크로 과제성공률 56.0%.
왜 중요한가
풀듀플렉스 음성이 OpenAI GPT-Live-1(09-10)·Google Gemini 3.8 Live(09-15)와 같은 주에 중국 랩에서도 나왔다 — 음성 인터페이스가 단일 랩의 차별점에서 공통 기본기로 내려앉는 구간.
출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요
논문arxiv.orghttps://arxiv.org/abs/2609.140052026년 9월 21일에 더한 조각 · 그 주 보기
같은 주에 나온 조각09.11'Scaling Storage for 1 Billion ChatGPT Users (Part I)' 공개공식 발표09.10Agents API 퍼블릭 베타 공개공식 발표09.10ChatGPT Work 에 Data agent 를 공개함공식 발표09.10클라우드 샌드박스에서 실제 셸을 과제당 300턴 이상 조작하며 각 과제 자체의 검증기로 보상을 받는 122B…논문