한국어EN
멀티모달StepFun

StepAudio 3 Realtime 기술 보고서 공개

StepAudio 3 Realtime 기술 보고서 공개 — 듣기·대화·사고·행동을 하나의 연속 루프로 돌리는 실시간 음성 모델. 대화를 끊지 않고 도구를 비동기로 실행한다. 자사 주장으로 StepAudioChat 매크로 평균 73.0, MMSU 90.6, Artificial Analysis Full-Duplex Bench Overall 98.9, τ-Voice 매크로 과제성공률 56.0%.

왜 중요한가

풀듀플렉스 음성이 OpenAI GPT-Live-1(09-10)·Google Gemini 3.8 Live(09-15)와 같은 주에 중국 랩에서도 나왔다 — 음성 인터페이스가 단일 랩의 차별점에서 공통 기본기로 내려앉는 구간.

출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요 논문arxiv.orghttps://arxiv.org/abs/2609.140052026년 9월 21일에 더한 조각 · 그 주 보기