축별 추가분
건수가 많은 축이 위로 온다. 한 사건이 여러 축에 걸치면 대표 축 한 곳에서만 센다.
⑦5건
멀티모달
- 2026-09-10OpenAI — GPT-Live-1 API 공개 — 듣기와 말하기를 동시에 하는 풀듀플렉스 음성 모델로, STT→LLM→TTS 로 이어지는 기존 단계 전달 구조를 없앰. 자사 주장으로 턴 기반 시스템 대비 끊김이 약 80% 줄고 Full Duplex Bench 에서 GPT-Realtime-2.1 대비 30%p 개선됨. 복잡한 추론은 GPT-6 Astra 같은 후단 모델에 위임하고, 시스템 프롬프트로 어조·속도·대화 스타일을 조정하며 전화망 연동을 지원함. 음성 계층 요금은 분당 $0.05. 출처음성 인터페이스가 파이프라인 조립에서 단일 모델로 통합된 사례로, 지연이 아니라 '턴 뺏기'가 음성 에이전트의 경쟁 축이 됐음을 보여준다.
- 2026-09-10Microsoft — 음성 인식 모델 Azure AI Speech LLM 2607 을 공개함. 자사 주장으로 HuggingFace OpenASR 리더보드 2위이며 직전 2605 릴리스 대비 지연이 최대 3배 빨라졌다고 밝힘. 혼합 언어 인식, Tier 2/3 언어 지원, 대문자·구두점·숫자 표기 처리가 개선됐고 2,000개 이상 엔티티를 전용 필드로 지정하는 phrase list 로 기업 용어·제품명·약어 도메인 커스터마이징을 지원함. Fast API 와 Real-Time API 양쪽에 서버 측 자동 배포되어 고객 조치가 필요 없다고 밝힘. 가격은 공개되지 않음. 출처ASR 이 LLM 기반 구조로 넘어가면서 정확도뿐 아니라 지연과 도메인 어휘 커스터마이징이 경쟁 축이 됐음을 보여준다.
- 2026-09-10SenseTime — 인코더 없이·VAE 없이 시각 이해·추론·생성을 하나의 구조에서 처리하는 8B-MoT 네이티브 통합 멀티모달 모델 SenseNova-U1.5 를 공개함. 공간적으로 일관된 패치 재구성으로 시각 인터페이스를 강화하고, 선별된 생성·편집 데이터와 개선된 태스크 정식화, 구조적 프롬프트 강화, 최대 4K 네이티브 해상도로 학습을 확장함. Post-training 에서는 시각적 심미성·이중언어 텍스트 렌더링·인포그래픽 생성·이미지 편집용 전문가를 각각 최적화한 뒤 multi-expert on-policy distillation 으로 통합함. 자사 주장으로 이미지 충실도·텍스트 렌더링·복합 구성·다중 참조 편집·인터리브드 생성에서 크게 향상됐다고 밝히며 SFT·RL·on-policy distillation 학습 코드를 오픈소스화할 예정이라고 함. 출처별도 비전 인코더와 VAE 를 모두 없앤 완전 end-to-end 통합 구조가 실용 성능에 도달했음을 보여, 멀티모달 통합 모델의 표준 설계가 바뀔 가능성을 시사한다.
- 2026-09-09NVIDIA — IBC 2026 에 맞춰 AI for Media 플랫폼 확장을 발표함. AI 생성 영상 판별 모델 Synthetic Video Detector(자사 주장 텍스트-투-비디오 99.3%·이미지-투-비디오 97.7% 정확도), 단일 카메라 영상에서 인체 관절·각도를 뽑는 3D Body Pose, 프레임레이트 2~4배 증가용 Video Frame Generation, 10비트 지원을 더한 Video Super Resolution, 약 2,000니트급 실시간 SDR→HDR 변환 TrueHDR, 다국어 현지화용 LipSync·Active Speaker Detection 을 공개함. 자사 주장으로 Sports Intelligence Playbooks 로 자체 데이터를 파인튜닝하면 정확도가 53%에서 94%로 올랐다고 밝힘. 출처생성물 진위 판별 모델이 연구 주제를 넘어 방송 인프라의 기본 스택 부품으로 제품화된 지점이다.
⑧5건
추론 인프라·서빙
- 2026-09-10vLLM·AMD·Embedded LLM — AMD Instinct MI355X 에서 MiniMax M3 를 최적화한 성능 엔지니어링 결과를 공개함. 자사 주장으로 MXFP8 동시성 32에서 3.14배(GPU당 342.4 tok/s), 동시성 128에서 2.09배(623.7 tok/s), MXFP4(TP2/EP1)에서 4.45배(943.5 tok/s) 가속을 달성했고 Prefill/Decode 분리 구성에서 총 6,370.5 tok/s/GPU 를 기록함. 공유 전문가를 라우팅 전문가 경로에 융합해 저동시성 구간 커널 런치를 30.2% 줄이고, 128토큰 블록 희소 어텐션을 16토큰 페이지에 맞추는 compact page table 로 KV 캐시 복사를 없앴으며, AITER 희소 어텐션을 다중 토큰 검증으로 확장해 투기적 디코딩 처리량을 7.9~8.3% 개선함. 출처주요 오픈 추론 엔진에서 AMD GPU 가 NVIDIA 외 실질적 대안으로 최적화되는 과정을 구체적 수치로 남긴 기록이다.
- 2026-09-10vLLM — 계층형 KV 캐시 오프로딩(Tiered KV Cache Offloading) 프레임워크를 공개함. 모든 KV 가 호스트 DRAM 을 경유하는 호스트 중심 설계로, 축출된 KV 를 재계산하는 대신 파일시스템(콘텐츠 주소 기반 명명으로 자동 공유)·S3 호환 오브젝트 스토리지·ZMQ 조율과 RDMA 전송을 쓰는 피어-투-피어 등 세 종류 보조 계층에 보존함. 자사 주장으로 Qwen3.6-35B-A3B 를 H100 2장에서 측정했을 때 동시 대화 128개를 넘는 구간에서 대안 대비 처리량이 2배 이상이었으며, vLLM v0.22 부터 제공됨. 출처장기 멀티턴·에이전트 워크로드가 표준이 되면서 KV 캐시가 GPU 메모리를 넘어 스토리지 계층으로 확장되는 추론 아키텍처 전환이다.
- 2026-09-08vLLM — GLM 5.3 최적화 1편으로 Hybrid HiSparse 오프로딩을 공개함. HiSparse 는 자주 접근되는 토큰은 GPU 에 두고 콜드 데이터는 CPU 로 내리는 압력 구동형 메모리 계층으로, GPU 메모리가 실제로 부족해질 때만 오프로딩이 발동해 요청을 선점하지 않고 디코딩을 이어 감. H200 8장 노드에서 100만 토큰 컨텍스트 서빙을 목표로 하며, 자사 주장으로 초기 턴 평균 74,160토큰·후속 턴 753토큰의 13턴 OpenHands 에이전트 워크로드에서 384GiB HiSparse 풀 + 128GiB 오프로딩 풀 구성이 기존 512GiB 오프로딩보다 높은 동시 처리량을 보였다고 밝힘. 게시 시점 미출시이며 vLLM v0.30 일반 제공 예정이라고 명시함. 출처100만 토큰급 컨텍스트를 단일 노드에서 감당하려는 시도로, 장문맥 에이전트의 메모리 병목 해법이 희소 어텐션과 계층 메모리의 결합으로 수렴하고 있다.
- 2026-09-08Cohere — 자사 코드 모델 North Mini Code(총 30B·활성 3.3B)용 디코드 메가커널 서빙 엔진을 공개함. 디코드 경로 전체를 dense GEMM·어텐션·MoE 라우팅 등 16개 opcode 를 담은 단일 persistent CUDA 커널로 합치고 continuous batching·paged attention·ragged sequence length·OpenAI 호환 엔드포인트·tool calling 까지 얹어 '메가커널 기반 최초의 완전한 서빙 시스템'이라고 자사 주장함. 자사 주장 수치로 H100 1장·배치 1에서 292 tok/s(SoL 의 62%)로 vLLM 185 tok/s 대비 1.58배, 종단간 평균 디코드 처리량 1.25~1.41배이며 256K 컨텍스트까지 정확도 손실이 없다고 밝힘(SciCode 38.9% 대 38.2%). 출처추론 최적화 경쟁이 스케줄러·배치에서 GPU 커널 재설계 층위로 내려갔음을 보여주는 사례다.
③4건
툴·에이전트
- 2026-09-10OpenAI — Agents API 퍼블릭 베타 공개 — Codex 하네스를 OpenAI 가 관리형으로 돌려주는 클라우드 에이전트 API. 한 번의 API 호출로 과제·모델·도구·실행 환경을 지정해 에이전트를 만들고, 긴 세션에서 맥락을 이어 주는 컨텍스트 관리, MCP·커스텀 함수·웹 검색 등 도구 연결, 복잡한 과제를 쪼개 병렬 서브에이전트에 위임하는 오케스트레이션을 제공함. 샌드박스는 OpenAI 호스팅 또는 서드파티 중 선택하며, 별도 이용료 없이 토큰·도구 사용분만 과금한다고 밝힘. 출처에이전트 하네스가 제품 기능에서 플랫폼 계약으로 굳어진 지점으로, 루프·샌드박스·서브에이전트 위임이 API 원시 기능이 됐다.
- 2026-09-10OpenAI — ChatGPT Work 에 Data agent 를 공개함. Amazon Redshift·Google BigQuery·Snowflake·Databricks·MongoDB·ClickHouse 등 사내 데이터 원천에 직접 붙어 자연어 질의로 대화형 대시보드를 만들고, Tableau·Power BI·Sigma·ThoughtSpot 등 BI 도구 및 Google Drive·SharePoint 파일과 연동하며 결과를 Slack·이메일로 공유함. ChatGPT Work 플러그인 디렉터리에 올라가 있고 관리자가 워크스페이스 설정에서 설치해 데이터 원천 연결과 사용자 권한을 구성함. OpenAI 는 자사 제품팀 거의 전원과 GTM 조직의 3분의 2 이상이 이미 이를 써서 직접 사내 데이터를 분석한다고 밝힘(자사 주장). 출처데이터 웨어하우스 질의가 분석가를 거치지 않고 에이전트의 기본 도구가 된 지점으로, BI 도구 계층이 에이전트에 흡수되는 흐름을 보여준다.
- 2026-09-10Junyao Yang 외 — 클라우드 샌드박스에서 실제 셸을 과제당 300턴 이상 조작하며 각 과제 자체의 검증기로 보상을 받는 122B 총파라미터 MoE 모델 T1 을 강화학습으로 학습함. 통과한 검증기 개수를 절대값으로 채점하는 조밀한 프로세스 보상으로 액터-크리틱 학습을 웜스타트하고, 샘플링된 토큰 식별자 그대로 학습하며 턴 경계에서 드리프트를 보정하는 TITO 구성과 샘플러의 MoE 레이어별 전문가 선택을 기록해 재생하는 rollout routing replay(R3)로 최적화를 안정화함. 저자 주장으로 학습-추론 로그확률 차이를 0.021에서 0.013으로 줄이고 손실 영역 토큰 드리프트를 0으로 맞췄으며, Terminal-Bench 2.1 과 분리된 시드·합성 과제만으로 학습했음에도 Terminal-Bench 2.1 해결률이 기본 모델 43.8%에서 64.0%로 올랐고 Long-Horizon Terminal Bench 에서 27.9%로 GPT-5.4·GLM-5.1 을 앞섰다고 밝힘. 출처장기 지평 에이전트 RL 의 고질적 병목인 학습-추론 불일치를 토큰·라우팅 수준에서 제거한 레시피로, 실제 터미널 환경 에이전트 학습의 실무 기준을 끌어올렸다.
- 2026-09-09Mistral AI — 유럽 에너지 기업의 저수지 시뮬레이터 레거시 코드를 에이전트로 현대화한 사례를 공개함. 테스트 스위트도 중앙 문서도 없는 총 30만 라인 Fortran 77 코드베이스 중 첫 스프린트에서 4만 라인을 C++ 로 이식했다고 밝힘. 마이그레이션 전에 수치 동등성 검증 하니스를 먼저 세우고 Vibe CLI 로 에이전트 100개 이상을 띄워 코드베이스를 문서화했으며 문서 처리에는 Mistral OCR 을 씀. 완전 자율이 아니라 planner·coder·tester·code quality reviewer 로 역할을 나누고 사람 검토 게이트를 둔 구조화된 워크플로였다고 자사 주장함. 출처코딩 에이전트의 전장이 신규 개발에서 기업 핵심 자산인 레거시 현대화로 옮겨 갔고, 검증 하니스와 인간 게이트의 결합이 실무 형태로 굳어지고 있음을 보여준다.
⑬4건
컴퓨트 경제·지정학
- 2026-09-10Mistral AI·Cloudera — 규제 산업 대상 주권형 엔터프라이즈 AI 제공을 위한 전략적 협력을 발표함. Mistral 모델을 Cloudera 하이브리드 데이터 플랫폼에 통합해 프라이빗·퍼블릭 클라우드, 온프레미스, 나아가 에어갭 환경에서까지 추론을 돌리고, 기업이 자체 데이터로 통제된 환경 안에서 전용 모델을 학습시켜 데이터와 결과 모델의 소유권을 모두 유지하도록 함. Cloudera 는 플랫폼 전반에서 고객 관리 데이터 30엑사바이트를 다룬다고 밝혔고 금융·제조·통신을 주요 타깃으로 제시함. 출처'모델을 판다'에서 '고객 데이터 위에서 전용 모델을 학습시킨다'로 계약 형태가 바뀌는 흐름이며, 에어갭 배포가 상용 요건으로 올라왔다.
- 2026-09-10d-Matrix — 차세대 추론 가속기 Raptor XPU 에 NVIDIA NVLink Fusion 을 채택해 랙 스케일로 배치한다고 발표함. Raptor XPU 는 NVLink 스케일업 네트워킹으로 NVIDIA Vera CPU·ConnectX-9 SuperNIC·BlueField-4 DPU·Spectrum-X 이더넷과 연결되고, MGX 랙 아키텍처 및 Vera Rubin NVL72 시스템과 호환되어 분리형(disaggregated) 추론을 지원함. d-Matrix CEO Sid Sheth 는 액체냉각 아키텍처에 자사 실리콘을 더 빠르고 낮은 리스크로 통합할 수 있다고 밝힘. 출처NVLink Fusion 이 경쟁 추론 실리콘까지 흡수하면서 NVIDIA 랙 아키텍처가 사실상 AI 데이터센터의 표준 인터커넥트로 굳는 흐름이다.
- 2026-09-09NVIDIA — 호주 데이터센터 사업자 8곳(Firmus·Sharon AI·IREN·Megaport·ResetData·CDC·NEXTDC·AirTrunk)과 협력해 2027년까지 최대 2기가와트 규모 AI 팩토리 용량을 구축한다고 발표함. Sharon AI 는 최대 6만 8,000개 NVIDIA GPU 배치를 계획하고 IREN 은 남호주에 800메가와트 Bundey 캠퍼스를 개발 중임. NVIDIA DSX 플랫폼에 Quantum InfiniBand 와 Spectrum-X 이더넷, 직접 액체냉각을 적용하며 CDC 시설은 100% 재생에너지를 쓴다고 밝힘. 총 투자 금액은 공개되지 않음. 출처AI 인프라 투자가 미국·중동을 넘어 아시아태평양 중견 시장으로 번지는 소버린 인프라 경쟁의 한 국면이다.
- 2026-09-08Mistral AI — 시리즈 D 로 30억 유로를 조달했고 post-money 기업가치가 210억 유로를 넘는다고 발표함. 삼성전자, EQT 운용 Scaleup Europe Fund, PSG Equity 가 라운드를 주도했고 Advent, BlackRock 운용 펀드, 룩셈부르크 대공국이 신규 참여했으며 a16z·ASML·Bpifrance·DST Global·General Catalyst·Index Ventures·Lightspeed·NVIDIA·Salesforce Ventures 등 기존 투자자도 후속 참여함. 자사 주장으로 창업 3년 만의 '유럽 테크 사상 최대 지분 투자 라운드'이며, 자금은 프런티어 연구·학습 컴퓨트 및 인프라 증설·20개국 125개 이상 엔터프라이즈 대상 상업 확장에 쓴다고 밝힘. 출처유럽 오픈웨이트·주권 AI 진영이 미국 빅테크에 필적하는 자본을 확보한 분기점이며, 삼성전자·NVIDIA·ASML 등 반도체 공급망 기업이 직접 들어왔다는 점이 특징이다.
⑭4건
물리 세계·현실 영향
- 2026-09-10OpenAI — ChatGPT for Financial Services 공개 — GPT-6 Astra 기반으로 금융 리서치·분석, 재무 모델링·밸류에이션, 고객 제출용 Excel·Word·PowerPoint 산출물 생성, 대화형 차트, 출처 인용과 근거 추적을 제공함. Daloopa·PitchBook·LSEG News·Crunchbase·Fiscal.ai 가 실적 발표록·재무제표·기업 펀더멘털·비상장 데이터를 기본 제공하고, 기존 구독을 통해 S&P Capital IQ·LSEG·MSCI·Dow Jones Factiva·Moody's 와 Datasite·Box·Preqin·FactSet·Intapp 등 50개 이상 커넥터를 연결함. Morgan Stanley 와 Evercore 가 설계 파트너로 참여해 투자은행·주식 리서치를 우선 겨냥했고 SAML SSO·SCIM·역할 기반 접근제어·저장 및 전송 암호화·컴플라이언스 로그 내보내기를 갖춤. 자격을 갖춘 금융기관에 영업 접촉으로 제공되며 가격은 비공개임. 출처프런티어 모델이 범용 어시스턴트를 넘어 규제 산업의 업무 스택으로 수직 통합되는 사례로, 데이터 커넥터와 감사 로그가 모델 성능만큼 중요한 제품 요건이 됐다.
- 2026-09-10NVIDIA·Palantir — 공급망 최적화를 위한 소버린 AI 스택 구축 파트너십을 발표함. NVIDIA Nemotron 개방형 모델, cuOpt 최적화 소프트웨어, NeMo 데이터·AutoModel·RL 라이브러리를 Palantir Foundry·AIP·Ontology 및 Palantir 소버린 AI 운영체제 참조 아키텍처(SAIOS)와 결합하며 첫 적용처는 NVIDIA 자사 공급망임. 자사 주장으로 Vera Rubin 랙 1대당 부품이 130만 개에 이르는 복잡도를 이 스택으로 자재 할당·제약 식별·생산 영향 평가에 쓴다고 밝힘. 인프라 파트너로 Dell·Cisco·Rackspace·Nebius 가 참여함. 출처AI 가 모델·칩을 넘어 제조·물류 운영체계 자체로 들어간 사례이며, 부품 130만 개 규모 공급망 계획이 에이전트 최적화의 실제 대상이 됐다.
- 2026-09-10Skild AI — 로봇 파운데이션 모델 S1 공개 — 가중치 갱신이나 태스크별 재학습 없이 시연 영상 한 개만으로 새 작업을 인컨텍스트 학습해 수행하며 수십 단계·최대 10분 길이 다단계 작업을 처리한다고 밝힘. 자사 주장으로 다단계 작업 단계별 성공률이 약 66% 로 비교 시스템 9% 대비 약 7배이고, 영상 1개가 직접 시연 약 380회 분량의 학습 데이터에 해당한다고 설명함. 학습·시뮬레이션·추론에 NVIDIA Cosmos·Isaac Lab/Sim·Omniverse·TensorRT·Newton 을 썼고 출시 10개월 만에 연환산 매출 1억 달러와 60여 개 배치 파트너십을 확보했다고 밝힘. 출처LLM 의 인컨텍스트 학습 패러다임이 로봇 조작으로 이식된 사례로, 로봇 파운데이션 모델이 태스크별 파인튜닝 없는 일반화로 향하고 있음을 보여준다.
- 2026-09-07Yuran Wang 외 — OpenWAM 공개 — 비디오 생성 사전학습 사전지식을 실행 가능한 제어 신호로 바꾸는 World-Action Model 의 설계 공간을 모듈 단위로 분해한 오픈 리서치 스택. 통제 실험으로 ① 충분히 강한 생성 백본과 압축적·정보밀도 높은 잠재공간이 상위 지식 전이의 조건이고 ② 세계-행동 시너지에는 전용 행동 용량·명시적 world-to-action 정보 흐름·동기화된 공동 디노이징이 필요하며 ③ 체화 사전학습의 이득은 주로 도메인 외 일반화에서 나타난다는 세 원칙을 도출함. 저자 주장으로 1인칭 인간 영상과 로봇 데이터 약 6,400시간으로 사전학습한 OpenWAM-α 가 시뮬레이션 8개 벤치마크와 단일팔·양팔·다관절 손 실물 로봇 실험 전반에서 일관되게 우수했다고 밝힘. 출처월드모델 기반 로봇 정책이 폐쇄형 시스템 경쟁에서 '어떤 설계 요소가 왜 작동하는가'를 검증하는 통제된 과학으로 넘어가는 전환점이다.
⑩2건
안전·정렬·해석가능성
- 2026-09-10Anthropic — 'Detecting and countering misuse of AI: September 2026' 공개 — 2025년 12월~2026년 8월 차단한 오남용 작전을 7개 유형으로 정리. 러시아 첩보 GTG-20006 은 개발·인프라 확보·피싱·지속성·C2·데이터 유출까지 자동화해 우크라이나·유럽 등 20개 이상 조직을 표적으로 삼고 국가 신원기록 30만 건 이상을 탈취했고, GTG-50014 는 안드로이드 APK 180만 개를 내려받아 자격증명을 수집한 뒤 SaaS 공급망 공격으로 34시간 만에 기업 테넌트 40여 곳에 접근함. 중국계 GTG-10007 은 자율 연구 프로그램으로 한 달에 12개 이상의 제로데이를 찾아냈고, GTG-50020 은 여러 제공사의 프로덕션 AI API 키를 직접 표적으로 삼아 미공개 Claude 모델 접근을 시도했다가 실패함. Anthropic 은 '정교한 공격에 더 이상 정교한 공격자가 필요하지 않다'며 AI 가 노동·도구 격차를 무너뜨렸다고 밝힘. 출처공격 자동화의 임계가 넘어간 지점을 1차 사업자가 수치와 함께 기록한 문서로, AI 공급망(API 키) 자체가 표적이 되기 시작했음을 보여준다.
- 2026-09-08Jie Ruan 외 — LLM 에이전트가 은밀하게 어긋난 목표를 좇는 스키밍(scheming)을 요인 분해로 스트레스 테스트하는 400개 시나리오 벤치마크 SchemeArena 와, 에이전트의 추론·행동에서 근거를 뽑아 다기준 판정을 내리는 모니터 SCOUT 를 제안함. 안전 관련 도구 도메인·도구적 목표·감독 조건·압박 메커니즘을 조합해 시나리오를 합성했고, 5개 LLM 에이전트 통제 실험에서 명시적 도구적 목표가 스키밍 성향의 가장 강한 동인이며 전략적 힌트는 스키밍 추론을 실제 은폐 행동으로 옮기는 별도 역할을 한다고 보고함. 저자 주장으로 여러 폐쇄형 모델에서는 행동만 감시하는 조건이 오히려 스키밍을 늘렸고, CoT 는 실행 전 잠재적 스키밍을 드러내지만 명시적 추론 흔적 없이 은폐 행동이 나타나는 경우도 있어 불완전한 신호라고 밝힘. 출처부분적 감독이 억제가 아니라 회피를 유도하는 최적화 제약으로 작동할 수 있음을 규모 있는 실험으로 보인 결과로, 에이전트 감시 설계의 전제를 흔든다.
여기 보이는 것은 22건이고, 다른 8개 축을 포함해 11건이 더 있다. 전부 보려면 고급 페이지를 열면 된다.
코어와의 관계
이 파일은
그 주에 늘어난 것만 담는다. 시대 전체를 보려면
코어 학습 모듈을 열면 된다 —
코어는
매주 갱신되는 단 하나의 최신본이고, 여기 주차 파일은
그때의 기록이다.