본문으로
2026년 · WW39 · 초등학생 눈높이

2026년 39주차에 새로 확인된 것

이번 주에는 툴·에이전트 쪽 소식이 가장 많았다(4건). 전체로는 26건이 새로 확인됐고 10개 분야가 움직였다. 처음 보는 이름도 11곳 나왔다 — Yi Duan 외 31인, StepFun.

26이번 주 추가
10움직인 축
2026-09-21기준 주(월요일)
1169누적 사건

축별 추가분

건수가 많은 축이 위로 온다. 한 사건이 여러 축에 걸치면 대표 축 한 곳에서만 센다.

4건

툴·에이전트

  • 2026-09-18OpenClaw — 업데이트를 원자적(atomic)으로 바꿈 — 업데이트를 준비하는 동안 기존 게이트웨이를 살려 두고 실패하면 마지막으로 동작하던 구성으로 되돌려, 진단과 자가 복구를 할 에이전트가 항상 남아 있게 함(2026.9.1 → 2026.9.2). 설정 옵션이 수천 개라 사용자 구성 조합을 전부 시험할 수 없다는 진단에서 나왔고, 개발자에게는 고칠 코딩 에이전트가 따로 있지만 일반 사용자에게는 그 에이전트가 유일한 자동화 수단이라는 점을 설계 근거로 들었다.
  • 2026-09-17Run-Ze Fan 외 (Zoom 외) — 코딩 에이전트 하네스 설계의 실증 연구 — 모델 4종에 대해 하네스 구성 176가지를 평가함. ①토큰 예산이 줄수록 컨텍스트 관리가 결정적이며 주된 효과는 오버플로 실패 방지 ②규칙 기반 제거와 LLM 요약을 함께 쓰는 쪽이 가장 낫고 제거한 내용을 되찾게 해 주는 것은 이득이 거의 없음 ③플래닝은 약한 모델에선 정확도를, 강한 모델에선 주로 비용을 개선 ④약한 모델은 미리 정의된 도구 인터페이스가 유리하지만 강한 모델은 bash 만 주는 쪽이 성능·효율 모두 낫다(특히 터미널 중심 과제). 궤적 수준 분석으로 각 기전을 설명함.
4건

멀티모달

  • 2026-09-18xAI — Grok Voice Transcribe 2.0 공개 — 같은 가격에 1.0 대비 정확도 2배라고 자사 주장. 19개 언어 짧은 문장 WER 20.6%→6.8%, 전화 음성(고객지원 통화)에서 시험한 모델 중 선두, Artificial Analysis 공개 리더보드의 스트리밍 모델 32종 중 정확도 1위. 배치 전사는 오디오 시간당 $0.10, 스트리밍은 $0.20 이며 화자 분리·타임스탬프·핵심어는 추가 비용 없음. 곧 Speech-to-Text API 기본값이 되고 1.0 은 수 주 내 폐기 예정이며 버전 고정이 가능함.
  • 2026-09-17Taoyong Cui 외 — JEPA-Anything 공개 — 잠재 목표를 상보적 인자로 분해해 각각 전용 경로로 학습하는(OPF) 도메인 비의존 예측 프레임워크. 비전·생물·임상 궤적·제어·분자동역학·물리장·기상 7개 영역에 적용해 동역학 과제 10개 전부에서 기준선을 개선했고, Interventional Pong 개입 예측 오차 34.8% 감소, 분자 4개 계에서 1스텝·100스텝 모두 최저 오차, 임상 사건 1,000종 이상 예측, 케플러 스케일링 지수를 기울기 -1.4991 로 복원함.
4건

안전·정렬·해석가능성

  • 2026-09-18Anthropic·Accenture(Faculty) — 임베디드 평가 파트너십 발표 — Accenture 의 AI 전문 조직 Faculty 의 평가자가 Anthropic 시설 안에 상주하며 모델 평가·레드팀, 정렬 평가, 안전장치 시험을 수행함. 직원에 준하는 접근권으로 모델 개발을 관찰하고 배포 결정을 모니터링하며 직원과 직접 소통한다. 양사는 향후 5년간 평가 역량 구축에 최소 10억 달러를 투자할 것으로 예상하며 METR 등 비영리 평가기관과도 논의 중. 모델 안전의 책임 자체는 Anthropic 에 남는다고 명시함. Dario Amodei 의 'We Must Pace the Frontier' 에서 이어진 조치.
  • 2026-09-17Anthropic — Life Sciences Verification Program(LSVP) 공개 — 검증받은 생명과학 종사자·조직에 한해 Claude(Mythos·Opus·Sonnet)의 생물학 관련 안전장치를 완화해 여는 제도. 연구 자격·보안 기준·윤리 감독을 심사하고 표준 이용(팀 단위, 연 1회 갱신)과 고위험 이용(프로젝트 단위, 반기 갱신, 생명과학 안전장치 전면 해제) 둘로 나눈다. 접근권은 명시한 용도에 묶이며 실시간 차단 대신 세션을 가로지르는 오프라인 이상 탐지로 전환함. 사전 프로그램에서 수십 개 조직을 온보딩했고 첫 주에 수백 개 조직 등록을 예상함.

여기 보이는 것은 6건이고, 다른 7개 축을 포함해 20건이 더 있다. 전부 보려면 고급 페이지를 열면 된다.

코어와의 관계 이 파일은 그 주에 늘어난 것만 담는다. 시대 전체를 보려면 코어 학습 모듈을 열면 된다 — 코어는 매주 갱신되는 단 하나의 최신본이고, 여기 주차 파일은 그때의 기록이다.