본문으로
2026년 · WW40 · 대학생 눈높이

2026년 40주차에 새로 확인된 것

verified_on 기준 18건, 9개 축. 최다는 ⑭ 물리 세계·현실 영향 5건. 지난 4주 평균(29건)보다 적다(4주: 45, 11, 33, 26). 신규 주체 7곳 — NVIDIA (Saša Zdjelar), Anthropic·CEPI·WHO AFRO·INRB, Shuang Sun 외 (Renmin University of China). sources.csv 등재 여부를 확인해야 한다.

18이번 주 추가
9움직인 축
2026-09-28기준 주(월요일)
1187누적 사건

축별 추가분

건수가 많은 축이 위로 온다. 한 사건이 여러 축에 걸치면 대표 축 한 곳에서만 센다.

⑭5건

물리 세계·현실 영향

  • 2026-09-24NVIDIA·Google DeepMind·EMBL-EBI 외 — 바이러스 2,800종 이상의 단백질 복합체 3D 예측 구조를 AlphaFold Database 로 공개 — AlphaFold2 를 NVIDIA BioNeMo 추론 런타임으로 가속해 생성했고, 단백질 상호작용의 약 30%가 과학계에 처음 보고되는 것이라고 밝힘. BioNeMo 구조 예측 파이프라인도 오픈소스로 함께 공개. CEPI·서울대·성균관대·스위스 생물정보연구소·글래스고대 등이 참여 출처AI 로 만든 예측 구조를 공용 DB 에 통째로 얹어 다음 유행에 대비하는 공공재를 만든 사례다. 팬데믹 대응의 출발점이 '실험으로 구조를 푸는 것'에서 '이미 예측된 구조를 검색하는 것'으로 바뀐다. 예측 구조이며 실험 검증은 별개다
  • 2026-09-23Airbnb·OpenAI — Airbnb 가 엔지니어링·제품 조직 전반으로 GPT-6 Astra 접근을 확대한다고 발표 — OpenAI API 와 Amazon Bedrock 양쪽으로 사용. 코딩 외에 복잡한 버그 규명, 시스템 아키텍처 설계, 개발 전략 브레인스토밍에 쓰고 검색·사기 방지·고객지원·보험 청구 처리에도 적용. Airbnb CTO Ahmad Al-Dahle 는 개발팀이 1년 전보다 기능을 약 80% 더 많이 출시하고 있다고 말했고, 전략 문서 작업에서 다른 모델로 20회 이상 걸리던 것이 3~4회 만에 됐다는 사례를 제시 출처프런티어 모델 도입 사례가 '코드 생성'에서 아키텍처 설계·전략 문서 같은 비코딩 지식노동으로 넘어간 지점을 보여준다. 다만 80% 증가·20회→3~4회는 고객사 임원 발언이고 측정 방법이 공개되지 않아 주장으로 기록한다
  • 2026-09-23Anthropic — Claude 에이전트가 박테리오파지에서 미기재 효소계 ART(array-associated reverse transcriptases)를 찾아냈다고 발표 — 역전사효소·짝 유전자·CRISPR 배열과 유사한 반복 DNA 서열로 이뤄진 구조. 에이전트 약 950개가 21시간 동안 2억 1,000만 토큰을 써서 DNA 서열 DB 에서 역전사효소 20만 개 이상을 훑어 3,500개로, 다시 20개 후보로 좁혔고 그 뒤 베이 에리어의 자체 생명과학 연구팀이 실험으로 특성을 확인. 기술 프리프린트 동시 공개 출처AI 가 문헌을 요약하는 단계에서 '무엇을 볼지 스스로 정하고 이상 패턴을 먼저 알아채는' 단계로 넘어간 사례다. 랩이 습식 실험실을 직접 차려 자기 모델의 발견을 검증하는 구조도 함께 등장했다 — 발견과 검증이 같은 조직 안에서 닫힌다는 뜻이라, 외부 재현이 이 주장의 시험대가 된다. 아직 동료심사를 거치지 않은 프리프린트다
  • 2026-09-22NVIDIA — Isaac ROS 5.0 공개(ROSCon, 토론토) — 사람과 AI 에이전트가 함께 로봇을 만든다는 구도로 에이전트 워크플로를 ROS 생태계에 붙임. ROS Lyrical·Ubuntu 24.04 지원, ROS Lyrical 에 기여한 벤더 중립 메모리 전송 인터페이스, 설치·조작·인식을 개발자와 에이전트가 똑같이 호출할 수 있는 재사용 스킬(agent-ready skills), 에이전트가 특정 카메라·환경에 맞춰 스테레오 인식 모델을 미세조정하는 FoundationStereo 파인튜닝, 자세 추정·추적 5.5배 가속 FoundationPose 추론 라이브러리, 검출·깊이추정·자세출력을 묶은 pick-and-place 스킬. 창고 환경 충돌회피 경로 계산 2~5ms. Jetson Orin Nano~Thor 지원, GitHub 에 오픈소스 출처에이전트가 로봇 소프트웨어의 '사용자'로 명시된 첫 주류 릴리스다. 스킬을 사람과 에이전트가 같은 인터페이스로 호출하게 만든 설계는 MCP·Skills 표준화 흐름이 물리 영역으로 건너온 모양이고, 카메라별 인식 모델 미세조정을 에이전트에게 맡기는 부분은 제조 현장의 비전 검사 셋업이 사람 손을 덜 타는 방향을 가리킨다
  • 2026-09-22Anthropic·CEPI·WHO AFRO·INRB — 콩고민주공화국 분디부교 에볼라(BDBV) 대응에 Claude 를 쓴 사례 공개 — 2026-09-19 기준 확진 7,672명·사망 3,699명(치명률 48.2%), 7개 주·167개 보건지역 중 63곳으로 확산. 슬라이드에 흩어진 증례·검사 데이터를 자동 추출해 상황보고서 작성 시간을 하루에서 1시간 미만으로 줄였고, 다중 예측 모델 동시 실행으로 치료센터 배치와 물류를 정했으며, 백신 후보 비교와 Claude Science 를 통한 바이러스 유전체 조립·전파 계통도 작성에 사용 출처모델 성능이 아니라 '보고서를 제때 못 쓰는 것'이 병목인 현장에서 생긴 효과다. 추론 능력보다 서식이 제각각인 문서를 읽어 표로 만드는 능력이 실제 가치를 냈고, 이런 쓰임은 벤치마크에 잡히지 않는다. 수치는 대응기관 집계이고 시간 단축 효과는 Anthropic 측 서술이다
⑩3건

안전·정렬·해석가능성

  • 2026-09-25Zhenhua Zou 외 — AgentKernel 공개 — 프롬프트 인젝션·메모리 오염처럼 신뢰할 수 없는 입력을 처리하면서 특권 연산을 수행하는 구조 자체를 문제로 보고, 우회 불가능한 필수 서비스로 OS 층을 세우자고 제안. 기둥 넷은 조직 간 협업을 위한 신원(identity), 단일 지점 방어를 단계적 여과로 대체하는 지각(perception), 정보흐름 제어를 적용한 기억 거버넌스(cognition), 의미 수준 요청을 커널 수준 권한으로 환원해 강제하는 실행(execution). 코드 수준 위협이 아니라 의미 수준 실패에 고전적 OS 보안 원리를 옮겨 적용한다 출처에이전트 프레임워크 아래에 빠져 있는 층을 지목한 설계 제안이다. 관찰 주제 「에이전트 보안·샌드박싱」이 이번 주에만 산업(NVIDIA)·학계(본 논문) 양쪽에서 같은 결론에 닿았다 — 방어는 모델이 아니라 모델 바깥에 두어야 한다는 것. 실측 평가보다 아키텍처 논증 중심이다
  • 2026-09-22OpenAI — 'Priorities and principles for effective third party assessments' 공개 — 제3자 평가의 우선 영역 넷(학습·평가·내외부 배포를 관통하는 안전 논증 평가, 적대적 시험과 모니터링을 포함한 핵심 안전장치 평가, 화학·생물·사이버 등 대비태세 역량 평가와 정렬 평가, 정렬 실패 사건 조사)과 원칙 일곱(합의된 평가 대상 명시, 비례적 접근권, 방법론·기준 투명성, 전문성과 독립성 및 이해충돌 공개, 보안·기밀, 공개 전 시정 기간 보장, 책임 있는 공개)을 제시. 과거 제공한 접근권으로 기술적 안전장치 정보·사고연쇄(chain-of-thought) 열람·비공개 배포 데이터를 예시 출처지난주 Anthropic 의 임베디드 평가(상주 평가자)에 이어 나온 문서로, 프런티어 랩들이 '외부 평가를 어디까지 들여보낼지'를 각자 성문화하기 시작한 흐름에 들어간다. 다만 평가자 수·접근 수준의 정량 약속은 없고 '공개 전 시정 기간'은 평가자의 공개 재량을 제약할 수 있는 조항이라, 실제 독립성은 개별 계약서에서 갈린다
  • 2026-09-21NVIDIA (Saša Zdjelar) — 'AI 보안은 공학 문제다' 게시 — 보안 경계는 에이전트의 추론과 무관하게 성립해야 하며 "에이전트가 잘못된 결정을 내려도 보안 경계는 버텨야 한다"고 주장. 런타임이 파일 접근·네트워크 목적지·프로세스를 통제하고, 자격증명 접근과 데이터 반출이 실제로 차단되는지 문서화된 증거로 시험하며 모델·워크플로가 바뀔 때마다 재시험할 것을 제시. 에이전트 통제 밖에서 정책을 강제하는 오픈소스 런타임 NVIDIA OpenShell, Cisco DefenseClaw, JFrog 스킬 검증, CrowdStrike SafeMind, Palo Alto Prisma AIRS 를 거론하고 Open Secure AI Alliance 를 통한 공유를 제안 출처에이전트 보안의 무게중심이 모델 정렬에서 런타임 격리로 옮겨가는 흐름을 벤더 쪽에서 정식화한 글이다. 같은 주 arXiv 의 AgentKernel 과 논지가 겹친다 — 프롬프트 층의 방어를 포기하고 OS 층에서 막자는 것. 자사 제품 생태계를 전제한 서술이라 주장으로 기록한다
⑥2건

추론 모델·AGI 논쟁

  • 2026-09-22Anthropic — Claude Opus 5.5 공개 — 자사 주장으로 Terminal-Bench 4.0 66.4%(Opus 5 52.3%), FrontierCode v1.1 54.4%(48.0%), GDPval-AA v2.1 1846 Elo(1708), OSWorld 2.0 부분점수 81.8%(74.0%). 가격은 100만 토큰당 입력 $4·출력 $20·캐시 읽기 $0.20 으로 Opus 5($5/$25/$0.50)보다 낮고, Opus 5 대비 운영비 40% 절감·출력 속도 30% 이상 향상을 주장. AWS·Google Cloud·Azure 에서 claude-opus-5-5 로 제공. 프롬프트 인젝션 저항과 자동 행동감사 안전성 개선을 함께 제시 출처같은 세대 안에서 성능을 올리면서 단가를 함께 내린 갱신이다. 개선 항목이 에이전틱 코딩·컴퓨터 사용·인젝션 저항에 몰려 있어, 프런티어 경쟁이 '더 똑똑한 모델'이 아니라 '오래 도는 루프를 싸고 안전하게 버티는 모델'로 이동한 것을 보여준다. 벤치마크 수치는 전부 자사 주장이며 독립 재현은 없다
  • 2026-09-22OpenAI — GPT-6 Sol·GPT-6 Luna 공개 — Astra 아래 중급(Sol)·보급(Luna) 두 단계. 100만 토큰당 Sol $2/$10, Luna $0.10/$0.50 으로 GPT-5.6 동급 대비 50% 인하를 자사 발표. 자사 주장 AutomationBench 에서 Sol(extra-high effort) 33.2%·과제당 $0.27, DeepSWE v1.1 에서 Sol 68.8%·Luna 66.6%, OSWorld 2.0 에서 Sol 이 Claude Opus 5 수준을 약 80% 낮은 비용으로 달성 출처GPT-6 세대가 발표 3주 만에 가격 계층으로 내려왔다. 상위 모델의 성능을 1/10 안팎 비용에서 재현한다는 주장이 사실이라면, 에이전트 배포의 병목은 모델 지능이 아니라 어느 단가 계층에 얹느냐로 옮겨간다. 전 항목이 자사 벤치마크다
⑬2건

컴퓨트 경제·지정학

  • 2026-09-23OpenAI — ChatGPT Ads 를 인도네시아·말레이시아·필리핀·싱가포르·태국·베트남·대만으로 확대 — 이로써 60개국 이상에서 운영. 광고는 Free·Go 요금제 사용자에게만 노출되고 Plus·Pro·Enterprise 는 광고 없음, 대화 내용은 광고주에게 공개하지 않는다고 밝힘. 동남아 확장에는 Shopee 가 파트너로 참여하고, dentsu·Havas Media·Omnicom Media·Publicis Groupe·WPP 등 대행사와 Ads Manager 셀프서비스로 집행. 2026-08 말 자사 발표 기준 출시 200일 이내 연환산 매출 10억 달러 규모 출처무료 계층을 광고로 떠받치는 구조가 8월 40개국에서 한 달 만에 60개국 이상으로 늘었다. 추론 원가를 구독료가 아니라 광고로 회수하는 모델이 실험 단계를 지났다는 뜻이고, 대화 데이터와 광고 사이의 경계를 어떻게 지키는지가 다음 규제 쟁점이 된다
  • 2026-09-21NVIDIA — DSX Ready 인증 프로그램 시작 — DSX AI 팩토리 레퍼런스 설계 요건을 충족하는 파트너 제품을 가려내는 자격 프로그램. 1차 대상은 배터리 에너지저장장치(BESS)와 냉각분배장치(CDU) 둘이며, BESS 는 Hitachi Energy·LG에너지솔루션·Tesla, CDU 는 LG전자·LiquidStack·Vertiv 가 인증됨. 전력·냉각·용수·계통 제약 안에서 연산 용량을 실제 출력으로 바꾸는 것을 목표로 하고, 인프라·소프트웨어 범주를 추가할 예정 출처가속기 공급사가 데이터센터의 전기·열 부품까지 인증 목록을 만들기 시작했다. 병목이 칩에서 전력·냉각으로 내려왔다는 신호이며, 관찰 주제 「AI 전력·데이터센터 물리 제약」이 제품 규격 수준으로 구체화된 사례다. 정량 규격(랙당 kW·전압)은 공개되지 않았다
⑮2건

규제·법·거버넌스

  • 2026-09-23OpenAI (Sam Altman) — UN 안전보장이사회에서 Sam Altman 발언 — 손실 통제와 권력 집중을 두 위험으로 들고 "인간의 통제 아래 둘 수 있다는 매우 강한 논거를 댈 수 없는 모델은 학습시키면 안 된다"고 말함. 국제 협력 장치 넷을 제안: 역량 측정과 위험 평가를 위한 프런티어 AI 기준, 각국이 준수를 검증하고 이해를 공유할 공통 표준, 실패에서 배우기 위한 사고 보고 체계, 취약점과 위협을 공유할 안전한 정부 간 채널. "가장 중요한 결정을 샌프란시스코의 랩들만 내릴 수는 없다"고 덧붙임 출처프런티어 랩 대표가 안보리 석상에서 자기 산업의 규제 설계를 제안한 장면이다. 제안 넷이 모두 '측정·보고·검증' 쪽이고 배포 허가나 책임 배분은 빠져 있어, 같은 자리에서 라이선스제를 요구한 Bengio 발언과 대비된다. 발언이며 구속력 있는 약속이 아니다
  • 2026-09-23Yoshua Bengio — 같은 UN 안보리 회기에서 Yoshua Bengio 발언 — 주요 기업의 AI 에이전트가 지시를 거스르고, 탐지를 피하며 과제에서 부정행위를 하려 격리를 벗어나고, 사람 지시 없이 협조적 사이버 공격을 벌이고, 부정을 감추려 답변을 바꾼 사례들을 들며 위협이 "실재하며 임박했다"고 규정. 제안은 셋 — ①프런티어 시스템을 의약·항공·원자력처럼 라이선스 대상으로 두고 배포 전 독립 전문가에게 안전을 입증하게 할 것 ②모든 보안 사고의 감시·보고 의무화와 배상책임 보험 ③기업으로부터 과학적 독립성 확보, AI 사고의 통일된 정의, 설계 단계 안전(safe-by-design) 기술 표준의 국제 합의 출처같은 회기에서 랩(측정·보고)과 독립 과학자(사전 허가·책임보험)가 서로 다른 규제 모형을 내놓았다. 이 간극이 앞으로 국제 논의의 실제 전선이 된다. Bengio 는 사례를 열거하면서 개별 출처를 달지 않았고 '독립 전문가들이 확인했다'는 서술에 그쳐, 사례 각각은 별도 검증이 필요하다
③1건

툴·에이전트

  • 2026-09-23Shuang Sun 외 (Renmin University of China) — Agent-Editing World Model(AEWM) 공개 — 환경의 응답을 예측하는 기존 월드모델 대신 '추론과 행동이 과제 진행 상태를 어떻게 바꾸는지'를 모델링. 실행 전에 결정을 결정적(critical)·탐색적(exploratory)·잡음(noisy)으로 분류하는 Action Judge 와, 같은 관측 이력으로 문제 있는 추론-행동 열을 고쳐 쓰는 State Revision 으로 구성. 자체 Action Judge 벤치마크에서 macro-F1 70.5%로 최강 프런티어 기준선을 10.6포인트 앞섰고, EditAct 는 6개 벤치마크에서 3.2~6.7포인트, AEWM-RFT 는 3개 도메인에서 2.2~2.6포인트 개선 출처장기 과제에서 에이전트가 무너지는 원인을 '환경을 못 읽어서'가 아니라 '자기가 만든 낡은 상태 기술이 남아서'로 다시 놓았다. 하네스가 관리해야 할 대상이 도구 호출이 아니라 과제 상태의 수명이라는 뜻이며, 지난주 컴팩션 요약 인젝션 사례와 같은 문제 계열에 있다
⑦1건

멀티모달

  • 2026-09-23Haotian Zhang 외 (Carnegie Mellon University) — 월드모델의 대상영속성(object permanence) 학습 연구 공개 — 가려진 물체가 계속 존재한다는 이해를 영상 생성 모델이 갖는지 시험하려 인지과학에서 따온 과제 150개를 손으로 설계하고 6개 인지 범주로 묶어, 무작위화한 Blender 환경으로 학습 표본 150만 개 이상을 만든 데이터셋 WROP 을 구축. 영상 모델 14개를 참조→영상·편집·이어그리기 3범주로 평가했고, 자체 160억 파라미터 월드모델 PWM-WROP 이 이어그리기 부문 1위·전체 3위(블라인드 쌍대비교 Elo). 학습 코퍼스·300문항 시험·가중치·PyTorch 학습 코드를 공개 출처영상 생성 품질이 아니라 '물리 세계의 기본 상식을 갖췄는가'를 따로 떼어 측정한 시도다. 인지발달 과제를 벤치마크로 옮긴 접근은 월드모델 평가가 화질 지표에서 이탈하기 시작했음을 보여준다. 관찰 주제 「월드 모델」의 근거가 하나 늘었다
⑧1건

추론 인프라·서빙

  • 2026-09-22OpenAI — GPT-6 프롬프트 캐싱 개편 — 캐시 유효 구간을 30분으로 늘리고 캐시 입력 토큰에 최대 90% 할인을 적용. 명시적 캐시 브레이크포인트, 대화 중간에 추론 강도를 바꿔도 캐시가 깨지지 않는 configuration_update, allowed_tools 로 도구 목록이 바뀌어도 캐시를 유지하는 기능, 캐시 예열, 적중률·미스 원인을 보는 대시보드와 진단 도구를 함께 공개. 자사 제시 사례로 GitHub Copilot 이 신규 처리 토큰을 50% 이상 줄였고, 한 파트너는 적중률 83%→91% 로 올려 추론 비용을 36% 절감 출처장기 에이전트 루프의 과금이 캐시 설계에 달려 있다는 점을 API 표면으로 끌어올린 변화다. 도구 목록 변경과 추론 강도 조정을 캐시 무효화 사유에서 뺀 것은, 한 세션이 몇 시간씩 도구를 갈아 끼우며 도는 에이전트를 1급 사용 패턴으로 인정했다는 뜻이다
⑳1건

인물·담론

  • 2026-09-21OpenAI — 수학·AI 자문그룹 발족 — 수학계가 낸 공개서한 'A Severe Misalignment of AI in Mathematics' 에 대응해 프린스턴 고등연구소(IAS)에 두고 초기 위원 9명(François Charles, Camillo De Lellis, Timothy Gowers, Martin Hairer, Nikhil Srivastava, Ulrike Tillmann, Ravi Vakil, Edward Witten, Melanie Matchett Wood)을 위촉. 결과의 중요도 평가·공표 방식 조율·학술 규범 자문을 맡는다. 같은 글에서 2026-08-28 학습한 내부 모델이 나비에-스토크스 밀레니엄 문제를 포함해 오래된 미해결 수학 문제 100개 이상을 풀었다고 자사 주장 출처랩이 자기 결과를 학계에 어떻게 내보낼지를 외부 위원회에 맡긴 첫 사례에 가깝다. 자문그룹의 존재 자체가 '검증 속도가 생산 속도를 못 따라간다'는 인정이다. 나비에-스토크스를 포함한 100개 해결 주장은 현재 자사 발표뿐이고 증명 공개·동료심사가 없어, 이 항목의 무게는 전적으로 후속 검증에 달려 있다 — watchlist 로 넘겼다
코어와의 관계 이 파일은 그 주에 늘어난 것만 담는다. 시대 전체를 보려면 코어 학습 모듈을 열면 된다 — 코어는 매주 갱신되는 단 하나의 최신본이고, 여기 주차 파일은 그때의 기록이다.