본문으로
2026년 · WW36 · 중·고등학생 눈높이

2026년 36주차에 새로 확인된 것

이번 주 추가는 45건, 움직인 축은 15개다. 가장 많이 늘어난 곳은 ⑲ 온디바이스·로컬 추론(6건). 지난 4주 평균(264건)보다 적다. Liquid AI 등 22곳이 이번 주에 처음 기여했다.

45이번 주 추가
15움직인 축
2026-08-31기준 주(월요일)
1099누적 사건

축별 추가분

건수가 많은 축이 위로 온다. 한 사건이 여러 축에 걸치면 대표 축 한 곳에서만 센다.

6건

온디바이스·로컬 추론

  • 2026-08-31HUMAIN·Qualcomm — LEAP 2026(리야드)에서 Horizon Ultra AI PC 공개 — Snapdragon X2 Elite(18코어 Oryon CPU·Adreno GPU·Hexagon NPU) 기반으로 CPU·GPU·NPU에 AI 작업을 분산. Windows판은 2026-09-20부터 기업 구매 개시, HUMAIN OS 버전은 2027년 예정. 보도자료에 NPU TOPS 수치와 가격은 없음 출처사우디 국부펀드 계열사가 온디바이스 AI PC를 주권 AI 스택의 단말로 내세움 — 로컬 추론이 지정학적 조달 품목이 되는 국면
  • 2026-05-19Google (AI Edge) — LiteRT-LM 정식 출시(GA) — iOS 네이티브 Swift API와 WebGPU 가속 JavaScript API 추가. Android CPU·OpenCL GPU·NPU, iOS Metal, 브라우저 WebGPU 지원. Gemma 4 기준 Android GPU 디코드 52 tok/s, iOS GPU 56 tok/s, MacBook Pro M4 Max 웹 76 tok/s, Multi-Token Prediction 최대 2.2배, iOS 메모리 607MB 출처온디바이스 런타임이 모바일 OS를 넘어 브라우저까지 같은 스택으로 덮는 단계. 수치는 벤더 자체 측정
  • 2026-05-05Google (Chrome) — Chrome 148 스테이블에서 Prompt API를 웹에 공개 — 확장 프로그램은 Chrome 138부터 스테이블. 브라우저 내장 Gemini Nano에 웹페이지가 직접 접근하며 텍스트·이미지·오디오 입력과 정규식·JSON 스키마 응답 제약을 지원. 요구 사양은 여유 공간 22GB, VRAM 4GB 초과 또는 RAM 16GB·4코어 이상 출처온디바이스 모델이 앱이 아니라 웹 플랫폼 API로 노출된 스테이블 채널 사례. 모델 배포와 용량 관리의 책임이 브라우저 벤더로 넘어간다
  • 2025-11-28Liquid AI — LFM2 기술보고서 발표 — 350M~8.3B 계열로 확장(밀집 350M·700M·1.2B·2.6B, MoE 8.3B 총/1.5B 활성), 10~12T 토큰 사전학습, 32K 컨텍스트. 엣지 지연·메모리 제약을 건 하드웨어-인-더-루프 아키텍처 탐색으로 설계했다고 기술. LFM2-2.6B가 IFEval 79.56%·GSM8K 82.41% 출처7월 릴리스의 후속 문서. 온디바이스 계열이 기술보고서 수준의 공개 문서를 갖춘 사례다
5건

안전·정렬·해석가능성

  • 2026-09-02Google — Fairwind 프로그램 발표 — 정부·국가 사이버당국·핵심 인프라 사업자·대형 플랫폼에 한해 Gemini 3.8 Flash Cyber와 CodeMender를 심사 후 제공. 참가 조건으로 사내 보안팀 한정 접근과 다요소 인증을 요구. 파트너 650곳 이상, Google.org를 통한 사이버보안 지원 누적 1억 달러 이상, 그중 3,600만 달러를 35개 사이버 클리닉에 배정했다고 밝힘 출처공격·방어 이중용도 모델을 심사받은 방어자에게만 배포하는 접근 통제 방식의 제도화
  • 2026-09-01OpenAI — 'Path to Astra: critical capabilities and frontier safeguards' 공개 — Astra가 Preparedness Framework의 사이버보안 Critical 역량 임계를 충족한 첫 자사 모델이라고 발표. Critical 정의로 (1) 강화된 실제 시스템에서 인간 개입 없이 작동하는 제로데이 익스플로잇을 발견·개발하거나 (2) 높은 수준의 목표만 주어져도 강화된 표적에 대한 새로운 공격 전략을 종단간 수립·실행하는 능력을 제시. 대응으로 유해 요청 거부 강화(자사 측정 91.5%, 이전 버전 59%), 시스템 수준 사이버 오용 분류기, 실시간 모니터링과 차단, 초기 접근 제한을 배치했고 보호 강화를 위해 일부 개발 단계를 지연했다고 설명 출처자사 위험 프레임워크의 최고 등급이 실제로 발동된 첫 사례. 선언적 임계값이 배포 지연과 접근 제한이라는 구체적 조치로 이어졌는지를 검증할 기준점이며, 프런티어 사이버 역량이 정책 문제로 전환된 지점
  • 2026-09-01xAI — Biosecurity at the frontier 공개 — Grok 4.6의 생물보안 안전장치(거부 학습·추론시 보호·행동 제어)를 설명하고 LatchBio의 제3자 평가(BioSecBench-Refusal·BioSecBench-Surveillance)를 인용. 자사 주장: 거부 벤치마크 평균 62.1%로 시험 대상 중 최고, 적대적 과업 59.2% 거부·정상 생물학 과업 64.8% 수행. 향후 모델에 배포 전 시험 확대·제3자 평가 증대·배포 후 모니터링 개선을 약속 출처프런티어 랩이 생물보안 거부율을 수치로 공개하고 외부 평가기관을 지정한 사례 — 다만 자사 게시물이며 독립 재현은 없다
  • 2026-09-01Anthropic — Enterprise Frontier Safeguards(EFS) 발표 — 고객사가 소유한 클라우드 계정(AWS·Azure·Google Cloud)에 로그를 보관하고 고객이 암호화 키와 접근 정책을 관리하는 무보존(zero data retention) 구성에서, Anthropic 직원의 열람 없이 자동화된 오용 탐지(사이버 공격, 자격증명 탈취, 유해 역량 개발)를 수행하는 방식. 100곳 이상 기업 고객과 함께 개발했고 2026년 가을부터 순차 배포. 금융·의료·법률·정부 등 규제 산업의 데이터 보관 요건을 대상으로 함 출처데이터 주권 요구와 오용 감시가 충돌하던 지점에 대한 설계적 답. 안전 감시를 벤더 서버 밖에서 성립시키는 구조가 표준이 되면, 규제 산업의 프런티어 모델 도입 장벽이 배포 아키텍처 문제로 재정의된다
5건

모델 아키텍처·학습 기법

  • 2026-09-03Sergii Kozyrev, Davyd Maiboroda — Minima 공개 — 하이브리드 LLM Qwen3.8-27B(GDN 48층·어텐션 16층)의 초기 커뮤니티 4비트 양자화가 순환 오차 누적을 우려해 GDN 블록, 특히 decay·write-strength 게이트를 8/16비트로 남겨 두던 관행을 시험하고자 496개 선형 층 전부에 NVFP4 W4A4를 적용. 4K/32K 퍼플렉시티, MMLU-Pro, GSM8K, AIME'25, GPQA-Diamond, LiveCodeBench, 64K RULER 검색에서 BF16과 시드 잡음 범위 내(5개 과제 평균 -0.52)로 일치하면서 17.5 GiB로 비교 대상 중 가장 작고 프리필이 14~19% 빠르다고 보고. 모듈별로 보정된 NVFP4 체크포인트를 모듈을 하나의 GEMM으로 융합하는 커널이 서빙할 때 생기는 전역 스케일 불일치를 함께 수정 출처'순환 상태의 오차는 긴 문맥에서 누적된다'는 통념을 뒤집어 하이브리드 LLM의 순환 절반이 오히려 양자화하기 쉬운 쪽이라고 주장하고, NVFP4의 16원소 블록 스케일링이 잔차 스트림의 극단 이상치를 국소화하는 점과 델타 규칙 순환이 주입된 잡음을 32K 토큰에 걸쳐 평탄하게 유지하는 점 등 네 갈래 기계적 설명을 제시. 수치는 저자 자체 보고.
  • 2026-09-01Shaowen Wang 외 — SMELT 공개 — 공유 층 블록을 반복해 유효 깊이를 늘리는 루프드 트랜스포머 평가가 대개 모델 크기를 고정한 채 비교해 아키텍처 이점과 추가 FLOPs를 뒤섞는다고 지적하고, 토큰당 FLOPs·비임베딩 총 파라미터·KV 캐시 세 예산을 모두 맞춘 상태에서 MoE 트랜스포머의 중간 절반 층을 두 번 도는 레시피(Sparse MoE Transformer, middle layers Loop Twice)를 제시. 비임베딩 파라미터 54B까지 네 규모로 확장해 아키텍처별로 친칠라식 스케일링 법칙을 따로 적합 출처깊이 재사용(루프)이 예산을 엄격히 맞춘 뒤에도 이득이 남는지를 스케일링 법칙 수준에서 판정한 연구. 저자 자체 보고로 계산 최적 프런티어에서 학습 FLOPs 6.8~18.0% 절감, 이득은 코드에서 가장 크고 샘플 길이와 인컨텍스트 예시 수가 늘수록 커지며, 두 번째 방문이 어텐션 싱크를 줄이고 주의 질량을 내용 관련 토큰으로 재배분한다는 기계적 분석을 제시.
  • 2026-08-31Zihan Qiu 외 (Alibaba Qwen) — On the Design of Qwen3.8-Next Architecture 공개 — 파라미터 125B·토큰당 활성 6B에 가속기 밖에 두는 51B n-gram 임베딩 테이블을 더한 희소 MoE 모델 Qwen3.8-Flash-Next의 설계를 기술. 네 층마다 하나만 전체 어텐션을 두는 Gated DeltaNet(GDN)-전역 어텐션 층별 하이브리드에 Qwen Sparse Attention과 Gated Residual을 결합했고, 각 설계 변경을 손실과 다운스트림 벤치마크·학습과 프리필과 디코드 비용·최적 하이퍼파라미터에 미치는 영향이라는 세 축으로 평가 출처프런티어 오픈웨이트 모델의 아키텍처 선택 근거를 절제 실험 단위로 공개한 사례. 저자 자체 보고로 손실과 다운스트림 정확도가 늘 같이 움직이지는 않으며, 이 아키텍처와 Muon 옵티마이저의 조합이 최적 학습률과 배치 크기를 위로 밀어 배치 크기 워밍업을 불필요하게 만들고 스트레스 테스트에서 안정성을 크게 개선.
  • 2026-08-28Alexia Jolicoeur-Martineau, Rhea Sanjay Sukthanker, Pashmina Cameron, Emy Gervais — Sliding-window beats linear attention 공개 — 기존 LLM을 선형 어텐션으로 개조(retrofit)하는 연구 갈래가 더 단순한 기준선과 제대로 비교된 적이 없다고 지적하고, 싱크를 둔 슬라이딩 윈도 어텐션(SWA)이 여러 LLM과 다양한 다운스트림 과제에서 후속학습된 선형 어텐션 모델과 같거나 더 낫다고 보고. Needle-in-a-Haystack·BABILong 등 장문맥 추론 과제에서는 SWA가 선형 어텐션 대비 2~10배 높은 성능을 냈고, SWA는 후속학습이 필요 없으며 매우 빠르고 메모리도 적게 쓴다고 주장 출처이차 스케일링 해법으로 각광받던 선형 어텐션 개조 갈래에 대해 '후속학습이 필요 없는 슬라이딩 윈도로 충분하다'는 기준선을 세운 반증 논문 — 선형 어텐션 모델은 처음부터 학습하거나 광범위한 후속학습을 거쳐야 겨우 SWA를 따라잡을 것이라고 저자들이 결론. 수치는 저자 자체 보고.
5건

AI 인프라 소프트웨어

  • 2026-09-01Guowei Wang 외 — AInfer-PD 공개 — 에이전틱 RL에서 각 궤적이 생성과 환경 상호작용을 여러 턴 오가며 비동기로 진행되므로 프리필(P)과 디코드(D)의 공존이 일회성 프롬프트 처리 사건이 아니라 롤아웃의 지속적 속성이 된다고 지적하고, 분산 MoE 롤아웃까지 in-place P/D 멀티플렉싱을 확장. 랭크 간 P/D 집합 통신 순서를 조율하고 DeepEP의 P·D 경로에 독립적인 통신 상태를 부여해 교차하는 ADP/ATP·DeepEP 경로의 동시 실행을 안전하게 만들면서 모델 가중치와 KV 저장은 공유. 단일 노드 프리필 집약 워크로드에서 P/D 멀티플렉싱을 끈 동일 엔진 대비 7.1~22.5%, SGLang 대비 24.8~32.9% 롤아웃 완료 시간을 줄였고 2노드에서는 각각 18.0~35.3%·18.3~31.8%라고 보고 출처별도 디바이스 풀과 KV 캐시 전송을 요구하는 P/D 분리(disaggregation) 대신, 가중치와 KV를 공유한 채 집합 통신 순서와 상태만 격리해 같은 디바이스에서 P/D를 겹치는 갈래. 서빙 인프라의 병목이 추론 서비스에서 RL 롤아웃으로 옮겨간 사례이기도 하다. 수치는 저자 자체 보고.
  • 2026-01-21PyTorch 재단 — PyTorch 2.10 릴리스 — varlen_attn() 가변길이 어텐션(순전파·역전파, A100+ BF16/FP16), torchinductor combo-kernel 수평 융합, cuSOLVER DnXgeev 일반 고유값 분해, torch.compile 의 use_deterministic_mode 준수와 DebugMode 도입, Python 3.14 지원. TorchScript 를 torch.export 로 대체 예고. 2.9 이후 기여자 536명·커밋 4,160건. 2026년부터 릴리스 주기를 분기에서 2개월로 단축 출처수치 재현성(결정성·텐서 해싱 디버깅)이 릴리스 헤드라인에 올라온 시점. 학습 스택이 성능 경쟁 단계에서 디버깅 가능성 단계로 넘어가는 신호
  • 2025-10-22PyTorch (Meta) — Helion 베타 공개 — Python 내장 DSL을 자동 튜닝된 Triton 커널로 컴파일. 어텐션 커널이 Helion 30줄 대 Triton 120줄, B200에서 eager 대비 기하평균 3.27배(torch.compile 2.7배·수작업 Triton 1.76배), MI350X에서 2.37배 출처Triton이 CUDA를 한 단계 추상화했듯 Helion은 Triton을 한 단계 더 추상화한다. 커널 작성 계보의 다음 층
  • 2025-10-22PyTorch (Meta) — Monarch 공개 — SPMD 대신 단일 컨트롤러로 클러스터를 배열처럼 다루는 분산 프레임워크. 제어 평면(메시징)과 데이터 평면(RDMA)을 분리. VERL 통합에서 H200 16→2,048 GPU 확장, torchft 통합 시 240 H100에 3분마다 장애를 주입해 SLURM 전체 재시작 대비 복구 60% 단축(프로세스 장애 평균 90초·머신 장애 2.5분) 출처2022년 Google Pathways가 제시한 단일 컨트롤러 모델이 PyTorch 코어 계보로 들어온 지점. TorchTitan 은 Monarch 안의 액터가 되고 torchforge 는 Monarch 위에 세워진다
4건

추론 모델·AGI 논쟁

  • 2026-09-04Anthropic — 'Formalizing Fermat's Last Theorem' 공개 — Claude Fable 5.1과 대략 비등한 수준이라고 설명한 내부 범용 연구 모델로 와일즈의 페르마의 마지막 정리 증명을 Lean으로 형식화. 11일 소요, 출력 토큰 약 60억, Lean 코드 1,300만 줄, 정리 3만 300개 증명(최종 증명에 2만 9,500개 사용)을 보고하고 Lean이 표준 3공리만으로 검증했다고 밝힘. Columbia의 Tianyi Peng 팀이 설계한 협업 형식화 플랫폼 Prove2Me에서 다수 Claude 에이전트가 협업했고, Lean 커뮤니티의 FLT 형식화를 이끌던 Kevin Buzzard(임페리얼)가 검토해 FLT의 첫 종단간 기계 검증 증명이라고 확인했다고 서술. Wiles 원논문이 아니라 Darmon·Diamond·Taylor의 간명화된 서술을 따름 출처인간 커뮤니티가 수년 단위로 진행하던 대형 형식화 과제를 에이전트 군집이 단기간에 수행했다는 주장. 검증 가능한 산출물(Lean 증명)이 결과물이라 벤치마크와 달리 외부 재검증이 가능하다는 점에서 자율 연구 주장 중 검증 난도가 낮은 사례
  • 2026-09-03OpenAI — GPT-6 Astra 공개. 자사 벤치마크로 FrontierMath Tier 4(v2) 97.6%, ARC-AGI-3 99.9%, GPQA Diamond 96.0%, Terminal-Bench 4.0 57.9%, OSWorld 2.0 72.6%, ScreenSpot-Pro 92.7%, ExploitBench 100%를 주장. 512K~1M 토큰 장문 컨텍스트를 시험했고 API 가격은 입력 100만 토큰 10달러·출력 50달러, 2배 속도의 fast 모드는 2배 가격. 당일 제한된 조직에 롤아웃한 뒤 ChatGPT Plus·Pro·Business·Enterprise로 확대하며 OpenAI API·Azure·AWS Bedrock에서 제공. Pro·Business·Enterprise용 GPT-6 Astra Pro 변형 존재 출처GPT-6 세대 개시. Anthropic Fable 5.1과 같은 주에, 100만 토큰당 10/50달러라는 동일한 가격표로 출시돼 프런티어 가격이 사실상 수렴했고, 벤치마크 경쟁의 중심이 컴퓨터 사용·사이버·에이전틱 코딩으로 이동
  • 2026-09-02Google DeepMind — Gemini 3.8 Flash 및 3.8 Flash Cyber 공개 — 자사 주장: HLE-Verified 54.9%, CWE-Bench 패치 pass@1 47.2%, 20개 언어 내부 평가 성공률 70% 초과, Chrome 보안팀 평가에서 경쟁 모델 대비 정확한 패치 2.6배. 가격은 입력 100만 토큰당 0.75달러·출력 3.75달러이며 2026-12-31까지 도입가. AI Studio·Android Studio·Gemini API·Gemini Enterprise·Gemini 앱·검색에서 제공 출처보안 전용 파생 모델을 프런티어 라인업의 정식 변종으로 분리 — 취약점 탐지·패치가 모델 제품군의 독립 축이 됨
  • 2026-09-01Anthropic — Claude Fable 5.1과 Claude Mythos 5.1 공개. 자사 벤치마크로 에이전틱 과학 연구(Terminal-Bench Science 0.1) Fable 5.1 52.6%(Fable 5는 24.7%), 에이전틱 코딩(Terminal-Bench 4.0) Fable 5.1 55.8%·Mythos 5.1 60.9%, Humanity's Last Exam 60.9%(도구 없음)·65.0%(도구 사용)를 주장. 가격은 입력 100만 토큰 10달러·출력 50달러로 Fable 5와 동일하나 캐시 읽기를 100만 토큰당 0.25달러로 75% 인하해 일반 워크로드 비용이 약 25%, 복잡한 코딩·고에이전틱 작업은 최대 약 45% 줄어든다고 주장. Mythos 5.1은 검증된 사이버 방어자·생명과학자에게만 제공되며 현재 미국 조직에 한정 출처프런티어 모델의 경쟁 축이 코딩에서 자율 과학 연구로 이동. 최상위 모델을 심사된 사용자에게만 여는 계층 배포가 제품 라인으로 굳어졌고, 가격 인하가 성능이 아니라 캐시 읽기 단가에서 나온 점은 장기 에이전트 루프가 과금의 중심임을 보여줌
4건

물리 세계·현실 영향

  • 2026-09-03OpenAI — 'Daybreak for Frontline Defenders' 발표 — 승인된 공공·민간 방어자가 사이버 방어에 첨단 AI를 쓰도록 하는 Daybreak를 10억 달러 규모 글로벌 이니셔티브로 확대. 주력 모델 기반의 Daybreak Blue와 민감하고 기술적으로 까다로운 작업용 전용 사이버 모델 Daybreak Red로 구성. 상하수도·전력망 운영자, 주·지방정부, 지역·커뮤니티 은행, 비영리, 오픈소스 메인테이너 등 자원이 부족한 조직을 우선 대상으로 하며, 승인된 2,000개 조직의 방어자 수천 명이 이미 사용 중이고 35개 이상 파트너 제품·서비스로 이뤄진 Daybreak Defense Network를 통해 배포한다고 설명 출처사이버 Critical 역량 선언과 같은 주에 나온 방어 측 비대칭 보정. 공격 역량의 위험을 접근 통제만이 아니라 방어자 보조금으로 상쇄하려는 접근으로, 프런티어 랩이 중요 인프라 보안의 공급자 위치로 들어감
  • 2026-09-03Google DeepMind·Google Research — WeatherNext 3 공개 — 지표 변수 5km 해상도, 시간 단위 예보(이전 6시간 단위), 물리 시뮬레이션 대신 정지궤도 위성 실시간 데이터 사용. 자사 주장: 강수 예보가 IMERG 대비 최대 60%, MRMS 대비 30%, 우량계 대비 10% 개선. Brightband의 독립 실시간 평가에서 가장 정확하다고 인용. 검색·Gemini 앱·지도·Maps Platform Weather API·Earth Engine에 적용되고 BigQuery·Earth Engine·GCS로 데이터 제공 출처AI 기상 모델이 연구 시연을 넘어 소비자 제품과 상용 API의 기본 예보로 들어감
  • 2026-09-01OpenAI — ChatGPT의 의료 데이터 연결 확대 — Epic 연동으로 전자의무기록(EHR)을 ChatGPT for Healthcare 조직과 자격을 갖춘 Enterprise 고객에 연결하고, ClinicalTrials.gov·CMS Coverage·RxNorm·DailyMed·PubMed 등 9개 공식 출처를 묶은 Healthcare Public Data 플러그인을 미국 임상의에게 ChatGPT for Clinicians로 제공. 60개국·49개 언어·26개 전문과 의사들과 협업했고 의사가 검토한 응답 4,363건 중 99.1%가 안전 등급, 임상 질문 응답의 93% 이상이 정확도 양호 이상이었다고 자사 주장. HIPAA BAA, 역할 기반 접근, SSO, 감사 로그 지원 출처범용 챗봇이 규제 의료 기록 시스템에 직접 연결되는 단계. 컨텍스트 연결(RAG·커넥터)의 전선이 공개 웹에서 규제 데이터 영역으로 넘어갔고, 안전성 근거는 아직 벤더 자체 평가에 의존
  • 2026-08-26Anthropic — Anthropic Insights를 통한 외부 연구 결과와 집계 데이터 공개 — 2026년 4~5월 대화 약 25만 건에서 뽑은 집계 데이터를 Hugging Face에 공개. 연구자는 원본 대화에 접근하지 못하고 프라이버시 검토를 거친 집계 산출물만 받으며, Anthropic에 불리한 결과도 발표할 수 있다는 조항이 협약에 포함. 검토 권한은 프라이버시·정책 위반 조력·기밀·연구 정확성으로 한정하고, 임페리얼 칼리지 런던이 제3자 프라이버시 감사를 수행. 정책 위반이 드러나는 범주는 5% 미만 부분 편집 출처사용 실태 데이터를 벤더가 독점하는 구조에 외부 검증 통로를 낸 사례. 발표 자유 조항과 제3자 감사를 명시해 벤더 자체 보고와 구분하려는 설계

여기 보이는 것은 24건이고, 다른 9개 축을 포함해 21건이 더 있다. 전부 보려면 고급 페이지를 열면 된다.

코어와의 관계 이 파일은 그 주에 늘어난 것만 담는다. 시대 전체를 보려면 코어 학습 모듈을 열면 된다 — 코어는 매주 갱신되는 단 하나의 최신본이고, 여기 주차 파일은 그때의 기록이다.