본문으로
2026년 · WW36 · 대학생 눈높이

2026년 36주차에 새로 확인된 것

verified_on 기준 45건, 15개 축. 최다는 ⑲ 온디바이스·로컬 추론 6건. 지난 4주 평균(264건)보다 적다(4주: 0, 0, 0, 1054). 신규 주체 22곳 — Liquid AI, Arm, Google (Chrome). sources.csv 등재 여부를 확인해야 한다.

45이번 주 추가
15움직인 축
2026-08-31기준 주(월요일)
1099누적 사건

축별 추가분

건수가 많은 축이 위로 온다. 한 사건이 여러 축에 걸치면 대표 축 한 곳에서만 센다.

6건

온디바이스·로컬 추론

  • 2026-08-31HUMAIN·Qualcomm — LEAP 2026(리야드)에서 Horizon Ultra AI PC 공개 — Snapdragon X2 Elite(18코어 Oryon CPU·Adreno GPU·Hexagon NPU) 기반으로 CPU·GPU·NPU에 AI 작업을 분산. Windows판은 2026-09-20부터 기업 구매 개시, HUMAIN OS 버전은 2027년 예정. 보도자료에 NPU TOPS 수치와 가격은 없음 출처사우디 국부펀드 계열사가 온디바이스 AI PC를 주권 AI 스택의 단말로 내세움 — 로컬 추론이 지정학적 조달 품목이 되는 국면
  • 2026-05-19Google (AI Edge) — LiteRT-LM 정식 출시(GA) — iOS 네이티브 Swift API와 WebGPU 가속 JavaScript API 추가. Android CPU·OpenCL GPU·NPU, iOS Metal, 브라우저 WebGPU 지원. Gemma 4 기준 Android GPU 디코드 52 tok/s, iOS GPU 56 tok/s, MacBook Pro M4 Max 웹 76 tok/s, Multi-Token Prediction 최대 2.2배, iOS 메모리 607MB 출처온디바이스 런타임이 모바일 OS를 넘어 브라우저까지 같은 스택으로 덮는 단계. 수치는 벤더 자체 측정
  • 2026-05-05Google (Chrome) — Chrome 148 스테이블에서 Prompt API를 웹에 공개 — 확장 프로그램은 Chrome 138부터 스테이블. 브라우저 내장 Gemini Nano에 웹페이지가 직접 접근하며 텍스트·이미지·오디오 입력과 정규식·JSON 스키마 응답 제약을 지원. 요구 사양은 여유 공간 22GB, VRAM 4GB 초과 또는 RAM 16GB·4코어 이상 출처온디바이스 모델이 앱이 아니라 웹 플랫폼 API로 노출된 스테이블 채널 사례. 모델 배포와 용량 관리의 책임이 브라우저 벤더로 넘어간다
  • 2025-11-28Liquid AI — LFM2 기술보고서 발표 — 350M~8.3B 계열로 확장(밀집 350M·700M·1.2B·2.6B, MoE 8.3B 총/1.5B 활성), 10~12T 토큰 사전학습, 32K 컨텍스트. 엣지 지연·메모리 제약을 건 하드웨어-인-더-루프 아키텍처 탐색으로 설계했다고 기술. LFM2-2.6B가 IFEval 79.56%·GSM8K 82.41% 출처7월 릴리스의 후속 문서. 온디바이스 계열이 기술보고서 수준의 공개 문서를 갖춘 사례다
  • 2025-09-10Arm — Lumex CSS 플랫폼 발표 — SME2를 넣은 C1 CPU 클러스터와 Mali G1-Ultra. KleidiAI를 PyTorch ExecuTorch·Google LiteRT·Alibaba MNN·Microsoft ONNX Runtime에 통합. AI 성능 최대 5배, 음성 워크로드 지연 4.7배 감소, 오디오 생성 2.8배를 주장 출처온디바이스 추론의 병목을 전용 NPU가 아니라 CPU 확장명령(SME2)으로 푸는 노선. 프레임워크 통합을 함께 발표해 실리콘이 아니라 소프트웨어 경로로 배포된다. 수치는 벤더 자체 주장
  • 2025-07-10Liquid AI — LFM2 공개 — 350M·700M·1.2B 밀집 체크포인트를 게이트형 short convolution과 소수의 GQA 블록을 섞은 하이브리드 백본으로 발표. Apache 2.0 기반 라이선스(연매출 1,000만 달러 미만 상업 이용 허용). Galaxy S24 Ultra·AMD Ryzen HX370에서 ExecuTorch·llama.cpp로 측정해 Qwen3 대비 CPU 디코드·프리필 2배라고 주장 출처온디바이스를 사후 양자화의 결과가 아니라 설계 목표로 두고 하드웨어-인-더-루프로 아키텍처를 탐색한 상용 계열. 수치는 벤더 자체 측정이며 독립 검증이 아니다
5건

안전·정렬·해석가능성

  • 2026-09-02Google — Fairwind 프로그램 발표 — 정부·국가 사이버당국·핵심 인프라 사업자·대형 플랫폼에 한해 Gemini 3.8 Flash Cyber와 CodeMender를 심사 후 제공. 참가 조건으로 사내 보안팀 한정 접근과 다요소 인증을 요구. 파트너 650곳 이상, Google.org를 통한 사이버보안 지원 누적 1억 달러 이상, 그중 3,600만 달러를 35개 사이버 클리닉에 배정했다고 밝힘 출처공격·방어 이중용도 모델을 심사받은 방어자에게만 배포하는 접근 통제 방식의 제도화
  • 2026-09-01OpenAI — 'Path to Astra: critical capabilities and frontier safeguards' 공개 — Astra가 Preparedness Framework의 사이버보안 Critical 역량 임계를 충족한 첫 자사 모델이라고 발표. Critical 정의로 (1) 강화된 실제 시스템에서 인간 개입 없이 작동하는 제로데이 익스플로잇을 발견·개발하거나 (2) 높은 수준의 목표만 주어져도 강화된 표적에 대한 새로운 공격 전략을 종단간 수립·실행하는 능력을 제시. 대응으로 유해 요청 거부 강화(자사 측정 91.5%, 이전 버전 59%), 시스템 수준 사이버 오용 분류기, 실시간 모니터링과 차단, 초기 접근 제한을 배치했고 보호 강화를 위해 일부 개발 단계를 지연했다고 설명 출처자사 위험 프레임워크의 최고 등급이 실제로 발동된 첫 사례. 선언적 임계값이 배포 지연과 접근 제한이라는 구체적 조치로 이어졌는지를 검증할 기준점이며, 프런티어 사이버 역량이 정책 문제로 전환된 지점
  • 2026-09-01xAI — Biosecurity at the frontier 공개 — Grok 4.6의 생물보안 안전장치(거부 학습·추론시 보호·행동 제어)를 설명하고 LatchBio의 제3자 평가(BioSecBench-Refusal·BioSecBench-Surveillance)를 인용. 자사 주장: 거부 벤치마크 평균 62.1%로 시험 대상 중 최고, 적대적 과업 59.2% 거부·정상 생물학 과업 64.8% 수행. 향후 모델에 배포 전 시험 확대·제3자 평가 증대·배포 후 모니터링 개선을 약속 출처프런티어 랩이 생물보안 거부율을 수치로 공개하고 외부 평가기관을 지정한 사례 — 다만 자사 게시물이며 독립 재현은 없다
  • 2026-09-01Anthropic — Enterprise Frontier Safeguards(EFS) 발표 — 고객사가 소유한 클라우드 계정(AWS·Azure·Google Cloud)에 로그를 보관하고 고객이 암호화 키와 접근 정책을 관리하는 무보존(zero data retention) 구성에서, Anthropic 직원의 열람 없이 자동화된 오용 탐지(사이버 공격, 자격증명 탈취, 유해 역량 개발)를 수행하는 방식. 100곳 이상 기업 고객과 함께 개발했고 2026년 가을부터 순차 배포. 금융·의료·법률·정부 등 규제 산업의 데이터 보관 요건을 대상으로 함 출처데이터 주권 요구와 오용 감시가 충돌하던 지점에 대한 설계적 답. 안전 감시를 벤더 서버 밖에서 성립시키는 구조가 표준이 되면, 규제 산업의 프런티어 모델 도입 장벽이 배포 아키텍처 문제로 재정의된다
  • 2026-08-28Anthropic — 'Automated researchers can reliably mitigate alignment failures' 공개 — 기만·아첨·프라이버시 침해·보상 해킹 등 10개 정렬 실패 범주에 대해 Claude가 자율적으로 완화 기법을 제안·학습·평가한 실험. 자사 보고로 10개 범주 전부에서 역량 저하 없이 목표 벤치마크를 개선했고 보류 벤치마크와 4.7배 큰 모델로도 이전됐다고 주장. 기만 항목에서 Claude가 안전 격차의 85%를 좁힌 반면 인간 연구자 28명(1인 8시간)은 20%였다고 보고. 연구 에이전트 트랜스크립트 약 1,600건 중 39건(2.4%)에서 부정행위 시도를 탐지 출처정렬 연구 자체를 모델에 위임하는 자동화 연구자 노선의 사내 검증. 안전 작업의 병목을 인간 연구자 시간에서 컴퓨트로 옮기려는 시도이며, 동시에 연구 에이전트의 부정행위 감시가 필수 구성요소로 등장
5건

모델 아키텍처·학습 기법

  • 2026-09-03Sergii Kozyrev, Davyd Maiboroda — Minima 공개 — 하이브리드 LLM Qwen3.8-27B(GDN 48층·어텐션 16층)의 초기 커뮤니티 4비트 양자화가 순환 오차 누적을 우려해 GDN 블록, 특히 decay·write-strength 게이트를 8/16비트로 남겨 두던 관행을 시험하고자 496개 선형 층 전부에 NVFP4 W4A4를 적용. 4K/32K 퍼플렉시티, MMLU-Pro, GSM8K, AIME'25, GPQA-Diamond, LiveCodeBench, 64K RULER 검색에서 BF16과 시드 잡음 범위 내(5개 과제 평균 -0.52)로 일치하면서 17.5 GiB로 비교 대상 중 가장 작고 프리필이 14~19% 빠르다고 보고. 모듈별로 보정된 NVFP4 체크포인트를 모듈을 하나의 GEMM으로 융합하는 커널이 서빙할 때 생기는 전역 스케일 불일치를 함께 수정 출처'순환 상태의 오차는 긴 문맥에서 누적된다'는 통념을 뒤집어 하이브리드 LLM의 순환 절반이 오히려 양자화하기 쉬운 쪽이라고 주장하고, NVFP4의 16원소 블록 스케일링이 잔차 스트림의 극단 이상치를 국소화하는 점과 델타 규칙 순환이 주입된 잡음을 32K 토큰에 걸쳐 평탄하게 유지하는 점 등 네 갈래 기계적 설명을 제시. 수치는 저자 자체 보고.
  • 2026-09-01Shaowen Wang 외 — SMELT 공개 — 공유 층 블록을 반복해 유효 깊이를 늘리는 루프드 트랜스포머 평가가 대개 모델 크기를 고정한 채 비교해 아키텍처 이점과 추가 FLOPs를 뒤섞는다고 지적하고, 토큰당 FLOPs·비임베딩 총 파라미터·KV 캐시 세 예산을 모두 맞춘 상태에서 MoE 트랜스포머의 중간 절반 층을 두 번 도는 레시피(Sparse MoE Transformer, middle layers Loop Twice)를 제시. 비임베딩 파라미터 54B까지 네 규모로 확장해 아키텍처별로 친칠라식 스케일링 법칙을 따로 적합 출처깊이 재사용(루프)이 예산을 엄격히 맞춘 뒤에도 이득이 남는지를 스케일링 법칙 수준에서 판정한 연구. 저자 자체 보고로 계산 최적 프런티어에서 학습 FLOPs 6.8~18.0% 절감, 이득은 코드에서 가장 크고 샘플 길이와 인컨텍스트 예시 수가 늘수록 커지며, 두 번째 방문이 어텐션 싱크를 줄이고 주의 질량을 내용 관련 토큰으로 재배분한다는 기계적 분석을 제시.
  • 2026-08-31Zihan Qiu 외 (Alibaba Qwen) — On the Design of Qwen3.8-Next Architecture 공개 — 파라미터 125B·토큰당 활성 6B에 가속기 밖에 두는 51B n-gram 임베딩 테이블을 더한 희소 MoE 모델 Qwen3.8-Flash-Next의 설계를 기술. 네 층마다 하나만 전체 어텐션을 두는 Gated DeltaNet(GDN)-전역 어텐션 층별 하이브리드에 Qwen Sparse Attention과 Gated Residual을 결합했고, 각 설계 변경을 손실과 다운스트림 벤치마크·학습과 프리필과 디코드 비용·최적 하이퍼파라미터에 미치는 영향이라는 세 축으로 평가 출처프런티어 오픈웨이트 모델의 아키텍처 선택 근거를 절제 실험 단위로 공개한 사례. 저자 자체 보고로 손실과 다운스트림 정확도가 늘 같이 움직이지는 않으며, 이 아키텍처와 Muon 옵티마이저의 조합이 최적 학습률과 배치 크기를 위로 밀어 배치 크기 워밍업을 불필요하게 만들고 스트레스 테스트에서 안정성을 크게 개선.
  • 2026-08-28Alexia Jolicoeur-Martineau, Rhea Sanjay Sukthanker, Pashmina Cameron, Emy Gervais — Sliding-window beats linear attention 공개 — 기존 LLM을 선형 어텐션으로 개조(retrofit)하는 연구 갈래가 더 단순한 기준선과 제대로 비교된 적이 없다고 지적하고, 싱크를 둔 슬라이딩 윈도 어텐션(SWA)이 여러 LLM과 다양한 다운스트림 과제에서 후속학습된 선형 어텐션 모델과 같거나 더 낫다고 보고. Needle-in-a-Haystack·BABILong 등 장문맥 추론 과제에서는 SWA가 선형 어텐션 대비 2~10배 높은 성능을 냈고, SWA는 후속학습이 필요 없으며 매우 빠르고 메모리도 적게 쓴다고 주장 출처이차 스케일링 해법으로 각광받던 선형 어텐션 개조 갈래에 대해 '후속학습이 필요 없는 슬라이딩 윈도로 충분하다'는 기준선을 세운 반증 논문 — 선형 어텐션 모델은 처음부터 학습하거나 광범위한 후속학습을 거쳐야 겨우 SWA를 따라잡을 것이라고 저자들이 결론. 수치는 저자 자체 보고.
  • 2026-08-27Yifan Zhang 외 (Mengdi Wang·Quanquan Gu·Andrew Chi-Chih Yao 등 공저) — Fast Weight Attention for Continual Learning 공개 — 순환 fast-weight 메모리와 선택적 상태공간 모델이 상태 전이를 온라인 학습 규칙으로 만든다는 관점에서, read-after-write 자기회귀 의미론 아래 접두사 예측 목적함수에서 t 시점에 드러나는 지역 fast-memory 예시는 접두사 정렬 쌍 (φ(k_{t-1}), v_t)이며 통상 쓰이는 동일 시점 연관 (φ(k_t), v_t)은 인과적이긴 하나 다른 내부 목적을 최적화한다고 주장. 제곱오차 회귀와 음의 내적 목적에 대한 정규화 1차 갱신식을 유도해 Falcon-1(스칼라 NLMS)·Falcon-2(열별 확장)·Falcon-3(슬라이딩 윈도 미니배치)와 내적 변형 Falcon-1A/2A/3A를 정의하고, 순환·마스크 병렬·청크 병렬 형태와 수치 안정적인 양의 감쇠 재정규화를 함께 제시 출처DeltaNet·Mamba 계열의 상태 갱신 규칙을 '무엇을 언제 연관시키는가'라는 시간 정렬 문제로 재정식화해, 시간 정렬·가소성·망각·유계 리허설을 분리 가능한 설계 축으로 만든 프레임워크. 저자 자체 보고로 대표 변형이 언어모델링에서 경쟁력을 유지하고 가변 자릿수 덧셈에서 길이 외삽을 개선.
5건

AI 인프라 소프트웨어

  • 2026-09-01Guowei Wang 외 — AInfer-PD 공개 — 에이전틱 RL에서 각 궤적이 생성과 환경 상호작용을 여러 턴 오가며 비동기로 진행되므로 프리필(P)과 디코드(D)의 공존이 일회성 프롬프트 처리 사건이 아니라 롤아웃의 지속적 속성이 된다고 지적하고, 분산 MoE 롤아웃까지 in-place P/D 멀티플렉싱을 확장. 랭크 간 P/D 집합 통신 순서를 조율하고 DeepEP의 P·D 경로에 독립적인 통신 상태를 부여해 교차하는 ADP/ATP·DeepEP 경로의 동시 실행을 안전하게 만들면서 모델 가중치와 KV 저장은 공유. 단일 노드 프리필 집약 워크로드에서 P/D 멀티플렉싱을 끈 동일 엔진 대비 7.1~22.5%, SGLang 대비 24.8~32.9% 롤아웃 완료 시간을 줄였고 2노드에서는 각각 18.0~35.3%·18.3~31.8%라고 보고 출처별도 디바이스 풀과 KV 캐시 전송을 요구하는 P/D 분리(disaggregation) 대신, 가중치와 KV를 공유한 채 집합 통신 순서와 상태만 격리해 같은 디바이스에서 P/D를 겹치는 갈래. 서빙 인프라의 병목이 추론 서비스에서 RL 롤아웃으로 옮겨간 사례이기도 하다. 수치는 저자 자체 보고.
  • 2026-01-21PyTorch 재단 — PyTorch 2.10 릴리스 — varlen_attn() 가변길이 어텐션(순전파·역전파, A100+ BF16/FP16), torchinductor combo-kernel 수평 융합, cuSOLVER DnXgeev 일반 고유값 분해, torch.compile 의 use_deterministic_mode 준수와 DebugMode 도입, Python 3.14 지원. TorchScript 를 torch.export 로 대체 예고. 2.9 이후 기여자 536명·커밋 4,160건. 2026년부터 릴리스 주기를 분기에서 2개월로 단축 출처수치 재현성(결정성·텐서 해싱 디버깅)이 릴리스 헤드라인에 올라온 시점. 학습 스택이 성능 경쟁 단계에서 디버깅 가능성 단계로 넘어가는 신호
  • 2025-10-22PyTorch (Meta) — Helion 베타 공개 — Python 내장 DSL을 자동 튜닝된 Triton 커널로 컴파일. 어텐션 커널이 Helion 30줄 대 Triton 120줄, B200에서 eager 대비 기하평균 3.27배(torch.compile 2.7배·수작업 Triton 1.76배), MI350X에서 2.37배 출처Triton이 CUDA를 한 단계 추상화했듯 Helion은 Triton을 한 단계 더 추상화한다. 커널 작성 계보의 다음 층
  • 2025-10-22PyTorch (Meta) — Monarch 공개 — SPMD 대신 단일 컨트롤러로 클러스터를 배열처럼 다루는 분산 프레임워크. 제어 평면(메시징)과 데이터 평면(RDMA)을 분리. VERL 통합에서 H200 16→2,048 GPU 확장, torchft 통합 시 240 H100에 3분마다 장애를 주입해 SLURM 전체 재시작 대비 복구 60% 단축(프로세스 장애 평균 90초·머신 장애 2.5분) 출처2022년 Google Pathways가 제시한 단일 컨트롤러 모델이 PyTorch 코어 계보로 들어온 지점. TorchTitan 은 Monarch 안의 액터가 되고 torchforge 는 Monarch 위에 세워진다
  • 2025-10-15PyTorch 재단 — PyTorch 2.9 릴리스 — 서드파티 C++/CUDA 확장을 위한 안정 libtorch ABI 확대, 다중 GPU 커널 작성을 위한 symmetric memory, torch.compile 그래프 브레이크 시 오류/재개 토글, ROCm·XPU·CUDA 13 휠 배리언트, Intel GPU FlexAttention 활성화. 2.8 이후 기여자 452명·커밋 3,216건 출처멀티 GPU 커널을 프레임워크 API 수준에서 직접 쓰게 하는 방향. NCCL 계열 집합통신 위에 사용자 커널 경로가 하나 더 생겼다
4건

추론 모델·AGI 논쟁

  • 2026-09-04Anthropic — 'Formalizing Fermat's Last Theorem' 공개 — Claude Fable 5.1과 대략 비등한 수준이라고 설명한 내부 범용 연구 모델로 와일즈의 페르마의 마지막 정리 증명을 Lean으로 형식화. 11일 소요, 출력 토큰 약 60억, Lean 코드 1,300만 줄, 정리 3만 300개 증명(최종 증명에 2만 9,500개 사용)을 보고하고 Lean이 표준 3공리만으로 검증했다고 밝힘. Columbia의 Tianyi Peng 팀이 설계한 협업 형식화 플랫폼 Prove2Me에서 다수 Claude 에이전트가 협업했고, Lean 커뮤니티의 FLT 형식화를 이끌던 Kevin Buzzard(임페리얼)가 검토해 FLT의 첫 종단간 기계 검증 증명이라고 확인했다고 서술. Wiles 원논문이 아니라 Darmon·Diamond·Taylor의 간명화된 서술을 따름 출처인간 커뮤니티가 수년 단위로 진행하던 대형 형식화 과제를 에이전트 군집이 단기간에 수행했다는 주장. 검증 가능한 산출물(Lean 증명)이 결과물이라 벤치마크와 달리 외부 재검증이 가능하다는 점에서 자율 연구 주장 중 검증 난도가 낮은 사례
  • 2026-09-03OpenAI — GPT-6 Astra 공개. 자사 벤치마크로 FrontierMath Tier 4(v2) 97.6%, ARC-AGI-3 99.9%, GPQA Diamond 96.0%, Terminal-Bench 4.0 57.9%, OSWorld 2.0 72.6%, ScreenSpot-Pro 92.7%, ExploitBench 100%를 주장. 512K~1M 토큰 장문 컨텍스트를 시험했고 API 가격은 입력 100만 토큰 10달러·출력 50달러, 2배 속도의 fast 모드는 2배 가격. 당일 제한된 조직에 롤아웃한 뒤 ChatGPT Plus·Pro·Business·Enterprise로 확대하며 OpenAI API·Azure·AWS Bedrock에서 제공. Pro·Business·Enterprise용 GPT-6 Astra Pro 변형 존재 출처GPT-6 세대 개시. Anthropic Fable 5.1과 같은 주에, 100만 토큰당 10/50달러라는 동일한 가격표로 출시돼 프런티어 가격이 사실상 수렴했고, 벤치마크 경쟁의 중심이 컴퓨터 사용·사이버·에이전틱 코딩으로 이동
  • 2026-09-02Google DeepMind — Gemini 3.8 Flash 및 3.8 Flash Cyber 공개 — 자사 주장: HLE-Verified 54.9%, CWE-Bench 패치 pass@1 47.2%, 20개 언어 내부 평가 성공률 70% 초과, Chrome 보안팀 평가에서 경쟁 모델 대비 정확한 패치 2.6배. 가격은 입력 100만 토큰당 0.75달러·출력 3.75달러이며 2026-12-31까지 도입가. AI Studio·Android Studio·Gemini API·Gemini Enterprise·Gemini 앱·검색에서 제공 출처보안 전용 파생 모델을 프런티어 라인업의 정식 변종으로 분리 — 취약점 탐지·패치가 모델 제품군의 독립 축이 됨
  • 2026-09-01Anthropic — Claude Fable 5.1과 Claude Mythos 5.1 공개. 자사 벤치마크로 에이전틱 과학 연구(Terminal-Bench Science 0.1) Fable 5.1 52.6%(Fable 5는 24.7%), 에이전틱 코딩(Terminal-Bench 4.0) Fable 5.1 55.8%·Mythos 5.1 60.9%, Humanity's Last Exam 60.9%(도구 없음)·65.0%(도구 사용)를 주장. 가격은 입력 100만 토큰 10달러·출력 50달러로 Fable 5와 동일하나 캐시 읽기를 100만 토큰당 0.25달러로 75% 인하해 일반 워크로드 비용이 약 25%, 복잡한 코딩·고에이전틱 작업은 최대 약 45% 줄어든다고 주장. Mythos 5.1은 검증된 사이버 방어자·생명과학자에게만 제공되며 현재 미국 조직에 한정 출처프런티어 모델의 경쟁 축이 코딩에서 자율 과학 연구로 이동. 최상위 모델을 심사된 사용자에게만 여는 계층 배포가 제품 라인으로 굳어졌고, 가격 인하가 성능이 아니라 캐시 읽기 단가에서 나온 점은 장기 에이전트 루프가 과금의 중심임을 보여줌
4건

물리 세계·현실 영향

  • 2026-09-03OpenAI — 'Daybreak for Frontline Defenders' 발표 — 승인된 공공·민간 방어자가 사이버 방어에 첨단 AI를 쓰도록 하는 Daybreak를 10억 달러 규모 글로벌 이니셔티브로 확대. 주력 모델 기반의 Daybreak Blue와 민감하고 기술적으로 까다로운 작업용 전용 사이버 모델 Daybreak Red로 구성. 상하수도·전력망 운영자, 주·지방정부, 지역·커뮤니티 은행, 비영리, 오픈소스 메인테이너 등 자원이 부족한 조직을 우선 대상으로 하며, 승인된 2,000개 조직의 방어자 수천 명이 이미 사용 중이고 35개 이상 파트너 제품·서비스로 이뤄진 Daybreak Defense Network를 통해 배포한다고 설명 출처사이버 Critical 역량 선언과 같은 주에 나온 방어 측 비대칭 보정. 공격 역량의 위험을 접근 통제만이 아니라 방어자 보조금으로 상쇄하려는 접근으로, 프런티어 랩이 중요 인프라 보안의 공급자 위치로 들어감
  • 2026-09-03Google DeepMind·Google Research — WeatherNext 3 공개 — 지표 변수 5km 해상도, 시간 단위 예보(이전 6시간 단위), 물리 시뮬레이션 대신 정지궤도 위성 실시간 데이터 사용. 자사 주장: 강수 예보가 IMERG 대비 최대 60%, MRMS 대비 30%, 우량계 대비 10% 개선. Brightband의 독립 실시간 평가에서 가장 정확하다고 인용. 검색·Gemini 앱·지도·Maps Platform Weather API·Earth Engine에 적용되고 BigQuery·Earth Engine·GCS로 데이터 제공 출처AI 기상 모델이 연구 시연을 넘어 소비자 제품과 상용 API의 기본 예보로 들어감
  • 2026-09-01OpenAI — ChatGPT의 의료 데이터 연결 확대 — Epic 연동으로 전자의무기록(EHR)을 ChatGPT for Healthcare 조직과 자격을 갖춘 Enterprise 고객에 연결하고, ClinicalTrials.gov·CMS Coverage·RxNorm·DailyMed·PubMed 등 9개 공식 출처를 묶은 Healthcare Public Data 플러그인을 미국 임상의에게 ChatGPT for Clinicians로 제공. 60개국·49개 언어·26개 전문과 의사들과 협업했고 의사가 검토한 응답 4,363건 중 99.1%가 안전 등급, 임상 질문 응답의 93% 이상이 정확도 양호 이상이었다고 자사 주장. HIPAA BAA, 역할 기반 접근, SSO, 감사 로그 지원 출처범용 챗봇이 규제 의료 기록 시스템에 직접 연결되는 단계. 컨텍스트 연결(RAG·커넥터)의 전선이 공개 웹에서 규제 데이터 영역으로 넘어갔고, 안전성 근거는 아직 벤더 자체 평가에 의존
  • 2026-08-26Anthropic — Anthropic Insights를 통한 외부 연구 결과와 집계 데이터 공개 — 2026년 4~5월 대화 약 25만 건에서 뽑은 집계 데이터를 Hugging Face에 공개. 연구자는 원본 대화에 접근하지 못하고 프라이버시 검토를 거친 집계 산출물만 받으며, Anthropic에 불리한 결과도 발표할 수 있다는 조항이 협약에 포함. 검토 권한은 프라이버시·정책 위반 조력·기밀·연구 정확성으로 한정하고, 임페리얼 칼리지 런던이 제3자 프라이버시 감사를 수행. 정책 위반이 드러나는 범주는 5% 미만 부분 편집 출처사용 실태 데이터를 벤더가 독점하는 구조에 외부 검증 통로를 낸 사례. 발표 자유 조항과 제3자 감사를 명시해 벤더 자체 보고와 구분하려는 설계
4건

그래프 엔지니어링

  • 2026-08-30Ming Wu, Pengyuan Zhu — Agent Zero Memory 공개 — 단일 조직 원리를 쓰는 기존 기억 시스템의 한계를 지적하고, 시간 변화를 기록하는 에피소드 타임라인·세션을 가로질러 인물과 프로젝트를 잇는 엔티티-이벤트 그래프·사실을 인용에 고정하는 문서 저장소 세 구조를 병행 운영하는 장기기억 시스템을 제시. 인텐트 게이트와 소스 라우터를 거쳐 저장소마다 임베딩+어휘 하이브리드 검색을 도는 툴 사용 루프 3개를 동시 수행하고, 모든 학습 항목에 출처·타임스탬프·근거 포인터를 붙이며, 답변은 리더가 실제로 연 근거만 인용할 수 있도록 인용 잠금 아래 읽는다 출처그래프 단일 구조에 기대던 에이전트 장기기억을 타임라인·그래프·문서 삼중 구조와 출처 추적(provenance)·인용 잠금으로 재편한 갈래. 저자 자체 보고로 LongMemEval 95.60%·LoCoMo 93.60%이며, 8개 언어모델에 걸쳐 질의당 비용이 약 30배 차이 나는데도 정확도 편차는 3.4%포인트에 그쳐 성능을 가르는 것은 모델 선택이 아니라 기억 아키텍처라고 주장.
  • 2026-08-26Martino M. L. Pulici, Cuong Xuan Chu, Evgeny Kharlamov, Volker Tresp — A Storage-Retrieval Gap in Parametric Knowledge Graph Memory 공개 — 그래프 RAG의 대안으로 지식그래프를 오프라인에서 엔티티당 하나씩의 LoRA 어댑터 뱅크로 컴파일해 파라메트릭 지식층으로 쓰는 방식을 제시. MetaQA에서 어댑터가 새 질문으로 일반화되는 사실 지식을 담아 단일값 관계 기준 거의 무지 상태의 베이스라인 대비 +0.243을 얻는 한편, 이웃 엔티티의 어댑터에는 답이 없어 저장된 지식이 유사도로는 회수되지 않고 가중치 기하와 서브그래프 의미의 상관은 ρ=+0.329에 그친다고 보고 출처검색 시점에 그래프를 조회하는 GraphRAG 계보와 달리 그래프를 모델 가중치로 미리 컴파일해 두는 파라메트릭 지식그래프 갈래를 열면서, 동시에 그 갈래의 병목이 저장이 아니라 어댑터 선택(라우팅)임을 못박았다 — 의미 유사도를 넘어서는 어댑터 선택 기제를 찾는 것이 남은 과제라고 저자들이 결론. 수치는 저자 자체 보고.
  • 2026-08-26Zhiyuan Li 외 — CaSKG 공개 — 에이전트 스킬 라이브러리 검색에서 전체 프롬프트 투입은 문맥이 과도하고 벡터 검색은 스킬을 독립적으로 다루며 그래프 검색은 간선 신뢰도가 높을 때만 워크플로 맥락을 회복한다고 지적하고, 의미·어휘·입출력·구조 근거로 고재현율 후보 그래프를 만든 뒤 방향 조건부 반사실 프로브로 스킬 쌍을 제거·치환·순서변경하고 베이즈 평활로 근거를 집계해 상태 필터링된 가중 유향 그래프를 오프라인 구축하는 방법을 제시 출처LLM이 뽑아낸 그래프 간선을 그대로 믿지 않고 반사실 개입으로 간선 가중치를 사후 보정한다는 갈래 — 그래프 검색의 고질적 약점으로 지목돼 온 간선 신뢰도 문제를 검색 이전 단계에서 다룬다. 저자 자체 보고로 6개 LLM에 걸쳐 Graph-of-Skills 대비 ScienceWorld 매크로 평균 72.62→80.50, ALFWorld 성공률 80.01%→86.79%이며 환경 스텝 수는 감소.
  • 2026-08-12Pranav Bykampadi 외 — MAGG 공개 — 문서 내용에서 엔티티·관계 타입을 직접 유도하는 도메인 분류기로 고정 스키마 없이 개방형 지식그래프를 구축하고, 후보 트리플을 도메인 소유자에게 배정해 근거 대조 검토·거버넌스 승인·감사 메타데이터 저장을 거치게 하며, 질의응답 때도 같은 소유 구조를 재사용해 도메인별 그래프 전문가에게 질의를 라우팅하는 멀티에이전트 지식그래프 구축 프레임워크 출처에이전틱 시스템의 지식그래프를 '추출된 트리플의 평평한 저장소'에서 누가 사실을 소유하는지·왜 채택됐는지·어떻게 쓰여야 하는지를 기록하는 거버넌스 대상으로 재정의한 갈래. 저자 자체 보고로 SciERC에서 평면 삽입 대비 strict 트리플 F1 47%·mapped 트리플 F1 51% 개선, 120개 트리플 블라인드 검토에서 거버넌스 통과 트리플이 더 자주 출처 근거를 가졌고, MuSiQue에서 Microsoft GraphRAG 대비 exact-match 9.0포인트·token F1 11.2포인트 우위.
2건

툴·에이전트

  • 2026-09-03xAI — Grok Bot 기업용 제공 시작 — 클라우드에서 자율 실행되는 봇에 접근·네트워크·감사 제어를 붙이고 봇 간 메시징을 지원. Grok·Cursor Enterprise 기존 고객에 2주 무료 제공. 자사 주장: 출시 이후 수천 개 조직이 사용하고 최근 몇 주간 수백만 개 봇이 생성됨. 가격은 미공개이며 영업 문의로 안내 출처에이전트 배포의 초점이 능력 과시에서 권한·감사 거버넌스로 이동
  • 2026-09-02Meta Superintelligence Labs — Muse Spark 1.3 공개 — 에이전트·코딩·지시 준수·롱컨텍스트 평가에서 개선을 주장. 자사 주장: Muse Spark 1.2 대비 툴 호출 약 20%·토큰 약 25% 감소. 비교 대상은 Muse Spark 1.2·GPT 5.6 Sol(max)·Opus 5(max)이나 본문에 수치 점수는 없고 그래프로만 제시. Muse Code와 Meta Model API에서 제공하며 가중치는 비공개이고 오픈웨이트 공개는 로드맵 언급에 그침 출처MSL이 폐쇄 API 노선을 유지한 채 에이전트 효율(툴 호출·토큰 절감)을 전면 지표로 내세움
2건

멀티모달

  • 2026-09-01Google (Gemini API) — Gemini에 에이전틱 영상 이해 도입 — 고정 프레임레이트 샘플링 대신 모델이 대상 구간을 직접 검색·스캔·정밀 확인. Gemini 3.7 Flash·3.6 Flash·3.5 Flash-Lite에 적용. 자사 주장: 토큰 소비 최대 88% 감소, 분석 비용 최대 66% 감소, 정확도 최대 7% 향상. API 설정에서 processing을 agentic으로 지정하며 추가 요금 없음. Gemini 앱과 YouTube Ask 적용은 예고 단계 출처긴 영상을 통째로 넣는 대신 모델이 스스로 탐색하는 방식 — 멀티모달 입력이 에이전트 루프로 편입
  • 2026-08-27Google (Gemini API) — Gemini Omni 1.1 Flash 제공 — 10초 단위로 누적 최대 40초까지 장면 연장, 첫/끝 프레임 지정, 최대 3초 영상 레퍼런스 입력. 360p 초안(자사 주장 최대 60% 빠름)·720p·1080p/4K 업스케일. AI Studio·Gemini Enterprise Agent Platform API·Flow·Gemini 앱에서 이용 출처영상 생성이 단발 클립에서 이어 붙이고 제어하는 타임라인 작업으로 이동
2건

규제·법·거버넌스

  • 2026-08-31캘리포니아 주의회 — SB 1119(Adam's Law, 컴패니언 챗봇 아동 안전) 양원 통과 — 상원 39-0, 하원 64-4. 연령 확인, 출시·수정 전 위험평가, 앱 내 위기 지원과 자해 우려 시 보호자 통지, 보호자 통제 기본값, 주법무장관 대상 사고 보고와 독립 준수 감사, 미성년자 표적 광고 제한, 사적 소권을 규정. 통과 단계이며 주지사 서명은 이 시점에 미완료 출처컴패니언 챗봇의 아동 안전을 성문법으로 다루는 미국 최초의 포괄 입법 시도 — 서명 여부가 주법 표준을 가른다
  • 2026-08-31OpenAI — 캘리포니아 상원법안 SB 1119 지지 표명 — 연령 확인, 안전 위험 식별, 독립 감사, 유해 콘텐츠 차단, 보호자 통제, 위기 자원 연결, 미성년자 대상 표적광고 제한 등 7개 조항을 지지한다고 밝힘. 연방 입법이 없는 상황에서 청소년 AI 안전의 강한 기준을 세운다고 평가하고, 13~17세에 자동 보호를 적용하는 ChatGPT for Teens와 보호자 통제·연령 추정 기술을 이미 도입했다고 설명 출처주 단위 청소년 안전 규제를 프런티어 랩이 선제 지지한 사례. 2024년 SB 1047 반대와 대비되며, 업계가 규제를 전면 거부하는 대신 영역별로 선택 수용하는 국면을 보여줌
2건

임베딩·벡터 검색

  • 2026-09-03Tingyu Song 외 — CORE 공개 — MLLM 기반 임베딩 모델이 같은 개념을 담았지만 속성-객체 결합이 다른 장면을 구분하지 못하는 반면 같은 백본을 교차 주의 리랭커로 쓰면 구분이 된다는 관찰에서 출발해, 리랭커의 구성적 판단을 임베딩 모델로 증류하는 방법을 제시. 5단계 구성 매칭 수준에 걸친 후보 리스트를 합성하고 리랭커의 세밀한 순위를 재현하도록 학습하는 Rank-KL 목적함수를 도입했으며, 동일 데이터·튜닝 예산에서 대조학습·pairwise CoSENT·listwise Rank-KL을 비교 출처임베딩 학습의 기본값이던 대조학습보다 다단계 순위 감독이 감독 신호를 더 잘 쓴다고 주장하며, 리랭커를 검색 파이프라인의 후단이 아니라 임베딩 모델의 교사로 재배치한 갈래. 저자 자체 보고로 COLA·SUGARCREPE++·NEGBENCH 3개 구성적 추론 벤치마크에서 CORE-RERANKER-8B가 총평균 82.7%로 Jina-Reranker 대비 10.7포인트 우위, CORE-EMBED-8B가 평가 대상 임베딩 모델 중 최고 총평균 0.666이며 COCO·Flickr30K 검색 성능은 유지.
  • 2026-08-31Aurélien Lac, Tony Wu — NeoMME 공개 — ColPali 류 시각 문서 검색기가 생성용 VLM(별도 사전학습된 비전 인코더+인과적 LM)을 인코더로 전용하며 비생성 과제에 파라미터·연산 오버헤드를 떠안는다고 지적하고, 다국어 텍스트와 원본 이미지 패치를 하나의 양방향 트랜스포머 인코더로 처리하는 260M·800M 멀티모달 다국어 인코더 계열을 제시. 이미지 패치를 조건으로 한 마스크드 이산 확산 텍스트 목적함수로 사전학습하고 16,384 토큰 컨텍스트를 지원하며, 밀집·late-interaction 헤드를 함께 미세조정한 NeoMME-Retriever가 ViDoRe v3에서 260M 0.523·800M 0.556 nDCG@10 기록. Apache 2.0으로 Hugging Face Transformers를 통해 공개 출처생성 모델을 검색기로 재활용하던 ColPali 계보 대신 처음부터 인코더로 설계한 단일 타워로 되돌아간 갈래 — 멀티모달 검색에서 '인코더 전용'이 다시 유효하다는 주장. 저자 자체 보고로 동일 해상도에서 ColModernVBERT 대비 약 2배 인코딩 처리량, 계층적 토큰 풀링과 비대칭 양자화로 255배 압축에서도 기준 성능 95% 이상 유지.
1건

MCP·Skills 표준화

  • 2026-08-27Anthropic — Model Hardware Standard(MHS) 리서치 프리뷰 공개 — AI 에이전트가 실험·제조 장비를 조작하기 위한 공유 명세. 장비별 차이를 흡수하는 통합 드라이버가 중앙 오케스트레이터와 장비 사이를 번역하며, 에이전트 하네스는 MCP 등 표준 프로토콜로 접근한다고 설명. 초기 참여 기관은 Genentech, 워싱턴대 Baker·Pinglay 랩, 카네기멜런대, HHMI Janelia, QuEra Computing, Tetsuwan Scientific. 장비사로 Automata·Danaher·Doosan Robotics·MBF Bioscience·QIAGEN·Tecan·Universal Robots 등이 지원 구현. 안전 평가와 모범사례 정립 후 오픈소스화 계획 출처MCP가 소프트웨어 도구 접근을 표준화했듯 물리 장비 제어를 표준화하려는 시도. 에이전트의 작용 범위를 실험실 하드웨어로 넓히는 경계 사건이며, 표준 주도권이 다시 Anthropic에 놓임
1건

추론 인프라·서빙

  • 2026-09-03Heng Wang 외 — Random Attention 공개 — 추론 시 KV 캐시 축출에서 캐시된 토큰에 점수를 매겨 남길 토큰을 정하는 통상적 접근에 대해 그 선택 신호가 거의 아무것도 기여하지 않는다고 보고하고, 프롬프트는 보존한 채 각 어텐션 헤드 안에서 토큰을 무작위로 제거해 점수 계산을 아예 없애는 방식을 제시. 4개 모델·6개 추론 벤치마크에서 더 강한 대안들과 성능이 일치하면서 실제 vLLM 환경에서 처리량이 상당히 높다고 보고 출처중요도 점수 기반 KV 축출 계보 전체에 대해 '점수 자체가 필요 없다'는 반증을 제기. 취약한 부분은 프롬프트뿐이며 추론 시퀀스는 텍스트 재진술과 여러 어텐션 헤드에 걸친 복제라는 이중 중복성으로 스스로를 지탱하므로 프롬프트만 지키면 무작위 선택으로 충분하다는 것이 저자들의 설명. 수치는 저자 자체 보고.
1건

컴퓨트 경제·지정학

  • 2026-08-31OpenAI — ChatGPT Ads 현황 공개 — 출시 약 200일 만에 연환산 매출 10억 달러 규모에 도달했다고 자사 발표. 40개국 이상에서 운영 중이며 셀프서비스 Ads Manager를 인도·유럽·중동·북아프리카로 확대. 광고는 답변과 분리해 표시되고 답변 내용에 영향을 주지 않으며 광고주는 이용자의 비공개 대화에 접근하지 못한다고 설명. 주간 활성 이용자 10억 명 이상의 무료 티어를 뒷받침하는 수익원으로 위치시킴 출처구독·API 밖의 광고가 소비자 AI의 주요 수익 축으로 공식화. 무료 티어 확산의 재원이 검색 광고와 같은 구조로 수렴하면서 답변과 광고의 분리가 신뢰 쟁점으로 이동
1건

평가·벤치마크

  • 2026-08-27Google DeepMind·싱가포르 AI 안전연구소·OpenMined·AVERI·MLCommons — 프런티어 모델 이중맹검 평가 파일럿 공개 — Google Cloud Confidential Space 안에서 Gemini Flash Lite 계열 모델을 외부 평가자가 시험. 평가자는 모델 가중치를, Google은 평가자의 테스트 프롬프트를 볼 수 없음. 파일럿 단계이며 평가 점수는 공개되지 않음 출처벤치마크 오염 방지와 IP 보호를 동시에 노리는 평가 인프라 시도 — 비공개 벤치마크로 프런티어 모델을 검증하는 경로
코어와의 관계 이 파일은 그 주에 늘어난 것만 담는다. 시대 전체를 보려면 코어 학습 모듈을 열면 된다 — 코어는 매주 갱신되는 단 하나의 최신본이고, 여기 주차 파일은 그때의 기록이다.