2026년 36주차 · 2026-08-31 ~ 2026-09-06
AI 두 개가 같은 주에,같은 값 으로 나왔어요. 뭐가 달라진 걸까요? 9월 첫째 주에 1차 출처로 확인한 사건 45개 중에서 고른 질문이에요. 답은 기록 안에 있고, 이해는 5분 수업에서 시작해요.
45 사건14 논문30 공식 발표1 정부 기록25 노트
GPT-6 세대 개시. Anthropic Fable 5.1과 같은 주에, 100만 토큰당 10/50달러라는 동일한 가격표로 출시돼 프런티어 가격이 사실상 수렴했고, 벤치마크 경쟁의 중심이 컴퓨터 사용·사이버·에이전틱 코딩으로 이동
프런티어 모델의 경쟁 축이 코딩에서 자율 과학 연구로 이동. 최상위 모델을 심사된 사용자에게만 여는 계층 배포가 제품 라인으로 굳어졌고, 가격 인하가 성능이 아니라 캐시 읽기 단가에서 나온 점은 장기 에이전트 루프가 과금의 중심임을 보여줌
컴패니언 챗봇의 아동 안전을 성문법으로 다루는 미국 최초의 포괄 입법 시도 — 서명 여부가 주법 표준을 가른다
이번 주 흐름 사건 사이를 잇는 이야기 — 제가 읽고 정리했어요.
가격 수렴 GPT-6 Astra와 Claude Fable 5.1이 같은 주, 100만 토큰당 10/50달러라는 같은 가격표로 나왔어요. 경쟁의 축이 성능에서 배포 조건으로 옮겨 가요.
에이전트의 고삐 Grok Bot 기업용, Enterprise Frontier Safeguards — 에이전트를 얼마나 잘 하느냐보다 권한과 감사를 어떻게 다느냐가 화두예요.
지키는 쪽의 AI 사이버 Critical 선언, Fairwind, Daybreak 10억 달러 — 공격 능력의 위험을 방어자 지원으로 상쇄하려는 움직임이 한 주에 몰렸어요.
이 주에 더한 조각 전부 기록과 정리 노트를 함께, 또는 따로.
모두 70 기록 45 정리 노트 25
2026년 9월 4일 Anthropic 인간 커뮤니티가 수년 단위로 진행하던 대형 형식화 과제를 에이전트 군집이 단기간에 수행했다는 주장. 검증 가능한 산출물(Lean 증명)이 결과물이라 벤치마크와 달리 외부 재검증이 가능하다는 점에서 자율 연구 주장 중 검증 난도가 낮은 사례
2026년 9월 3일 Tingyu Song 외 임베딩 학습의 기본값이던 대조학습보다 다단계 순위 감독이 감독 신호를 더 잘 쓴다고 주장하며, 리랭커를 검색 파이프라인의 후단이 아니라 임베딩 모델의 교사로 재배치한 갈래. 저자 자체 보고로 COLA·SUGARCREPE++·NEGBENCH 3개 구성적 추론 벤치마크에서 CORE-RERANKER-8B가 총평균 82.7%로 Jina-Reranker 대비 10.7포인트 우위, CORE-EMBED-8B가 평가 대상 임베딩 모델 중 최고 총평균 0.666이며 COCO·Flickr30K 검색 성능은 유지.
2026년 9월 3일 Google DeepMind·Google Resea AI 기상 모델이 연구 시연을 넘어 소비자 제품과 상용 API의 기본 예보로 들어감
2026년 9월 3일 OpenAI 사이버 Critical 역량 선언과 같은 주에 나온 방어 측 비대칭 보정. 공격 역량의 위험을 접근 통제만이 아니라 방어자 보조금으로 상쇄하려는 접근으로, 프런티어 랩이 중요 인프라 보안의 공급자 위치로 들어감
2026년 9월 3일 Sergii Kozyrev, Davyd Maibor '순환 상태의 오차는 긴 문맥에서 누적된다'는 통념을 뒤집어 하이브리드 LLM의 순환 절반이 오히려 양자화하기 쉬운 쪽이라고 주장하고, NVFP4의 16원소 블록 스케일링이 잔차 스트림의 극단 이상치를 국소화하는 점과 델타 규칙 순환이 주입된 잡음을 32K 토큰에 걸쳐 평탄하게 유지하는 점 등 네 갈래 기계적 설명을 제시. 수치는 저자 자체 보고.
2026년 9월 3일 Heng Wang 외 중요도 점수 기반 KV 축출 계보 전체에 대해 '점수 자체가 필요 없다'는 반증을 제기. 취약한 부분은 프롬프트뿐이며 추론 시퀀스는 텍스트 재진술과 여러 어텐션 헤드에 걸친 복제라는 이중 중복성으로 스스로를 지탱하므로 프롬프트만 지키면 무작위 선택으로 충분하다는 것이 저자들의 설명. 수치는 저자 자체 보고.
2026년 9월 3일 OpenAI GPT-6 세대 개시. Anthropic Fable 5.1과 같은 주에, 100만 토큰당 10/50달러라는 동일한 가격표로 출시돼 프런티어 가격이 사실상 수렴했고, 벤치마크 경쟁의 중심이 컴퓨터 사용·사이버·에이전틱 코딩으로 이동
2026년 9월 3일 xAI 에이전트 배포의 초점이 능력 과시에서 권한·감사 거버넌스로 이동
2026년 9월 2일 Google 공격·방어 이중용도 모델을 심사받은 방어자에게만 배포하는 접근 통제 방식의 제도화
2026년 9월 2일 Google DeepMind 보안 전용 파생 모델을 프런티어 라인업의 정식 변종으로 분리 — 취약점 탐지·패치가 모델 제품군의 독립 축이 됨
2026년 9월 2일 Meta Superintelligence Labs MSL이 폐쇄 API 노선을 유지한 채 에이전트 효율(툴 호출·토큰 절감)을 전면 지표로 내세움
2026년 9월 1일 Guowei Wang 외 별도 디바이스 풀과 KV 캐시 전송을 요구하는 P/D 분리(disaggregation) 대신, 가중치와 KV를 공유한 채 집합 통신 순서와 상태만 격리해 같은 디바이스에서 P/D를 겹치는 갈래. 서빙 인프라의 병목이 추론 서비스에서 RL 롤아웃으로 옮겨간 사례이기도 하다. 수치는 저자 자체 보고.
2026년 9월 1일 OpenAI 범용 챗봇이 규제 의료 기록 시스템에 직접 연결되는 단계. 컨텍스트 연결(RAG·커넥터)의 전선이 공개 웹에서 규제 데이터 영역으로 넘어갔고, 안전성 근거는 아직 벤더 자체 평가에 의존
2026년 9월 1일 Shaowen Wang 외 깊이 재사용(루프)이 예산을 엄격히 맞춘 뒤에도 이득이 남는지를 스케일링 법칙 수준에서 판정한 연구. 저자 자체 보고로 계산 최적 프런티어에서 학습 FLOPs 6.8~18.0% 절감, 이득은 코드에서 가장 크고 샘플 길이와 인컨텍스트 예시 수가 늘수록 커지며, 두 번째 방문이 어텐션 싱크를 줄이고 주의 질량을 내용 관련 토큰으로 재배분한다는 기계적 분석을 제시.
2026년 9월 1일 Anthropic 데이터 주권 요구와 오용 감시가 충돌하던 지점에 대한 설계적 답. 안전 감시를 벤더 서버 밖에서 성립시키는 구조가 표준이 되면, 규제 산업의 프런티어 모델 도입 장벽이 배포 아키텍처 문제로 재정의된다
2026년 9월 1일 xAI 프런티어 랩이 생물보안 거부율을 수치로 공개하고 외부 평가기관을 지정한 사례 — 다만 자사 게시물이며 독립 재현은 없다
2026년 9월 1일 OpenAI 자사 위험 프레임워크의 최고 등급이 실제로 발동된 첫 사례. 선언적 임계값이 배포 지연과 접근 제한이라는 구체적 조치로 이어졌는지를 검증할 기준점이며, 프런티어 사이버 역량이 정책 문제로 전환된 지점
2026년 9월 1일 Google (Gemini API) 긴 영상을 통째로 넣는 대신 모델이 스스로 탐색하는 방식 — 멀티모달 입력이 에이전트 루프로 편입
2026년 9월 1일 Anthropic 프런티어 모델의 경쟁 축이 코딩에서 자율 과학 연구로 이동. 최상위 모델을 심사된 사용자에게만 여는 계층 배포가 제품 라인으로 굳어졌고, 가격 인하가 성능이 아니라 캐시 읽기 단가에서 나온 점은 장기 에이전트 루프가 과금의 중심임을 보여줌
2026년 8월 31일 정리 노트 Herdr는 Orca보다 훨씬 가벼운 원격 터미널 서버로, 터미널만 있으면 리눅스 VM에도 쉽게 설치되고 Ghostty를 꺼도 세션이 그대로 살아 있다. 이를 Grok Bot의 가상 머신에 얹으면 맥북 전원과 무관하게 스마트폰만으로 코딩 에이전트를 상
2026년 8월 31일 정리 노트 이순신 명량대첩을 소재로 1분짜리 시네마틱 비디오를 만드는 과정에서 배울 점은 프롬프트를 바로 넣지 않는 순서다. 먼저 명량대첩이라는 주제와 생성 툴의 사용법을 각각 리서치시켜 컨텍스트를 채운 뒤, 두 결과를 합쳐 초 단위 화면 기획이 담긴 툴 전용
2026년 8월 31일 HUMAIN·Qualcomm 사우디 국부펀드 계열사가 온디바이스 AI PC를 주권 AI 스택의 단말로 내세움 — 로컬 추론이 지정학적 조달 품목이 되는 국면
2026년 8월 31일 Aurélien Lac, Tony Wu 생성 모델을 검색기로 재활용하던 ColPali 계보 대신 처음부터 인코더로 설계한 단일 타워로 되돌아간 갈래 — 멀티모달 검색에서 '인코더 전용'이 다시 유효하다는 주장. 저자 자체 보고로 동일 해상도에서 ColModernVBERT 대비 약 2배 인코딩 처리량, 계층적 토큰 풀링과 비대칭 양자화로 255배 압축에서도 기준 성능 95% 이상 유지.
2026년 8월 31일 OpenAI 주 단위 청소년 안전 규제를 프런티어 랩이 선제 지지한 사례. 2024년 SB 1047 반대와 대비되며, 업계가 규제를 전면 거부하는 대신 영역별로 선택 수용하는 국면을 보여줌
2026년 8월 31일 캘리포니아 주의회 컴패니언 챗봇의 아동 안전을 성문법으로 다루는 미국 최초의 포괄 입법 시도 — 서명 여부가 주법 표준을 가른다
2026년 8월 31일 OpenAI 구독·API 밖의 광고가 소비자 AI의 주요 수익 축으로 공식화. 무료 티어 확산의 재원이 검색 광고와 같은 구조로 수렴하면서 답변과 광고의 분리가 신뢰 쟁점으로 이동
2026년 8월 31일 Zihan Qiu 외 (Alibaba Qwen) 프런티어 오픈웨이트 모델의 아키텍처 선택 근거를 절제 실험 단위로 공개한 사례. 저자 자체 보고로 손실과 다운스트림 정확도가 늘 같이 움직이지는 않으며, 이 아키텍처와 Muon 옵티마이저의 조합이 최적 학습률과 배치 크기를 위로 밀어 배치 크기 워밍업을 불필요하게 만들고 스트레스 테스트에서 안정성을 크게 개선.
2026년 8월 30일 정리 노트 Claude Code에서 좋은 프롬프트를 쓰는 사람은 실력이 아니라 프롬프트 마스터라는 스킬 하나를 설치했을 뿐이라는 것이 이 짧은 클립의 요지다. 최소한의 입력만 줘도 건드릴 파일, 출력 형식, 멈춰야 할 시점까지 채운 완성된 프롬프트로 바꿔 주고,
2026년 8월 30일 정리 노트 Anthropic의 /design 스킬은 텍스트 대화로만 디자인을 반복 수정하던 비효율을 겨냥한 기능이다. 애플 기기 리셀 사이트처럼 색상 체계가 정해지지 않은 상태라면 무드보드 3안을 먼저 만들게 요청하는 식으로, 스킬이 세부 질문을 단계별로 던지도
2026년 8월 30일 정리 노트 400개 이상의 프로덕션 에이전트 경험에서 정리됐다는 12-레이어 스택은, 가상의 응급실 트리아지 에이전트에서 각 레이어를 boolean 플래그로 켜고 끄며 실패를 재현하는 방식으로 이해하면 명확하다. 데이터 이해 레이어가 없으면 알레르기 필드가 누락
2026년 8월 30일 Ming Wu, Pengyuan Zhu 그래프 단일 구조에 기대던 에이전트 장기기억을 타임라인·그래프·문서 삼중 구조와 출처 추적(provenance)·인용 잠금으로 재편한 갈래. 저자 자체 보고로 LongMemEval 95.60%·LoCoMo 93.60%이며, 8개 언어모델에 걸쳐 질의당 비용이 약 30배 차이 나는데도 정확도 편차는 3.4%포인트에 그쳐 성능을 가르는 것은 모델 선택이 아니라 기억 아키텍처라고 주장.
2026년 8월 29일 정리 노트 구글시트에 탑재된 Gemini는 단순 질의응답에서 2026년 4월 수식·피벗·차트 생성, 6월 한국어 지원, 8월 시트 캔버스(미니앱 생성)까지 네 단계로 발전했다. 매출·비용 데이터 4,800행을 두고 수식을 직접 짜는 대신 지표 이름과 의미만 설명
2026년 8월 29일 정리 노트 에어비앤비 숙소 리서치를 예제로 그래프 엔지니어링을 끝까지 구현하는 순서는 다음과 같다. 그래프를 통째로 돌리기 전에 강남구 한 지역만으로 파이프라인 하나를 엔드투엔드로 검증하고, run ID 아래 마크다운·로우·로그 세 폴더로 상태를 나눠 관리하는
2026년 8월 29일 정리 노트 Claude Code 요금은 토큰으로 표시되지만 실제 비용은 GPU 추론 시간이고, 토큰 단가는 모델 크기·입력/출력 방향·캐시 여부로 정해진다. 입력(프리필)은 병렬 처리되지만 출력(디코드)은 순차 생성이라 출력 단가가 약 5배 비싸고, 보이지 않는
2026년 8월 29일 정리 노트 미국 버지니아·조지아처럼 데이터센터 유치를 일자리와 세수로 반겼던 지역들이 실제로는 상주 인력이 100명도 안 되고 전기·수도 부담만 커지는 것을 겪으며 반대 여론으로 돌아섰다. 국가 경쟁력을 위해 데이터센터를 적기에 지어야 하는데 정작 내 동네만은
2026년 8월 29일 정리 노트 인간 뇌는 약 20와트로 작동하지만 AI 슈퍼컴퓨터는 2000만 와트를 쓴다는 대비에서 출발해, 그 격차의 근원을 1945년식 폰노이만 구조의 처리장치·메모리 분리로 짚는다. 딥러닝 워크로드 에너지의 80% 이상이 연산이 아니라 데이터 이동에 소모된다
2026년 8월 28일 정리 노트 같은 과제라도 코딩 에이전트를 하나로 쓸지 나눌지에 따라 성적이 80% 넘게 오르기도, 70%가 깎이기도 한다. Anthropic의 리서치 기능은 병렬 분할로 90% 넘게, 재무 분석 학계 실험은 80.8% 좋아졌지만, 순서대로 진행해야 하는 계획형
2026년 8월 28일 정리 노트 사이버보안 기업 크라우드스트라이크와 옥타가 실적 발표 후 각각 20%, 28%대 급등하며 신고가를 기록한 배경에는 옥타가 내세운 새 서사가 있다. 기존에는 직원 한 명당 계정 하나만 관리하면 됐지만, 이제 직원 한 명이 수십~수백 개의 에이전트를 만들
2026년 8월 28일 Alexia Jolicoeur-Martineau, 이차 스케일링 해법으로 각광받던 선형 어텐션 개조 갈래에 대해 '후속학습이 필요 없는 슬라이딩 윈도로 충분하다'는 기준선을 세운 반증 논문 — 선형 어텐션 모델은 처음부터 학습하거나 광범위한 후속학습을 거쳐야 겨우 SWA를 따라잡을 것이라고 저자들이 결론. 수치는 저자 자체 보고.
2026년 8월 28일 Anthropic 정렬 연구 자체를 모델에 위임하는 자동화 연구자 노선의 사내 검증. 안전 작업의 병목을 인간 연구자 시간에서 컴퓨트로 옮기려는 시도이며, 동시에 연구 에이전트의 부정행위 감시가 필수 구성요소로 등장
2026년 8월 27일 정리 노트 AI 엔지니어링의 핵심 스킬은 프롬프트(2022)→컨텍스트(2024)→하네스(2025년 후반)→루프→그래프 엔지니어링 순으로 옮겨왔고, 각 단계는 이전 단계의 한계에서 태어났다. 모델이 똑똑해지며 프롬프트 기교의 중요성이 줄었고, 프로덕션 투입에서 컨
2026년 8월 27일 Google DeepMind·싱가포르 AI 안전연구 벤치마크 오염 방지와 IP 보호를 동시에 노리는 평가 인프라 시도 — 비공개 벤치마크로 프런티어 모델을 검증하는 경로
2026년 8월 27일 Yifan Zhang 외 (Mengdi Wang·Q DeltaNet·Mamba 계열의 상태 갱신 규칙을 '무엇을 언제 연관시키는가'라는 시간 정렬 문제로 재정식화해, 시간 정렬·가소성·망각·유계 리허설을 분리 가능한 설계 축으로 만든 프레임워크. 저자 자체 보고로 대표 변형이 언어모델링에서 경쟁력을 유지하고 가변 자릿수 덧셈에서 길이 외삽을 개선.
2026년 8월 27일 Google (Gemini API) 영상 생성이 단발 클립에서 이어 붙이고 제어하는 타임라인 작업으로 이동
2026년 8월 27일 Anthropic MCP가 소프트웨어 도구 접근을 표준화했듯 물리 장비 제어를 표준화하려는 시도. 에이전트의 작용 범위를 실험실 하드웨어로 넓히는 경계 사건이며, 표준 주도권이 다시 Anthropic에 놓임
2026년 8월 26일 정리 노트 Gemini의 업무 자동화 기능은 자동화 강도 순으로 다섯 단계로 정리된다. 개인 인텔리전스에서 메모리와 워크스페이스·노트북 연동을 켜면 메일 확인→정리→캘린더 등록처럼 서비스를 가로지르는 지시가 되고, 노트북은 워드·PDF·드라이브·웹페이지를 주제별
2026년 8월 26일 정리 노트 빅테크가 한국에 수십조 원을 투자하는 배경은 패권의 축이 석유에서 24시간 싸고 안정적인 전기로 옮겨간 일렉트로스테이트 시대라는 구도로 읽힌다. 생성형 AI 질의 1회는 검색의 약 10배인 2.9Wh를 쓰고 AI 서버 랙은 7kW에서 50kW 이상으로
2026년 8월 26일 정리 노트 한 채용 플랫폼의 프로덕트 디자인팀이 Claude Code를 실무에 녹인 방식은 네 가지 패턴으로 정리된다. 첫째, 사내 디자인시스템의 템플릿 프롬프트를 붙여넣고 이벤트 결제 페이지를 만들어 달라는 자연어 한 줄로 로컬에 프로토타입을 띄우며, 템플릿
2026년 8월 26일 정리 노트 오픈웨이트 모델은 학습으로 얻은 가중치 자체를 공개해 다른 개발사가 파인튜닝할 수 있게 한 모델이고, 프론티어 모델은 설계를 비공개한 채 완제품에 과금하는 방식이다. 중국의 키미 K3·큐원이나 미국의 엔비디아·메타가 오픈웨이트를 택한 것은 미중 갈등이
2026년 8월 26일 정리 노트 반도체 기업 최초로 시총 1위에 오른 엔비디아의 성장사(상장 후 약 8,000배, 3조→4조 달러 1년, 4조→5조 달러 3개월)는 자본의 흐름이 에너지·플랫폼에서 지능으로 옮겨갔음을 보여준다. 여기서 나온 프레임이 한 나라가 확보한 지능과 연산량으로
2026년 8월 26일 정리 노트 2026년형 Mac mini는 로컬 LLM 구동을 겨냥한 에지 노드로 재편됐고, 기본가가 599달러에서 899달러로 오른 배경에는 TSMC 2나노 웨이퍼 비용이 66% 급등해 장당 3만 달러에 이른 파운드리 경제가 있다. 핵심 프레임은 두 단계의 분리
2026년 8월 26일 정리 노트 샤오미 AI 큐브의 1.22TB/s 근접 메모리 대역폭은 첨단 공정이 아니라 6나노 구식 노드 칩 X-Ring O100의 웨이퍼-온-웨이퍼 하이브리드 본딩에서 나왔다. 구리 패드를 직접 융합하는 1.4마이크로미터 피치로 258만 개 본딩 포인트와 28
2026년 8월 26일 Zhiyuan Li 외 LLM이 뽑아낸 그래프 간선을 그대로 믿지 않고 반사실 개입으로 간선 가중치를 사후 보정한다는 갈래 — 그래프 검색의 고질적 약점으로 지목돼 온 간선 신뢰도 문제를 검색 이전 단계에서 다룬다. 저자 자체 보고로 6개 LLM에 걸쳐 Graph-of-Skills 대비 ScienceWorld 매크로 평균 72.62→80.50, ALFWorld 성공률 80.01%→86.79%이며 환경 스텝 수는 감소.
2026년 8월 26일 Martino M. L. Pulici, Cuong 검색 시점에 그래프를 조회하는 GraphRAG 계보와 달리 그래프를 모델 가중치로 미리 컴파일해 두는 파라메트릭 지식그래프 갈래를 열면서, 동시에 그 갈래의 병목이 저장이 아니라 어댑터 선택(라우팅)임을 못박았다 — 의미 유사도를 넘어서는 어댑터 선택 기제를 찾는 것이 남은 과제라고 저자들이 결론. 수치는 저자 자체 보고.
2026년 8월 26일 Anthropic 사용 실태 데이터를 벤더가 독점하는 구조에 외부 검증 통로를 낸 사례. 발표 자유 조항과 제3자 감사를 명시해 벤더 자체 보고와 구분하려는 설계
2026년 8월 25일 정리 노트 휴머노이드가 날아오는 공을 다루는 시연은 센싱이 어디에 있느냐로 수준을 가를 수 있다. 2024년 11월 테슬라 옵티머스의 테니스공 캐치는 사람이 카메라 화면을 보며 조작한 텔레오퍼레이션이었고, 증명된 것은 자유도가 11에서 22(손목 포함 25)로
2026년 8월 25일 정리 노트 정부가 보고한 독자 AI 모델 2차 성과의 핵심 주장은 에포크 AI의 주목할 만한 모델 명단에 오른 나라가 미국·중국·한국뿐이라는 것과, 아티피셜 애널리시스에서 점수가 측정되는 국내 기업이 7곳이라는 점이다. SK·LG AI연구원(7,500억 파라미터
2026년 8월 25일 정리 노트 Rich Sutton과 제자 Khurram Javed의 요지는 현재 AI가 가는 길이 근본적으로 틀렸다는 것이다. Bitter Lesson의 핵심은 인간 지식에 매달리지 말고 탐색과 학습처럼 계산과 함께 확장되는 방법에 집중하라는 것인데, LLM은 인
2026년 8월 25일 정리 노트 Hermes 기반 개인용 멀티에이전트는 소프트웨어를 자율 빌드하는 Coder, Telegram 생산성·건강 코치 LifeBot, 팀 COO 역할의 Taco Bot을 역할별로 분리한 구성이다. Coder는 Mac Studio의 로컬 Qwen 3.6 35
2026년 8월 25일 정리 노트 그래프 엔지니어링이 혼란스러운 이유는 컨트롤 그래프(SOP로 에이전트 신뢰성 확보), 지식 그래프(엔티티 관계 기반 검색, 무관한 개념), 루프의 그래프(여러 루프의 조율, 아직 미해결)라는 세 가지가 한 단어로 뭉뚱그려지기 때문이다. 실무에서 쓸모
2026년 8월 12일 Pranav Bykampadi 외 에이전틱 시스템의 지식그래프를 '추출된 트리플의 평평한 저장소'에서 누가 사실을 소유하는지·왜 채택됐는지·어떻게 쓰여야 하는지를 기록하는 거버넌스 대상으로 재정의한 갈래. 저자 자체 보고로 SciERC에서 평면 삽입 대비 strict 트리플 F1 47%·mapped 트리플 F1 51% 개선, 120개 트리플 블라인드 검토에서 거버넌스 통과 트리플이 더 자주 출처 근거를 가졌고, MuSiQue에서 Microsoft GraphRAG 대비 exact-match 9.0포인트·token F1 11.2포인트 우위.
2026년 5월 19일 Google (AI Edge) 온디바이스 런타임이 모바일 OS를 넘어 브라우저까지 같은 스택으로 덮는 단계. 수치는 벤더 자체 측정
2026년 5월 5일 Google (Chrome) 온디바이스 모델이 앱이 아니라 웹 플랫폼 API로 노출된 스테이블 채널 사례. 모델 배포와 용량 관리의 책임이 브라우저 벤더로 넘어간다
2026년 1월 21일 PyTorch 재단 수치 재현성(결정성·텐서 해싱 디버깅)이 릴리스 헤드라인에 올라온 시점. 학습 스택이 성능 경쟁 단계에서 디버깅 가능성 단계로 넘어가는 신호
2025년 11월 28일 Liquid AI 7월 릴리스의 후속 문서. 온디바이스 계열이 기술보고서 수준의 공개 문서를 갖춘 사례다
2025년 10월 22일 PyTorch (Meta) 2022년 Google Pathways가 제시한 단일 컨트롤러 모델이 PyTorch 코어 계보로 들어온 지점. TorchTitan 은 Monarch 안의 액터가 되고 torchforge 는 Monarch 위에 세워진다
2025년 10월 22일 PyTorch (Meta) Triton이 CUDA를 한 단계 추상화했듯 Helion은 Triton을 한 단계 더 추상화한다. 커널 작성 계보의 다음 층
2025년 10월 15일 PyTorch 재단 멀티 GPU 커널을 프레임워크 API 수준에서 직접 쓰게 하는 방향. NCCL 계열 집합통신 위에 사용자 커널 경로가 하나 더 생겼다
2025년 9월 10일 Arm 온디바이스 추론의 병목을 전용 NPU가 아니라 CPU 확장명령(SME2)으로 푸는 노선. 프레임워크 통합을 함께 발표해 실리콘이 아니라 소프트웨어 경로로 배포된다. 수치는 벤더 자체 주장
2025년 7월 10일 Liquid AI 온디바이스를 사후 양자화의 결과가 아니라 설계 목표로 두고 하드웨어-인-더-루프로 아키텍처를 탐색한 상용 계열. 수치는 벤더 자체 측정이며 독립 검증이 아니다