한국어EN
축 ⑥

추론 모델·AGI 논쟁

기록 60 · 정리 노트 0 · 관련 축으로 붙은 사건도 함께 보여요.


Anthropic
인간 커뮤니티가 수년 단위로 진행하던 대형 형식화 과제를 에이전트 군집이 단기간에 수행했다는 주장. 검증 가능한 산출물(Lean 증명)이 결과물이라 벤치마크와 달리 외부 재검증이 가능하다는 점에서 자율 연구 주장 중 검증 난도가 낮은 사례

OpenAI
GPT-6 세대 개시. Anthropic Fable 5.1과 같은 주에, 100만 토큰당 10/50달러라는 동일한 가격표로 출시돼 프런티어 가격이 사실상 수렴했고, 벤치마크 경쟁의 중심이 컴퓨터 사용·사이버·에이전틱 코딩으로 이동

Google DeepMind
보안 전용 파생 모델을 프런티어 라인업의 정식 변종으로 분리 — 취약점 탐지·패치가 모델 제품군의 독립 축이 됨

Meta Superintelligence Labs
MSL이 폐쇄 API 노선을 유지한 채 에이전트 효율(툴 호출·토큰 절감)을 전면 지표로 내세움
툴·에이전트공식 발표

Anthropic
프런티어 모델의 경쟁 축이 코딩에서 자율 과학 연구로 이동. 최상위 모델을 심사된 사용자에게만 여는 계층 배포가 제품 라인으로 굳어졌고, 가격 인하가 성능이 아니라 캐시 읽기 단가에서 나온 점은 장기 에이전트 루프가 과금의 중심임을 보여줌

xAI
장시간 실행 에이전트에 초점. 안전 서술은 능력에 맞춰 보정했다는 수준이고 별도 모델 카드가 링크되지 않음

xAI
챗봇에서 상주형 자율 에이전트로의 제품 축 이동

deedy (imo-2026 커뮤니티 프로젝트)
랩 발표가 아닌 커뮤니티 주도의 감사 추적 공개 + 독립 채점 방식 실시간 올림피아드 평가가 새 검증 관행으로 등장

xAI
코딩 제품사와의 공동 학습이라는 새 형태. 경쟁사 수치는 각사 시스템 카드에서 인용했다고 명시

데미스 허사비스 (Google DeepMind CE
기존의 신중한 AGI 타임라인 화법에서 적극적 프레임으로 이동했음을 보여주는 2026년 대표 발언

OpenAI·Microsoft
AGI 정의가 실은 계약·거버넌스 장치였음을 드러낸 사건

David C. Krakauer
벤치마크 간 제1주성분 설명력이 2023~24년 92%에서 추론 모델 등장 이후 64%로, 겉보기 일반성 아래의 전문화 주장

François Chollet
test-time에 새로움에 적응하는 fluid intelligence의 등장을 이유로 든 조건부 전향

Sakana AI
AI 생성 논문의 심사 통과가 정식 학술 기록으로 편입. 자동 연구의 평가 기준 논쟁이 본격화

ARC Prize
정적 문제풀이에서 지시 없는 대화형 탐색·기술 습득으로 축 이동

Yann LeCun / AMI Labs
LLM 회의론이 10억 달러 규모의 대안 노선 베팅으로 자본화

Dario Amodei (Dwarkesh)
스케일링 종료와 AGI 임박이 같은 주장의 양면이라는 논리 구조

Google DeepMind
ARC-AGI-2 사실상 포화. 발표문은 AGI를 논하지 않고 과학·연구·공학 가속으로 프레이밍

ARC Prize
2025년의 핵심 기술 변화는 탐색·검증 반복 루프였음을 확인

Yann LeCun

Google DeepMind
ARC-AGI-2 SOTA가 한 번에 2배 도약

xAI
정서적·창작적 상호작용을 명시적 최적화 대상으로 삼은 릴리스

Scale AI·CAIS
실세계 지식노동 전이 실패의 정량 증거

Hendrycks·Bengio 외 29인
AGI 정의를 수사에서 심리측정학적 척도로 이전, 최대 결손은 장기기억 저장

DeepSeek (深度求索)
프런티어 LLM이 정식 동료심사를 거쳐 학술지에 실린 첫 사례. 기업 기술보고서 중심의 관행에 균열

xAI
저가 코딩 모델을 Copilot·Cursor·Cline 등에 무료 배포해 점유율을 먼저 확보하는 전략

OpenAI
AGI 기대의 환멸 구간, Altman 스스로 AGI 정의상 중요한 무언가가 빠져 있다고 인정

Google DeepMind
형식화 없이 자연어 end-to-end 범용 모델의 성취라는 점이 일반성 논쟁의 핵심 증거

xAI
RL 컴퓨트를 사전학습 수준으로 끌어올린 노선. 인용 점수는 모두 xAI 발표문 기준이며 독립 검증 주체가 명시되지 않음

Dellibarda Varela 외
Apple 논문의 평가 설계를 부분 반박하되 일부 실패는 실제 추론 한계라고 인정

Mistral AI
유럽 랩 최초의 오픈웨이트 추론 모델 계열. 학습 인프라·RL 알고리즘 논문 동시 공개

Apple
가장 널리 인용된 회의론 실증, 추론 노력이 임계 이후 오히려 감소

Epoch AI
약 1년 내 총 학습 연산 프론티어 도달 후 성장률이 연 4배 수준으로 수렴할 것이라는 정량 예측

OpenAI
추론 모델이 사고 사슬에서 에이전트로 전환, 경쟁축이 얼마나 오래 생각하나에서 얼마나 길게 자율 수행하나로

AI Futures Project
짧은 타임라인 진영의 대표 문서

Google
thinking이 특수 모드에서 기본값으로 이동하는 선언

Demis Hassabis
신중한 낙관 진영의 기준점

Cohere
하이브리드 아키텍처, 23개 언어, RAG·그라운딩·툴 사용 특화. 자기정제와 모델 머징을 쓰는 분산 학습 접근

Anthropic
추론은 별도 모델이 아니라 프론티어 모델의 통합 능력이어야 한다는 노선 천명

xAI
Think 버튼 기반 추론 모드 분리. 발표문의 20만 GPU 클러스터는 차기 모델 학습용 언급이며 Grok 3 학습에 전부 쓰였다는 서술은 없음

금융시장
R1의 저비용 학습 주장이 AI 자본지출 해자론을 흔듦

CAIS·Scale AI
MMLU 포화 이후의 다음 한계선, 당시 모델 정답률 10% 미만

DeepSeek
추론 능력이 폐쇄형 랩의 비밀 레시피가 아님을 증명, 자기검증·재검토·전략 전환이 창발. RLVR과 소형 모델로의 능력 이전 레시피도 같은 보고서에서 공개됐다

François Chollet
ARC 설계자가 program synthesis 대안 노선을 자본과 조직으로 옮김

Sam Altman
프론티어 랩 CEO의 가장 직접적인 AGI 선언, 목표를 초지능으로 이동

Google
Google 첫 추론 모델, 사고 과정을 사용자에게 노출하는 노선

OpenAI
더 오래 생각하는 값을 사용자가 지불한다는 inference-scaling의 상업화

Alibaba Qwen
o1 이후 최초의 오픈 추론 모델

Ai2
보상 모델을 검증 함수로 대체하는 접근을 명명, 파이프라인 전 단계 공개

Ilya Sutskever (Reuters)
사전학습 스케일링 회의론의 최초 공개 발언

The Information
스케일링 벽 논쟁 점화

OpenAI
최초의 상용 추론 모델, AIME 2024에서 GPT-4o 12%에서 o1 74%로

Sakana AI
연구 자동화 담론을 논문 1편 15달러라는 구체 수치로 전환

xAI
이미지 생성은 자체 모델이 아니라 외부 모델(Black Forest Labs FLUX.1) 연동으로 시작

Snell 외
test-time compute가 파라미터 확대보다 효율적일 수 있음을 실증

Google DeepMind
형식언어 기반 자기학습이 올림피아드 수준에 도달. DeepMind는 Lean·Mathlib 없이는 불가능했다고 명시

xAI
컨텍스트를 이전 대비 16배로 확대

Trieu H. Trinh 외 (Google Dee
형식 검증 가능한 보상이 추론 학습을 이끈 초기 사례. 인간이 읽을 수 있는 증명 생성

xAI
첫 제품. 위트와 반항적 기질을 명시적 설계 목표로, X 플랫폼 실시간 지식을 차별점으로 제시

xAI
DeepMind·OpenAI·구글 출신으로 구성된 신생 프런티어 랩의 출발점. 설립 인원 명단은 위키피디아 기준이며 xAI 공식 발표문은 미확인