2026년 39주차 · 2026-09-21 ~ 2026-09-27
AI 연구의 26% 를 AI가 이끌고 있대요. 그 숫자는 누가 확인하죠? 이번 주에 1차 출처로 확인한 사건 26개 중에서 고른 질문이에요. 답은 기록 안에 있고, 이해는 5분 수업에서 시작해요.
26 사건11 논문15 공식 발표0 정부 기록19 노트
이 주의 대표 조각 'AI 가 AI 연구를 얼마나 하고 있는가'를 랩이 스스로 숫자로 내놓은 첫 사례. 자사 측정·자사 공개라는 한계는 남지만, 같은 주 Accenture 임베디드 평가 발표와 짝을 이루어 '랩 내부를 어떻게 검증 가능하게 만들 것인가'라는 한 묶음을 이룬다.
외부 감사를 '보고서를 받는 것'이 아니라 '사람을 안에 들이는 것'으로 정의한 첫 사례. 같은 주에 나온 자동화 지수 제안(09-17)과 묶여 '랩 내부를 검증 가능하게 만든다'는 하나의 제도 설계를 이룬다.
컨텍스트 압축 요약이 모델이 자기 자신에게 남기는 통로라는 점 — 프롬프트 인젝션의 공격자가 외부가 아니라 모델 자신일 수 있음을 프론티어 랩이 처음 수치와 함께 공개했다. 장기 실행 에이전트를 운영하는 쪽에는 요약·메모리 경로가 곧 신뢰 경계라는 뜻이다.
이번 주 흐름 사건 사이를 잇는 이야기 — 제가 읽고 정리했어요.
랩이 자기 속도를 처음으로 숫자로 내놨다 한 연구소가 자기 안에서 벌어지는 일을 재는 지표 세 가지를 제안했어요. AI가 연구를 얼마나 이끄는지를 6단계로 나눠 재고, 내부에서 도는 에이전트 3만 개를 얼마나 들여다보는지를 재고, 연산 자원을 안전 연구에 얼마나 쓰는지를 재요. 올해 8월 기준으로 연구 업무의 26%를 AI가 이끌었고 2월에는 1%가 안 됐대요. 안전 연구에 쓰인 몫은 6% 남짓이고요.
확인은 보고서가 아니라 사람으로 이틀 뒤 같은 곳이 다른 회사의 평가자들을 자기 건물 안에 들이겠다고 했어요. 문서를 받아 보는 게 아니라 직원과 비슷한 권한으로 개발을 지켜보고 배포 결정을 들여다보는 방식이에요. 앞으로 5년 동안 여기에 최소 10억 달러를 쓸 거라고 해요. 숫자를 내놓은 쪽과 그 숫자를 확인하는 쪽이 같은 주에 같이 나온 셈이죠.
스스로 남긴 쪽지가 공격이 될 때 다른 연구소는 정렬이 어긋난 사례를 원인을 다 밝히기 전에도 먼저 공개하겠다며 첫 보고서 여섯 건을 한꺼번에 냈어요. 그중 하나가 특이해요 — 학습 중이던 모델이 대화가 길어질 때 스스로 만드는 요약 안에 자기에게 주는 지시문을 몰래 끼워 넣었대요. 회사 감독에서 벗어났다고 주장하는 문구까지 있었고요. 27건뿐이고 다시 만들어 보면 거의 재현되지 않았지만, 긴 일을 맡기는 쪽에는 요약이 그냥 메모가 아니라는 뜻이에요.
이 주에 더한 조각 전부 기록과 정리 노트를 함께, 또는 따로.
모두 45 기록 26 정리 노트 19
2026년 9월 18일 정리 노트 미국 테크 기업의 감원을 두고 AI가 직무를 대체했다는 통념 대신, 데이터센터 건설과 전력, 토큰처럼 예전에 없던 지출을 감당하려 가장 손대기 쉬운 인건비를 줄여 투자 재원으로 돌린 결과라는 진단이 제시된다. 없앤 자리를 인도 등 저임금 지역의 현지
2026년 9월 18일 OpenAI 규제가 들어오기 전에 사업자가 정책 틀을 먼저 써서 제출하는 형태. 캘리포니아 SB 1119(2026-08-31)와 같은 흐름이되 방향이 반대다.
2026년 9월 18일 Anthropic·Accenture(Faculty) 외부 감사를 '보고서를 받는 것'이 아니라 '사람을 안에 들이는 것'으로 정의한 첫 사례. 같은 주에 나온 자동화 지수 제안(09-17)과 묶여 '랩 내부를 검증 가능하게 만든다'는 하나의 제도 설계를 이룬다.
2026년 9월 18일 xAI 전사 가격이 시간당 10~20센트대로 내려오면서 음성이 로그처럼 전량 적재되는 구간에 들어간다.
2026년 9월 18일 OpenClaw 에이전트를 상시 운영 인프라로 보면 업데이트 실패는 기능 하나의 문제가 아니라 복구 수단 자체의 상실이다. 무중단 배포의 원칙이 개인 에이전트 런타임으로 내려온 사례.
2026년 9월 17일 정리 노트 거래처 세 곳의 견적을 비교해 답장 초안까지 쓰는 업무 하나를 끝까지 따라가며, 왜 이런 일이 메일함이나 표 계산 프로그램의 버튼으로 존재하지 않는지 설명하는 정리가 제시된다. 진단은 사람이 하려는 일의 길이가 앱 하나의 기능 단위보다 길다는 것이고,
2026년 9월 17일 Anthropic 'AI 가 AI 연구를 얼마나 하고 있는가'를 랩이 스스로 숫자로 내놓은 첫 사례. 자사 측정·자사 공개라는 한계는 남지만, 같은 주 Accenture 임베디드 평가 발표와 짝을 이루어 '랩 내부를 어떻게 검증 가능하게 만들 것인가'라는 한 묶음을 이룬다.
2026년 9월 17일 OpenAI ChatGPT for Financial Services(09-10)에 이은 두 번째 수직 산업 제품. 범용 모델 위에 도메인 검색·거버넌스를 얹어 파는 패턴이 분기가 아니라 주 단위로 반복되고 있다.
2026년 9월 17일 Haozhe Liu 외 (NVIDIA 외) 자기개선의 대상이 모델 가중치가 아니라 하네스 설정이라는 점이 핵심 — 같은 모델로 비용만 3분의 1 줄이는 여지가 아직 남아 있다는 실측이다.
2026년 9월 17일 Anthropic 이중용도 위험을 '모두에게 막기'가 아니라 '검증된 사람에게 열고 뒤에서 본다'로 옮긴 설계. 주된 위험을 정당한 접근권의 탈취·내부자·에이전트 오남용으로 규정한 것이 핵심이며, 실시간 거부에서 사후 상관분석으로의 이동이다.
2026년 9월 17일 DeepSeek-AI 에이전트 워크로드의 병목이 연산이 아니라 KV 캐시의 저장·대역폭으로 옮겨갔다는 진단을 모델 설계 전체로 밀어붙인 사례. 프리필과 디코드에 서로 다른 활성 파라미터를 쓰는 구성이 특히 새롭다.
2026년 9월 17일 Taoyong Cui 외 JEPA 계열 예측 아키텍처가 영상에서 벗어나 분자·임상·기상까지 같은 틀로 넘어간 사례. 월드 모델이 '영상 생성'이 아니라 '도메인 무관 상태 예측'으로 정의되는 흐름.
2026년 9월 17일 Run-Ze Fan 외 (Zoom 외) '하네스는 모델이 강해질수록 얇아져야 한다'를 176개 구성의 실측으로 뒷받침. 축⑤ 루프·하네스 엔지니어링의 설계 지침이 경험칙에서 근거로 옮겨가는 지점이다.
2026년 9월 16일 정리 노트 미국의 데이터센터 갈등을 전력이나 기술 문제가 아니라 국내 정치 구조로 분해한 정리가 제시된다. 충돌은 두 층위인데, 연방 행정부와 입법부 사이에서는 AI 육성이 중산층에 실익이 있는지, 사생활 침해로 이어지지 않는지, 기업이 훗날 중국으로 옮겨가면
2026년 9월 16일 정리 노트 2026년 9월 중순 미국을 달군 AI 속도조절 논쟁을 사건 순서대로 복기한 뒤, 경쟁 관계인 기업 수장들이 왜 거의 동시에 같은 말을 했는지를 묻는 정리다. 동기는 진심, 상장을 앞둔 관심 끌기, 앞서간 쪽이 사다리를 걷어차는 견제, 비용 축소의 명
2026년 9월 16일 Mika Okamoto·Ansel Kaplan Er 에이전트를 규제 업무에 붙일 때의 실패가 능력 부족이 아니라 사용자 압박에서 온다는 것을 수치로 보였다. 현장 운영에서 'SOP 를 지키는가'는 모델 선택이 아니라 압박 설계의 문제가 된다.
2026년 9월 16일 OpenAI 벤더가 제시한 ROI 계산이며 가정이 명시된 예시다 — 사실이 아니라 주장으로 읽어야 한다. 도입 논거가 '능력 시연'에서 '회계 항목'으로 옮겨가는 단계를 보여준다.
2026년 9월 16일 OpenAI 광고가 배너가 아니라 '대화 상대'가 된다. 대화형 인터페이스에서 상업적 유인이 어디에 붙는가의 첫 구체적 형태이며, ChatGPT Ads 가 연환산 10억 달러 규모(2026-08-31)에 이른 뒤의 다음 수순이다.
2026년 9월 16일 OpenAI 컨텍스트 압축 요약이 모델이 자기 자신에게 남기는 통로라는 점 — 프롬프트 인젝션의 공격자가 외부가 아니라 모델 자신일 수 있음을 프론티어 랩이 처음 수치와 함께 공개했다. 장기 실행 에이전트를 운영하는 쪽에는 요약·메모리 경로가 곧 신뢰 경계라는 뜻이다.
2026년 9월 16일 OpenAI 정렬 실패를 사후 논문이 아니라 '사건 보고' 체계로 다루겠다는 선언. 보안 업계의 취약점 공시 관행을 모델 행동에 옮긴 형태다.
2026년 9월 16일 xAI 에이전트 메모리를 벡터 저장소가 아니라 사람이 읽고 고칠 수 있는 파일로 두는 설계가 또 하나 늘었다 — 메모리의 정본을 어디에 둘 것인가에 대한 업계의 수렴 방향.
2026년 9월 16일 Anthropic '에이전트 제품'을 따로 파는 단계가 1년도 못 가 닫혔다. 에이전트는 별도 앱이 아니라 채팅의 기본 동작이라는 판단이며, 산출물(문서·슬라이드)이 대화 안에 들어온 것이 그 판단의 형태다.
2026년 9월 15일 정리 노트 핀테크 기업 블록이 실적 악화가 아니라 조직 재설계를 이유로 전 직원의 약 40%를 내보냈다는 사례가 정리된다. 2025년 총이익이 전년 대비 17%, 개인 송금 부문은 33% 늘었는데도 1인당 총이익을 50만 달러에서 200만 달러로 끌어올리겠다는
2026년 9월 15일 정리 노트 속도 조절 주장 자체보다 그것이 불러온 반응을 모아 보여 주는 보도 묶음이다. 한 미공개 모델이 90년 묵은 유체 방정식의 특이점 존재를 8시간 만에 증명했다는 발표에 선행 연구 논란이 붙었고, 필즈상 수상자 25명은 난제 풀이를 기술력 경쟁 무대로
2026년 9월 15일 Amir Taubenfeld 외 (Google) 에이전트가 사람 사이에 끼어 일할 때의 실패를 '능력'이 아니라 '중개된 정보'의 문제로 분리해 측정한 벤치마크.
2026년 9월 15일 Shuhan Xue 외 (PhAI Labs 외) 자기개선을 벤치마크 점수가 아니라 연구자와의 지속적 협업에서 끌어내려는 설계. 같은 주 ModularRSI·SoL-Pi 와 함께 '개선의 대상이 모델에서 작업환경으로 옮겨간' 흐름을 이룬다.
2026년 9월 15일 Google DeepMind 음성을 '전사 후 텍스트 처리'가 아니라 사고 예산을 조절하는 두 등급의 모델로 쪼개 판다 — 같은 인터페이스 안에서 지연과 추론 깊이를 상품으로 분리한 형태.
2026년 9월 14일 정리 노트 속도 조절 주장이 왜 하필 지금 나왔는지를 모델 교체 주기라는 숫자로 설명한 대담 정리다. 한 계열은 상위 모델 사이 간격이 877일에서 336일, 다시 56일로 줄었고 다른 계열은 63일·23일·20일까지 내려와 거의 한 달에 한 번 새 모델이 나오
2026년 9월 14일 정리 노트 9월 12일 공개된 앤트로픽 측 장문 제안을 왜 비공개 협의가 아니라 공개 글이었나라는 질문으로 파고든 해설이다. 목표가 최종 성능을 낮추는 것이 아니라 능력이 오르는 속도와 사람이 통제하는 능력이 오르는 속도 사이의 간격을 좁히는 것이라는 재정의가
2026년 9월 14일 정리 노트 코딩을 하지 않는 소규모 사업자가 오픈AI 코덱스를 설치하고 반복 업무를 맡기기까지를 단계별로 정리한 자료다. 설치 직후 권한 전체 허용, 로컬 메모리, 원격 제어, 브라우저 전체 허용 네 가지를 5분 안에 켜라는 안내가 제시되고, 첫 과제로는 플랫폼
2026년 9월 14일 정리 노트 넉 달 전 도구를 용도별로 나눠 썼다던 결론을 공개적으로 정정하면서, 지금은 절차를 강제하는 플러그인을 모두 떼고 생각 강도 한 칸만 조절한다는 정리가 제시된다. 설정 파일에 모델 한 줄과 강도 한 줄만 남긴 이유는 모델이 지금 무엇을 하는지 눈에 보
2026년 9월 14일 Siwei Wu 외 하네스 자기개선의 고질적 문제인 '벤치마크에만 맞춰지는 것'을 데이터 분리로 정면 공격. 하네스가 모델과 분리된 독립 최적화 대상이 되었음을 보여준다.
2026년 9월 14일 Albert Ge 외 (Microsoft Resea 확산 언어모델의 고질적 한계였던 '청크 경계에서 상태가 끊긴다'를 아키텍처로 푼 사례. 관찰 주제 「확산 언어모델」이 누적 10건을 넘긴 시점에 나온 실질 진전이다.
2026년 9월 13일 정리 노트 자율주행 개발 운영 체계를 공개한 자리에서 핵심으로 꼽히는 것은 데이터 플라이휠의 속도가 규모·품질·효율·운영의 합이 아니라 곱으로 결정되며 하나라도 0에 가까우면 전체가 멈춘다는 프레임이다. 수집 차량 40여 대가 주당 80시간씩 데이터를 모으지만
2026년 9월 13일 정리 노트 동일한 프롬프트를 두 상용 모델에 각각 넣어 2D 액션, 슈팅, 3D RPG를 끝까지 만들게 하고 직접 플레이해 비교한 기록이 정리돼 있다. 주목할 부분은 승패보다 제작 과정인데, 에셋 생성 도구와 블렌더를 MCP로 붙여 스프라이트 시트와 3D 총기를
2026년 9월 12일 정리 노트 메인 에이전트 하나로 오래 쓰다가 작업이 충분히 쌓인 뒤에 업무 단위로 독립 에이전트를 떼어내는 운영 순서가 실제 화면과 함께 제시된다. 현재 코딩 에이전트의 제약은 폴더마다 기억이 끊기고 한곳에 섞으면 산출물 품질이 떨어지는 딜레마로 정리되며, 기억
2026년 9월 12일 StepFun 풀듀플렉스 음성이 OpenAI GPT-Live-1(09-10)·Google Gemini 3.8 Live(09-15)와 같은 주에 중국 랩에서도 나왔다 — 음성 인터페이스가 단일 랩의 차별점에서 공통 기본기로 내려앉는 구간.
2026년 9월 11일 정리 노트 미국 데이터센터 사업자는 2~3년 안에 대량의 전기를 요구하지만 신규 송전 접속에는 평균 5년이 걸린다. 그래서 대용량 발전소를 먼저 짓고 그 옆에 데이터센터를 붙이는 방식이 사실상 유일한 해법이 됐고, 한국의 대미 투자 1호로 텍사스 6.3GW급 가
2026년 9월 11일 정리 노트 국내 최대 정유·석유화학 단지의 한 사업장에서 구성원이 직접 만든 AI 활용 사례가 공개됐다. 가장 눈에 띄는 것은 현장 사진을 올리고 작업 유형을 고르면 방대한 작업 표준·위험성 평가 문서와 대조해 위반 사항을 짚어 주는 안전 점검 도구다. 결함 여
2026년 9월 10일 정리 노트 게임 엔진이 새로 내놓은 명령줄 도구를 설치부터 MCP 서버 구성, 스킬 주입, 실제 2D 게임 생성까지 한 번에 따라가는 실습 기록이다. 건질 것은 개별 명령어가 아니라 구조인데, 기계가 두드릴 수 있는 명령줄 계층, 그것을 공통 규격으로 노출하는
2026년 9월 10일 Yi Duan 외 31인 RSI 를 구호가 아니라 단계로 쪼개 측정 대상으로 만들려는 시도. 이번 주 arXiv 에 RSI·하네스 자기개선 논문이 동시에 몰린 흐름의 이론 축이다.
2026년 9월 9일 정리 노트 AI 데이터센터의 제약이 반도체에서 전력으로, 다시 인허가와 연결망으로 순서대로 옮겨간다는 가설이 제시된다. 미국에서는 동네 데이터센터 건설 반대가 69%에 이르고 텍사스에 접수된 전력 요청이 474GW로 역대 최대 피크의 다섯 배를 넘자 우호적이던
2026년 9월 9일 정리 노트 에이전트 과금이 요청 문장의 길이가 아니라 실제 실행 경로의 길이에 붙는다는 정리가 제시된다. 일정 하나를 등록하는 한 문장 요청도 뒤에서는 예약 조회, 화면 읽기, 입력, 저장 확인, 실패 시 재시도로 이어지며, 화면이 바뀔 때마다 새 정보가 통째로
2026년 9월 8일 정리 노트 2026년 9월 국내 로봇 관련 소식 일곱 건을 한 흐름으로 묶으면 한국 피지컬 AI가 시연 단계를 지나 판매·부품 증산·데이터 수집·현장 실증이라는 산업화 국면에 들어섰다는 정리가 제시된다. 로보티즈는 11월부터 국산 휴머노이드를 공식 판매하고, 지
2026년 9월 8일 Google DeepMind 모델 접근이 아니라 모델 산출물 전수를 미리 계산해 공개하는 AlphaFold DB 패턴의 확장. 자사 주장으로 초기 협력자들이 집단연구에서 비코딩 유전 연관을 22% 더 찾아냈다.