AI 가 문헌을 요약하는 단계에서 '무엇을 볼지 스스로 정하고 이상 패턴을 먼저 알아채는' 단계로 넘어간 사례다. 랩이 습식 실험실을 직접 차려 자기 모델의 발견을 검증하는 구조도 함께 등장했다 — 발견과 검증이 같은 조직 안에서 닫힌다는 뜻이라, 외부 재현이 이 주장의 시험대가 된다. 아직 동료심사를 거치지 않은 프리프린트다
랩이 자기 결과를 학계에 어떻게 내보낼지를 외부 위원회에 맡긴 첫 사례에 가깝다. 자문그룹의 존재 자체가 '검증 속도가 생산 속도를 못 따라간다'는 인정이다. 나비에-스토크스를 포함한 100개 해결 주장은 현재 자사 발표뿐이고 증명 공개·동료심사가 없어, 이 항목의 무게는 전적으로 후속 검증에 달려 있다 — watchlist 로 넘겼다
같은 회기에서 랩(측정·보고)과 독립 과학자(사전 허가·책임보험)가 서로 다른 규제 모형을 내놓았다. 이 간극이 앞으로 국제 논의의 실제 전선이 된다. Bengio 는 사례를 열거하면서 개별 출처를 달지 않았고 '독립 전문가들이 확인했다'는 서술에 그쳐, 사례 각각은 별도 검증이 필요하다
한 연구소가 바이러스를 잡아먹는 미생물에서 지금까지 기록에 없던 효소 한 벌을 찾았다고 밝혔어요. 사람이 찾은 게 아니라 AI 에이전트 950개가 21시간 동안 유전자 데이터베이스를 훑어서 20만 개 후보를 20개까지 좁힌 거예요. 그다음에야 사람이 실험실에서 진짜인지 확인했고요. 같은 주에 다른 곳에서는 바이러스 2,800종의 단백질 구조 예측값을 공개 데이터베이스에 통째로 올렸는데, 그중 30% 정도는 과학계가 처음 보는 것이래요. 찾는 일과 확인하는 일이 이렇게 갈라지기 시작했어요.
풀었다는 말과 확인했다는 말은 다른 말이에요
한 회사가 8월에 학습시킨 내부 모델이 오래된 수학 난제를 100개 넘게 풀었다고 했어요. 그중에는 100년 가까이 안 풀린 아주 유명한 문제도 들어 있고요. 그런데 증명은 아직 공개되지 않았어요. 그래서 그 회사는 같은 날 수학자 아홉 명으로 자문단을 꾸렸어요 — 결과가 얼마나 중요한지 판단하고, 어떻게 내놓을지 조언하는 자리예요. 만드는 속도가 확인하는 속도를 앞질렀다는 걸 만든 쪽이 먼저 인정한 셈이에요.
같은 날 같은 자리에서 갈린 두 처방
유엔 안전보장이사회가 AI를 안건으로 올렸어요. 한쪽에서는 AI 회사 대표가 나와서 능력을 재는 기준을 만들고 사고가 나면 서로 알리자고 했어요. 다른 쪽에서는 이 분야를 오래 연구한 학자가 나와서, 약이나 비행기나 원자력처럼 내놓기 전에 허가를 받게 하고 사고 보험도 들게 하자고 했고요. 하나는 나온 다음에 보자는 쪽이고 하나는 나오기 전에 막자는 쪽이에요. 앞으로 몇 년 동안 이 두 갈래가 계속 부딪힐 거예요.
에이전트 프레임워크 아래에 빠져 있는 층을 지목한 설계 제안이다. 관찰 주제 「에이전트 보안·샌드박싱」이 이번 주에만 산업(NVIDIA)·학계(본 논문) 양쪽에서 같은 결론에 닿았다 — 방어는 모델이 아니라 모델 바깥에 두어야 한다는 것. 실측 평가보다 아키텍처 논증 중심이다
같은 회기에서 랩(측정·보고)과 독립 과학자(사전 허가·책임보험)가 서로 다른 규제 모형을 내놓았다. 이 간극이 앞으로 국제 논의의 실제 전선이 된다. Bengio 는 사례를 열거하면서 개별 출처를 달지 않았고 '독립 전문가들이 확인했다'는 서술에 그쳐, 사례 각각은 별도 검증이 필요하다
AI 가 문헌을 요약하는 단계에서 '무엇을 볼지 스스로 정하고 이상 패턴을 먼저 알아채는' 단계로 넘어간 사례다. 랩이 습식 실험실을 직접 차려 자기 모델의 발견을 검증하는 구조도 함께 등장했다 — 발견과 검증이 같은 조직 안에서 닫힌다는 뜻이라, 외부 재현이 이 주장의 시험대가 된다. 아직 동료심사를 거치지 않은 프리프린트다
모델 성능이 아니라 '보고서를 제때 못 쓰는 것'이 병목인 현장에서 생긴 효과다. 추론 능력보다 서식이 제각각인 문서를 읽어 표로 만드는 능력이 실제 가치를 냈고, 이런 쓰임은 벤치마크에 잡히지 않는다. 수치는 대응기관 집계이고 시간 단축 효과는 Anthropic 측 서술이다
에이전트가 로봇 소프트웨어의 '사용자'로 명시된 첫 주류 릴리스다. 스킬을 사람과 에이전트가 같은 인터페이스로 호출하게 만든 설계는 MCP·Skills 표준화 흐름이 물리 영역으로 건너온 모양이고, 카메라별 인식 모델 미세조정을 에이전트에게 맡기는 부분은 제조 현장의 비전 검사 셋업이 사람 손을 덜 타는 방향을 가리킨다
지난주 Anthropic 의 임베디드 평가(상주 평가자)에 이어 나온 문서로, 프런티어 랩들이 '외부 평가를 어디까지 들여보낼지'를 각자 성문화하기 시작한 흐름에 들어간다. 다만 평가자 수·접근 수준의 정량 약속은 없고 '공개 전 시정 기간'은 평가자의 공개 재량을 제약할 수 있는 조항이라, 실제 독립성은 개별 계약서에서 갈린다
같은 세대 안에서 성능을 올리면서 단가를 함께 내린 갱신이다. 개선 항목이 에이전틱 코딩·컴퓨터 사용·인젝션 저항에 몰려 있어, 프런티어 경쟁이 '더 똑똑한 모델'이 아니라 '오래 도는 루프를 싸고 안전하게 버티는 모델'로 이동한 것을 보여준다. 벤치마크 수치는 전부 자사 주장이며 독립 재현은 없다
랩이 자기 결과를 학계에 어떻게 내보낼지를 외부 위원회에 맡긴 첫 사례에 가깝다. 자문그룹의 존재 자체가 '검증 속도가 생산 속도를 못 따라간다'는 인정이다. 나비에-스토크스를 포함한 100개 해결 주장은 현재 자사 발표뿐이고 증명 공개·동료심사가 없어, 이 항목의 무게는 전적으로 후속 검증에 달려 있다 — watchlist 로 넘겼다
에이전트 보안의 무게중심이 모델 정렬에서 런타임 격리로 옮겨가는 흐름을 벤더 쪽에서 정식화한 글이다. 같은 주 arXiv 의 AgentKernel 과 논지가 겹친다 — 프롬프트 층의 방어를 포기하고 OS 층에서 막자는 것. 자사 제품 생태계를 전제한 서술이라 주장으로 기록한다