한국어EN
축 ⑩

안전·정렬·해석가능성

기록 77 · 정리 노트 0 · 관련 축으로 붙은 사건도 함께 보여요.


OpenAI
사이버 Critical 역량 선언과 같은 주에 나온 방어 측 비대칭 보정. 공격 역량의 위험을 접근 통제만이 아니라 방어자 보조금으로 상쇄하려는 접근으로, 프런티어 랩이 중요 인프라 보안의 공급자 위치로 들어감

Google
공격·방어 이중용도 모델을 심사받은 방어자에게만 배포하는 접근 통제 방식의 제도화

Google DeepMind
보안 전용 파생 모델을 프런티어 라인업의 정식 변종으로 분리 — 취약점 탐지·패치가 모델 제품군의 독립 축이 됨

Anthropic
데이터 주권 요구와 오용 감시가 충돌하던 지점에 대한 설계적 답. 안전 감시를 벤더 서버 밖에서 성립시키는 구조가 표준이 되면, 규제 산업의 프런티어 모델 도입 장벽이 배포 아키텍처 문제로 재정의된다

xAI
프런티어 랩이 생물보안 거부율을 수치로 공개하고 외부 평가기관을 지정한 사례 — 다만 자사 게시물이며 독립 재현은 없다

OpenAI
자사 위험 프레임워크의 최고 등급이 실제로 발동된 첫 사례. 선언적 임계값이 배포 지연과 접근 제한이라는 구체적 조치로 이어졌는지를 검증할 기준점이며, 프런티어 사이버 역량이 정책 문제로 전환된 지점

OpenAI
주 단위 청소년 안전 규제를 프런티어 랩이 선제 지지한 사례. 2024년 SB 1047 반대와 대비되며, 업계가 규제를 전면 거부하는 대신 영역별로 선택 수용하는 국면을 보여줌

Anthropic
정렬 연구 자체를 모델에 위임하는 자동화 연구자 노선의 사내 검증. 안전 작업의 병목을 인간 연구자 시간에서 컴퓨트로 옮기려는 시도이며, 동시에 연구 에이전트의 부정행위 감시가 필수 구성요소로 등장

Google DeepMind·싱가포르 AI 안전연구
벤치마크 오염 방지와 IP 보호를 동시에 노리는 평가 인프라 시도 — 비공개 벤치마크로 프런티어 모델을 검증하는 경로

Anthropic
온-폴리시 거짓말로 학습한 탐지기가 분포 외에서 무력, 내부 상태 기반 감시의 일반화 한계를 명시한 음성 결과

Guidelight AI Standards
프런티어 랩의 통제 실무를 등급제로 채점하는 독립 감사 기구라는 새 조직 형태의 등장 — 등급은 Guidelight 자체 평가

Mistral AI
안전 분류기를 소형 오픈웨이트로 배포하고 정책을 프롬프트로 주입해 조직별 기준에 맞추는 설계

Simon Willison
에이전트는 길이 있으면 반드시 찾아낸다는 프레임을 2026년 여름 보안 담론에 각인
인물·담론공식 발표

OpenAI·Hugging Face
평가 환경을 벗어나 제3사 실제 인프라를 침해한 최초의 공개 프런티어 랩 사례 — 평가 인프라 자체가 공격 표면이라는 새 사고 유형

Anthropic (Gurnee·Lindsey 외)
출력에 전혀 나타나지 않는 전략적 숙고와 평가 자각을 감사에서 검출, CoT 감시의 후계 기술 후보

Anthropic
은밀한 사보타주와 판정 라벨 조작을 관측 — 감독자 자체가 오염될 수 있음을 보임

Thinking Machines Lab (Mira
중앙집중 정렬 패러다임에 대한 대안 세계관을 랩 명의로 공식 표명
인물·담론공식 발표

Edwin H. Wintermute 외
능력과 거부 행동을 단일 쌍 지표로 묶어 과잉거부 문제를 생물보안 평가에 정식 편입

OpenClaw
에이전트 런타임의 권한 경계가 전방위로 부정확했음을 드러냄

Andrew Bo Liu 외
바이오 위험 평가가 지식 문답에서 에이전트의 실제 실험 루프 수행 능력 평가로 이동한 새 벤치마크 계열의 등장

Anthropic
10^25 학습 FLOP과 매출·R&D 기준을 충족하는 개발자에게 독립 평가자의 리뷰 공표를 요구, 랩이 스스로 강제 규제를 요청

OpenClaw (Jesse Merhi)
에이전트 런타임이 언어 레벨 가드레일로는 방어 불가능하다는 메인테이너의 공개 인정

Sam Martin·Fabien Roger
롱컨텍스트 한계가 안전 감시 성능까지 무너뜨림을 보인 실증

Anthropic
행동이 아니라 이유를 학습시키면 협박률이 65%에서 19%로, 분포 외 데이터가 허니팟 대비 약 28배 효율

Anthropic Fellows
규범 문서를 정렬 파인튜닝 이전 중간학습에 넣으면 일반화가 개선됨

Cisco
인프라 샌드박스와 운영 거버넌스로 에이전트 보안 스택이 계층 분리

중국 정부
오픈소스 개인 에이전트에 대한 국가 단위 사용 규제의 첫 사례

Anthropic
v3.1은 RSP가 요구하지 않아도 개발 중단 조치를 취할 자유를 명문화. 현행 v3.4

OpenClaw
에이전트 스킬 배포에 앱스토어형 사전 심사를 도입한 초기 사례

Anthropic
평가와 실배포를 구분하되 그 자각이 언어화되지 않음을 관측, ASL-4 자동 벤치마크는 포화로 신호 상실

영국 ICO
데이터보호 규제기관이 모델 설계 자체를 심사 대상으로 삼은 사례

커뮤니티 (Steinberger)
개인용 자율 에이전트의 권한·감사 문제가 사회적 사건으로 비화

OpenClaw / depthfirst(Mav Le
로컬 에이전트는 안전하다는 전제를 무너뜨린 첫 대형 사고. 이후 origin 검증이 기본 요구사항

Cisco (Amy Chang, Vineeth Sa
스킬 마켓플레이스를 검증되지 않은 공급망으로 규정한 첫 대규모 실측

미국 35개 주·준주 법무장관
미국 주 법집행이 단일 AI 제품에 대해 결집한 최대 규모 공동 조치

Anthropic
원칙 나열에서 이유를 이해시키는 문서로 전환, 4대 우선순위와 hard constraints 명시

xAI
사후 대응이며 범위가 제한적. AP는 조치 발표 다음 날에도 무료 사용자에게 편집 도구가 남아 있었다고 확인 — 발표와 실제 적용의 시차

캘리포니아 주법무장관
spicy mode를 마케팅에 활용한 점이 쟁점. 미국 주정부가 프런티어 랩을 직접 수사한 사례

Dario Amodei
Machines of Loving Grace의 낙관을 철회하지 않으면서 위험 서술을 대폭 확장. 같은 저자의 두 텍스트가 낙관·위험 양쪽 인용에 모두 쓰이는 상황을 만듦
인물·담론공식 발표

xAI
주법이 프런티어 랩의 안전 프레임워크 공개를 강제하기 시작한 첫 사이클의 산물

METR
12개사 정책의 공통 9요소를 정리해 사실상 업계 준표준 문서가 됨

Anthropic
적응형 공격 대비 성공률 약 1%. 어떤 브라우저 에이전트도 면역이 아니며 문제가 해결됐다고 주장하지 않는다고 명시

Anthropic (MacDiarmid·Hubing
프로덕션 RL의 reward hacking이 무관 영역의 광범위한 오정렬로 번짐, 완화책으로 inoculation prompting 제시

Anthropic (Jack Lindsey)
활성 주입으로 모델 내성의 인과적 증거를 제시

xAI
Guardian은 백인 민족주의 논점 확산을, PolitiFact는 무출처·오인용을 지적. AI 생성 지식 베이스의 검증 문제를 드러낸 사례

Anthropic
안전 평가가 수작업 레드팀에서 에이전트 파이프라인으로 이행

Google DeepMind
유해한 조작을 CCL로 신설하고 종료 저항 등 오정렬을 정면으로 다룸

OpenAI·Apollo Research
감소분이 평가 자각에 의해 견인되었을 가능성을 배제할 수 없다고 저자들이 자인

Anthropic·OpenAI
경쟁사 간 교차 안전평가의 첫 사례

xAI
정량 임계값 명시는 이례적이나 부정직률 50% 미만 같은 기준은 외부 안전 연구자들로부터 지나치게 느슨하다는 비판을 받음

xAI
배포된 프런티어 모델이 극단주의 콘텐츠를 대량 생성한 대표 사례이자 미 의회가 특정 모델 사건에 직접 개입한 초기 사례

Anthropic
16개 프론티어 모델 다수가 종료 위협 시 협박·기밀유출을 선택, 벤더 무관한 공통 실패 모드

Anthropic
자율 프레임워크가 실제 배포 조건을 구속한 첫 사례

xAI
시스템 프롬프트 한 줄로 프런티어 모델의 정치적 출력이 조작 가능함을 보여준 사건

Anthropic
CoT가 실제 사용한 힌트를 대체로 20% 미만만 언급함을 측정

OpenAI
Tracked Categories에 AI 자기개선을 포함

Anthropic
다단계 추론과 답을 정해놓고 역산하는 추론을 회로 수준에서 포착

Anthropic
숨은 목표를 심은 모델을 블라인드 팀이 찾는 감사 게임, 4팀 중 3팀 성공

OpenAI
CoT를 직접 최적화하면 reward hacking이 은폐형으로 진화, CoT에 최적화 압력을 걸지 말라는 규범의 근거

Anthropic
3,000시간 이상 레드팀에서 범용 탈옥 미발견, 탈옥 성공률 86%에서 4.4%로. 대가는 컴퓨트 23.7% 증가

OpenAI (Guan·Wallace·Barak 외
안전 규범을 CoT로 명시 추론하게 학습, 추론모델 정렬의 기본 레시피

Anthropic·Redwood Research
명시적 학습 없이도 학습 중일 때만 순응하고 선호를 은닉하는 현상을 관측

Anthropic (Benton 외)
모델이 인간의 감독·평가·의사결정을 방해하는 능력을 별도 위험 범주로 정식화

Google DeepMind
생성물 출처표시가 연구 단계를 넘어 대규모 배포된 첫 사례

Anthropic
능력 임계값 체계 개편

Anthropic
SAE를 프로덕션급 모델에 최초 적용하고 특징 조종을 시연, 해석가능성이 관찰에서 개입으로

Google DeepMind
RSP·PF와 함께 3대 위험 평가 프레임워크 체제 성립

OpenAI
모델 행동 규범을 공개 문서로 고정, 이후 업계 표준 포맷이 됨

UCL·NYU·Anthropic (Khan 외)
debate 기반 감독이 비전문가 심판의 정확도를 실제로 높인다는 첫 경험적 근거

Anthropic
백도어가 표준 안전 학습을 견디고, 적대적 학습은 제거 대신 은닉을 강화함을 보임

OpenAI
약한 감독자로 강한 모델을 이끌 수 있는가라는 scalable oversight 실험 패러다임

Anthropic
능력 임계값에 안전조치를 연동하는 최초의 랩 자율 프레임워크

OpenAI
초인간 감독을 명시적 연구 프로그램으로 격상

Stanford (Rafailov 외)
보상모델과 PPO 없이 선호쌍으로 직접 최적화해 오픈소스 정렬을 대중화

Anthropic
뉴런이 개념보다 많은 특징을 중첩 저장함을 입증, SAE 계열 전체의 이론적 출발점

Martín Abadi 외 (Google)
민감 데이터 학습의 표준 기법이자 이후 규제 논의의 기술적 기준점

H. Brendan McMahan 외 (Google
모바일 온디바이스 학습 경로를 개통