한국어EN
축 ⑫

학습 데이터·후속학습

기록 46 · 정리 노트 0 · 관련 축으로 붙은 사건도 함께 보여요.


Anthropic
정렬 연구 자체를 모델에 위임하는 자동화 연구자 노선의 사내 검증. 안전 작업의 병목을 인간 연구자 시간에서 컴퓨트로 옮기려는 시도이며, 동시에 연구 에이전트의 부정행위 감시가 필수 구성요소로 등장

Anthropic
사용 실태 데이터를 벤더가 독점하는 구조에 외부 검증 통로를 낸 사례. 발표 자유 조항과 제3자 감사를 명시해 벤더 자체 보고와 구분하려는 설계

D. Mass. (Saylor)
출력 침해 주장이 충분하다고 판단, DMCA 청구 존속

N.D. Cal.
약 40만 권·권당 3,000달러, 적격 저자 91% 이상 청구

NYT·Daily News
쟁점이 공정이용에서 증거 보전과 은닉으로 확장

연방대법원
AI 단독 생성물의 인간 저작자 요건이 확정

Anthropic
증류 분쟁이 의혹에서 정량적 고발로. 소송이 아니라 탐지 공개와 산업 공동 대응을 택한 것이 법적 수단의 한계를 반영

OLG Hamburg
상업적 TDM 예외 적용을 명시하고 자연어 opt-out의 기계가독성 미충족을 인정. BGH 상고 허가로 미확정

Nous Research
분산학습이 가능하다를 넘어 동등 이상이라는 통제 비교를 처음 제시

AI2
데이터와 후속학습 파이프라인을 함께 공개

LG München I
유럽에서 암기를 복제로 인정하고 TDM 예외 적용을 배제한 첫 사례

S.D.N.Y. (Stein)
NYT·Authors Guild 등 7건이 하나의 MDL로

Salesforce AI Research·CMU
continual pretraining 대비 최대 100배 적은 토큰으로 동등 성능, 데이터 고갈에 대한 직접적 기술 답변

Psyche Team
분산학습이 사전학습 데모를 넘어 실제 제품 모델의 후속학습 경로로 편입

Surge·Mercor·Mechanize·Prime
병목이 정적 데이터셋에서 상호작용형 검증 환경으로 이동. 동시에 보상 해킹과 빠른 진부화라는 회의론도 제기

Nous Research
가중치만 여는 관행과 달리 후속학습 데이터까지 공개. 오픈 커뮤니티 재현성의 기준선

Kandpal 외
소송 리스크에 대한 데이터 측 대응, 공개 라이선스만으로 Llama 1·2 7B급 달성

Nous Research / Psyche
인터넷을 통한 최대 규모 사전학습. 비신뢰 참가자 협업을 블록체인 조정으로 해결

미국 저작권청
확정 규칙 제시를 거부하고 시장 희석 이론을 도입. 2026-08 현재 정식판 미발간

OpenAI
ToS 기반 출력 소유권 주장이 처음 국가 정책 문제로 격상

DeepSeek
추론 능력이 폐쇄형 랩의 비밀 레시피가 아님을 증명, 자기검증·재검토·전략 전환이 창발. RLVR과 소형 모델로의 능력 이전 레시피도 같은 보고서에서 공개됐다

Nous Research
예비 보고서 수준의 주장이 재현 가능한 논문·코드로 전환

AI2
선호 학습에서 검증 가능 보상으로의 전환점

Nous Research
데이터센터 인터커넥트 없이 인터넷 대역폭으로 학습한다는 노선의 출발점

Epoch AI
2030년까지 유효 토큰 400조에서 2경, 전력이 먼저 구속하고 다음이 칩 생산능력이라는 순서 제시

Shumailov 외 (Nature)

Hugging Face
LLM 분류기로 교육적 가치를 점수화한 부분집합이 원본보다 나은 모델을 만들어 model-based filtering을 표준화

NVIDIA
데이터 생성 파이프라인 자체가 제품이 됨

Xu 외
증류가 API 호출조차 필요 없는 수준으로 저렴해짐

Epoch AI
데이터 고갈 담론의 정량적 기준점

Meng 외
direct alignment 계열의 마지막 단순화

Hugging Face
오픈 웹 코퍼스의 규모 상한을 갱신

Gerstgrasser 외
실데이터를 대체하면 붕괴하나 누적하면 오차 상한이 유한함을 증명, 모델 붕괴 담론을 재정의

Hong 외
정렬 파이프라인의 추가 단순화

Ahmadian 외
RL 단순화 계열의 대표

DeepSeek
가치함수 없는 그룹 상대 정책 최적화가 이후 추론 모델 RL의 사실상 표준이 됨

Ethayarajh 외
보편적으로 우월한 손실 함수는 없고 설정에 맞는 귀납 편향이 최선이라는 결론

AI2
데이터와 도구를 함께 공개해 데이터 과학을 재현 가능하게 만듦

Yang 외
바꿔쓰기·번역만으로 n-gram 디컨터미네이션이 무력화되고 HumanEval의 8~18%가 공개 코퍼스와 중복

Sainz 외
벤치마크별 오염 측정을 커뮤니티 표준으로 삼자는 제안

Microsoft Research
1.3B를 7B 토큰으로 학습해 HumanEval 50.6%, 데이터 품질이 양보다 중요함을 실증

TII
잘 정제한 웹 데이터만으로 큐레이션 코퍼스를 능가한다는 주장, MinHash 퍼지 중복제거가 표준 기법으로

Together
LLaMA 학습 레시피의 공개 재현으로 폐쇄 모델 데이터의 역설계 시대를 염

UW·AI2 (Wang 외)
모델이 자기 학습 데이터를 만드는 부트스트랩, 합성 데이터 산업의 출발점

EleutherAI
다양성 큐레이션 패러다임. 동시에 Books3 등 저작권 부담을 이후 모델에 전가

Google
Common Crawl을 휴리스틱으로 정제한 최초의 대규모 표준 코퍼스