평가·벤치마크OpenAI
SWE-bench Verified 공개
SWE-bench Verified 공개 — 개발자 93명이 1,699개 샘플을 3중 주석해 500개 부분집합 구성, 원본의 68.3%를 제외
왜 중요한가
에이전트 코딩 평가의 기준 데이터셋. 원본 벤치마크의 상당수가 부적격이었음을 드러냄
출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요
공식 발표openai.comhttps://openai.com/index/introducing-swe-bench-verified/2026년 8월 24일에 더한 조각 · 그 주 보기
같은 주에 나온 조각08.15Hermes 3공식 발표08.15Graph Retrieval-Augmented Generation논문08.14Prompt caching 공개 베타공식 발표08.13Grok-2 / Grok-2 mini 베타 공개공식 발표