축 ⑤
루프·하네스 엔지니어링
기록 28 · 정리 노트 3 · 관련 축으로 붙은 사건도 함께 보여요.
정리 노트
Herdr는 Orca보다 훨씬 가벼운 원격 터미널 서버로, 터미널만 있으면 리눅스 VM에도 쉽게 설치되고 Ghostty를 꺼도 세션이 그대로 살아 있다. 이를 Grok Bot의 가상 머신에 얹으면 맥북 전원과 무관하게 스마트폰만으로 코딩 에이전트를 상
정리 노트
400개 이상의 프로덕션 에이전트 경험에서 정리됐다는 12-레이어 스택은, 가상의 응급실 트리아지 에이전트에서 각 레이어를 boolean 플래그로 켜고 끄며 실패를 재현하는 방식으로 이해하면 명확하다. 데이터 이해 레이어가 없으면 알레르기 필드가 누락
Zhiyuan Li 외
LLM이 뽑아낸 그래프 간선을 그대로 믿지 않고 반사실 개입으로 간선 가중치를 사후 보정한다는 갈래 — 그래프 검색의 고질적 약점으로 지목돼 온 간선 신뢰도 문제를 검색 이전 단계에서 다룬다. 저자 자체 보고로 6개 LLM에 걸쳐 Graph-of-Skills 대비 ScienceWorld 매크로 평균 72.62→80.50, ALFWorld 성공률 80.01%→86.79%이며 환경 스텝 수는 감소.
정리 노트
Hermes 기반 개인용 멀티에이전트는 소프트웨어를 자율 빌드하는 Coder, Telegram 생산성·건강 코치 LifeBot, 팀 COO 역할의 Taco Bot을 역할별로 분리한 구성이다. Coder는 Mac Studio의 로컬 Qwen 3.6 35
de Macedo (arXiv:2606.10106)
용어 다의성을 학술적으로 문제화, 모델 순응에 의존하지 않는 통제 기제를 조건으로 제시
Zhang 외 (arXiv:2605.23950)
하네스 유발 분산이 모델 유발 분산의 7.80배, 9개 모델쌍 중 6개 순위 역전
Anthropic Labs (Prithvi Raja
Planner-Generator-Evaluator 3에이전트, 단일 에이전트 20분 9달러 대 풀 하네스 6시간 200달러
루프·하네스 엔지니어링공식 발표
Birgitta Böckeler (martinfow
guides/sensors 곱하기 computational/inferential 프레임의 최초 제시
루프·하네스 엔지니어링공식 발표
OpenAI (Ryan Lopopolo)
약 100만 줄 규모 내부 제품을 전량 Codex 작성으로, 5개월간 엔지니어 3~7명이 약 1,500 PR 머지
루프·하네스 엔지니어링공식 발표
METR
방법론 변경만으로 수치가 움직인다는 것을 발행 기관이 스스로 보여준 사례. 최상위 모델 50% 시간지평 약 5.3시간은 이 개정판 기준이며 이전 판과 직접 비교할 수 없다
평가·벤치마크공식 발표
Anthropic (Justin Young)
Claude Agent SDK를 범용 agent harness로 명시, 프런티어 랩이 harness를 정식 용어로 채택한 분기점
루프·하네스 엔지니어링공식 발표
Geoffrey Huntley
컨텍스트를 매 반복 폐기하고 상태를 git과 파일에 두는 루프 엔지니어링의 원형