한국어EN
정리 노트추론 인프라·서빙

문장 대신 확률만 돌려주는 모델 논쟁

질문에 긴 문장으로 답하는 대신 정해진 선택지가 맞을 가능성만 숫자로 돌려주는 모델을 놓고 벌어진 찬반이 양쪽 주장과 함께 정리된다. 비판은 작은 분류 모델로도 같은 일이 되고 속도 비교 조건이 불공정했다는 것이고, 반박의 축은 하드웨어에 있다 — 토큰을 하나씩 만드는 순차 의존은 모델을 줄이거나 연산 장치를 더 붙여도 남으므로 처리량과 응답 지연은 다른 문제라는 설명이다. 그래서 비교 기준을 되느냐가 아니라 같은 정확도에서 어느 쪽이 덜 기다리고 덜 쓰는가로 다시 세우자는 제안이 나오고, 90%라고 한 판단이 실제로도 그만큼 맞아야 어디까지 자동 처리할지 정할 수 있다는 확률 보정 논의가 이어진다. 같은 대기 문제를 전용 칩으로 풀었던 앞선 사례도 나란히 놓인다. 다만 스스로 세운 그 비교 수치를 끝내 제시하지 않아 결론은 논증이 아니라 요청으로 끝난다.

기억할 것
  • 선택지 확률만 돌려주는 출력 형식으로 생성 비용을 줄이는 접근
  • 순차 의존은 연산 장치를 늘려도 사라지지 않는다는 지적
  • 확률 보정 수준이 자동 처리 범위를 정한다는 정리
  • 같은 정확도 기준의 지연·비용 비교치는 끝내 제시되지 않음
응답 지연추론 비용확률 보정전용 가속 하드웨어모델 라우팅

이 글은 제가 여러 자료를 읽고 제 말로 다시 정리한 노트예요. 출처 링크를 달지 않는 대신, 사실 확인이 된 사건은 기록에 따로 있어요.