정리 노트학습 데이터·후속학습
자율주행 데이터 플라이휠은 곱셈으로 돈다
자율주행 개발 운영 체계를 공개한 자리에서 핵심으로 꼽히는 것은 데이터 플라이휠의 속도가 규모·품질·효율·운영의 합이 아니라 곱으로 결정되며 하나라도 0에 가까우면 전체가 멈춘다는 프레임이다. 수집 차량 40여 대가 주당 80시간씩 데이터를 모으지만 절반 가까이가 직진 정속 주행이라 학습 가치가 낮고, 그래서 모델이 어려워하는 샘플만 자동으로 선별하는 하드 마이닝이 필요하다는 진단이 이어진다. 기록 체계는 수동 요청, 급가속·급제동 감지, 자율주행 해제라는 세 가지 트리거로 이벤트 전후 15초만 잘라 센서와 모델 중간 출력까지 함께 저장하고 어노테이션까지 자동 처리한다. 검증은 실제 주행 데이터를 3D Gaussian Splatting으로 재구성한 클로즈드 루프에서 이뤄지고, 1억 파라미터급 모델을 양자화해 수 밀리초 지연 안에 밀어 넣는다. 다만 자사 발표라 개입률 같은 비교 가능한 성능 수치는 하나도 없다는 점을 감안해야 한다.
기억할 것
- 수집 차량 40여 대에 차량당 주 80시간, 그중 절반 가까이가 학습 가치 낮은 직진 정속 주행
- 이벤트 전후 15초만 남기는 세 가지 트리거 기록 체계와 자동 어노테이션 파이프라인
- 1억 파라미터급 모델을 양자화해 수 밀리초 지연을 맞추고 가드레일 의존도는 점차 축소
- 양산 일정은 L2+ 2028년 상반기, L2++ 2028년 하반기, 자체 모델 적용은 2029년 하반기
이 글은 제가 여러 자료를 읽고 제 말로 다시 정리한 노트예요. 출처 링크를 달지 않는 대신, 사실 확인이 된 사건은 기록에 따로 있어요.