한국어EN
임베딩·벡터 검색Aurélien Lac, Tony Wu

NeoMME 공개

NeoMME 공개 — ColPali 류 시각 문서 검색기가 생성용 VLM(별도 사전학습된 비전 인코더+인과적 LM)을 인코더로 전용하며 비생성 과제에 파라미터·연산 오버헤드를 떠안는다고 지적하고, 다국어 텍스트와 원본 이미지 패치를 하나의 양방향 트랜스포머 인코더로 처리하는 260M·800M 멀티모달 다국어 인코더 계열을 제시. 이미지 패치를 조건으로 한 마스크드 이산 확산 텍스트 목적함수로 사전학습하고 16,384 토큰 컨텍스트를 지원하며, 밀집·late-interaction 헤드를 함께 미세조정한 NeoMME-Retriever가 ViDoRe v3에서 260M 0.523·800M 0.556 nDCG@10 기록. Apache 2.0으로 Hugging Face Transformers를 통해 공개

왜 중요한가

생성 모델을 검색기로 재활용하던 ColPali 계보 대신 처음부터 인코더로 설계한 단일 타워로 되돌아간 갈래 — 멀티모달 검색에서 '인코더 전용'이 다시 유효하다는 주장. 저자 자체 보고로 동일 해상도에서 ColModernVBERT 대비 약 2배 인코딩 처리량, 계층적 토큰 풀링과 비대칭 양자화로 255배 압축에서도 기준 성능 95% 이상 유지.

출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요 논문arxiv.orghttps://arxiv.org/abs/2609.016572026년 8월 31일에 더한 조각 · 그 주 보기