VECTOR SEARCH / ARXIV:2609.09854

압축된 벡터는 언제 같은 결정을 내릴까요?

When Does Low-Bit Quantization Preserve the Decisions of Vector Search?

벡터 검색이 실제로 수행하는 순위 비교와 그래프 가지치기 안에서 양자화 오차를 분석하고, 신뢰성을 비교 마진, 상관된 잔차, 실행 경로와 연결합니다.

양자화 오차가 결정 경계를 넘을 때만 비교 결과가 바뀝니다.

거리 오차에서 구체적인 선택으로

벡터 검색은 어느 후보가 더 가까운지, 어느 간선을 남길지 반복해서 결정합니다. 평균 오차와 전역 순위 상관만으로는 이런 국소 결정이 실패하는 이유를 설명할 수 없어, 알고리즘이 실제 수행하는 비교 자체를 분석합니다.

핵심은 후보 사이의 원래 마진과 양자화 오차가 이를 넘을 수 있는지입니다. 결정 경계 근처의 위험과 보정된 잔차의 꼬리 거동을 분리하며, 공유 쿼리나 그래프 노드에서 생기는 상관도 포함합니다.

국소 결정을 그래프 실행 경로와 연결

후보 순서가 고정된 Vamana 이웃 선택에서, 개별 가지치기 결정의 일치가 고정된 정확 상태에서 최종 이웃 목록의 일치와 어떻게 연결되는지 설명합니다.

분포 가정을 신뢰하기 어려울 때는 독립된 검증용 블록으로 고정된 양자화 규칙의 위험을 추정합니다. 이진 코드, RaBitQ, Lucene BBQ, 곱 양자화를 같은 의사결정 인터페이스로 연구할 수 있습니다.

검색 과정에 맞는 양자화 선택

학습된 표현, 전통적 표현, 합성 표현에서 정규화된 비교 마진은 전역 순위 상관보다 순위와 가지치기 반전을 더 잘 예측합니다. 분석 범위는 고정 후보 집합과 고정 실행 경로이며, 전체 검색 재현율은 후보의 포괄성에도 의존합니다.

읽기와 인용

논문 원문에서 더 살펴보세요.

전체 유도 과정, 실험 설정과 결과는 공개된 원고에서 확인할 수 있습니다.

초록과 버전 기록 ↗
논문 전문 PDF ↗