从距离误差,到一次具体的选择
向量搜索不断做出选择:哪个候选更近,哪条边需要保留。平均误差和全局排序相关性难以解释这些局部选择为何失效。这项研究把分析单位落到算法实际执行的比较上。
关键是两个候选原本相隔多远,以及量化误差是否足以越过这个间隔。论文将比较翻转的风险分解为边界附近的概率质量与校准残差的尾部概率,并纳入共享查询或图节点带来的误差相关性。
把局部决策连接到图的执行轨迹
对固定候选顺序下的 Vamana 邻居选择,论文证明:在冻结的精确状态上,每个候选的剪枝动作一致,当且仅当近似重放得到相同的邻居列表。这样便能把一次局部比较与具体的图结构变化联系起来。
当分布假设难以成立时,独立留出数据块提供另一条路径:为已经固定的量化规则估计选择性失效风险。二值编码、RaBitQ、Lucene BBQ 与乘积量化可以通过同一种决策接口接受分析。
让量化的选择,更贴近搜索本身
在学习型、经典与合成表示上的实验中,标准化比较间隔比全局排序相关性更能预测排序和剪枝的翻转。研究覆盖固定候选集合与冻结执行轨迹;完整搜索的召回率还取决于候选覆盖。
阅读与引用
完整推导、实验设置和结果见论文原文。
Wenxuan Xiao, Xu Cao. When Does Low-Bit Quantization Preserve the Decisions of Vector Search?. arXiv:2609.09854, 2026.