← 全部研究

RESEARCH / REPRESENTATION GEOMETRY

少到一两个比特,什么信息仍被保留?

Covariance Structure and Coordinate Heterogeneity Govern Binary Quantization of Contrastive Embeddings

从协方差结构与坐标差异出发,解释二值量化的排序能力,以及额外一位和随机旋转为什么在不同表示上作用不同。

相反的设计,为什么都能奏效?

有的二值量化系统先随机旋转向量,有的保留原始坐标轴;同样是一两个比特,不同表示上的检索表现也相差很大。论文从对比学习表示的统计结构出发,分析这些现象背后的共同机制。

坐标各自的变化幅度,以及坐标之间的关系,共同影响压缩后的排序信息。

区分坐标之间的关系与坐标自身的差异

在高斯模型下,完整协方差结构影响排序保真度,仅看各坐标的方差会遗漏坐标间相关性积累的信号。坐标方差的不均匀性则影响设计选择:幅度比特能补充多少信息,随机旋转会帮助还是削弱现有编码。

旋转让方差更均匀,可以适配依赖各向同性的距离校正,也可能消除另一类编码利用的坐标差异。论文据此推导近似排序保真度表达式,并提出跨模型、跨维度的经验缩放关系。

把表示结构变成系统设计的依据

覆盖 9 个嵌入家族、18 个数据集的实验检验了协方差、幅度比特与旋转的作用。研究为编码方式与预处理的选择提供统计依据,其解析预测依赖文中明确的高斯模型和近似条件。

阅读与引用

完整推导、实验设置和结果见论文原文。

Wenxuan Xiao. Covariance Structure and Coordinate Heterogeneity Govern Binary Quantization of Contrastive Embeddings. arXiv:2605.17524, 2026.