相反的設計,為何都可能奏效?
有些二值量化系統先隨機旋轉向量,另一些保留原始座標軸;相同位元數下,不同表示的檢索品質也相差甚遠。論文從對比學習嵌入的統計性質研究這些現象。
區分共變異數與座標異質性
在高斯模型下,完整共變異數結構影響排序保真度;只看邊際變異數,會遺漏跨座標累積的訊號。不均勻的座標變異數,決定幅度位元能補充多少資訊,以及隨機旋轉會帶來幫助還是消除有用結構。
旋轉能使變異數更均勻,有利於各向同性距離校正,也可能抹除另一種編碼所利用的異質性。論文推導近似保真度公式,並提出跨模型與維度的經驗縮放關係。
把表示結構化為設計依據
涵蓋 9 個嵌入家族與 18 個資料集的實驗,檢驗共變異數、幅度位元及旋轉的作用。在明確的高斯模型及近似條件下,結果為編碼與前處理的選擇提供統計依據。
閱讀與引用
繼續閱讀論文原文。
完整推導、實驗設定與結果,請參閱公開論文。