密度比推定

二つの確率分布の違いを扱う問題の多くは、分布そのものではなく比さえ分かれば解けます。密度比推定は、その比をデータから直接推定する方法で、異常検知や共変量シフトへの適応、因果推論の重み付けに共通する基礎です。代表的な成果は、ICML 2021 の Non-negative Bregman Divergence Minimization for Deep Direct Density Ratio Estimation(Kato and Teshima, 2021)です。

扱う問題

それぞれの分布の密度を推定してから割り算をする方法は、分母の推定誤差が比を大きく揺らすため不安定です。そこで、比そのものを一つの関数として推定します。推定は Bregman ダイバージェンスの最小化として統一的に書け、既存の多くの手法がその特別な場合になります。私たちは、この定式化を深層ニューラルネットワークで使うと訓練損失だけが不自然に下がる過学習が生じることを示し、非負化補正で安定させました。

近年は、因果推論でバイアス補正に使われる Riesz regression が、実は密度比推定と同じ構造を持つことを明らかにし、二つの分野をつなげています(Riesz Regression As Direct Density Ratio Estimation)。この方向の全体像は Generalized Riesz Regression のページで説明します。

研究の系列

2023年
Unified Perspective on Probability Divergence via Maximum Likelihood Density Ratio Estimation(AISTATS 2023)。確率ダイバージェンスの推定を密度比の最尤推定として統一。
2021年
Density-Ratio Based Personalised Ranking from Implicit Feedback(WWW 2021)。暗黙のフィードバックからの推薦を密度比で定式化。
2020年
Off-Policy Evaluation and Learning for External Validity under a Covariate Shift(NeurIPS 2020)。共変量シフトの補正への応用。

先行研究との関係

密度比を推定してさまざまな学習問題を解く方法論は、杉山将らの一連の研究が確立し、教科書(Sugiyama, Suzuki, and Kanamori, 2012, Density Ratio Estimation in Machine Learning)にまとまっています。二乗損失による直接推定 uLSIF(Kanamori, Hido, and Sugiyama, 2009, A Least-squares Approach to Direct Importance Estimation)は、その代表的な手法です。私たちの研究は、この方法論を深層モデルへ広げたときの問題の特定と補正、そして因果推論との橋渡しを担っています。

関連テーマ