この問題のテーマ・前提知識
- テーマ: ベイズ推定・共役事前分布・MAP推定量・ベータ−二項モデル
- 前提知識: ベイズの定理 / ベータ分布の性質 / 二項分布の尤度関数 / 正規分布の共役事前分布
問題の概要
ベイズ推定に関する2大問。[1] 二項モデルにベータ事前分布を適用し、事後分布のパラメータ(\(\alpha_1, \beta_1\))とMAP推定量を対数微分で求める。[2] 正規モデルで事後分布が正規分布になることを確認し、具体的な観測値から事後分布の平均・分散を計算する。
解説
解法の方針:[1] 尤度 \(\propto \theta^{x_0}(1-\theta)^{n-x_0}\) と事前分布 \(\propto \theta^{\alpha_0-1}(1-\theta)^{\beta_0-1}\) の積から事後分布がベータ分布になることを示し(共役性)、\(\alpha_1=x_0+\alpha_0\)、\(\beta_1=n-x_0+\beta_0\) を読み取る。MAP推定量は対数事後密度を微分してゼロと置いて求める。[2] 正規事前分布と正規尤度の積が正規分布になる共役性を利用し、事後分布の平均・分散を計算する。
[1]
[1-1]
(A)と(B)
[1-2]
\(X=x_0\) が得られたときの二項分布の確率関数を \(p(X=x_0|n, \theta)\) とおくと、
\[p(X=x_0|n, \theta)={}_nC_{x_0}\theta^{x_0}(1-\theta)^{n-x_0}\]
よって、\(\theta\) の事後分布 \(f(\theta|x_0)\) は、
\begin{eqnarray}
f(\theta|x_0) &\propto& p(X=x_0|n, \theta)f(\theta|\alpha_0, \beta_0) \\
&=& {}_nC_{x_0}\theta^{x_0}(1-\theta)^{n-x_0} × \frac{1}{B(\alpha_0, \beta_0)}\theta^{\alpha_0-1}(1-\theta)^{\beta_0-1} \\
&\propto& \theta^{x_0+\alpha_0-1}(1-\theta)^{n-x_0+\beta_0-1}\\
\end{eqnarray}
と書けるから、\(\alpha_1=x_0+\alpha_0, \beta_1=n-x_0+\beta_0\) と表せる。
[1-3]
事後密度関数を \(\theta\) で微分すると、
\begin{eqnarray}
\frac{\partial \log f(\theta | x_0)}{\partial \theta} &=& \frac{\partial}{\partial \theta} \left( (x_0 + \alpha_0 – 1) \log \theta + (n – x_0 + \beta_0 – 1) \log (1 – \theta) \right) \\
&=& \frac{x_0 + \alpha_0 – 1}{\theta} – \frac{n – x_0 + \beta_0 – 1}{1 – \theta} \\
&=& \frac{(x_0 + \alpha_0 – 1)(1 – \theta) – (n – x_0 + \beta_0 – 1)\theta}{\theta(1 – \theta)} \\
&=& \frac{(x_0 + \alpha_0 – 1) – (x_0 + \alpha_0 – 1 + n – x_0 + \beta_0 – 1)\theta}{\theta(1 – \theta)} \\
&=& \frac{(x_0 + \alpha_0 – 1) – (n + \alpha_0 + \beta_0 – 2)\theta}{\theta(1 – \theta)}
\end{eqnarray}
上記において、\(\frac{\partial \log f(\theta | x_0)}{\partial \theta}=0\) を解くと、
\begin{eqnarray}
\frac{\partial \log f(\theta | x_0)}{\partial \theta} &=& 0 \\
\frac{(x_0 + \alpha_0 – 1) – (n + \alpha_0 + \beta_0 – 2)\theta}{\theta(1 – \theta)} &= 0 \\ (x_0 + \alpha_0 – 1) – (n + \alpha_0 + \beta_0 – 2)\theta &=& 0 \\
(n + \alpha_0 + \beta_0 – 2)\theta &=& x_0 + \alpha_0 – 1 \\
\theta &=& \frac{x_0 + \alpha_0 – 1}{n + \alpha_0 + \beta_0 – 2}
\end{eqnarray}
となり、事後密度関数を最大にする \(\theta\) は \(\frac{x_0 + \alpha_0 – 1}{n + \alpha_0 + \beta_0 – 2} \) である。
[2]
[2-1]
観測値とパラメータの事前分布がどちらも正規分布のため、事後分布は正規分布に従う。
よって、(B)が正しい。
[2-2]
事後密度関数は、
\begin{eqnarray}
f(\mu \mid X_2 = 2.3, X_3 = 4.2, X_4 = 1.5) &\propto& \exp \left\{ -\frac{5}{8}\left(\mu – \frac{3}{5}\right)^2 – \frac{1}{8}(2.3 – \mu)^2 – \frac{1}{8}(4.2 – \mu)^2 – \frac{1}{8}(1.5 – \mu)^2 \right\} \\
&\propto& \exp \left\{ -\left(\mu – \frac{11}{8}\right)^2 \right\}
\end{eqnarray}
と書けるから、事後分布は \(N\left(\frac{11}{8}, \frac{1}{2}\right)\) である。
よくある質問
Q. 共役事前分布を使う利点は何ですか?
事後分布が事前分布と同じ分布族に属するため、パラメータの更新が代数的に計算できる(数値積分不要)。ベータ−二項モデル、正規−正規モデルなどが代表例。
Q. MAP推定量と最尤推定量はどのような関係にありますか?
事前分布が一様分布の場合、MAP推定量は最尤推定量と一致する。ベータ事前分布では \(\hat{\theta}_\text{MAP}=(x_0+\alpha_0-1)/(n+\alpha_0+\beta_0-2)\) であり、\(\alpha_0=\beta_0=1\)(一様)のとき \(x_0/n\) となる。
Q. 事後平均とMAP推定量のどちらを使うべきですか?
損失関数が二乗誤差なら事後平均、絶対誤差なら事後中央値、0-1損失ならMAPが最適。事後分布が対称なら三者はほぼ一致するため、対称性を確認してから選択する。



コメント