最尤推定の公式|尤度関数・対数尤度の微分・正規分布・ポアソン分布の最尤推定量と例題【大学院入試・数理統計】

最尤推定の公式|尤度関数・対数尤度の微分・正規分布・ポアソン分布の最尤推定量と例題【大学院入試・数理統計】

合格大作戦 算数・数学公式辞典 › 場合の数・確率

大学院入試

θ^=arg⁡max⁡θ∏i=1nf(xi;θ)\hat\theta=\mathop{\arg\max}_{\theta}\prod_{i=1}^{n}f(x_i;\theta)

対数をとって ddθlog⁡L(θ)=0\dfrac{d}{d\theta}\log L(\theta)=0 を解くのが基本

この公式のポイント

  • データが出る確率(密度)の積を最大にする
  • 対数をとって微分(積が和になる)
  • 正規分布の σ^2\hat\sigma^2 は nn で割る(不偏ではない)
  • 一様分布などは微分では求まらない
うかるくん

うかるくん

最尤推定で、尤度の対数をとってから微分するのはなぜ?

合格先生

合格先生

log⁡\log は増加関数だから、最大になる場所は変わらない。しかも積が和になって、微分がぐっと楽になるんだ。

最尤推定の考え方と公式

データ x1,⋯ ,xnx_1,\cdots,x_n が得られたとき、「このデータが出る確率(密度)がいちばん大きくなるパラメータ」を推定値にするのが最尤(さいゆう)推定です。

最尤推定量

確率関数(または密度)f(x;θ)f(x;\theta) から独立に得たデータ x1,⋯ ,xnx_1,\cdots,x_n について

L(θ)=∏i=1nf(xi;θ)(尤度関数),ℓ(θ)=log⁡L(θ)=∑i=1nlog⁡f(xi;θ)L(\theta)=\prod_{i=1}^{n}f(x_i;\theta)\quad(\text{尤度関数}),\qquad\ell(\theta)=\log L(\theta)=\sum_{i=1}^{n}\log f(x_i;\theta)

L(θ)L(\theta) を最大にする θ^\hat\theta が最尤推定量。多くの場合、尤度方程式 dℓdθ=0\dfrac{d\ell}{d\theta}=0 を解いて求める。

代表的な結果

ベルヌーイ: p^=kn,ポアソン: λ^=xˉ,指数分布: λ^=1xˉ\text{ベルヌーイ}:\ \hat p=\frac kn,\qquad\text{ポアソン}:\ \hat\lambda=\bar x,\qquad\text{指数分布}:\ \hat\lambda=\frac1{\bar x}正規分布: μ^=xˉ,σ^2=1n∑i=1n(xi−xˉ)2\text{正規分布}:\ \hat\mu=\bar x,\qquad\hat\sigma^2=\frac1n\sum_{i=1}^{n}(x_i-\bar x)^2
pL(p)00.50.71最大:p=0.7(傾き 0)p=0.5 だと約半分10回中7回表のとき L(p)=p⁷(1−p)³「このデータが出る確率」が最大になる p を推定値にする
10回中7回表:尤度 L(p)=p7(1−p)3L(p)=p^7(1-p)^3 は p=0.7p=0.7 で最大

log⁡\log は増加関数なので、LL と ℓ=log⁡L\ell=\log L は同じ θ\theta で最大になります。積が和になるので、対数をとってから微分するのが基本の手順です。

なぜその式になるのか(証明)

① ベルヌーイ(コイン):p^=kn\hat p=\dfrac kn

nn 回中 kk 回成功なら L(p)=pk(1−p)n−kL(p)=p^k(1-p)^{n-k}、ℓ(p)=klog⁡p+(n−k)log⁡(1−p)\ell(p)=k\log p+(n-k)\log(1-p)(0<k<n0<k<n とする)。

ℓ′(p)=kp−n−k1−p=k−npp(1−p)\ell'(p)=\frac kp-\frac{n-k}{1-p}=\frac{k-np}{p(1-p)}

p<knp<\dfrac kn で ℓ′>0\ell'>0、p>knp>\dfrac kn で ℓ′<0\ell'<0 なので、p=knp=\dfrac kn で最大です(増減表で確かめる)。直観どおり「成功した割合」が推定値になります。

② 正規分布:μ^=xˉ\hat\mu=\bar x、σ^2=1n∑(xi−xˉ)2\hat\sigma^2=\dfrac1n\sum(x_i-\bar x)^2

v=σ2v=\sigma^2 とおくと

ℓ(μ,v)=−n2log⁡(2πv)−12v∑i=1n(xi−μ)2\ell(\mu,v)=-\frac n2\log(2\pi v)-\frac1{2v}\sum_{i=1}^{n}(x_i-\mu)^2

μ\mu で偏微分して 00:1v∑(xi−μ)=0\dfrac1v\sum(x_i-\mu)=0 より μ^=xˉ\hat\mu=\bar x。どの vv でも ∑(xi−μ)2\sum(x_i-\mu)^2 は μ=xˉ\mu=\bar x で最小なので、これが μ\mu についての最大です。

次に μ=xˉ\mu=\bar x として vv で微分して 00:−n2v+S2v2=0-\dfrac n{2v}+\dfrac{S}{2v^2}=0(S=∑(xi−xˉ)2S=\sum(x_i-\bar x)^2)より v^=Sn\hat v=\dfrac Sn。v<Snv<\dfrac Sn で増加、v>Snv>\dfrac Sn で減少なので最大です。

0246810μ=5μ=3μ=5(データの平均):赤い縦線の高さの積が最大μ=3:積は μ=5 のときの約 1/12赤い点:データ 2, 3, 5, 6, 9(σ=2 とする)
正規分布の μ\mu の最尤推定:各データでの密度の高さの積が最大になるのは μ=xˉ\mu=\bar x

③ σ^2\hat\sigma^2 は不偏ではない

X1,⋯ ,XnX_1,\cdots,X_n が独立で平均 μ\mu、分散 σ2\sigma^2 のとき、∑(Xi−Xˉ)2=∑(Xi−μ)2−n(Xˉ−μ)2\displaystyle\sum(X_i-\bar X)^2=\sum(X_i-\mu)^2-n(\bar X-\mu)^2 と変形でき、E[(Xi−μ)2]=σ2E[(X_i-\mu)^2]=\sigma^2、E[(Xˉ−μ)2]=V[Xˉ]=σ2nE[(\bar X-\mu)^2]=V[\bar X]=\dfrac{\sigma^2}{n} なので

E[∑i=1n(Xi−Xˉ)2]=nσ2−σ2=(n−1)σ2E\left[\sum_{i=1}^{n}(X_i-\bar X)^2\right]=n\sigma^2-\sigma^2=(n-1)\sigma^2

よって E[σ^2]=n−1nσ2E[\hat\sigma^2]=\dfrac{n-1}{n}\sigma^2 で、少し小さめに偏ります。偏りをなくしたのが不偏分散 s2=1n−1∑(xi−xˉ)2s^2=\dfrac1{n-1}\sum(x_i-\bar x)^2 です。

大学院入試では

院試では「尤度関数を書く → 対数をとる → 微分して0 → 最大であることを確かめる」の4段を答案に書けるかが問われます。

大学院入試

例題1(ポアソン分布)

ポアソン分布 Po(λ)\mathrm{Po}(\lambda) から独立に得たデータ x1,⋯ ,xnx_1,\cdots,x_n について、λ\lambda の最尤推定量を求めなさい。また、データが 2, 0, 3, 1, 42,\ 0,\ 3,\ 1,\ 4 のときの推定値を求めなさい。

解き方

L(λ)=∏i=1ne−λλxixi!L(\lambda)=\displaystyle\prod_{i=1}^{n}e^{-\lambda}\dfrac{\lambda^{x_i}}{x_i!}、ℓ(λ)=−nλ+(∑xi)log⁡λ−∑log⁡(xi!)\ell(\lambda)=-n\lambda+\left(\sum x_i\right)\log\lambda-\sum\log(x_i!)。

ℓ′(λ)=−n+∑xiλ=0\ell^{\prime}(\lambda)=-n+\dfrac{\sum x_i}{\lambda}=0 より λ=xˉ\lambda=\bar x。ℓ′\ell^{\prime} は λ<xˉ\lambda<\bar x で正、λ>xˉ\lambda>\bar x で負なので最大(xˉ>0\bar x>0 のとき)。

データでは xˉ=2+0+3+1+45=2\bar x=\dfrac{2+0+3+1+4}{5}=2。

答え λ^=xˉ\hat\lambda=\bar x、推定値は 22

大学院入試

例題2(指数分布)

指数分布(密度 λe−λx\lambda e^{-\lambda x})から得たデータ 1.2, 0.8, 2.5, 1.51.2,\ 0.8,\ 2.5,\ 1.5 について、λ\lambda の最尤推定値を求めなさい。

解き方

ℓ(λ)=nlog⁡λ−λ∑xi\ell(\lambda)=n\log\lambda-\lambda\sum x_i。ℓ′(λ)=nλ−∑xi=0\ell^{\prime}(\lambda)=\dfrac n\lambda-\sum x_i=0 より λ^=n∑xi=1xˉ\hat\lambda=\dfrac{n}{\sum x_i}=\dfrac1{\bar x}(ℓ′\ell^{\prime} は減少関数なのでここで最大)。

∑xi=6.0\sum x_i=6.0、xˉ=1.5\bar x=1.5 より λ^=11.5=23\hat\lambda=\dfrac1{1.5}=\dfrac23。

答え λ^=23\hat\lambda=\dfrac23

大学院入試

例題3(正規分布の平均と分散)

正規分布 N(μ, σ2)N(\mu,\ \sigma^2) から得たデータ 2, 3, 5, 6, 92,\ 3,\ 5,\ 6,\ 9 について、μ, σ2\mu,\ \sigma^2 の最尤推定値と、不偏分散を求めなさい。

解き方

μ^=xˉ=255=5\hat\mu=\bar x=\dfrac{25}{5}=5。

偏差は −3, −2, 0, 1, 4-3,\ -2,\ 0,\ 1,\ 4 で、2乗の和は 9+4+0+1+16=309+4+0+1+16=30。

σ^2=305=6\hat\sigma^2=\dfrac{30}{5}=6、不偏分散 s2=304=7.5s^2=\dfrac{30}{4}=7.5。

答え μ^=5\hat\mu=5、σ^2=6\hat\sigma^2=6(不偏分散は 7.57.5)

学部の授業とのつながり・院試での注意

  • どの授業で習うか:「数理統計学」「統計学」の点推定で学びます。機械学習でも、ロジスティック回帰などのパラメータを決める基本の考え方として出てきます。
  • 答案で示すべきこと:①尤度関数 L(θ)L(\theta) ②対数尤度 ℓ(θ)\ell(\theta) ③尤度方程式とその解 ④それが最大であること(増減か2階微分の符号)。④を書き忘れる答案が多いです。
  • よくある出題の形:ポアソン・指数・正規・幾何分布の最尤推定量/不偏性の判定(E[θ^]=θE[\hat\theta]=\theta か)/一様分布 U(0, θ)U(0,\ \theta) のように微分では求まらない場合(練習問題1)/信頼区間・検定との組み合わせ。
  • 性質(証明は略):適当な条件のもとで、最尤推定量は n→∞n\to\infty で真の値に近づき(一致性)、分布は正規分布に近づくことが大学の授業で示されます。

よくある間違い

腕でバツを作る合格先生

合格先生

何でも微分して0とするな。一様分布 U(0, θ)U(0,\ \theta) では微分が0の点はなく、最大のデータが推定値だぞ。

  • 何でも微分して0とする:一様分布 U(0, θ)U(0,\ \theta) の尤度は θ≥max⁡xi\theta\ge\max x_i で θ−n\theta^{-n}(減少)なので、微分が0になる点はなく、θ^=max⁡xi\hat\theta=\max x_i です。
  • σ^2\hat\sigma^2 を不偏分散と思う:最尤推定量は nn で割り、不偏分散は n−1n-1 で割ります。E[σ^2]=n−1nσ2E[\hat\sigma^2]=\dfrac{n-1}{n}\sigma^2 です。
  • 尤度を足し算で書く:独立なデータの尤度は密度の積です。和になるのは対数をとったあとです。

練習問題

ひらめいたうかるくん

うかるくん

最大になることの確認も書くんだね。

  1. 大学院入試 一様分布 U(0, θ)U(0,\ \theta)(密度 1θ\dfrac1\theta、0≤x≤θ0\le x\le\theta)から得たデータ 3.1, 0.4, 2.2, 4.73.1,\ 0.4,\ 2.2,\ 4.7 について、θ\theta の最尤推定値を求めなさい。
    答えと解説を見るL(θ)=θ−4L(\theta)=\theta^{-4}(θ≥\theta\ge すべてのデータ)、それ以外は 00。θ−4\theta^{-4} は減少関数なので、できるだけ小さい θ\theta、つまり最大のデータで最大。答え θ^=4.7\hat\theta=4.7
  2. 大学院入試 ある試行を20回行ったところ6回成功した。成功確率 pp の最尤推定値を求めなさい。
    答えと解説を見るℓ(p)=6log⁡p+14log⁡(1−p)\ell(p)=6\log p+14\log(1-p)、ℓ′(p)=6p−141−p=0\ell^{\prime}(p)=\dfrac6p-\dfrac{14}{1-p}=0 より p=620p=\dfrac{6}{20}。答え p^=0.3\hat p=0.3
  3. 大学院入試 幾何分布 P(X=k)=(1−p)k−1pP(X=k)=(1-p)^{k-1}p(k=1,2,⋯k=1,2,\cdots)から得たデータ 3, 1, 4, 23,\ 1,\ 4,\ 2 について、pp の最尤推定値を求めなさい。
    答えと解説を見るℓ(p)=(∑ki−n)log⁡(1−p)+nlog⁡p\ell(p)=\left(\sum k_i-n\right)\log(1-p)+n\log p、ℓ′=0\ell^{\prime}=0 より p^=n∑ki=1kˉ\hat p=\dfrac{n}{\sum k_i}=\dfrac1{\bar k}。kˉ=2.5\bar k=2.5 なので答え p^=0.4\hat p=0.4

関連する公式

よくある質問

最尤推定とは?

得られたデータが出る確率(密度)の積である尤度関数を考え、それを最大にするパラメータの値を推定値とする方法です。

なぜ対数をとるのですか?

logは増加関数なので最大になる場所は変わりません。積が和になって微分しやすくなるからです。

正規分布の分散の最尤推定量と不偏分散の違いは?

最尤推定量は偏差の2乗和をnで割り、不偏分散はn−1で割ります。最尤推定量の期待値は(n−1)σ²/nで、少し小さめに偏ります。

尤度方程式が使えないのはどんなときですか?

一様分布U(0,θ)のように、尤度が範囲の端で最大になるときです。この場合は最大のデータが最尤推定量になります。

あわせて読みたい

出典・参考

  • 大学初年級の数理統計学(点推定)

最終更新:2026年10月11日/作成:大学受験合格大作戦