Newpost

統計分析を理解しよう:正規分布、標準化、標準正規分布の概念 ニッセイ基礎研究所

標準正規分布とは、平均値0、分散1の正規分布のことです。 標準偏差は分散の平方根をとったものですから、標準正規分布においては標準偏差σ=分散σ 2 =1 となります。 確率変数Zが標準正規分布に従うことを などと表します。. 標準正規分布表は、統計学の分野で確率を計算する際に不可欠なツールです。 この表の見方を理解することで、特定のデータがどのくらいの確率で発生するのかを簡単に求められます。 本記事では、統計学の基本となる標準正規分布の考え方から、表の具体的な使い方、標準化の計算方法まで.

正規分布(せいきぶんぷ、英: normal distribution)またはガウス分布(英: Gaussian distribution)は、確率論や統計学で用いられる連続的な変数に関する確率分布の一つである。データが平均の付近に集積するような分布を表す。主な特徴としては平均値と最頻値、中央値が一致する事や平均値を中心にして左右対称である事などが挙げられる。

中心極限定理により、独立な多数の因子の和として表される確率変数は正規分布に従う。このことによって正規分布は統計学や自然科学、社会科学の様々な場面で複雑な現象を簡単に表すモデルとして用いられている。

たとえば、実験における測定の誤差は正規分布に従って分布すると仮定され、不確かさの評価が計算されている。

正規分布の確率密度関数のフーリエ変換は再び正規分布の密度関数になることから、フーリエ解析および派生した様々な数学・物理の理論の体系において、正規分布は基本的な役割を果たしている。

確率変数 X が1次元正規分布に従う場合は

X

N
(
μ
,

σ

2

)

{\displaystyle X\sim N(\mu ,\sigma ^{2})}

と表記し、確率変数 X が n 次元正規分布に従う場合は

X

N

n

(
μ
,

Σ

)

{\displaystyle X\sim N_{n}(\mu ,{\mathit {\Sigma }})}

などと表記する。

概要

平均を μ, 分散を σ2 > 0 とする(1次元)正規分布とは、確率密度関数が次の形(ガウス関数と呼ばれる)

f
(
x
)
=

1

2
π

σ

2

exp

(

(
x

μ

)

2

2

σ

2

)

(
x

R

)

{\displaystyle f(x)={\frac {1}{\sqrt {2\pi \sigma ^{2}}}}\exp \!\left(-{\frac {(x-\mu )^{2}}{2\sigma ^{2}}}\right)\quad (x\in \mathbb {R} )}

で与えられる確率分布のことである。この分布を N(μ, σ2) と表す。(N は「正規分布」を表す英語 “normal distribution” の頭文字から取られている)。

標準正規分布

特に μ = 0, σ2 = 1 のとき、この分布は(1次元)標準正規分布(または基準正規分布)と呼ばれる。つまり標準正規分布 N(0, 1) は

f
(
x
)
=

1

2
π

exp

(

x

2

2

)

{\displaystyle f(x)={\frac {1}{\sqrt {2\pi }}}\exp \!\left(-{\frac {x^{2}}{2}}\right)}

なる確率密度関数を持つ確率分布として与えられる。

再生性

正規分布は再生性を持つ —— つまり確率変数 X1, …, Xn が独立にそれぞれ正規分布 N(μ1, σ12), …, N(μn, σn2) に従うならば、その線型結合 ∑aiXi もまた正規分布 N(∑aiμi, ∑ai2σi2) に従う。

確率密度関数

正規分布の確率密度関数をグラフ化した正規分布曲線は左右対称な釣鐘状の曲線であり、鐘の形に似ていることからベル・カーブ(鐘形曲線)とも呼ばれる。直線 x = μ に関して対称であり、x 軸は漸近線である。なお、曲線は σ の値が大きいほど扁平になる。

なお、中心極限定理により、巨大な n に対する二項分布とも考えることができる。

平均値の周辺の n 次モーメントは、各次数 n に対して

E
[
(
X

μ

)

n

]
=

{

0
,

if 

n

 is odd

(
n

1
)
!
!

σ

n

,

if 

n

 is even

{\displaystyle E[(X-\mu )^{n}]={\begin{cases}0,&{\text{if }}n{\text{ is odd}}\\[1ex](n-1)!!\,\sigma ^{n},&{\text{if }}n{\text{ is even}}\end{cases}}}

となることが知られている。ただし(2n − 1)!! ≔ (2n − 1) ⋅ (2n − 3) ⋅ … ⋅ 3 ⋅ 1。 (odd: 奇数/even: 偶数)

多変量正規分布

また、多変量の統計として共分散まで込めた多次元の正規分布も定義され、平均 μ = (μ1, μ2, …, μn) の n 次元正規分布の同時確率密度は次の式で与えられる。

f
(
x
)
=

1

(

2
π

)

n

|

Σ

|

exp

(

1
2

(
x

μ

)

T

Σ


1

(
x

μ
)

)

{\displaystyle f(x)={\frac {1}{({\sqrt {2\pi }})^{n}{\sqrt {\vert {\mathit {\Sigma }}\vert }}}}\exp \!\left(-{\frac {1}{2}}(x-\mu )^{\mathrm {T} }\,{\mathit {\Sigma }}^{-1}(x-\mu )\right)}

ここで、 = (σij) は分散共分散行列と呼ばれる正定値対称行列である。|Σ| は Σ の行列式。なお、A[x] は(対称)行列 A とベクトル x に対して二次形式 xTAx を意味するもの(ジーゲルの記号)とすると (xμ)T−1(xμ) = −1[xμ] と書くこともできる。

この n 次元正規分布を Nn(μ, ) と表す。特に1次元の場合、平均 (μ) と分散共分散行列 = (σ2) は共に1次元の平均と分散を意味する1つの実数値であり、記号 N1((μ), ) = N1((μ), (σ2)) は単に N(μ, σ2) と書かれる(先に述べた1次元の場合の記号と同じものと理解してよい)。

歪正規分布

正規分布の拡張としては、上で示した多次元化を施した多変量正規分布の他に、歪正規分布 (Skew-Normal (SN) distribution) がある。これは三変数で表現され、そのうち1つの変数について α = 0 のときに正規分布となることから、分布を平均と分散の二変数で表現する正規分布の拡張であるといえる。φ(x) を標準正規分布の確率密度関数とする。

ϕ
(
x
)
=

1

2
π

e

x

2

2

{\displaystyle \phi (x)={\frac {1}{\sqrt {2\pi }}}e^{-{\frac {x^{2}}{2}}}}

その累積確率密度関数は次で与えられる。

Φ
(
x
)
=


x

ϕ
(
t
)

d
t
=

1
2

[

1
+
erf

(

x

2

)

]

{\displaystyle \Phi (x)=\int _{-\infty }^{x}\phi (t)\,dt={\frac {1}{2}}\left[1+\operatorname {erf} \left({\frac {x}{\sqrt {2}}}\right)\right]}

ここに “erf” は誤差関数(シグモイド関数)である。このとき、標準正規分布に対応する歪正規分布 SN(0, 1, α) の確率密度関数は次で与えられる。

f
(
x
)
=
2
ϕ
(
x
)
Φ
(
α
x
)

{\displaystyle f(x)=2\phi (x)\Phi (\alpha x)}

これに平均のようなもの相当する変数と分散のようなものに相当する変数を加えるためにZ変換(標準化)の逆 y = ξ + ωx を施す。すると歪正規分布は一般の形になり、以下の関係が成り立つ。

Y

SN

(
ξ
,

ω

2

,
α
)

{\displaystyle Y\sim \operatorname {SN} (\xi ,\omega ^{2},\alpha )}

正規分布の適用

正規分布が統計学上特別な地位を持つのは中心極限定理が存在するためである。中心極限定理とは、「独立同分布に従う確率変数

X

{\displaystyle X}

の値の算術平均

X
¯

n

=
(

X

1

+

+

X

n

)

/

n

{\displaystyle {\bar {X}}_{n}=(X_{1}+\dotsb +X_{n})/n}

の確率分布は、

X

{\displaystyle X}

に標準偏差が存在するならば、

X

{\displaystyle X}

の分布の形状に関係なく、

n

{\displaystyle n}

が限りなく大きくなったとき、正規分布に収束する」という定理である。このため大標本の「平均値」の統計には、正規分布が仮定されることが非常に多い。なお、「確率変数

X

{\displaystyle X}

の値」自体は、

n

{\displaystyle n}

をどれだけ増やしても、

X

{\displaystyle X}

の分布に従うだけで、正規分布に収束することはない。(たとえば、一つのサイコロを振ったときの目の分布は、サイコロをどれだけ多く振っても、1から6の均等分布である。正規分布に収束するのは、出た目の平均値の分布である。)

自然界の事象の中には正規分布に従う数量の分布をとるものがあることが知られている。また、そのままでは変数が正規分布に従わない場合もその対数をとると正規分布に従う場合がある。しかしそれは必ずしも多数派というわけではない。19世紀ではさながら「正規分布万能主義」のような考え方がまかり通っていたが、20世紀以降そういった考え方に修正が見られた。今日においては社会現象、生物集団の現象等々、種別から言えば、正規分布に従うものはむしろ少数派であることが確認されている。

例えば、フラクタルな性質を持つ物は正規分布よりも、パレート分布になることが多い。人間は自然界の事象とは違って自分の意思をもっているため、たとえば、子供の成績などは決して正規分布にはならない。しかし、そもそも理論上、正規分布の x の値は負の無限大から正の無限大まで取れるのに対して、多くの事象は最小値(例えば比例尺度におけるゼロ)と最大値(例えばテストにおける100点満点)が予め定まっている場合があり、そのような事象が完全な正規分布に従うとするには無理がある(その際は打ち切りを考慮したり、対数正規分布を用いたりするとより正確な確率を求めることが出来る場合がある)。また、0 および自然数しかとらない離散確率分布、例えばポアソン分布や二項分布を連続確率分布である正規分布で近似することも一般的に行われている。

検定

何らかの事象について法則性を捜したり理論を構築しようとしたりする際、その確率分布がまだ分かっていない場合にはそれが正規分布であると仮定して推論することは珍しくないが、誤った結論にたどりついてしまう可能性がある。標本データが正規分布に近似しているかどうを判断するためには、尖度と歪度を調べる、ヒストグラムを見る、正規Q-Qプロットをチェックする、あるいはシャピロ–ウィルク検定やコルモゴロフ–スミルノフ検定(正規分布)を利用する方法などが一般的に行われている。

点推定

平均や分散が未知の正規分布に従うデータから、母数 θ = (μ, σ2) を推定したいことがある。これには次の推定量

θ
^

=
(

μ
^

,

σ
^

2

)

{\displaystyle {\hat {\theta }}=({\hat {\mu }},{\hat {\sigma }}^{2})}

がよく用いられる。正規分布 N(μ, σ2) からの無作為標本 x1, …, xn が与えられたとき、

μ
^

=

1
n

i
=
1

n

x

i

σ
^

2

=

1

n

1

i
=
1

n

(

x

i

μ
^

)

2

{\displaystyle {\begin{aligned}{\hat {\mu }}&={\frac {1}{n}}\textstyle \sum \limits _{i=1}^{n}x_{i}\\{\hat {\sigma }}^{2}&={\frac {1}{n-1}}\textstyle \sum \limits _{i=1}^{n}(x_{i}-{\hat {\mu }})^{2}\end{aligned}}}

は最小分散不偏推定量である。

区間推定

点推定が1つの値を用いて母数の推定を行うのに対し、一定の区間を設けて推定することを区間推定という。

例えば、

「2022年6月の岸田内閣の支持率は59%である」

という推定が点推定であるのに対し、

「2022年1月から12月まで支持率は33%から59%である」

という推定は区間推定に分類される。

また、推定する区間を信頼区間と呼び、水準に応じて「90%信頼区間」「95%信頼区間」「99%信頼区間」などとも呼ばれる。

歴史

正規分布はアブラーム・ド・モアブルによって1733年に導入された。この論文はド・モアブル自身による1738年出版の The Doctrine of Chances 第二版の中で、高い次数に関する二項分布の近似の文脈において再掲されている。ド・モアブルの結果はピエール=シモン・ラプラスによる『確率論の解析理論』(1812年)において拡張され、いまではド・モアブル–ラプラスの定理と呼ばれている。

ラプラスは正規分布を実験の誤差の解析に用いた。その後アドリアン=マリ・ルジャンドルによって1805年に最小二乗法が導入され、1809年のカール・フリードリヒ・ガウスによる誤差論で詳細に論じられた(ガウスは1794年から最小二乗法を知っていたと主張していた)。

「ベル・カーブ」という名前は、1872年に2変数正規分布に対して「鐘形曲面」という言葉を用いた Esprit Jouffret にさかのぼる。「正規分布」という言葉はチャールズ・サンダース・パース、フランシス・ゴルトン、ヴィルヘルム・レキシスの3人によって1875年頃に独立に導入された。

統計的な意味

正規分布 N(μ, σ2) からの無作為標本 x を取ると、平均 μ からのずれが ±1σ 以下の範囲に x が含まれる確率は 68.27%、±2σ 以下だと 95.45%、さらに ±3σ だと 99.73% となる。これは68–95–99.7則と呼ばれることもある。

正規分布は、t分布やF分布といった種々の分布の考え方の基礎になっているだけでなく、実際の統計的推測においても、仮説検定、区間推定など、様々な場面で利用される。

正規分布 N(μ, σ) に従う確率変数 X が与えられたとき Z = Xμ/σ と標準化すれば確率変数 Z は標準正規分布に従う。大学レベルの統計入門のクラスでは必ず行われているが、Z 値を求めることで標準正規分布表と呼ばれる変量に対応した確率を表す一覧表を用いて、コンピュータを使うことなく正規分布に従った事象の確率を求めることができる。

不連続値をとる確率変数についての検定の場合でも、連続変数と同様の考え方で正規分布を近似的に用いることがある。これは標本の大きさ n が大きく、かつデータの階級幅が狭いほど、近似の精度が高い。

標準正規分布表

引用元:(成実清松 & 坂井忠次 1952)

標準正規分布

X

N
(
0
,
1
)

{\displaystyle X\sim N(0,1)}

における確率

P
(
0

X

Z
)

{\displaystyle P(0\leqq X\leqq Z)}

の値をまとめた。

脚注

 

出典

参考文献

  • ハラルド・クラメール (1946). Mathematical Methods of Statistics. Princeton Mathematical Series. 9. Princeton University Press. MR 0016588. Zbl 0063.01014. https://books.google.co.jp/books?id=CRTKKaJO0DYC  (Review by W. Feller)
  • 稲垣宣生『数理統計学』裳華房、1990年。ISBN 4-7853-1406-0。 
  • JIS Z 8101-1:2015 統計 − 用語と記号 − 第1部:確率及び一般統計用語, 日本規格協会, https://www.jisc.go.jp/app/jis/general/GnrJISSearch.html (条項2.5 正規分布, 条項2.51 標準正規分布)
  • Stigler, Stephen M. (1986). The History of Statistics: The Measurement of Uncertainty before 1900. The Belknap Press of Harvard University Press. ISBN 0-674-40340-1. MR 0852410. Zbl 0656.62005. https://books.google.co.jp/books?id=M7yvkERHIIMC 
  • 日本数学会 編『岩波 数学辞典』(第4版)岩波書店、2007年。ISBN 978-4-00-080309-0。 
  • 成実清松、坂井忠次『数理統計学要説』培風館、1952年。doi:10.11501/1371195。NDLJP:1371195。https://dl.ndl.go.jp/pid/1371195/1/1。 

関連項目

  • 中心極限定理
  • 正規乱数
  • シックス・シグマ
  • 標準得点
  • 安定分布
  • 統計量
  • 確率分布
  • t分布
  • F分布
  • カイ二乗分布
  • ポアソン分布

外部リンク

  • 正規分布表 (PDF) —— 脇本和昌『身近なデータによる統計解析入門』森北出版、1973年。ISBN 4627090307。https://web.archive.org/web/20190102193334/http://ebsa.ism.ac.jp/ebooks/ebook/1321。  付表
  • 『正規分布』 – コトバンク


統計における正規分布と標準偏差を理解しよう! ITの学び

統計における正規分布と標準偏差を理解しよう! ITの学び


標準正規分布計算 _ 標準正規分布表の見方 【基本】標準正規分布 RUOR

標準正規分布計算 _ 標準正規分布表の見方 【基本】標準正規分布 RUOR


正規分布とは?初学者向けにわかりやすく解説 DATA VIZ LAB|データビズラボ

正規分布とは?初学者向けにわかりやすく解説 DATA VIZ LAB|データビズラボ


臨界値求め方標準正規分布 統計量z 正規分布 求め方 LXCM

臨界値求め方標準正規分布 統計量z 正規分布 求め方 LXCM


数式の知識ゼロでもOK!標準正規分布表の見方を世界一やさしく解説|tokei

数式の知識ゼロでもOK!標準正規分布表の見方を世界一やさしく解説|tokei


正規分布表 Kpとは 標準正規分布表 使い方 正規分布とは?初学者向けにわかりやすく解説 HUUILX

正規分布表 Kpとは 標準正規分布表 使い方 正規分布とは?初学者向けにわかりやすく解説 HUUILX


標準正規分布表(片側/両側)の見方とエクセルで作る方法をわかりやすく ロジギーク

標準正規分布表(片側/両側)の見方とエクセルで作る方法をわかりやすく ロジギーク


正規分布とは?表の見方や計算問題をわかりやすく解説! 受験辞典

正規分布とは?表の見方や計算問題をわかりやすく解説! 受験辞典


Z検定に利用する標準正規分布(z値)分布表 分布表一覧 【統計学の入門サイト】統計ドットリンク

Z検定に利用する標準正規分布(z値)分布表 分布表一覧 【統計学の入門サイト】統計ドットリンク


正規分布の標準化とは, 正規分布の基準化 ZEAPST

正規分布の標準化とは, 正規分布の基準化 ZEAPST


標準正規分布表の見方や使い方!標準化とZ値の計算式や求め方はどうする? いちばんやさしい、医療統計

標準正規分布表の見方や使い方!標準化とZ値の計算式や求め方はどうする? いちばんやさしい、医療統計


正規分布の定義と性質まとめ 数学の景色

正規分布の定義と性質まとめ 数学の景色


統計学の重要概念「正規分布」を実際例を踏まえて解説 Senehataの学習帳ライブラリ

統計学の重要概念「正規分布」を実際例を踏まえて解説 Senehataの学習帳ライブラリ


【徹底解説】標準正規分布とは Academaid

【徹底解説】標準正規分布とは Academaid


統計分析を理解しよう:正規分布、標準化、標準正規分布の概念 ニッセイ基礎研究所

統計分析を理解しよう:正規分布、標準化、標準正規分布の概念 ニッセイ基礎研究所


正規分布解説 _ 正規分布 見分け方 ACOITL

正規分布解説 _ 正規分布 見分け方 ACOITL


正規分布とは?表の見方や計算問題をわかりやすく解説! 受験辞典

正規分布とは?表の見方や計算問題をわかりやすく解説! 受験辞典


標準正規分布表(片側/両側)の見方とエクセルで作る方法をわかりやすく ロジギーク

標準正規分布表(片側/両側)の見方とエクセルで作る方法をわかりやすく ロジギーク


統計分析を理解しよう:正規分布、標準化、標準正規分布の概念 ニッセイ基礎研究所

統計分析を理解しよう:正規分布、標準化、標準正規分布の概念 ニッセイ基礎研究所


正規分布 5段階 標準正規分布表 計算方法 SQVS

正規分布 5段階 標準正規分布表 計算方法 SQVS

標準正規分布の意味や使い方、正規分布との関係を統計を勉強したてでもわかりやすいように丁寧に解説していきます。 これを読めば標準正規分布の使い方は完璧! 標準正規分布表をPDFにもまとめています。. 中心極限定理 により、 独立 な多数の因子の和として表される 確率変数 は正規分布に従う。 このことによって正規分布は統計学や自然科学、社会科学の様々な場面で複雑な現象を簡単に表すモデルとして用いられている [1]。