教養 – ページ 6

独立な確率変数の共分散がゼロであること

[mathjax] 共分散と相関係数の定義について過去に書いていた。そもそも共分散が発生するのは、2つの確率変数が連動して動くから。 2つの確率変数が独立している場合は、共分散、相関係数共にゼロ。共分散の定義まず、共分散、相関係数の定義はこの通り。 2次元のデータ((x_1,y_1),(x_2,y_2),cdots,(x_n,y_n))が与えられた場合、変数(x)と(y)の相関係数(r_{xy})は、それぞれの標準偏差(S_x,S_y)と、共分散(C_{xy})を使って以下となる。 begin{eqnarray} r_{xy} &=& frac{C_{xy}}{S_x S_y} \\ &=& frac{sum_{i=1}^n(x_i-bar{x})(y_i-bar{y})/n}{sqrt{sum_{i=1}^n{(x_i-bar{x})^2}/n} sqrt{sum_{i=1}^n{(y_i-bar{y})^2}/n}} \\ &=& frac{sum_{i=1}^n(x_i-bar{x})(y_i-bar{y})}{sqrt{sum_{i=1}^n{(x_i-bar{x})^2}} sqrt{sum_{i=1}^n{(y_i-bar{y})^2}}} \\ end{eqnarray} [clink url=\"https://ikuty.com/2018/08/13/correlation_coefficient/\"] [arst_adsense slotnumber=\"1\"] そもそもの共分散確率変数(X),(Y)があったとする。それぞれの期待値は(E(X)),(E(Y))、分散は(V(X),V(Y))。定義通りに(V(X+Y))を式展開していくと以下の通りになる。 begin{eqnarray} V(X+Y) &=& E(((X+Y)-mu_{X+Y})^2) \\ &=& E((X+Y-mu_x-mu_y)^2) \\ &=& E(((X-mu_x) + (Y-mu_y))^2) \\ &=& E((X-mu_x)^2) + E((Y-mu_y)^2) + 2E((X-mu_x)(Y-mu_y)) \\ &=& V(X) + V(Y) + 2E((X-mu_x)(Y-mu_y)) \\ &=& V(X) + V(Y) + 2C_{xy} end{eqnarray} ここで、(C_{xy}=2E((X-mu_x)(Y-mu_y)))を共分散としている。 (V(X+Y))は、(V(X))と(V(Y))の和に(C_{xy})で補正をかけた値になっている。では、(X)と(Y)が独立であるとなぜ(C_{xy}=0)になるのか。 (C_{xy})を式変形していくと以下のようになるが、 begin{eqnarray} frac{1}{2} C_{xy} &=& E((X-mu_x)(Y-mu_y)) \\ &=& E(XY)-mu_yE(X)-mu_xE(Y) +mu_x mu_y \\ &=& E(XY) -mu_x mu_y - mu_x mu_y + mu_x mu_y \\ end{eqnarray} (X)と(Y)が独立であると(E(XY)=E(X)E(Y)=mu_x mu_u)となるから、 begin{eqnarray} frac{1}{2} C_{xy} &=& E(XY) -mu_x mu_y - mu_x mu_y + mu_x mu_y \\ &=& mu_x mu_y-mu_x mu_y - mu_x mu_y + mu_x mu_y \\ &=& 0 end{eqnarray} こうやって、独立であるなら共分散がゼロといえる。 [arst_adsense slotnumber=\"1\"]

同時確率分布と周辺確率分布の関係と独立性の定義

[mathjax] 確率変数XとYが微妙に連動して動くときに何が起こっているのか。状態空間モデルとベイズ統計で理解が必須なので、全くわからないながらもまとめてみる。 2次元確率分布の共分散と相関係数は次回で、まずは確率変数の独立性について。互いに独立 40近いおっさんが久々に数式をこねくりまわして、\"互いに独立\"の定義を読むところまで来た。たぶん、厳密ではないんだろうけども...。 2つの確率変数X,Yがあったとして、X,Yの2変数からなる確率分布を検討する。 (X=x)であり同時に(Y=y)である確率(P(X=x,Y=y)=f(x,y))とする。 (f(x,y))の読み方は(x,y)の同時確率分布(joint probability distribution)。確率分布なので、全部足したら1になる。 begin{eqnarray} sum_x sum_y f(x,y) = 1, f(x,y) geq 0 end{eqnarray} X,Yという2次元の確率変数を使ったとして、それが同時に起こる事象Aも2次元となる。（（X,Y)という全ての集合のうち、特別な事象Aを選んだとしてもAは2次元。） begin{eqnarray} P((X,Y) in A) = sum _A sum f(x,y) end{eqnarray} X,Yを連続値としたとき、確率を定義できる空間（2次元ユークリッド空間(S)...）において、 X,Yが同時に起こる特別な事象A((S)の部分集合)で定義できる。 (大学1年くらいにやるやつだ...) begin{eqnarray} iint_S f(x,y)dydx = 1, f(x,y) geq 0 \\ P((X,Y) in A) = iint_A f(x,y)dydx end{eqnarray} ２変数の片方について合計、または積分した分布を検討する。この分布の呼び方は周辺確率分布(marginal probability distribution)。 begin{eqnarray} g(x) &=& sum_y f(x,y) \\ h(x) &=& sum_x f(x,y) end{eqnarray} [arst_adsense slotnumber=\"1\"] ここからが「互いに独立」の定義の読み方。 2変数関数を片方の変数で積分して1変数にする方向の操作は可能で、そうやって同時確率分布から周辺確率分布を求められる。離散型の場合はマトリクスの縦・横いずれかを固定してループして足す操作。では、それぞれの周辺分布関数の値から同時確率分布の値を求められるか？？この操作は出来る場合と出来ない場合がある。出来る例は（既に互いに独立であることを意識しつつも）2つのサイコロ振り。サイコロ1の目(X_1)とサイコロ2の目(X_2)について、同時確率分布、周辺確率分布が以下であるとする。 123456(h(x)) 1(frac{1}{36})(frac{1}{36})(frac{1}{36})<td(frac{1}{36})(frac{1}{36})(frac{1}{36})(frac{1}{36})(frac{1}{6}) 2(frac{1}{36})(frac{1}{36})(frac{1}{36})<td(frac{1}{36})(frac{1}{36})(frac{1}{36})(frac{1}{36})(frac{1}{6}) 3(frac{1}{36})(frac{1}{36})(frac{1}{36})<td(frac{1}{36})(frac{1}{36})(frac{1}{36})(frac{1}{36})(frac{1}{6}) 4(frac{1}{36})(frac{1}{36})(frac{1}{36})<td(frac{1}{36})(frac{1}{36})(frac{1}{36})(frac{1}{36})(frac{1}{6}) 5(frac{1}{36})(frac{1}{36})(frac{1}{36})<td(frac{1}{36})(frac{1}{36})(frac{1}{36})(frac{1}{36})(frac{1}{6}) 6(frac{1}{36})(frac{1}{36})(frac{1}{36})<td(frac{1}{36})(frac{1}{36})(frac{1}{36})(frac{1}{36})(frac{1}{6}) (g(x))(frac{1}{6})(frac{1}{6})(frac{1}{6})(frac{1}{6})(frac{1}{6})(frac{1}{6})1 周辺確率の積が同時確率の積にならないケースがない。かなり稀なケース。出来ない例は、上記の奇跡的なケース以外の全てで、以下の通り、周辺確率を掛け合わせても同時確率にならない。 123(h(x)) 1(frac{1}{8})(frac{2}{8})(frac{3}{8})(frac{6}{8}) 20(frac{1}{8})0(frac{1}{8}) 3(frac{1}{8})00(frac{1}{8}) (g(x))(frac{2}{8})(frac{3}{8})(frac{3}{8})1 同時確率が全て(frac{1}{9})であれば、周辺確率の積から同時確率の積を計算できるがそうでない。 (frac{1}{9})と比較して大きい同時確率、小さい同時確率が存在するということは、 (X_1,X_2)が協調して動く傾向の度合いが効いている。日本工業規格の定義は、「互いに独立」の必要十分条件は、「周辺分布関数の積が同時分布関数になること」。 [arst_adsense slotnumber=\"1\"]

幾何分布と「過去の結果からは何もわからない話」

[mathjax] いつか起こる大地震がもし昨日起きたとしたら明日起こる確率は下がるのか？飛行機が昨日落ちたとしたらしばらくは飛行機は落ちないのか？うまくいかない人生が今日またうまくいかなかったとして将来うまくいかない確率は下がるのか？起こるか起こらないかの確率が変わらないのであれば、将来は過去に影響されないらしい。影響されるかどうか、と聞かれるとされない、と答えるだろうけど、それを説明することができるらしい。そんな無記憶性の件読んでみたのでまとめてみる。統計学入門とこちらを参考にさせて頂きました。幾何分布幾何分布二項分布、ポアソン分布は(n)回の試行のうち(x)回事象(A)が発生したときを話題にしていた。前提を少し変えて、予め試行する回数を決めないで、 (x)回目の試行で初めて事象(A)が発生した、という話をすることもできる様子。確率変数(x)が等間隔に並ぶ時刻であるとすることで、事象(A)が発生するまでの待ち時間に関する確率分布を作れる。 (x)回目の試行で初めて事象(A)が起こった、ということを、 (x-1)回事象(bar{A})が起こり、次に事象(A)が起きたと考える。事象(A)の生起確率を(p)、事象(bar{A})の生起確率を(q)とすると、その確率は以下のようになる。 begin{eqnarray} f(x) = p cdot q^{x-1} end{eqnarray} (x)の増加1回に対して(q)を1回かける構造で、公比(q)の等比数列になっている。等比数列って英語でgeometric seriesって言うもんだから、幾何分布っていう名前がついてる様子。 (f(x))の確率変数(x)は事象(A)が発生するまでの試行回数（時間）である、と読む様子。では確率変数(X)が幾何分布に従うとき、期待値はどうかというと(frac{1}{p})となる。確率の以下の読み方から、(x)回の試行に平均して(frac{1}{p})回かかる、というのは妥当に見える。事象(A)の生起確率(p)の読み方について、その逆数(frac{1}{p})は、事象(A)が起こるまでの試行回数と読む。 (p)回の試行で初めて事象(A)が起こった、というシーンで事象(A)の生起確率を(p)と置いているので..。期待値幾何分布の期待値は(frac{1}{p})。ベルヌーイ試行の確率が(p)であるならば、平均(frac{1}{p})回で事象が起こる。分散は(frac{1-p}{p^2})。期待値の証明は以下の通り。へぇ。 begin{eqnarray} E(X) &=& sum_x x cdot f(x) \\ &=& sum_x x cdot p q^{x-1} end{eqnarray} (E(X)がfrac{1}{p})であることを示したい。恒等式を使ってやる奴ではなく、愚直にやる奴を書く。まず、(q=1-p)として(E(X))を変形しておいてスタート。 begin{eqnarray} E(X) &=& sum_x x cdot p (1-p)^{x-1} \\ &=& p sum_x x cdot (1-p)^{x-1} end{eqnarray} 右辺を生み出すために、(frac{1}{x-1})のテイラー展開を持ち出す。 begin{eqnarray} frac{1}{1-x} &=& 1 + x + x^2 + cdots \\ &=& sum_{k=0}^{infty} x^k end{eqnarray} 左辺を(x)で微分すると以下の通り。 begin{eqnarray} left( frac{1}{1-x} right) frac{d}{dx} = frac{1}{(1-x)^2} end{eqnarray} 右辺を(x)で微分すると以下の通り。 begin{eqnarray} sum_{k=0}^{infty} x^k frac{d}{dx} = sum_{k=1}^{infty} k x^{k-1} end{eqnarray} なので、 begin{eqnarray} frac{1}{(1-x)^2} = sum_{k=1}^{infty} k x^{k-1} end{eqnarray} (x=1-p)として式変形すると、 begin{eqnarray} frac{1}{p^2} = sum_{k=1}^{infty} k (1-p)^{k-1} end{eqnarray} (E(X))にこれらを代入すると、 begin{eqnarray} E(X) &=& p sum_x x cdot (1-p)^{x-1} \\ &=& p cdot frac{1}{p^2} \\ &=& frac{1}{p} end{eqnarray} 本当に(frac{1}{p})になった。両辺を微分したものが等しいって、なんでだっけ？無記憶性どうも、世の中には(n-1)回連続して失敗して(n)回目で初めて成功することを言っているものと、 (n)回連続して失敗して、(n+1)回目で初めて成功することを言っているものがある。期待値も分散も若干違うものになる。ここからは(n)回の失敗に続いて(n+1)回目で初めて成功するケースに切り替える。その時の確率を(P(X=n))とする。で、失敗が(n)回以上連続して起こる確率(P(Xgeq n))を考える。 begin{eqnarray} P(X geq n) &=& P(X=n) + P(X=n+1) + P(X=n+2) + cdots \\ &=& p(1-p)^n + p(1-p)^{n+1} + p(1-p)^{n+2} + cdots \\ &=& p(1-p) left( 1 + (1-p)^1 + (1-p)^2 + cdots right) \\ &=& p(1-p) sum_{k=1}^{infty} (1-p)^{k-1} end{eqnarray} 途中の無限級数は(frac{1}{1-x})の級数展開になっていて、以下みたいになる。 begin{eqnarray} P(X geq n) &=& p(1-p)^n sum_{k=1}^{infty} (1-p)^{k-1} \\ &=& p(1-p)^n frac{1}{1-(1-p)} \\ &=& p(1-p)^n frac{1}{p} \\ &=& (1-p)^n end{eqnarray} (n)回連続して失敗した上で、さらに連続して(k)回の失敗を重ねる確率を考える。 (n)回連続して失敗する確率は(P(Xgeq n))。この条件の上でさらに(k)回失敗を重ねる確率は条件付き確率として(P(Xgeq n+k | X geq n))。条件付き確率の定義と乗法定理から式を展開していく。（ここが難しかった...) begin{eqnarray} P(Xgeq n+k | X geq n) &=& frac{P((X geq n+k)cap (X geq n) )}{P(X geq n)} \\ &=& frac{P(X geq n+k)}{P(X geq n)} \\ &=& frac{(1-p)^{n+k}}{(1-p)^n} \\ &=& (1-p)^k \\ &=& P(X=k) end{eqnarray} ということで、以下が成り立つことがわかる。 begin{eqnarray} P(Xgeq n+k | X geq n) &=& P(X=k) end{eqnarray} よーく見てみると、(n)回連続して失敗した後に(k)回連続して失敗する確率と、 (n)回の失敗無しに、最初から(k)回連続して失敗する確率が同じである、と言っている。凄まじいことに、(n)回連続して失敗することは、次の(k)回の失敗に全く影響を及ぼさない、と言っている。何回失敗しようと次に失敗する確率はこれまでの失敗に影響されない。つまり失敗する確率は過去の影響を受けない。美しすぎる感じがする。

ベイズの定理と解法例

[mathjax] ベイズの定理の例以前、確率の乗法定理と共にベイズの定理の導出をおこなった。 [clink url=\"https://ikuty.com/2018/09/12/conditional_probability/\"] ちょっと慣れておきたいので、ベイズの定理を持ち出して問題を解いてみる。 18歳未満の子供が病気Dに罹患する確率は10%であるとする。病気Dの検査法において、病気Dに罹患している子供が正しく陽性と判定される確率は96%、誤って陰性と判定される確率は4%である。逆に、病気Dに罹患していない子供が正しく陰性と判定される確率は98%、誤って陽性と判定される確率は2%である。ある子供が病気Dの検査を受けたときの結果が「陽性」であったとき、実際に病気Dに罹患している確率を求めよ。計算不可能な条件付き確率を、計算可能な条件付き確率を使って式変形するのがベイズの定理。病気Dに罹患しているという事象を(D_1)、罹患していないという事象を(D_2)とおく。また、検査で陽性であるという事象を(A)とおく。提示されている（既にわかっている）陽性、偽陽性、陰性、偽陰性の条件は、 (P(A|D_1)=0.96)、(P(bar{A}|D_1)=0.04)、(P(bar{A}|D_2)=0.98)、(P(A|D_2)=0.02) また、病気Dに罹患する確率は(P(D_1)=0.1)。検査を受けたとき陽性であるとは、事象(D_1)が起こった後事象Aが起こった、ということ。その確率を条件付き確率を使って(P(D_1|A))と書く。ベイズの定理ここでベイスの定理。 (H_1,H_2,⋯,H_n)という原因の結果(A)が得られた、という条件。普通は原因(H)が発生した上で結果(A)が得られる確率(P(A|H))を直接計算することができるが、結果が得られた上で原因が得られる確率(P(H|A))は直接計算できない。直接計算できる(P(A|H))を直接計算できない(P(H|A))に変換するのがベイズの定理。 begin{eqnarray} P(H_i|A) = frac{P(H_i)⋅P(A|H_i)}{sum P(H_j)⋅P(A|H_j)} end{eqnarray} なお、確率の乗法定理は以下の通りである。 begin{eqnarray} P(Acap B) = P(B)cdot P(A|B) end{eqnarray} 今回、罹患していて陽性と判定される確率は、( P(D_1)P(A|D_1) )、罹患していないで陽性と判定される確率は、(P(D_2)P(A|D_2))。ベイズの定理において、分母は、結果(A)が起こる全ての確率の和。つまり、今回の例では検査で陽性となる全ての確率( P(D_1)P(A|D_1)+P(D_2)P(A|D_2))。分子は、病気(D)に罹患している場合に陽性となる確率(P(D_1)P(A|D_1))。 begin{eqnarray} P(D_1|A) &=& frac{P(D_1)P(A|D_1)}{ P(D_1)P(A|D_1)+P(D_2)P(A|D_2)} \\ &=& frac{0.1 cdot 0.96}{0.1 cdot 0.96 + 0.9 cdot 0.02 } \\ &=& 0.842 end{eqnarray} こつまぁ、与えられた問題文を良く読んで、求めたい条件付き確率、与えられている条件付き確率を抜き出すところがポイントだろうか。ベイズの定理自体は、分母の意味と分子の意味を理解していれば、導出できるはず。その際、確率の乗法定理を知らないと導出できない。

ポアソン分布とLPからのCVR

[mathjax] 二項分布において、(n)が極めて大きく、(p)が極めて小さくなる現実的な事象はとても多いとされる。例えば、交通事故件数、破産件数、火災件数、砲弾命中数、遺伝子の突然変異数など。あるECサイトにおけるLPへの到達を(n)、そのうちコンバージョンする確率を(p)などとしたとき。（実際には、アクセス頻度が一定でないので、単純なポアソン分布でモデル化する訳ではないらしい。ここでは単純化してアクセス頻度が一定であるという仮定をする）超幾何分布から二項分布、そしてポアソン分布まで地続きで理解するとわかりやすい。このケースで二項分布の式を計算しようとすると、例えば(N=1000)、(p=0.003)、(x=3)であるとしたとき、（例えば、1000回のPVがあり、3回コンバージョンした、コンバージョン確率は0.3%である、という条件）数値計算上の誤差により演算が繊細で現実的でない。 begin{eqnarray} f(x) &=& {}_n C_x p^x (1-p)^{n-x} \\ &=& {}_{1000} C_3 0.003^3 (0.997)^{997} end{eqnarray} ここで、(n rightarrow infty, p rightarrow 0 )という極限を考えたとき、(np rightarrow lambda)となることを考える。つまり、二項分布の式において以下が成り立つ。 begin{eqnarray} {}_n C_x p^x (1-p)^{n-x} rightarrow e^{-lambda} lambda^x /x! end{eqnarray} 右式が確率分布であることは指数関数のマクローリン展開を使って証明できる。（これも無茶苦茶に鮮やかで気持ちがよい..） begin{eqnarray} sum_{x} f(x ) &=& sum_{x} e^{-lambda} lambda^x /x! \\ &=& e^{-lambda} sum_{x} lambda^x /x! \\ &=& e^{-lambda} cdot e^{lambda} \\ &=& 1 end{eqnarray} ポアソン分布において、期待値、分散は以下の通り。奇跡的に、期待値も分散も同じ(lambda)となる。 begin{eqnarray} E(X) &=& lambda \\ V(X) &=& lambda end{eqnarray} ポアソン分布の分布図平均、分散共に(lambda)ということで、分布は定数(lambda)だけによって決まる。以下、(lambda)をばらけさせてExcelでプロットしてみた。また、(lambda=3)における、確率密度関数と累積分布関数を同一軸でプロットしてみる。 (lambda=3)というのは、最初の(N=1000)、(p=0.003)という条件下である。平均は(lambda=3)であるから、3回コンバージョンする確率が最も大きく、確率密度関数は右に歪んでいて、以外と3回以上コンバージョンする確率の減少は緩やか。

二項分布と例

[mathjax] 超幾何分布においてNの無限大の極限を取った時に二項分布になった。確率分布の理解はデータの数え方のケーススタディだと思うのでまとめてみる。二項分布になるデータの発生の仕方は多いと書いてある。二項分布起こり得る結果が2種類に限定される事象を(n)回繰り返すとする。 (n)回のうち(x)回が結果A、(n-x)回が結果Bであるとき、その組み合わせになる確率は以下の通り。 begin{eqnarray} f(x) = {}_n C_x p^x (1-p)^{n-x} end{eqnarray} ある事象が起こったとき、それを元に戻さないで次を行う。確率(p)が(x)回、確率(1-p)が(n-x)回、(n)回のうち(x)回の組み合わせの数をかけている。 5回中1回ということは、1回目、2回目、3回目、4回目、5回目の計5通りで、それは({}_5 C_1)回。 n回中x回ということは({}_n C_x)回という意味。ちなみに、以下の二項定理を使って二項分布が確率分布であることを証明する。 begin{eqnarray} (a+b)^n &=& {}_n C_0 a^0 b^n + {}n C_1 a^1 b^{n-2}+ cdots + {}_n C_k a^k b^{n-k} + cdots + {}n C_{n-1}a^{n-1}b + {}_n C_n a^n b^0 \\ &=& sum_{k=0}^n {}_n C_k a^k b^{n-k} end{eqnarray} 全部足す式を二項定理を使って変形すると1になる。なので二項分布は確率分布。 begin{eqnarray} sum_x f(x ) &=& sum_x {}_n C_x p^x (1-p)^{n-x}\\ &=& sum_x {}_n C_x p^x q^{n-x} \\ &=& (p+q)^n \\ &=& 1^n \\ &=& 1 end{eqnarray} 確率変数(X)が二項分布に従っているのであれば、期待値、分散は以下の通り。 begin{eqnarray} E(X) &=& np \\ V(X) &=& np(1-p) end{eqnarray} 二項分布の例比較的簡単なので統計検定で頻出。以下の問題がたぶん最もミニマル（二項分布の式に頼る必要もないけど）。コインを6回投げる試行を行う。 4回表が出る確率を求めよ。表が出る確率、裏が出る確率、共に(0.5)。 6回のうち4回表が出る場合の数は({}_6 C_4)回、6回のうち2回裏が出る場合の同じで15回。 ({}_6 C_4 0.5^4 0.5^2 = 0.234 ) コインを6回投げる試行を行う。表が出る期待値を求めよ。 (E(X) = np = 6 cdot 0.5 = 3) つまり、コインを6回投げると平均して3回表が出る...、っていう当たり前。コインを6回投げる試行を行う。表が出る標準偏差を求めよ。 (sqrt{V(X)} = sqrt{n p (1-p} = sqrt{6 cdot 0.5 cdot 0.5} = 1.22 ) 95%信頼区間は? 標準偏差が出てきたところで、最初のころにやった95%信頼区間を思い出してみる。二項分布であれ、中心極限定理により正規分布に近似できる。 begin{eqnarray} B(n,p) = N(np,np(1-p)) end{eqnarray} この正規分布について標準正規分布への変換を考える。 begin{eqnarray} Z = frac{X-E(X)}{sigma} = frac{X-np}{sqrt{np(1-p)}} end{eqnarray} Z得点を使って95%信頼区間は以下の通り求められる。 begin{eqnarray} -1.96 le Z le 1.96 \\ -1.96 le frac{X-3}{1.22} le 1.96 \\ -1.96 * 1.22 +3 le X le 1.96 * 1.22 + 3 \\ 0.60 le X le 5.40 end{eqnarray} 95%信頼区間は上記の通り。従って、コインを6回投げたとき、表の出る回数の95%は0.60から5.40の間であると言える。

超幾何分布

[mathjax] 基本的に、足りない地頭を補うために時間を使ってきた歴史がある。理解の速度や再現に地頭が影響する。頭の中でパンパンパンって話が進む経験は全くない。たぶんここに書いていることを活かすには地頭が必要だと思うので今後の人生で使えないだろうな。具体的な確率分布を理解していく。超幾何分布(hypergeometric distribution)。超幾何分布 2種類のグループ(A,B)があって、個数の構成はそれぞれ(M),(N-M)。これらから(n)個を取り出したときに、(A)が(x)個、(B)が(n-x)個であるとする。袋の中に赤い玉が(M)個、白い玉が(N-M)個あって、赤い玉を(x)個、白い玉を(n-x)個取る確率だな。取り出して戻さないやつ。俯瞰して書くとこういうことになる。 begin{eqnarray} f(x) = frac{ {}_M C_x cdot {}_{N-M} C_{n-x} }{ {}_N C_n } end{eqnarray} 単に確率を求めただけ、みたいに見えるけど、この事実が確率変数(x)を使った確率分布になっている。 (x)以外は定数（つまり観測可能、設定可能な値）となっていて、 (n,M,x)から(N)を推測するのに使われたりする。超幾何分布という確率分布を知ったのであれば、捕獲再捕獲法という条件下で、(n,M,x)という既知の値を使って(N)を推測したいなと式が確率分布であることの証明そもそも(f(x))はある(x)に関する確率を求めただけではないのか、なぜ確率分布なのか。以下のように考えるらしい。スタートは以下の恒等式。 begin{eqnarray} (1+t)^N equiv (1+t)^M cdot (1+t)^{N-M} end{eqnarray} (N=2)のとき、左辺を展開すると(t^2+2t+1)。 (N=3)のときは(t^3+3t^2+3t+1)。 (N)を増やしていった時、一般的に(t^n)の項の係数は({}_N C_n )。（初めて考えたけどこうなるんだな...）対して、右辺の展開式において(t^n)の項の係数を調べる。 ((1+t)^M)の展開式において次数(x)の項と、 ((1+t)^{N-M})の展開式において次数(n-x)の項の積が次数(n)となる。 (x)は複数あるが、全ての(x)について係数を足すことで(t^n)の係数を求められる。つまり、(sum_x {}_M C_x cdot {}_{N-M} C_{n-x}) 左辺、右辺の(t^n)の項の係数は同じであるはずなので、 begin{eqnarray} {}_N C_n = sum_x {}_M C_x cdot {}_{N-M} C_{n-x} end{eqnarray} 両辺を({}_N C_n)で割ると、 begin{eqnarray} 1 &=& sum_x frac{ {}_M C_x cdot {}_{N-M} C_{n-x} }{ {}_N C_n } \\ &=& sum_x f(x) end{eqnarray} 全部足して1になるということは確率分布。左辺がサクッと1になって、右辺がサクッと超幾何分布の式になるという、ぷよぷよの2段消しみたいな快感。確率分布とは関係ない恒等式からスタートして、いきなり言いたいことが出てくるという不思議。超幾何分布と二項分布の関係超幾何分布は2種類のグループから取り出したものを戻さずに次を取り出す際の確率分布だけども、戻して取り出す場合と戻さずに取り出す場合では、立式自体が変わってくる。で、戻さないで次を取り出すときは二項分布になる。 (N)の極限を取ると二項分布になると書いてある。立式の上では、以下の通り、確かに二項分布になる。 begin{eqnarray} lim_{N rightarrow infty} f(x) &=& lim_{N rightarrow infty} frac{ {}_M C_x cdot {}_{N-M} C_{n-x} }{ {}_N C_n } \\ &=& lim_{N rightarrow infty} cdot frac{ {}_{M_1} C_x cdot {}_{M_2} C_{n-x} }{ {}_N C_n } \\ &=& lim_{N rightarrow infty} frac{M_1!}{(M_1-x)! cdot x!} cdot frac{M_2!}{(M_2-n+x)!(n-x)!} cdot frac{(N-n)!n!}{N!} \\ &=& lim_{N rightarrow infty} frac{n!}{(n-x)! x!} frac{M_1(M_1-1)cdots (M_1-x+1)cdot M_2(M_2-1)cdots (M_2-n+x+1)}{N(N-1)(N-2)cdots (N-n+1)} \\ &=& lim_{N rightarrow infty} {}_N C_x cdot frac{ frac{M_1}{N}(frac{M_1-1}{N})cdots (frac{M_1-x+1}{N}) cdot frac{M_2}{N}(frac{M_2-1}{N})cdots (frac{M_2-n+x+1}{N}) }{(1-frac{1}{N})(1-frac{2}{N})cdots (1-frac{n-1}{N})} \\ &=& lim_{N rightarrow infty} {}_N C_x cdot frac{ p cdot (p-frac{1}{N}) cdot (p-frac{x+1}{N}) cdot q cdot (q-frac{1}{N}) cdot (q-frac{n-x-1}{N}) }{ (1-frac{1}{N})(1-frac{2}{N})cdots (1-frac{n-1}{N}) } \\ &=& {}_N C_x p^x cdot q^{n-x} \\ &=& {}_N C_x p^x cdot (1-p)^{n-x} end{eqnarray} (N)が十分に大きいときはより簡単な二項分布で近似せよ、ということになる。あぁ、ここで、(p=frac{M_1}{N}, q=frac{M_2}{N})。アルゴリズムの計算量の話のように、どういう問題がどんな分布に収まるのか、というのは、知っておくと便利な気がする。単純にモデルに当てはめるというのではなくて、世の中には、こういうデータの測り方がありますよ、というケーススタディなんですな。

モーメント母関数と確率密度関数

[mathjax] 期待値、分散、歪度、尖度...、確率分布を形成する確率密度関数の特徴を表す値で、実は、相互に変換できる値なのだという...。読んでいったら若干感動したのでまとめてみる。 40近いオッさんがはじめてテイラー展開のありがたさを味わう瞬間の記録。モーメント母関数とモーメントモーメント母関数を以下のように定義。 begin{eqnarray} M_x(t) &=& E(e^{tX}) \\ &=& int_{-infty}^{infty} e^{tx} f(x) dx end{eqnarray} 英語で書くとmoment generating function。モーメントを作る関数。ここで(f(x))というのが確率密度関数。もともとこの時点で積分が存在しないかもしれない。確率密度関数によっては、期待値、分散、歪度、尖度を直接求めるのは難しい。しかし、モーメント母関数の(r)階導関数からモーメント(mu_r)を解析的に求められる性質から、期待値、分散、歪度、尖度を求めることができる。さて...、40近いオッさんは思い出す。指数関数のテイラー展開は、マクローリン級数を使って以下の通り。 begin{eqnarray} e^x = 1+x+x^2/2!+x^3/3!+cdots end{eqnarray} (tX)だと、 begin{eqnarray} e^{tX} = 1+tX+(tX)^2/2! +(tX)^3/3! + cdots end{eqnarray} 両辺の期待値をとる。右辺全体の期待値はそれぞれの項の期待値の和にできるので、 begin{eqnarray} E(e^{tX}) &=& M_x(t)\\ &=& E(1) + E(tX) + E((tX)^2/2!) + E((tX)^3/3!)) + cdots end{eqnarray} (t)に対する定数を出すと begin{eqnarray} M_x(t) &=& E(e^{tX})\\ &=& E(1) + E(X)t + E(X^2/2!)t^2 + E(X^3/3!)t^3 + cdots \\ &=& 1 + mu_1 t + (mu_2/2!)t^2 + (mu_3/3!)t^3 + cdots end{eqnarray} キター。おわかりだろうか...。 (M_x(t))は(t)に関する展開式の係数に各次数のモーメントを含んでいる。 (t)について1回微分すると0次までの項は消える。 2次以降の項の(t)の次数が1減って残る。1次の項だけ(t)が消える。そのとき(t=0)とすると、階数の係数(M^{(r)}_X(0)=mu_r)だけ残る！つまり、以下のようなとんでもないことになる。 begin{eqnarray} M_X\'(0) = mu_1 \\ M_X\'\'(0) = mu_2 \\ M_X\'\'\'(0) = mu_3 \\ end{eqnarray} 各次数のモーメントである期待値、分散、歪度、尖度を、モーメント母関数の(r)階導関数から求められるということになる。指数分布のモーメント試しに指数分布でやってみる。 begin{eqnarray} M_x(t) &=& int_{0}^{infty} e^{tx} lambda e^{-lambda x} dx \\ &=& lambda int_{0}^{infty} e^{(t-lambda)x} dx end{eqnarray} 指数関数の積分のところでおっ、と思ったけど、以下となる。 begin{eqnarray} M_x(t) = frac{ lambda }{ lambda -t} end{eqnarray} これ、解析的に微分できるのかな...と思うんだけども高校数学で暗記するやつ。微分と積分を行ったり来たりするとわかる。 begin{eqnarray} M_x^{(1)}(t) &=& frac{ lambda }{ (lambda -t)^2} \\ M_x^{(2)}(t) &=& frac{ 2 cdot lambda }{(lambda -t)^3} \\ M_x^{(3)}(t) &=& frac{ 2 cdot 3 cdot lambda}{(lambda -t)^4} end{eqnarray} (t=0)とおくと、 begin{eqnarray} mu_1 &=& frac{1}{lambda} \\ mu_2 &=& frac{2}{lambda^2} \\ mu_3 &=& frac{2 cdot 3}{ lambda^3} \\ mu_4 &=& frac{2 cdot 3 cdot 4}{ lambda^4} end{eqnarray} これで、微分の数値計算をしなくても解析的に(mu_1)から(mu_4)が求まった。そして永遠に微分し続けることで指数分布を形作る指標が決まっていく。すごいなぁ...。

歪度と尖度（モーメント母関数導入前）

[mathjax] 確率変数(X)を使って表される確率分布の様子を表す指標について。最も基本的なのが期待値(E(X))であって、次が分散(V(X))。さらに、期待値(E(X))を中心として左右のどちらに歪んでいるかを表す歪度(alpha_3)、期待値(E(X))近辺が全体と比較してどの程度尖っているかを表す尖度(alpha_4)がある。その調子で、確率分布の特徴を表す指標は無数に作ることができる。モーメント母関数の(r)階導関数から得られる各次数のモーメントが期待値、分散、歪度、尖度である、という究極的にシンプルな話を読んでかなり感動したのだが、モーメント母関数の(r)階導関数からモーメントを導出するのは次回として、まず、歪度、尖度をそれぞれ別個に書いてあるのを読んでみる。歪度確率分布は常に期待値(E(X))を中心に左右対象という訳ではない。この非対称性の指標の定義があって歪度が使われる。歪度は(alpha_3)という記号を使う。その定義は以下の通り。 begin{eqnarray} alpha_3 = E(X-mu )^3 / sigma^3 end{eqnarray} (alpha_3 ge 0)ならば左の裾が長い。 (alpha_3 le 0)ならば右の裾が長い、と読む。また、(|alpha_3|)は左右の歪みの程度を表す。 (alpha_3)を定義通り計算しても値が得られるが、以下のようにしておくとより楽に得られる。 begin{eqnarray} E(X-mu)^3 &=& E(X^3) - 3mu E(X^2) + 3mu^2 E(X) - mu^3 \\ &=& E(X^3) - 3mu E(X^2) + 2mu^3 end{eqnarray} なんで(alpha_3)の式が確率分布の歪みを表すのか。 ( mu = E(X) )を中心に、(X-mu ge 0)を満たす確率よりも(X-mu le 0 )を満たす確率の方が少なければ、 (X-mu)は右に歪んでいるといえる。逆も真。 3次の式(y=x^3)は、(x ge 0)であれば正、(x le 0 )であれば負であるという特徴がある。この特徴を使うと、( E(X-mu)^3 )の正負は、(X-mu)の正負と一致すると言える。さらに、大きさを規格化するため、( E(X-mu)/sigma )の正負を考えることとし、( (X-mu)^3 / sigma^3 )が出てくる。尖度分布の頂点がどれだけ尖っているかを表すのが尖度(alpha_4)。正規分布の尖度を3とし、 (alpha_4-3 gt 0)であれば正規分布より尖っている。 (alpha_4 lt 0)であれば正規分布より尖っていない、とする。これも(y = x^4 ) の特徴から導かれる。 (x=0)近辺の値と、(x=0)から離れた値を比べたとき、前者は(y = x^4 ) に対して小さな値を出力し、後者は大きな値を出力する。 (x=0)から離れると急激に値が大きくなるという特徴がある。つまり、(E(X-mu)^4)を見たとき、確率値が(mu)の近辺にあれば値は0に近く、(mu)から離れた値が多ければ急激に値が大きくなる。大きさを規格化し、(E(X-mu)^4/sigma^4)を尖度として利用する。 (alpha_3)と同様に、直接計算する方法もあるが、以下のように計算することもできる。 begin{eqnarray} E(X-mu)^4 &=& E(X^4) - 4mu E(X^3) + 6 mu E(X^3) -4 mu^3 E(X) + mu ^4 \\ &=& E(X^4) - 4mu E(X^3) + 6 mu E(X^2) - 3 mu^4 end{eqnarray} モーメント母関数のr階導関数期待値、分散、歪度、尖度は、モーメント母関数から統一的に導かれる。これがまたすごいので次のエントリで書いてみる。

確率変数、確率密度関数

[mathjax] やりなおし統計もだいぶ頭が慣れてきた。だいぶ赤本を読めるようになってきたぞ、という感触がある。続けて確率密度関数の定義を読んでいく。一線でやっているデータサイエンティスト(俗称)の方の話として、必要な数学力というのは実はそこまで高くなく、線形代数といっても実は単に行列の掛け算ができる、とか、解析学といっても、高校数学の数Ⅲぐらいだったりとか、そういうことを言う人が多いみたい。（アカデミックな層とは2段も3段も劣るオッさんが基礎を学んだところで行けるラインなんて限界がある。）機械学習と密接な関係の統計学くらいはちゃんとインプットしておきたいのだが。もちろん一発で理解できる頭ではないので、たぶんこれから何度もやりなおすだろう。一方で足りなかったら後から足していけば良いぐらいの位置に立てたかな、とも思う。確率変数と確率分布サイコロを投げてそれぞれの目が出る相対度数はおそらく(1/6)くらいだろう。実際に出る目はランダムで相対度数は決まらなない。一方で確率の定義からそれぞれ(1/6)。実際に出る目を(X)として表して、(P(X) = 1/6)として表現する。つまり、 begin{eqnarray} P(X=1)=1/6, P(X=2)=1/6, P(X=3)=1/6, \\ P(X=4)=1/6, P(X=5)=1/6, P(X=6)=1/6 end{eqnarray} この(X)を確率変数という。また(P(X=x_k)=p_k)を確率分布という。加算集合({x_1,x_2,cdots,})の中の値を取る確率変数(X=x_k)について確率分布は離散的であり、(sum_{k=1}^{infty} f(x_k) =1 )である。また、確率変数が連続である場合、(P(aleq X leq b)=int_{a}^{b} f(x) dx =1 )である確率密度関数連続型の確率変数(X)について、(P(xleq X leq x+ Delta x)=int_{a}^{b} f(x) dx )と表す場合、区間(a)から(b)の定積分、つまり面積が確率値となる。 (X)は連続型の確率分布をもつという。(f(x))を(X)を確率密度関数という。ここで、全ての(X)に対して以下が成り立つ。 begin{eqnarray} f(x) geq 0 \\ int_{-infty}^{infty}f(x) dx = 1 end{eqnarray} 「密度」とは何なのか。 (P(X)=int_{a}^{b} f(x))の式において、(a=b)であるならば定積分は0である。確率密度関数において一点の確率は0ということになる。これだと、密度関数の大小が確率にどう影響を与えるか説明しづらい。小さい(Delta x)を考えたとき、面積を(Delta x)を使って近似する。微小区間に掛け与える値の大小(f(x))が確率(P(X))に影響する。この振る舞いを「密度」と言っているらしい。 begin{eqnarray} P(xleq X leq x+ Delta x) simeq f(x)cdot Delta x end{eqnarray} 全ての確率変数(X)について均一に確率が存在している訳ではなく、高い確率、低い確率の存在に濃淡がある。その様を表すのが確率密度関数である。うん、特に難しくない。

Fellegi-Sunterモデルに基づく確率的名寄せパッケージ Splinkを試してみる

[mathjax] Record Linkage、Entity Recognitionなど、いわゆる「名寄せ」問題には、割とさまざまな解決策が提案されている。その1つに確率論的な数学的背景を持つFellegi-Sunterモデルを実装したSplinkがある。数学的背景について咀嚼して説明してくれているサイトはあまりなく、Splinkの公式ドキュメントが唯一に近いソースだろうと思う。今回は5万人の人物データを使って重複を除去するSplinkの主要な機能のサンプルを追ってみた。数式を読んだところで実りは薄い、ということもあり、なるべく数式を読まずに読み進めたが、モデルのパラメタ、予測結果を解釈する際にどうしても数式を読まないとわからない箇所があった。特にベイズ統計について理解がかなり浅くて、正直なところ理解しきれてはいない。 Splinkの公式ドキュメントを読み進めていった際に気付いたメモを書いてみることにした。 [arst_toc tag=\"h4\"] 環境構築・準備環境構築の実装部分は主な学習要素ではないのでClaude Codeでサクッと作ってみた。まずはPlan modeで計画を立ててもらう。これぐらいだとほぼ言い値で使える。 DuckDB、Splinkを使う最小構成の環境を作ります。環境はDocker composeで構築します。計画を立ててください。 ⏺ DuckDB、Splinkを使うDocker Compose環境の計画を完了しました。計画概要 1. 設計文書: .tmp/design.mdで要件、アーキテクチャ、技術仕様を定義 2. タスク管理: .tmp/task.mdで詳細な実装手順を3フェーズに分けて整理主要コンポーネント - Jupyter Lab環境: DuckDB、Splink、必要なライブラリがプリインストール - データボリューム: サンプルデータ、notebook、出力用のディレクトリ - 最小構成: 開発・学習用途に特化した軽量環境次のステップ実装を開始する場合は、Phase 1から順番に進めます： 1. Docker設定ファイル作成 2. ディレクトリ構造構築 3. サンプル実装 4. テストと検証計画の詳細は.tmp/design.mdと.tmp/task.mdをご確認ください。実装を開始しますか？実際にファイルを作ってもらうと以下のような構成となる。得られる中間成果物である docker-compose.yml、Dockerfile は本記事では省略する。 . ├── data ├── docker-compose.yml ├── Dockerfile ├── notebooks ├── output └── requirements.txt 普通に http://localhost:8888 で JupyterLab が開く。使用するサンプルデータ 5万人の人物データを使って名寄せを行うサンプル。おそらくSplinkの用途として最初に思いつくやつ。 Splinkにデータをロードする前に必要なデータクリーニング手順について説明がある。公式によると、まずは行に一意のIDを割り当てる必要がある。データセット内で一意となるIDであって、重複除去した後のエンティティを識別するIDのことではない。 [clink implicit=\"false\" url=\"https://moj-analytical-services.github.io/splink/demos/tutorials/01_Prerequisites.html\" imgurl=\"https://user-images.githubusercontent.com/7570107/85285114-3969ac00-b488-11ea-88ff-5fca1b34af1f.png\" title=\"Data Prerequisites\" excerpt=\"Splink では、リンクする前にデータをクリーンアップし、行に一意の ID を割り当てる必要があります。このセクションでは、Splink にデータをロードする前に必要な追加のデータクリーニング手順について説明します。\"] 使用するサンプルデータは以下の通り。 from splink import splink_datasets df = splink_datasets.historical_50k df.head() データの分布を可視化 splink.exploratoryのprofile_columnsを使って分布を可視化してみる。 from splink import DuckDBAPI from splink.exploratory import profile_columns db_api = DuckDBAPI() profile_columns(df, db_api, column_expressions=[\"first_name\", \"substr(surname,1,2)\"]) 同じ姓・名の人が大量にいることがわかる。ブロッキングとブロッキングルールの評価テーブル内のレコードが他のレコードと「同一かどうか」を調べるためには、基本的には、他のすべてのレコードとの何らかの比較操作を行うこととなる。全てのレコードについて全てのカラム同士を比較したいのなら、対象のテーブルをCROSS JOINした結果、各カラム同士を比較することとなる。 SELECT ... FROM input_tables as l CROSS JOIN input_tables as r あるカラムが条件に合わなければ、もうその先は見ても意味がない、というケースは多い。例えば、まず first_name 、surname が同じでなければ、その先の比較を行わない、というのはあり得る。 SELECT ... FROM input_tables as l INNER JOIN input_tables as r ON l.first_name = r.first_name AND l.surname = r.surname このような考え方をブロッキング、ON句の条件をブロッキングルールと言う。ただ、これだと性と名が完全一致していないレコードが残らない。そこで、ブロッキングルールを複数定義し、いずれかが真であれば残すことができる。ここでポイントなのが、ブロッキングルールを複数定義したとき、それぞれのブロッキングルールで重複して選ばれるレコードが発生した場合、 Splinkが自動的に排除してくれる。このため、ブロッキングルールを重ねがけすると、最終的に残るレコード数は一致する。ただ、順番により、同じルールで残るレコード数は変化する。逆に言うと、ブロッキングルールを足すことで、重複除去後のOR条件が増えていく。積算グラフにして、ブロッキングルールとその順番の効果を見ることができる。 from splink import DuckDBAPI, block_on from splink.blocking_analysis import ( cumulative_comparisons_to_be_scored_from_blocking_rules_chart, ) blocking_rules = [ block_on(\"substr(first_name,1,3)\", \"substr(surname,1,4)\"), block_on(\"surname\", \"dob\"), block_on(\"first_name\", \"dob\"), block_on(\"postcode_fake\", \"first_name\"), block_on(\"postcode_fake\", \"surname\"), block_on(\"dob\", \"birth_place\"), block_on(\"substr(postcode_fake,1,3)\", \"dob\"), block_on(\"substr(postcode_fake,1,3)\", \"first_name\"), block_on(\"substr(postcode_fake,1,3)\", \"surname\"), block_on(\"substr(first_name,1,2)\", \"substr(surname,1,2)\", \"substr(dob,1,4)\"), ] db_api = DuckDBAPI() cumulative_comparisons_to_be_scored_from_blocking_rules_chart( table_or_tables=df, blocking_rules=blocking_rules, db_api=db_api, link_type=\"dedupe_only\", ) 積算グラフは以下の通り。積み上がっている数値は「比較の数」。要は、論理和で条件を足していって、次第に緩和されている様子がわかる。 DuckDBでは比較の数を2,000万件以内、Athena,Sparkでは1億件以内を目安にせよとのこと。比較の定義 Splinkは Fellegi-Sunter model モデル (というかフレームワーク) に基づいている。 https://moj-analytical-services.github.io/splink/topic_guides/theory/fellegi_sunter.html 各カラムの同士をカラムの特性に応じた距離を使って比較し、重みを計算していく。各カラムの比較に使うためのメソッドが予め用意されているので、特性に応じて選んでいく。以下では、first_name, sur_name に ForenameSurnameComparison が使われている。 dobにDateOfBirthComparison、birth_place、ocupationにExactMatchが使われている。 import splink.comparison_library as cl from splink import Linker, SettingsCreator settings = SettingsCreator( link_type=\"dedupe_only\", blocking_rules_to_generate_predictions=blocking_rules, comparisons=[ cl.ForenameSurnameComparison( \"first_name\", \"surname\", forename_surname_concat_col_name=\"first_name_surname_concat\", ), cl.DateOfBirthComparison( \"dob\", input_is_string=True ), cl.PostcodeComparison(\"postcode_fake\"), cl.ExactMatch(\"birth_place\").configure(term_frequency_adjustments=True), cl.ExactMatch(\"occupation\").configure(term_frequency_adjustments=True), ], retain_intermediate_calculation_columns=True, ) # Needed to apply term frequencies to first+surname comparison df[\"first_name_surname_concat\"] = df[\"first_name\"] + \" \" + df[\"surname\"] linker = Linker(df, settings, db_api=db_api) ComparisonとComparison Level ここでSplinkツール内の比較の概念の説明。以下の通り概念に名前がついている。 Data Linking Model ├─-- Comparison: Date of birth │ ├─-- ComparisonLevel: Exact match │ ├─-- ComparisonLevel: One character difference │ ├─-- ComparisonLevel: All other ├─-- Comparison: First name │ ├─-- ComparisonLevel: Exact match on first_name │ ├─-- ComparisonLevel: first_names have JaroWinklerSimilarity > 0.95 │ ├─-- ComparisonLevel: first_names have JaroWinklerSimilarity > 0.8 │ ├─-- ComparisonLevel: All other モデルのパラメタ推定モデルの実行に必要なパラメタは以下の3つ。Splinkを用いてパラメタを得る。ちなみに u は \"\'U\'nmatch\"、m は \"\'M\'atch\"。背後の数式の説明で現れる。 No パラメタ説明 1 無作為に選んだレコードが一致する確率入力データからランダムに取得した2つのレコードが一致する確率 (通常は非常に小さい数値) 2 u値(u確率) 実際には一致しないレコードの中で各 ComparisonLevel に該当するレコードの割合。具体的には、レコード同士が同じエンティティを表すにも関わらず値が異なる確率。例えば、同じ人なのにレコードによって生年月日が違う確率。これは端的には「データ品質」を表す。名前であればタイプミス、別名、ニックネーム、ミドルネーム、結婚後の姓など。 3 m値(m確率) 実際に一致するレコードの中で各 ComparisonLevel に該当するレコードの割合。具体的には、レコード同士が異なるエンティティを表すにも関わらず値が同じである確率。例えば別人なのにレコードによって性・名が同じ確率 (同姓同名)。性別は男か女かしかないので別人でも50%の確率で一致してしまう。無作為に選んだレコードが一致する確率入力データからランダムに抽出した2つのレコードが一致する確率を求める。値は0.000136。すべての可能なレコードのペア比較のうち7,362.31組に1組が一致すると予想される。合計1,279,041,753組の比較が可能なため、一致するペアは合計で約173,728.33組になると予想される、とのこと。 linker.training.estimate_probability_two_random_records_match( [ block_on(\"first_name\", \"surname\", \"dob\"), block_on(\"substr(first_name,1,2)\", \"surname\", \"substr(postcode_fake,1,2)\"), block_on(\"dob\", \"postcode_fake\"), ], recall=0.6, ) > Probability two random records match is estimated to be 0.000136. > This means that amongst all possible pairwise record comparisons, > one in 7,362.31 are expected to match. > With 1,279,041,753 total possible comparisons, > we expect a total of around 173,728.33 matching pairs u確率の推定実際には一致しないレコードの中でComparisonの評価結果がPositiveである確率。基本、無作為に抽出したレコードは一致しないため、「無作為に抽出したレコード」を「実際には一致しないレコード」として扱える、という点がミソ。 probability_two_random_records_match によって得られた値を使ってu確率を求める。 estimate_u_using_random_sampling によって、ラベルなし、つまり教師なしでu確率を得られる。レコードのペアをランダムでサンプルして上で定義したComparisonを評価する。ランダムサンプルなので大量の不一致が発生するが、各Comparisonにおける不一致の分布を得ている。これは、例えば性別について、50%が一致、50%が不一致である、という分布を得ている。一方、例えば生年月日について、一致する確率は 1%、1 文字の違いがある確率は 3%、その他はすべて 96% の確率で発生する、という分布を得ている。 linker.training.estimate_u_using_random_sampling(max_pairs=5e6) > ----- Estimating u probabilities using random sampling ----- > > Estimated u probabilities using random sampling > > Your model is not yet fully trained. Missing estimates for: > - first_name_surname (no m values are trained). > - dob (no m values are trained). > - postcode_fake (no m values are trained). > - birth_place (no m values are trained). > - occupation (no m values are trained). m確率の推定「実際に一致するレコード」の中で、Comparisonの評価がNegativeになる確率。そもそも、このモデルを使って名寄せ、つまり「一致するレコード」を見つけたいのだから、モデルを作るために「実際に一致するレコード」を計算しなければならないのは矛盾では..となる。無作為抽出結果から求められるu確率とは異なり、m確率を求めるのは難しい。もしラベル付けされた「一致するレコード」、つまり教師データセットがあるのであれば、そのデータセットを使ってm確率を求められる。例えば、日本人全員にマイナンバーが振られて、全てのレコードにマイナンバーが振られている、というアナザーワールドがあるのであれば、マイナンバーを使ってm確率を推定する。(どういう状況??) ラベル付けされたデータがないのであれば、EMアルゴリズムでm確率を求めることになっている。 EMアルゴリズムは反復的な手法で、メモリや収束速度の点でペア数を減らす必要があり、例ではブロッキングルールを設定している。以下のケースでは、first_nameとsurnameをブロッキングルールとしている。つまり、first_name, surnameが完全に一致するレコードについてペア比較を行う。この仮定を設定したため、first_name, surname (first_name_surname) のパラメタを推定できない。 training_blocking_rule = block_on(\"first_name\", \"surname\") training_session_names = ( linker.training.estimate_parameters_using_expectation_maximisation( training_blocking_rule, estimate_without_term_frequencies=True ) ) > ----- Starting EM training session ----- > > Estimating the m probabilities of the model by blocking on: > (l.\"first_name\" = r.\"first_name\") AND (l.\"surname\" = r.\"surname\") > > Parameter estimates will be made for the following comparison(s): > - dob > - postcode_fake > - birth_place > - occupation > > Parameter estimates cannot be made for the following comparison(s) since they are used in the blocking rules: > - first_name_surname > > Iteration 1: Largest change in params was 0.248 in probability_two_random_records_match > Iteration 2: Largest change in params was 0.0929 in probability_two_random_records_match > Iteration 3: Largest change in params was -0.0237 in the m_probability of birth_place, level `Exact match on > birth_place` > Iteration 4: Largest change in params was 0.00961 in the m_probability of birth_place, level `All other >comparisons` > Iteration 5: Largest change in params was -0.00457 in the m_probability of birth_place, level `Exact match on birth_place` > Iteration 6: Largest change in params was -0.00256 in the m_probability of birth_place, level `Exact match on birth_place` > Iteration 7: Largest change in params was 0.00171 in the m_probability of dob, level `Abs date difference Iteration 8: Largest change in params was 0.00115 in the m_probability of dob, level `Abs date difference Iteration 9: Largest change in params was 0.000759 in the m_probability of dob, level `Abs date difference Iteration 10: Largest change in params was 0.000498 in the m_probability of dob, level `Abs date difference Iteration 11: Largest change in params was 0.000326 in the m_probability of dob, level `Abs date difference Iteration 12: Largest change in params was 0.000213 in the m_probability of dob, level `Abs date difference Iteration 13: Largest change in params was 0.000139 in the m_probability of dob, level `Abs date difference Iteration 14: Largest change in params was 9.04e-05 in the m_probability of dob, level `Abs date difference <= 10 year` 同様にdobをブロッキングルールに設定して実行すると、dob以外の列についてパラメタを推定できる。 training_blocking_rule = block_on(\"dob\") training_session_dob = ( linker.training.estimate_parameters_using_expectation_maximisation( training_blocking_rule, estimate_without_term_frequencies=True ) ) > ----- Starting EM training session ----- > > Estimating the m probabilities of the model by blocking on: > l.\"dob\" = r.\"dob\" > > Parameter estimates will be made for the following comparison(s): > - first_name_surname > - postcode_fake > - birth_place > - occupation > > Parameter estimates cannot be made for the following comparison(s) since they are used in the blocking rules: > - dob > > Iteration 1: Largest change in params was -0.474 in the m_probability of first_name_surname, level `Exact match on first_name_surname_concat` > Iteration 2: Largest change in params was 0.052 in the m_probability of first_name_surname, level `All other comparisons` > Iteration 3: Largest change in params was 0.0174 in the m_probability of first_name_surname, level `All other comparisons` > Iteration 4: Largest change in params was 0.00532 in the m_probability of first_name_surname, level `All other comparisons` > Iteration 5: Largest change in params was 0.00165 in the m_probability of first_name_surname, level `All other comparisons` > Iteration 6: Largest change in params was 0.00052 in the m_probability of first_name_surname, level `All other comparisons` > Iteration 7: Largest change in params was 0.000165 in the m_probability of first_name_surname, level `All other comparisons` > Iteration 8: Largest change in params was 5.29e-05 in the m_probability of first_name_surname, level `All other comparisons` > > EM converged after 8 iterations > > Your model is not yet fully trained. Missing estimates for: > - first_name_surname (some u values are not trained). モデルパラメタの可視化 m確率、u確率の可視化。マッチウェイトの可視化。マッチウェイトは (log_2 (m / u))で計算される。 linker.visualisations.match_weights_chart() モデルの保存と読み込み以下でモデルを保存できる。 settings = linker.misc.save_model_to_json( \"./saved_model_from_demo.json\", overwrite=True ) 以下で保存したモデルを読み込める。 import json settings = json.load( open(\'./saved_model_from_demo.json\', \'r\') ) リンクするのに十分な情報が含まれていないレコード「John Smith」のみを含み、他のすべてのフィールドがnullであるレコードは、他のレコードにリンクされている可能性もあるが、潜在的なリンクを明確にするには十分な情報がない。以下により可視化できる。 linker.evaluation.unlinkables_chart() 横軸は「マッチウェイトの閾値」。縦軸は「リンクするのに十分な情報が含まれないレコード」の割合。マッチウェイト閾値=6.11ぐらいのところを見ると、入力データセットのレコードの約1.3%がリンクできないことが示唆される。訓練済みモデルを使って未知データのマッチウェイトを予測上で構築した推定モデルを使用し、どのペア比較が一致するかを予測する。内部的には以下を行うとのこと。 blocking_rules_to_generate_predictionsの少なくとも1つと一致するペア比較を生成 Comparisonで指定されたルールを使用して、入力データの類似性を評価推定された一致重みを使用し、要求に応じて用語頻度調整を適用して、最終的な一致重みと一致確率スコアを生成 df_predictions = linker.inference.predict(threshold_match_probability=0.2) df_predictions.as_pandas_dataframe(limit=1) > Blocking time: 0.88 seconds > Predict time: 1.91 seconds > > -- WARNING -- > You have called predict(), but there are some parameter estimates which have neither been estimated or > specified in your settings dictionary. To produce predictions the following untrained trained parameters will > use default values. > Comparison: \'first_name_surname\': > u values not fully trained records_to_plot = df_e.to_dict(orient=\"records\") linker.visualisations.waterfall_chart(records_to_plot, filter_nulls=False) predictしたマッチウェイトの可視化、数式との照合 predictしたマッチウェイトは、ウォーターフォール図で可視化できる。マッチウェイトは、モデル内の各特徴量によって一致の証拠がどの程度提供されるかを示す中心的な指標。 (lambda)は無作為抽出した2つのレコードが一致する確率。(K=m/u)はベイズ因子。 begin{align} M &= log_2 ( frac{lambda}{1-lambda} ) + log_2 K \\ &= log_2 ( frac{lambda}{1-lambda} ) + log_2 m - log_2 u end{align} 異なる列の比較が互いに独立しているという仮定を置いていて、 2つのレコードのベイズ係数が各列比較のベイズ係数の積として扱う。 begin{eqnarray} K_{feature} = K_{first_name_surname} + K_{dob} + K_{postcode_fake} + K_{birth_place} + K_{occupation} + cdots end{eqnarray} マッチウェイトは以下の和。 begin{eqnarray} M_{observe} = M_{prior} + M_{feature} end{eqnarray} ここで begin{align} M_{prior} &= log_2 (frac{lambda}{1-lambda}) \\ M_{feature} &= M_{first_name_surname} + M_{dob} + M_{postcode_fake} + M_{birth_place} + M_{occupation} + cdots end{align} 以下のように書き換える。 begin{align} M_{observe} &= log_2 (frac{lambda}{1-lambda}) + sum_i^{feature} log_2 (frac{m_i}{u_i}) \\ &= log_2 (frac{lambda}{1-lambda}) + log_2 (prod_i^{feature} (frac{m_i}{u_i}) ) end{align} ウォーターフォール図の一番左、赤いバーは(M_{prior} = log_2 (frac{lambda}{1-lambda}))。特徴に関する追加の知識が考慮されていない場合のマッチウェイト。横に並んでいる薄い緑のバーは (M_{first_name_surname} + M_{dob} + M_{postcode_fake} + M_{birth_place} + M_{occupation} + cdots)。各特徴量のマッチウェイト。一番右の濃い緑のバーは2つのレコードの合計マッチウェイト。 begin{align} M_{feature} &= M_{first_name_surname} + M_{dob} + M_{postcode_fake} + M_{birth_place} + M_{occupation} + cdots \\ &= 8.50w end{align} まとめ長くなったのでいったん終了。この記事では教師なし確率的名寄せパッケージSplinkを使用してモデルを作ってみた。次の記事では、作ったモデルを使用して実際に名寄せをしてみる。途中、DuckDBが楽しいことに気づいたので、DuckDBだけで何個か記事にしてみようと思う。

カテゴリー: 教養

独立な確率変数の共分散がゼロであること

同時確率分布と周辺確率分布の関係と独立性の定義

幾何分布と「過去の結果からは何もわからない話」

ベイズの定理と解法例

ポアソン分布とLPからのCVR

二項分布と例

超幾何分布

モーメント母関数と確率密度関数

歪度と尖度（モーメント母関数導入前）

確率変数、確率密度関数

React+Next.jsでDummy JSONのCRUDをCSR/SSRの両方で作成して違いを調べてみた話

go-txdbを使ってgolang, gin, gorm(gen)+sqlite構成のAPI をテストケース毎に管理する

gorm互換の型安全なORMであるgenでCRUD APIを試作

Golang + Gin カスタムバリデーション

Golang + Gin Framework で Hello World してみた話〜基本的なルーティング、バスパラメタ・クエリパラメタ・JSON Req/Res、フォームデータ

Snowflake MCPサーバを試してみた

Fellegi-Sunterモデルに基づく確率的名寄せパッケージ Splinkを試してみる

AirflowでEnd-To-End Pipeline Testsを行うためにAirflow APIを調べてみた話

CustomOperatorのUnitTestを理解するためGCSToBigQueryOperatorのUnitTestを読んでみた話

GoogleによるAirflow DAG実装のベスプラ集を読んでみた – その1