Fellegi-Sunter/Splink 統計

Fellegi-Sunterモデルに基づく確率的名寄せパッケージ Splinkを試してみる

投稿日 2025年08月18日

カテゴリ: Fellegi-Sunter/Splink, 統計タグ: やりなおし統計, 日々の学び

Record Linkage、Entity Recognitionなど、いわゆる「名寄せ」問題には、割とさまざまな解決策が
提案されている。その1つに確率論的な数学的背景を持つFellegi-Sunterモデルを実装したSplinkがある。
数学的背景について咀嚼して説明してくれているサイトはあまりなく、Splinkの公式ドキュメントが唯一
に近いソースだろうと思う。
今回は5万人の人物データを使って重複を除去するSplinkの主要な機能のサンプルを追ってみた。

数式を読んだところで実りは薄い、ということもあり、なるべく数式を読まずに読み進めたが、
モデルのパラメタ、予測結果を解釈する際にどうしても数式を読まないとわからない箇所があった。
特にベイズ統計について理解がかなり浅くて、正直なところ理解しきれてはいない。

Splinkの公式ドキュメントを読み進めていった際に気付いたメモを書いてみることにした。

【目次】

∨環境構築・準備
∨使用するサンプルデータ
∨データの分布を可視化
∨ブロッキングとブロッキングルールの評価
∨比較の定義
∨ComparisonとComparison Level
∨モデルのパラメタ推定
∨無作為に選んだレコードが一致する確率
∨u確率の推定
∨m確率の推定
∨モデルパラメタの可視化
∨モデルの保存と読み込み
∨リンクするのに十分な情報が含まれていないレコード
∨訓練済みモデルを使って未知データのマッチウェイトを予測
∨predictしたマッチウェイトの可視化、数式との照合
∨まとめ

環境構築・準備

環境構築の実装部分は主な学習要素ではないのでClaude Codeでサクッと作ってみた。
まずはPlan modeで計画を立ててもらう。これぐらいだとほぼ言い値で使える。

DuckDB、Splinkを使う最小構成の環境を作ります。環境はDocker composeで構築します。計画を立ててください。


⏺ DuckDB、Splinkを使うDocker Compose環境の計画を完了しました。

  計画概要

  1. 設計文書: .tmp/design.mdで要件、アーキテクチャ、技術仕様を定義
  2. タスク管理: .tmp/task.mdで詳細な実装手順を3フェーズに分けて整理

  主要コンポーネント

  - Jupyter Lab環境: DuckDB、Splink、必要なライブラリがプリインストール
  - データボリューム: サンプルデータ、notebook、出力用のディレクトリ
  - 最小構成: 開発・学習用途に特化した軽量環境

  次のステップ

  実装を開始する場合は、Phase 1から順番に進めます：
  1. Docker設定ファイル作成
  2. ディレクトリ構造構築
  3. サンプル実装
  4. テストと検証

  計画の詳細は.tmp/design.mdと.tmp/task.mdをご確認ください。実装を開始しますか？

実際にファイルを作ってもらうと以下のような構成となる。
得られる中間成果物である docker-compose.yml、Dockerfile は本記事では省略する。


.
├── data
├── docker-compose.yml
├── Dockerfile
├── notebooks
├── output
└── requirements.txt

普通に http://localhost:8888 で JupyterLab が開く。

使用するサンプルデータ

5万人の人物データを使って名寄せを行うサンプル。おそらくSplinkの用途として最初に思いつくやつ。

Splinkにデータをロードする前に必要なデータクリーニング手順について説明がある。
公式によると、まずは行に一意のIDを割り当てる必要がある。
データセット内で一意となるIDであって、重複除去した後のエンティティを識別するIDのことではない。

Data Prerequisites

Splink では、リンクする前にデータをクリーンアップし、行に一意の ID を割り当てる必要があります。このセクションでは、Splink にデータをロードする前に必要な追加のデータクリーニング手順について説明します。

使用するサンプルデータは以下の通り。


from splink import splink_datasets
df = splink_datasets.historical_50k
df.head()

データの分布を可視化

splink.exploratoryのprofile_columnsを使って分布を可視化してみる。


from splink import DuckDBAPI
from splink.exploratory import profile_columns

db_api = DuckDBAPI()
profile_columns(df, db_api, column_expressions=["first_name", "substr(surname,1,2)"])

同じ姓・名の人が大量にいることがわかる。

ブロッキングとブロッキングルールの評価

テーブル内のレコードが他のレコードと「同一かどうか」を調べるためには、
基本的には、他のすべてのレコードとの何らかの比較操作を行うこととなる。

全てのレコードについて全てのカラム同士を比較したいのなら、
対象のテーブルをCROSS JOINした結果、各カラム同士を比較することとなる。


SELECT ...
FROM input_tables as l
CROSS JOIN input_tables as r

あるカラムが条件に合わなければ、もうその先は見ても意味がない、
というケースは多い。例えば、まず first_name 、surname が同じでなければ、
その先の比較を行わない、というのはあり得る。


SELECT ...
FROM input_tables as l
INNER JOIN input_tables as r
ON l.first_name = r.first_name AND l.surname = r.surname

このような考え方をブロッキング、ON句の条件をブロッキングルールと言う。
ただ、これだと性と名が完全一致していないレコードが残らない。
そこで、ブロッキングルールを複数定義し、いずれかが真であれば残すことができる。

ここでポイントなのが、ブロッキングルールを複数定義したとき、
それぞれのブロッキングルールで重複して選ばれるレコードが発生した場合、
Splinkが自動的に排除してくれる。
このため、ブロッキングルールを重ねがけすると、最終的に残るレコード数は一致する。
ただ、順番により、同じルールで残るレコード数は変化する。

逆に言うと、ブロッキングルールを足すことで、重複除去後のOR条件が増えていく。
積算グラフにして、ブロッキングルールとその順番の効果を見ることができる。


from splink import DuckDBAPI, block_on
from splink.blocking_analysis import (
    cumulative_comparisons_to_be_scored_from_blocking_rules_chart,
)

blocking_rules = [
    block_on("substr(first_name,1,3)", "substr(surname,1,4)"),
    block_on("surname", "dob"),
    block_on("first_name", "dob"),
    block_on("postcode_fake", "first_name"),
    block_on("postcode_fake", "surname"),
    block_on("dob", "birth_place"),
    block_on("substr(postcode_fake,1,3)", "dob"),
    block_on("substr(postcode_fake,1,3)", "first_name"),
    block_on("substr(postcode_fake,1,3)", "surname"),
    block_on("substr(first_name,1,2)", "substr(surname,1,2)", "substr(dob,1,4)"),
]

db_api = DuckDBAPI()

cumulative_comparisons_to_be_scored_from_blocking_rules_chart(
    table_or_tables=df,
    blocking_rules=blocking_rules,
    db_api=db_api,
    link_type="dedupe_only",
)

積算グラフは以下の通り。積み上がっている数値は「比較の数」。
要は、論理和で条件を足していって、次第に緩和されている様子がわかる。
DuckDBでは比較の数を2,000万件以内、Athena,Sparkでは1億件以内を目安にせよとのこと。

比較の定義

Splinkは Fellegi-Sunter model モデル (というかフレームワーク) に基づいている。
https://moj-analytical-services.github.io/splink/topic_guides/theory/fellegi_sunter.html

各カラムの同士をカラムの特性に応じた距離を使って比較し、重みを計算していく。
各カラムの比較に使うためのメソッドが予め用意されているので、特性に応じて選んでいく。
以下では、first_name, sur_name に ForenameSurnameComparison が使われている。
dobにDateOfBirthComparison、birth_place、ocupationにExactMatchが使われている。


import splink.comparison_library as cl

from splink import Linker, SettingsCreator

settings = SettingsCreator(
    link_type="dedupe_only",
    blocking_rules_to_generate_predictions=blocking_rules,
    comparisons=[
        cl.ForenameSurnameComparison(
            "first_name",
            "surname",
            forename_surname_concat_col_name="first_name_surname_concat",
        ),
        cl.DateOfBirthComparison(
            "dob", input_is_string=True
        ),
        cl.PostcodeComparison("postcode_fake"),
        cl.ExactMatch("birth_place").configure(term_frequency_adjustments=True),
        cl.ExactMatch("occupation").configure(term_frequency_adjustments=True),
    ],
    retain_intermediate_calculation_columns=True,
)
# Needed to apply term frequencies to first+surname comparison
df["first_name_surname_concat"] = df["first_name"] + " " + df["surname"]
linker = Linker(df, settings, db_api=db_api)

ComparisonとComparison Level

ここでSplinkツール内の比較の概念の説明。以下の通り概念に名前がついている。


Data Linking Model
├─-- Comparison: Date of birth
│    ├─-- ComparisonLevel: Exact match
│    ├─-- ComparisonLevel: One character difference
│    ├─-- ComparisonLevel: All other
├─-- Comparison: First name
│    ├─-- ComparisonLevel: Exact match on first_name
│    ├─-- ComparisonLevel: first_names have JaroWinklerSimilarity > 0.95
│    ├─-- ComparisonLevel: first_names have JaroWinklerSimilarity > 0.8
│    ├─-- ComparisonLevel: All other

モデルのパラメタ推定

モデルの実行に必要なパラメタは以下の3つ。Splinkを用いてパラメタを得る。
ちなみに u は “‘U’nmatch”、m は “‘M’atch”。背後の数式の説明で現れる。

No	パラメタ	説明
1	無作為に選んだレコードが一致する確率	入力データからランダムに取得した2つのレコードが一致する確率 (通常は非常に小さい数値)
2	u値(u確率)	実際には一致しないレコードの中で各 ComparisonLevel に該当するレコードの割合。具体的には、レコード同士が同じエンティティを表すにも関わらず値が異なる確率。例えば、同じ人なのにレコードによって生年月日が違う確率。これは端的には「データ品質」を表す。名前であればタイプミス、別名、ニックネーム、ミドルネーム、結婚後の姓など。
3	m値(m確率)	実際に一致するレコードの中で各 ComparisonLevel に該当するレコードの割合。具体的には、レコード同士が異なるエンティティを表すにも関わらず値が同じである確率。例えば別人なのにレコードによって性・名が同じ確率 (同姓同名)。性別は男か女かしかないので別人でも50%の確率で一致してしまう。

無作為に選んだレコードが一致する確率

入力データからランダムに抽出した2つのレコードが一致する確率を求める。
値は0.000136。すべての可能なレコードのペア比較のうち7,362.31組に1組が一致すると予想される。
合計1,279,041,753組の比較が可能なため、一致するペアは合計で約173,728.33組になると予想される、
とのこと。


linker.training.estimate_probability_two_random_records_match(
    [
        block_on("first_name", "surname", "dob"),
        block_on("substr(first_name,1,2)", "surname", "substr(postcode_fake,1,2)"),
        block_on("dob", "postcode_fake"),
    ],
    recall=0.6,
)

> Probability two random records match is estimated to be  0.000136.
> This means that amongst all possible pairwise record comparisons, 
> one in 7,362.31 are expected to match. 
> With 1,279,041,753 total possible comparisons,
> we expect a total of around 173,728.33 matching pairs

u確率の推定

実際には一致しないレコードの中でComparisonの評価結果がPositiveである確率。
基本、無作為に抽出したレコードは一致しないため、「無作為に抽出したレコード」を
「実際には一致しないレコード」として扱える、という点がミソ。
probability_two_random_records_match によって得られた値を使ってu確率を求める。
estimate_u_using_random_sampling によって、ラベルなし、つまり教師なしでu確率を得られる。

レコードのペアをランダムでサンプルして上で定義したComparisonを評価する。
ランダムサンプルなので大量の不一致が発生するが、各Comparisonにおける不一致の分布を得ている。
これは、例えば性別について、50%が一致、50%が不一致である、という分布を得ている。
一方、例えば生年月日について、一致する確率は 1%、1 文字の違いがある確率は 3%、
その他はすべて 96% の確率で発生する、という分布を得ている。


linker.training.estimate_u_using_random_sampling(max_pairs=5e6)

> ----- Estimating u probabilities using random sampling -----
> 
> Estimated u probabilities using random sampling
> 
> Your model is not yet fully trained. Missing estimates for:
>     - first_name_surname (no m values are trained).
>     - dob (no m values are trained).
>     - postcode_fake (no m values are trained).
>     - birth_place (no m values are trained).
>     - occupation (no m values are trained).

m確率の推定

「実際に一致するレコード」の中で、Comparisonの評価がNegativeになる確率。
そもそも、このモデルを使って名寄せ、つまり「一致するレコード」を見つけたいのだから、
モデルを作るために「実際に一致するレコード」を計算しなければならないのは矛盾では..となる。
無作為抽出結果から求められるu確率とは異なり、m確率を求めるのは難しい。

もしラベル付けされた「一致するレコード」、つまり教師データセットがあるのであれば、
そのデータセットを使ってm確率を求められる。
例えば、日本人全員にマイナンバーが振られて、全てのレコードにマイナンバーが振られている、
というアナザーワールドがあるのであれば、マイナンバーを使ってm確率を推定する。(どういう状況??)

ラベル付けされたデータがないのであれば、EMアルゴリズムでm確率を求めることになっている。
EMアルゴリズムは反復的な手法で、メモリや収束速度の点でペア数を減らす必要があり、
例ではブロッキングルールを設定している。
以下のケースでは、first_nameとsurnameをブロッキングルールとしている。
つまり、first_name, surnameが完全に一致するレコードについてペア比較を行う。
この仮定を設定したため、first_name, surname (first_name_surname) のパラメタを推定できない。


training_blocking_rule = block_on("first_name", "surname")
training_session_names = (
    linker.training.estimate_parameters_using_expectation_maximisation(
        training_blocking_rule, estimate_without_term_frequencies=True
    )
)

> ----- Starting EM training session -----
> 
> Estimating the m probabilities of the model by blocking on:
> (l."first_name" = r."first_name") AND (l."surname" = r."surname")
> 
> Parameter estimates will be made for the following comparison(s):
>     - dob
>     - postcode_fake
>     - birth_place
>     - occupation
> 
> Parameter estimates cannot be made for the following comparison(s) since they are used in the blocking rules: 
>     - first_name_surname
> 
> Iteration 1: Largest change in params was 0.248 in probability_two_random_records_match
> Iteration 2: Largest change in params was 0.0929 in probability_two_random_records_match
> Iteration 3: Largest change in params was -0.0237 in the m_probability of birth_place, level `Exact match on > birth_place`
> Iteration 4: Largest change in params was 0.00961 in the m_probability of birth_place, level `All other >comparisons`
> Iteration 5: Largest change in params was -0.00457 in the m_probability of birth_place, level `Exact match on birth_place`
> Iteration 6: Largest change in params was -0.00256 in the m_probability of birth_place, level `Exact match on birth_place`
> Iteration 7: Largest change in params was 0.00171 in the m_probability of dob, level `Abs date difference <= 10 year`
> Iteration 8: Largest change in params was 0.00115 in the m_probability of dob, level `Abs date difference <= 10 year`
> Iteration 9: Largest change in params was 0.000759 in the m_probability of dob, level `Abs date difference <= 10 year`
> Iteration 10: Largest change in params was 0.000498 in the m_probability of dob, level `Abs date difference <= 10 year`
> Iteration 11: Largest change in params was 0.000326 in the m_probability of dob, level `Abs date difference <= 10 year`
> Iteration 12: Largest change in params was 0.000213 in the m_probability of dob, level `Abs date difference <= 10 year`
> Iteration 13: Largest change in params was 0.000139 in the m_probability of dob, level `Abs date difference <= 10 year`
> Iteration 14: Largest change in params was 9.04e-05 in the m_probability of dob, level `Abs date difference <= 10 year`

同様にdobをブロッキングルールに設定して実行すると、dob以外の列についてパラメタを推定できる。


training_blocking_rule = block_on("dob")
training_session_dob = (
    linker.training.estimate_parameters_using_expectation_maximisation(
        training_blocking_rule, estimate_without_term_frequencies=True
    )
)

> ----- Starting EM training session -----
> 
> Estimating the m probabilities of the model by blocking on:
> l."dob" = r."dob"
> 
> Parameter estimates will be made for the following comparison(s):
>     - first_name_surname
>     - postcode_fake
>     - birth_place
>     - occupation
> 
> Parameter estimates cannot be made for the following comparison(s) since they are used in the blocking rules: 
>     - dob
> 
> Iteration 1: Largest change in params was -0.474 in the m_probability of first_name_surname, level `Exact match on first_name_surname_concat`
> Iteration 2: Largest change in params was 0.052 in the m_probability of first_name_surname, level `All other comparisons`
> Iteration 3: Largest change in params was 0.0174 in the m_probability of first_name_surname, level `All other comparisons`
> Iteration 4: Largest change in params was 0.00532 in the m_probability of first_name_surname, level `All other comparisons`
> Iteration 5: Largest change in params was 0.00165 in the m_probability of first_name_surname, level `All other comparisons`
> Iteration 6: Largest change in params was 0.00052 in the m_probability of first_name_surname, level `All other comparisons`
> Iteration 7: Largest change in params was 0.000165 in the m_probability of first_name_surname, level `All other comparisons`
> Iteration 8: Largest change in params was 5.29e-05 in the m_probability of first_name_surname, level `All other comparisons`
> 
> EM converged after 8 iterations
> 
> Your model is not yet fully trained. Missing estimates for:
>     - first_name_surname (some u values are not trained).

モデルパラメタの可視化

m確率、u確率の可視化。

マッチウェイトの可視化。マッチウェイトは \(\log_2 (m / u)\)で計算される。


linker.visualisations.match_weights_chart()

モデルの保存と読み込み

以下でモデルを保存できる。


settings = linker.misc.save_model_to_json(
    "./saved_model_from_demo.json", overwrite=True
)

以下で保存したモデルを読み込める。


import json
settings = json.load(
    open('./saved_model_from_demo.json', 'r')
)

リンクするのに十分な情報が含まれていないレコード

「John Smith」のみを含み、他のすべてのフィールドがnullであるレコードは、
他のレコードにリンクされている可能性もあるが、潜在的なリンクを明確にするには十分な情報がない。

以下により可視化できる。


linker.evaluation.unlinkables_chart()

横軸は「マッチウェイトの閾値」。縦軸は「リンクするのに十分な情報が含まれないレコード」の割合。
マッチウェイト閾値=6.11ぐらいのところを見ると、入力データセットのレコードの約1.3%が
リンクできないことが示唆される。

訓練済みモデルを使って未知データのマッチウェイトを予測

上で構築した推定モデルを使用し、どのペア比較が一致するかを予測する。
内部的には以下を行うとのこと。

blocking_rules_to_generate_predictionsの少なくとも1つと一致するペア比較を生成
Comparisonで指定されたルールを使用して、入力データの類似性を評価
推定された一致重みを使用し、要求に応じて用語頻度調整を適用して、最終的な一致重みと一致確率スコアを生成


df_predictions = linker.inference.predict(threshold_match_probability=0.2)
df_predictions.as_pandas_dataframe(limit=1)

> Blocking time: 0.88 seconds
> Predict time: 1.91 seconds
> 
>  -- WARNING --
> You have called predict(), but there are some parameter estimates which have neither been estimated or > specified in your settings dictionary.  To produce predictions the following untrained trained parameters will > use default values.
> Comparison: 'first_name_surname':
>     u values not fully trained

records_to_plot = df_e.to_dict(orient="records")
linker.visualisations.waterfall_chart(records_to_plot, filter_nulls=False)

predictしたマッチウェイトの可視化、数式との照合

predictしたマッチウェイトは、ウォーターフォール図で可視化できる。

マッチウェイトは、モデル内の各特徴量によって一致の証拠がどの程度提供されるかを示す中心的な指標。
\(\lambda\)は無作為抽出した2つのレコードが一致する確率。\(K=m/u\)はベイズ因子。

\begin{align}
M &= log_2 ( \frac{\lambda}{1-\lambda} ) + log_2 K \\
&= log_2 ( \frac{\lambda}{1-\lambda} ) + log_2 m - log_2 u
\end{align}

異なる列の比較が互いに独立しているという仮定を置いていて、
2つのレコードのベイズ係数が各列比較のベイズ係数の積として扱う。
\begin{eqnarray}
K_{feature} = K_{first\_name\_surname} + K_{dob} + K_{postcode\_fake} + K_{birth\_place} + K_{occupation} + \cdots
\end{eqnarray}

マッチウェイトは以下の和。
\begin{eqnarray}
M_{observe} = M_{prior} + M_{feature}
\end{eqnarray}

ここで
\begin{align}
M_{prior} &= log_2 (\frac{\lambda}{1-\lambda}) \\
M_{feature} &= M_{first\_name\_surname} + M_{dob} + M_{postcode\_fake} + M_{birth\_place} + M_{occupation} + \cdots
\end{align}

以下のように書き換える。
\begin{align}
M_{observe} &= log_2 (\frac{\lambda}{1-\lambda}) + \sum_i^{feature} log_2 (\frac{m_i}{u_i}) \\
&= log_2 (\frac{\lambda}{1-\lambda}) + log_2 (\prod_i^{feature} (\frac{m_i}{u_i}) )
\end{align}

ウォーターフォール図の一番左、赤いバーは\(M_{prior} = log_2 (\frac{\lambda}{1-\lambda})\)。
特徴に関する追加の知識が考慮されていない場合のマッチウェイト。

横に並んでいる薄い緑のバーは \(M_{first\_name\_surname} + M_{dob} + M_{postcode\_fake} + M_{birth\_place} + M_{occupation} + \cdots\)。
各特徴量のマッチウェイト。

一番右の濃い緑のバーは2つのレコードの合計マッチウェイト。
\begin{align}
M_{feature} &= M_{first\_name\_surname} + M_{dob} + M_{postcode\_fake} + M_{birth\_place} + M_{occupation} + \cdots \\
&= 8.50w
\end{align}

まとめ

長くなったのでいったん終了。この記事では教師なし確率的名寄せパッケージSplinkを使用してモデルを作ってみた。
次の記事では、作ったモデルを使用して実際に名寄せをしてみる。
途中、DuckDBが楽しいことに気づいたので、DuckDBだけで何個か記事にしてみようと思う。

機械学習の分類問題と損失関数の最小化の話

[mathjax] 参考にした書籍でこの順序で誘導されていて理解しやすかったです. パーセプトロンによる一番簡単な教師あり学習を理解する ADALINEにより学習を凸で連続なコスト関数の最小化問題として捉えるパーセプトロンの学習 2値のラベル((+1),(-1))が付与されているサンプルデータが与えられたとする. ラベル値が(-1)であるデータと, ラベル値が(+1)であるデータに分類できる. それらの境界が線形和で表される問題である場合, その境界を求めることができれば, 未知のデータに対してその境界の(+1)側か(-1)側かを判定できる. (m)次のサンプルデータと重みの線形和を考える. [ boldsymbol{z} = boldsymbol{w}^T boldsymbol{x} = w_1 x_1 + w_2 x_2 + cdots x_m x_m ] (z)に関するステップ関数を用意する. こうすることで (z)-(phi(z)) 空間において(z=theta)を境に線形和(z)が(-1),(+1)に分かれることを表現できる. [ varphi(z) = begin{cases} 1 & (z gt theta) \\ -1 & (z leq theta) end{cases} ] (theta)を左辺に移動し, (x_0 = 1), (w_0 = -theta) とすると, 線形和に(theta)の項を組み入れることができる. 新しい線形和(z\')が(0)になる箇所を境にステップ関数の応答値が切り替わる. [ varphi(z) = begin{cases} 1 & (z-theta gt 0) \\ -1 & (z-theta leq 0) end{cases} ] [ z\' = z - theta = w_0 x_0 + w_1 x_1 + w_2 x_2 + cdots x_m x_m ] あるパラメータ(boldsymbol{w})が存在するとして, データ(boldsymbol{x})について, (boldsymbol{w}^T boldsymbol{x}=0)を境界にステップ関数の応答値が切り替わる. 未知のデータ(x)に対して, (boldsymbol{w}^T boldsymbol{x})はラベルの予測値(+1), (-1)を応答する. 予測値(varphi(w^Tx))が正解であるサンプルデータに含まれる(y^{i})と同じとなる(w)を探したい. それを探していく. 最初,(w)に初期値を設定し, 以下の手続きによって(w)を更新していく. 上付きの添字はサンプルデータ内の順序数を表している. (y^{(i)})は(i)番目のサンプルデータ. 右下の添字は該当サンプルデータの各次元を表している. (y^{(i)_m})は(y^{(i)})の(m)番目の要素. 現在の(w)を使って予測値を計算する. (hat{y}=w^T x) (w)を更新する. (Delta w_j := eta(y^{i}-hat{y})x^{i}_j) 1個のサンプルデータで1回(w)が更新される. そもそもデータセットを綺麗に線形和が表す決定境界で分離できないような状態だと、何度やっても予測したクラスラベルと真のクラスラベルの差が埋まらない。あっちを立てればこっちが立たず、みたいになる。予測したクラスラベルと真のクラスラベルを比較するこの方法だと、 (Delta w_j := eta(y^{i}-hat{y})x^{i}_j) が良い値なのか悪い値なのか、繰り返さないとわからない。予測と真の値の比較を凸で連続な関数で表すことができれば、その関数の凸の底に向かうやり方で、「今より良い次の値」に更新する方法を解析的に求めることができて都合が良い。真の値と予測した値の差が「損失」とか「コスト」とか呼んで、「コスト関数」を最小化するパラメータが良いパラメータなんだろう、という話が進んでいく。 ADALINEの学習線形和をステップ関数に変換する部分があった。こうして(w^T x varphi(w^T x))空間で (w^T x)が(-1),(+1)に分かれる(w)を求めようとした. [ varphi(z) = begin{cases} 1 & (z-theta gt 0) \\ -1 & (z-theta leq 0) end{cases} ] そうではなく以下の恒等式(左辺と右辺が同じ)を使い,真の値と予測した値の差の求め方を変えると, 差が凸で連続な関数で表せるようになり (解析的に微分できるようになり), 一番小さいところは? という話がしやすくなる. [ varphi(z)=z ] 最小二乗法のときやったやつで、差の2乗を足し合わると符号がキャンセルされてよくて、差を式で表せる。 [ J(w) = sum_i left( y^{(i)} - varphi(w^T x^{(i)}) right)^2 ] こういうのを誤差平方和と言うようで(frac{1}{2})倍するらしい. [ J(w) =frac{1}{2} sum_i left( y^{(i)} - varphi(w^T x^{(i)}) right)^2 ] (J(w))がなんで連続で凸なのかは知ったことではないが、連続で凸であれば(J\'(w)=0)を解くと極小となる(w)が求まるのは高校生のときにやった話. (J(w))の接線(多次元だと接っする面)の傾きが(J\'(w))。ただ(w)には次数があって傾きは以下(それぞれの次数毎の極限). [ nabla J(w) = frac{partial J(w)}{partial w_j} ] (w J(w))空間で(nabla J(w))は(w)における傾きなので, (w)に(-nabla J(w) cdot 1)を足すと, (J(w))が極小になる箇所に近づく. どれだけ行けば良いかわからないので(-nabla J(w) cdot eta)を足すことにする. (w)を以下の通り更新する. begin{eqnarray} w &:=& w + nabla J(w) \\ &:=& w -nabla J(w) cdot eta end{eqnarray} ちなみに(nabla J(w))は式をこねくり回すと計算できる. 最終的に更新は以下の通りとなる. [ w := w - eta sum_i left( y^{(i)} -varphi left( z^{(i)} right) right) x_j^{(i)} ] パーセプトロンの更新とそっくりな形が出てきて感動する... あっちは(varphi(z))が不連続なステップ関数でこっちは連続な関数. 式をこねくり回す際に, (varphi(z) = z)の恒等式の関係を使っていない. 何か連続な関数であればこれが成り立つ. 形式上,例えば(varphi(z))を以下(シグモイド)とすることでロジスティック回帰 (本当か? 次回確認.). [ varphi (z) = frac{1}{1+e^{-z}} ]

球面集中現象を理解するために必要そうなことの理解 – 極座標・直行座標変換,

[mathjax] 球面集中現象を理解するために記憶にないことが多すぎるので理解に必要そうなことを少しずつ復習していきます。まず極座標の直行座標変換。極座標を使って球の体積を求めてみます。次の記事で球の体積を求める時に使う微小体積がヤコビアンになることを確認します。極座標の直行座標変換 2次元のとき、極座標((r),(phi)) を直行座標で表すと、 begin{eqnarray} x &=& r cos(phi) \\ y &=& r sin(phi) end{eqnarray} 3次元のとき、極座標((r),(phi_1),(phi_2))を直行座標で表すと、 begin{eqnarray} x &=& r cos(phi_1) \\ y &=& r sin(phi_1) cos(phi_2) \\ z &=& r sin(phi_1) sin(phi_2) end{eqnarray} ここまではイメージできるのだけれども、(N)に飛ばしたときにどうなるのか。 N次元のとき、極座標((r),(phi_1),(phi_2),(cdots),(phi_{N-1}))を直行座標で表すと以下のようになるらしい。 begin{eqnarray} x_1 &=& r cos(phi_1) \\ x_2 &=& r sin(phi_1) cos(phi_2) \\ x_3 &=& r sin(phi_1) sin(phi_2) cos(phi_3) \\ vdots \\ x_{N-1} &=& r sin (phi_1) cdots sin(phi_{N-2}) cos(phi_{N-1}) \\ x_{N} &=& r sin (phi_1) cdots sin(phi_{N-2}) sin(phi_{N-1}) end{eqnarray} この後使わないけれど、逆変換は以下の通りになるらしい。 begin{eqnarray} r &=& sqrt{x_1^2 + cdots + x_{N-1}^2 + x_N^2} \\ phi_1 &=& arccosfrac{x_1}{sqrt{x_1^2 + cdots + x_{N-1}^2 + x_N^2}} \\ phi_2 &=& arccosfrac{x_2}{sqrt{x_2^2 + cdots + x_{N-1}^2 + x_N^2}} \\ vdots \\ phi_{N-2} &=& arccos frac{x_{N-2}}{sqrt{x_{N-2}^2 + x_{N-1}^2 + x_N^2}} \\ phi_{N-1} &=& begin{cases} arccos frac{x_{N-1}}{sqrt{x_{N-1}^2+X_N^2}} & X_N ge 0 \\ -arccos frac{x_{N-1}}{sqrt{x_{N-1}^2+X_N^2}} & X_N lt 0 end{cases} end{eqnarray} 3次元極座標系における体積計算の例極座標((r),(phi_1),(phi_2))において(r)を微小量(Delta r)だけ増やす。 (2pi r)は半径を(r)とする円の直径だということを考慮すると、 (phi_1)から微小角(Delta phi_1)増やしたときの(r Delta phi_1)は円弧の一部。 (Delta phi_1)を限りなく小さくすると(r Delta phi_1)は直線と考えられる。 (2pi rsin(phi_1) )が半径を(rsin(phi_1))とする円の直径と考えると、 (phi_2)から微小角(Delta phi_2)増やしたときの(r sin(phi_1) Delta phi_2)は円弧の一部。 (Delta phi_2)を限りなく小さくすると(r sin(phi_1) Delta phi_2)は直線と考えられる。 (Delta r, Delta phi_1, Delta phi_2)が限りなくゼロに近くときに上記のそれぞれの直線を辺とする直方体ができる。その体積を(dV)とすると、 begin{eqnarray} dV &=& Delta r cdot r Delta phi_1 cdot r sin(phi_1) Delta phi_2 \\ &=& r^2 sin(phi_1) Delta r Delta phi_1 Delta phi_2 end{eqnarray} 直交座標(x,y,z)の位置を(U(x,y,z))とする。直交座標系における球の体積はざっくり以下で表せる。 begin{eqnarray} int U(x,y,z) dV end{eqnarray} 直行座標の極座標変換は前述の通り以下。この座標を(U(r,phi_1,phi_2))とする。 begin{eqnarray} x &=& r cos(phi_1) \\ y &=& r sin(phi_1) cos(phi_2) \\ z &=& r sin(phi_1) sin(phi_2) end{eqnarray} 極座標系において以下だから、 begin{eqnarray} 0 le r le 1 \\ 0 le phi_1 le pi\\ 0 le phi_2 2pi end{eqnarray} それぞれについて積分すると体積になる。 begin{eqnarray} int_{0}^{2pi} Biggl( int_{0}^{pi} Bigl( int_{0}^{1} U(r,phi_1,phi_2)r^2 sin(phi_1) dr Bigr) d phi_1 Biggr) dphi_2 end{eqnarray} つまり以下。 begin{eqnarray} int U(x,y,z) dV = int_{0}^{2pi} Biggl( int_{0}^{pi} Bigl( int_{0}^{1} U(r,phi_1,phi_2)r^2 sin(phi_1) dr Bigr) d phi_1 Biggr) dphi_2 end{eqnarray} ここで( U(r,phi_1,phi_2) =1 )として積分範囲を(r)とすると球の体積の公式になる。 begin{eqnarray} int U(x,y,z) dV &=& int_{0}^{2pi} Biggl( int_{0}^{pi} Bigl( int_{0}^{r} r^2 sin(phi_1) dr Bigr) d phi_1 Biggr) dphi_2 \\ &=& int_{0}^{2pi} int_{0}^{pi} Bigl( int_{0}^{r} frac{sin(phi_1)}{3} bigl[ r^3 bigr]_{0}^{r} Bigr) dphi_1 dphi_2 \\ &=& int_{0}^{2pi} int_{0}^{pi} frac{r^3 sin(phi_1)}{3} dphi_1 dphi_2 \\ &=& int_{0}^{2pi} -frac{r^3}{3} bigl[ cos(phi_1) bigr]_{0}^{pi} dphi_2 \\ &=& int_{0}^{2pi} frac{2r^3}{3} dphi_2 \\ &=& frac{2r^3}{3} bigl[ phi_2bigr]_{0}^{2pi} \\ &=& frac{4pi r^3}{3} end{eqnarray} 次回、微小体積とヤコビアンが等しい理由を書いてみます。

既知の標準偏差をもとに母平均を推定する

[mathjax] 機械が出力した結果を観測すると、観測結果がある平均値を中心として誤差内に含まれ、その分布が正規分布を成すことがわかる。既に存在する機械の誤差（標準偏差）は既知であり、既知の標準偏差を使って、母平均を予測することができる。予測の仕方は、95%信頼区間を使う。母平均を推定する例ドリンク製造装置があったとする。このドリンク製造装置は標準偏差=12の誤差でドリンクを製造できる。ドリンクを36個製造したとき、ドリンクの量の標本平均が370mlであった。母集団が、母平均(mu)、標準偏差(sigma)の正規分布である場合、母平均の95%信頼区間は、 begin{eqnarray} -1.96 leq frac{x-mu}{sigma} leq 1.96 end{eqnarray} この母手段から、(N)個の標本を観測したなら、標本の分布は、標本平均(mu)、標準偏差(frac{sigma}{sqrt{N}})の正規分布となる。標本平均の95%信頼区間は、 begin{eqnarray} -1.96 leq frac{bar{x}-mu}{frac{sigma}{sqrt{N}}} leq 1.96 end{eqnarray} 今、(N=36)、(bar{x}=370)、(sigma=12)なので、それを入れてみる。 begin{eqnarray} -1.96 leq frac{370-mu}{frac{12}{sqrt{36}}} leq 1.96 \\ -1.96 leq frac{370-mu}{2} leq 1.96 \\ -3.92-370 leq -mu leq 3.92-370 \\ 366.08 leq mu leq 373.92 end{eqnarray} 母平均が棄却されない区間は、(366.08 leq mu leq 373.92)となる。標本の数(N)が増えれば増えるほど95%信頼区間が狭くなっていき、母平均をドンピシャで当てる確度が上がっていく。

Fellegi-Sunterモデルに基づく確率的名寄せパッケージ Splinkを試してみる

[mathjax] Record Linkage、Entity Recognitionなど、いわゆる「名寄せ」問題には、割とさまざまな解決策が提案されている。その1つに確率論的な数学的背景を持つFellegi-Sunterモデルを実装したSplinkがある。数学的背景について咀嚼して説明してくれているサイトはあまりなく、Splinkの公式ドキュメントが唯一に近いソースだろうと思う。今回は5万人の人物データを使って重複を除去するSplinkの主要な機能のサンプルを追ってみた。数式を読んだところで実りは薄い、ということもあり、なるべく数式を読まずに読み進めたが、モデルのパラメタ、予測結果を解釈する際にどうしても数式を読まないとわからない箇所があった。特にベイズ統計について理解がかなり浅くて、正直なところ理解しきれてはいない。 Splinkの公式ドキュメントを読み進めていった際に気付いたメモを書いてみることにした。 [arst_toc tag=\"h4\"] 環境構築・準備環境構築の実装部分は主な学習要素ではないのでClaude Codeでサクッと作ってみた。まずはPlan modeで計画を立ててもらう。これぐらいだとほぼ言い値で使える。 DuckDB、Splinkを使う最小構成の環境を作ります。環境はDocker composeで構築します。計画を立ててください。 ⏺ DuckDB、Splinkを使うDocker Compose環境の計画を完了しました。計画概要 1. 設計文書: .tmp/design.mdで要件、アーキテクチャ、技術仕様を定義 2. タスク管理: .tmp/task.mdで詳細な実装手順を3フェーズに分けて整理主要コンポーネント - Jupyter Lab環境: DuckDB、Splink、必要なライブラリがプリインストール - データボリューム: サンプルデータ、notebook、出力用のディレクトリ - 最小構成: 開発・学習用途に特化した軽量環境次のステップ実装を開始する場合は、Phase 1から順番に進めます： 1. Docker設定ファイル作成 2. ディレクトリ構造構築 3. サンプル実装 4. テストと検証計画の詳細は.tmp/design.mdと.tmp/task.mdをご確認ください。実装を開始しますか？実際にファイルを作ってもらうと以下のような構成となる。得られる中間成果物である docker-compose.yml、Dockerfile は本記事では省略する。 . ├── data ├── docker-compose.yml ├── Dockerfile ├── notebooks ├── output └── requirements.txt 普通に http://localhost:8888 で JupyterLab が開く。使用するサンプルデータ 5万人の人物データを使って名寄せを行うサンプル。おそらくSplinkの用途として最初に思いつくやつ。 Splinkにデータをロードする前に必要なデータクリーニング手順について説明がある。公式によると、まずは行に一意のIDを割り当てる必要がある。データセット内で一意となるIDであって、重複除去した後のエンティティを識別するIDのことではない。 [clink implicit=\"false\" url=\"https://moj-analytical-services.github.io/splink/demos/tutorials/01_Prerequisites.html\" imgurl=\"https://user-images.githubusercontent.com/7570107/85285114-3969ac00-b488-11ea-88ff-5fca1b34af1f.png\" title=\"Data Prerequisites\" excerpt=\"Splink では、リンクする前にデータをクリーンアップし、行に一意の ID を割り当てる必要があります。このセクションでは、Splink にデータをロードする前に必要な追加のデータクリーニング手順について説明します。\"] 使用するサンプルデータは以下の通り。 from splink import splink_datasets df = splink_datasets.historical_50k df.head() データの分布を可視化 splink.exploratoryのprofile_columnsを使って分布を可視化してみる。 from splink import DuckDBAPI from splink.exploratory import profile_columns db_api = DuckDBAPI() profile_columns(df, db_api, column_expressions=[\"first_name\", \"substr(surname,1,2)\"]) 同じ姓・名の人が大量にいることがわかる。ブロッキングとブロッキングルールの評価テーブル内のレコードが他のレコードと「同一かどうか」を調べるためには、基本的には、他のすべてのレコードとの何らかの比較操作を行うこととなる。全てのレコードについて全てのカラム同士を比較したいのなら、対象のテーブルをCROSS JOINした結果、各カラム同士を比較することとなる。 SELECT ... FROM input_tables as l CROSS JOIN input_tables as r あるカラムが条件に合わなければ、もうその先は見ても意味がない、というケースは多い。例えば、まず first_name 、surname が同じでなければ、その先の比較を行わない、というのはあり得る。 SELECT ... FROM input_tables as l INNER JOIN input_tables as r ON l.first_name = r.first_name AND l.surname = r.surname このような考え方をブロッキング、ON句の条件をブロッキングルールと言う。ただ、これだと性と名が完全一致していないレコードが残らない。そこで、ブロッキングルールを複数定義し、いずれかが真であれば残すことができる。ここでポイントなのが、ブロッキングルールを複数定義したとき、それぞれのブロッキングルールで重複して選ばれるレコードが発生した場合、 Splinkが自動的に排除してくれる。このため、ブロッキングルールを重ねがけすると、最終的に残るレコード数は一致する。ただ、順番により、同じルールで残るレコード数は変化する。逆に言うと、ブロッキングルールを足すことで、重複除去後のOR条件が増えていく。積算グラフにして、ブロッキングルールとその順番の効果を見ることができる。 from splink import DuckDBAPI, block_on from splink.blocking_analysis import ( cumulative_comparisons_to_be_scored_from_blocking_rules_chart, ) blocking_rules = [ block_on(\"substr(first_name,1,3)\", \"substr(surname,1,4)\"), block_on(\"surname\", \"dob\"), block_on(\"first_name\", \"dob\"), block_on(\"postcode_fake\", \"first_name\"), block_on(\"postcode_fake\", \"surname\"), block_on(\"dob\", \"birth_place\"), block_on(\"substr(postcode_fake,1,3)\", \"dob\"), block_on(\"substr(postcode_fake,1,3)\", \"first_name\"), block_on(\"substr(postcode_fake,1,3)\", \"surname\"), block_on(\"substr(first_name,1,2)\", \"substr(surname,1,2)\", \"substr(dob,1,4)\"), ] db_api = DuckDBAPI() cumulative_comparisons_to_be_scored_from_blocking_rules_chart( table_or_tables=df, blocking_rules=blocking_rules, db_api=db_api, link_type=\"dedupe_only\", ) 積算グラフは以下の通り。積み上がっている数値は「比較の数」。要は、論理和で条件を足していって、次第に緩和されている様子がわかる。 DuckDBでは比較の数を2,000万件以内、Athena,Sparkでは1億件以内を目安にせよとのこと。比較の定義 Splinkは Fellegi-Sunter model モデル (というかフレームワーク) に基づいている。 https://moj-analytical-services.github.io/splink/topic_guides/theory/fellegi_sunter.html 各カラムの同士をカラムの特性に応じた距離を使って比較し、重みを計算していく。各カラムの比較に使うためのメソッドが予め用意されているので、特性に応じて選んでいく。以下では、first_name, sur_name に ForenameSurnameComparison が使われている。 dobにDateOfBirthComparison、birth_place、ocupationにExactMatchが使われている。 import splink.comparison_library as cl from splink import Linker, SettingsCreator settings = SettingsCreator( link_type=\"dedupe_only\", blocking_rules_to_generate_predictions=blocking_rules, comparisons=[ cl.ForenameSurnameComparison( \"first_name\", \"surname\", forename_surname_concat_col_name=\"first_name_surname_concat\", ), cl.DateOfBirthComparison( \"dob\", input_is_string=True ), cl.PostcodeComparison(\"postcode_fake\"), cl.ExactMatch(\"birth_place\").configure(term_frequency_adjustments=True), cl.ExactMatch(\"occupation\").configure(term_frequency_adjustments=True), ], retain_intermediate_calculation_columns=True, ) # Needed to apply term frequencies to first+surname comparison df[\"first_name_surname_concat\"] = df[\"first_name\"] + \" \" + df[\"surname\"] linker = Linker(df, settings, db_api=db_api) ComparisonとComparison Level ここでSplinkツール内の比較の概念の説明。以下の通り概念に名前がついている。 Data Linking Model ├─-- Comparison: Date of birth │ ├─-- ComparisonLevel: Exact match │ ├─-- ComparisonLevel: One character difference │ ├─-- ComparisonLevel: All other ├─-- Comparison: First name │ ├─-- ComparisonLevel: Exact match on first_name │ ├─-- ComparisonLevel: first_names have JaroWinklerSimilarity > 0.95 │ ├─-- ComparisonLevel: first_names have JaroWinklerSimilarity > 0.8 │ ├─-- ComparisonLevel: All other モデルのパラメタ推定モデルの実行に必要なパラメタは以下の3つ。Splinkを用いてパラメタを得る。ちなみに u は \"\'U\'nmatch\"、m は \"\'M\'atch\"。背後の数式の説明で現れる。 No パラメタ説明 1 無作為に選んだレコードが一致する確率入力データからランダムに取得した2つのレコードが一致する確率 (通常は非常に小さい数値) 2 u値(u確率) 実際には一致しないレコードの中で各 ComparisonLevel に該当するレコードの割合。具体的には、レコード同士が同じエンティティを表すにも関わらず値が異なる確率。例えば、同じ人なのにレコードによって生年月日が違う確率。これは端的には「データ品質」を表す。名前であればタイプミス、別名、ニックネーム、ミドルネーム、結婚後の姓など。 3 m値(m確率) 実際に一致するレコードの中で各 ComparisonLevel に該当するレコードの割合。具体的には、レコード同士が異なるエンティティを表すにも関わらず値が同じである確率。例えば別人なのにレコードによって性・名が同じ確率 (同姓同名)。性別は男か女かしかないので別人でも50%の確率で一致してしまう。無作為に選んだレコードが一致する確率入力データからランダムに抽出した2つのレコードが一致する確率を求める。値は0.000136。すべての可能なレコードのペア比較のうち7,362.31組に1組が一致すると予想される。合計1,279,041,753組の比較が可能なため、一致するペアは合計で約173,728.33組になると予想される、とのこと。 linker.training.estimate_probability_two_random_records_match( [ block_on(\"first_name\", \"surname\", \"dob\"), block_on(\"substr(first_name,1,2)\", \"surname\", \"substr(postcode_fake,1,2)\"), block_on(\"dob\", \"postcode_fake\"), ], recall=0.6, ) > Probability two random records match is estimated to be 0.000136. > This means that amongst all possible pairwise record comparisons, > one in 7,362.31 are expected to match. > With 1,279,041,753 total possible comparisons, > we expect a total of around 173,728.33 matching pairs u確率の推定実際には一致しないレコードの中でComparisonの評価結果がPositiveである確率。基本、無作為に抽出したレコードは一致しないため、「無作為に抽出したレコード」を「実際には一致しないレコード」として扱える、という点がミソ。 probability_two_random_records_match によって得られた値を使ってu確率を求める。 estimate_u_using_random_sampling によって、ラベルなし、つまり教師なしでu確率を得られる。レコードのペアをランダムでサンプルして上で定義したComparisonを評価する。ランダムサンプルなので大量の不一致が発生するが、各Comparisonにおける不一致の分布を得ている。これは、例えば性別について、50%が一致、50%が不一致である、という分布を得ている。一方、例えば生年月日について、一致する確率は 1%、1 文字の違いがある確率は 3%、その他はすべて 96% の確率で発生する、という分布を得ている。 linker.training.estimate_u_using_random_sampling(max_pairs=5e6) > ----- Estimating u probabilities using random sampling ----- > > Estimated u probabilities using random sampling > > Your model is not yet fully trained. Missing estimates for: > - first_name_surname (no m values are trained). > - dob (no m values are trained). > - postcode_fake (no m values are trained). > - birth_place (no m values are trained). > - occupation (no m values are trained). m確率の推定「実際に一致するレコード」の中で、Comparisonの評価がNegativeになる確率。そもそも、このモデルを使って名寄せ、つまり「一致するレコード」を見つけたいのだから、モデルを作るために「実際に一致するレコード」を計算しなければならないのは矛盾では..となる。無作為抽出結果から求められるu確率とは異なり、m確率を求めるのは難しい。もしラベル付けされた「一致するレコード」、つまり教師データセットがあるのであれば、そのデータセットを使ってm確率を求められる。例えば、日本人全員にマイナンバーが振られて、全てのレコードにマイナンバーが振られている、というアナザーワールドがあるのであれば、マイナンバーを使ってm確率を推定する。(どういう状況??) ラベル付けされたデータがないのであれば、EMアルゴリズムでm確率を求めることになっている。 EMアルゴリズムは反復的な手法で、メモリや収束速度の点でペア数を減らす必要があり、例ではブロッキングルールを設定している。以下のケースでは、first_nameとsurnameをブロッキングルールとしている。つまり、first_name, surnameが完全に一致するレコードについてペア比較を行う。この仮定を設定したため、first_name, surname (first_name_surname) のパラメタを推定できない。 training_blocking_rule = block_on(\"first_name\", \"surname\") training_session_names = ( linker.training.estimate_parameters_using_expectation_maximisation( training_blocking_rule, estimate_without_term_frequencies=True ) ) > ----- Starting EM training session ----- > > Estimating the m probabilities of the model by blocking on: > (l.\"first_name\" = r.\"first_name\") AND (l.\"surname\" = r.\"surname\") > > Parameter estimates will be made for the following comparison(s): > - dob > - postcode_fake > - birth_place > - occupation > > Parameter estimates cannot be made for the following comparison(s) since they are used in the blocking rules: > - first_name_surname > > Iteration 1: Largest change in params was 0.248 in probability_two_random_records_match > Iteration 2: Largest change in params was 0.0929 in probability_two_random_records_match > Iteration 3: Largest change in params was -0.0237 in the m_probability of birth_place, level `Exact match on > birth_place` > Iteration 4: Largest change in params was 0.00961 in the m_probability of birth_place, level `All other >comparisons` > Iteration 5: Largest change in params was -0.00457 in the m_probability of birth_place, level `Exact match on birth_place` > Iteration 6: Largest change in params was -0.00256 in the m_probability of birth_place, level `Exact match on birth_place` > Iteration 7: Largest change in params was 0.00171 in the m_probability of dob, level `Abs date difference Iteration 8: Largest change in params was 0.00115 in the m_probability of dob, level `Abs date difference Iteration 9: Largest change in params was 0.000759 in the m_probability of dob, level `Abs date difference Iteration 10: Largest change in params was 0.000498 in the m_probability of dob, level `Abs date difference Iteration 11: Largest change in params was 0.000326 in the m_probability of dob, level `Abs date difference Iteration 12: Largest change in params was 0.000213 in the m_probability of dob, level `Abs date difference Iteration 13: Largest change in params was 0.000139 in the m_probability of dob, level `Abs date difference Iteration 14: Largest change in params was 9.04e-05 in the m_probability of dob, level `Abs date difference <= 10 year` 同様にdobをブロッキングルールに設定して実行すると、dob以外の列についてパラメタを推定できる。 training_blocking_rule = block_on(\"dob\") training_session_dob = ( linker.training.estimate_parameters_using_expectation_maximisation( training_blocking_rule, estimate_without_term_frequencies=True ) ) > ----- Starting EM training session ----- > > Estimating the m probabilities of the model by blocking on: > l.\"dob\" = r.\"dob\" > > Parameter estimates will be made for the following comparison(s): > - first_name_surname > - postcode_fake > - birth_place > - occupation > > Parameter estimates cannot be made for the following comparison(s) since they are used in the blocking rules: > - dob > > Iteration 1: Largest change in params was -0.474 in the m_probability of first_name_surname, level `Exact match on first_name_surname_concat` > Iteration 2: Largest change in params was 0.052 in the m_probability of first_name_surname, level `All other comparisons` > Iteration 3: Largest change in params was 0.0174 in the m_probability of first_name_surname, level `All other comparisons` > Iteration 4: Largest change in params was 0.00532 in the m_probability of first_name_surname, level `All other comparisons` > Iteration 5: Largest change in params was 0.00165 in the m_probability of first_name_surname, level `All other comparisons` > Iteration 6: Largest change in params was 0.00052 in the m_probability of first_name_surname, level `All other comparisons` > Iteration 7: Largest change in params was 0.000165 in the m_probability of first_name_surname, level `All other comparisons` > Iteration 8: Largest change in params was 5.29e-05 in the m_probability of first_name_surname, level `All other comparisons` > > EM converged after 8 iterations > > Your model is not yet fully trained. Missing estimates for: > - first_name_surname (some u values are not trained). モデルパラメタの可視化 m確率、u確率の可視化。マッチウェイトの可視化。マッチウェイトは (log_2 (m / u))で計算される。 linker.visualisations.match_weights_chart() モデルの保存と読み込み以下でモデルを保存できる。 settings = linker.misc.save_model_to_json( \"./saved_model_from_demo.json\", overwrite=True ) 以下で保存したモデルを読み込める。 import json settings = json.load( open(\'./saved_model_from_demo.json\', \'r\') ) リンクするのに十分な情報が含まれていないレコード「John Smith」のみを含み、他のすべてのフィールドがnullであるレコードは、他のレコードにリンクされている可能性もあるが、潜在的なリンクを明確にするには十分な情報がない。以下により可視化できる。 linker.evaluation.unlinkables_chart() 横軸は「マッチウェイトの閾値」。縦軸は「リンクするのに十分な情報が含まれないレコード」の割合。マッチウェイト閾値=6.11ぐらいのところを見ると、入力データセットのレコードの約1.3%がリンクできないことが示唆される。訓練済みモデルを使って未知データのマッチウェイトを予測上で構築した推定モデルを使用し、どのペア比較が一致するかを予測する。内部的には以下を行うとのこと。 blocking_rules_to_generate_predictionsの少なくとも1つと一致するペア比較を生成 Comparisonで指定されたルールを使用して、入力データの類似性を評価推定された一致重みを使用し、要求に応じて用語頻度調整を適用して、最終的な一致重みと一致確率スコアを生成 df_predictions = linker.inference.predict(threshold_match_probability=0.2) df_predictions.as_pandas_dataframe(limit=1) > Blocking time: 0.88 seconds > Predict time: 1.91 seconds > > -- WARNING -- > You have called predict(), but there are some parameter estimates which have neither been estimated or > specified in your settings dictionary. To produce predictions the following untrained trained parameters will > use default values. > Comparison: \'first_name_surname\': > u values not fully trained records_to_plot = df_e.to_dict(orient=\"records\") linker.visualisations.waterfall_chart(records_to_plot, filter_nulls=False) predictしたマッチウェイトの可視化、数式との照合 predictしたマッチウェイトは、ウォーターフォール図で可視化できる。マッチウェイトは、モデル内の各特徴量によって一致の証拠がどの程度提供されるかを示す中心的な指標。 (lambda)は無作為抽出した2つのレコードが一致する確率。(K=m/u)はベイズ因子。 begin{align} M &= log_2 ( frac{lambda}{1-lambda} ) + log_2 K \\ &= log_2 ( frac{lambda}{1-lambda} ) + log_2 m - log_2 u end{align} 異なる列の比較が互いに独立しているという仮定を置いていて、 2つのレコードのベイズ係数が各列比較のベイズ係数の積として扱う。 begin{eqnarray} K_{feature} = K_{first_name_surname} + K_{dob} + K_{postcode_fake} + K_{birth_place} + K_{occupation} + cdots end{eqnarray} マッチウェイトは以下の和。 begin{eqnarray} M_{observe} = M_{prior} + M_{feature} end{eqnarray} ここで begin{align} M_{prior} &= log_2 (frac{lambda}{1-lambda}) \\ M_{feature} &= M_{first_name_surname} + M_{dob} + M_{postcode_fake} + M_{birth_place} + M_{occupation} + cdots end{align} 以下のように書き換える。 begin{align} M_{observe} &= log_2 (frac{lambda}{1-lambda}) + sum_i^{feature} log_2 (frac{m_i}{u_i}) \\ &= log_2 (frac{lambda}{1-lambda}) + log_2 (prod_i^{feature} (frac{m_i}{u_i}) ) end{align} ウォーターフォール図の一番左、赤いバーは(M_{prior} = log_2 (frac{lambda}{1-lambda}))。特徴に関する追加の知識が考慮されていない場合のマッチウェイト。横に並んでいる薄い緑のバーは (M_{first_name_surname} + M_{dob} + M_{postcode_fake} + M_{birth_place} + M_{occupation} + cdots)。各特徴量のマッチウェイト。一番右の濃い緑のバーは2つのレコードの合計マッチウェイト。 begin{align} M_{feature} &= M_{first_name_surname} + M_{dob} + M_{postcode_fake} + M_{birth_place} + M_{occupation} + cdots \\ &= 8.50w end{align} まとめ長くなったのでいったん終了。この記事では教師なし確率的名寄せパッケージSplinkを使用してモデルを作ってみた。次の記事では、作ったモデルを使用して実際に名寄せをしてみる。途中、DuckDBが楽しいことに気づいたので、DuckDBだけで何個か記事にしてみようと思う。

Fellegi-Sunterモデルに基づく確率的名寄せパッケージ Splinkを試してみる

環境構築・準備

使用するサンプルデータ

データの分布を可視化

ブロッキングとブロッキングルールの評価

比較の定義

ComparisonとComparison Level

モデルのパラメタ推定

無作為に選んだレコードが一致する確率

u確率の推定

m確率の推定

モデルパラメタの可視化

モデルの保存と読み込み

リンクするのに十分な情報が含まれていないレコード

訓練済みモデルを使って未知データのマッチウェイトを予測

predictしたマッチウェイトの可視化、数式との照合

まとめ

React+Next.jsでDummy JSONのCRUDをCSR/SSRの両方で作成して違いを調べてみた話

go-txdbを使ってgolang, gin, gorm(gen)+sqlite構成のAPI をテストケース毎に管理する

gorm互換の型安全なORMであるgenでCRUD APIを試作

Golang + Gin カスタムバリデーション

Golang + Gin Framework で Hello World してみた話〜基本的なルーティング、バスパラメタ・クエリパラメタ・JSON Req/Res、フォームデータ

Snowflake MCPサーバを試してみた

Fellegi-Sunterモデルに基づく確率的名寄せパッケージ Splinkを試してみる

AirflowでEnd-To-End Pipeline Testsを行うためにAirflow APIを調べてみた話

CustomOperatorのUnitTestを理解するためGCSToBigQueryOperatorのUnitTestを読んでみた話

GoogleによるAirflow DAG実装のベスプラ集を読んでみた – その1

環境構築・準備

使用するサンプルデータ

データの分布を可視化

ブロッキングとブロッキングルールの評価

比較の定義

ComparisonとComparison Level

モデルのパラメタ推定

無作為に選んだレコードが一致する確率

u確率の推定

m確率の推定

モデルパラメタの可視化

モデルの保存と読み込み

リンクするのに十分な情報が含まれていないレコード

訓練済みモデルを使って未知データのマッチウェイトを予測

predictしたマッチウェイトの可視化、数式との照合

まとめ

関連記事