--- title: Splink created: 2026-07-17 updated: 2026-07-17 type: entity tags: [tool, civic-tech, public-interest, quality, data-protection] sources: [raw/articles/splink-probabilistic-record-linkage-docs-2026.md, raw/articles/splink-github-repo-2026.md] confidence: medium --- # Splink Splink は、共通 ID を持たないデータセットの重複排除・照合を行うための Python 製 probabilistic record linkage / entity resolution ツール。Fellegi-Sunter モデルを基礎に、term frequency adjustment、ユーザー定義の fuzzy matching、blocking、unsupervised training、DuckDB/Spark/Athena などの backend を組み合わせ、大規模データでも照合結果とその根拠を確認しやすくする。^[raw/articles/splink-probabilistic-record-linkage-docs-2026.md] Yuta の Wiki では、Splink は単なるデータ前処理ライブラリというより、[[record-linkage-data-cleaning]] を行政・医療・研究・公共サービスで実用化する道具として重要。英国 Ministry of Justice、Office for National Statistics、NHS England、自治体、UNHCR、ABS などの use case が並び、データ統合が政策・給付・医療・統計の判断基盤になる場面で使われている。これは [[legal-document-open-data]] と同じく、公共情報を機械処理しやすくする civic-tech だが、Splink の焦点は形式標準ではなく「同じ人・組織・住所・記録をどれだけ信頼して同一視できるか」にある。^[raw/articles/splink-probabilistic-record-linkage-docs-2026.md] ## 技術的な見どころ - **教師なしで始められる照合**: 正解ラベルがない状態でも、random sampling や expectation maximisation でモデル推定を進められる。 - **大規模 backend**: 小規模には DuckDB、大規模には Spark/Athena などを使い、100M+ records のような運用にも寄せられる。 - **説明可能な出力**: match probability だけでなく、comparison viewer や interactive outputs で、どの属性が照合に効いたかを診断できる。 - **データ品質の前提を明示**: 複数の非相関カラムがあるデータに向き、単一の bag-of-words カラムには不向きだと明記している。 ## 注意点 Record linkage は [[information-integrity]] と [[data-protection-and-expression]] の間にある。重複を消す・個人を同定する・別システムの記録をつなぐことは、公共サービスの品質を上げる一方で、誤結合、過剰な個人追跡、説明不能な行政判断にもつながる。Splink のような道具は、照合品質、human review、データ最小化、異議申立て、監査可能性と一緒に設計されるべきである。