Files
llm-wiki/concepts/record-linkage-data-cleaning.md
T
2026-07-18 10:09:57 +09:00

3.2 KiB

title, created, updated, type, tags, sources, confidence
title created updated type tags sources confidence
Record Linkage and Data Cleaning 2026-07-17 2026-07-17 concept
quality
reliability
civic-tech
public-interest
data-protection
raw/articles/nii-record-linkage-research-trends-2004.md
raw/articles/splink-probabilistic-record-linkage-docs-2026.md
medium

Record Linkage and Data Cleaning

Record linkage は、共通の一意識別子を持たない複数のデータベースから、同じ実体を指す record を見つけ、重複や分断を減らす技術領域。NII の 2004 年レビューは、record matching、entity reconciliation、merge/purge、deduplication など多くの呼び名をまとめ、出生・死亡・婚姻、医療、国勢調査、書誌、Web 由来の半構造化データなど、長期・分散的に作られたデータの品質管理問題として位置づけている。^[raw/articles/nii-record-linkage-research-trends-2004.md]

重要なのは、record linkage が単独の機械学習問題ではなく、データクリーニング全体の一部だという点。欠損・誤り・表記揺れ・schema 変換・domain knowledge・人手判定が絡むため、NII レビューは「現実世界のデータを前提とした総合的なシステム設計」として扱うべきだと述べる。これは e2e-coverage-metrics が単なるテスト件数ではなく実装由来の観測可能性を要求するのと似ており、品質はアルゴリズム単体ではなく周辺 loop で決まる。^[raw/articles/nii-record-linkage-research-trends-2004.md]

現代的な実装例

splink は、この古典的な record linkage 問題を Python / DuckDB / Spark で扱いやすくした実装例。Fellegi-Sunter モデル、blocking、fuzzy matching、term frequency adjustment、unsupervised training、interactive diagnostics を組み合わせ、公共部門・医療・統計・自治体のデータ統合で使われている。^[raw/articles/splink-probabilistic-record-linkage-docs-2026.md]

Wiki 上で見る軸

  • 照合品質: false match と missed match が行政・医療・研究の判断にどう影響するか。
  • 説明可能性: なぜ同一 record と判断したか、どの属性が効いたかを後から監査できるか。
  • 人間の関与: domain knowledge、clerical review、異議申立て、例外処理をどこに置くか。
  • プライバシーと最小化: データ統合が便利になるほど、過剰な個人追跡や目的外利用を抑える設計が必要になる。
  • 公共情報基盤: legal-document-open-data が文書の構造・版・引用を守るのに対し、record linkage は分散した記録の同一性と品質を守る。

Open Questions

  • AI/LLM が行政データ統合や調査支援に入る場合、record linkage の不確実性を UI と監査ログにどう表示すべきか。
  • 人手レビューが高コストなとき、どの閾値・サンプル・active learning 戦略が公共サービスとして妥当か。
  • Privacy-preserving record linkage や zero-knowledge identity 系の技術は、social-media-age-assurance や data-protection-and-expression とどの範囲で接続できるか。