
電子カルテやレセプト、検査結果といった医療データは、発生する部門もシステムも分かれているため、そのままでは分析に使えない状態で蓄積されていきます。表記ゆれや患者IDの重複、単位の不統一を放置したまま分析へ進むと、導き出した結論そのものが揺らぎます。クレンジングでは、この不備を取り除き、分析と突合に耐える状態へ整えていきます。
医療データの整備が難航する背景には、医療分野特有の事情があります。同じ検査項目でも施設ごとにコードや単位が異なり、患者IDもシステムをまたぐと別人として登録されている場合が少なくないのです。加えて個人情報保護の制約があるため、一般的なデータ整備の手順をそのまま適用できない点が特有の難しさです。
本記事では、医療データクレンジングの定義と対象範囲、品質が低下する要因、6段階の進め方を実務目線で解説します。個人情報保護を踏まえた実務対応と、現場で起こりやすい失敗パターンもあわせて取り上げます。組織の整備計画を設計する際の下敷きとして活用してください。
目次
医療データクレンジングとは
医療データクレンジングは、単に誤字を直す作業ではありません。病名や薬剤名の表記を統一する標準化、重複レコードの統合、欠損への対応までを含む一連の工程を指すものです。ここでは定義と対象データ、一般的なデータクレンジングとの違いを整理します。
医療データクレンジングの定義:標準化・重複統合・欠損対応までを含む工程
医療データクレンジングとは、電子カルテやレセプトに蓄積されたデータを、分析や二次利用に耐える状態へ整える一連の工程を指します。作業範囲が表記の統一にとどまらない点が特徴です。病名や薬剤名を標準コードへ変換する標準化、同一患者や同一検査を指す重複レコードの統合、欠損値や外れ値の扱いを決めるルール整備までが含まれます。対象件数は数万件から数百万件に及ぶことも珍しくありません。手作業の修正だけで完結させる前提を置くと、工程の途中で必ず行き詰まるものです。
工程の位置づけを整理すると、クレンジングは分析の前工程というより、データ基盤の運用そのものに組み込むべき継続的な活動です。一度整備して終わりにすると、新しい診療科の追加やシステム更改のたびに品質は元の水準へ戻ってしまいます。実際、更改から1年程度で入力ルールの逸脱が再発する例は少なくないのです。定義の段階で「どこまでを整備の範囲とするか」を文書化しておくと、後工程での認識のずれを防げます。範囲を決める際は、分析に使う項目と、突合に使うキー項目を分けて列挙すると判断しやすくなります。
データクレンジングとは?意味と代表手法を解説!
対象となるデータの種類:電子カルテ、レセプト、検査、健診、DPCデータ
医療データクレンジングの対象は、発生源ごとに性質が大きく異なります。電子カルテは自由記載が多く、同じ所見でも記述の粒度が担当医によって変わります。レセプトは請求ルールに沿って構造化されている一方、傷病名が請求上の理由で付与される場合があり、臨床実態と一致しないことがあるのです。急性期病院で扱うDPCデータは様式ごとに項目定義が決まっており比較的整っていますが、様式間の突合には患者IDと入院年月日の一致が前提になります。
データ種別 | 主な発生源 | 品質上の課題 | クレンジングの重点 |
|---|---|---|---|
電子カルテ | 診療部門 | 自由記載による粒度の差、略語の混在 | 病名の標準化、略語の展開ルール |
レセプト | 医事会計 | 請求都合の傷病名、月単位の粒度 | 傷病名の主副判定、期間の名寄せ |
検査データ | 検査部門 | 項目コードと単位の不統一 | JLAC10への対応づけ、単位換算 |
健診データ | 健診部門 | 年度ごとの項目改定、経年比較の断絶 | 項目マスタの履歴管理 |
DPCデータ | 医事会計 | 様式間の突合キーの欠落 | 患者IDと入院年月日の整合確認 |
検査データと健診データは、数値そのものは扱いやすい一方で、項目コードと単位の管理が課題になります。同じ「HbA1c」でも施設によってJDS値とNGSP値が混在し、換算しないまま比較すると0.4程度の差が生じます。健診データは経年比較を前提とするため、項目マスタが年度ごとに改定されている点にも注意が必要です。医療分野のデジタル化で施設間のデータ連携が進むほど、この差分は表面化しやすくなります。単位と項目コードの一覧は、検査部門から年に1回は最新版を受け取る運用が安全です。
医療DXとは?具体的な施策や成功のポイント、医療DX令和ビジョン2030を解説
一般的なデータクレンジングとの違い:標準コードと法規制が前提になる
一般的なデータクレンジングでは、表記ゆれの統一や欠損補完を、業務上の使いやすさを基準に判断します。医療データでは、この判断基準が2つ増えます。1つは標準コードという外部の正解が存在する点、もう1つは個人情報保護法をはじめとする法規制が処理の前提になる点です。たとえば病名は、任意の表記に丸めるのではなく、ICD-10やMEDIS標準病名マスターへ対応づける必要があります。医薬品や検査項目についても、外部の標準が判断の基準になります。
比較軸 | 一般的なデータクレンジング | 医療データクレンジング |
|---|---|---|
統一の基準 | 社内ルールや業務上の使いやすさ | ICD-10、JLAC10などの外部標準コード |
判断の主体 | データ管理部門が単独で決定 | 診療部門や検査部門との合意が前提 |
法規制の関与 | 業種により限定的 | 個人情報保護法と関連法令が常に関与 |
誤りの影響 | 集計のやり直しで回復可能 | 研究結果や診療判断まで波及 |
再整備の頻度 | システム更改時が中心 | 項目改定や診療科新設のたびに発生 |
処理を誤ったときの影響範囲が大きい点も、医療データならではの特徴です。売上データの分類誤りは集計をやり直せば回復しますが、臨床研究に用いたデータで病名の統合を誤ると、論文の結論そのものが揺らぎます。加えて、加工履歴を残していなければ、どの段階で誤りが混入したかを追跡できません。品質基準と加工ルールを先に文書化し、そのうえで作業へ入る順序を守ってください。作業に入る前のルール文書は、A4で2枚程度あれば実務では足ります。
医療データの品質が低下する主な要因
品質の低下は、担当者の注意不足だけが原因ではありません。部門ごとに最適化されたシステム構成や、診療現場の運用制約が積み重なった結果として生じるものです。ここでは現場で頻出する5つの要因を、発生メカニズムとあわせて整理します。
部門システムごとに入力ルールが異なる
同じ患者情報でも、医事会計、電子カルテ、検査、放射線と、部門システムごとに入力ルールが分かれている施設は少なくありません。氏名の入力ひとつをとっても、姓名の間にスペースを入れる部門と入れない部門が混在します。カナ氏名の全角と半角、旧字体の扱い、生年月日の和暦と西暦も同様です。こうした差異は個々には小さく見えますが、突合時には一致率を10ポイント以上押し下げる要因になります。突合のキーに使う項目ほど、部門をまたいだ差異が致命的になるのです。
- 氏名:姓名の間にスペースを入れるかどうか
- カナ氏名:全角と半角、長音記号の扱い
- 生年月日:和暦と西暦、区切り文字の有無
- 性別:数値コードと「男/女」の文字列
- 患者ID:桁数と先頭のゼロ埋めの有無
回避策は、入力規則をシステム側で強制する方向へ寄せることです。自由入力欄を選択式へ変更する、必須項目のチェックを保存時に走らせるといった対応が有効になります。ただし現場の入力負荷が増えると運用が形骸化するため、変更対象は突合に使うキー項目へ絞ってください。氏名、カナ氏名、生年月日、性別、患者IDの5項目から着手すると、費用対効果が見えやすくなります。変更の影響範囲が読めない場合は、1部門で試行してから全体へ広げる進め方が安全です。
データ品質とは?品質評価項目や品質を向上させるための実務的対策を解説
病名・薬剤名の表記ゆれと略語の混在
病名の表記ゆれは、医療データで最も件数が多い品質課題です。「胃癌」「胃がん」「胃ガン」といった表記が同一施設内に併存することは珍しくありません。加えて「DM」「HT」「AF」といった略語が経過記録に混在し、これらを機械的に展開すると別の疾患と取り違える危険があります。薬剤名も同様で、先発品名、一般名、院内略称が並存している状態が標準的です。初回の調査では、病名の異なり数が実際の疾患数の3倍前後になる施設も見られます。
対処の基本は、表記のパターンを人手で潰すのではなく、標準マスターへの対応表を作って一括変換する方法になります。対応表は完全自動での生成に頼らず、変換率の低い上位100件を目視で確認する運用が現実的です。実務では、全体の8割程度が文字列の正規化と辞書照合で機械的に処理でき、残る2割に工数が集中します。略語については、診療科ごとに意味が異なる場合があるため、展開ルールを診療科単位で定義してください。対応表の更新履歴は、変換結果の差分を後から説明する材料になります。
患者IDの重複と施設をまたいだ名寄せの困難さ
1つの施設内でも、救急搬送時の仮IDや旧姓での登録が原因で、同一患者に複数のIDが振られる状況は日常的に発生します。施設をまたぐ場合はさらに難易度が上がり、共通の識別子が存在しないため、氏名や生年月日といった属性情報による名寄せに頼らざるを得ないのです。同姓同名で生年月日も近い患者は一定数存在し、属性の一致だけでは判定を誤ります。人口規模の大きい地域では、同姓同名の発生率が無視できない水準になるのです。
実務では、確実に同一と判断できる条件と、人が確認する条件を分けて設計します。カナ氏名、生年月日、性別の3項目が完全一致し、かつ住所の市区町村まで一致する場合は自動統合、いずれかが不一致なら保留とする、といった閾値の置き方が一般的です。保留分は1万件あたり50件から200件程度発生し、医事課の担当者が原本と照合して判断します。判断の結果は必ず記録に残し、後から再現できる状態にしてください。照合に使う原本は、保険証の記載や過去の診療録に限定しておきます。
名寄せとは?正確な顧客データ管理の方法と活用ポイントを徹底解説
検査項目の単位・基準値が統一されていない
検査データは数値が中心のため一見扱いやすく見えますが、単位と基準値の不統一が分析結果を大きく歪めます。血糖値をmg/dLで記録する施設とmmol/Lで記録する施設が混在すれば、換算を挟まない比較は無意味です。基準値も測定機器や試薬によって幅があり、同じ数値でも基準値内か異常かの判定が施設間で変わります。単位の記録欄が任意入力になっている場合は、空欄のレコードが一定の割合で混ざる点にも注意が必要です。
対応としては、検査項目コードをJLAC10などの標準コードへ対応づけ、単位を正規形に固定したうえで数値を変換します。変換は元の値を残したまま新しい列へ格納し、換算係数と適用日を併記する方式が安全です。基準値については、施設ごとの値をメタ情報として保持し、判定は分析の時点で行う設計にしてください。数値だけを統一して基準値を捨ててしまうと、異常判定の再現ができなくなります。換算の要否は、項目ごとに一覧化しておくと引き継ぎが容易です。
転記・手入力に起因する欠損と外れ値
紙の運用が残る領域や、部門システム間で自動連携ができていない箇所では、転記が発生します。転記が入るたびに、桁の入力誤りや単位の取り違えが一定の確率で混入するのです。身長を1750mmと入力した結果、cm単位の列に1750という値が残る、といった外れ値は典型例になります。欠損についても、未実施と未入力が同じ空欄で表現されるため、後から区別できない状態が生まれます。転記の回数を1回減らすだけでも、誤りの混入は目に見えて減るものです。
外れ値の検出は統計的な閾値だけに頼らず、臨床的にあり得る範囲を診療科と合意して定義することが要点です。血圧の収縮期で300を超える値は入力誤りの可能性が高い一方、体温の異常高値は実データとして存在します。欠損については、未実施、未入力、対象外の3種類を別のコードで持たせる設計にしてください。空欄を一律にゼロで埋める処理は、平均値を大きく引き下げるため避けます。臨床的な上下限は、主要な10項目程度から順に定義していく進め方が現実的です。
医療データのクレンジングで得られる効果
品質改善の効果は、分析精度の向上だけにとどまりません。研究、経営、地域連携、日々の分析工数という4つの側面で、投資に見合うリターンが得られます。効果を定量的に説明できると、予算化の議論も進めやすくなるものです。
臨床研究・二次利用データの信頼性が高まる
臨床研究では、解析対象の定義が結果を左右します。病名コードが統一されていないと、対象患者の抽出漏れが発生し、症例数が実態より少なく見積もられるのです。コホート研究の準備段階で病名の標準化前後を比較したところ、抽出件数が2割前後増えた例もあります。査読への対応でも、データ加工の手順が明文化されていれば、方法論への指摘に短時間で回答できます。抽出の条件は、使用したコードの一覧とあわせて研究計画書へ添付しておくのが基本です。
二次利用を前提とするなら、収集した時点でクレンジング済みの状態を保つ運用が最も効率的です。研究のたびに個別へ整備する方式では、同じ作業が研究者ごとに繰り返され、加工結果の食い違いも生じます。整備済みデータセットを共通基盤に置き、更新履歴とデータ定義書をあわせて公開する形が実務では標準になります。定義書には、項目名、単位、欠損の意味、加工日を最低限記載してください。公開の範囲は、共同研究の契約や倫理審査の条件に応じて段階的に決めます。
経営分析やDPC分析の精度が改善する
DPC分析では、診断群分類ごとの在院日数や医療資源の投入量を他院と比較します。ここで様式1と様式4の突合ができていないと、症例が欠落し、平均在院日数が実態とずれるのです。データの不備は、指標が改善したのか悪化したのかという判断そのものを誤らせます。原価計算まで踏み込む場合は、部門コードと診療科コードの対応づけも整備の対象になります。突合の状態は、様式ごとの件数を突き合わせれば数分で確認できるものです。
経営会議で使う指標は、定義の揺れが最も影響します。「新入院患者数」を予定入院のみで数えるか救急搬送を含めるかで、月次の数字は数十件の単位で変わるのです。指標定義書を作り、集計ロジックとあわせて管理する運用へ切り替えてください。定義の変更が生じた場合は、過去分の再集計方針も同時に決めておくと、時系列の比較が崩れません。定義書は年に1回は更新し、変更点を会議の冒頭で共有していく運用が定着しやすいです。
地域医療連携でのデータ突合がスムーズになる
地域医療連携では、複数の施設から集まったデータを患者の単位で突合する必要があります。氏名やカナの表記が施設ごとに異なる状態では、一致率が7割程度にとどまる例も見られるのです。事前に各施設で標準化を済ませておけば、一致率は9割を超える水準まで改善します。突合できなかったレコードの確認作業も、件数が減るぶん現場の負担が軽くなるのです。突合の精度は、事前に各施設で共通の入力規則を適用できたかどうかで決まります。
連携の設計では、どの項目を共有し、どの項目を各施設に残すかを先に決めます。共有する項目が増えるほど同意取得と管理の負荷が上がるため、初期は紹介状の作成に必要な範囲へ絞る判断が現実的です。運用開始後に用途が増えた段階で、対象項目を段階的に拡張してください。拡張のたびに、突合キーの品質を再確認する手順も忘れずに組み込みます。共有する項目を追加する際は、同意文書の記載を見直す必要があるかどうかを毎回確認する運用が安全です。
データ統合とは?統合の目的や初心者向けの進め方を解説
分析前の前処理工数を継続的に削減できる
分析業務の実感として、前処理に費やす時間は全体の6割から8割を占めます。この比率は、元データの品質が上がるほど下がっていきます。クレンジングを基盤の側で一度実施しておけば、分析者ごとに同じ整形コードを書く無駄がなくなるのです。10人の分析者が月に4時間ずつ整形作業をしていた組織であれば、年間で480時間規模の削減余地が生まれます。削減の余地は、分析者の人数と月あたりの整形時間を掛け合わせれば概算できるものです。
削減の効果を示すときは、工数だけでなく手戻りの減少もあわせて説明します。整形ロジックが分析者ごとに異なると、同じ指標で異なる数字が出て、原因の調査に数日かかる事態が起こります。基盤の側で処理を共通化すれば、この種の調査は原則として不要です。導入前に、手戻りの発生件数と調査時間を1か月分だけでも記録しておいてください。記録が残っていると、改善後の効果を同じ指標で比較でき、次の投資判断の材料になります。
医療データクレンジングの進め方
進め方は、目的の定義から品質モニタリングまでの6段階に整理できます。各段階で決めるべき事項と成果物を明確にしておくと、途中で手戻りが発生しにくくなるものです。あわせて、処理の順序に関する原則も押さえておきます。
STEP1:利用目的と対象データの範囲を定義する
最初に決めるのは、整備したデータを何に使うかという点です。臨床研究に使うのか、経営分析に使うのか、地域連携に使うのかで、必要な精度も対象期間も変わります。研究目的なら過去5年から10年分の遡及整備が必要になる一方、経営分析であれば直近2年分で足りる場合が大半です。目的が曖昧なまま全データを対象にすると、工数が数倍に膨らみます。対象を広げる判断は、試行で得た1診療科あたりの工数をもとに行うのが確実です。
- 対象システム:電子カルテ、医事会計、検査、健診などの範囲
- 対象期間:遡及する年数と、以降の更新頻度
- 対象項目:分析に使う項目と、突合に使うキー項目
- 除外条件:テスト患者、削除フラグ、他院からの取り込み分の扱い
- 精度要件:どの程度の誤差までを許容するか
範囲の定義では、対象システム、対象期間、対象項目、除外条件の4点を文書へ落とします。除外条件の記載漏れは後工程で必ず問題になるため、テスト患者、削除フラグ付きレコード、他院からの取り込みデータの扱いを明記してください。範囲が広すぎると判断した場合は、1つの診療科や1つの様式へ絞った試行から始める方針が有効です。試行の結果をもとに全体の工数を見積もると、精度の高い計画が立てられます。計画書には、工程ごとの担当部門も明記しておくと後の調整が早く進みます。
STEP2:データプロファイリングで品質の実態を可視化する
データプロファイリングは、対象データの実態を統計的に把握する作業です。項目ごとの欠損率、値のユニーク数、最頻値、最小値と最大値、フォーマットの分布を機械的に集計します。この工程を飛ばして修正作業へ入る現場は多いのですが、実態を知らないまま手を動かすと、優先順位を誤ります。欠損率が0.1%の項目に時間をかけ、欠損率が40%の項目を放置してしまう事態が起こるのです。集計の結果は、項目名と欠損率を並べた一覧の形で関係者へ共有します。
プロファイリングの結果は、修正するか、そのまま使うか、収集をやめるかという3つの判断へ直結します。欠損率が50%を超える項目は、補完しても分析に耐えないため、対象から外す判断が合理的です。ツールはOpenRefineやPythonのライブラリで十分に対応でき、数十万件規模なら数時間で全項目の分布を出力できます。出力結果は必ず一覧表として保存し、整備前後の比較へ使ってください。比較の際は、整備前の数値を別のシートへ残しておきます。
STEP3:標準コードへの変換と正規化を行う
標準化では、病名、医薬品、検査項目の3領域を分けて進めます。病名はICD-10とMEDIS標準病名マスター、医薬品はYJコードやHOTコード、検査項目はJLAC10が実務上の基準になります。変換は対応表を介して行い、対応表そのものをバージョン管理の対象としてください。マスターは改定されるため、いつ時点の版を使ったかを記録していないと、後から結果を再現できません。版の記録は、対応表のファイル名と処理ログの両方へ残す方式が確実です。
正規化では、全角と半角、大文字と小文字、空白と記号の扱いを統一します。処理の順序を固定しないと、同じ入力から異なる結果が出るため、変換関数の適用順を定義書へ明記する運用が安全です。変換できなかった値は捨てずに未変換リストへ退避し、件数の推移を毎回確認します。未変換率が5%を超える場合は、対応表の不足を疑って辞書を追加してください。追加した辞書の内容は、次回の処理でも再利用できるよう共有の場所へ保存します。
マスタデータ管理(MDM)とは?適切に運用する重要性とその手法を解説
STEP4:患者単位の名寄せと重複レコードを統合する
名寄せでは、同一人物と判断する条件を段階的に設計します。患者IDが一致するレコードの統合から始め、次にカナ氏名と生年月日の完全一致、その次に類似度スコアによる候補抽出という順で範囲を広げます。類似度にはレーベンシュタイン距離やJaro-Winkler距離が使われ、閾値は0.9前後から調整するのが一般的です。閾値を下げすぎると別人の統合が発生するため、精度と網羅率の折り合いを事前に決めておきます。折り合いの目安は、誤った統合をゼロに近づける設定を優先する考え方です。
統合の実行では、レコードを物理的に消さず、統合先のIDを持つ対応表を別に作る方式を選んでください。原本を残しておけば、誤った統合が判明した際に分離できます。統合の結果は、統合件数、保留件数、誤統合の疑い件数を毎回記録し、担当者の判断根拠も残す運用が現実的です。医事課と情報システム部門のどちらが最終判断を行うかも、着手前に決めておきます。判断の基準が部門で割れる場合は、統合を保留したまま次の工程へ進める運用が現実的です。
STEP5:欠損値・外れ値の扱いをルール化する
欠損値の扱いは、分析の目的によって最適解が変わります。統計解析であれば多重代入法が選択肢になり、経営指標の集計であれば欠損のまま件数から除外する方が実態に近くなるのです。要点は、どの方法を選んだかを項目ごとに記録し、分析結果とセットで参照できる状態にしておく点にあります。方法を統一せず担当者の裁量に任せると、同じ項目で異なる集計結果が生まれます。選択の理由まで残しておくと、担当者が交代しても方針が引き継がれるものです。
対応方法 | 向くケース | 注意点 | 工数の目安 |
|---|---|---|---|
レコードごと除外 | 欠損率が数%以下 | 件数が減り、偏りが生じる場合がある | 小 |
平均値・中央値で補完 | 分布が安定した検査値 | 分散が過小評価される | 小 |
多重代入法 | 統計解析、論文投稿を伴う研究 | 前提条件の確認と実装工数が必要 | 中から大 |
欠損のまま保持 | 経営指標、件数ベースの集計 | 集計側で欠損の扱いを明示する必要 | 小 |
外れ値については、削除ではなくフラグの付与を基本方針にしてください。削除してしまうと、実データとして意味のある異常値まで失われます。血液検査の極端な高値は、重症例を示している場合があるためです。フラグを立てておけば、分析の時点で含めるか除くかを目的に応じて選べます。判定の基準は、統計的な3シグマだけでなく、診療科と合意した臨床的な上下限を併用する運用が実務的です。上下限の一覧は、年に1回は診療科と見直す機会を設けます。
STEP6:検証と品質モニタリングを仕組みに組み込む
クレンジングの結果は、必ず定量的に検証します。検証項目は、標準コードへの変換率、名寄せ後の患者数の妥当性、必須項目の欠損率、値の範囲逸脱の件数という4つが基本です。変換率が95%を下回る、あるいは名寄せ後の患者数が想定より1割以上減った場合は、処理のどこかに誤りがあると考えて原因を追います。検証は自動化し、処理のたびに同じ指標が出力される状態にしてください。出力先は、担当者が毎朝確認できる場所へ固定しておきます。
- 標準コードへの変換率が前月比で低下していないか
- 必須項目の欠損率が閾値を超えていないか
- 名寄せの保留件数が急増していないか
- 値の範囲逸脱の件数が想定の水準に収まっているか
- 新規に追加された項目がデータ定義書へ反映されているか
運用のフェーズでは、月次で品質指標をモニタリングする体制を組みます。指標が悪化したときに誰が調査し、誰が改修を判断するかを役割として決めておかないと、ダッシュボードだけが残って誰も見ない状態になるのです。監視の対象は10項目前後に絞り、閾値を超えた場合のみ通知が飛ぶ設計が続けやすくなります。四半期に一度は、閾値そのものの妥当性も見直してください。見直しの結果は、モニタリングの定義書へ日付とともに追記します。
処理順序の原則:標準化を先に、名寄せを後に実施する
工程の順序を誤ると、後戻りの工数が跳ね上がります。原則は、標準化と正規化を先に済ませ、そのうえで名寄せを実施する順序です。氏名や住所の表記が揺れたまま名寄せを走らせると、同一人物が別人として残り、一致率が下がります。標準化を済ませてから実行すれば、同じアルゴリズムでも一致率は明確に改善するのです。順序を入れ替えるだけで、一致率が5ポイントから10ポイント改善する例もあります。作業の総量が変わらない点でも、取り組みやすい改善です。
欠損値の補完は、名寄せが完了した後に行う点も押さえておきます。統合の前に補完すると、統合時に矛盾する値が並び、どちらを採用するかの判断が発生するのです。統合後であれば、統合済みのレコードに対して一度だけ補完すれば済みます。全体の順序は、範囲の定義、プロファイリング、標準化、名寄せ、欠損対応、検証という流れで固定してください。この流れを工程表へ落とし込み、各段階の完了条件と成果物をあらかじめ決めておきます。
個人情報保護と匿名加工を踏まえた実務対応
医療データの加工は、法令上の位置づけを理解したうえで設計する必要があります。個人情報保護法と、医療分野に特化した法制度では、求められる手続きも扱えるデータの範囲も異なるのです。ここでは、クレンジングをどの段階で行うかという実務上の論点を中心に整理します。
取り扱いの根拠:個人情報保護法と次世代医療基盤法の位置づけ
医療データの二次利用には、大きく2つの経路があります。1つは個人情報保護法にもとづき、本人の同意または適切な匿名加工を経て利用する経路です。もう1つは次世代医療基盤法にもとづき、認定を受けた事業者へ医療情報を提供し、仮名加工医療情報や匿名加工医療情報として利用する経路になります。後者はオプトアウトによる提供が認められる点が特徴で、大規模なデータ収集に向いています。どちらの経路でも、加工の前に対象範囲を確定させておく点は共通です。
比較軸 | 個人情報保護法にもとづく経路 | 次世代医療基盤法にもとづく経路 |
|---|---|---|
本人の関与 | 本人同意または匿名加工が前提 | オプトアウトによる提供が可能 |
提供先 | 自組織または委託先 | 国の認定を受けた事業者 |
扱えるデータ | 個人情報、匿名加工情報など | 仮名加工医療情報、匿名加工医療情報 |
向くケース | 院内での経営分析、委託での分析 | 多施設を横断する大規模研究 |
どちらの経路を選ぶかは、利用目的と必要なデータの粒度で判断します。個々の医療機関が院内の経営分析に使うだけであれば、外部への提供は発生しないため、院内の利用規程の整備が中心です。多施設のデータを集めて研究に使う場合は、認定事業者を介した枠組みの検討が現実的になります。法令の解釈が関わる論点は、着手前に法務部門や倫理委員会へ確認してください。確認の際は、想定する利用目的と提供先を一覧にして持ち込むと話が早く進みます。
仮名加工・匿名加工との工程上の関係:クレンジングをどの段階で行うか
加工の順序に関する誤解として多いのが、匿名加工を済ませてからクレンジングを行うという発想です。この順序では、氏名や生年月日が失われた後に名寄せを行うことになり、統合の精度が大きく落ちます。識別子を使える段階でクレンジングを完了させ、その後に加工を実施する順序が合理的です。実際の案件でも、順序を逆にしたために再作業が発生した例は少なくありません。加工の前に整備を終える前提で、工程表の順序を組み立てるのが基本です。
仮名加工と匿名加工では、必要な処理の水準が異なります。仮名加工は他の情報と照合しない限り個人を特定できない状態にする処理であり、対応表を管理者の側で保持できるものです。匿名加工は特定の個人を識別できず、かつ復元もできない状態まで加工する必要があり、対応表の保持は認められません。研究のように追跡が必要な用途では仮名加工、公開データセットとして配布する用途では匿名加工という使い分けになります。用途が途中で変わる可能性がある場合は、仮名加工から始める判断が無難です。
仮名化とは?匿名化との違いや法的な位置づけ、活用方法をわかりやすく解説
再識別リスクへの配慮:識別子の削除と希少症例の扱い
識別子の削除だけでは、再識別のリスクは消えません。氏名や患者IDを除いても、生年月日、性別、郵便番号の3項目が揃えば、相当な確度で個人を絞り込めるものです。そのため、生年月日は生年または年齢の階級へ、郵便番号は上位3桁へと粒度を落とす処理が必要になります。年齢については、90歳以上をまとめて扱う運用が一般的です。粒度をどこまで落とすかは、分析に必要な精度と再識別のリスクを見比べて決めます。判断の記録は、加工方針書へ項目ごとに残しておきます。
希少症例の扱いは、匿名加工で最も判断が難しい論点です。特定の疾患で年間の症例数が数件しかない場合、疾患名と地域の情報だけで個人が推定される可能性があります。対応としては、症例数が5件未満となるセルを非公開にする、地域の粒度を都道府県まで落とすといった処理を組み合わせます。判断に迷う場合は、公開の前に第三者へレビューを依頼してください。レビューでは、公開する項目の組み合わせから個人が絞り込めないかを確認します。
監査証跡の確保:加工履歴の記録と原本データの保持
加工の監査証跡は、後から結果を再現するための前提になります。記録すべきは、処理日時、実行者、使用した対応表の版、入力件数、出力件数、変換できなかった件数です。これらをログとして自動出力する仕組みにしておくと、担当者の記憶に依存しなくなります。手作業での表計算ソフトの編集が混ざると証跡が途切れるため、加工は原則としてスクリプトで実行してください。ログの保存先は、加工処理の実行環境とは別のストレージへ分けておきます。
原本データは、加工の後も一定期間そのまま保持します。保持期間は利用目的や関連する規程によって変わりますが、研究用途であれば論文の公表後5年から10年を目安とする例が大半です。保持する際は、アクセス権限を絞り、参照ログを取得する運用が前提です。原本と加工済みデータを同じ領域に置くと誤用の危険があるため、格納先を分けておきます。アクセス権限の棚卸しについては、半年に1回程度の頻度で実施する運用が現実的です。
データ監査とは?基本概念と実施手順、企業での活用ポイント
医療データクレンジングでよくある失敗パターンと回避策
失敗の多くは、技術的な難易度ではなく、進め方の設計に原因があります。着手の前に典型的なつまずきを知っておくと、同じ轍を踏む確率は大きく下がるものです。ここでは6つのパターンを、回避策とあわせて示します。
原本を上書きし、加工前の状態を検証できなくなる
最も影響が大きい失敗が、原本の上書きです。加工用の作業ファイルを作らずに元のテーブルを直接更新すると、誤りが判明しても元へ戻せません。一括更新のSQLを実行した後で条件の誤りに気づくケースは、実務で繰り返し発生するものです。バックアップがあっても、復元に半日から数日を要し、その間は分析業務が止まります。復旧を待つ間に手作業で暫定の集計を作る対応は、数字の二重管理を生むため、できるかぎり避けたい選択です。
回避策は単純で、原本を読み取り専用として扱い、加工の結果は別のテーブルやスキーマへ書き出します。中間データも各工程で保存しておくと、どの処理で異常が入ったかを切り分けられます。保存容量が問題になる場合は、中間データの保持期間を30日程度に区切る運用で十分です。作業の前には必ずバックアップを取得し、復元手順の動作確認まで済ませてください。復元の手順書は、担当者以外でも実行できる粒度まで書き下しておきます。
類似する病名を機械的に統合し、臨床的に異なる概念を混同する
文字列の類似度だけで病名をまとめると、臨床的に別物の疾患が同一視されます。「1型糖尿病」と「2型糖尿病」、「急性心筋梗塞」と「陳旧性心筋梗塞」は、表記が近くても治療も予後も異なるものです。自動統合のルールに文字列の一致率だけを使うと、こうした組み合わせが機械的に統合されます。統合後のデータで解析すると、疾患の分布が実態からかけ離れた形になるのです。解析の結果を見ても誤りに気づけないため、統合の前に確認する工程が必要になります。
回避策は、統合の候補を必ず標準マスターのコード単位で確認する運用です。文字列が似ていてもICD-10のコードが異なれば統合しない、というルールを先に置いてください。判断が割れる組み合わせは一覧化し、診療科の医師に確認する時間を工程へ組み込みます。確認の対象は全体の数%程度にとどまるため、1回あたり2時間から4時間の会議枠で処理できます。確認の記録は、統合ルールの一覧へ判断の理由とあわせて残す形が扱いやすいです。
単位換算を見落とし、検査値が実態と乖離する
単位の見落としは、気づきにくいわりに影響が大きい失敗です。数値としては正常な範囲に見えるため、集計の結果を眺めても異常に気づけません。HbA1cのJDS値とNGSP値の混在、クレアチニンの単位の混在は、実務で頻出する組み合わせになります。換算せずに集計すると、平均値が数%から数十%ずれる結果になるのです。単位の情報が別のテーブルに分かれている場合は、結合の漏れにも注意が必要になります。実務では、この結合漏れが換算誤りの入口になります。
回避策として、単位の列を必ず保持し、単位が空欄のレコードは処理の対象から除外する設計にしてください。換算処理を実装する場合は、換算前後の分布をヒストグラムで比較し、想定どおりの位置に集まっているかを目視で確認します。検査部門に基準値の一覧を提供してもらい、換算後の値が基準値の範囲に収まるかを検証する手順も有効です。この確認は項目あたり10分程度で終わります。確認の結果は、換算の対応表へ検証済みの印として記録しておくと安心です。
名寄せを急いだ結果、別人のレコードを統合してしまう
誤った統合は、名寄せで最も避けたい失敗です。別人の診療情報が1つの患者IDに混ざると、既往歴やアレルギー情報が誤って表示され、診療上の危険につながります。統計解析でも、複数人の検査値が混在した時系列が生成され、異常な変動として現れるのです。誤った統合は発見が遅れやすく、数か月後に現場からの指摘で判明する例が少なくありません。発見が遅れるほど、統合した後に追加された記録の切り分けも難しくなるものです。
回避策の要点は、自動統合の条件を厳しく設定し、判断が微妙な組み合わせは必ず保留へ回すことです。自動統合の対象は、複数の識別情報が完全に一致する場合へ限定してください。保留分の目視確認には件数に応じた工数がかかりますが、1件あたり3分から5分程度が目安になります。統合の取り消し手順を先に用意しておくと、誤りが判明した際の対応も短時間で済みます。取り消しの手順は、対応表を戻すだけで完了する設計にしておくと安全です。
一度きりの整備で終わり、運用開始後に品質が再び低下する
プロジェクトとして整備を終えた後、モニタリングの体制を残さない組織は多く見られます。新しい検査項目の追加、システムの更改、診療科の新設といった変化のたびに、品質は少しずつ劣化していきます。整備の直後は変換率が98%あった項目が、1年後には90%を下回るという事態も起こるのです。低下は緩やかに進むため、定点観測をしていないと気づけません。変換率の推移をグラフで残しておくと、低下が始まった時期を特定しやすいものです。
回避策は、品質指標の定期確認を業務プロセスとして定義することです。月次の運用会議で5分だけ指標を確認する枠を設ける、という程度でも効果があります。新しい項目やシステムを追加する際の申請フローに、データ定義の登録を必須項目として組み込んでください。仕組みへ埋め込まない限り、確認作業は担当者の異動とともに失われます。確認の担当を組織上の役割として定義し、異動時の引き継ぎ資料へ明記しておく運用が確実です。
現場の入力負荷を考慮せず、運用ルールが形骸化する
入力ルールを厳格にしすぎると、診療の現場では守られなくなります。必須項目を増やした結果、とりあえずダミー値を入力して先へ進む運用が定着した例は珍しくありません。ダミー値は形式上は埋まっているため欠損としても検出されず、品質の実態が見えなくなるのです。ルールの厳格化が、かえって品質を悪化させる結果になります。ダミー値の混入を見つけるには、特定の値に極端に集中していないかを確認する方法が有効です。同じ生年月日が数百件並ぶといった形で現れます。
設計の時点では、入力にかかる秒数を実測してください。1件あたり10秒の増加でも、1日100件の入力があれば年間で約70時間の負荷増になります。負荷を抑えるには、選択肢の並び順を使用頻度の順にする、直近の入力値を初期表示する、といった細かな工夫が効きます。ルールを決める前に、実際に入力する職種の担当者を検討の場へ入れておく進め方が有効です。試行の段階で、入力時間の増加が想定の範囲に収まるかを実測しておきます。
医療データクレンジングの取り組み事例
実際の取り組みでは、目的に応じて着手する範囲が変わります。ここでは急性期病院、多施設共同研究、健診機関という3つの立場から、着手した範囲と得られた成果を紹介します。いずれも、限定した範囲から始めて段階的に広げた点が共通しているのです。
急性期病院:システム更改にあわせた患者IDの名寄せ
500床規模の急性期病院で、電子カルテの更改にあわせて患者IDの整理を実施した例です。更改前の調査では、約40万件の患者マスターのうち、重複の疑いがあるレコードが1.2%程度存在していました。仮IDのまま本IDへ統合されていない救急搬送の患者と、旧姓での登録が主な原因だったのです。移行のタイミングを逃すと、重複を抱えたまま次の更改まで運用が続きます。更改の1年前から調査を始めておくと、対応の時間を確保しやすいものです。
進め方としては、自動統合の条件を厳しく設定し、保留分を医事課で目視確認する体制を組みました。3名の担当者が2か月かけて約4,800件を確認しており、統合の対象となったのは約7割です。移行後は、仮IDの発行時に本IDへ紐づける作業を翌営業日までに実施する運用ルールを新設しました。重複の新規発生率は、更改前の水準から大きく下がっています。新設した運用は、月次の件数報告で定着の度合いを確認しているとのことです。
多施設共同研究:検査項目コードの統一による横断分析の実現
8施設が参加する共同研究で、検査データの横断的な分析を目指した例です。当初は各施設が独自の項目コードを使用しており、同じ検査項目が施設ごとに異なるコードで登録されていました。項目名の文字列だけで突合を試みた段階では、一致率は6割程度です。残る4割は、略称や旧称、施設に固有の項目名が原因になっていました。施設ごとの独自コードは、過去の運用の経緯が積み重なった結果である場合が大半です。統一の作業に入る前に、その背景を確認する時間を取りました。
対応として、参加施設の項目を一覧化し、JLAC10のコードへ対応づける作業を実施しました。作業量は全体で約1,200項目、1施設あたり2週間から3週間の工数です。単位の統一も同時に行い、換算が必要な項目には換算係数を対応表へ記載しました。統一後は8施設のデータを1つのテーブルへ結合できるようになり、症例数は単独の施設と比べて約6倍に増えています。対応表は共同研究の事務局で管理し、年に1回の更新を続けている状態です。
健診機関:経年比較を可能にするための項目マスタ整備
年間10万件規模の健診を実施する機関で、経年比較ができる状態を目指した例です。健診項目は年度ごとに改定されるため、同じ項目名でも定義が変わっている場合があります。腹囲の測定条件や血圧の測定回数の変更が、そのまま数値の傾向へ影響していました。項目マスタに改定の履歴が残っていなかったため、過去のデータと単純に比較できない状態が続いていたのです。比較の可否を判断できないまま、経年のグラフだけが作られていた状態でもあります。
整備では、過去10年分の項目マスタを年度ごとに復元し、項目コードと定義の変更点を一覧化しました。復元には、紙の健診結果票と検査部門の記録を突き合わせる作業が必要です。整備の後は、定義が変わった年度を明示したうえで比較できるようになり、受診者への説明資料にも活用されています。作業工数は延べ約400時間で、以降の年度は改定時に履歴を追記する運用へ移行しました。履歴の追記は、年度更新の作業手順書へ組み込んである状態です。
まとめ:医療データクレンジングは標準化と法令対応をセットで設計する
医療データクレンジングは、標準コードへの対応と法令上の要件を同時に満たす設計が求められる取り組みです。本記事で扱った内容を、着手の時点で確認すべき観点として整理します。
進め方の骨子は、利用目的と範囲の定義から始め、プロファイリングで実態を把握し、標準化、名寄せ、欠損対応の順で処理を進める流れです。順序を守るだけで、後戻りの工数は大きく減ります。加工の各段階では証跡を残し、原本を保持したまま作業を進めてください。個人情報の取り扱いについては、利用目的に応じてどの法的枠組みを使うかを、着手の前に確認しておく必要があります。
- 整備したデータの利用目的と対象範囲を文書化したか
- 標準コードへの対応表を版として管理する仕組みがあるか
- 名寄せの自動統合条件と、保留時の確認体制を決めたか
- 欠損値と外れ値の扱いを項目ごとにルール化したか
- 加工履歴の記録と原本の保持先を分けて設計したか
- 運用開始後に品質指標を確認する会議体を用意したか
最初から全データを対象にする必要はありません。1つの診療科、1つの様式、1年分といった限定した範囲で試行し、工数と効果を実測してから広げる進め方が現実的です。試行の結果を数値で示せると、次の予算獲得の根拠にもなります。
「これから医療データの整備に取り組みたいけれど、何から手をつけたらいいかわからない」「医療データ分析の専門家の知見を取り入れたい」という方は、データ活用支援の実績豊富な弊社、データビズラボにお気軽にご相談ください。
貴社の課題や状況に合わせて、医療データ活用の取り組みをご提案させていただきます。








