
電子カルテには、日々の診療で積み上がった膨大な記録が残っています。ところが経営分析や臨床研究に使おうとした瞬間、病名の重複、患者IDの不一致、検査項目コードの差異といった問題が一斉に表面化します。クレンジングでは、この不備を解消し、分析と突合に耐える状態へ整えていきます。
問題が表面化する背景には、電子カルテ特有の記録形式があります。同じ疾患でも医師ごとに病名の付け方が異なり、フリーテキストの所見欄には略語や独自表記が混在しているのが通常です。加えてシステム更改や部門システムとの連携により、同一患者が別IDで登録されている場合も少なくありません。
本記事では、電子カルテデータのクレンジング手順と品質確保の実務を、工数の目安や現場でつまずきやすい箇所とあわせて解説します。標準化の範囲を決める判断基準も順に取り上げます。自院のデータ整備を進める際の指針として活用してください。
目次
電子カルテデータのクレンジングとは
電子カルテは診療を支えるために設計された仕組みであり、分析用に整えられたデータベースではありません。この前提を押さえずに抽出すると、集計結果が現場の感覚と食い違い、原因の切り分けに数週間を要するのが実情です。不整合が生まれる仕組み、一般的なクレンジングとの違い、そして二次利用が求められる背景を順に整理します。
診療現場の入力運用から生じるデータの不整合
電子カルテへの入力は、診療の流れを止めないことが最優先されます。外来では1人あたり3〜5分で記録を終える必要があり、選択式の項目より自由記述やコピー&ペーストが選ばれがちです。結果として、同じ意味の情報が別の場所に別の形式で残ります。たとえば喫煙歴が、既往歴欄と看護記録と問診票テンプレートの3か所に、それぞれ「20本/日」「喫煙+」「Brinkman指数800」として記録されている状態です。抽出前に入力画面の構成を確認しておくと、どの項目が信頼できるかを見極める材料になるのです。
この種の不整合は、担当者個人の注意力では解決できません。病棟ごとにテンプレートが独自に進化し、電子カルテの更新時に旧テンプレートが残ったまま併用される事例も見られます。現場でよくあるつまずきは、抽出したデータを見て「入力ミスが多い」と結論づけてしまう判断です。実際には運用ルールの差異が原因であるケースが大半を占めます。データを見る前に、対象診療科の入力画面と運用手順書を確認しておくと、原因の切り分けが早く進みます。
一般的なデータクレンジングとの違い:原本性の保持が前提になる
一般的な業務データのクレンジングでは、誤った値を見つけたら元のデータを直すのが基本です。電子カルテでは、この手順が取れません。診療録は医師法や医療法に基づく記録であり、原本性(作成者・作成日時・内容が後から改変されていないこと)の担保が求められます。クレンジングは原本を書き換える作業ではなく、原本を保持したまま分析用のデータセットを別に作る作業です。この前提を関係者全員で共有しておくことが、着手前の必須条件です。
この違いは、作業の設計そのものを変えます。抽出したデータへの変換は必ず複製したデータベース上で実施し、変換前後の値を対で保持する構成にします。現場でよくあるつまずきは、電子カルテの運用担当者に「このデータを直してほしい」と依頼してしまう進め方です。依頼された側は原本を改変できないため、そこで話が止まります。二次利用データセット側で処理する前提を最初に共有しておくと、部門間の調整にかかる期間を1〜2か月短縮できます。
データクレンジングとは?意味と代表手法を解説!
観点 | 一般的な業務データ | 電子カルテデータ |
|---|---|---|
誤りの修正 | 原本を直接修正する | 原本は保持し複製側で変換する |
品質の判断者 | データ管理部門が中心 | 医師や診療情報管理士を含む多職種 |
履歴の扱い | 更新履歴があれば足りる | 変換ルールと処理ログの文書化が必須 |
対象範囲 | 業務で使う項目に限定 | 二次利用の目的から必要項目を逆算 |
二次利用のニーズが高まる背景:経営分析・臨床研究・リアルワールドデータ
診療データを診療以外の目的に使う動きは、複数の方向から同時に強まっています。診療報酬改定への対応や病床機能の見直しを、感覚ではなく数値で説明する場面が増えました。症例登録票への手入力をやめ、電子カルテから直接データを取り出す研究デザインも一般化しつつあるのです。製薬企業や行政機関が扱うリアルワールドデータの供給元として、医療機関が名指しで依頼を受ける場面も出てきました。用途によって求められる品質水準は大きく異なります。
- 経営分析:病床稼働率や在院日数を、月次で安定して同じ条件で集計できること
- 臨床研究:患者の抽出条件と検査値の単位が、研究計画書どおりに再現できること
- リアルワールドデータ提供:標準コードへの変換率と加工方法の文書化が審査対象になること
共通しているのは、院内で完結していた記録を、院外の基準に合わせて説明できる形にする必要が出てきた点です。院内独自の検査項目コードや薬剤コードは、その施設の中では問題なく機能します。他施設や公的データベースと突き合わせた瞬間、対応表がないという理由だけで解析対象から外れます。着手を判断する基準は明確で、外部に提出する予定があるか、複数施設で比較する予定があるかの2点です。どちらか一方でも該当するなら、標準コードへの対応を先に設計しておくべきです。
医療DXとは?具体的な施策や成功のポイント、医療DX令和ビジョン2030を解説
電子カルテデータで品質が低下しやすい代表的な項目
品質の問題は、電子カルテ全体に均等に散らばっているわけではありません。実際に手を動かすと、劣化が集中する項目はおおむね5つに絞られます。項目ごとに原因も対処法も異なるため、それぞれの特徴を押さえておくと調査の初動が速くなるのです。
病名データ:レセプト病名・疑い病名・転帰未入力の混在
病名データは、二次利用で最初につまずく項目です。保険請求のために付与されたレセプト病名と、医師が臨床判断として確定した診断名が、同じテーブルに区別なく並んでいます。検査の査定を避ける目的で付けられた疑い病名も、疑いフラグが立っていなければ確定診断と見分けがつきません。1人の患者に病名が30〜50件登録されている例も珍しくなく、そのまま件数を数えると有病率が実態の2倍以上に膨らむこともあるのです。疑い病名の扱いも、同じ考え方で整理します。
対処の第一歩は、病名レコードに付随する属性を確認する作業です。多くの電子カルテでは、転帰区分、疑いフラグ、主病名フラグ、登録日、診療科がレコード単位で保持されています。主病名フラグと転帰区分の2つを使うだけで、分析対象の病名は3分の1程度まで絞り込めます。転帰が未入力のまま放置されたレコードは、退院日や最終来院日から機械的に補完するルールを事前に決めておく方法が有効です。補完した事実は必ずフラグとして残しておきます。
患者ID:部門システム間および地域医療連携での重複と表記ゆれ
患者IDは一意であることが前提になっていますが、実際には複数の体系が併存します。電子カルテの患者ID、医事会計システムの患者番号、検査システムの受付番号、地域医療連携の連携IDが、別々の採番ルールで動いているのが実情です。同一人物が救急搬送時に仮IDで登録され、後日正規IDと統合されないまま残る事例もあります。500床規模の病院で調査すると、重複候補は全患者の0.5〜2%程度検出されるのが一般的です。
重複を洗い出す際は、氏名の完全一致だけに頼らない設計にします。カナ氏名、生年月日、性別、住所の郵便番号を組み合わせ、一致した項目数でスコアを付ける方式が実務では扱いやすいです。氏名は旧姓や外字、カナの長音記号でゆれるため、単独の判定材料としては弱いのです。名寄せの候補を機械的に抽出したうえで、最終判定は診療情報管理士が目視で確認する二段構えにすると、誤統合を避けられます。1,000件の候補を確認する工数は、2人体制でおよそ3〜5日が目安になります。
名寄せとは?正確な顧客データ管理の方法と活用ポイントを徹底解説
検査データ:施設ごとの項目コード・単位・基準値の差異
検査データは、値そのものより項目コードと単位で問題が起きます。同じクレアチニンでも、施設によって院内コードが異なり、単位がmg/dLとμmol/Lで分かれることがあるのです。施設間で検査データを比較する前提に立つなら、JLAC10(臨床検査項目分類コード)への対応表を用意する作業が出発点になります。17桁のコードで分析物、識別、材料、測定法、結果識別を表現でき、測定法の違いまで区別できます。単位が異なるまま結合すると、値の桁が10倍以上ずれた集計になるのです。
基準値の差異も見落とされやすい論点です。施設ごとに採用している測定法や機器が違うため、同じ検査でも基準範囲の上限と下限が異なります。異常値の判定を「基準値外」で行うと、施設間で異常の定義がずれた集計になってしまいます。回避策は、基準値による判定を後段の分析側に持たせ、クレンジング段階では実測値と単位の統一だけを行う設計です。単位換算の係数は1か所のマスタで管理し、変換式を個別のプログラムへ直接書き込まない運用にします。
医薬品データ:規格違いと院内独自コードの併存
医薬品データでは、同じ成分が複数の粒度で記録されている点が課題になります。YJコードは規格や剤形まで区別する12桁のコードで、同一成分でも錠剤と散剤、5mgと10mgで別コードになるのです。成分単位で集計したい分析では、この粒度がそのままでは使えません。一般名処方への切り替えが進んだ結果、院内では一般名のマスタと商品名のマスタが併存している施設も多いです。集計の粒度をどこに置くかを、分析の設計段階で決めておきます。
対処の基本は、成分レベルのコードを別の列として付与する方法です。YJコードの上位7桁を成分と規格の識別に使う、あるいはATCコードや薬効分類コードを併記する方式が現実的に運用できます。院内製剤や治験薬に付与された独自コードは、標準コードに対応する先がありません。除外するのか別区分として残すのかを最初に決めておかないと、後工程で集計が合わない原因になるのです。判断基準としては、薬効の評価が目的なら除外し、コスト分析が目的なら区分を分けて残す整理が扱いやすくなります。
自由記述:略語・略号・テンプレート依存の記録
経過記録や退院時サマリには、構造化されていない情報が大量に含まれています。「HT」「DM」といった略語、「+」「−」による所見表現、施設独自のテンプレートが混在するのが通常です。自然言語処理で一括抽出しようとしても、略語辞書がなければ精度は上がりません。同じ「BS」が血糖値と腸雑音のどちらを指すかは、診療科によって変わります。診療科ごとに略語の意味を確認する作業が、抽出精度を左右する要因になるのです。
実務では、自由記述の全面的な構造化を目指さない判断が有効です。目的に必要な項目だけを絞り、辞書を作って抽出する範囲を限定します。喫煙歴と飲酒歴の2項目に絞れば、辞書の登録語数は100〜200語程度で実用水準に届きます。抽出結果は必ず50〜100件をサンプリングし、医師または診療情報管理士が正解と照合する検証工程を挟むべきです。精度が8割を下回る場合は、辞書の追加ではなく入力テンプレートの改修を検討します。
電子カルテデータのクレンジングで解決できること
クレンジングは、それ自体が目的になると続きません。整えたデータで何ができるようになるのかを先に描いておくと、投資判断も現場への説明も通しやすくなるのです。実際に効果が出やすい3つの領域を取り上げます。
DPC分析・経営指標の算出精度が上がる
DPCデータ(診断群分類に基づく包括評価のために提出する様式データ)は、多くの急性期病院で既に整備されています。様式1、EFファイル、Dファイルという決まった形式で作成されるため、施設をまたいだ比較にも耐える構造です。ただし、DPCデータだけでは検査値や処方の詳細まで追えません。電子カルテ側のデータと突き合わせて初めて、在院日数の差がどの診療プロセスから生じているかを説明できます。両者の連結を前提にした設計が、分析基盤の出発点になるのです。
突合の鍵は、患者IDと入院日の組み合わせを揃える作業です。DPCデータは入院単位、電子カルテは来院単位でレコードが作られるため、粒度をそろえないと件数が合いません。在院日数や診療単価の分析精度は、病名の整理と患者IDの統合が済んでいるかどうかでほぼ決まります。整備の前後で比較すると、疾患別の症例数の誤差が10%以上縮まる例も出てくるのです。経営会議に出す指標は集計ロジックを文書化し、毎月同じ条件で再現できる状態にしておきます。
臨床研究や多施設データ連携で利用できる状態になる
臨床研究でデータを使う場合、求められるのは網羅性より再現性です。どの条件で患者を抽出し、どの検査値をどう単位変換したかを、第三者が同じ手順で再現できる必要があります。研究計画書に記載した定義と実際の抽出クエリが一致していないと、査読の段階で説明できません。クレンジング済みのデータセットに定義書を添えておくと、この照合作業が数日で終わるのです。抽出条件と変換内容を1枚の定義書にまとめる作業を、最初の工程に組み込みます。
多施設共同研究では、施設ごとの前処理のばらつきが最大の障害になります。共通フォーマットを先に決め、各施設がそこへ変換する方式が現実的です。変換仕様書には、項目名、データ型、コード体系、単位、欠損時の扱いという5項目を必ず含めます。参加施設が5施設を超えると仕様の解釈違いが必ず発生するため、テストデータを1施設あたり100件程度交換し、事前に検証する手順を組み込みます。解釈の齟齬を早く見つけるほど、後半の修正コストが小さくなるのです。
部門システムや地域連携基盤とのデータ突合が成立する
検査部門、放射線部門、薬剤部門は、それぞれ独立したシステムで動いていることが多いです。電子カルテとはオーダー番号で連携していても、患者属性の更新タイミングがずれる場合があります。氏名変更が電子カルテには反映され、部門システムには反映されていない状態も起こります。突合が成立しない原因の多くは、データの中身ではなく連携インターフェースの設計側にあるのです。連携の仕様書を確認し、どの項目がいつ同期されるかを一覧にする作業が出発点です。
地域医療連携のネットワークに参加する場合は、施設をまたいだ相互運用性が前提になります。SS-MIX2の標準化ストレージへ出力できる形式に整えておくと、連携先との調整コストを抑えられます。格納形式はHL7 v2.5に準拠し、患者基本情報や処方、検査結果が決まったフォルダ構造で保存される仕組みです。既存システムからの出力に対応していない項目は、中間テーブルを作って補完する手順をあらかじめ設計します。補完のルールは、連携先とも共有しておくべきです。
相互運用性とは?データガバナンスとデータマネジメントでの重要性
電子カルテデータのクレンジングの進め方
進め方には型があります。目的の定義から始めて、現状把握、標準マスタへのマッピング、標準化、名寄せ、検証と履歴記録という順に進めるのが基本形です。各段階で何を決め、どの程度の工数を見込むかを具体的に示していきます。
STEP1 目的とスコープの定義:二次利用の用途から必要項目を逆算する
最初に決めるのは、どの分析に使うデータなのかという一点です。必要な項目は分析の用途から逆算して決めるものであり、電子カルテにある項目を端から整えていく進め方は失敗します。500床規模の電子カルテには、テーブル数で200を超える構造が組まれています。全項目を対象にすると、現状把握だけで半年以上かかるのです。対象を絞る判断を先送りすると、関係部門への確認依頼だけが積み上がります。用途を1つに決めることが、工数を現実的な範囲に収める前提条件です。
- 分析の成果物は何か(経営会議の資料か、研究用データセットか、外部提出データか)
- 集計単位は患者単位か、入院単位か、外来受診単位か
- 必要な期間はどこからどこまでか
- 標準コードへの変換が必須か、院内コードのままで足りるか
スコープを決める際は、対象期間、対象診療科、対象項目という3軸で線を引きます。電子カルテの更新前後でデータ構造が変わっている場合、更新後の期間だけに絞る判断も有効です。最初の対象を1診療科・3年分・50項目程度に抑えると、3〜4か月で一巡できます。一巡させて成果を示してから範囲を広げる進め方が、院内の合意を得るうえでも現実的になります。範囲の拡大は、成果物を示したあとに検討する順序が安全です。拡大を判断する材料として、初回の実績工数を必ず記録しておきます。
STEP2 データ抽出と現状把握:欠損・不整合の分布を可視化する
現状把握では、データを見る前に仮説を立てないほうが早く進みます。項目ごとの欠損率、値の分布、コードの出現頻度を機械的に一覧化する作業から始めます。SQLで集計してもよいですし、pandasのプロファイリングやTableauの分布表示を使う方法も実用的です。欠損率が5%を超える項目と、コードの出現頻度が上位20件で9割を占める項目には、それぞれ別の対処が必要になります。網羅的な一覧を先に作ることが、無駄な調査を減らす近道です。
可視化して初めて見えるのは、時系列での断絶です。特定の年月を境に欠損率が跳ね上がっていれば、システム更新か運用変更が起きた可能性が高いといえます。該当時期の変更履歴を情報システム部門に確認すると、原因を特定できます。この工程にかける期間の目安は、対象50項目でおよそ2〜3週間です。ここを省略すると、後の工程で想定外のパターンが次々に見つかり、手戻りが発生します。初期調査の省略は、後半の工程で数倍の時間となって返ってくるものです。
データ品質とは?品質評価項目や品質を向上させるための実務的対策を解説
STEP3 標準マスタへのマッピング:標準病名マスタ・JLAC10・医薬品コード
マッピングは、院内コードと標準コードの対応表を作る工程です。病名は標準病名マスタ(MEDIS-DCが公開する病名マスターとICD-10の対応)、検査はJLAC10、医薬品はYJコードやHOTコードが基準になります。対応表の作成は、出現頻度の高いコードから着手すると投資対効果が高くなります。実データでは、上位300コードで全レコードの9割前後をカバーできる場合が多いのです。残りのコードは、未対応として一覧に残したまま先へ進みます。
機械的に対応づけられないコードは必ず残ります。院内独自の検査項目や、廃止された旧コードがその代表例です。未対応として一覧に残し、対応方針を決めた日付と決定者を記録しておく運用にします。対応表は表計算ソフトで作り始めても構いませんが、300行を超えたらデータベース上のテーブルへ移す判断が必要になります。対応表の列構成は、院内コード、標準コード、対応の根拠、更新日の4つが最低限必要です。列の定義を先に固めておくと、複数人で分担しても品質が揃います。
マスタデータ管理(MDM)とは?適切に運用する重要性とその手法を解説
STEP4 表記・単位・日付の標準化
表記ゆれの整理は、機械的に処理できる部分と判断が必要な部分に分かれます。全角と半角の統一、前後の空白除去、カナの正規化は自動処理で完結する領域です。これに対して「胃癌」「胃がん」「胃ガン」をどれに寄せるかは、病名マスタの定義に従って決める判断が入ります。自動処理と手動判断の境界を最初に線引きしておくと、作業量の見積もりが立てやすくなります。線引きの結果は作業手順書に残し、担当者が変わっても同じ判断ができる状態にするのです。
- 数値項目:単位を統一し、「<0.1」のような不等号付きの値の扱いを決める
- 文字項目:全角と半角、カナを正規化し、外字の置換表を作る
- 日付項目:西暦のISO 8601形式へ統一し、不明日はNULLのまま保持する
日付は最も事故が起きやすい項目です。和暦と西暦の混在、月日の桁揃えの違い、時刻の有無が混ざると、期間の集計が静かに狂います。入院日が「令和6年4月1日」と「2024/04/01」で並んでいる状態は実際によく見かけます。ISO 8601形式へ寄せ、時刻を持たない項目は日付型として明示的に定義しておく方法が安全です。不明日を1900年1月1日などのダミー値で埋める処理は、集計に混入するため避けます。日付の扱いは、集計仕様書に明記しておくべきです。
STEP5 患者単位の名寄せと重複レコードの整理
名寄せでは、統合の条件をどこまで緩めるかが最大の論点になります。条件を厳しくすれば統合漏れが残り、緩めれば別人を統合する事故が起きるのです。医療データでは、後者の影響が圧倒的に重くなります。別人のアレルギー情報や既往歴が混ざったデータセットは、研究にも経営分析にも使えません。誤って統合したデータは、後から分離するのに数倍の手間がかかるのです。統合の条件は、分析の用途ごとに強度を変えて設計する必要があります。
条件の強度 | 一致させる項目 | 想定される用途 | 主なリスク |
|---|---|---|---|
厳格 | カナ氏名・生年月日・性別が完全一致 | 臨床研究用のデータセット | 統合漏れが残る |
標準 | 生年月日と性別が一致しカナ氏名が部分一致 | 院内の経営分析 | 目視確認の工数が増える |
緩和 | 生年月日と性別のみ一致 | 統合候補の洗い出し | 別人の統合が起きやすい |
実務では、緩めの条件で候補を抽出し、そこから絞り込む二段階の進め方が扱いやすいです。自動統合してよいのは完全一致の組だけとし、それ以外は必ず人の確認を挟む方針にします。統合した結果は取り消せる構造にしておく必要があります。元の患者IDを保持したまま、統合後の代表IDを別の列で持たせる設計が安全です。この設計にしておくと、誤統合が判明した際に該当レコードだけを切り離せます。切り離しの手順も、あわせて文書に残しておくべきです。
STEP6 検証と変換履歴の記録
検証は、件数の照合から始めます。抽出元と変換後で、患者数、レコード数、期間ごとの件数が一致するかを確認する作業です。一致しない場合は、変換ルールのどこで脱落したかを工程単位で追える構造にしておきます。工程ごとに中間テーブルを残しておくと、原因の特定が数時間で終わります。照合が合わない状態のまま次の工程へ進むと、原因の切り分けが困難になるのです。中間テーブルは、検証が完了するまで削除せずに保持しておきます。
- 件数照合:患者数・レコード数・年月別件数が、変換の前後で説明できるか
- 値の妥当性:検査値の分布が、変換の前後で不自然に変わっていないか
- 標本確認:無作為に抽出した20〜30件を、原本と目視で突き合わせたか
変換履歴の記録は、後から見て再現できることが条件です。実行したスクリプト、実行日時、実行者、入力データの範囲、出力件数を組にして保存します。スクリプトはGitなどのバージョン管理へ置き、対応表の更新も履歴として残す運用にします。口頭で決めた例外処理をコードにだけ書き残す状態は、担当者が変わった時点で再現できなくなるのです。判断の根拠は文書に残し、コードからその文書を参照できるようにしておきます。参照先を明示する運用が、追跡可能性を支える仕組みです。
電子カルテデータを扱う際に踏まえるべき制約
電子カルテデータには、他の業務データにはない制約が伴います。制約を後から知ると、設計のやり直しに数か月を要することもあるのです。着手前に押さえておくべき論点を4つに整理します。
診療録の保存義務と真正性:原本は書き換えず二次利用データセット側で処理する
診療録の保存期間は医師法で5年、診療に関する諸記録は医療法で2年と定められています。電子的に保存する場合は、真正性、見読性、保存性という3つの基準を満たす必要があるのです。クレンジングの対象はあくまで複製した二次利用データセットであり、原本の診療録には一切手を加えません。この線引きを文書で明示しておくと、監査や実地指導の場面でも説明が通ります。原本と二次利用データを混同しない設計が、制度面での前提条件です。
実装の面では、二次利用データベースを物理的または論理的に分離します。電子カルテの本番環境から夜間バッチで抽出し、分析環境へ連携する構成が一般的です。本番環境で直接クエリを実行する運用は、性能面と改変リスクの両方から避けるべきです。抽出の頻度は、月次分析なら月1回、経営指標を日次で監視するなら日次で設計します。頻度を上げるほど運用負荷が増えるため、用途に対して過剰にならない水準を選びます。用途に応じた設計が、運用の持続性を左右する要素です。
変換ルールと処理ログの文書化:追跡可能性を担保する
文書化の目的は、第三者が同じ結果を再現できる状態を作ることです。変換ルール一覧には、対象項目、変換前の値、変換後の値、変換の根拠、決定日、決定者を記載します。根拠の欄が空白のルールは、後から必ず議論が蒸し返されます。「なぜこの値に寄せたのか」を1行で書いておくだけで、引き継ぎの負荷が大きく下がるのです。決定した内容は、関係者が閲覧できる場所に置いて共有します。更新のたびに版を上げ、古い版も参照できる状態にしておくべきです。
処理ログは、自動で残る仕組みにしておく方法が確実です。手作業で記録する運用は、繁忙期に必ず抜けます。バッチ処理の中で実行日時と処理件数をログテーブルへ書き込む実装にしておきます。ログの保存期間は、データセットの利用期間より長く設定しておく必要があるのです。研究用途なら、論文発表後の問い合わせに備えて5年以上を見込みます。ログの粒度は、処理単位ごとに1行を残す水準が実用的です。保存先はデータセットと分けて管理し、誤って削除されない構成にします。
個人情報の取り扱い:仮名加工・匿名加工の判断基準を先に決める
加工の方針は、データに触れる前に決めておく必要があります。仮名加工情報(他の情報と照合しない限り特定の個人を識別できないように加工した情報)と匿名加工情報では、作成の基準も利用できる範囲も異なるのです。院内の研究や経営分析にとどまるのか、外部への提供まで見据えるのかで選択が変わります。後から匿名加工へ切り替えると、加工基準を満たすために元データからやり直す事態になります。着手前に法務や倫理委員会の担当者と方針を確認しておくことが安全です。
観点 | 仮名加工情報 | 匿名加工情報 |
|---|---|---|
加工の水準 | 氏名など識別子を削除または置換 | 個人の識別と復元ができないよう加工 |
第三者への提供 | 原則として不可 | 一定の条件のもとで可能 |
主な用途 | 院内の分析や研究 | 外部機関への提供や共同研究 |
留意点 | 対応表の厳格な管理が必須 | 希少症例の再識別リスク評価が必要 |
実務では、日付のずらし方が論点になります。生年月日を年単位に丸めるか、入退院日を一律で数日ずらすかによって、分析の可否が変わるのです。在院日数を扱うなら、入院日と退院日の差を保ったままずらす処理が必要になります。加工方針は倫理委員会への申請前に固め、申請書の記載と実装を一致させておきます。日付をずらす幅は、分析で必要な時間分解能から逆算して決めるものです。決めた内容は加工手順書に記載し、実装との差異が出ないよう管理します。
仮名化とは?匿名化との違いや法的な位置づけ、活用方法をわかりやすく解説
多職種での合意形成:医師・診療情報管理士・システム部門の役割分担
データの解釈は、システム部門だけでは決められません。病名の取捨や検査項目の同一性判断には、臨床の知識が要るからです。診療情報管理士は病名コーディングとDPCの実務に精通しており、判断の中心に置くべき役割を担います。医師は臨床的な妥当性を、システム部門はデータ構造と抽出の可否を担当する分担が現実的です。役割を明文化しないまま進めると、判断待ちで工程が止まります。誰が最終決定するかを最初に決めておくことが、進行を止めない条件です。
合意形成の場は、会議体として定義しておく方法が続きます。月1回1時間、判断が必要な事項だけを持ち寄る運営にすると、医師の参加率が保てるのです。毎回の議事録には決定事項と保留事項を分けて記載し、保留は次回に必ず再掲します。決められない論点を放置すると、変換ルールに例外が積み上がり、後から手がつけられなくなります。議事録は共有ストレージに置き、参加できなかった職種も追えるようにするのです。決定事項は変換ルール一覧へ即座に反映します。
電子カルテデータのクレンジングでよくある失敗パターン
失敗の多くは、技術的な難しさではなく判断の設計に起因します。ここで挙げる4つのパターンは、実際の現場で繰り返し観察されるものです。事前に知っておくだけで回避できる内容なので、着手前に目を通しておいてください。
外れ値を一律に除外し、重症例や臨床的に意味のある値を失う
統計的な手法で外れ値を除外する処理は、医療データでは慎重に扱う必要があります。平均から標準偏差の3倍を超える値を機械的に落とすと、重症例が消えてしまうからです。CRPが30mg/dLを超える値や、白血球数が50,000/μLを超える値は、異常ですが実在します。これらを除外したデータで重症度を分析しても、意味のある結果は得られません。除外の判断は統計量ではなく、臨床的にあり得るかどうかを基準にすべきです。
判断の基準は、生理学的にあり得ない値かどうかで線を引く方法です。身長300cmや体重3kgの成人といった値は、入力誤りとして扱えます。臨床的に説明できる範囲の値は、外れ値ではなく重要な情報として残します。除外する場合も、削除ではなくフラグを立てて残す実装にしておくべきです。後から判断を変えたくなった際に、元データへ戻る手間を省けます。フラグの列名と判定条件は、データ定義書に明記しておく必要があるのです。
名寄せ条件を緩めすぎ、別患者のレコードを統合してしまう
同姓同名で生年月日も近い患者は、規模の大きい施設ほど実際に存在します。生年月日とカナ氏名だけで統合する条件設定は、別患者の統合事故を招きます。双子の患者は生年月日と姓が一致し、名前のカナも似ている場合があるのです。性別と住所を条件に加えても、同居している家族であれば一致してしまいます。条件を1つ緩めるごとに、誤統合の可能性がどれだけ増えるかを試算しておくべきです。試算には、実データから抽出した候補の一部を使います。
事故を防ぐ手立ては、統合前の目視確認を必須にする運用です。自動統合の対象は、患者IDが完全に一致し属性もすべて一致する明白な重複に限定します。それ以外は候補一覧として出力し、診療情報管理士が受診履歴や診療科を見て判断します。確認の目安は1件あたり1〜2分であり、候補が500件なら2日程度の作業量です。工数を惜しんで自動化の範囲を広げた結果、後から全件を再確認する事態に陥る例もあります。確認の工数は、最初から計画に織り込んでおくべきです。
マッピング表を属人管理し、再現性と引き継ぎができなくなる
対応表が個人の端末にある表計算ファイルで管理されている状態は、非常に多く見られます。ファイル名に日付を付けた版が10個以上並び、どれが最新かわからなくなるのが典型的な結末です。担当者が異動すると、変換ルールの根拠がわからなくなります。同じ調査を最初からやり直すことになり、数か月分の作業が失われます。属人管理の怖さは、失われるのがファイルではなく判断の履歴である点です。同じ判断を再現できなければ、過去の分析結果も説明できなくなります。
回避策は、対応表を成果物として正式に管理する体制を作ることです。共有ストレージやデータベースへ置き、更新履歴を残す仕組みにします。どの表がどのデータセットの生成に使われたかを記録しておくと、追跡が容易になります。対応表そのものにもメタデータを付け、管理者と更新頻度を明示しておくべきです。データカタログの仕組みを使い、対応表を含めて一元的に把握する運用も選択肢になります。管理の仕組みを整えるほど、引き継ぎにかかる期間は短くなるものです。
一度整備して終わりにし、入力運用の改善につなげない
クレンジングは、入力運用が変わらなければ同じ問題が再生産されます。転帰未入力が多いという結果が出たなら、なぜ入力されないのかを現場に確認する工程が必要です。入力欄が画面の下部にあって見えていない、といった単純な理由であることも珍しくありません。画面レイアウトの変更だけで未入力率が半分以下になった例もあります。データの問題は、入力する場面まで遡って初めて解決するものです。現場への確認は、抽出結果を持参して具体的に行います。
継続の仕組みとして、品質指標を定点観測する方法が有効です。主要項目の欠損率、標準コードへの変換率、重複候補の件数という3つを月次で追います。値が悪化した月は、その前月に起きた運用変更を確認する流れを定型化しておきます。指標は診療科別に出すと、改善の働きかけがしやすくなるのです。四半期に一度、現場へ結果を返す場を設けると、入力の質そのものが上がります。指標を継続して見る体制があってこそ、整備の効果が持続するのです。
電子カルテデータのクレンジング活用イメージ
同じクレンジングでも、組織の形と目的によって重点は変わります。急性期病院、複数拠点を持つ医療法人、研究や製薬の領域という3つの立場から、どこに工数が偏るのかを見ていきます。自院に近い形を探して読み替えると、優先順位を決める材料になるはずです。
急性期病院:DPCデータと診療記録を突合した分析基盤の整備
急性期病院では、DPCデータと診療記録の突合が最初の目標になります。既にDPCデータを毎月提出しているため、標準化された骨格が手元にある点が強みです。不足しているのは、検査値や看護記録といった詳細な情報です。両者を患者IDと入院期間で結び、在院日数の変動要因を分析できる基盤を作ります。対象を絞ることで、突合の設計に集中できるのが利点です。必要な項目は、既存のDPC提出データの様式から逆算して洗い出します。
工数配分の目安は、患者IDの整理に全体の2割、病名の整理に3割、検査項目のマッピングに3割です。残りを検証と文書化に充てる配分にすると、手戻りが起きにくくなります。初回は特定の疾患群に絞ると、成果を早く示せます。症例数の多い脳梗塞や大腿骨骨折など、1つの診断群分類から始める判断が現実的です。3か月で1疾患群を仕上げ、その手順を横展開する進め方が定着しやすくなります。横展開のたびに手順書を更新しておくと、担当者が増えても品質が保てるのです。
複数拠点を持つ医療法人:拠点間で分断された患者データの統合
拠点ごとに異なる電子カルテを使っている法人は珍しくありません。同一法人でも患者IDの体系が拠点ごとに独立している場合が多いです。同じ患者が本院と分院の両方を受診していても、法人全体では別人として扱われます。紹介の実績や重複した検査の把握ができず、経営判断の材料が欠けた状態が続きます。拠点間の紹介や逆紹介が多い法人ほど、この分断の影響は大きくなるのです。統合の対象となる患者の規模を把握する調査から始めます。
解決の中心は、法人共通の患者識別子を新たに設ける設計です。既存の拠点IDは変更せず、法人IDを対応表で紐づける方式にすると、各拠点の運用を止めずに統合できます。対応表は日次で更新し、新規患者の登録に追随させます。拠点をまたぐ受診が全患者の5〜10%程度あれば、統合の効果は数値として説明できるのです。電子カルテの統一を待たずに着手できる点も、この方式の利点になります。対応表の管理責任者を明確にしておくことも、運用を続けるうえで必要です。
データ統合とは?統合の目的や初心者向けの進め方を解説
研究・製薬領域:多施設データを共通フォーマットに揃える前処理
多施設のデータを扱う場合、前処理の大半は共通フォーマットへの変換に費やされます。CDISCのSDTMや、独自に定義した共通データモデルへ揃える作業です。施設ごとに項目の有無が異なるため、必須項目と任意項目を明確に分けます。必須項目が欠けている施設は、参加前の段階で除外する判断も必要になります。変換の前に、施設ごとの項目一覧を突き合わせる工程が必要になるのです。対応が難しい項目は、任意項目として扱う方針を事前に合意します。
品質の確認は、施設単位で実施する方法が効率的です。施設ごとに検査値の中央値や分布を比較し、明らかに外れている施設を特定します。単位換算の誤りは、分布の比較で高い確率で発見できるのです。発見した差異は施設へ照会し、回答を記録に残したうえで変換ルールへ反映します。照会と回答の往復には1施設あたり2〜4週間を見込んでおくと、計画が崩れません。照会と回答の履歴は、研究の品質管理記録として保存しておくべきです。
まとめ:電子カルテデータのクレンジングは目的定義と原本性の担保から始まる
電子カルテデータのクレンジングは、技術的な処理そのものより、目的の定義と原本性の担保という2つの土台で成否が決まります。ここまでの内容を、着手時に判断すべき点に絞って整理します。
最初にやるべきことは、分析の用途を1つ決め、そこから必要な項目を逆算する作業です。対象を1診療科・3年分程度に絞れば、3〜4か月で一巡できます。原本には手を加えず、複製した二次利用データセット側で変換する構成を最初から取ります。変換ルールと処理ログを文書として残すことが、再現性と引き継ぎを支える基盤になるのです。
品質の低下が集中するのは、病名、患者ID、検査、医薬品、自由記述という5項目です。どこから着手するかは、分析の用途によって変わります。経営分析なら病名と患者ID、多施設連携なら検査と医薬品のコード対応を優先します。整備後も品質指標を月次で追い、入力運用の改善につなげる流れを作ってください。
「これから電子カルテデータに関する取り組みを実施したいけれど、何から手をつけたらいいかわからない」「データ専門家の知見を取り入れたい」という方は、データ領域の実績豊富な弊社、データビズラボにお気軽にご相談ください。
貴社の課題や状況に合わせて、データの取り組みをご提案させていただきます。








