検査データのクレンジングとは|臨床検査値の品質を守る実務手順

検査データのクレンジングとは|臨床検査値の品質を守る実務手順

検査データは、患者の状態を数値で追える貴重な情報源です。ところが分析や二次利用へ回そうとすると、項目コードの不一致、単位の混在、欠損の意味の食い違いといった壁に突き当たります。クレンジングでは、この不備を解消し、施設内外の突合と比較に耐える状態へ整えていきます。

検査データ特有の難しさは、同じ検査でも施設ごとに記録の仕方が異なる点にあります。項目コードが院内独自の体系で振られていたり、同じ項目でも測定法の違いで基準値が変わっていたりと、単純な名寄せでは解決できない不備が重なっているのが通常です。欠損1つをとっても、未実施なのか測定エラーなのかで扱いが変わります。

本記事では、検査データのクレンジングを実務レベルで進める手順を、作業順序やつまずきの回避策、工数の目安まで踏み込んで解説します。どこまでを自動化し、どこから人が判断するかの切り分けにも触れます。着手前の設計指針として活用してください。

目次

検査データのクレンジングとは|対象範囲と品質の不備が生じる原因

検査データのクレンジングを設計するには、対象となるデータの範囲と、品質の不備がどこで生まれるかを先に押さえる必要があります。項目コード、単位、基準範囲、定性表記、欠損、患者情報という6つの観点から、不備が生じる典型的な原因を順に確認していきます。

検査データの範囲:検体検査・生理検査とその付随情報

検査データと一口に言っても、実務で扱う範囲は3つの層に分かれます。1つ目は血液や尿を対象とする検体検査で、生化学、血液学、免疫血清、微生物といった区分ごとに数百項目が並ぶのが通常です。2つ目は心電図や呼吸機能検査などの生理検査であり、波形データや所見文といった数値以外の情報を多く含みます。3つ目はオーダ情報、採取日時、検体種別、実施部門といった付随情報です。対象を検体検査の数値だけに絞ると、後から採取日時の欠落が判明し、集計をやり直す事態を招きます。

  • 検体検査(生化学・血液学・免疫血清・微生物など、数値と定性結果が中心)
  • 生理検査(心電図・呼吸機能・超音波など、波形データと所見文が中心)
  • 付随情報(オーダ日時・採取日時・検体種別・実施部門・委託先区分)

最初に着手すべきは、対象範囲を1枚の表に書き出す作業です。検査部門の実施項目一覧、外部委託先から返却されるデータレイアウト、電子カルテ側の格納テーブルを突き合わせ、どこに何が入っているかを可視化します。中規模の病院であれば、この棚卸しだけで2週間から1か月ほどを見込んでおくと現実的でしょう。範囲を確定しないまま変換ルールを作り始めると、後工程で「この項目は対象外だった」という差し戻しが繰り返し発生します。

医療DXとは?具体的な施策や成功のポイント、医療DX令和ビジョン2030を解説

検査項目コードと単位が不統一になる背景

同じASTでも、システムによって「GOT」「AST(GOT)」「S-AST」と表記が異なるのは珍しくありません。背景にある原因は大きく3つです。1つは部門システムごとに独自の院内コードを採番してきた歴史であり、検査部門、病理部門、生理検査部門がそれぞれ別体系を持つ例が多く見られます。2つ目は、外部委託検査会社ごとにコード体系が異なる点にあります。3つ目は試薬や測定機器の更新に伴い、過去コードが残ったまま新コードが追加される運用です。

単位の不統一はさらに厄介です。クレアチニンを例にすると、mg/dLとμmol/Lでは数値が約88倍違い、単位を無視して統計処理を行えば分布が完全に崩れます。ヘモグロビンA1cについても、JDS値とNGSP値で0.4ポイント程度の差が生じるのです。単位カラムが用意されていても空欄のまま運用されている例は多く、値だけを見ても判断がつきません。項目コードと単位の組み合わせを全件集計し、1項目に複数単位が存在するものを洗い出してください。

基準範囲の施設間差異:同じ項目でも判定結果が変わる

基準範囲は全国共通ではなく、測定機器、試薬、対象集団によって施設ごとに設定されるものです。たとえばALPは、測定法がJSCC法からIFCC法へ移行した際に基準範囲がおよそ3分の1へ変わりました。同じ100 U/Lという値でも、どちらの測定法かによって正常とも高値とも判定されます。複数施設のデータを統合する場面では、値そのものより先に、どの基準範囲が適用されていたかを確認すべきです。基準範囲の記載が検査結果報告書の欄外にしか残っていない場合もあり、システム上のマスタと突き合わせる作業が発生します。

実務では、基準範囲そのものをデータに持たせる方式が有効です。検査結果テーブルに下限値、上限値、判定区分の3カラムを追加し、結果値と同じ行に記録しておけば、後から基準範囲が変わっても過去の判定を再現できます。すでに判定フラグだけが格納されている場合は、検査部門が保管する基準範囲の改定履歴を取り寄せ、適用期間と突き合わせてください。改定履歴が紙台帳でしか残っていない施設も少なくありません。その場合は電子化を先に済ませ、適用開始日と終了日を持つ履歴テーブルとして保持する形が確実です。

定性・半定量結果と検出限界値の表記ゆれ

定性検査の結果は、「陽性」「+」「(+)」「1+」「陰性」「-」といった複数の表記が混在しがちです。半定量では「1+」「2+」「3+」が使われますが、判定基準は検査法によって異なります。尿定性検査の潜血が2+である場合と、便潜血が2+である場合では意味がまったく違うため、項目を無視した一括変換は避けるべきです。表記の対応表を作る際は、必ず項目コードと組み合わせた粒度で定義します。対応表には、旧表記、統一後の表記、適用する項目コードの3列を最低限持たせておいてください。

測定機器が検出できる下限を下回った結果は、検出限界値を用いて「<0.1」のように記録されます。この値を単純に0へ置き換えると、実際には0.09だった可能性を切り捨てることになるのです。逆に0.1として扱えば、値を過大評価します。臨床研究では、検出限界未満を限界値の2分の1に置換する方法が慣例として使われますが、置換したこと自体を別カラムで明示するのが前提です。元の文字列は必ず原本カラムとして残しておいてください。

欠損の意味が混在する状態:未実施・未入力・検査対象外

検査データの空欄は、少なくとも4種類の意味を含みます。オーダはされたが未実施のもの、実施したが結果が未入力のもの、そもそも対象外で実施しないもの、検体不良で測定不能だったものです。これらがすべて同じNULLとして格納されていると、欠損率を集計しても解釈ができません。分析上も、未実施を欠損として補完するのは誤りであり、対象外は分母から除外すべきです。欠損率だけを見て使えないデータだと判断してしまう前に、意味の内訳を必ず確認します。

  • オーダ済み・未実施(採取待ち、患者都合によるキャンセル前)
  • 実施済み・結果未入力(機器連携の失敗、手入力待ち)
  • 対象外(該当診療科で実施しない、年齢や性別による非適用)
  • 測定不能(溶血、乳び、検体量不足)

区別するには、結果値カラムとは別に状態コードカラムを設ける方法が確実です。電子カルテやLISのオーダテーブルには、オーダ状態を示すフラグがすでに存在する場合が多く、結果テーブルと結合すれば未実施と未入力を切り分けられます。フラグが存在しない場合は、オーダ日時と結果報告日時の差から推定する暫定策も取れます。運用開始から半年程度は、推定ルールの妥当性を毎月レビューしてください。推定で埋めた行には推定であることを示すフラグを付け、解析時に除外できる状態にしておきます。

患者情報の重複登録と氏名表記の不一致

同一患者に複数の患者IDが割り当てられる状況は、多くの施設で発生しています。救急搬送時の仮ID発行、旧姓での初診登録、他院からの紹介時の重複登録が代表的な原因です。氏名についても、外字、旧字体、カタカナとひらがなの混在、姓名間のスペース有無といった差異が積み重なります。生年月日の入力誤りが加わると、単純な完全一致では同一人物として判定できません。重複候補がどの程度存在するかを把握するため、氏名カナと生年月日の組み合わせで件数を集計するところから始めてください。

この状態を解消する作業が名寄せです。氏名カナ、生年月日、性別、郵便番号を組み合わせた複合キーで候補を抽出し、一致度スコアが一定値を超えたペアを人が目視確認する流れが実務的です。1万人規模の患者マスタであれば、候補ペアは数百件から千件程度に収まることが多く、2名体制で1週間ほどの確認工数を見込みます。統合の可否を迷った場合は、統合しない判断を選ぶのが安全な運用です。自動統合だけで完結させると、別人を同一人物として結合する事故が起こります。

名寄せとは?正確な顧客データ管理の方法と活用ポイントを徹底解説

検査データのクレンジングで解決できること

整備は手間のかかる作業ですが、投資に見合う効果は明確です。患者単位の経時追跡、部門横断の集計、臨床研究への二次利用、そして日々の抽出工数という4つの観点から、何ができるようになるかを具体的に確認します。

患者単位の経時変化を正確に追跡できる

検査値の解釈で最も価値があるのは、1時点の値ではなく変化の方向です。クレアチニンが1.2 mg/dLという情報だけでは判断が難しくても、3か月で0.8から1.2へ上昇したとわかれば介入の材料になります。項目コードと単位が統一されていない状態では、この時系列を1本の線として描くことはできないのです。部門システムの切り替えを挟んだ期間はとくに断絶が起きやすく、10年分のデータが実質3年分しか使えない例もあります。移行前後で同一項目のコードが変わっていないかは、切り替え時期の前後1か月のデータを並べて確認してください。

統一後に得られる効果は、具体的な運用改善として現れるものです。腎機能の悪化傾向を持つ患者を自動抽出して腎臓内科へ紹介する仕組みは、値と単位が揃って初めて成立します。糖尿病領域では、HbA1cの推移を6か月単位で追跡し、目標未達の患者リストを外来前日に出力する運用が定着しやすい領域です。こうした抽出条件は一度作れば繰り返し使えるため、初期整備の工数は数か月で回収できます。抽出条件を10本ほど用意しただけで、年間200時間以上の削減につながった例もあります。

部門システムをまたいだ横断集計が可能になる

検査部門、放射線部門、病理部門、内視鏡部門は、それぞれ別のシステムで結果を管理しているのが一般的です。同じ患者の同じ疾患に関する所見が4か所に分散していると、横断的な集計には手作業の突合が必要になります。項目コードと患者IDが統一されれば、こうした突合は自動化の対象になるのです。感染症サーベイランスのように、微生物検査の結果と病棟情報を掛け合わせる用途では、統一の有無が集計可否そのものを左右します。

横断集計の設計では、粒度の定義を先に決めることが要点です。検査単位、オーダ単位、来院単位、患者単位のどれを1行とするかで、集計結果はまったく違う数字になります。たとえば1回のオーダで5項目を実施した場合、検査単位なら5行、オーダ単位なら1行です。この定義を関係部門で合意しないまま集計を進めると、同じ質問に対して部署ごとに異なる数字が出る事態を招きます。集計定義書を1枚作り、粒度と除外条件を明記しておいてください。

臨床研究・二次利用に耐えるデータ品質を確保できる

臨床研究でデータを使う場合、求められる品質水準は日常診療より一段高くなります。値そのものの正確さに加えて、測定方法、基準範囲、単位、採取条件が記録されているかが問われるのです。査読の過程で測定法を尋ねられ、記録がなく回答できなかったという事例は珍しくありません。整備済みのデータであれば、必要な属性を添えて提出でき、追加照会への対応も短時間で済むはずです。倫理審査の申請時にも、データの由来と加工内容を説明できる資料があれば、審査のやり取りが1往復から2往復ほど減ります。

二次利用の可否は、データ品質の6つの観点で評価すると判断しやすくなります。完全性、正確性、一貫性、適時性、一意性、妥当性の各観点について、対象データがどの水準にあるかを事前に採点しておけば、研究計画の段階で不足を補えるのです。採点は5段階で十分であり、3点未満の観点があれば追加整備を計画へ組み込みます。品質評価を省略したまま解析へ進むと、結果が出た後で前提の誤りに気づく事態になります。着手前に30分ほどかけて採点しておくだけで、後工程の手戻りを大きく減らせるのです。

データ品質とは?品質評価項目や品質を向上させるための実務的対策を解説

抽出のたびに発生する手戻りと確認工数を削減できる

データ抽出の依頼が来るたびに、担当者が項目コードの対応表を確認し、単位を換算し、重複を除去する作業を繰り返している施設は多くあります。1件あたり半日から2日の工数がかかり、月に10件の依頼があれば年間で数百時間に達する計算です。しかも属人的な処理になるため、担当者が変わると同じ条件で抽出しても結果が一致しません。手戻りの多くは、この再現性の欠如から生まれるものです。依頼内容と抽出条件を記録していない施設では、同じ依頼が半年後に再度届いた際に一から作業をやり直します。

整備済みのデータマートを用意すれば、抽出はSQLの条件変更だけで完結します。標準コードと統一単位で格納したビューを1つ作り、そこからの抽出を原則とする運用に変えるだけでも効果は明確です。実際に、依頼から納品までの平均日数が5日から1日へ短縮できた例もあります。抽出条件の履歴をチケットで管理しておくと、類似依頼への再利用がさらに進むはずです。過去1年分の依頼を分類すると、上位5パターンで全体の7割前後を占める例が多く、そこだけを定型化しても効果は出ます。

検査データのクレンジングを進める5つのステップ

進め方は、現状把握、ルール設計、変換と正規化、重複排除、検証と記録の5段階に整理できます。順序には理由があり、入れ替えると手戻りが生じる箇所も明示しますので、自組織の状況に当てはめながら読み進めてください。

ステップ

主な作業

成果物

工数の目安

STEP1 現状把握

データソースと項目定義の棚卸し

データ一覧表・項目定義書

2週間〜1か月

STEP2 ルール設計

標準コード・単位・丸め規則の決定

変換ルール定義書

3週間〜1.5か月

STEP3 変換と正規化

コード統一・単位統一・値の正規化

変換スクリプト・中間テーブル

1〜3か月

STEP4 重複排除と名寄せ

患者単位・検査単位の同一性判定

名寄せ結果・統合履歴

2週間〜1か月

STEP5 検証と記録

件数照合・値域確認・変更ログ整備

検証報告書・変更ログ

2週間〜1か月

STEP1 現状把握:データソースと項目定義の棚卸し

最初に行うのは、どこにどんなデータがあるかの一覧化です。対象はLIS、電子カルテ、部門システム、外部委託検査会社から返却されるファイル、そして部署が個別に持つExcelまで含めます。それぞれについて、格納場所、項目数、保有期間、更新頻度、責任部署を1行ずつ記録するのです。ここで「Excelは対象外」と決めてしまうと、実は院内で最も参照されている集計表が管理の外に残る結果を招きます。部署が個別に持つファイルは、所在と作成者を記録するだけでも次の工程が進めやすくなるはずです。

項目定義の棚卸しでは、実データの値分布を必ず確認します。項目コードごとに件数、ユニーク値数、最小値、最大値、欠損率を出し、想定と食い違う項目を洗い出す作業です。SQLのGROUP BYで十分に対応でき、数万件規模ならExcelのピボットテーブルでも実施できます。定義書に書かれた内容と実データが一致しない項目は、経験上2割前後の割合で見つかります。その差分こそが、後工程で問題になる箇所です。差分は一覧にまとめ、修正するのか定義書側を実態に合わせるのかを項目ごとに決めてください。

STEP2 ルール設計:標準コード・単位・丸め規則の統一方針を決める

ルール設計では、標準コードの採用方針を最初に決めます。国内の施設内利用が中心であればJLAC10を基軸とし、国際的な研究連携や他院との相互運用を視野に入れるならLOINCへの対応も並行して検討する形が現実的です。両方を持つ場合は、院内コードを主キーとして各体系をそれぞれ別カラムで保持する構成にします。1つのカラムへ複数体系を混在させる設計は、後から必ず破綻します。対応表はスプレッドシートではなくマスタテーブルとして持ち、更新の履歴を残せる形にしておくのが望ましい形です。

  • 採用する標準コード体系と、院内コードとの対応表の管理責任者
  • 項目ごとの基準単位と、旧単位からの換算式
  • 有効桁数と丸め方向(四捨五入か切り捨てか)の定義
  • 定性・半定量結果の表記統一ルール
  • 欠損と対象外を区別する状態コードの値一覧

単位と丸め規則も同時に決めておく必要があります。単位はSI単位系に寄せるか、臨床現場の慣用単位に寄せるかの二択です。院内利用が主目的なら慣用単位を採用し、換算式を定義表へ持たせる方式が扱いやすいでしょう。丸めは項目ごとに有効桁数を定め、変換時ではなく表示時に適用します。変換の途中で丸めると誤差が累積し、再計算しても元の値へ戻せなくなります。丸め前の値を別カラムへ残しておけば、有効桁数の方針を後から変更しても再計算で対応できる構成です。

データクレンジングとは?意味と代表手法を解説!

STEP3 変換と正規化:項目コードと単位の統一を最初に実施する

変換の順序には明確な優先順位があります。項目コードの統一、単位の統一、値の正規化、この順で進めるのが原則です。単位を揃える前に統計処理を行うと、mg/dLとμmol/Lが混在したまま平均値が算出され、結果が意味を失います。同様に、項目コードを統一する前に重複を除去すると、別項目を同一項目と誤認する危険が生まれるのです。順序を守るだけで、後戻りの大半は防げるはずです。逆に順序を崩すと、変換のやり直しに当初見積もりの2倍から3倍の工数がかかります。

実装面では、変換処理を1本のスクリプトにまとめず、工程ごとにテーブルを分ける構成が扱いやすくなります。原本テーブル、コード統一済みテーブル、単位統一済みテーブル、分析用テーブルという4層を用意し、各層の件数が一致するかを毎回確認する運用です。件数が減っていれば、変換に失敗した行が捨てられている証拠です。dbtやTalend、Alteryxといったツールを使う場合も、この層構造をそのままモデルへ反映させてください。

データプレパレーションとは?ETLとの違いから成功ポイントまで徹底解説

STEP4 重複排除と名寄せ:患者単位・検査単位で同一性を判定する

重複には2つの水準があります。患者単位の重複は複数IDの統合で解消し、検査単位の重複は同一オーダの二重取り込みや再検査の扱いを整理することで解消できるのです。再検査は重複ではないため、削除してはいけません。判定には患者ID、検査項目コード、採取日時、結果値の4つを組み合わせたキーを用い、採取日時まで完全一致する行だけを重複候補として扱う方針が安全です。再検査かどうかは、オーダ区分や備考欄に手がかりが残っている場合が多く、検査部門への確認で判別できるはずです。

一致度判定では、閾値の設計が結果を左右します。氏名カナの編集距離、生年月日の完全一致、性別の一致を組み合わせてスコア化します。0.95以上は自動統合、0.80から0.95は目視確認、0.80未満は別人として扱う3段階の運用が現実的です。目視確認の対象が全体の1パーセントを超える場合は、閾値かキー項目の見直しを検討してください。統合した組み合わせは必ず履歴テーブルへ残し、誤統合が判明した際に分離できる状態を保ちます。

STEP5 検証と記録:修正内容と判断根拠を追跡可能な形で残す

検証で確認すべき観点は4つあります。件数の整合、値域の妥当性、必須項目の充足率、そして変換前後で意味が変わっていないかという点です。件数は各層で一致するかを見ますが、意図的に除外した行がある場合は除外件数と理由を別途記録します。値域については、項目ごとに生理学的にあり得る範囲を定義し、範囲外の値をリスト化して臨床部門へ確認を依頼してください。照会は項目ごとにまとめて行うと効率がよく、1回の依頼で20件から30件をまとめて処理できます。

記録の粒度は、第三者が再現できる水準に揃えます。どの行のどのカラムを、どんなルールで、いつ、誰の判断で変更したかを1行ずつ残す方式が確実です。変更ログのテーブルには、対象ID、変更前値、変更後値、適用ルールID、実行日時、承認者の6項目を持たせておきます。監査や査察の場面では、この記録があるかどうかでデータの信頼性評価が大きく変わります。ログの保存期間は、研究利用を想定するなら最低でも5年、治験関連なら規定に沿った期間を確保してください。

検査データの標準化で押さえるコード体系と規格

標準化を進めるうえで避けて通れないのが、どの規格に準拠するかという判断です。国内向けの項目分類、国際的な相互運用、電子カルテからの抽出形式、臨床研究向けの要件という4つの領域について、それぞれの位置づけと選択の基準を整理します。

規格

主な役割

適する場面

導入時の注意点

JLAC10・JLAC11

国内の臨床検査項目分類

院内および国内施設間での統一

桁数が多く部分一致検索を前提とした設計が必要

LOINC

国際的な検査項目の識別

国際共同研究・海外システム連携

全項目対応は不要で優先項目に絞る

SS-MIX2・HL7 FHIR

電子カルテからの抽出と連携

ベンダーに依存しないデータ取得

拡張ストレージの中身は施設ごとに確認が必要

CDISC

治験データの標準形式

治験・規制当局への提出

収集段階から形式を合わせる必要がある

JLAC10・JLAC11:国内の臨床検査項目分類コード

JLAC10は日本臨床検査医学会が定める17桁のコード体系で、分析物、識別、材料、測定法、結果識別の5要素を組み合わせて1項目を表現します。測定法まで含めて識別できる点が特徴であり、同じ分析物でも測定法が違えば別コードです。この設計により、測定法の違いに起因する値の差を後から追跡できます。一方で桁数が多いため、部分一致検索を前提とした運用設計が必要です。実務では、分析物コードの上位5桁だけで項目群を束ねる検索を用意しておくと、集計作業が進めやすくなります。

後継のJLAC11は、コードの枯渇と拡張性の不足という課題に対応した体系です。移行を検討する際は、既存データの再コード化範囲を先に見積もってください。過去5年分だけを再コード化し、それ以前は旧コードのまま参照専用とする割り切りも実務では有効です。全期間の再コード化にこだわると、費用と期間が数倍に膨らみ、着手自体が先送りになります。移行の判断は、外部連携の予定があるかどうかと、既存データの参照頻度の2点で決めるのが現実的です。

LOINC:施設や国をまたいだ相互運用性を確保する場合の選択肢

LOINCは米国のRegenstrief Instituteが管理する国際的な検査項目コードで、6つの軸で項目を定義します。成分、測定属性、時相、検体系、尺度、測定法という構成であり、JLAC10とは分類の考え方が異なるものです。国際共同研究への参加、海外システムとのデータ交換、国際的な学術誌への投稿を予定する場合には、対応が実質的な前提条件になります。JLAC10との対応表は公開されており、機械的な変換もある程度は可能です。ただし1対1で対応しない項目が1割前後は残るため、その分は人が判断する前提で計画を立てます。判断が割れた項目は保留リストへ入れ、臨床検査技師の確認を経てから確定させる運用です。

全項目をLOINCへ対応させる必要はありません。実務では、外部連携や研究で実際に使う項目、たとえば血算、生化学の主要項目、HbA1c、脂質など100項目前後に絞って対応表を整備する進め方が効率的です。対応表の作成は1項目あたり10分から30分を見込み、100項目なら3人日から6人日程度に収まります。残りの項目は必要が生じた時点で追加する運用にしてください。対応表の妥当性は、LOINCの公式検索ツールで項目名と単位を突き合わせて確認します。

相互運用性とは?データガバナンスとデータマネジメントでの重要性

SS-MIX2・HL7 FHIR:電子カルテからの抽出と連携時の格納形式

電子カルテからデータを取り出す際の標準的な仕組みがSS-MIX2です。標準化ストレージにHL7 V2.5形式のメッセージをファイルとして蓄積する方式で、患者基本情報、処方、検査結果などが分野別に格納されます。多くの電子カルテベンダーが対応しているため、ベンダー独自の抽出機能に依存せずデータを取得できる点が利点です。ただし拡張ストレージの中身はベンダー裁量の部分が残り、施設ごとの確認は避けられません。導入前に、標準化ストレージへ検査結果が実際に出力されているかをベンダーへ確認しておいてください。出力対象の項目範囲や更新頻度は施設ごとの設定に依存するため、契約前の確認が有効です。

HL7 FHIRは、リソース単位でデータを表現しREST APIで交換する新しい規格です。検査結果はObservationリソースとして表現され、コードにはLOINCを用いるのが標準的な運用になります。既存のSS-MIX2資産がある施設では、SS-MIX2を一次保管、FHIRを外部連携用の変換出力と位置づける構成が現実的です。両方を同時に主系として運用すると、二重管理の負荷が現場に残り続けます。移行期はFHIR側を参照専用と定めておくと、運用の混乱を避けられるはずです。

CDISC・GCP:治験および臨床研究で求められるデータ要件

治験データを扱う場合、CDISCが定める標準への準拠が求められます。収集段階のCDASH、解析用データセットのSDTM、統計解析用のADaMという3層構造で、それぞれ変数名や値の持ち方が細かく規定されています。検査値についてはLBドメインへ格納し、標準単位への換算値と原単位の値を併せて保持する形式です。この規定を知らずに独自形式で収集すると、提出前の変換作業が大きな負担になります。実施医療機関としてデータを提供する立場でも、収集項目の定義書は事前に読み込んでおくべきです。

GCPの観点で最も重視されるのは、原資料との照合可能性です。検査値の修正履歴、修正理由、実施者、日時が残っていない場合、モニタリングや査察で指摘の対象になります。電子データを扱う場合は、監査証跡機能を持つシステムを使うか、変更ログを別テーブルで完全に保持する体制が必要です。日常診療のデータをそのまま研究へ転用する場面でも、この記録要件は同じ水準で満たしておいてください。診療録と研究用データの突合手順を文書化しておけば、査察対応の準備時間を大幅に短縮できます。

検査データのクレンジングを成功させる実務ポイント

手順どおりに進めても、判断を誤ると成果が出ないまま工数だけが積み上がります。外れ値の扱い、履歴の保持方法、個人情報の取り扱い、部門間の合意形成、ツール選定という5つの論点について、判断の基準を具体的に示します。

外れ値と臨床的に意味のある異常値を切り分けて扱う

統計的な外れ値と、臨床的に意味のある異常値はまったく別物です。白血球数が50,000/μLという値は統計的には極端でも、白血病であれば正しい測定結果になります。四分位範囲の1.5倍を超える値を機械的に除外する処理を検査データへ適用すると、重症例だけが消えたデータセットができあがります。除外ではなく、フラグを立てて残す方針が原則です。除外する場合は、除外件数と条件を必ず報告書へ明記してください。除外した行は削除せず、除外フラグを立てて残しておくと再検証が容易になります。

実務での切り分けは、3段階のルールで対応できます。第1に、生理学的にあり得ない値、たとえばヘモグロビン0 g/dLや年齢200歳といった値は入力誤りとして修正の対象です。第2に、あり得るが極端な値は臨床部門へ照会し、判断を仰いだうえで採否を決めます。第3に、正常範囲内でも前回値から急激に変動した値は、検体取り違えの可能性を疑って採取記録を確認してください。箱ひげ図で分布を可視化すると、この切り分けが進めやすくなります。

箱ひげ図とは?外れ値の見方やExcelでの作成方法まで徹底解説

原データは上書きせず、変換履歴を別レイヤーで保持する

原データの上書きは、取り返しのつかない事故につながります。変換ルールに誤りが見つかった場合、原本が残っていれば再変換で復旧できますが、上書きしていれば復旧の手段がないのです。バックアップがあっても、日次バックアップでは変換前後のどの時点かを特定するのに時間がかかります。原本テーブルは読み取り専用とし、変換結果は必ず別テーブルへ書き出す構成にしてください。権限設定で書き込みを禁止しておけば、運用担当者が変わっても誤操作の余地が残りません。

履歴の保持方法は、対象データの規模で使い分けます。数百万行までであれば、変換前後の値を1行ずつ記録する変更ログ方式が扱いやすい選択です。億行規模になると変更ログ自体が肥大化するため、適用したルールIDと処理日時のみを記録し、原本と再変換で差分を導出する方式へ切り替えます。判断の目安は、変更ログの想定行数が原本の3割を超えるかどうかです。超える見込みであれば、最初から再変換方式で設計しておくほうが後の移行コストを抑えられます。

個人情報の取り扱い:仮名加工情報と匿名加工情報の判断基準

検査データの二次利用では、加工の種類によって扱いが変わります。仮名加工情報は、他の情報と照合しない限り個人を識別できないように加工したもので、内部での分析利用が主な想定です。匿名加工情報は、特定の個人を識別できず、かつ元データを復元できないように加工したものであり、第三者提供が可能になります。医療情報については次世代医療基盤法に基づく枠組みもあり、目的に応じた選択が必要です。判断に迷う場合は、法務部門や倫理委員会へ相談したうえで方針を文書化しておきます。

判断の基準は、データを誰に渡すかで決まります。院内の研究部門が使うだけであれば仮名加工で足りますが、他施設や企業へ提供する場合は匿名加工または法に基づく枠組みが必要です。検査データ特有の注意点として、希少疾患の検査値や特殊な検査項目の組み合わせは、それ自体が個人の特定につながる場合があります。項目の削除だけでなく、値の丸めや上位カテゴリへの集約も検討してください。検査値そのものを5パーセンタイル単位へ丸めるだけでも、特定につながるリスクは大きく下がります。

匿名化とは?匿名加工情報との関係や仮名化・秘匿化との違い、各手法の活用目的

臨床部門と情報システム部門で判断基準をすり合わせる

整備の判断には、臨床的な知識とシステム的な知識の両方が必要です。単位の換算式や検出限界の扱いは検査技師でなければ判断できず、テーブル構造や更新頻度は情報システム部門でなければわかりません。どちらか一方だけで進めると、技術的には正しいが臨床的に無意味な変換や、その逆が生まれます。月1回、1時間程度の定例で判断待ち事項を消化する体制が現実的です。定例では、判断が必要な項目を10件から15件に絞って持ち込むと時間内に収まります。

すり合わせを効率化するには、判断が必要な論点をリスト化して持ち込む形が有効です。「この項目は3つの単位が混在しているが、どれに統一するか」「この定性表記の対応関係は正しいか」といった問いを、対象件数とともに提示します。曖昧な相談ではなく、選択肢と件数を示せば、1件あたり5分程度で結論が出ます。決定事項はその場で定義書へ反映し、次回までに関係者へ共有してください。議事録は判断内容と根拠だけを残す形式にすると、後から参照しやすい資料になります。

ツール選定の基準:自動化範囲と検証のしやすさで見極める

ツール選定では、機能の多さより検証のしやすさを優先します。検査データの整備は、変換結果が正しいかを人が確認する工程が必ず入るため、処理内容が読めることが重要な条件です。ブラックボックス的に処理を実行するツールは、結果に疑問が生じた際の原因追跡に時間がかかります。SQLやPythonのコードとして残る形式か、画面上で処理フローが可視化される形式を選んでください。試用期間では実際の検査データを1万行ほど流し込み、結果の検証にかかる時間を測っておくと判断しやすくなります。

手段

自動化の範囲

検証のしやすさ

適する規模

Excel・Power Query

定型的な変換と結合

操作手順が画面に残り追跡しやすい

数万行・ルール数十件まで

SQL(ビュー・ストアド)

大量データの一括変換

コードとして残り差分管理が容易

数百万行以上・定期実行あり

dbt・Talend・Alteryx

依存関係の管理と自動テスト

処理フローが可視化され検証が速い

複数ソース統合・月次以上の再実行

専用クレンジングツール

名寄せ・表記ゆれの補正

内部処理が見えにくい場合がある

名寄せが中心の用途

規模による使い分けも判断材料になります。数万行までで変換ルールが数十件であればExcelとPower Queryで十分に対応でき、初期費用がかからない点も利点です。数百万行を超え、定期的な再実行が必要になる段階からは、SQLベースの処理基盤やdbtのような変換管理ツールが適します。データ量よりも、再実行の頻度が月1回を超えるかどうかが分岐点です。年に1回だけの整備であれば、専用ツールを導入するより手作業と表計算で済ませたほうが総コストは低く収まります。

検査データのクレンジングでよくある失敗パターンと回避策

同じ失敗は多くの現場で繰り返されています。実際に起きやすい5つのパターンについて、何が起き、どの時点で気づけるか、どう回避するかを順に取り上げる構成です。着手前に一読しておけば、避けられる手戻りは少なくありません。

単位変換より先に統計処理を行い、桁の異なる値が混在する

この失敗は、平均値や中央値が想定と大きくずれた時点で初めて気づく例がほとんどです。クレアチニンをmg/dLとμmol/Lが混在したまま平均すると、値は実態の10倍以上に振れます。厄介なのは、値が極端に大きくなるわけではなく、一見それらしい数値に見えてしまう点です。異常に気づかないまま報告書に載り、指摘を受けて数か月分の作業をやり直す事態も起こります。値の桁数分布をヒストグラムで確認すると、混在の有無は数分で見分けられるはずです。

回避策は単純で、単位カラムのユニーク値を必ず先に確認する手順を組み込むことです。項目コードごとに単位の種類数を集計し、2種類以上ある項目を一覧化してください。この確認は数分で終わり、SQLならGROUP BYの1文で済みます。集計処理を実装する前に、単位が1種類へ統一されていることをテストとして自動化しておくと、再発を防げます。テストは変換処理の一部として組み込み、条件を満たさない場合は処理を止める設計にしておいてください。

「<0.1」などの表記を一括で数値化し、検出限界の情報が失われる

文字列を数値へ変換する処理で、変換できない値を一律にNULLや0へ落とす実装は珍しくありません。「<0.1」を0として扱えば、本来は検出限界未満という情報を持っていた行が、測定値0の行と区別がつかなくなるのです。感染症のウイルス量や腫瘍マーカーでは、この区別が臨床的な判断を左右する場面もあります。変換ログを見てもエラーではなく正常終了として処理されるため、発見が遅れがちです。変換時には、数値化できなかった値の一覧を必ずログへ書き出す実装にします。

回避策は、数値カラムと修飾子カラムを分離する設計にあります。「<0.1」であれば、修飾子カラムに不等号、数値カラムに0.1を格納し、元の文字列も原本カラムへ残す構成です。解析時には修飾子の有無を条件に含めることで、検出限界未満の扱いを目的に応じて変えられます。変換処理を実装する際は、数値化できなかった値の件数と実例を必ず出力し、目視で確認してください。実例を10件ほど眺めるだけで、想定していなかった表記が見つかることも多いものです。

基準範囲を院内共通と誤認し、施設間比較で誤った判定を招く

1つの施設だけを見ていると、基準範囲は固定値だと思い込みがちです。しかし外部委託先が複数ある場合、同じ項目でも委託先ごとに基準範囲が違う状況は普通に起こります。グループ病院や地域連携でデータを集約する際に各施設の判定フラグをそのまま集計すると、異常値の割合が施設間で不自然にばらつくのです。原因を測定精度の差と誤解し、機器の調査に工数を費やす例もあります。集約前に、施設ごとの基準範囲一覧を取り寄せて突き合わせる手順を入れておいてください。

回避策として、判定フラグは集約時にいったん破棄し、値と基準範囲から再計算する方針を採ってください。基準範囲が取得できない施設がある場合は、その施設のデータを判定対象から除外するか、共通の参照範囲を定めて全施設で再判定する方法を選びます。どちらを採るかは、比較の目的が施設内の推移か施設間の水準比較かで決まります。施設間比較を行うなら、共通範囲での再判定が前提です。共通範囲の設定根拠は集計定義書へ記載し、参照した文献や学会基準も併記しておきます。

名寄せを先行させ、表記ゆれのまま別患者として分離したまま残る

表記の正規化を行わずに名寄せを実行すると、一致度スコアが上がらず、同一人物が別患者のまま残ります。全角と半角のスペース、カタカナの長音記号とハイフン、旧字体と新字体といった差異は、編集距離では大きな違いとして計算されるためです。結果として、統合できたはずのペアが目視確認の対象にも上がってきません。数千人規模でも数十件の取りこぼしが生じ、経時追跡の分析結果に影響します。取りこぼしの規模は、正規化の前後で候補ペア数を比較すれば把握できるものです。

正規化は名寄せの前工程として必ず実施してください。氏名カナは全角カタカナへ統一し、長音とハイフンを1文字へ寄せ、スペースを除去した比較用カラムを別に作ります。住所は都道府県から番地までを正規化し、郵便番号は7桁のハイフンなしへ寄せた形です。比較用カラムは原本とは別に持ち、原本は一切変更しない構成にしておくと、正規化ルールの見直しにも対応できます。正規化ルールは、実データで見つかった表記ゆれを追加していく前提で運用してください。

一度きりの整備で終わり、日々の運用で再び不備が蓄積する

整備直後のデータ品質は高くても、半年から1年で元の状態へ戻る現象はよく見られます。新しい検査項目の追加、試薬の変更、外部委託先の切り替え、システム更新といった変化が継続的に発生するためです。整備をプロジェクトとして終わらせ、担当者が異動してしまうと、変化への対応が止まります。品質は放置すれば必ず劣化する前提で、運用の仕組みを同時に設計する必要があります。整備の完了はゴールではなく、運用開始の起点だと捉えるのが実態に合った見方です。

継続の仕組みとして、3つを最低限用意してください。1つ目は月次の品質チェックで、未対応の項目コード、単位の複数存在、欠損率の急変を自動で検出する仕組みです。2つ目は新規項目の登録手順で、項目を追加する際に標準コードと単位を必ず登録する運用を業務フローへ組み込みます。3つ目は責任者の明確化であり、部署ではなく個人名で決めておくと実効性が高まります。3つとも半日程度で仕組みを用意でき、月次の運用工数も1時間から2時間に収まるはずです。

検査データのクレンジングに取り組んだ事例

実際の取り組みでは、施設の規模や目的によって着手点が変わります。総合病院、診療所グループ、製薬および臨床研究機関という3つの例から、どこから手をつけ、どの程度の期間と工数で成果が出たかを見ていきます。

総合病院:複数部門システムの検査値を統合し経時比較を実現した例

600床規模の総合病院で、検査部門、生理検査部門、外部委託の3系統に分かれていた検査結果を統合した例です。着手時点で院内コードは3体系あり、同一項目に対する表記は最大5種類が存在していました。最初に取り組んだのは、直近3年間に実施件数が100件以上あった項目、およそ400項目への絞り込みです。全項目を対象にせず、使用頻度で優先順位をつけた点が期間短縮につながりました。残る項目は、依頼が発生した時点で個別に対応する方針です。

作業は、現状把握に1か月、ルール設計に1.5か月、変換実装と検証に3か月の計5.5か月で完了しています。体制は情報システム部門2名と検査技師1名の兼務で、投入工数は合計でおよそ4人月です。統合後は腎機能や肝機能の経時推移を10年分まとめて参照できるようになり、抽出依頼への対応時間も従来の3分の1へ短縮しています。次の段階として、生理検査の所見文の構造化に着手する計画です。所見文は自由記述が多く、頻出する定型表現の抽出から進めています。

診療所グループ:外部委託検査の項目コードを統一した例

20施設を運営する診療所グループで、委託先が3社に分かれていたことによる項目コードの不統一を解消した例です。院内に検査部門を持たないため対象は委託先から返却されるファイルに限られ、範囲の特定には苦労しませんでした。一方で返却レイアウトが3社それぞれ異なり、同じ項目でも小数点以下の桁数や単位表記が揃っていない状態です。グループ全体での健診結果の比較ができず、経営判断に使えない点が課題でした。健診結果の異常値率を施設別に比較したくても、集計の前提が揃わない状態が続いていました。

解決の中心は、委託先3社のコードをJLAC10へ寄せる対応表の作成にあります。対象は健診で使用する80項目に絞り込んだうえで、1項目あたり15分程度の確認作業を2週間で終えた計算です。取り込み処理は、各社のファイルを読み込んで標準形式へ変換する共通スクリプトへ統一しています。委託先を追加する場合も、対応表に1列足すだけで済む構成になりました。運用開始後は、月次の取り込み作業を半日から1時間程度へ短縮した状態です。

製薬・臨床研究機関:多施設由来のデータを解析用に整えた例

12施設から収集した検査データを、多施設共同研究の解析用に整えた例です。施設ごとに測定法と基準範囲が異なり、そのままでは同一項目としての比較ができません。方針として、値は標準単位へ換算したうえで原単位の値も保持し、基準範囲は施設ごとの値を各行へ付与する構成です。判定は解析時に共通基準で再計算する設計としました。施設ごとの測定法と基準範囲は、データ受領時のチェックリストで必ず取得する運用です。取得できない施設については、解析対象から外すか感度分析で影響を確認する方針としました。

データはSDTMのLBドメイン形式へ変換し、標準単位の値、原単位の値、単位、基準範囲下限、基準範囲上限を並べて保持しています。変換履歴は施設別に管理し、どの行がどのルールで換算されたかを追跡できる状態です。検証では施設ごとの分布を箱ひげ図で比較し、明らかに水準が異なる施設について測定法を再確認しました。この工程で2施設の測定法の記録誤りが判明し、解析前に修正できています。品質確認にかけた期間は約3週間で、解析全体の工程から見れば1割前後の工数です。

まとめ:検査データのクレンジングは標準化を起点に段階的に進める

検査データの整備は、項目コードと単位の統一という標準化から着手するのが最短の道です。ここまでに取り上げた内容を、着手時の判断材料として要点を絞って振り返ります。

取り組みの順序は、現状把握、ルール設計、変換と正規化、重複排除、検証と記録の5段階です。この順序を守るだけで手戻りの大半は避けられますので、とくに単位変換を統計処理より先に行う点は徹底してください。範囲は使用頻度の高い項目から絞り込み、全項目を対象にしない判断が期間短縮につながります。整備後の品質維持まで含めて設計すれば、投資は継続的な効果として返ってきます。

  • 対象データの範囲と責任部署を1枚の表へ整理できているか
  • 項目コードと単位の組み合わせを全件集計し、複数単位の項目を洗い出したか
  • 欠損と対象外を区別する状態コードを定義したか
  • 原本テーブルを読み取り専用とし、変換履歴を別レイヤーで保持する設計になっているか
  • 月次の品質チェックと新規項目の登録手順を運用へ組み込んだか

「これから検査データに関する取り組みを実施したいけれど、何から手をつけたらいいかわからない」「データ専門家の知見を取り入れたい」という方は、データ領域の実績豊富な弊社、データビズラボにお気軽にご相談ください。

貴社の課題や状況に合わせて、検査データ活用や、クレンジングの進め方をご提案させていただきます。

データビズラボの実績無料相談・お見積り

このブログについて

データビズラボが運営する、データの価値を最大化するためのナレッジ共有メディアです。
戦略策定から具体的な分析手法、ツールの活用術まで、データの現場で培われた実践的な取り組みから
得られた知見や気づきを発信しています。

データのことなら、
まずはお気軽にご相談ください。

データ活用に、万能の正解はありません。
貴社の業界特性や課題に合わせて、最適な進め方を一緒に設計します。