レセプトデータのクレンジングとは?手順と精度を高めるポイント

レセプトデータのクレンジングとは?手順と精度を高めるポイント

レセプトデータは、医療費の請求根拠として作成された事務データであり、分析のために設計されたものではないことが一般的です。診療報酬制度に沿った独自のルールで記録されているため、そのまま集計すると有病率や医療費の実態から離れた数値が出てしまいます。分析に使うには、請求用の記録を分析用の形式へ変換する整備を進めます。

集計がずれる原因は、レセプト特有の記録ルールにあります。同月内の複数受診が1枚にまとまっていたり、疑い病名が確定病名と区別されずに残っていたりと、請求上は正しくても分析上は不備となる項目が多いのです。この特性を知らずに件数や病名を数えると、実態より過大な結果になるのが典型的な失敗です。

本記事では、レセプトデータのクレンジングについて、不備が生じやすい項目、7つの実施手順、精度を高める観点、現場で頻発する失敗パターンまでを順に解説します。手元のレセプトの種別と保有期間を思い浮かべながら読み進めてください。

目次

レセプトデータのクレンジングとは

クレンジングの手順に入る前に、対象となるデータがどのような性質を持つのかを押さえておく必要があります。ここでは種別ごとの構成、クレンジングが求められるようになった背景、そして一般的な業務データのクレンジングとの相違点を順に確認していきます。

レセプトデータの構成:医科・歯科・調剤・DPCで異なる項目

レセプトは診療報酬を請求するための明細書で、医科・歯科・調剤・DPCの4種類に大別されます。電子データとしてはレセプト電算処理システムの規約に沿ったCSV形式で授受され、行の先頭に置かれたレコード識別情報によって、その行が何を表すのかが決まります。医科レセプトであれば医療機関情報はIR、レセプト共通情報はRE、傷病名はSY、診療行為はSI、医薬品はIY、特定器材はTOという具合です。1件のレセプトが複数行にまたがる可変長構造をとるため、表計算ソフトで開いても列の意味が揃わない点が、最初のつまずきになります。

実務上の大きな落とし穴は、種別ごとに存在する項目が異なる点にあります。調剤レセプトには傷病名が入らないため、薬剤から疾患を推定する場合は医科レセプトとの連結が前提となるのです。DPCの場合は出来高部分と包括部分が分かれ、様式1・EFファイル・Dファイルといった複数ファイルの組み合わせで初めて診療内容が復元できます。分析要件を決める前に、手元にあるファイルが4種別のどれをどこまで含むのかを棚卸ししましょう。

種別

主に含まれる情報

傷病名の記載

分析時の注意点

医科

診療行為、医薬品、特定器材、傷病名

あり

入院と外来で点数構造が異なるため分けて集計する

歯科

歯式、歯科固有の診療行為、傷病名

あり

部位情報が独自形式のため医科と同じ処理では扱えない

調剤

調剤行為、医薬品、処方元医療機関

なし

疾患との紐付けには医科レセプトとの連結が必要になる

DPC

包括部分の診断群分類、出来高部分の明細

あり

様式1やEFファイルと組み合わせないと内容を復元できない

クレンジングが必要とされる背景

保険者が保有するレセプトデータは、もともと審査支払機関を経由した請求事務の産物です。医療費を支払うために必要な情報は揃っていますが、疾病の実態を分析するための整合性までは保証されていません。例えば同一人物が転職や扶養異動を経ると記号番号が変わり、同じ人のはずが別人として集計されてしまうのです。データヘルス計画の策定とPDCAの運用が保険者に求められる中で、この事務データを分析データへ変換する工程が避けて通れなくなりました。

医療DXの進展によってオンライン資格確認や電子処方箋の基盤が整い、扱えるデータの幅は広がっています。ただし基盤が整うことと、分析に耐える形に整うことは別の話です。加入者1万人規模の健康保険組合では月におよそ8,000件から12,000件のレセプトが発生し、年間では10万件前後の明細を扱う計算になります。この規模を目視で確認するのは非現実的なため、ルールベースの自動処理として設計する必要があります。

医療DXとは?具体的な施策や成功のポイント、医療DX令和ビジョン2030を解説

一般的なデータクレンジングとの違い

顧客データや売上データのクレンジングとの大きな違いは、値の正しさを判定する外部基準が制度側に存在する点です。診療行為コードや医薬品コードは国が定めるマスターに紐づいており、いわば正解表が公開されているのです。一方でレセプトに記載された傷病名は請求の妥当性を担保するために付けられたものであり、患者の実際の疾患と一対一で対応するとは限りません。この「制度上は正しいが臨床実態とはずれる」という二重性こそが、レセプトデータのクレンジングを難しくしています。

処理の順序に対する制約が強い点も特徴です。一般的なクレンジングでは、重複排除を先に行っても大きな問題は起きません。しかしレセプトでは改定時点の異なるコードが混在するため、標準化を済ませないと同一とみなすべき明細を別物と判定してしまいます。工数の面でも差があり、初回の基盤構築には2〜3か月、その後の月次運用でも2〜4人日程度を見込むのが現実的な水準です。汎用的なクレンジングの考え方は下記の記事に整理されていますので、基礎を押さえたうえで読み進めていただくと理解が早まります。

データクレンジングとは?意味と代表手法を解説!

比較軸

一般的なデータクレンジング

レセプトデータのクレンジング

正解の基準

自社の業務ルールで定義する

国が定める公的マスターが基準になる

主な突合キー

顧客IDやメールアドレス

保険者番号・記号・番号・枝番の組み合わせ

時点管理

必須ではない場合が多い

改定時点ごとのマスター保持が前提となる

個人情報の扱い

個人情報として管理する

要配慮個人情報として厳格な安全管理を要する

検証の担い手

業務部門の担当者

医療事務や保健師など医療の実務知見を持つ人材

レセプトデータで不備が生じやすい項目

不備はデータ全体に均等に分布するのではなく、特定の項目に集中して現れます。どこに問題が出やすいのかを先に把握しておけば、限られた工数をどこへ投入すべきかを絞り込めるのです。ここでは傷病名・被保険者情報・各種コード・請求月・表記ゆれという5つの観点から、現場で頻出する不備を順に見ていきます。

傷病名:疑い病名と転帰未記載による判定のずれ

レセプトの傷病名には、確定した病名だけでなく、検査を実施するために付けられた疑い病名が含まれます。糖尿病の検査を行うために「2型糖尿病の疑い」と記載する運用は珍しくなく、傷病名全体に占める疑いの割合が2割から3割に達することもあります。レセ電のSYレコードには疑いを示す修飾語コードが付与されるため、機械的な除外そのものは可能です。ここを見落としたまま集計すると、有病率が実態の1.5倍以上に膨らむ事態も起こります。

転帰の未記載も判定を狂わせる要因です。転帰区分は治ゆ・死亡・中止・継続のいずれかで表されますが、継続扱いのまま放置された傷病名が翌月以降も引き継がれる例が多く見られます。実務では「同一傷病名が6か月以上連続し、かつ関連する診療行為が3か月以上ない場合は終了とみなす」といった判定ルールを置いて対処するのが定石です。閾値は疾患群ごとに変える必要があるため、慢性疾患と急性疾患で別々に設計してください。実務上は件数の多い上位20傷病名から順にルールを作り込むと、投じた工数に対する効果が高くなります。

被保険者情報:資格異動・記号番号の変更による追跡の断絶

被保険者を一意に識別する項目は、保険者番号・記号・番号・枝番の組み合わせです。ところがこの組み合わせは資格異動のたびに変わり、同一人物であっても転職や被扶養者からの切り替えで別のキーになってしまいます。オンライン資格確認の運用開始に伴って個人単位の枝番が付与されるようになりましたが、それ以前の履歴データには枝番が存在しないのです。過去5年分を通した分析を行うなら、枝番の有無が混在する前提で設計する必要があります。

現場でよくあるつまずきは、記号番号だけで名寄せしてしまい、資格喪失者が分析対象から静かに消える点にあります。年度をまたぐ継続率を見るときは、資格取得日と資格喪失日を必ず保持し、分母を「その期間に資格を有していた人」に限定してください。氏名カナ・生年月日・性別を組み合わせたキーを併用すると、記号番号の変更をまたいだ追跡が可能になります。実運用ではこの組み合わせで95%前後が自動で一致し、残りは目視や別キーでの補完に回すのが一般的です。

各種コード:診療報酬改定に伴うマスター更新の影響

診療報酬は原則として2年ごとに改定され、薬価についてはより短い周期で見直しが入ります。改定のたびに診療行為コードや医薬品コードは追加・廃止・置換が発生するため、同じ薬剤でも年度が違えばコードが異なる場合があります。過去5年分を横断して集計する際に最新マスターだけを当てると、廃止済みコードが未定義として弾かれ、集計対象から丸ごと抜け落ちてしまうのです。医薬品であればYJコードや一般名コードといった上位の識別子に寄せておくと、改定をまたいだ集計が安定します。

対処の基本は、改定時点ごとのマスターをすべて保持し、コード間の変換テーブルを自前で持つことです。公開されている基本マスターは改定のたびに更新版が提供されるため、取得した年月をファイル名に含めて世代管理する運用を最初に決めておきます。管理体制が整っていない組織では、担当者ごとに手元のコード表が異なり、同じ指標を出したはずなのに集計値が合わない事態がしばしば起こります。マスターデータを一元管理する考え方は下記の記事にまとまっていますので、体制づくりの検討時に確認してみてください。

マスタデータ管理(MDM)とは?適切に運用する重要性とその手法を解説

請求月のずれ:月遅れ請求・返戻・再請求による重複計上

レセプトには診療が行われた診療年月と、保険者が受け付けた請求年月という2つの時点が存在します。医療機関の事情で請求が遅れる月遅れ請求や、記載不備で差し戻される返戻と再請求が発生すると、この2つは容易に数か月ずれるのです。集計軸をどちらに置くかを決めないまま作業を進めると、同一の診療が異なる月に二重で計上されてしまいます。医療費の推移を見る目的なら診療年月、財政の収支を見る目的なら請求年月というように、目的から軸を決めるのが原則です。

遅れの実態を把握しておくと、締めのタイミングを判断できます。診療月ベースで見た場合、当該月の請求が出そろうまでには3か月から6か月を要するケースが多く、直近3か月分の数値は確定値として扱えません。月次レポートで直近月を含めると前月比が毎回下振れするため、確報は3か月前まで、直近は速報値として区別する運用が扱いやすい形です。返戻と再請求のレコードには元レセプトとの対応関係が残るので、突合して差し引く処理を必ず組み込んでください。

表記ゆれ:医療機関名・医薬品名・単位の不統一

コード化されていない自由記載の項目には、必ず表記ゆれが混入します。医療機関名は法人格の有無や全角半角の差で複数の表記が生まれ、そのまま集計すると同じ施設が別施設として並びます。医薬品名も先発品名・後発品名・一般名が混在し、剤形や規格の書き方まで揺れるのが実情です。単位についてもmgとミリグラム、錠と丁のように表記が分かれ、数量の合計が正しく取れなくなります。旧字体と新字体の混在は目視で気付きにくく、集計後に施設数が想定より多いと感じた段階で初めて発覚する例も目立ちます。

対処は正規化ルールの明文化から始めるのが基本です。全角半角の統一、法人格を表す文字列の除去、空白と記号の削除といった前処理を順番に適用し、それでも残る差異は変換辞書で吸収する方法が確実です。医療機関については医療機関コードが付与されているレコードを優先し、コードのないものだけを名称マッチングの対象にすると作業量を大きく減らせます。目安として、1,000施設規模のリストでも辞書の初期整備に3〜5人日、以降は月あたり1時間程度のメンテナンスで維持できます。

  • 全角と半角の混在を全角に統一する
  • 医療法人・社団・財団といった法人格の文字列を除去する
  • 空白・中黒・括弧などの記号を削除する
  • 旧字体と新字体を新字体側に寄せる
  • 変換後も一致しないレコードだけを目視確認のキューに回す

レセプトデータのクレンジングで解決できること

クレンジングは手段であって目的ではありません。工数をかける以上、その先にどのような成果が生まれるのかを説明できる状態にしておきたいところです。ここでは対象者抽出、他データとの突合、効果測定、比較可能性という4つの切り口で、投資に見合う効果を整理します。

保健事業における対象者抽出の精度向上

保健事業の成否は、対象者を正しく絞り込めるかどうかで決まります。糖尿病性腎症の重症化予防を例に取ると、抽出条件には傷病名・検査値・処方内容・受診状況が絡み、どれか1つでも不備があれば対象者リストは実態からずれるのです。クレンジングを経ていないデータで抽出すると、疑いの病名が混入して本来対象外の加入者が3割前後紛れ込む事態も起こり得ます。声がけの工数は1人あたり15分から30分かかるため、精度の低い抽出リストは現場の負荷に直結します。

抽出条件は、必ず判定ロジックを文書化したうえでレビューにかけてください。「HbA1cが6.5%以上」といった医学的な条件と、データ側の条件を分けて記述する形が有効です。「疑いの病名を除外する」「直近12か月に3回以上の受診がある」といった条件を切り出すと、保健師と分析担当の役割分担が明確になります。抽出結果は件数だけでなく年齢構成や性別構成も併せて確認し、前回抽出との差分が2割を超える場合は条件かデータのどちらかに変更があったと考えるのが妥当です。

健診データ・介護データとの突合による分析範囲の拡大

レセプトデータ単体では、検査値や生活習慣の情報までは取得できません。特定健診の結果と突合すると、受診行動と検査値の推移を同じ人単位で追えるようになり、分析の幅が一気に広がります。介護保険の給付データまで連結できれば、医療から介護への移行を時系列で捉えられるようになるのです。国民健康保険や後期高齢者医療の保険者であれば、国保データベースの仕組みを通じて三者が結び付いた形で参照できます。医療と介護をまたいだ分析は、地域包括ケアの検討材料としても使い勝手がよいものです。

突合の実務でつまずきやすいのは、キーの粒度と対象範囲の差です。健診は年度単位、レセプトは月単位で発生するため、突合する前にどちらかの粒度へ揃える設計が要ります。健診の対象年齢が限られる一方でレセプトは全年齢で発生するので、突合率を分母の取り方で調整しないと数字の意味が変わってしまうのです。データ統合の一般的な進め方は下記の記事が参考になりますので、設計の初期段階で目を通しておくと手戻りを避けられます。

データ統合とは?統合の目的や初心者向けの進め方を解説

医療費適正化施策の効果測定の信頼性確保

後発医薬品の使用促進や重複投薬の是正といった施策は、実施前後の医療費で効果を測ります。ここで前提となるのが、比較する2つの期間のデータが同じルールで整えられていることです。片方だけ月遅れの請求を含んでいたり、コードの変換基準が違ったりすると、施策の効果と処理の差を区別できなくなります。効果額を算出する際は、対象者数・1人あたり単価・利用率の3つに分解し、どの要素が動いたのかを示すと説明力が上がります。

測定の信頼性を担保するには、対照群の設計まで踏み込むことが必要です。施策の対象者だけを見ると、もともと医療費が高い層が自然に平均へ戻る現象と効果を取り違えやすくなるためです。年齢・性別・前年度医療費階層を揃えた対照群を用意し、両群の差分で評価する方法が実務的な落としどころになります。対照群を作れない場合でも、全体平均の推移を並記して効果の上限と下限を示すと、報告先の納得を得やすくなるでしょう。評価の設計は分析に着手する前に固めておくと、後から条件を変えたのではないかという疑念を招きません。

経年比較・保険者間比較に耐えるデータ基盤の整備

同じ組織の中でも、担当者が代わると集計方法が変わってしまう例は少なくありません。前任者がどのレコードを除外していたのかがわからず、昨年度の数値を再現できない状況は珍しくないのです。処理内容をコードとして残し、入力データと出力データの件数を毎回記録しておけば、数値の説明責任を果たせます。保険者間で比較する場合はさらに条件が厳しく、除外ルールや期間の取り方まで揃っていなければ、順位の議論は成立しません。

比較可能性の担保には、最低限そろえておきたい観点があるのです。データの品質を評価する枠組みを使って、完全性・一意性・正確性・適時性といった軸で自組織の状態を点検すると、どこから手を入れるべきかが見えてきます。点検は年に1回、データヘルス計画の見直し時期に合わせて実施するのが現実的な頻度です。点検結果を前年のものと並べて残しておくと、改善しているかどうかを自組織で確認できます。品質評価の具体的な項目は下記の記事に整理されていますので、点検表を作る際の下敷きにしてください。

データ品質とは?品質評価項目や品質を向上させるための実務的対策を解説

レセプトデータのクレンジングの進め方

クレンジングは7つの工程に分解すると管理しやすくなります。工程ごとに成果物と完了条件を決めておけば、どこまで進んだのかを関係者と共有でき、途中での方針変更にも耐えられる構成です。全体像を先に示したうえで、各工程の具体的な作業内容と判断基準を順に説明していきます。

工程

主な作業内容

初回構築時の目安工数

STEP1 要件定義

分析目的の言語化、対象期間と粒度の確定

3〜5人日

STEP2 形式変換

レセ電CSVの展開、項目マッピング表の作成

5〜10人日

STEP3 標準化

コード・単位・日付・文字列の統一

5〜10人日

STEP4 欠損と異常値

欠損区分の整理、異常値の検出と退避

3〜5人日

STEP5 名寄せ

個人IDの再構築、在籍期間テーブルの作成

5〜10人日

STEP6 重複排除

完全重複と実質重複の判定、採用ルールの適用

3〜5人日

STEP7 検証と記録

件数と金額の突合、処理ログと定義書の整備

3〜5人日

STEP1:分析目的とデータ要件の定義

最初に決めるのは、何を明らかにしたいのかという分析目的です。「重症化予防の対象者を抽出する」のか「医療費の構造を把握する」のかで、必要なレコード種別も保有期間も変わります。目的が曖昧なままデータを集めると、後工程でどこまで整えれば十分なのかを判断できなくなり、作業が延々と続いてしまうのです。目的を1文で書き切れない状態であれば、まだデータに触れるべき段階ではありません。クレンジングの終わりは、データがきれいになった時ではなく、目的に照らして十分と判断できた時に訪れます。

要件定義では、対象期間・対象者・粒度・許容する欠損の程度を1枚の資料に落とし込んでおくと、後工程の判断が速くなるのです。特に対象期間と粒度は、後から変更すると全工程のやり直しにつながるため、着手前に関係者の合意を取ってください。合意した内容は口頭ではなく文書に残し、変更が生じた際は日付とともに追記する運用が安全です。合意形成には関係者3〜5名で1〜2時間の打ち合わせを2回程度見込んでおきます。実務では下記の観点を埋める形で進めると、抜け漏れを防げます。

  • 分析の目的と、その結果をもとに実施する意思決定
  • 対象期間(診療年月と請求年月のどちらを軸にするか、何年分か)
  • 対象者の範囲(資格要件、年齢、被保険者と被扶養者の扱い)
  • 集計粒度(個人単位・世帯単位・医療機関単位)
  • 許容できる欠損率と、欠損が生じた場合の代替手段

STEP2:形式変換と項目マッピング

レセ電のCSVは可変長のレコード構造をとるため、そのままでは分析ツールに読み込めません。RE行を1件の親レコードとし、SY・SI・IY・TOの各行を子レコードとして展開する縦持ちのテーブルに変換する作業が最初の山場になります。Pythonであればレコード識別子ごとに行を振り分けて別々のデータフレームに格納し、レセプト番号をキーに再結合する実装が扱いやすい形です。件数が数十万行規模までならローカル環境で処理でき、それを超える場合はデータベースへの投入を検討します。

項目マッピングでは、元の項目名と変換後の項目名、変換ルールを1対1で記述した対応表を作ります。ここを省略すると半年後に自分でも読み解けなくなるため、列数が100を超えるようなケースでは特に手を抜かないでください。ツール選定の判断基準は明快で、月次のルーチンとして繰り返すならコードで再現できる形式、単発の調査ならExcelのPower Queryでも十分です。ただしPower Queryは数十万行を超えたあたりから動作が重くなるので、その水準を境に切り替えるのが現実的でしょう。

STEP3:コード・単位・日付表記の標準化

標準化の対象は、コード・単位・日付・文字列の4つに整理できます。コードは改定時点のマスターを当てて名称を付与し、廃止コードには後継コードへの変換を適用します。日付は和暦と西暦が混在しやすいため、8桁の西暦表記に統一したうえで日付型へ変換し、不正な値を検出する手順を挟むと安全です。換算表は薬効分類ごとに整理しておくと、後から品目を追加する際も探しやすくなります。単位は薬剤の数量計算に直結するので、mgとgのように換算が必要なものは変換係数を明示した表を用意してください。

標準化で見落としやすいのが、コードの桁数と型の扱いです。保険者番号や医療機関コードは先頭がゼロで始まる場合があり、表計算ソフトで開いた瞬間に数値型と解釈されてゼロが落ちる事故が頻発します。CSVを読み込む際は該当列を文字列型として明示的に指定し、読み込み後に桁数の分布を確認する習慣をつけると防げます。桁数が想定と異なるレコードが全体の0.1%でも出た場合は、原因を特定するまで先に進まないでください。

STEP4:欠損値・異常値の検出と処理方針の決定

欠損には、制度上あり得ない欠損と、仕様として発生する欠損の2種類があります。前者は生年月日や保険者番号のようにレセプトの成立に必須の項目が空になっているケースで、原因を追わずに埋めるのは禁物です。後者は調剤レセプトの傷病名のように、そもそも存在しない項目が空欄として現れるケースで、これを欠損と数えると欠損率の解釈を誤ります。両者を区別するために、項目ごとに「必須・任意・種別により不在」の区分を持たせた一覧を先に作ります。

異常値の検出では、分布を見る方法と制度上の上限を当てる方法の併用が基本です。1件あたりの点数や投与日数のように分布が大きく歪む項目では、平均と標準偏差よりも四分位範囲を使った判定のほうが安定します。ただし高額なレセプトは実在するため、統計的な外れ値をそのまま除外してはいけません。除外ではなく別テーブルに退避し、上位1%の明細は内容を確認したうえで扱いを決めるのが安全な進め方です。分布の把握には箱ひげ図が扱いやすいので、下記の記事も参考にしてみてください。

箱ひげ図とは?外れ値の見方やExcelでの作成方法まで徹底解説

STEP5:個人単位での名寄せと期間の連結

名寄せの目的は、資格異動をまたいで同一人物を追跡できるようにすることです。健康保険組合であれば加入者名簿と突合し、記号番号の変更履歴から個人IDを再構築する方法が最も確実になります。名簿が使えない場合は、氏名カナ・生年月日・性別を連結した文字列のハッシュ値をキーとして用いる方法が一般的です。同姓同名かつ同一生年月日の衝突は1万人規模でも数件程度発生するため、住所や事業所コードを補助キーに加えて確認します。

期間の連結では、資格取得日と資格喪失日から在籍期間を復元し、月ごとの在籍フラグを持つテーブルを作ります。このテーブルがあると分母を正確に取れるようになり、受診率や継続率の計算が安定するのです。精度は感覚ではなく数値で確認してください。処理前後の人数、複数キーに紐づいた人数、どのキーとも一致しなかった件数の3つを記録しておくと、後から精度を説明できます。名寄せの基本的な考え方は下記の記事にまとまっています。

名寄せとは?正確な顧客データ管理の方法と活用ポイントを徹底解説

STEP6:重複レセプトの判定と排除

重複には、完全重複と実質重複の2つがあります。完全重複は同じファイルを二重に取り込んだ場合などに発生し、全項目が一致するので検出は容易です。厄介なのは実質重複で、返戻後の再請求や請求の遅れにより、同じ診療が別のレセプト番号で再度上がってくるパターンになります。判定には医療機関コード・診療年月・被保険者キー・診療実日数・合計点数の組み合わせを用い、一致した組を候補として抽出する方法が実務的です。候補の件数は全体の1%前後に収まるのが通常で、これを大きく超えるようなら判定キーの設計そのものを疑います。

候補が出たら、どちらを残すかの判断基準を決めておきます。原則は請求年月が新しいレコードを採用し、古い方を無効として扱う方式が扱いやすい形です。ただし返戻のレコードには元レセプトを特定する情報が付くため、その情報が使える場合はそちらを優先してください。排除した件数は必ず記録し、全体の何%が重複だったのかを月ごとに追うと、取り込み手順の不具合を早期に発見できます。目安として重複率が1%を超える月が続く場合は、データ受領の手順そのものを見直したほうがよいでしょう。

STEP7:検証と処理内容の記録

検証は、件数・金額・分布の3つの観点で行います。工程の入口と出口でレセプト件数と合計点数を突き合わせ、意図した増減以外の変化がないかを確認するのが基本の作業です。金額は保険者の財政報告や審査支払機関からの通知と照合すると、外部基準での検算ができます。分布については年齢階層別の件数構成や上位疾患の順位を前年度と比較し、大きく順位が入れ替わっている項目があれば処理を疑ってください。確認結果は毎回同じ書式で記録しておくと、前月との比較が容易になります。

処理内容の記録は、後任者のためだけでなく自分自身のために残すものです。どの項目にどのルールを適用し、どのレコードをなぜ除外したのかをデータ定義書として文書化しておくと、数値に疑義が生じた際の説明が容易になります。記録すべき最小限の項目は、処理日・入力件数・出力件数・適用ルールのバージョン・除外理由別件数の5つです。この5項目をログとして自動出力する仕組みを組み込んでおけば、月次運用の負荷はほとんど増えません。

レセプトデータのクレンジング精度を高めるポイント

同じ手順を踏んでも、いくつかの勘所を押さえているかどうかで結果の質は大きく変わります。ここでは工程の順序、マスターの世代管理、ルールの文書化、現場知見の活用、個人情報の設計という5つの観点を取り上げます。いずれも後から追加するより、設計段階で織り込むほうがはるかに安価に実現できる項目です。

標準化を名寄せより先に実施する

工程の順序を誤ると、後戻りの規模が一気に大きくなります。表記ゆれやコードの不統一を残したまま個人の突合を行うと、同一人物であるはずのレコードが別々のキーに割り振られ、統合されないまま処理が進んでしまうのです。標準化を先に済ませておけば、キーの一致率は目に見えて改善します。実際、氏名カナの全角半角統一と旧字体の変換を先に行うだけで、一致率が数ポイント上がる例は珍しくありません。順序の誤りは処理が一通り終わってから発覚することが多く、修正には数日単位の手戻りが生じるものです。

順序の判断基準はシンプルで、キーとして使う項目に触れる処理をすべて突合より前に置くことです。逆に、集計値の丸めや指標の算出のようにキーへ影響しない処理は後段でも問題ありません。工程を図にして、どの処理がどの項目を書き換えるのかを矢印で示しておくと、順序の誤りを設計段階で発見できるのです。図はホワイトボードに描いたもので構いませんので、写真に撮って定義書に添付しておきます。既存の処理を引き継いだ場合は、この図を最初に描き起こす作業から始めてください。

改定時点ごとのマスターを保持し可逆的に変換する

マスターは上書きせず、取得時点ごとに世代を分けて保管します。ディレクトリ名やテーブル名に適用開始年月を含める運用にしておくと、どの時点のマスターを当てたのかが一目でわかる状態を保てるのです。世代管理を怠ると、どの時点のマスターで変換したのかを特定するだけで半日を要することもあります。変換の際は元のコードを別列として必ず残し、変換後のコードと並べて保持してください。この形にしておけば、変換ルールを見直したくなったときに元データへ戻らずに再変換できます。

可逆性を確保する具体的な方法は、変換履歴テーブルを持つことです。元コード・変換後コード・適用マスター年月・変換理由の4列を持つテーブルを作り、変換のたびに1行追加する設計にします。運用の負荷は月あたり数十分程度で済みますが、改定をまたいだ比較を求められた際の効果は大きいものです。逆にこの履歴がないと、過去の集計を再現するために元ファイルから作り直す羽目になり、数日単位の手戻りが発生します。履歴テーブルは分析用のテーブルとは別の場所に置き、参照専用の権限で共有すると安全です。

除外・補完のルールを定義書として残す

除外と補完は、分析結果を左右する最も主観の入りやすい工程です。「1件あたり100万点を超える明細を除く」「投与日数が空欄の場合は処方日数で代替する」といった判断は、担当者の裁量で決まってしまいがちになります。ルールを文書化しないまま運用すると、翌年度に別の担当者が別の基準を適用し、経年比較が成立しなくなるのです。判断そのものを禁じる必要はなく、判断した内容を残せば十分に運用できます。むしろ判断の痕跡が残っていれば、後から基準を見直す作業も容易になります。

定義書に書くべき内容は、ルールの本文だけでは足りないのです。なぜそのルールを置いたのかという根拠と、適用した結果として何件が影響を受けたのかまで記載してはじめて、第三者が妥当性を検証できる状態になります。作成にかかる時間は初回で半日程度、以降の更新は1件あたり数分で済みます。書式は表形式で構いませんので、下記の項目を列として持たせてください。四半期に一度は見直し、実態と合わなくなったルールを更新する運用が理想的です。

  • ルールIDと適用対象の項目名
  • 判定条件(閾値や条件式を具体的な値で記述する)
  • 除外か補完かの区分と、補完する場合の代替値
  • そのルールを置いた根拠と参照した資料
  • 適用件数と、全体に占める割合
  • 最終更新日と更新者

医療事務・保健師の知見を検証工程に組み込む

データだけを見ていても、値の妥当性を判断しきれない場面が必ず出てきます。特定の診療行為が特定の傷病名と組み合わされる理由や、ある月だけ請求が集中する背景は、現場の運用を知る人にしか説明できないためです。医療事務の経験者であれば、レセプトの記載ルールから逆算して不自然なパターンを指摘できます。保健師であれば、抽出された対象者リストを見て「この人が入るのはおかしい」という違和感を言語化できるでしょう。

組み込み方は、検証工程に30分程度のレビューを挟む形で十分です。分析担当が集計結果と異常候補の上位を一覧で提示し、現場側が違和感のある行を指摘するという進め方が回りやすくなります。指摘は必ず記録し、対応したものと保留したものを分けて管理してください。この往復を2、3回繰り返すと、ルールの粗い部分がおおむね洗い出せます。参加者を3名以内に絞ると、議論が発散せずに済みます。初回構築時は週1回、運用が安定してからは月1回の頻度が現実的な水準です。

個人情報の取り扱い:匿名化のタイミングと安全管理の設計

レセプトデータは、要配慮個人情報を含む極めて機微なデータです。分析目的で利用するにあたっては、どの時点で識別性を落とすかを設計段階で決めておく必要があります。個人の突合には識別子が必要なため、その工程を完了させた後に個人IDを不可逆なハッシュ値へ置き換え、氏名や住所を削除する順序が現実的な設計になるのです。加工の程度によって匿名加工情報に該当するかどうかが変わるため、法務や委託先と認識を合わせたうえで進めてください。

安全管理の設計では、技術面と運用面の両方を押さえます。技術面では、作業環境をインターネットから分離し、アクセス権限を担当者単位で付与し、操作ログを取得する構成が基本になります。運用面では、持ち出しの禁止範囲、外部委託時の契約条項、保管期間と廃棄手順を文書で定めておくことが求められるのです。外部へ委託する場合は、再委託の可否と監査の権限を契約書に明記しておきます。匿名化の手法や関連する制度上の位置づけは下記の記事が詳しいので、設計前に確認しておくと判断を誤りません。

匿名化とは?匿名加工情報との関係や仮名化・秘匿化との違い、各手法の活用目的

レセプトデータのクレンジングでよくある失敗パターン

失敗の多くは高度な技術の不足ではなく、前提の置き方や運用の詰めの甘さから生じます。他組織がつまずいた箇所を先に知っておけば、同じ轍を踏まずに済むのです。ここでは実際に起こりやすい5つのパターンについて、症状の見分け方と回避策をあわせて示します。

疑い病名を確定病名として集計し有病率を過大に見積もる

最も頻度が高い失敗が、傷病名をそのまま疾患として数えてしまうケースです。健診の有所見率と比べて明らかに高い有病率が出た場合は、疑いを示す病名の混入をまず疑ってください。除外処理を入れる前後で、糖尿病の該当者数が3割以上変動する例も報告されています。数値が動く幅が大きいだけに、除外の有無は必ず報告書へ明記する必要があるのです。有病率を対外的に公表する場面では、この差がそのまま報告全体の信頼性への評価につながります。

回避策は、傷病名の採用条件を明文化することに尽きるのです。疑いを示すコードの除外に加えて、いくつかの条件を組み合わせると確からしさが上がります。「同一傷病名が2か月以上継続している」「関連する検査または投薬が実施されている」といった条件が代表的です。条件を厳しくすれば見逃しが増え、緩めれば過大評価につながるため、目的に応じて設定を変えてください。重症化予防の対象者抽出なら見逃しを避ける方向、有病率の公表なら過大評価を避ける方向が妥当な判断です。

最新マスターのみで過去分を変換し履歴が欠落する

5年分のデータを一括で処理する際に、手元にある最新のマスターだけを当ててしまう失敗はよく起こります。廃止されたコードは名称が付かないまま不明として集計され、古い年度ほど不明の比率が高いという不自然な結果が現れるのです。この状態に気付かず時系列グラフを作ると、実際には変化していない項目が減少傾向に見えてしまいます。気付くための目安として、年度別の不明コード比率を必ず出力しておくと安全です。不明の比率が年度間で2倍以上に開いていれば、マスターの当て方を疑う十分な根拠になります。

対処は改定時点ごとのマスターを当てる方式へ切り替えることですが、既に処理を進めた後で気付く場合も少なくないのです。その際は元データが保全されているかどうかが分かれ目になり、上書きしていなければ再処理で済みます。再処理の工数は5年分・10万件規模でおおむね1〜2人日が目安です。逆に元データを上書きしていた場合は、審査支払機関への再取得依頼から始まるため、1か月以上を要する事態も起こり得ます。再取得の可否は保険者や委託先の規程によって異なるので、着手前に確認しておきます。

資格喪失者の脱落を考慮せず継続率を読み違える

継続率や改善率を見るときに、分母を初年度の対象者のまま固定してしまう誤りが起こります。退職や転居で資格を失った人は翌年度のレセプトが存在しないため、改善したのか脱落したのかを区別できません。この区別をしないまま集計すると、脱落者が改善者として扱われ、施策の効果が実態より良く見えてしまうのです。健康保険組合では年間の資格喪失率が数%から10%程度に達することもあり、無視できない規模になります。分母の定義は、報告書の脚注に必ず記載しておきます。

回避には、月ごとの在籍フラグを持つテーブルを用意する方法が有効です。分母を「両年度とも資格を有していた人」に限定した数値と、全対象者の数値を並べて示すと、脱落の影響を可視化できます。在籍フラグのテーブルは1人あたり12行、1万人規模でも年間12万行に収まり、扱いは軽い部類です。報告資料には対象者数の推移を必ず添え、期間中の増減がどこから生じたのかを説明してください。脱落率が2割を超える場合は継続率の議論自体が成立しにくいため、分析設計から見直すのが賢明でしょう。

元データを上書きし処理の再現性を失う

作業を急ぐあまり、受領したファイルを直接編集してしまう事故は今も後を絶ちません。上書きした瞬間に処理前の状態へ戻る手段が失われ、検証も再現もできなくなります。特に表計算ソフトで開いて保存し直すと、前述のゼロ落ちや日付の自動変換が同時に発生し、どこが変わったのかすら追えなくなるのです。受領ファイルは読み取り専用の領域に置き、作業用のコピーだけを触る運用を最初に徹底してください。受領直後にファイルのハッシュ値を取得し、原本性を確認する手順も有効です。

再現性を保つ構成は、受領層・加工層・分析層の3層にデータを分ける形が扱いやすくなります。受領層は一切変更せず、加工層には処理後のテーブルを、分析層には集計済みのデータを置き、それぞれの間の処理をコードとして残します。この構成にしておけば、ルールを修正した際も加工層から作り直すだけで済むため、影響範囲は限定的です。保管費用は数年分でも手戻りの工数に比べればはるかに小さく、安価な保険として割り切れます。

月次の締め基準が統一されず集計値が安定しない

毎月同じ集計をしているつもりでも、締めの基準が揃っていないと数値は動きます。ある月は請求年月ベース、別の月は診療年月ベースで抽出していたといった食い違いは、担当者が複数いる組織で実際に起こる問題です。データの受領日が月末なのか月初なのかによっても、含まれる請求の量が変わってしまいます。基準を1枚のルールとして固定し、抽出条件をコードに埋め込んでおけば、この種のぶれは発生しません。ルールの文書は1ページで十分ですが、必ず版数と更新日を入れて管理する形が安全です。

締め基準を決める際は、確報と速報を明確に分ける設計が現実的です。診療年月ベースで見る場合、3か月前までを確報、直近3か月を速報として扱い、レポート上でも表記を分けておきます。速報値には今後増加する旨の注記を添えると、受け手の誤解を防げるでしょう。確報化のタイミングで数値が動いた場合は、変動幅と理由を1行添えると混乱を防げます。運用を始める前に、確報の更新タイミングと過去分の遡及修正の可否を関係者間で合意してください。

レセプトデータのクレンジング事例

実際の取り組みでは、どの工程に手を入れると成果に結び付くのかが組織の立場によって変わります。ここでは健康保険組合・自治体国保・医療機関という3つの立場について、典型的な改善の流れを整理しました。自組織に近い立場の例から、着手すべき工程の当たりを付けてみてください。

健康保険組合:保健指導の対象者抽出精度を改善した例

加入者1万人規模の健康保険組合が、糖尿病性腎症の重症化予防で対象者を絞り込む場面を想定します。当初は傷病名と検査値の条件だけで抽出し、200名を超えるリストが出ていたものの、保健師が内容を確認すると明らかに対象外と思われる加入者が多数含まれていました。原因は疑いを示す病名の混入と、資格喪失者の残存という2点です。除外ルールを追加した結果、リストは120名前後まで絞られ、声がけの工数を4割程度削減できる計算になります。

この改善で効いたのは、抽出条件の分解です。医学的な条件とデータ側の条件を明確に分けて記述し、後者を保健師ではなく分析担当が責任を持つ形に整理したことで、議論が噛み合うようになりました。運用面では、抽出結果を毎回同じ書式で出力し、前回との差分件数を添えるルールを設けるのが有効です。差分が2割を超えた月は必ず原因を確認する取り決めにしておくと、条件変更やデータ不備の見落としを防げます。差分の確認そのものは10分程度で終わり、運用の負担にはなりません。

自治体国保:健診データとの突合率を引き上げた例

自治体の国民健康保険では、レセプトと特定健診の結果を突合して分析するのが一般的な形です。ところが個人を結び付けるキーの整備が不十分だと、突合率が7割前後にとどまる例も見られます。原因の多くは、健診側とレセプト側で被保険者番号の桁数や記載形式が揃っていないことにあります。桁揃えと前ゼロの保持を徹底し、氏名カナと生年月日による補助的な照合を加えると、突合率が9割台まで改善する余地が生まれるのです。突合率は毎年度計測し、前年度からの変化を記録しておくと改善の効果が見えます。

突合率を上げる作業では、一致しなかったレコードの分析が近道になります。全件を眺めるのではなく、不一致となった数百件を抽出し、原因ごとに分類して件数の多い順から手を打つ進め方が効率的です。分類は桁数不一致・前ゼロ欠落・氏名の表記差・対象年齢外の4種類程度に絞ると、対処方針が立てやすくなります。分類作業そのものは半日程度で終わり、以降の改善方針を決める材料になります。上位2つの原因で全体の7割程度を説明できることが多いため、そこだけ潰しても効果は大きいでしょう。

医療機関:DPCデータとの整合性を確保した例

急性期の病院では、レセプトデータとDPCデータの双方を扱う場面が出てきます。同じ入院症例であっても、レセプト上の合計点数とDPCの様式1に記録された内容が食い違うことがあり、原因の切り分けに時間を取られがちです。多くは包括部分と出来高部分の集計範囲の違いから生じるため、比較する前にどこまでを対象とするのかを定義しておく必要があります。定義を決めずに突き合わせると、差異の原因究明だけで数日を費やす事態になりかねません。

整合性の確認は、症例単位の件数、入院日数の合計、診療行為の点数という3つの観点で行うと漏れが出にくい形です。差異が出た症例は個別に一覧化し、診療情報管理士とともに内容を確認する体制を組むと精度が上がります。月に1回、前月分を対象に確認する運用であれば、担当者1名で半日程度の工数に収まるのが目安です。確認結果は診療科ごとに集計しておくと、傾向のある部署を特定しやすくなります。この確認を継続すると入力側の運用ルールの改善点も見えてくるため、データの質そのものが徐々に向上します。

まとめ:標準化と名寄せの順序がレセプトデータの分析精度を左右する

レセプトデータのクレンジングは、請求のための事務データを分析用のデータへ翻訳する作業です。ここまで扱ってきた不備の傾向、7つの手順、精度を高める観点を、明日からの着手順に沿って整理します。

最初に着手すべきは、目的とデータ要件の言語化です。何を判断するための分析なのかが決まれば、どの項目をどこまで整えるべきかが自ずと定まり、過剰な作業を避けられます。続いて手を付けるのが標準化で、コード・単位・日付・文字列を揃えてから個人の突合へ進む順序を守ってください。この順序を逆にすると、一致率が上がらないまま作業が長期化します。

運用に移す段階では、記録の仕組みを先に組み込んでおくことをおすすめします。処理日・入力件数・出力件数・除外理由別件数を自動で出力する仕掛けがあれば、数値の説明も再現も難しくないのです。疑いを示す病名の扱い、請求の遅れに対する締め基準、資格喪失者の扱いという3点は、特に結果を大きく動かす論点になります。この3点だけでも文書として合意しておくと、担当者が代わっても数値の一貫性を保てるのです。

着手の第一歩として、手元のレセプトデータの棚卸しから始めてください。確認する項目は、種別・保有期間・枝番の有無・マスターの世代管理状況という4点で十分です。この棚卸しを終えた時点で、自組織がどの工程から手を付けるべきかはおおむね絞り込めます。工程ごとの担当と期限まで決められれば、クレンジングは属人的な作業から再現可能な業務へ移行していきます。

「これからレセプトデータの活用に関する取り組みを実施したいけれど、何から手をつけたらいいかわからない」「データ専門家の知見を取り入れたい」という方は、データ領域の実績豊富な弊社、データビズラボにお気軽にご相談ください。

貴社の課題や状況に合わせて、レセプトデータの取り組みをご提案させていただきます。

データビズラボの実績無料相談・お見積り

このブログについて

データビズラボが運営する、データの価値を最大化するためのナレッジ共有メディアです。
戦略策定から具体的な分析手法、ツールの活用術まで、データの現場で培われた実践的な取り組みから
得られた知見や気づきを発信しています。

データのことなら、
まずはお気軽にご相談ください。

データ活用に、万能の正解はありません。
貴社の業界特性や課題に合わせて、最適な進め方を一緒に設計します。