バイタルデータのクレンジング|手順と品質を保つ実務ポイントを解説

バイタルデータのクレンジング|手順と品質を保つ実務ポイントを解説

ウェアラブル端末や医療機器から集めたバイタルデータは、取得できた時点では分析に使える状態になっていないことがほとんどです。装着のずれ、端末ごとの単位の違い、記録時刻のずれが混ざり込み、集計するたびに違う結果が出ます。クレンジングでは、この測定由来の不備を取り除き、比較と集計に耐える状態へ整えていきます。

バイタルデータ特有の難しさは、異常値の判別にあります。心拍数の急上昇が運動によるものか、装着不良によるノイズなのかは、数値だけを見ても区別できません。測定時の状況を示す情報を残さないまま外れ値を一律に削除すると、本来検出したい変化まで消してしまうのが典型的な失敗です。

本記事では、バイタルデータのクレンジングについて、対象範囲から具体的な進め方、失敗しやすい判断までを実務の順序に沿って解説します。分析に進んでよいかを見極める品質水準にも触れます。自社で記録している項目と使用機器を書き出し、本記事の手順と照らし合わせながら読み進めてください。

目次

バイタルデータのクレンジングとは

バイタルデータのクレンジングは、一般的な業務データの整備とは前提が異なります。生体由来のばらつきと時系列という2つの性質が、処理の設計を難しくしているためです。対象となるデータの範囲、通常のクレンジングとの違い、取り組みが広がる背景の順に整理していきます。

対象となるデータの範囲:心拍数・血圧・体温・SpO2・活動量・睡眠

バイタルデータとして扱う項目は、測定の頻度と取得経路によって性質が大きく変わります。心拍数や活動量はウェアラブル端末が数秒から数分おきに自動で記録しますが、血圧や体温は1日1〜2回の手動測定にとどまることが珍しくありません。クレンジングの設計に入る前に、項目ごとの測定者・使用機器・測定頻度を一覧化してください。この一覧がないまま処理を組むと、後工程で必ず手戻りが発生します。取得経路が異なる項目を同じ表として扱うと、後の結合処理で必ず無理が生じるのです。

  • 心拍数・心拍変動:数秒から数分の間隔で自動取得され、体動ノイズの影響を最も受けやすい項目です
  • 血圧:1日1〜2回の手動測定が中心で、測定姿勢や時間帯によって20mmHg前後の変動が出ます
  • 体温:測定部位(腋窩・耳・皮膚)で基準が異なり、機器間の互換性が低い項目です
  • SpO2:装着位置と末梢循環の影響を受け、80%台の異常値が誤って記録されやすくなります
  • 活動量・歩数:端末が独自のアルゴリズムで集計するため、機種間の単純比較が難しい項目です
  • 睡眠:判定ロジックが非公開の場合が多く、段階区分の定義をそろえる作業が必要になります

項目を洗い出したら、分析目的に照らして保持する粒度を決めます。異常検知が目的なら秒単位の生データを残し、月次の傾向把握が目的なら日次の代表値だけを残すという線引きが実務的です。保持期間の目安は、生データが3〜6か月、集計値が3年以上という分け方がよく採用されています。ストレージ費用は生データを全期間保持する場合の2〜3割に収まる例が多く、初期設計での判断が後の運用コストを左右します。粒度の決定は一度決めると簡単には変えられないため、関係者の合意を書面で残してください。

一般的なデータクレンジングとの違い:時系列性と生体由来のばらつき

顧客マスタや売上データのクレンジングでは、表記ゆれの統一や重複行の削除が処理の中心になります。バイタルデータではこれに加えて、値が時間軸上でどう並んでいるかを常に見る姿勢が必要です。1件の外れ値を単独で見ても、それが測定エラーなのか体調変化なのかは判断できません。直前直後の数値、装着状態のログ、同時刻の他項目を合わせて見て初めて、削除してよい値かどうかが決まるのです。時系列という前提を外して処理を組むと、精度の高い判定ルールは作れません。

生体由来のばらつきも、業務データにはない難しさです。同じ人が同じ機器で測っても、心拍数は起床直後と午後で20〜30bpm異なります。血圧は測定姿勢や会話の有無だけで10mmHg前後動くため、値が違うことをそのまま誤りとは扱えません。統計的な外れ値検出をそのまま適用すると、本来検知したい体調変化を大量に削ってしまうのです。クレンジングの目的は、ばらつきをなくすことではありません。測定に由来するばらつきと体調に由来するばらつきを、区別できる状態にすることです。

データクレンジングとは?意味と代表手法を解説!

必要性が高まる背景:ウェアラブル普及とPHR・健康経営での活用拡大

バイタルデータの活用が広がった直接の要因は、測定機器の低価格化と常時装着の一般化です。腕時計型の端末は2万円台から入手でき、心拍数と睡眠を24時間記録できます。測定できる量が増えたことで、企業側の課題は集める方法から集めた値をどう信頼するかへ移ったのです。健康経営の施策評価やPHR(Personal Health Record)の整備では、データの正確さが施策の可否判断に直結します。産業医面談や健康経営度調査の回答でも、記録の信頼性が問われる場面が増えているのです。

制度面の後押しも大きく影響しています。医療機関の外で取得した記録を診療の場面で参照する動きが具体化しつつあるのです。企業の健康経営度調査でも、施策を実施したかどうかだけでなく効果測定の質が問われます。集めたデータの品質を説明できなければ、投資判断の根拠として使えません。健康保険組合との共同事業でも、提供するデータの品質基準を求められる例が出てきたのです。品質を数値で説明できる体制が、外部連携の前提条件になります。

医療DXとは?具体的な施策や成功のポイント、医療DX令和ビジョン2030を解説

バイタルデータの品質が低下する主な原因

バイタルデータの品質劣化は、単一の原因で起きることはほとんどありません。装着状態、機器の仕様、時刻の管理、手入力の運用という4つの層で問題が重なって現れるのが実情です。それぞれの発生メカニズムと、現場で見分けるための手がかりを順に確認していきます。

装着不良と体動:ノイズの混入と測定の途切れ

光学式の心拍センサーは、皮膚に密着していないと反射光を正しく捉えられません。腕時計型端末を緩めに着けた状態では、歩行中に心拍数が実測より30bpm以上高く記録される事象が起こります。この値は生理的にあり得る範囲に収まるため、単純なしきい値判定では弾けないのです。装着状態を示すフラグを端末側から取得できるかどうかが、最初の確認事項になります。フラグを取得できない場合は、心拍数の急変時に加速度の大きさを併せて確認する運用で代替できます。

体動の影響を切り分ける実務的な方法は、加速度データを併用することです。心拍数の急変と同じ時刻に大きな加速度変化があれば、体動由来のノイズと判定できます。加速度が静止相当なのに心拍数だけが跳ねている場合は、体調変化の可能性を残してフラグを立てます。現場でよくあるつまずきは、加速度データを保存対象から外してしまい、後から判定できなくなることです。取得の段階で心拍数と加速度を同一の粒度でそろえておいてください。

デバイス間の差:測定方式・精度・単位・丸め方の不統一

同じ心拍数という項目でも、測定方式が違えば値の意味が変わります。光学式は血流の変化から拍動を推定し、心電式は電位の変化を直接捉えます。運動中の精度差は5〜15bpm程度になることがあり、機種をまたいだ比較には補正の検討が必要です。単位や丸め方の不統一も見落とされやすく、体温を0.1度単位で記録する機器と0.5度単位に丸める機器が混在すると、分布の形そのものが変わってしまいます。機器を導入する段階で、丸め方と単位の仕様を調達要件に含めておくと後の負担が減るのです。

測定方式

主な対象項目

精度の傾向

クレンジング上の注意

光学式(PPG)

心拍数・SpO2・睡眠

安静時は安定し運動時に誤差が拡大

装着状態フラグと加速度を併せて保持する

電極式(ECG)

心拍数・心拍変動

精度は高いが装着時間が短い

欠測が多い前提で解析条件を設計する

カフ式(オシロメトリック)

血圧

測定条件の影響が大きい

測定姿勢と時間帯を属性として記録する

体温計(接触・非接触)

体温

測定部位で基準値が異なる

部位情報がない値は統合対象から外す

機器差への対応は、無理に値をそろえるより出所を残す方向で設計します。具体的には、レコードに機器ID・測定方式・ファームウェアのバージョンを持たせ、分析時に層別できる状態にするのが基本です。判断基準としては、同一人物の推移を追う分析なら機器を固定し、集団の分布を見る分析なら機器差を共変量として扱う進め方が現実的です。機器を混在させたまま平均値だけを比較する運用は、早い段階で見直してください。機器情報を持たない過去のデータについては、分析対象から外すか参考値として区別します。

データ品質とは?品質評価項目や品質を向上させるための実務的対策を解説

時刻のずれ:サンプリング周期・タイムゾーン・端末時計の同期不足

サンプリング周期の違いは、結合処理の段階で表面化します。1分間隔の心拍数と5分間隔の活動量をそのまま結合すると、活動量側の値が欠測として大量に現れます。時刻に関する不整合は、値そのものが正しくても分析結果を丸ごと壊す点で最も厄介な問題です。タイムゾーンの扱いも注意が必要で、端末がUTCで記録しアプリ側が日本時間で表示している構成では、日付境界の集計が9時間ずれます。集計の基準となる日付をどう定義するかは、要件定義の段階で明文化しておいてください。

対策は、取り込み時点で時刻表現を1つに固定することです。保存はUTCのISO 8601形式に統一し、表示や集計の段階でローカル時刻へ変換する構成にします。端末時計のずれについては同期ログを確認し、数分以上の乖離が続く端末を洗い出しておきます。実務では、月に1回程度、端末ごとの最終同期日時を集計して一覧化する運用が有効です。乖離が大きい端末については、利用者へ再同期を依頼するか、機器そのものの交換対象として扱います。

手入力記録の不備:介護・医療現場での転記ミスと表記ゆれ

介護施設や病院の記録では、測定値を紙に書いてから転記する運用が今も残っています。転記の過程で桁の入力誤りが起こり、体温36.5度が365度として登録される事例が実際にあるのです。表記ゆれも頻出し、36.5、36.5℃、36度5分といった値が同じ列に混在します。数値型で受けられない値が入るため、取り込み処理そのものが止まる原因にもなるのです。入力の担当者が交代した時期に、誤りが集中する傾向も確認されています。

防ぎ方は、入力画面側の制約と取り込み側の検査を二重に用意することです。入力画面では体温を30〜43度の範囲に制限し、範囲外は保存できないようにします。取り込み側では単位付き文字列を数値へ変換する正規化処理を挟み、変換できない値をエラーとして別テーブルへ退避する構成が有効です。次の観点を月次で点検すると、入力起因の不備は大きく減らせます。退避した値は週次で担当者へ差し戻し、元の記録に当たって修正する運用にしてください。

  • 同一利用者・同一時刻に2件以上の記録が登録されていないか
  • 体温・血圧・脈拍が機器の測定可能範囲を外れていないか
  • 前回測定から24時間以上空いた欠測が特定の担当者に偏っていないか
  • 数値以外の文字が混入した値が何件発生しているか

クレンジングによって解決できること

クレンジングの効果は、データが整うことそのものではなく現場の判断や業務が変わる点に現れます。誤報の削減、比較可能性の確保、再利用性の向上という3つの観点で、投資対効果を説明できる形に落とし込めます。それぞれ、どの指標がどれだけ改善するのかを具体的に見ていきましょう。

異常検知アラートの精度向上と誤報の削減

見守りシステムや健康管理サービスで最初に問題になるのは、アラートの誤報です。装着不良による心拍数の乱れをそのまま異常と判定すると、1台あたり1日10件を超える通知が出ることもあります。通知を受ける職員は内容を確認しきれず、やがて画面を見なくなるのです。誤報が多い状態は、検知の仕組みがない場合より危険な状況を生みます。現場が使い続けられる水準まで通知量を下げることが、最初の目標になります。通知の総量を減らす取り組みは、検知精度の向上と同じだけの価値を持つのです。

クレンジングを挟むと、この構図が変わります。装着状態フラグと加速度による判定を入れた事例では、誤報が1日10件前後から2〜3件まで減った報告があります。検知すべき事象を見逃さずに通知量だけを減らせるかどうかが、クレンジング設計の成否を分ける基準です。導入前後で、真陽性の件数を維持したまま総通知数が半減しているかを必ず確認してください。通知が減った分だけ見逃しが増えていないかは、必ず現場の記録と照合します。

個人間・期間横断での比較可能性の確保

単位や時刻がそろっていないデータは、集計するたびに違う数字が出ます。部署別の平均歩数を比較したところ実際は端末の機種構成が違うだけだった、という誤った結論に至る例は少なくありません。クレンジングによって単位・粒度・時刻表現をそろえると、比較の前提が初めて成立するのです。ここでいう比較には、個人内の推移と集団間の差という2つの方向があります。比較の対象を決める前に、前提条件がそろっているかを点検する手順を挟んでください。

実務では、比較の前に3つの条件を確認します。1つ目は測定間隔がそろっていること、2つ目は欠測率が一定水準を下回っていること、3つ目は機器構成に偏りがないことです。欠測率の目安として、日次集計であれば1日あたりの取得率70%以上を条件にする運用がよく見られます。この条件を満たさない期間は比較対象から除外するか、除外した旨を注記として残します。注記のない除外は、後から結果の妥当性を検証できなくなる原因になるのです。

データセットの再利用性:分析・研究・外部連携への展開

整備されたバイタルデータは、当初の目的以外にも使えます。見守り目的で集めた心拍数と活動量は、勤務シフトの見直しや共同研究のためのデータ提供にも展開できるのです。再利用の可否を分けるのは、処理履歴が残っているかどうかという1点に尽きます。どの値を補完し、どの値を除去したかが不明なデータは、外部提供の審査を通りません。提供先から処理内容の照会を受けた際に、即答できるかどうかが分かれ目です。再利用の可能性がある領域では、最初から履歴を残す前提で設計します。

再利用を見据える場合、生データと処理済みデータを別々に保持する構成が有効です。生データは変更せずに保管し、クレンジング処理はビューや中間テーブルとして重ねます。この構成なら判定ルールを見直した際に過去分へ遡って再処理でき、やり直しの工数を数日単位から数時間単位に短縮できます。ストレージ費用は増えますが、ルール変更が想定される領域では十分に見合う投資です。生データを削除する判断は、保持期間の基準を定めたうえで行ってください。

バイタルデータのクレンジングの進め方

バイタルデータのクレンジングは、6つの手順に分けると全体像をつかみやすくなります。順序を入れ替えると品質が下がる箇所があるため、特に標準化と名寄せの前後関係には注意が必要です。各手順で決めるべきこと、使うツール、目安となる工数を具体的に示していきます。

STEP1 要件定義:分析目的と許容できる欠測・誤差の水準を決める

最初に決めるのは、分析目的とそこから逆算した許容水準です。どこまでの欠測と誤差を許すかを先に決めないと、クレンジングは終わりのない作業になります。異常検知が目的なら秒単位の連続性が問われるため、欠測が5分続いた時点で解析対象外とする基準を置きます。月次の健康施策評価が目的であれば、1日1回の測定があれば足りる場合もあるのです。目的が複数ある場合は、最も厳しい要件に合わせて全体の水準を決めておくのが安全です。

要件定義の成果物は、A4で2〜3枚の基準書にまとめます。記載すべき項目は、対象項目と測定機器、必要な測定頻度、許容欠測率、外れ値の判定方針、処理履歴の保持方針の6点です。この工程にかける期間の目安は2〜4週間で、医療職や現場職員へのヒアリングを2回以上挟む進め方が確実です。基準書がないまま実装に入ると、後から判定ルールの是非を巡って議論が振り出しに戻ります。基準書は関係部門の承認を得たうえで、版を管理して保管してください。

STEP2 プロファイリング:欠測率・値の分布・測定間隔を把握する

基準が決まったら、手元のデータが実際にどういう状態かを測ります。確認する指標は、項目ごとの欠測率、値の分布、測定間隔の実測値、機器別のレコード件数の4つです。Pythonのpandasであればdescribeとisnullで基礎統計と欠測を一度に把握でき、数万件規模なら10分程度で全体像がつかめます。件数が数千万件を超える場合は、SQLで日次に集約してから可視化する手順に切り替えます。プロファイリングの結果は、要件定義で決めた水準と必ず突き合わせるのです。

測定間隔の把握は特に見落とされやすい観点です。心拍数の記録間隔を差分で計算して分布を見ると、公称1分間隔の端末が実際には30秒から3分の幅で記録している事実が見えてきます。この実測値を知らないまま等間隔を前提とした処理を書くと、結合の段階で説明のつかない欠測が大量に生まれるのです。プロファイリング結果は後の検証工程で比較する基準になるため、必ずファイルとして保存しておいてください。保存先は共有ドライブなど、担当者が交代しても参照できる場所を選びます。

STEP3 標準化:単位・時刻表現・項目名をそろえる

標準化では、単位・時刻表現・項目名の3つをそろえます。体温は摂氏0.1度単位、血圧はmmHgの整数、SpO2は百分率の整数といった内部標準を定義してください。時刻はUTCのISO 8601形式に統一し、ローカル時刻は表示側で変換する構成にします。項目名は英小文字とアンダースコアで統一し、heart_rate や body_temperature のように機器名を含めない命名にするのが無難です。命名規則は一覧表にまとめ、新しい項目を追加する際の判断基準として運用します。

この工程で必ず先に済ませておきたいのが、単位と時刻の変換です。標準化を後回しにして名寄せを先に行うと、単位が異なる値が同一人物のレコードとして統合され、後から切り分けられなくなります。変換処理は機器ごとの変換定義をテーブルとして外出しし、コードに直接書かない形にします。新しい機器を追加するたびにコードを改修する構成は、運用開始から半年ほどで破綻するのです。定義テーブルには機器名と適用開始日を持たせ、過去分の再処理にも使える形にしてください。

STEP4 重複排除と名寄せ:同一利用者・同一時刻の記録を統合する

重複は、同期の再送やアプリの再インストールをきっかけに発生します。同一利用者・同一時刻・同一項目のレコードが2件以上ある状態を検出し、どちらを残すかの規則を決めてください。実務では後着のレコードを優先する方式より、機器の優先順位表を持たせる方式が安定します。医療機器の測定値を消費者向け端末の値より優先するという順位を明示しておくと、判断が揺れません。優先順位表は機器を追加するたびに更新し、更新した日付を記録として残すのです。

名寄せは、利用者IDが機器やサービスごとに分かれている場合に必要になります。氏名と生年月日での突合は表記ゆれの影響を受けるため、施設の利用者番号や職員番号のような一意なキーを軸に据えます。突合率の目安は95%以上で、これを下回る場合はキーの設計そのものを見直す判断が必要です。残った不一致は自動処理で無理に寄せず、確認待ちの状態にして人が判断する運用にしてください。確認待ちの件数が全体の5%を超える状態が続く場合は、キー設計の見直しが必要です。

名寄せとは?正確な顧客データ管理の方法と活用ポイントを徹底解説

STEP5 欠測値と外れ値への対応:除去・補完・フラグ付けを使い分ける

欠測と外れ値への対応は、除去・補完・フラグ付けの3つを使い分けます。機械的に削除する処理は検知すべき体調変化まで失う危険があるため、原則として採用しません。判断の軸は、値が生理学的に成立するかどうかと、他の項目と整合しているかどうかの2点です。SpO2が50%と記録されていても、同時刻の心拍数が正常で加速度に大きな動きがあれば、装着ずれによる測定エラーと判定できます。判定に迷う値は削除せず、要確認として残す方針を既定にしておくのです。

対応方法

適する状況

実務上の利点

注意点

除去

生理学的にあり得ない値(体温365度など)

下流の処理が単純になる

削除した件数を必ず記録に残す

補完

5分以内など短時間の欠測

時系列の連続性を保てる

補完値であることを列で区別する

フラグ付け

判定が分かれる値や長時間の欠測

解析時に扱いを選べる

フラグの定義を利用部門へ周知する

補完の方法は、欠測の長さで選び分けます。5分以内の短い欠測なら前後の値による線形補間で足りますが、30分を超える欠測を補間すると実態と乖離した滑らかな波形が生まれてしまいます。長い欠測は補完せず、欠測フラグを立てて解析側に判断を委ねる方針が安全です。補完値には必ず専用の列を設け、実測値と区別できる状態を維持してください。補完の方法を変更した場合は、変更日と対象期間を記録として残します。過去分を再処理するかどうかも、その時点で判断しておくのが安全です。

箱ひげ図とは?外れ値の見方やExcelでの作成方法まで徹底解説

STEP6 検証と記録:処理内容を残し再現できる状態にする

処理を組み終えたら、プロファイリング時の数値と突き合わせて検証します。確認する観点は、処理前後のレコード件数、欠測率の変化、除去件数、補完件数、値の分布の変化の5つです。件数が想定以上に減っている場合は、判定ルールが厳しすぎるか結合キーの不一致が起きている可能性があります。分布の形が処理前と大きく変わっていないかを、ヒストグラムで目視確認する手順も入れておきます。検証結果は基準書と同じ場所に保管し、次回の見直し時に参照できるようにするのです。

記録として残すべきは、処理の内容そのものではなく再現できる状態です。処理コードをGitで管理し、実行時のパラメータと入出力件数をログとして保存すると、半年後でも同じ結果を再現できます。運用に乗せたあとは月次で欠測率と除去件数を集計し、前月比で20%以上変動した項目を点検対象とする運用が有効です。この点検を怠ると、機器の入れ替えによる品質低下に気づけません。点検の担当者と実施時期を、あらかじめ決めておいてください。

クレンジングの精度を左右する実務ポイント

手順どおりに処理を組んでも、判断の設計が甘いと品質は安定しません。判定ルール、欠測の扱い、個人差への配慮、履歴の保持、法令面の整合という5つの論点が、実務では繰り返し問題になるのです。それぞれについて、判断の基準と具体的な実装方針を示します。

判定ルールの設計:測定エラーと体調変化を切り分ける基準を持つ

測定エラーと体調変化を切り分ける基準は、単一のしきい値では作れません。心拍数が急に130bpmへ上がったという事実だけでは、発熱なのか運動なのかノイズなのかを区別できないためです。実装では、値・変化速度・他項目との整合・装着状態という4つの条件を組み合わせます。条件のうち2つ以上が異常を示した場合にのみエラー判定とする、多数決型の設計が実用的です。条件の重み付けは、現場の記録と照合しながら3か月ほどかけて調整します。

ルールは一度作って終わりにせず、判定結果を検証する仕組みまで含めて設計してください。判定ルールの妥当性は、現場の記録と突き合わせて初めて確認できるものです。介護施設であれば、アラートが出た時刻の介護記録を100件程度サンプリングし、実際に何が起きていたかを照合します。この照合を四半期に1回行うだけで、ルールの過剰検知と見逃しの傾向がはっきりします。照合の結果は、ルールの改訂履歴として残しておくのです。

欠測は削除せずフラグで残す:解析時に扱いを選べるようにする

欠測行を削除すると、後から欠測の発生パターンを分析できなくなります。特定の利用者だけ夜間の記録が抜けている、特定の機種だけ充電時間帯に欠測するといった傾向は、運用改善の手がかりです。削除ではなく値を空のまま残し、欠測理由を示す列を併設する構成にします。理由の区分は、未装着・充電中・同期失敗・原因不明の4つ程度から始めると管理しやすくなります。理由が記録されていない欠測は、原因不明として扱う運用に統一するのです。

解析の段階では、欠測をどう扱うかを分析ごとに選べる状態が理想です。日次の平均値を出す分析では取得率が70%未満の日を除外し、傾向を見るだけの分析では欠測をそのまま残すという使い分けができます。現場でよくあるつまずきは、可視化ツール側が欠測を0として描画してしまうことです。Tableauでもグラフの設定によっては欠測が0扱いになるため、集計の前に明示的に除外する処理を入れてください。除外した件数は集計結果と一緒に表示し、判断材料として共有します。

個人差を前提にした基準値:一律のしきい値に依存しない

安静時心拍数は個人差が大きく、50bpm台の人もいれば80bpm台の人もいます。一律に100bpm以上を異常と定義すると、平常時から高めの人だけがアラートを出し続ける状態になるのです。実務では、個人ごとのベースラインを算出し、そこからの乖離で判定する方式に切り替えます。ベースラインは直近14〜30日の同時間帯の中央値を使うと、季節変動の影響を受けにくくなるのです。中央値を使う理由は、単発の異常値に基準が引きずられないようにするためです。

判定方式

適する場面

必要なデータ量

主な弱点

一律しきい値

導入直後や利用者数が少ない場面

当日分のみ

個人差により誤報が偏る

個人ベースライン比

継続利用者の日常的な変化検知

直近14〜30日分

導入初期は判定できない

併用方式

実運用で最も現実的な構成

直近14日分と当日分

ルールが複雑で保守の負荷が高い

導入初期はベースラインが作れないため、一律しきい値から始めて2週間から1か月で個人基準へ移行する設計が現実的です。移行の条件は、対象者の測定データが14日分以上たまり欠測率が30%を下回っていることの2点で判断します。基準値の更新頻度は週1回程度が扱いやすく、毎日更新すると変化そのものが基準に吸収されてしまいます。急性の変化を捉えたい場合は、更新を止める期間を設ける運用も検討してください。移行の判断は自動化せず、担当者が対象者ごとに確認する運用が安全です。

処理履歴の保持:どの値をどう変換したかを追跡可能にする

どの値をどう変換したかを追跡できる状態は、データリネージの考え方そのものです。バイタルデータでは、補完値と実測値の区別、除去した値の内容、適用したルールのバージョンの3点を最低限残します。実装としてはレコード単位に処理IDを持たせ、処理IDから適用ルールと実行日時をたどれる構成が有効です。処理IDがないと、過去のアラートがどのルールで出たのかを説明できません。処理IDは日次バッチの実行単位で採番し、再実行時も追跡できる形にしてください。

履歴の保持は、監査や外部提供の場面で効いてきます。共同研究にデータを提供する際、前処理の内容を文書で説明できなければ審査の段階で差し戻されるのです。実務では処理定義書とコードのバージョンを対応づけ、データセットのメタデータに埋め込む方式が確実です。保存容量の目安として履歴テーブルは元データの1割前後に収まる場合が多く、費用面の障壁は小さく済みます。提供先が求める説明の粒度は事前に確認し、不足があれば設計に反映します。

データリネージとは?データリネージの意味やメリット、重要性、主なツールなどを解説

要配慮個人情報としての取扱い:アクセス制御・匿名加工との整合

バイタルデータのうち、診療や健康診断に関連して取得した情報は要配慮個人情報にあたります。取得には本人の同意が原則として必要で、オプトアウトによる第三者提供も認められていません。ウェアラブル端末で取得した心拍数そのものは直ちに該当しない場合もありますが、健康診断結果と結びつけた時点で扱いが変わるのです。判断に迷う場合は、要配慮個人情報として扱う前提で設計するほうが安全です。取得の目的と利用範囲は、同意を得る時点で具体的に示しておきます。

実装面では、アクセス制御と加工処理の設計を同時に進めます。閲覧権限は本人・産業保健スタッフ・人事担当・分析担当の4区分に分け、分析担当は氏名を含まない識別子だけを見る構成にしてください。統計分析が目的であれば、匿名加工情報として加工したうえで扱う選択肢もあります。加工の水準は再識別のリスク評価と合わせて、法務部門と確認する手順を必ず挟みます。権限の棚卸しは、人事異動の時期に合わせて年2回実施するのが現実的です。

匿名化とは?匿名加工情報との関係や仮名化・秘匿化との違い、各手法の活用目的

バイタルデータのクレンジングでよくある失敗パターン

クレンジングの失敗は、処理そのものの誤りより判断の順序や運用の設計に起因します。ここでは実際に起こりやすい5つのパターンを取り上げ、何が原因でどう防ぐのかを整理します。自社の運用に当てはまるものがないか、確認しながら読み進めてください。

外れ値を一括削除し、検知すべき体調変化まで失う

最も多い失敗は、統計的な外れ値検出をそのまま適用してしまうことです。平均値から標準偏差の3倍を超える値を一律に削除する処理を入れると、発熱時の体温上昇や不整脈による心拍変動まで消えてしまいます。検知したい事象そのものが外れ値として現れる領域では、統計的な自動削除は成立しません。削除の前に、その値が生理学的にあり得るかどうかという物理的な条件を先に置いてください。統計的な手法は、物理的な条件で絞り込んだ後の補助として使うのです。

回避策は、削除ではなくフラグ付けを既定の動作にすることです。生理学的にあり得ない値だけを削除対象とし、それ以外は要確認フラグを立てて残します。体温であれば30〜43度、心拍数であれば20〜250bpm、SpO2であれば50〜100%といった物理的な範囲を定義しておきます。範囲外の値が急増した場合は、機器の故障やファームウェア更新の影響を疑う手がかりにもなるのです。範囲の定義は機器の仕様書に基づいて決め、独自の判断で狭めないでください。

名寄せを先に行い、単位や時刻のずれを取り込んだまま統合する

処理の順序を誤ると、後から取り返しがつかなくなります。単位も時刻もそろえないまま名寄せを実行すると、摂氏と華氏の値やUTCと日本時間の記録が同一人物のレコードとして統合されます。統合後はどのレコードがどの機器由来かを判別できず、元に戻すには生データからの再処理が必要です。数千万件規模では、再処理だけで数日の工数がかかります。生データを保持していない場合は、復旧そのものができなくなるのです。順序の設計は、実装に入る前に図として整理しておきます。

正しい順序は、標準化を完了させてから重複排除と名寄せに進む流れです。順序を守れているかは、名寄せ処理の入力データに機器固有の単位や時刻表現が残っていないかで確認できます。実装上は標準化済みを示すフラグ列を中間テーブルに持たせ、フラグが立っていないレコードは名寄せ処理に流さない制御を入れておきます。この制御があるだけで、順序の誤りは構造的に防げるのです。制御を入れる場所は取り込み処理の直後が扱いやすく、検知も早くなります。

補完値と実測値を区別せず、そのまま分析に回す

補完処理そのものは有用ですが、区別せずに分析へ回すと結論が歪みます。線形補間で埋めた心拍数を含めて標準偏差を計算すると、実際よりばらつきが小さく出るのです。研究用途では補完値の混入が査読で指摘され、データの作り直しを求められる事態も起こります。補完値の比率が全体の何%かを、データセットの説明に必ず記載してください。記載がないデータセットは、外部提供の対象から外す判断も必要です。補完の比率は、10%を超えた時点で原因の調査に入る運用が目安になります。

防ぎ方は単純で、補完値専用の列を最初から設計に含めることです。値の列とは別に is_imputed のような真偽値の列を持たせ、補完方法の種類も記録します。分析側はこの列を条件に含めるだけで、実測値のみの集計へ切り替えられるのです。データを受け取る側が補完の有無を意識せずに済む構成は、組織をまたいだ活用の前提になります。列の追加は後からでも可能ですが、過去分について補完の有無を判別できなくなる点には注意してください。

デバイス更新後もルールを据え置き、品質が徐々に低下する

バイタルデータの品質は、いったん整えても時間とともに劣化します。端末のファームウェア更新でセンサーのアルゴリズムが変わり、同じ人の睡眠時間が平均30分長く記録されるようになった事例もあるのです。ルールを据え置いたままだと、この変化は品質低下として検知されないまま蓄積されます。過去データとの連続性が失われている点に、誰も気づかない状態が続きます。品質は放置すれば下がるものだという前提で、点検の仕組みを組み込むのです。

対策は、機器の構成変更を管理対象に含めることです。機種名とファームウェアのバージョンをレコードに保持し、バージョンが切り替わった前後で主要指標の分布を比較する点検を組み込みます。比較のタイミングは、更新から2週間後を目安にしてください。平均値が5%以上ずれている項目については、補正の要否を検討する判断につなげます。更新の情報は、メーカーの告知を定期的に確認して収集します。補正を行わない判断をした場合も、その理由を記録として残しておくのです。

リアルタイム処理とバッチ処理で異なるルールを適用する

リアルタイムのアラート判定と夜間バッチでの集計処理に別々のルールを実装すると、同じ日のデータについて2つの異なる結果が出ます。アラートは鳴ったのに日次レポートには異常が出ていないという不信につながり、システム全体の信頼が損なわれるのです。原因の多くは、リアルタイム側で使える情報が限られている点にあります。到着が遅れたレコードを、バッチ側だけが取り込んでいる状態です。遅延の許容時間を決めておかないと、両者の差はいつまでも解消しません。

解決の方向は、判定ロジックを1か所に集約して両方の処理から呼び出す構成にすることです。ロジックを共通の関数やビューとして定義し、リアルタイム処理とバッチ処理が同じ定義を参照する形にします。完全な一致が難しい場合は、リアルタイム側を速報値、バッチ側を確定値と明示的に区別して運用してください。差分が出た件数を日次で集計し、想定範囲に収まっているかを監視する運用も合わせて設けます。差分が想定を超えた場合の対応手順も、あらかじめ決めておくのです。

バッチ処理とは?仕組み・メリット・実装の考え方をわかりやすく解説

バイタルデータのクレンジング事例

実際の取り組みでは、業種や目的によって重点を置く工程が変わります。介護、製造業の健康経営、ヘルスケアサービスという3つの立場から、どの課題にどう対応したのかを見ていきます。自社に近い状況を探しながら読むと、着手すべき工程が具体化しやすくなるのです。

介護施設:見守りシステムの誤報削減と職員の負荷軽減

入居者60名規模の施設で、ベッドセンサーと腕時計型端末による見守りを導入した例です。運用開始の直後は1日あたり80件を超える通知が出て、夜勤帯の職員が対応しきれない状況に陥りました。分析すると、通知の6割以上が寝返りや離床動作に伴う一時的な数値変動だと判明したのです。センサーの感度調整だけでは解決せず、データ側の処理を見直す判断に至ります。通知の内訳を件数で把握したことが、改善の出発点になったのです。

対応として、加速度データを併用した判定と3分間の継続条件を追加しました。心拍数の上昇が3分以上続いた場合にのみ通知する設計へ変えたところ、通知は1日15件前後まで減ったのです。転倒や体調急変の検知件数は変わらず、職員の確認作業は1日あたり2時間程度削減できました。導入から効果が安定するまでの期間は、およそ3か月でした。同様の設計は、他の施設へ展開する際もそのまま適用できます。通知条件の継続時間は、3分から5分の範囲で施設ごとに調整するのが実務的です。

製造業の健康経営:作業環境下での体調変化の早期把握

高温環境での作業がある製造現場で、作業者の心拍数と体温を記録する取り組みが進んでいます。課題になったのは、作業服の下に装着したセンサーが汗と体動の影響を強く受ける点でした。測定値の欠測率が3割を超える時間帯があり、そのままでは体調変化の判定に使えません。装着方法の見直しと並行して、欠測の扱いを設計し直す必要が生じたのです。装着位置を1か所に固定するだけでも、欠測率は1割程度改善します。機器の選定と運用のルールは、同時に見直す必要があるのです。

採用したのは、5分単位の代表値に集約したうえで、取得率が50%を下回る区間を評価対象外とする方式です。生データを捨てずに残し、評価用のビューだけで除外する構成にしました。この方式により判定に使える時間帯が明確になり、産業医との協議もしやすくなったのです。作業前後の比較では、心拍数の回復速度を指標に置く運用が定着しました。評価対象外となった区間の割合は、月次の報告に含めて関係者へ共有しています。作業環境そのものの改善につながる指標としても活用されているのです。

ヘルスケアサービス事業者:複数デバイス横断での指標統一

複数の端末メーカーに対応するサービスでは、機器ごとの仕様差が最大の障壁になります。歩数、睡眠、心拍数のいずれもメーカー独自のアルゴリズムで算出されているためです。同じ利用者が端末を買い替えただけで、過去との連続性が失われる事象が起こります。利用者からは数値が急に変わったという問い合わせが増えることになるのです。問い合わせ対応の工数は、機種構成が増えるほど比例して膨らみます。仕様差を前提にした指標設計が、サービスの継続性を左右するのです。

この事業者は、メーカー横断で使う共通指標を定義する方針を採りました。機器ごとの生値を無理にそろえるのではなく、比較可能な粒度まで抽象化して指標を再定義する判断が有効です。睡眠であれば段階区分を使わず、総睡眠時間と中途覚醒回数の2つに絞る設計へ変えています。端末を買い替えた利用者には、切り替え日を表示して連続性の注意を促す運用も加えました。指標を減らす判断は、機能を削ることではなく比較の信頼性を守るための選択です。

まとめ:バイタルデータのクレンジングは判断基準の設計から始める

バイタルデータのクレンジングで最初に決めるべきなのは、処理の方法ではなく判断の基準です。どこまでの欠測を許すか、どの値を測定エラーとみなすか、誰がその判定を検証するのかを先に固めておくと、以降の実装は迷いなく進みます。技術的な処理そのものは、既存のツールで十分に対応できる範囲に収まります。

本記事の内容を、着手する順序に沿って整理すると次のとおりです。

  • 分析目的と許容欠測率・許容誤差を基準書としてまとめる
  • 欠測率・分布・測定間隔をプロファイリングし、現状を数値で把握する
  • 単位・時刻・項目名を標準化してから、重複排除と名寄せに進む
  • 外れ値は削除ではなくフラグ付けを既定とし、補完値は列で区別する
  • 処理履歴とルールのバージョンを残し、月次で品質指標を点検する

まずは自社で扱う項目を1つ選び、直近1か月分の欠測率と測定間隔を出すところから始めてください。数値が見えた時点で、優先して手を入れるべき工程が自然に絞り込まれます。判断基準を言語化しておけば、機器やサービスが入れ替わっても運用は続けられるのです。

「これからバイタルデータの利活用に関する取り組みを実施したいけれど、何から手をつけたらいいかわからない」「データ専門家の知見を取り入れたい」という方は、データ領域の実績豊富な弊社、データビズラボにお気軽にご相談ください。

貴社の課題や状況に合わせて、バイタルデータの活用やクレンジングの進め方をご提案させていただきます。

データビズラボの実績無料相談・お見積り

このブログについて

データビズラボが運営する、データの価値を最大化するためのナレッジ共有メディアです。
戦略策定から具体的な分析手法、ツールの活用術まで、データの現場で培われた実践的な取り組みから
得られた知見や気づきを発信しています。

データのことなら、
まずはお気軽にご相談ください。

データ活用に、万能の正解はありません。
貴社の業界特性や課題に合わせて、最適な進め方を一緒に設計します。