
人事データを分析や人材配置に活用しようとした途端、氏名の表記ゆれや部署コードの断絶が次々と見つかったという経験がある方も多いでしょう。
勤怠・給与・評価と複数のシステムに分かれた人事データが持つ難しさは、顧客データの整備とは別物です。退職者の扱いや機微な情報への配慮など、判断に迷いやすい論点を先回りして整理した構成です。
本記事では、人事データ特有の事情を踏まえたクレンジングの進め方を、7つのステップで解説します。人事システムの刷新やデータ分析の内製化を控えている方は、着手前の準備としてぜひ参考にしてください。
目次
人事データクレンジングとは:他部門のデータ整備との違い
人事データクレンジングは、社内に散在する従業員情報の誤り・重複・表記ゆれを検出し、使える状態へ直す作業です。この章では対象となる不備の種類を確認し、顧客データや販売データの整備と何が違うのかを2つの観点から掘り下げます。
人事データクレンジングが対象とする不備の種類
人事データの不備は、大きく「表記ゆれ」「重複」「欠損」「不整合」の4種類に分類できます。クレンジングの目的は見た目を整えることではなく、集計や突合で同一人物・同一組織を正しく扱える状態にすることです。例えば氏名の旧字体と新字体の混在、全角半角が揺れた社員番号、入社日が空欄のレコードが典型例です。弊社の支援では、1万件規模の従業員マスタから数百件単位の表記ゆれが見つかるケースが珍しくありません。不備の全類型を頭に入れておくと、後続の品質調査で見落としが減るはずです。
不備の種類ごとに対処の道具立てが異なる点も見逃せないところです。表記ゆれは変換ルールで機械的に直せますが、不整合は原本の確認が必要になるなど、人手の介入度合いに差があります。原本確認が挟まる項目は、1件あたりの処理時間を多めに見積もっておくと計画が崩れません。種類別の件数を最初に数えておけば、工数見積もりの精度も上げられるはずです。データクレンジング全般の考え方や代表的な手法は、以下の記事で全体像を確認できます。
データクレンジングとは?意味と代表手法を解説!
従業員一人ひとりに履歴が紐づくという特性
顧客データの多くは、現時点の最新状態さえ正しければ用が足ります。一方、人事データは異動・昇格・給与改定といった履歴の積み重ねそのものが分析対象です。現在の所属だけ正しくても、過去の履歴が壊れていれば勤続年数や異動回数の集計が狂います。例えば昇給履歴が1年分欠けているだけで、年収推移や昇格スピードの分析は成立しなくなるものです。クレンジングでは「最新の1枚を直す」のではなく「時系列の連続性を守る」意識が求められます。
履歴を持つがゆえに、1件の修正が過去の集計値まで変えてしまう点も特徴的です。人事データのクレンジングでは、値を直すたびに「いつ時点の事実として直すのか」を必ず決める必要があります。例えば結婚による改姓を反映する際、旧姓時代のレコードまで新姓へ書き換えると、過去資料との突合ができません。有効開始日と有効終了日を持つ形式で履歴を残すのが定石です。修正履歴そのものも監査対応で説明を求められるため、変更日と変更者を残す設計にしておきます。
個人情報を扱うがゆえの制約
人事データは全項目が個人情報であり、健康診断結果や懲戒歴のような機微な情報も含まれます。販売データのように「とりあえず全件を分析環境へコピーして試す」という進め方が許されない領域です。クレンジング作業そのものが個人情報の取り扱いに当たるため、作業環境と閲覧権限の設計が先に必要になります。具体的には、作業用の抽出データを誰が参照できるか、作業後にどこへ保管するかまで決めてから手を動かします。この準備を飛ばすと、後から監査部門への説明に追われる羽目になるのです。
実務でつまずきやすいのは、担当者が全項目を見られる状態のまま作業を始めてしまうケースです。表記ゆれの修正に評価や健康情報の閲覧は不要なため、抽出段階で対象項目を絞るのが原則になります。実際、氏名の表記統一だけが目的なら、必要な列は社員番号と氏名関連の数列だけのはずです。弊社では、作業開始前に「作業環境・対象項目・保存場所」の3点を書面で確認してから着手します。具体的には次の観点をチェックしてください。
- 作業環境:個人PCではなく、アクセスログが残る共有環境を使う
- 対象項目:目的に不要な機微項目は抽出段階で除外する
- 保存場所:ローカル保存を禁止し、ファイルの置き場所を1か所に固定する
人事データの品質が低下する4つの発生源
クレンジングを繰り返さないためには、そもそもなぜ品質が下がるのかを押さえる必要があります。ここでは大企業・中堅企業で共通して見られる4つの発生源を取り上げ、後述する対策の理解につなげます。
複数システムへの分散:勤怠・給与・評価が別管理になっている
勤怠は勤怠システム、給与は給与システム、評価はExcelという分散状態は、従業員1,000名規模の企業でも普通に見られます。システムごとに社員番号の桁数や体系が異なると、同じ従業員のデータを突き合わせる時点で手作業が発生します。分散そのものが悪いのではなく、システム間で人物を一意に特定するキーが揃っていないことが品質低下の本質です。桁数の違いだけでなく、旧姓と新姓の混在や雇用区分コードの体系差も、突合を阻む典型要因です。
よくあるつまずきとして、システム連携を後回しにし、CSVの手動連携でしのぐ運用が挙げられます。月次で人手のコピーが挟まるたびに、転記ミスと更新漏れが少しずつ蓄積します。担当者が休暇を取った月だけ連携が遅れ、データの鮮度が部門間でずれるという問題も起きがちです。連携頻度が月1回を超えるデータは、自動連携の対象として優先度を上げる判断基準が有効です。システム間のデータ統合の進め方は、以下の記事でも詳しく解説しています。
データ統合とは?統合の目的や初心者向けの進め方を解説
組織改編:部署コードが年度をまたいで断絶する
毎年4月の組織改編で部署コードを全面的に振り直す企業では、年度をまたいだ人員推移の集計が困難になります。部署コードの断絶は、放置すると過去データを実質的に使えなくする、最も影響の大きい品質劣化です。旧コードと新コードの対応表が残っていないと、後から復元する作業に数週間単位の工数がかかります。実際に、5年前の部門別人員数を役員会向けに出せず、紙の組織図から手作業で数え直した企業もあります。この復元だけで専任1名の2〜3週間が消えたのが実情です。
回避策はシンプルで、改編のたびに新旧コードの対応表を作り、改編日と一緒に保管することです。対応表の作成は組織改編の事務作業と同時に行えば、1回あたり数時間で済みます。作業といっても、組織改編の稟議資料から新旧の対応を転記するだけの単純作業です。事後に人の記憶を頼りに復元する場合と比べ、必要な工数は文字どおり桁違いに小さくなります。対応表には統廃合の区分列も持たせておくと、後の人員按分で迷いが減ります。
手入力とExcel運用:入力ルールが担当者ごとに異なる
入力ルールが文書化されていない現場では、担当者の交代のたびに表記の流儀が変わるのが実情です。資格名を正式名称で書く人と略称で書く人が混在すると、同じ資格が別物として集計されます。「中小企業診断士」と「診断士」が別の資格として数えられる、といったずれが典型です。入力した本人にとっては些細な違いでも、集計側では別の値として扱われるのがデータの怖さです。保有資格の集計を誤ると、配置検討や入札要件の確認といった意思決定に直接響きます。
Excel運用を今すぐ廃止できない場合でも、有効な手立てはあるものです。入力欄をプルダウン化して自由入力を減らすだけで、新規に発生する表記ゆれは大幅に抑えられます。「データの入力規則」機能で選択リストを設定する作業は、主要な列だけなら半日で終わるはずです。あわせて入力ルールを1枚のシートにまとめ、ファイルの先頭タブに置いておくと定着が進みます。凝ったマニュアルより、入力欄のすぐ近くにルールがある状態の方が守られやすいものです。
雇用形態の多様化:出向者・再雇用者・業務委託の扱いが揺れる
出向者・定年後の再雇用者・業務委託メンバーをどう管理するかは、企業ごとに扱いが揺れやすい論点です。出向者を出向元と出向先の両方で登録すると、全社の人員数を集計したときに二重計上が起きます。業務委託を従業員マスタに混ぜると、法定報告の集計から除外し忘れるミスも生まれます。区分が曖昧なままでは、障害者雇用率のような法定集計の分母すら定まらないのです。集計のたびに個別判断でリストを直す運用は、担当者の異動とともに破綻します。
判断基準として、雇用契約の有無でテーブルを分け、区分コードで雇用形態を持たせる設計が扱いやすいところです。雇用契約がある人だけを従業員マスタに置き、業務委託は別マスタで管理すれば、集計時の混入を構造的に防げます。再雇用者は同一人物として履歴を継続し、雇用区分の変更履歴で表現する形が集計と整合します。出向者は出向元マスタを正とし、出向先では参照情報として持つ、という主従の取り決めも忘れずに行ってください。
人事データをクレンジングすると解決できること
発生源を踏まえたうえで、クレンジングにどれだけの見返りがあるのかを具体化しておきましょう。投資判断の材料になるよう、この章では4つの効果を実務の場面に即して説明します。
タレントマネジメントシステムへの移行がスムーズになる
タレントマネジメントシステムの導入プロジェクトでは、データ移行が最大の難所になります。移行前にクレンジングを済ませておくことが、導入スケジュールの遅延を防ぐ一番の保険です。ベンダーが提供する移行テンプレートに合わせて汚れたデータを整形する作業は、想定の2〜3倍に膨らみがちです。移行データの不備はテスト移行の段階で大量のエラーとして噴出し、原因調査に時間を奪われます。エラーの大半は表記ゆれと欠損という、事前に潰せたはずの不備です。
弊社が支援した移行案件では、事前クレンジングの有無で移行フェーズの期間が1〜2か月変わりました。差が生まれた要因は、移行リハーサルでのエラー件数と手戻り回数の違いに尽きます。導入決定から本稼働までの限られた期間に整備を詰め込むより、契約前の段階から並行して進める計画が現実的です。システム選定と並行して品質調査だけでも先行させる価値は十分にあるはずです。人事領域のDX全体の進め方は、以下の記事も参考になります。
人事DX(HRDX)とは?具体的な施策、ステップと成功させる5つのポイントを解説
離職・配置・スキルの分析が実データに基づく判断になる
離職率の部門間比較や配置転換の効果検証は、データが汚れたままだと数字への信頼が持てません。集計のたびに数字の正しさを疑う確認作業が挟まり、分析より検算に時間が消えるのが実態です。クレンジング後は誰が集計しても同じ数字になるため、議論の焦点を打ち手の中身へ移せます。「データが信用できないから勘で決める」という状態は、分析体制への投資を無駄にします。数字の確からしさを担保する土台が、クレンジングそのものです。
例えば離職分析では、退職日と退職事由の欠損を埋めるだけで、部門別・勤続年数別の傾向がようやく比較可能になります。スキルデータも資格名の表記統一を経て、初めて有資格者の充足率という指標に落とし込めるのです。充足率が部門別に出せるようになると、採用計画や研修計画の議論が数字ベースへ変わります。感覚頼みだった人材配置の会話が変わる瞬間です。従業員エンゲージメントの分析と組み合わせる際の考え方は、以下の記事で解説しています。
従業員エンゲージメントとは?似た言葉との違いや高める方法、役立つツール
労務関連の集計・法定報告の作業時間が短縮される
障害者雇用率や男女賃金差異の開示など、人事部門が担う法定報告は年々増えています。元データが汚れていると報告のたびに手作業の突合が発生し、担当者が数日単位で拘束されるのが常です。クレンジング済みの状態を保てれば、集計クエリやピボットの再実行だけで報告値を出せます。開示項目は拡充が続いており、集計対象の範囲を毎回定義し直す負荷も無視できません。報告値の再現性を確保できない状態は、監査や労基署対応の場面でも弱点になるのです。
工数の目安として、四半期の定型集計に毎回3営業日かけていた企業が、整備後は1営業日未満まで短縮できた例もあるほどです。浮いた時間を分析や制度設計へ振り向けられる点が、費用対効果の説明で最も伝わる材料になります。経営会議向けの資料作成が締切前夜の突貫作業ではなくなる、という現場の働き方の変化も見逃せません。短縮できた作業時間を人件費に換算して示せば、クレンジング予算の稟議も格段に通しやすくなるでしょう。
経営層への報告数値が部門間で一致する
人事部の在籍者数と経理部の給与支給人数が合わない、という現象は珍しくありません。同じ「社員数」という言葉を使っていても、各部門が数えている集合は微妙に違います。原因の多くは、出向者・休職者・月中入退社の扱いが部門ごとに異なることにあるのです。差異はたかだか数名分でも、報告数値への信頼を損なうには十分すぎる火種です。クレンジングの過程でこうした定義の差異が洗い出され、全社共通の集計定義を固める契機になります。
定義を固める際は、「在籍者数」「就業者数」のような指標ごとに、含める雇用区分と基準日を1枚の定義書にまとめてください。定義書があれば、経営層から数字の食い違いを指摘された際も、原因を数分で説明できます。定義書はA4で1枚に収まる分量で十分なのです。数字合わせの調査に半日を費やす状況から抜け出せるかどうかは、この定義書の有無で決まります。作成後は経理・経営企画にも共有し、全社の共通言語として使い回します。
人事データクレンジングの進め方7ステップ
ここからは実際の進め方を、着手順に沿った7つのステップで解説します。各ステップは前工程の成果物を前提に組み立てているため、順番を入れ替えずに進めることを推奨します。
STEP1:対象データと利用目的の棚卸し
最初に行うのは、社内に存在する人事関連データの一覧化と、それぞれの利用目的の明確化です。勤怠・給与・評価・採用・研修とシステムやファイルを洗い出し、管理部門・更新頻度・件数を台帳にまとめます。弊社の経験では、中堅企業でも洗い出すと15〜30種類のデータソースが見つかります。台帳には最終更新日と持ち主の列を設け、すでに使われていないファイルを対象から外せる形にするのが確実です。棚卸しの段階で、不要データの廃棄候補も併せて洗い出せます。
つまずきやすいのは、目的を決めずに「全部きれいにする」と宣言してしまうことです。クレンジングは目的によって求める品質水準が変わるため、対象を絞らないと工数が際限なく膨らみます。範囲を絞った1回目で成果を示し、2回目以降に対象を広げる進め方が結局は早道です。最初の対象は5,000〜10,000レコード程度に収めると、2〜3か月で一巡できます。「タレントマネジメント導入のため」「離職分析のため」と目的を1つ決め、必要な項目だけを対象にしてください。
STEP2:現状のデータ品質を可視化する
対象を決めたら、修正作業に入る前に不備の件数を定量化します。具体的には項目ごとの欠損率・重複件数・表記ゆれのパターン数を集計し、1枚の品質レポートにまとめる作業です。先に全体像を数値で押さえることで、どの項目から直すべきかの優先順位を根拠を持って決められます。表記ゆれのパターン数は、対象列に含まれる値の種類を数えるだけでも概算できます。作成した品質レポートは、経営層へ現状を説明する資料としてもそのまま使える成果物です。
ExcelならCOUNTBLANK関数とピボットテーブル、SQLが使えるならGROUP BYでの件数集計だけで十分に可視化できます。この段階で専用ツールを導入する必要は基本的にないはずです。レポートには集計日を必ず入れ、クレンジング後に同じ集計を再実行して効果を示せる形にしておきます。再集計との比較こそが、効果を客観的に示す唯一の方法です。データ品質を測る観点の詳細は、以下の記事で体系的に整理しています。
データ品質とは?品質評価項目や品質を向上させるための実務的対策を解説
STEP3:社員番号を主キーとした統合設計
複数システムのデータを1つにまとめる際は、全システム共通で人物を特定できるキーの設計が土台になります。多くの企業では社員番号が候補ですが、システムごとに桁数やゼロ埋めの有無が異なるのが実情です。統合前に「8桁ゼロ埋めに統一する」のような変換ルールを決め、対応表を作ってから結合します。対応表なしで結合すると、結合できなかったレコードが黙って消え、件数のずれとして後から発覚します。結合前後の件数チェックを習慣にすることが、静かな欠落を防ぐ基本動作です。
グループ会社間の転籍や再入社では、社員番号が変わる場合がある点に注意します。社員番号とは別に人物を一意に示す統合IDを新設し、社員番号の変遷を統合IDへ紐づける設計が安全です。統合IDは意味を持たない連番にしておくと、将来の番号体系変更の影響を受けません。統合IDの採番ルールと発行手順は、この段階で文書化しておきます。転籍や再入社が年に数件の企業でも、手順がなければ発生のたびに場当たり対応になるものです。
STEP4:表記の標準化:氏名・所属・資格名の統一
氏名・所属・資格名の表記を、定めた標準形へ一括変換していきます。氏名は旧字体と新字体、半角カナと全角カナの統一、所属は正式名称への統一が中心作業です。資格名は正式名称の一覧表を先に作り、略称や俗称をそこへ寄せる方式が確実です。変換にはExcelのSUBSTITUTE関数か、Power Queryの値の置換機能を使えば専用ツールなしで進められます。置換は必ず複製した作業列へ適用し、元の値の列は保全するのが鉄則です。
標準化で最も避けたいのは、変換ルールを作業者の頭の中だけに置いたまま進めることです。ルールを対応表として残さないと、次回のクレンジングで同じ判断を一からやり直すことになります。対応表が育つほど、2回目以降の標準化は置換処理の再実行だけで済むようになるのです。対応表は「変換前・変換後・適用日・判断理由」の4列で管理すると、後任者への引き継ぎにも使えます。Excelの別シートで構わないので、変換作業と同じファイル内に置いて更新漏れを防ぎます。
STEP5:重複レコードの検出と統合
同一人物のレコードが複数存在する状態を解消する工程が、いわゆる名寄せです。検出は社員番号の完全一致を第1段階とし、一致しないものは氏名カナ・生年月日・入社日の組み合わせで候補を挙げます。氏名には入力ミスの可能性が残るため、完全一致だけに頼りきらない設計が安全です。候補はあくまで候補として扱い、機械的な自動統合はこの段階では行いません。候補件数の目安として、1万件規模の従業員マスタなら数十〜数百件が検出されます。
統合時は、どちらのレコードを正とするかを項目単位で決めるのが実務の勘所です。住所は更新日が新しい方、入社日は古い方、といった項目別の採用ルールを先に文書化しておきます。レコード単位で一方を丸ごと残す方式は、正しい値を捨てる危険が大きい進め方です。どちらを採るか迷う項目は独断で決めず、雇用契約書などの原本にあたり、確定までの経緯を記録に残します。名寄せの考え方と具体的な手順は、以下の記事で詳しく解説しています。
名寄せとは?正確な顧客データ管理の方法と活用ポイントを徹底解説
STEP6:欠損値の補完方針の決定
欠損への対処は「補完する」「欠損のまま残す」「レコードごと除外する」の3択から項目別に選びます。全項目を一律の方法で埋めると、後の分析結果を静かに歪めてしまうため危険です。原本にあたれば正しい値が分かる項目なのか、それとも失われて確認不能なのかで、まず大きく分岐させます。補完の可否は情報システム部門任せにせず、その項目の業務上の意味を知る人事側が主導して決めるのが適切です。判断の目安を下の表に整理しました。
欠損の状況 | 推奨方針 | 具体例 | 注意点 |
|---|---|---|---|
原本で確認できる | 原本から補完する | 入社日が空欄で雇用契約書に記載あり | 確認工数を見積もってから着手する |
確認不能だが分析に必要 | 欠損フラグを立てて残す | 過去の退職事由が不明 | ゼロや空文字で埋めない |
分析に使わない項目 | 欠損のまま残す | 使途のない旧制度の項目 | 削除は履歴保全の観点で慎重に判断する |
現場でよくある失敗は、集計を通すためだけに欠損をゼロで埋めてしまうことです。残業時間の欠損をゼロ扱いにすると、平均残業時間が実態より低く算出され、誤った判断材料になります。勤続年数や年齢のように他項目から計算で導ける欠損は、演算での補完が最も安全です。Excelなら補完列の隣にフラグ列を追加し、1を立てるだけで運用できます。補完した値には補完フラグ列を付け、元から存在した値と区別できる状態を保ってください。
STEP7:履歴データの時系列整合性の検証
最後に、異動履歴や給与履歴の時系列が矛盾なくつながっているかを検証します。履歴の重なりと空白を機械的に検出することが、時系列検証の中心作業です。具体的には「有効期間が重複する所属レコード」「退職日より後の勤怠実績」のような矛盾をSQLや関数で抽出します。所属履歴・等級履歴・給与履歴の3系統を対象にすれば、主要な矛盾はほぼ拾えます。抽出条件は10個前後のパターンに定型化でき、一度作れば毎回使い回せる資産になるのです。
検出した矛盾は、原因を確かめずに機械的に削除しないでください。退職日後の勤怠は、再雇用の登録漏れが原因というケースが実際に多くあります。矛盾リストを人事担当者と1件ずつ確認する場を設け、判断根拠を記録しながら潰していく進め方が結局は最短です。確認の場は週1回・1時間の枠で数回に分けて設定すれば、担当者の負荷も現実的な範囲に収まります。件数が多い場合は、影響の大きい在籍者の分から先に処理します。退職者分は優先度を下げても実害が出にくいためです。
人事データ特有の判断に迷うポイントと処理基準
手順どおりに進めても、人事データには機械的に決められない論点が残ります。この章では実務で質問を受けることが多い4つの論点について、弊社が用いている判断基準を示します。
退職者データ:削除するか保持するかの線引き
退職者のレコードを消すべきか残すべきかは、保存期間の法的要件と分析上の価値の両面から決めます。原則は「削除ではなく、アクセスを絞ったうえで保持する」が実務の答えです。労働関係の書類には退職後も保存義務があり、離職分析には退職者データそのものが不可欠だからです。削除してしまった退職者データは、当然ながら二度と復元できません。消す判断だけは、法務・労務担当の確認を経ずに現場だけで下してはならない領域です。
レコードを保持する場合でも、現役従業員と同じ画面で誰もが閲覧できる状態のまま置くのは避けます。参照権限を人事部門内の限られた担当者へ絞り、閲覧の利用目的を台帳へ記録する運用が無難です。退職した本人から削除請求があった場合の対応フローも、この機会に決めておきます。削除請求のたびにゼロから対応を検討する体制では、判断のぶれと対応の遅れを招いてしまうのです。退職者データの種類ごとの推奨する扱いを、次の表にまとめました。
データの種類 | 推奨する扱い | 保持期間の目安 | 備考 |
|---|---|---|---|
雇用・労務関連の記録 | 保持する | 退職後5年程度 | 労働関係法令の保存義務を確認する |
評価・スキル情報 | 匿名化して保持する | 分析目的が続く間 | 個人を特定しない形へ変換できるか検討する |
健康・懲戒などの機微情報 | 期間経過後に削除する | 義務期間の満了まで | 保持理由を説明できる状態にしておく |
再入社者:同一人物として名寄せする場合の条件
一度退職した人が再入社した場合、旧レコードと新レコードを同一人物として統合するかが問題になります。弊社の基準は、氏名カナ・生年月日・過去の社員番号の申告の3点が一致した場合に限り統合する、というものです。2点一致では同姓同名同誕生日の他人を統合する危険が残るため、必ず本人申告を加えます。本人申告は入社手続きの書類に「過去の在籍有無」の欄を設ければ、自然に収集できます。申告漏れが後から判明した場合に統合する手順も、あわせて用意しておくと運用が安定するはずです。
統合後は統合IDの下に新旧2つの雇用期間をぶら下げ、勤続年数の計算ルールを明文化します。通算するか再入社日から数え直すかは、退職金や有給付与の制度と直結するため、人事制度の担当と必ず合意してください。システム上の都合だけで決めると、後から制度側との食い違いが発覚します。制度側と齟齬のある統合は、退職金や有給の計算誤りという実害に直結するのです。統合の判断記録は、本人や監査から照会があった際の説明資料として保管します。
旧部署コード:組織改編前後をつなぐマッピングテーブルの作り方
組織改編前後の部署をつなぐには、新旧コードの対応関係を持つマッピングテーブルを作ります。列構成は「旧コード・新コード・適用開始日・分割統合の区分」の4列が基本形です。1つの部署が2つに分かれた場合は旧1行に対して新2行を作り、人員は所属実績で振り分けます。部署の英字略称や通称も列に加えておくと、現場資料との突合で役立ちます。マッピングテーブルは組織改編のたびに行を追加していく、育てる前提の資産です。
作成時のつまずきどころは、廃止された部署の行を作り忘れることです。廃止部署に「対応先なし」の行を明示的に残さないと、集計時にエラーではなく静かな欠落として現れます。集計プログラム側には、対応表にないコードが現れたら警告を出す仕組みを仕込んでおくと安心です。警告ゼロを保つ運用が、対応表の鮮度を測るバロメーターになります。対応表は組織改編の議事録と一緒に保管し、次回改編時に前回分を引き継いで追記する運用にします。
要配慮個人情報:クレンジング作業者のアクセス権限をどう絞るか
健康診断結果や障害の情報は、個人情報保護法上の要配慮個人情報に当たります。クレンジング作業でこれらを扱う場合は、閲覧できる作業者を通常項目より一段厳しく絞るのが原則です。具体的には、機微項目のクレンジングだけを人事内の正社員2名に限定する、といった線引きを行います。アクセス権の設定は口頭の約束ではなく、フォルダ権限やデータベースのロールとして技術的に強制します。権限を絞った記録自体が、監査や本人への説明で自社を守る材料になるのです。
外部ベンダーへ作業を委託する場合は、機微項目を除外した抽出データを渡す設計にしてください。どうしても必要な場合も、値そのものではなく記載有無のフラグへ変換してから渡せば作業は成立します。フラグへ変換しても、分析上の用途はほとんど損なわれません。委託契約書の取扱条項と実際の受け渡し方法が食い違っていないかも、着手前に確認しておきたい点です。個人情報とパーソナルデータの整理は、以下の記事が参考になります。
パーソナルデータと個人情報の違いとは?取り扱いの注意点をわかりやすく解説
人事データクレンジングでよくある失敗パターン5つ
クレンジングの失敗は、作業中には気づきにくく、分析や移行の段階で表面化します。この章では実際の現場で繰り返し見てきた5つの失敗を、回避策とセットで紹介します。
氏名と生年月日だけで名寄せし、同姓同名を統合してしまう
氏名と生年月日の2条件一致で自動統合すると、同姓同名・同誕生日の別人を1人にまとめる事故が起きます。名寄せの自動統合は「完全一致でも別人があり得る」前提で、必ず人の確認を挟む工程にすべきです。従業員数が数千名を超える企業では、同姓同名の組み合わせは現実に複数存在します。統合事故の怖さは、給与や評価が別人へ紐づくという、従業員本人への実害に直結する点です。発覚も本人からの指摘で判明することが多く、人事部門への信頼を大きく損ないます。
回避策は、自動処理を統合ではなく候補の提示までに留めることです。候補一覧に入社日・所属・連絡先を並べて表示し、人事担当者が1件ずつ判定する画面や帳票を用意します。判定結果は「統合・非統合・保留」の3値で記録し、保留分を原本確認へ回す流れが確実です。1件あたりの判定は数十秒で終わるため、数百件の候補でも確認工数は数時間で収まります。判定基準そのものも記録し、担当者が代わっても同じ判断を再現できるようにします。
標準化より先に重複削除を行い、残すべきレコードを消す
作業の順序を誤ったせいで、残すべきレコードを消してしまうのがこの失敗です。表記ゆれが残った状態のまま重複検出をかけると、本来同一と判定すべきレコードが別物として素通りします。逆に部分一致で緩く検出すると、別人を重複と誤認して削除する方向に倒れます。どちらに転んでも、後から誤りに気づいた時点では復元がきわめて困難です。在籍しているはずの従業員が名簿から消えている、という現場からの指摘で初めて事故が発覚します。
STEP4の標準化を完了させてからSTEP5の重複検出へ進む順序は、この失敗を防ぐための順序でもあります。削除を伴う操作の前には必ず全件バックアップを取り、削除ではなく無効フラグでの論理削除を選んでください。バックアップには取得日時を付け、少なくともプロジェクト完了後3か月は保管します。復元の手順を1回はリハーサルしておくと、万一の際も落ち着いて対処できるはずです。物理削除は、論理削除から一定期間を置いて問題がないと確認できた後で構いません。
欠損を一律ゼロや空白で埋め、分析結果を歪める
集計エラーを消したい一心で、欠損をゼロや「不明」の文字で一括置換する対応は根深い失敗です。残業ゼロと残業不明はまったく意味が異なるのに、埋めた瞬間から区別がつかなくなります。平均値や比率を使う分析ほど、この歪みは静かに、しかし確実に結論を狂わせていきます。一度上書きすると、置換前の状態へ戻せる保証もないのです。「集計が通るようになった」という見た目の達成感が、かえって問題の発見を遅らせてしまいます。
正しい対処は、欠損を欠損のまま扱える形で持つことです。集計時にはCOUNTやAVERAGEの対象から欠損を除外し、欠損件数そのものも併記して報告します。除外した欠損の件数を隠さず示すことが、報告の誠実さと数字の解釈可能性を両立させます。欠損率が高い項目は分析に使わない、という撤退基準を先に決めておくのも有効な方法です。どうしても補完が必要な場合は、STEP6の表で示した方針に沿って項目別に判断してください。
現場部門に確認せず人事側の判断だけで補正する
人事側の推測だけでデータを補正すると、現場の実態とかけ離れた「きれいなだけの誤データ」が生まれます。兼務者の主所属を人事の判断で片方に寄せた結果、現場の工数管理と合わなくなる例が典型です。データ上の正しさと業務上の正しさは、必ずしも一致しません。補正の根拠を聞かれて答えられない状態は、データへの信頼を確実に損ないます。独断で行った補正は、直した本人が異動した後にブラックボックスとして残り続けるのです。
回避策は、補正案の段階で現場部門のレビューを挟むゲートを設けることです。全件確認は不要で、部門ごとに件数の多い補正パターンを代表10〜20件抽出して見てもらえば十分に機能します。レビューの依頼は「この直し方で業務上の問題がないか」の1問に絞ると、現場の負担も小さいはずです。回答期限を1週間と区切り、期限超過は異議なしとみなすルールで停滞を防ぎます。レビュー済みのパターンは以後自動適用に切り替え、確認負荷を初回だけに集中させます。
一度きりの作業で終わらせ、半年後に元の状態へ戻る
プロジェクトとして一度きれいにしても、発生源を放置すれば半年で元の状態に戻ります。手入力の運用もExcel台帳もそのままなら、汚れの流入速度は何も変わっていないからです。クレンジングは一過性の掃除ではなく、品質を保つ仕組みづくりとセットで初めて投資に見合います。「一度直したのにまた汚れた」という経験は、データ整備そのものへの社内の不信につながります。2回目の予算獲得は、初回よりはるかに難しくなるものです。
実際、初回クレンジングの半年後に品質を再測定すると、対策のない企業では欠損率がほぼ元の水準へ戻っていました。次の章で述べる運用ルールまでを初回プロジェクトの成果物に含めることが、再発を防ぐ現実的な打ち手です。維持の中身は、後述する点検サイクルと指標のモニタリングが中心です。維持にかかる工数は初回整備の1〜2割程度で収まることが多く、保険としては安い投資になります。予算取りの段階から、整備と維持を分けて計画へ組み込んでください。
クレンジング後の品質を維持する運用ルール
仕上げとして、きれいになったデータの状態を保つための運用を設計します。この章では入力時の予防・体制・点検サイクル・測定指標の4点を順に説明します。
入力時点で不備を防ぐマスタとバリデーションの設計
品質維持の最も効率的な打ち手は、入力の時点で不備を作らせないことです。所属・資格・役職のように選択式で足りる項目は、マスタからの選択入力へ切り替えて自由記述を締め出します。入力値の形式チェックを行うバリデーションは、社員番号の桁数や日付の前後関係の検査から始めると効果が見えやすいところです。人事システムの改修が難しい場合は、Excelの入力規則やスプレッドシートのデータ検証機能でも代用が利きます。
マスタ自体の管理者を決めておかないと、今度はマスタが汚れていきます。部署マスタは組織改編の主管部門、資格マスタは人材開発の担当と、項目ごとに責任者を1名ずつ決める形です。更新は申請ベースとし、誰でも直接編集できる状態を避けます。マスタの変更履歴も残し、いつ誰が何を変えたかを追える状態を保ちます。責任者の氏名まで書いた管理表を作れば、問い合わせ先の迷いも消えるのです。マスタデータ管理の全体像は、以下の記事で詳しく解説しています。
マスタデータ管理(MDM)とは?適切に運用する重要性とその手法を解説
人事・情報システム・現場部門の役割分担
品質維持は人事部だけでは完結せず、3者の分担を明確にする必要があります。人事はルール策定と最終責任、情報システムは連携とチェック機構の実装、現場は一次入力の正確性を担う分担です。例えば住所変更は本人入力、承認は現場管理職、マスタ反映は人事、という粒度まで落とします。責任の所在が曖昧な項目は、例外なく品質が落ちていきます。三者それぞれに自分の守備範囲が明文化されて初めて、品質の劣化に歯止めがかかるのです。
分担表はRACIのような形式で1枚にまとめ、項目単位で「入力・承認・修正・参照」の権限を割り当てます。兼務情報のように入力者が複数部門にまたがる項目こそ、先に決めておく価値が大きいのです。権限の割り当ては性善説に寄せず、修正権限を持つ人数を最小限に抑えます。年1回の組織改編のタイミングで分担表も見直し、実態と乖離していないかを点検する運用です。実態と合わない分担表は、品質事故の際に責任の押し付け合いを生むだけの文書になりかねません。
組織改編と定期異動に合わせた点検サイクル
品質の点検は任意のカレンダーで行うのではなく、データが大きく動くイベントに同期させます。4月の組織改編と定期異動の直後こそ、品質点検を必ず走らせるべきタイミングです。改編直後の1〜2週間に集中的に点検すれば、不備が業務へ波及する前に食い止められます。10月に中間異動を行う企業であれば、年2回の定期点検が基本形です。イベント直後の点検の機会を逃すと、不備を含んだままのデータが給与計算や各種届出へ流れ込みます。
点検の中身は、STEP2で作った品質レポートの再実行が基本です。同じ集計を同じ手順で回すだけなので、2回目以降の点検は半日から1日で完了します。点検結果は前回値と並べて推移を見える化し、悪化した項目があれば発生源まで遡って手を打ちます。不備件数の推移グラフが低い水準を保っていれば、運用が機能している何よりの証拠です。担当者の異動があっても点検が止まらないよう、手順書とクエリは共有フォルダで管理してください。
データ品質を測る指標の設定
品質を良い悪いの感覚で語らないために、数値指標を設定します。実務で使いやすいのは「必須項目の欠損率」「重複疑いレコード件数」「マスタ外の値の件数」の3つです。それぞれ欠損率1%未満、重複疑いゼロ、マスタ外の値ゼロのように、具体的な水準で目標を置きます。3指標とも既存のExcelやSQLの集計で算出でき、追加の投資は不要です。測定の手間が小さいという事実は、指標運用を長く続けるうえで想像以上に効いてきます。
指標は多く設けるほど形骸化しやすいため、最初は3〜5個に絞るのが運用のコツです。月次の人事定例で1枚のダッシュボードとして報告し、経営層の目に触れる場所へ置き続けます。ダッシュボードは凝った作りにせず、指標の現在値と前月比だけを載せる簡素な形で十分です。数字が悪化した月に原因を話し合う場があるだけで、品質維持は文化として根づいていきます。担当者の評価目標に品質指標を組み込めれば、維持活動はさらに定着します。
人事データのクレンジングは分析基盤づくりの第一歩
人事データのクレンジングは、7つのステップに沿えば特別なツールなしでも着手できます。一方、名寄せの判断や機微な情報の扱いなど、経験がないと迷いやすい論点が多いのも人事データの特徴です。小さく始めるなら、STEP2の品質可視化だけでも今月中に実行してみてください。
「これから人事データの整備や活用を始めたいけれど、何から手をつけたらいいかわからない」「データ専門家の知見を取り入れたい」という方は、人事データ領域の実績豊富な弊社、データビズラボにお気軽にご相談ください。
貴社の課題や状況に合わせて、人事データ整備の取り組みをご提案させていただきます。








