品質データのクレンジングとは?手順・失敗パターンと実務のコツ

品質データのクレンジングとは?手順・失敗パターンと実務のコツ

製造現場には検査記録や設備ログが日々蓄積されています。しかし、そのまま不良分析に使えるデータはごくわずかです。不良名称の表記ゆれ、単位の混在、ロット番号の不整合が分析の手前で足を止めるため、集計に耐える状態への整備から始めます。

品質データのクレンジングは、目についた誤記を場当たり的に直す作業ではありません。不良コードの統一基準や検査単位の換算ルールを先に決め、どの記録を正とするかを定めたうえで進める体系的な工程です。この設計を省くと、担当者ごとに直し方が変わり、同じ不良が別名称のまま残るのが実情です。

本記事では、品質データに生じやすい不備のパターン、6段階の進め方、失敗例と回避策を実務目線で解説します。担当者1人でも着手できる作業から順に取り上げます。自社の検査記録を1つ手元に用意し、照らし合わせながら読み進めてください。

目次

品質データのクレンジングとは

品質データという言葉は、検査結果だけを指すと受け取られがちです。実際の分析では、工程条件や設備の測定値まで含めて扱わなければ、不良の原因にたどり着けません。ここでは品質データの範囲を確認したうえで、クレンジングが必要になる背景と、一般的なデータクレンジングとの違いを整理します。

品質データの範囲:検査結果・不良情報・工程条件・測定値

品質データを検査の合否判定だけに限定すると、分析は早い段階で行き詰まります。不良の理由を説明するうえで必要なのは、発生時点の設備条件や測定値です。実務では4つの領域に分けて棚卸しすると、全体像をつかみやすくなります。検査結果、不良情報、工程条件、測定値の4つです。管理部署も保存形式も領域ごとに異なるため、最初に所在の一覧化から着手します。一覧化の粒度は、システム名・帳票名・保存場所・更新頻度の4項目で十分です。

  • 検査結果:受入検査、工程内検査、出荷検査の合否判定と測定データ
  • 不良情報:不良コード、発生工程、発生日時、処置内容、再検査の記録
  • 工程条件:温度、圧力、送り速度、金型番号、作業者、使用ロットなどの実績値
  • 測定値:設備から自動取得されるセンサーデータや検査機の生データ

4つの領域のうち、不良情報だけが紙や口頭の伝達に依存している現場は少なくありません。範囲を決めずに着手すると対象が際限なく増えるため、最初に境界線を引くことが必要です。目安として、直近1年分かつ主要3品目に限定すれば、初回の棚卸しは2〜3日で終わります。対象を広げるのは、1周目の成果が出てからで十分です。4領域を同時に整えようとした結果、半年で頓挫した取り組みも実際にあります。範囲を先に決めてから品質へ進む順序が、結果的には近道です。

クレンジングが必要になる背景:紙・Excel・設備ログの併存

品質記録は、工程ごとに最適な手段が選ばれてきた結果、媒体がばらばらのまま積み上がっています。受入検査は紙のチェックシート、工程内検査はExcel、設備は自動ログという構成が典型です。それぞれ単体では機能しますが、横断して集計しようとした瞬間に問題が表面化します。同じ不良を指す名称が媒体ごとに違い、突合できないためです。紙をスキャンしてPDF化しただけでは、分析可能な状態にはなりません。文字認識を通しても、手書きの数値の誤読率は数%残るのが実情です。

媒体の併存は、品質保証部門だけの問題では終わりません。生産技術が設備ログを、品質保証が検査記録を、製造が作業日報を持つという分散が一般的です。部門ごとに項目名や粒度を決めてきたため、統合時には必ず変換ルールが必要になります。変換ルールの整備工数は、対象システム3〜4本で20〜40人日が目安です。この工数を見積もらずに着手すると、分析開始が数カ月単位で後ろ倒しになります。変換ルールの所在を1枚の表にまとめておくと、次回以降の統合が楽になるはずです。

製造業のデータ分析はなぜ必要?解決できる課題やメリットなどを解説

一般的なデータクレンジングとの違い:品質データ特有の制約

顧客データのクレンジングと品質データのクレンジングでは、判断基準が大きく異なります。顧客データでは異常な値を除去してよい場面が多い一方、品質データの異常値は分析対象そのものです。規格外れの測定値を外れ値として削除すれば、不良の兆候を自ら消すことになります。もう1つの違いは、記録保存の要件です。品質記録は法令や顧客要求に基づき、原本を数年から10年以上保管する義務を負う場合があります。上書き修正が許されない領域があるという点が、他分野との決定的な差です。

比較軸

一般的なデータクレンジング

品質データのクレンジング

主な対象

顧客名・住所・購買履歴

検査結果・工程条件・設備ログ

異常値の扱い

誤入力として除去する前提

不良の兆候として保持する前提

原本の扱い

上書き修正が許容されやすい

原本保管と変更履歴の記録が必須

突合キー

氏名・電話番号・メールアドレス

ロット番号・製番・品目コード

主な関係部署

営業・マーケティング

品質保証・生産技術・製造

この違いを理解しないまま汎用のクレンジングツールを適用すると、品質情報が失われます。たとえば重複排除機能を無条件に走らせると、再検査の記録まで消えてしまうのです。再検査は不良の重要な手がかりであり、2回目の測定値には固有の意味があります。ツール選定の判断基準は、処理ルールを項目単位で制御できるかどうかです。項目単位の制御ができない機能は、品質データには適用しないと決めておきます。選定時には、処理ログを出力できるかどうかも確認しておきたい点です。

データクレンジングとは?意味と代表手法を解説!

品質データに生じやすい不備のパターン

不備は現場ごとに違うように見えて、実際には5つの型に収まります。型を知っていれば、初回の調査で確認すべき観点があらかじめ決まるので効率的です。ここでは表記ゆれから紐付けの断絶まで、発生原因と見つけ方を順に取り上げます。

表記ゆれ:不良名称・工程名・設備名の不統一

不良名称の表記ゆれは、品質データで最も高い頻度で現れます。「キズ」「傷」「スリキズ」「擦り傷」が同一台帳に併存している状態です。自由入力欄を持つExcel台帳では、1年運用しただけで名称が20〜30種類に増えます。工程名や設備名も同様で、「3号機」「No.3」「#3」の混在が典型例です。表記ゆれを放置すると、不良のパレート図が実態より細かく分散します。本来1位の不良項目が3位以下に埋もれてしまうのが、最も困る影響です。

調査の第一歩は、対象列のユニーク値を件数付きで一覧化する作業です。Excelならピボットテーブルの行に不良名称、値に件数を置けば10分で確認できます。件数が1〜2件しかない名称は、多くが表記ゆれか入力ミスです。この一覧を品質保証の担当者と一緒に見ながら、正式名称への対応表を作ります。対応表は「入力された文字列」「正式名称」「判断者」「判断日」の4列で十分です。300件程度の対応表なら、半日から1日で完成します。

単位と桁の不一致:mmとμm、%とppmの混在

寸法測定の記録では、mmとμmが同じ列に混在する事態が起こります。測定器の設定変更や担当者の交代がきっかけになることが多いです。0.05という値が0.05mmなのか0.05μmなのか、数値だけでは判別できません。1000倍の差は、工程能力指数の計算結果を全く別物にしてしまうものです。不良率の記録でも、%とppmの混在が頻繁に見つかります。100と書かれた値が100%なのか100ppmなのかで、判断は正反対です。

単位の混在は、値の分布を見れば比較的簡単に検出できます。同一項目のヒストグラムに山が2つ離れて現れたら、単位混在をまず疑うのが定石です。桁が3つずれた集団が同居していないか、最小値と最大値の比で確認します。比が1000倍を超えるなら、単位の問題である可能性が高いです。対策としては、記録項目名に単位を含めてしまう方法が確実に効きます。「外径」ではなく「外径_mm」という列名にするだけで、混在は大きく減るのです。

欠測値:検査項目の未記入と設備からの取得漏れ

欠測値は、原因によって対処方針が変わります。検査担当者の未記入と、設備側の通信断による取得漏れは別物です。未記入は特定の担当者や特定の時間帯に偏る傾向があります。取得漏れは設備の停止や再起動と時刻が一致するのが特徴です。両者を切り分けるには、欠測の発生日時を横軸に取ってプロットします。連続した時間帯にまとまって空白が並ぶなら、設備側の要因を疑うのが順当です。切り分けができれば、対策先が校正か運用かも自動的に定まります。

欠測率の目安としては、5%を分岐点に置く運用が実務的です。5%未満であれば、該当レコードを除外しても傾向分析の結論は大きく変わりません。5%を超える場合は、除外ではなく発生源の調査を優先すべきです。欠測が集中している検査項目は、そもそも運用が形骸化している疑いがあります。記録すること自体が現場で意味を失っているサインです。この場合は、項目の廃止や自動取得への切り替えを検討します。廃止の判断も、データを見たうえでなら現場の納得を得やすいものです。

重複記録:再検査・手戻りによる二重登録

同一ロットに対する検査記録が2件以上存在する状況は、日常的に発生します。再検査、手直し後の再測定、システム再送信が主な原因です。重複をすべて削除すると、不良の発生件数を過小に見積もることになります。放置すれば良品率が実態より低く算出されるという、逆の歪みが出るものです。判断の分かれ目は、その記録が「別の事象」か「同じ事象の重複入力」かという点にあります。再検査は別の事象であり、システムの二重送信は同じ事象の重複です。

切り分けの手順は、キー項目の組み合わせで重複候補を抽出することから始めます。ロット番号、検査項目、測定日時の3つを結合キーにするのが基本形です。測定日時まで完全に一致するレコードは、システム起因の重複と判断できます。日時が異なるレコードは、再検査として区別フラグを立てて残すのが適切です。「検査回次」という列を追加し、1回目・2回目と明示する運用で解決します。この列があるだけで、初回不良率と最終不良率を別々に集計できるのです。

名寄せとは?正確な顧客データ管理の方法と活用ポイントを徹底解説

紐付けの断絶:ロット番号・製番・品目コードの不整合

検査データと生産実績が突合できない原因の多くは、キー項目の不整合にあります。ロット番号の桁数や区切り文字が系統ごとに違えば、どれほど整った表でも結合は不可能です。「L-2024-0031」と「L20240031」は、機械的には別の値として扱われます。品目コードも同様で、旧コードと新コードが混在した状態が長く残るものです。統合の前提として、マスタデータの整備が避けて通れません。マスタが整っていない状態でのクレンジングは、砂の上に建てる作業と同じです。

実務で現実的なのは、系統間の変換テーブルを1枚用意する方法です。「検査系のロット番号」「生産系のロット番号」「品目コード」「有効期間」を列に持たせます。有効期間の列があれば、コード改訂の前後を同じ仕組みで扱えるので便利です。作成工数は、対象品目が500点規模で5〜10人日を見込みます。工数のかかる作業ですが、一度作れば毎月の分析で使い続けられる資産です。変換テーブルの更新責任者を決めないまま運用を始めると、半年で陳腐化します。

品質データのクレンジングで解決できること

クレンジングは地味な作業であり、投資対効果を説明しにくい取り組みです。ただし整備後に得られる成果は、工数削減から監査対応まで幅広く及びます。ここでは経営層への説明にも使える4つの効果を、具体的な数字とともに示します。

不良分析の精度向上:真因特定までの工数削減

不良の真因を追う作業時間の大半は、分析ではなくデータ整形に費やされます。複数部門から集めたファイルを手作業で結合する時間が、全体の6〜7割を占める例も普通です。整備済みのデータがあれば、この部分がほぼゼロになります。月次の不良分析にかかる工数が、10人日から3人日程度まで下がる想定です。削減された時間は、対策立案や現場での検証に振り向けられます。分析の質が上がる本当の理由は、考える時間が確保できるという点です。

工数だけでなく、分析結果の精度そのものも変わります。表記ゆれを統合した結果、上位3項目で全不良の7割を説明できるようになった例が典型です。整備前は上位10項目でも5割に届かず、対策の優先順位が決められませんでした。パレート分析が機能するかどうかは、名称の統一度に強く依存するものです。同じデータでも、整備の有無で結論そのものが変わってしまいます。分析手法を高度化する前に、入力データを整える方が費用対効果は高いです。

工程改善の実効性:QC工程表と実データの整合

QC工程表に書かれた管理項目と、実際に記録されている項目がずれている職場は多く存在します。管理項目が20項目あるのに、実データとして残っているのは12項目という状態です。残る8項目は現場の判断で記録が省略され、誰も気づかないまま年月が過ぎます。この状態では、工程能力の評価が一部の項目に偏るのは当然です。クレンジングの過程で、この乖離が自動的に可視化されます。データを並べた瞬間に、空欄だらけの列が浮かび上がるためです。

乖離が見つかったら、記録項目を増やすか管理項目を減らすかの判断に進みます。記録されていない管理項目は、管理していないのと同じという前提で議論するのが現実的です。実際に品質へ影響しない項目であれば、管理項目側から削除する判断もあり得ます。不要な記録を減らせば、現場の入力負荷も同時に下がるという副次効果があるのです。削除の判断は、過去2年間の不良発生とその項目との相関を見て決めます。相関が見られない項目を残し続ける理由は、監査要求がある場合を除いて乏しいです。

トレーサビリティと監査対応:記録の一貫性確保

顧客からの不具合連絡を受けたとき、該当ロットの記録を何分で提示できるかが問われます。トレーサビリティの実力は、平時ではなく緊急時にはっきり現れるものです。紙とExcelが混在した状態では、1件の遡及に半日から1日を要します。整備済みの状態なら、同じ作業が10分から30分で完了する水準です。差が生まれる理由は、キー項目が統一されているかどうかに尽きます。ロット番号1つで原材料から出荷先までたどれる構造が、対応速度を決めるのです。

監査対応でも、記録の一貫性が評価対象です。IATF16949やISO9001の審査では、記録の追跡可能性を実演で求められます。その場で提示できない記録は、存在しないものとして扱われるのが実務の感覚です。クレンジングの過程で変更履歴を残しておけば、審査での説明も容易になります。「いつ、誰が、どの値を、なぜ変更したか」の4点が記録されていれば十分です。この4点を最初から様式化しておくと、後追いの作業を大幅に減らせます。

予知保全やAI活用の前提整備

設備の異常予兆をAIで検知する取り組みは、多くの企業が検討しています。実行段階で壁になるのは、アルゴリズムではなく学習データの状態です。センサーデータと不良発生の記録が結びついていなければ、正解ラベルを作れません。モデルの精度以前に、学習を始める条件が整っていないという話です。時刻の粒度がずれているだけでも、紐付けは成立しなくなります。設備ログが1秒単位、検査記録が日単位という組み合わせは典型的な障害です。

前提整備として最低限必要な条件は、3つに整理できます。時刻の統一、キー項目の統一、そして欠測処理ルールの明文化です。この3条件を満たすまでに、一般的な工場で3〜6カ月を要します。先行してツールを導入しても、この期間は短縮できないのが実情です。順序を逆にした結果、高価な分析基盤が使われないまま残る事例が後を絶ちません。データを整える工程を先に置くことが、遠回りに見えて最短の道です。整備の期間を計画に織り込んでおけば、途中での説明にも困りません。

AI-Readyを支えるデータガバナンスとは?品質・透明性・責任あるAI活用の基盤を築く重要性と実践ポイント

品質データクレンジングの進め方

進め方は6段階に分けると、担当者間で作業の現在地を共有しやすくなります。各段階には終了条件があり、それを満たすまで次へ進まないという運用が有効です。ここでは目的定義から検証までの流れを、想定工数とあわせて説明します。

STEP1:分析目的と対象データの範囲を定義する

最初に決めるべきなのは、整備後に何を分析したいのかという1点です。目的が「不良率を下げる」では粗すぎるため、「A工程の寸法不良を3割減らす」まで具体化します。粒度をここまで落とすと、必要なデータ項目が自動的に絞り込まれるのです。対象は3カ月から1年分、品目は上位3品目程度から始めます。スモールスタートが推奨される理由は、失敗のやり直しコストが小さいためです。全社展開の判断は、1周目の成果を見てから下します。

範囲定義の成果物は、1枚の資料にまとめます。記載するのは目的、対象期間、対象品目、対象システム、完了条件の5項目です。完了条件を書いておかないと、作業がいつまでも終わりません。「上位3品目の寸法データが1つの表で集計できる状態」といった書き方が適切です。この資料は品質保証、生産技術、情報システムの3部門で合意しておきます。合意なしに進めると、途中でデータ提供を断られる展開になりやすいです。合意した資料は、進捗報告のたびに冒頭で読み合わせます。

STEP2:データプロファイリングで不備の所在を可視化する

データプロファイリングとは、データの中身を統計的に把握する作業を指します。対象は件数、ユニーク値数、欠測率、最小値、最大値、データ型の6項目で十分です。Excelでも実施できますが、列数が多い場合はPythonのpandasを使うと作業が速く進みます。describe関数とvalue_counts関数の2つで、必要な情報の大半が得られるのです。1テーブルあたりの所要時間は、慣れれば30分ほどで終わります。専用ツールを導入する前に、手元の環境で試す価値は十分にあるはずです。

プロファイリングの結果は、一覧表にして関係者へ共有します。列名、欠測率、ユニーク値数、想定される問題、対応要否の5列構成が使いやすいです。この表があると、優先的に手を入れるべき項目が一目で決まります。欠測率が3割を超える列は、そもそも使わないという判断も選択肢です。限られた工数を、分析に効く項目へ集中させる考え方が求められます。全項目を等しく整備しようとするのは、工数を浪費する典型的な進め方です。

データ品質とは?品質評価項目や品質を向上させるための実務的対策を解説

STEP3:標準化・正規化でコード体系と単位を統一する

標準化の作業は、対応表を作り、それを機械的に適用する2段階で進めます。対応表の作成は人の判断、適用は自動処理という分担が原則です。人が1件ずつ書き換える方法は、件数が増えた瞬間に破綻します。1万件を手作業で直せば、20〜30時間と一定数の新たなミスが生まれるものです。対応表さえあれば、同じ処理を毎月自動で再実行できます。再現性のある仕組みにしておくことが、この段階の狙いです。対応表はExcelで作り、処理側から参照する構成にしておきます。

単位の統一で決めるのは、どの単位に寄せるかという方針です。寸法はmm、不良率はppm、時間は秒に統一する例が多く見られます。判断基準は、現場の図面や規格書で使われている単位に合わせることです。分析側の都合で単位を変えると、現場との会話が噛み合わなくなります。換算後は、元の値と単位を別列に残しておくと安全です。後から換算誤りが判明したとき、元の値があれば復旧できます。単位の統一方針は、項目の定義資料へ必ず反映しておくべき内容です。

データプレパレーションとは?ETLとの違いから成功ポイントまで徹底解説

STEP4:ロット単位で突合し、重複を排除する

突合作業では、結合キーの品質が結果をほぼ決めます。ロット番号の前後の空白、全角半角、ゼロ埋めの有無が最初の障害です。これらを正規化してから結合すると、一致率が大きく改善します。前処理なしで6割程度だった一致率が、9割超まで上がる場合もあるのです。残る1割は、そもそも記録が存在しないケースが中心になります。一致率100%を目指すより、不一致の原因を分類する方が生産的です。分類ができれば、次に手を入れる場所が具体的に決まります。

重複の排除では、削除ではなくフラグ付けから始めます。削除は元に戻せないため、まず重複候補に印を付けて内容を確認する順序が安全です。確認は品質保証の担当者が実施し、判断結果を対応表に残します。1000件規模の重複候補でも、パターン化すれば確認は1〜2日で済むものです。同じパターンの重複は、まとめて同じ判断を適用できます。個別に見るべきなのは、パターンから外れた数十件だけです。フラグ列を残しておくと、後から判断の妥当性を検証できます。

STEP5:欠測値と外れ値の処理方針を決定する

処理方針は、分析の目的から逆算して決めます。傾向把握が目的なら除外、統計的検定が目的なら補完という切り分けが基本です。補完方法を選ぶ際は、時系列性の有無を判断材料にします。設備の連続測定値なら前後の値による補間、独立した検査値なら中央値が妥当です。平均値での補完は、外れ値の影響を受けるため品質データには向きません。分布が歪んでいる項目が多いというのが、その理由です。補完した値には必ず補完フラグを立て、実測値と区別できるようにします。

処理方針

適用条件

メリット

注意点

レコード除外

欠測率が5%未満

実測値だけで分析でき解釈が単純

欠測が特定条件に偏ると結論が歪む

前後値による補間

設備の連続測定値

時系列の連続性を保てる

急変時の値をなだらかにしてしまう

中央値による補完

独立した検査値で分布が歪む

外れ値の影響を受けにくい

ばらつきが実態より小さくなる

欠測のまま保持

欠測自体が分析の対象

運用上の問題を発見できる

集計のたびに個別処理が必要

外れ値については、除外の前に必ず原因を確認します。規格上限を超えた測定値は、不良そのものである可能性が高いです。物理的にあり得ない値のみ、入力誤りとして扱います。板厚2mmの製品で200mmという記録は、桁の打ち間違いと考えるのが自然です。判断に迷う値は、除外せずに「要確認」の印を付けて残します。判断を保留できる仕組みがあると、作業が止まらずに進むのです。「要確認」の件数は、月次で棚卸しして処理方針を決めていきます。

STEP6:処理結果を検証し、変更履歴を記録する

検証では、処理前後で件数と合計値がどう変化したかを確認します。不良件数が3割減っていれば、必要な記録まで削っている疑いが濃厚です。確認する指標は、総件数、不良件数、不良率、品目別件数の4つで足ります。変化率が想定を超えた項目は、処理ルールを1つずつ戻して原因を特定するのが確実です。この作業を効率化するため、処理は必ず段階ごとに保存しておきます。中間ファイルが残っていれば、切り分けは数時間で終わるものです。

変更履歴の記録は、監査対応と再現性の両面で必要な作業です。処理日時、処理内容、対象件数、実行者、判断根拠の5項目を残します。スクリプトで処理している場合は、そのスクリプト自体が履歴の一部です。バージョン管理の仕組みに置いておくと、変更の経緯まで追跡できます。手作業の場合は、作業ログを別途残す運用が最低限の対応です。履歴のないクレンジングは、結果の正しさを誰も証明できなくなります。履歴の様式は、初回の処理を始める前に決めておくべき事項です。

品質データを整備する際の実務ポイント

手順どおりに進めても、判断を誤れば品質情報そのものを失う危険があります。品質データ特有の勘所を押さえているかどうかで、成果には大きな差が出るものです。ここでは現場で判断を求められる5つの論点を取り上げます。

外れ値を機械的に除外しない:異常値こそ品質情報

統計処理の教科書では、外れ値を除外する手法が多く紹介されています。品質データにそのまま適用するのは、極めて危険な判断です。規格から外れた値こそ、不良の発生を最も直接的に示します。3σを超える値を自動除外する処理は、不良データを消す処理と同義です。除外した結果、工程能力指数が実態より良く見えてしまいます。数字は改善しても、現場では不良が出続けるという状態になるのです。除外の是非は、報告先と目的をセットで確認したうえで決めます。

外れ値の扱いは、分析目的によって使い分けます。工程の平常時のばらつきを知りたいなら除外し、不良の原因を探るなら残すという使い分けが基本です。同じデータでも、目的が変われば処理も変わります。そのため、原本を残したうえで目的別のデータを作る構成が現実的です。箱ひげ図で分布を確認してから判断すると、見落としを減らせます。可視化を挟まずに数値だけで判断するのは、避けたい進め方です。分布の形を見てから方針を決める習慣が、判断の質を底上げします。

箱ひげ図とは?外れ値の見方やExcelでの作成方法まで徹底解説

クレンジング前の原本を保持する:記録保存要件への対応

品質記録には、法令や顧客要求に基づく保存義務が課される場合があります。自動車部品なら15年、医療機器なら製品寿命に応じた期間という例が代表的です。クレンジングによって元の記録を上書きすると、この要件に抵触します。原本は別領域に読み取り専用で保管し、加工は複製に対して行うのが鉄則です。保管領域には、書き込み権限を持つ利用者を限定して設定します。権限管理まで含めて初めて、原本保持の仕組みが成立するのです。

実装方法としては、フォルダを3層に分ける構成が扱いやすいです。原本、加工中、分析用の3つに分け、それぞれ権限を変えて運用します。原本フォルダへの書き込みは、システム管理者のみに限定するのが基本です。加工中のファイルには、日付と処理内容を含む命名規則を適用します。「20260801_単位統一済」といった名称なら、後から見ても内容が分かるので便利です。命名規則を決めずに始めると、3カ月後には自分でも判別できなくなります。

測定誤差と入力誤りを切り分ける判断基準

異常な値を見つけたとき、測定器の誤差なのか人の入力ミスなのかを判断します。この切り分けを誤ると、対策の方向が完全にずれてしまうものです。測定誤差なら校正の問題、入力誤りなら運用の問題として扱います。判断材料は、値のずれ方と発生パターンの2つです。測定誤差は一定方向に少しずつずれ、入力誤りは桁単位で大きく飛びます。発生の偏りにも違いがあり、誤差は連続、入力ミスは散発というのが一般的です。この2つの観点で分類すると、対策の担当部署も自然に決まります。

観点

測定誤差の特徴

入力誤りの特徴

ずれの大きさ

規格幅の1〜2割程度のずれ

10倍や100倍など桁単位の飛び

発生の仕方

特定期間に連続して発生

散発的で規則性がない

偏りの出方

同一測定器・同一設備に集中

特定の担当者や時間帯に集中

主な対策

測定器の校正と点検周期の見直し

入力方式の選択式化と桁数チェック

元データの扱い

補正値を別列に追加して保持

原本を残したうえで修正値を追加

切り分けの実務では、測定器の校正記録との突合が有効な手段です。異常値の発生時期と校正日をカレンダー上で重ねて確認します。校正直前に異常が集中していれば、測定誤差である可能性が高いです。校正記録が電子化されていない現場では、この確認に数日を要します。校正記録の電子化は、クレンジングの前提整備として優先度が高い項目です。検査記録だけを整えても、突合先がなければ判断できません。校正記録の様式を検査記録と揃えることが、突合を楽にする条件です。

入力時点で不備を防ぐ:マスタ整備と選択式入力

クレンジングは、発生した不備を後から直す作業にすぎません。毎月同じ作業を繰り返すことになれば、担当者の負担は積み上がる一方です。根本的な解決策は、入力の時点で不備が生まれない仕組みへ切り替える取り組みにあります。最も効果が大きいのは、自由入力欄を選択式に変更する方法です。不良名称をプルダウンにするだけで、表記ゆれはほぼ消滅します。選択肢の設計に1〜2週間かければ、その後の整備工数を毎月削減できるのです。

設計上の要点は、選択肢の数を現場が扱える範囲に絞ることです。不良名称が50種類を超えると、現場は「その他」を選ぶようになります。大分類10種類、中分類で各3〜5種類という2階層構成が扱いやすいです。選択肢の追加要望は、月1回まとめて審議する運用にします。随時追加を認めると、結局は自由入力と同じ状態に戻るためです。マスタの管理責任者を1名決めておくと、この運用が回り始めます。責任者の役割は、選択肢の追加可否を判断し、変更履歴を残すことです。

マスタデータとは?具体例でクイックに解説!

品質データ定義書を運用に組み込む

データ定義書とは、各項目の意味と入力ルールを明文化した資料を指します。必要なのは、項目名、意味、データ型、単位、必須区分、記入例の6列です。この資料がないと、担当者が交代した瞬間に入力基準が変わります。基準の変化は、数カ月後にデータの断層として現れるものです。定義書は作成するだけでなく、運用に組み込まなければ意味を持ちません。引き出しにしまわれた定義書は、存在しないのと同じです。置き場所は、現場が業務中に開ける場所を選びます。

運用へ組み込むための具体策を、3つ挙げます。新任者教育への組み込み、年1回の見直し、変更時の周知ルールの3点です。配属時に30分の入力研修を組み込むと、初期のばらつきを大きく抑えられます。研修の有無で、入力誤りの発生率に2倍近い差が出るという報告もあるほどです。見直しは年1回で足り、頻繁に変えると現場が追いつきません。変更を周知する経路を決めておくことが、定着の条件です。周知の経路は、朝礼と掲示板の2系統に決めておくと漏れが減ります。

  • 新任者教育:配属時に定義書を用いた入力研修を30分実施する
  • 定期見直し:年1回、品質保証と製造の担当者で記載内容を確認する
  • 変更管理:項目の追加や意味の変更は、朝礼での周知と定義書の改訂をセットで行う

よくある失敗パターンと回避策

同じ失敗が、業種や規模を問わず繰り返し起きています。事前に知っておくだけで避けられるものがほとんどです。ここでは相談の場でよく聞く5つのパターンと、その回避策を示します。

一括置換により本来の不良傾向まで消してしまう

表記ゆれを直す際、置換機能を一括で走らせる方法が真っ先に思い浮かびます。この手軽さが、最も多い失敗の入口です。「キズ」を「傷」に置換したところ、「キズミ」という別の語まで変換された例があります。部分一致による意図しない変換が、静かにデータを壊していくのです。置換後の値が一見正常に見えるため、誤りの発見が半年後になることも起こります。気づいた時点では、元の値がすでに残っていないという展開が最悪です。

回避策は、完全一致による置換と対応表の併用です。部分一致の置換は、品質データに対しては原則使いません。対応表方式なら、変換前後の値が1対1で記録として残るので追跡が容易です。置換前に必ずバックアップを取り、件数の変化を確認します。変換対象の件数が事前の想定と食い違ったら、そこで手を止めるのが賢明です。想定件数を先に見積もっておくと、この確認が機能します。見積もりなしの置換は、結果の正しさを判定できない作業です。

クレンジング基準が属人化し、再現できなくなる

1人の担当者がExcel上で手作業を重ねると、処理内容が本人の頭の中だけに残ります。異動や退職の時点で、同じ処理を再現できる人が誰もいなくなるという事態です。翌月の分析で数字が合わず、原因も追えないという状況に陥ります。属人化の怖さは、問題が顕在化するタイミングが遅いという点です。担当者がいる間は、誰も不都合を感じません。いなくなって初めて、仕組みが存在しなかったと分かるのです。引き継ぎ資料を作る前に異動が決まる例も、珍しくありません。

回避策の中心は、処理の手順化と自動化です。手順化では、操作内容を上から順に書き下した文書を用意します。「どの列を」「どう変換し」「なぜそう判断したか」の3点を必ず含めるのが要点です。自動化まで進める場合は、PythonやTableau Prepなどのツールを使います。処理内容がファイルとして残るため、手順書と実装が一致する点が利点です。自動化の初期構築には、5〜15人日程度を見込みます。手順書と処理ファイルは、同じ場所で管理するのが運用上の要点です。

過去データのみを整備し、発生源の運用を放置する

過去3年分のデータを整備し終えて、取り組みが完了したと考えてしまう例があります。翌月から入ってくる新しいデータは、以前と同じ形式のままです。結果として、毎月同じクレンジング作業が発生し続けます。担当者の負荷は減らず、取り組みへの評価も下がっていくものです。過去データの整備と発生源の改善は、必ずセットで計画します。片方だけを実施する計画は、最初から見直すべき内容です。発生源の改善に必要な期間も、初期の計画段階で確保しておきます。

発生源の改善で着手しやすいのは、入力フォームの見直しです。既存の帳票を1枚選び、自由入力欄を選択式に変えるところから始めます。1帳票あたりの改修工数は、システム改修を伴わなければ2〜5人日が目安です。効果は翌月のデータから確認でき、関係者の納得も得やすくなります。小さな成功を先に作ることが、全体を進めるうえでの推進力です。大規模な基幹システム改修から入る計画は、承認までに時間がかかりすぎます。改修の順番は、不備件数の多い帳票から選ぶのが効率的です。

目的を決めずに全項目の整備に着手し、途中で頓挫する

「とりあえずデータをきれいにする」という進め方は、高い確率で失敗します。終わりが定義されていないため、どこまでやれば完了なのか誰にも分からないためです。対象項目が数百に及ぶと、半年たっても3割程度しか進みません。その間に成果が出ないので、取り組み自体が中断される流れになるのです。防ぐには、最初に分析テーマを1つ決めておきます。テーマが決まれば、必要な項目は20〜30に絞り込めるはずです。テーマの選定では、経営層が関心を持つ不良から選ぶと支援を得やすくなります。

絞り込みで有効なのは、使う指標から逆算して項目を並べる方法です。不良率を分析するなら、生産数、不良数、品目、工程、日付の5項目が起点になります。原因分析まで広げるなら、設備、作業者、材料ロット、工程条件が追加で必要です。この段階でも、対象は30項目前後に収まります。残る項目は、次のテーマに着手するときに整備すれば十分です。1テーマあたり2〜3カ月で1周する計画が、現実的なペースになります。項目を絞る作業自体が、分析設計の一部だと考えると納得しやすいはずです。

現場の入力負荷が増え、記録精度がかえって落ちる

データを整備する過程で、記録項目を増やしたくなる場面が必ず訪れます。分析側から見れば、項目は多いほど良いと考えるのが自然です。しかし入力する現場では、1項目の追加が毎日の作業時間に直結します。1件あたり10秒の増加でも、1日200件なら30分を超える負担です。負担が閾値を超えると、記録の質が急速に落ちます。前の値をコピーする、まとめて後から入力するという行動が始まるのです。記録の質が落ちれば、分析の前提そのものが崩れてしまいます。

回避の原則は、項目を増やすなら同時に減らすことです。追加する項目と同数以上を廃止できないか、必ず検討します。廃止候補は、過去2年間で一度も分析に使われていない項目です。実際に確認すると、記録項目の3〜4割が該当する現場も見つかります。入力方式の改善も同時に進めると、負担はさらに下げられるはずです。バーコード読み取りや設備からの自動取得に切り替える方法も併用します。現場の作業を一度観察してから設計する姿勢が、失敗を防ぐ近道です。

品質データクレンジングの取り組み事例

実際の取り組みを知ると、自社での進め方を具体的に描きやすくなります。取り上げるのは、業種の異なる3社の例です。着手範囲、実施内容、得られた成果の3点に絞って紹介します。

自動車部品メーカー:不良コード体系の統合による分析工数の削減

複数工場を持つ自動車部品メーカーで、工場ごとに不良コードが独自に運用されていました。同じ不良に対して、A工場は「D-12」、B工場は「NG-3」を使うという状態です。全社の不良傾向を把握する会議のたびに、担当者が手作業で読み替えていました。月次会議の資料作成に、3人で5日を要していたというのが着手前の状況です。取り組みでは、全社共通の不良コード体系を新たに定義しました。大分類12種類、中分類48種類という2階層の構成です。

旧コードと新コードの対応表を工場ごとに作成し、過去2年分に適用しました。対応表の作成には、各工場の品質保証担当者との協議で2カ月を要したそうです。移行後は、月次資料の作成工数が3人で1日まで下がりました。削減率は8割に達し、浮いた時間の使い道は現場での要因調査です。副次的な効果として、工場間の比較が初めて可能になりました。同じ工程で不良率に3倍の差があると判明したのは、統合後の発見です。統合作業の推進役は、本社の品質部門が担うと調整が進みます。

食品メーカー:検査記録の電子化と単位統一による帳票作成の効率化

食品メーカーでは、微生物検査や理化学検査の記録が紙で管理されていました。記録の単位も、担当者によってCFU/gとCFU/mLが混在していた状況です。顧客提出用の分析証明書を作る際、単位を確認しながら転記していました。1件あたり20〜30分、月に150件という作業量です。転記ミスによる再発行も、月に数件は発生していました。担当者の負荷と品質リスクが同時に存在する状態だったのです。電子化と単位統一を同時に進める判断が、ここでの出発点になります。

取り組みでは、まず検査項目ごとに使用する単位を1つに固定しました。単位を項目名に含める命名規則へ変更したことで、入力段階での混在は発生しなくなったのです。あわせて、タブレット端末での入力に切り替えました。選択式の入力画面を用意し、規格外の値には警告を表示する仕組みです。証明書の作成は自動出力となり、1件あたり3分程度に短縮されました。投資額は端末とシステムを含めて数百万円規模、回収期間は1年強という試算です。

電子部品メーカー:設備ログと検査データの紐付けによる工程分析の実現

電子部品メーカーでは、製造設備のログを1秒単位で蓄積していました。検査データのほうは、ロット単位でしか記録されていない構成です。粒度が違うため、不良と設備条件の関係を分析できませんでした。設備ログは大量に存在するのに、活用の入口がないという状態です。取り組みでは、ロットの投入時刻と完了時刻を記録する仕組みを追加しました。時刻の範囲が分かれば、該当する設備ログを抽出できるという発想です。時刻の記録は、既存の生産管理システムへの小さな追加で実現しました。

設備ログ側は、ロット単位で平均値、最大値、最小値、標準偏差に集約しました。1秒単位のデータを、検査データと同じ粒度に揃える処理です。集約後のデータ量は、元の1000分の1以下まで減りました。分析に使える形になったうえ、保管コストも下がるという二重の効果です。分析の結果、特定の温度帯で不良率が2倍になることが判明しました。設備の設定変更により、該当不良は3カ月で6割減という成果につながったそうです。

まとめ:品質データは「整えてから活かす」が原則

品質データのクレンジングは、分析の準備作業として軽く扱われがちです。実際には、分析結果の正しさを決める中核の工程にあたります。本記事で扱った内容を、着手の順序に沿って整理します。

  • 分析テーマを1つに絞り、対象期間と品目を限定してから着手する
  • プロファイリングで不備の所在を可視化し、優先順位を決める
  • 表記ゆれと単位は対応表で機械的に統一し、手作業に頼らない
  • 外れ値は不良の兆候として扱い、目的別にデータを作り分ける
  • 原本と変更履歴を必ず残し、処理を再現できる状態を保つ
  • 過去データの整備と発生源の改善を、同じ計画に含める

最初の1カ月で取り組む範囲は、目的の定義とプロファイリングまでで十分です。対象を上位3品目、直近1年分に絞れば、担当者1人でも進められます。その結果をもとに、全社展開するかどうかを判断する順序が現実的です。小さく始めて成果を示す進め方が、社内の合意形成にも効きます。最初から完璧な基盤を目指す計画は、承認の段階で止まりやすいものです。まずは手元の1テーブルを開くところから始めます。

整備されたデータは、分析だけでなく現場の日常業務も変えます。不良の傾向が即座に見えることで、対策の議論が具体的になるためです。品質データを整える作業は、品質管理そのものの一部だと捉えられます。整えてから活かすという順序を守れるかどうかが、成否の分かれ目です。判断に迷う論点は、基準を文書化して関係者と合意する手順で解決します。本記事の内容を、自社の状況に合わせて取捨選択しながらご活用ください。

「これから品質データに関する取り組みを実施したいけれど、何から手をつけたらいいかわからない」「データ専門家の知見を取り入れたい」という方は、品質データ領域の実績豊富な弊社、データビズラボにお気軽にご相談ください。

貴社の課題や状況に合わせて、品質データの活用やクレンジングの進め方をご提案させていただきます。

データビズラボの実績無料相談・お見積り

このブログについて

データビズラボが運営する、データの価値を最大化するためのナレッジ共有メディアです。
戦略策定から具体的な分析手法、ツールの活用術まで、データの現場で培われた実践的な取り組みから
得られた知見や気づきを発信しています。

データのことなら、
まずはお気軽にご相談ください。

データ活用に、万能の正解はありません。
貴社の業界特性や課題に合わせて、最適な進め方を一緒に設計します。