
「設備からデータは取れているのに、集計するたびに数値が合わない」という相談を、当社は製造業の現場から数多く受けています。稼働率を出すたびに値が変わる、同じ品番なのに集計表で3行に分かれるという状態では、分析結果を経営判断に使えません。原因の多くはデータそのものではなく、収集したあとの整え方にあります。
生産データのクレンジングは、欠損や重複を機械的に取り除くだけの単純作業ではありません。設備の仕様や工程の事情を踏まえ、どこまでを「正しい記録」とみなすかを決める設計作業です。この基準を決めないまま集計ツールだけ導入しても、担当者ごとに異なる数値が量産されるのが実情です。
本記事では、生産データに生じやすい不備の型、6段階の進め方、精度を高める要点、現場で頻発する失敗パターンまでを順に解説します。自社のどのラインから着手し、どの手段を選ぶべきかを判断する材料として活用してください。
目次
生産データのクレンジングとは
生産データのクレンジングを検討する前に、対象範囲と作業の定義をそろえる必要があります。ここで整理するのは、扱うデータの種類、前処理やデータ統合との線引き、製造現場特有の品質低下要因という3点です。読み進めれば、自社のどのデータから手をつけるべきかの当たりがつきます。
生産データの範囲:設備稼働・工程実績・品質・作業日報
生産データと一口に言っても、発生源によって性質は大きく異なります。設備稼働データはPLCやSCADA、IoTゲートウェイ経由で秒単位から分単位で自動収集され、1ラインあたり1日数十万レコードに達することもあるのです。工程実績データはMESや生産管理システムから、ロット単位・作業単位で1日数百件から数千件が登録されます。品質データは検査装置の自動出力と検査員の手入力が混在しており、作業日報にいたっては紙やExcelを起点とする手入力が中心です。自動収集と手入力が同居している点が、生産データの整備を難しくしています。
- 設備稼働データ:PLC・SCADA・IoTゲートウェイ経由。秒から分単位で自動収集される
- 工程実績データ:MES・生産管理システム経由。ロット単位・作業単位で半自動的に登録される
- 品質データ:検査装置の自動出力と、検査員による目視結果の手入力が混在する
- 作業日報:紙やExcelを起点とした手入力が中心。備考欄に自由記述が集まる
計画を立てる前に、この4系統を1枚の表に落とし、発生源・粒度・更新頻度・保有期間を並べて確認してください。設備稼働データだけを対象に着手し、工程実績と突き合わせた段階で品番マスタの不整合に気づく、という手戻りは現場で頻発します。棚卸しの所要時間は、1ライン・4系統でおおむね3〜5人日が目安です。拠点をまたぐ場合は、拠点ごとに同じ表を作り、列の定義が一致しているかを先に照合します。この最初の1枚がないまま処理を書き始めると、後工程のすべてがやり直しになります。
製造業のデータ分析はなぜ必要?解決できる課題やメリットなどを解説
クレンジングと前処理・データ統合との違い
現場では「データを綺麗にする」という言葉が、まったく違う3つの作業を指して使われています。クレンジングは、記録された値の誤り・欠け・ゆれを取り除いて信頼できる状態にする作業です。前処理は、分析やモデル学習の目的に合わせて集計・変換・特徴量作成を行う作業を指します。データ統合は、複数システムに分かれた情報を共通のキーで結合し、1つのテーブルとして扱えるようにする作業です。3つを混同したまま担当を割り振ると、誰も値の正しさに責任を持たない状態が生まれます。
区分 | 目的 | 主な作業 | 実施タイミング |
|---|---|---|---|
クレンジング | 記録の正しさを担保する | 欠損補完・重複排除・表記統一・単位換算 | 蓄積直後および定期実行 |
前処理 | 分析や学習の目的に合わせる | 集計・型変換・特徴量作成・標準化 | 分析テーマが決まったあと |
データ統合 | 分散した情報を結合する | キー設計・名寄せ・テーブル結合 | クレンジングと並行から後 |
順序を誤ると作業量が跳ね上がります。表記ゆれを残したままデータ統合に進めば、結合キーが一致せず突合率が50〜70%程度にとどまるのです。クレンジングで単位と品番コードをそろえてから結合すれば、同じデータでも突合率は90%を超えます。判断基準は単純で、複数システムをまたぐ結合作業の前に、単一システム内の値の整えを終わらせておくことです。分析要件が固まっていない段階でも、クレンジングだけは先行して進められます。
データクレンジングとは?意味と代表手法を解説!
製造現場のデータで品質が低下しやすい構造的な理由
生産データの品質が落ちる理由は、担当者の注意不足ではなく構造にあります。1つ目は、設備の導入時期が10年以上ばらつき、通信規格もデータ形式も統一されていない点です。2つ目は、記録の主目的が分析ではなく、その場の作業指示と法定記録である点にあります。3つ目として、現場改善のたびに工程名や設備呼称が変わり、過去データとの互換性が失われていく事情も挙げられます。放置すれば品質が下がる方向にしか進まない仕組みが、最初から埋め込まれているのです。
この構造を前提にすると、対策の方向性は明確です。個人のスキルに頼る運用ではなく、命名規則と入力制約をシステム側に持たせる方向へ寄せていきます。たとえば作業日報の設備名を自由入力から選択式に変えるだけで、表記ゆれは9割以上減ります。入力制約の追加はシステム改修を伴うため、着手前に情報システム部門と改修範囲を握っておくのです。設備を更新する際は、旧設備IDと新設備IDの対応表を必ず残してください。対応表がないと、更新前後をまたぐ分析は実質的に不可能になります。
生産データに生じやすい不備のパターンと発生要因
不備の型を知っておくと、原因の特定にかかる時間が大きく短縮されます。生産データで頻出するのは、欠損・重複・表記ゆれ・時刻の不整合・単位や桁の不統一・外れ値という6種類です。それぞれ発生要因と見つけ方が異なるため、順に確認していきます。
欠損:チョコ停や手入力漏れによる記録の抜け
欠損は、値が空欄になっている状態だけを指すわけではありません。生産現場では、レコードそのものが存在しない「行の欠落」が問題になるのです。代表例がチョコ停で、数十秒から数分の短時間停止は設備側の閾値設定によって停止記録として残らないことがあります。その結果、稼働時間の合計と実際の生産時間が合わず、稼働率が実態より高く算出されるのです。作業日報側でも、繁忙時間帯の記録がまとめて翌日に転記され、日付単位の集計が崩れてしまうのです。
欠損を見つける手順は決まっています。タイムスタンプの連続性をチェックし、期待されるサンプリング周期に対して抜けている区間を抽出します。続いて、設備稼働ログの停止コード別件数を月次で並べ、特定コードだけが極端に少ない月を探してください。1日あたりの記録件数が平常時の80%を下回る日は、要調査として一覧化します。この2つの確認だけで、記録の抜けはおおむね把握できるものです。欠損は「空欄を探す」のではなく「あるはずの行を数える」ことで初めて見つかります。
重複:設備からの再送信・二重登録による同一レコード
重複レコードは、通信の再送信と人による二重登録という2つの経路で発生します。IoTゲートウェイやMQTTブローカーは、応答が返らない場合に同じメッセージを再送する仕組みを持っています。受信側にべき等性の担保がなければ、まったく同じ値の行が2件3件と積み上がるのです。人起因では、ロット完了報告を作業者と班長の双方が登録する運用や、システム障害後の手動再入力が典型例です。件数としては、1か月分の実績データで0.5〜3%程度の重複が見つかるケースが多くなっています。
重複判定は、完全一致だけでは取りこぼします。設備IDとタイムスタンプと測定値がすべて一致する行は機械的に削除できますが、再送時にミリ秒がずれる実装も存在するのです。実務では、設備ID・品番・秒単位に丸めたタイムスタンプの3項目を複合キーとし、同一キー内で最新の受信時刻を持つ1件を残す方式が扱いやすくなっています。削除ではなく重複フラグを立てて残す設計にしておけば、後から判定ロジックを見直せます。判定ルールを変える可能性が少しでもあるなら、フラグ方式を選んでください。
表記ゆれ:品番・設備名・工程名の命名規則の不統一
表記ゆれは、生産データで最も件数が多い不備です。同じ品番が「AB-1234」「AB1234」「ab-1234」「AB-1234」の4通りで登録されている状況は珍しくありません。設備名では「1号機」「1号ライン」「No.1」「#1」が混在し、工程名では「組立」「組み立て」「アッセンブリ」が並ぶのです。原因は、システムごとに入力形式の制約が異なる点と、拠点ごとに慣習的な呼称が定着している点にあります。買収や工場統合を経た企業では、同じ設備に3世代分の名称が残っている例もあるのです。
表記ゆれの棚卸しは、SQLのGROUP BYかExcelのピボットテーブルで足ります。品番列の一意値を件数付きで出力し、出現回数が1〜2件の値だけを抽出すると、ゆれの候補が短時間で浮かび上がります。5,000品番規模なら、抽出から目視確認まで1〜2人日が目安です。確認の際は、大文字小文字・全角半角・ハイフン有無・前後の空白という4観点を必ずチェックしてください。空白は目視で見つからないため、文字数と表示長の差を計算する列を作って機械的に検出します。
時刻の不整合:設備間の時刻ずれとサンプリング周期の差
工程間の因果を追う分析では、時刻のずれが1秒あるだけで結論が変わります。設備の内蔵時計はNTP同期がされていない限り、月に数秒から数十秒の単位でドリフトしていきます。導入時期の異なる設備が並ぶラインでは、上流工程の加工完了時刻が下流工程の投入時刻より後になるという、物理的にありえない記録が生まれるのです。サンプリング周期も、温度センサーは1秒間隔、電力計は1分間隔、検査装置はロット単位というように統一されていません。周期の異なるデータをそのまま結合すると、値が飛ぶ区間が大量に発生するのです。
時刻の整合性は、3つの手順で確保します。1つ目は、全設備のNTP同期設定を確認し、未設定の設備を洗い出す作業です。2つ目は、データ側にタイムゾーンとオフセットの列を明示的に持たせ、夏時間や海外拠点との差を吸収させます。3つ目は、分析に使う最小粒度を決め、細かいデータをその粒度へ集約するルールを定めることです。工程間の因果分析が目的なら1秒粒度、日次の稼働率管理が目的なら1分粒度で十分そろいます。設備間のずれが5秒を超える場合は、クレンジングより先に設備側の設定変更を依頼してください。
単位・桁の不統一:ライン別・拠点別の計測基準の違い
単位の不統一は、値の大きさが数百倍から数千倍変わるため影響が大きい不備です。重量をkgで記録するラインとgで記録するライン、圧力をMPaとkPaで扱う設備が同居している状況は、複数拠点を持つ企業では標準的に見られます。温度の小数点以下の桁数も、設備によって0桁・1桁・2桁とばらつきます。海外拠点が加わると、インチやポンド系の値が混在するのです。単位が列名やコメントにしか書かれておらず、データ本体からは判別できない点が問題を長引かせています。
単位の統一は、値の分布を見れば機械的に検出できます。同じ測定項目の値をライン別にヒストグラム化し、中央値が10倍や1,000倍の単位でずれている系列を探してください。検出したら、変換式と適用対象を1行1ルールで管理表に書き出します。管理表には、対象列名・変換前単位・変換後単位・係数・適用開始日の5項目を持たせておくと、後から検証しやすくなるのです。桁数については、分析側で丸めるのではなく、取得できる最大桁のまま保持して集計時に丸める方針を推奨します。
外れ値:設備異常の兆候と単純な計測ノイズの混在
外れ値は、除去すべきものと残すべきものが混在している点が厄介です。センサーの一時的な誤動作で発生する値は、統計的に見て明らかに範囲外であり、除去して問題ありません。ところが、軸受の摩耗で振動値が徐々に上昇していく場合、その外れ値こそが設備故障の予兆そのものです。品質不良の分析でも、規格外の測定値を先に落としてしまうと、不良発生のメカニズムが見えなくなります。除去の判断は統計処理だけでは完結せず、現場の知見と組み合わせる必要があります。
- 持続時間:単発の1点か、複数点にわたって連続しているか
- 同時性:複数のセンサーで同時に検出されているか、単独か
- 再現性:過去に同じパターンの発生履歴があるか
この3条件のうち「単発・単独・履歴なし」がそろえばノイズの可能性が高く、「連続・複数・履歴あり」ならば設備異常を疑います。判定にはスミルノフ・グラブス検定や四分位範囲による方法を用いますが、閾値は現場と合意したうえで決めてください。実務では、箱ひげ図で分布を可視化し、上下のひげから外れる点を保全担当者と一緒に確認する進め方が定着しやすくなっています。振動値や電流値のように予兆管理の対象となる項目は、外れ値の自動除去を初期設定でオフにしておく判断が安全です。
箱ひげ図とは?外れ値の見方やExcelでの作成方法まで徹底解説
生産データをクレンジングすることで解決できること
クレンジングは手段であり、投資判断の場では成果の説明が求められます。整備によって何が変わるのかを、生産指標の精度、工程比較の成立、データ活用の前提、監査対応の工数という4つの観点で示します。社内稟議で使える論点として押さえておいてください。
稼働率・OEEなど生産指標の算出精度が安定する
生産指標の代表格であるOEE(Overall Equipment Effectiveness)は、時間稼働率・性能稼働率・良品率の3要素を掛け合わせて算出します。分子と分母のどちらにも設備稼働ログと生産実績が使われるため、記録の欠けや重複がそのまま指標の誤差になるのです。チョコ停が記録されていないラインでは、時間稼働率が実態より5〜15ポイント高く出る例が報告されています。改善活動の効果を測る指標が実態とずれていれば、投資の優先順位を誤ります。数値の信頼性は、改善サイクルを回すための前提そのものです。
クレンジング後に指標がどう変わるかは、事前と事後の両方を並べて確認してください。導入現場では、重複排除と欠損補完を行った結果、OEEの月次推移のばらつきが±8ポイントから±2ポイント程度まで縮小した例があります。指標が大きく動かなくなること自体が、データが整った何よりの証拠です。経営層への説明では、数値が上がった下がったではなく、月ごとの振れ幅が小さくなった点を示します。振れ幅の縮小は、改善施策の効果を検出できる状態になったことを意味しています。
不良要因の分析で工程間の比較が成り立つ
不良要因の分析は、工程間・ライン間・拠点間の比較が成り立って初めて機能します。品番コードが統一されていなければ、同じ製品の不良率を2つのラインで比較する作業すらできません。単位が異なれば、加工条件と不良率の相関を取っても意味のない係数が出るだけです。クレンジングによって比較の土台がそろうと、これまで勘と経験で語られていた工程差が数値で説明できるようになります。要因分析の議論が、担当者の主張の応酬から数値の解釈へと変わるのです。
比較を成立させるうえで最低限そろえるべき項目は決まっています。品番、工程コード、設備ID、作業者区分、測定単位、時刻の粒度という6項目です。この6項目の整備が終われば、層別分析やパレート分析はExcelのピボットテーブルでも実行できます。実務では不良コードの体系が拠点ごとに異なる点が最後の壁になりますので、統合コードと各拠点コードの対応表を先に作ってください。対応表の作成には、拠点数と不良コード数に応じておおむね5〜10人日を見込みます。
需要予測や異常検知などのデータ活用に耐える状態になる
機械学習を用いた需要予測や異常検知は、入力データの品質がそのまま精度に直結します。欠損の多い時系列を学習させれば、モデルは欠損のパターンそのものを学習してしまうのです。表記ゆれが残る品番でカテゴリ変数を作れば、同一製品が別カテゴリとして扱われ、学習データが分散します。異常検知では、ノイズと真の異常が区別されていないデータで学習すると、誤検知が多発して現場から使われなくなるのです。モデルの選定に時間をかける前に、入力の整備へ着手する判断が結果を左右します。
着手可否の判断には、簡易な品質チェックが使えます。予測対象期間のデータについて、欠損率5%未満、重複率1%未満、キー項目の一意性99%以上という3つの水準を最初に確認してください。この水準を下回る場合は、モデル構築を始めずクレンジングを優先します。目安として、1年分の時系列データで欠損が20%を超えていると、補完によって作り出した値が学習結果を支配する危険が高まります。データが足りない期間は、無理に補完せず学習対象から除外する判断も有効です。
トレーサビリティ照会や監査対応の工数を削減できる
品質問題が発生した際のトレーサビリティ照会は、時間との勝負になります。特定ロットに使われた原材料、加工した設備、作業者、検査結果を、複数システムから短時間で引き当てる必要があるのです。データが整備されていない状態では、担当者が手作業でExcelを突き合わせ、回答までに2〜3日を要する例が珍しくありません。整備後は、ロット番号を起点とした照会が数分で完了する状態になるのです。回収範囲の絞り込みが早まれば、対象数量と対応コストの両方を圧縮できます。
監査対応でも、クレンジングの記録そのものが説明材料になります。ISO9001やIATF16949の審査では、データの加工履歴を問われる場面があるためです。どの列に、いつ、どのルールで、誰の承認のもとに変更を加えたかを残しておけば、その場で提示できます。実務では、処理ログをCSVで日次出力し、変更件数と対象列を月次でまとめる運用が扱いやすくなっています。ログの保存期間は、製品の保証期間と法定保存年限のうち長いほうに合わせて設定してください。
生産データのクレンジングの進め方
実際の進め方は、6段階に分けると管理しやすくなります。棚卸しから始めて品質基準を定義し、標準化・欠損と重複の処理・名寄せを経て、検証と定着まで進める流れです。各段階で決めるべきことと、飛ばすと後戻りが発生する箇所を具体的に示します。
STEP1 データの棚卸し:発生源・粒度・保有期間の把握
棚卸しでは、対象データの全体像を1枚の管理表にまとめます。記載する項目は、システム名・テーブル名・列名・発生源・粒度・更新頻度・保有期間・所管部署の8つです。列名だけを並べても意味がないため、実際の値を10行程度サンプル抽出して管理表に添付してください。この作業を通じて、誰も使っていないテーブルや、同じ内容が2箇所に保存されている状態が見つかります。1ライン・4系統の規模で、3〜5人日が目安になります。
棚卸しでつまずきやすいのは、所管部署の特定です。設備データは保全部門、実績データは生産管理部門、品質データは品質保証部門と分かれており、部門をまたぐ調整に想定以上の時間がかかります。着手前に、各部門から1名ずつ窓口担当を出してもらう体制を作ってください。窓口が決まらないまま個別の問い合わせを繰り返すと、棚卸しだけで2か月を費やす事態になりかねません。管理表は共有ドライブに置き、更新履歴が残る形式で運用します。
STEP2 品質基準の定義:許容範囲と必須項目の合意形成
品質基準がないまま処理を始めると、何をもって完了とするかが決まりません。定義すべきは、必須項目・値の許容範囲・許容できる欠損率・重複の判定条件・更新遅延の許容時間という5点です。たとえば温度センサーであれば、物理的にありえない範囲を除外条件として設定します。設備の仕様書に記載された測定レンジをそのまま許容範囲に使う方法が、合意を得やすい進め方です。範囲の設定は、保全部門と品質保証部門の双方に確認を取ってください。
基準づくりで時間を溶かしやすいのが、完璧な定義を目指してしまう進め方です。最初から全項目の基準を作ろうとせず、分析に使う10〜20項目に絞って着手します。残りの項目は基準未定義と明示したうえで、そのまま保持しておけば問題ありません。対象項目の選定は、直近の分析で実際に参照した列を洗い出す方法が確実です。基準は文書化し、版番号と承認日を記載して共有ドライブで管理してください。3か月ごとに見直す前提で作れば、初版の完成度に悩む時間を減らせます。
データ品質とは?品質評価項目や品質を向上させるための実務的対策を解説
STEP3 標準化・正規化:コード体系と単位・時刻の統一
標準化では、表記のゆれと単位の違いを機械的に処理できる状態へそろえます。品番は大文字・半角・ハイフンなしという形式に統一する、といった変換ルールを列ごとに定義します。全角半角の変換、前後空白の除去、英字の大文字化は、ほぼすべての文字列列に共通して適用できる処理です。設備名や工程名は、正規のコードと表示名を分離し、実績データにはコードだけを保持させる設計にします。表示名を直接持たせると、呼称変更のたびに過去データの書き換えが必要になるのです。
変換ルールは、コードに直書きせず設定ファイルや変換テーブルとして外出ししてください。PythonのpandasやSQLのCASE式で処理する場合でも、変換内容そのものはCSVで管理し、コードはそれを読み込む形にします。ルール件数は、5,000品番規模のラインで100〜300件程度になるのが一般的です。適用の前後で件数と一意値数を必ず記録し、想定外の統合が起きていないかを確認します。品番の一意値数が急減した場合は、異なる製品を同一視した可能性を疑ってください。
STEP4 欠損・重複の処理:補完可否の判断と処理ルール化
欠損への対処は、補完・除外・そのまま保持の3択から選びます。判断の基準になるのは、欠損の発生パターンと分析への影響度です。ランダムに発生している欠損であれば、前後の値からの線形補間や直前値の繰り返しで対応できます。特定の時間帯や特定設備に偏って発生している欠損は、補完すると分析結果を歪めるため除外を選びます。補完した値には必ず補完フラグ列を持たせ、後から元の状態を再現できるようにしておいてください。
手法 | 適する条件 | 主なリスク | 実装の手間 |
|---|---|---|---|
直前値の繰り返し | 変化が緩やかな温度・圧力データ | 変化点を平坦化してしまう | 小 |
線形補間 | 連続的に変化する時系列データ | 急変時に実態とずれる | 小 |
代表値での補完 | 欠損率が5%未満の離散項目 | 分布の分散が縮む | 中 |
補完せず除外 | 欠損が特定条件に偏っている場合 | 対象期間のデータ量が減る | 小 |
重複処理は、判定と削除を分けて設計します。判定ロジックで重複フラグを立てる処理と、フラグの立った行を除外する処理を別の段階にしておけば、判定基準の見直しがデータの再取得なしで行えます。処理は必ずべき等に組み、同じ入力に対して何度実行しても結果が変わらない状態を保ってください。日次バッチが二重起動した場合でも、べき等性が確保されていればデータは壊れません。処理件数、除外件数、フラグ件数の3つは実行ごとにログへ書き出します。
STEP5 名寄せ:品番・設備マスタと実績データの突合
名寄せは、実績データの品番や設備名を、正式なマスタデータに突き合わせて統一する作業です。完全一致で突合し、残った未突合分に対して段階的に条件を緩めていく進め方が基本になります。1段階目は完全一致、2段階目は大文字小文字と空白を無視した一致、3段階目は編集距離を用いたあいまい一致という順です。あいまい一致は誤結合の危険があるため、必ず人による確認を挟んでください。突合率は、標準化を済ませていれば初回から90%以上に届きます。
未突合として残った行は、放置せず分類してください。マスタ側に登録がない新規品番、廃番済みの旧品番、入力誤りの3種類に分けると、対応先が明確になります。新規品番はマスタ登録、旧品番は履歴付きで保持、入力誤りは修正ルールへ追加という流れです。突合結果を1つのレコードに統合する際は、どのシステムの値を正とするかを列ごとに決めたゴールデンレコードの定義が必要になります。優先順位は、更新頻度が高く入力制約が強いシステムを上位に置く考え方が実務的です。
名寄せとは?正確な顧客データ管理の方法と活用ポイントを徹底解説
STEP6 検証と定着:処理ログの記録と定期実行への組み込み
処理を書き終えた段階では、まだ半分しか終わっていません。検証では、処理前後のレコード件数、一意値数、欠損率、合計値という4指標を比較します。合計値が想定外に変動している場合は、単位変換の適用漏れか重複削除の過剰実行を疑ってください。検証結果は日付付きで保存し、次回実行時の比較対象として使います。比較結果は表計算ソフトの1シートにまとめ、実行日ごとに行を追加していくのです。手作業で1回だけ処理した状態は、数か月で元の品質に戻るのです。
定着させるには、処理を定期実行の仕組みへ組み込みます。日次バッチであればcronやAirflow、Azure Data Factoryなどのワークフロー基盤に載せ、実行結果を担当者へ自動通知する構成にしてください。通知内容には、処理件数、エラー件数、品質基準を外れた件数の3項目を含めます。品質基準を外れた件数が前日比で2倍を超えた場合にアラートを出す設定にしておけば、設備側の変更にも気づけます。運用開始から3か月は、週1回の目視確認を並行させる進め方が安全です。
生産データのクレンジング精度を高める要点
手順どおりに進めても、設計を誤ると精度は上がりません。ここで扱うのは、データの保持方法、処理の順序、外れ値の扱い、現場知見の文書化、履歴管理という5つの要点です。いずれも、後戻りのコストを大きく左右する判断になります。
生データを保持したまま加工データを分離して管理する
クレンジングの結果を元データに上書きする運用は、避けてください。生データ、クレンジング済みデータ、分析用データの3層に分けて保存する構成が基本になります。設備から取得した値をそのまま保持する層があれば、判定ルールを変更しても何度でも作り直せます。ストレージコストを気にする声もありますが、設備稼働データを1年分保持しても、クラウドストレージ費用は月額数千円から数万円の水準です。処理をやり直せない状態のほうが、結果としてはるかに高くつきます。
3層の管理では、層ごとに書き込み権限を分ける設定が効きます。生データ層は書き込み専用とし、更新と削除を禁止する設定にしてください。元の記録を必ず復元できる状態を保つことが、クレンジングの前提条件です。クラウド上であればオブジェクトストレージのバージョニング機能を有効にし、誤操作にも備えます。層ごとの命名規則を決めておけば、どのテーブルがどの段階の状態かが一目で判別できます。層の名称はraw・cleansed・martのように、段階が語順でわかる形式が実務的です。
標準化を名寄せより先に実施して突合率を引き上げる
処理の順序を誤ると、同じ作業を2回行う羽目になります。表記ゆれを残したまま名寄せに進むと、完全一致で突合できる行が減り、あいまい一致に頼る割合が増えるのです。あいまい一致は人による確認工数が発生するため、対象が5,000件を超えると現実的な期間で終わりません。標準化を先に行えば、あいまい一致の対象は数百件規模まで圧縮できるのです。実測では、標準化前の突合率が60%前後だったデータが、標準化後には92%まで改善した例があります。
順序の判断基準は単純です。1つの列の中だけで完結する処理は先に、複数のテーブルをまたぐ処理は後に回します。全角半角の変換や単位換算は前者にあたり、マスタとの突合や工程間の結合は後者にあたるのです。この原則に従うと、処理の依存関係が一方向に整理され、途中からの再実行が容易になります。図はスプレッドシートの1シートで十分ですが、処理名と入出力テーブル名は必ず明記します。処理の順序は図として1枚にまとめ、担当者が変わっても同じ順で実行できる状態にしてください。
外れ値は除去せず「異常候補」として現場判断に回す
外れ値の自動除去は、便利に見えて危険な設定です。統計的な閾値だけで判断すると、設備故障の予兆や品質不良の発生源となる値まで消えてしまいます。実際に、振動値の上昇を外れ値として除去し、故障の予兆を見落とした事例が報告されています。推奨する扱いは、除去ではなくフラグ付けです。閾値を外れた行に異常候補の印を付け、元の値は保持したまま次の工程へ渡します。分析時にフラグを使って除外するか含めるかを選べる状態にしておけば、目的に応じた使い分けができるのです。
フラグの立った行は、保全担当者や品質担当者が確認する運用に乗せてください。週次で一覧を出し、確認結果をノイズ・設備要因・品質要因・判定保留という4区分で記録します。この記録が蓄積されると、閾値の妥当性を検証する材料になり、判定ルールの精度が上がっていきます。件数の目安として、1ラインあたり週10〜30件を超えると確認が回らなくなるため、閾値の調整が必要です。逆に週0件が続く場合は、閾値が緩すぎて予兆を見逃している可能性を疑います。
現場の暗黙知を運用ルールとして文書に落とし込む
生産データの解釈には、現場でしか通用しない知識が数多く埋め込まれています。「この設備の値は立ち上がり30分間は参考値」「この工程の日報は前日分がまとめて入力される」といった知識は、担当者の頭の中にしか存在しません。こうした前提を知らずにクレンジングルールを作ると、正常な記録を異常と判定してしまうのです。文書化の対象になるのは、値の解釈上の注意点、例外的な運用、過去のシステム変更履歴という3つになります。
聞き取りは、1回のヒアリングで済ませようとせず、実データを見ながら行ってください。異常に見える値を10件ほど印刷して現場に持ち込み、1件ずつ理由を尋ねる進め方が効果的です。所要時間は1ラインあたり2〜3時間、対象部門が3つあれば1〜2週間を見込みます。得られた内容は、ルール文書に背景欄を設けて記載し、なぜその処理をするのかを残しておくのです。担当者の異動後にルールの意図がわからなくなり、処理が形骸化する事態を防げます。
クレンジングルールの改訂履歴を残し再現性を確保する
同じ元データから同じ結果が再現できない状態は、分析結果の信頼を損ないます。半年前に作成した資料の数値を再計算したら値が変わっていた、という事態も起こるのです。原因は、処理ルールが更新されたにもかかわらず、いつ何を変えたかの記録が残っていない点にあります。ルールをCSVやYAMLで管理し、Gitでバージョン管理する運用にすれば、変更点の差分がそのまま履歴として残るのです。分析結果には、使用したルールの版番号を必ず添えて出力します。
履歴管理と合わせて整えたいのが、データの流れを追跡できる状態です。どの元データがどの処理を経て、どの集計値になったかをたどれる仕組みをデータリネージと呼びます。専用ツールを導入しなくても、テーブル間の依存関係を1枚の図にまとめ、処理スクリプト名を各矢印に添えるだけで実務上は機能するのです。数値の問い合わせを受けた際、この図があれば確認先を数分で特定できます。図の更新は、処理の追加や変更を行った日に必ず実施してください。
生産データのクレンジングでよくある失敗パターン
失敗の型は限られており、事前に知っておけば大半は回避できます。ここで挙げる5つは、複数の製造業の現場で繰り返し観測されているものです。自社の計画に同じ構造が含まれていないかを照らし合わせながら読み進めてください。
異常値を一括除去して品質不良の予兆を消してしまう
最も損失が大きい失敗が、統計的な外れ値の一括除去です。四分位範囲の1.5倍を超える値をすべて削除する処理を組み込んだ結果、軸受劣化による振動値の上昇傾向が完全に消えた事例があります。予知保全の取り組みで、故障の3週間前から現れていた兆候が学習データに含まれず、モデルが機能しませんでした。除去処理を書く前に、その列が予兆管理の対象かどうかを保全部門へ確認してください。振動、電流、温度、圧力の4項目は、原則として自動除去の対象外とする判断が安全です。
回避策は、除去処理に対象列のホワイトリスト方式を採ることです。自動除去してよい列を明示的に列挙し、リストにない列は必ずフラグ付けにとどめる設計にします。リストの承認者を品質保証部門の責任者に設定しておけば、独断での追加を防げます。リストの見直しは、四半期に1回の頻度で行う運用が現実的です。処理の実行後は、除去件数を列別に集計し、前月比で急増した列を確認する運用を組み込んでください。除去件数の急増は、設備の状態変化を示すサインである場合が多くなっています。
マスタ整備を後回しにして名寄せがやり直しになる
品番マスタや設備マスタの整備は、面倒である一方で先送りできない作業です。マスタが古いまま名寄せを実行すると、廃番品や新規品番が大量に未突合として残ります。未突合分を個別に処理する運用を始めてしまうと、その場しのぎの対応表が増殖し、後から統合できなくなるのです。マスタの現況確認は、登録件数、最終更新日、重複登録の有無、廃番フラグの運用状況という4点から始めます。更新が2年以上止まっているマスタは、そのまま使わずに再整備を前提としてください。
マスタデータ管理(MDM)とは?適切に運用する重要性とその手法を解説
マスタ整備の工数は、品番数と拠点数に比例して増えます。5,000品番・3拠点の規模で、現況調査から統合コード体系の設計まで15〜25人日を見込む例が多いのです。全件を一度に整備する必要はなく、直近1年で実績のある品番に絞れば対象は3〜4割まで減らせます。整備の順序は、実績件数の多い品番から着手し、稀にしか登場しない品番を後回しにする判断が効率的です。マスタの所管部署と更新ルールを、整備と同時に決めておいてください。
担当者個人のスクリプトに依存し運用が属人化する
クレンジング処理が、特定の担当者のPC上にあるスクリプトで動いている状態は珍しくありません。その担当者が異動すれば、処理内容を誰も説明できなくなります。属人化は技術の問題ではなく、実行環境と手順が共有されていない運用の問題です。ローカルPCで動かす前提のコードは、ファイルパスや環境変数が個人の環境に依存しており、他者が実行しても再現しないのです。処理の共有は、コードの受け渡しではなく実行環境ごと移すという考え方で進めます。
脱属人化の最低ラインは、3つの条件を満たすことです。1つ目は、処理コードがバージョン管理システムに登録されている状態になります。2つ目は、実行手順が第三者の環境でそのまま再現できることです。3つ目として、実行環境を個人PCからサーバーやクラウドへ移す必要があります。GitとDockerを使う構成が一般的ですが、共有サーバー上のスケジュール実行に移すだけでも効果はあります。担当者が1週間不在でも処理が止まらない状態を、最初の到達点に設定してください。
一度きりの作業で終わり、数か月後に元の状態へ戻る
プロジェクトとしてクレンジングを実施し、完了報告を出して終わりにする進め方は失敗します。設備は追加され、品番は増え、工程は改善のたびに変わっていくのです。新しい設備が追加された時点で、その設備のデータは標準化ルールの対象外になります。増設や更新が年に数回あるラインでは、半年で対象外のデータが全体の1割に達することもあります。3か月から半年で、整備前と同じ状態に戻る例が繰り返し報告されているのです。クレンジングは一度の作業ではなく、継続的な運用として設計する必要があります。
継続運用に載せる具体策は、変更の発生源に手を打つことです。設備の新規導入、品番の新規登録、工程の変更という3つのイベントについて、データ側の対応をチェックリスト化してください。設備導入の際は、タグ名の命名規則適用、NTP同期設定、データ取得項目の登録という3項目を導入手順書に組み込みます。品番登録の際は、マスタ登録と同時に旧品番との関連付けを行う運用にします。手順書に1行加えるだけで、データ品質が劣化する速度は大きく下がるのです。
加工履歴を残さず監査時に処理内容を説明できない
監査や顧客の工程監査で問われるのは、数値そのものよりも数値の作り方です。「この不良率はどのデータから、どの処理を経て算出されたのか」に答えられない状態は、指摘の対象になります。加工履歴が残っていなければ、担当者の記憶に頼った説明しかできません。監査の場で求められるのは、口頭の説明ではなく記録として残された証跡なのです。記憶に頼った説明は、監査人にとって検証できない情報にすぎないのです。履歴の記録は、監査対応だけでなく社内の数値議論を短縮する効果も持ちます。
残すべき履歴は、5W1Hのうち4項目に絞れば実務が回ります。いつ、どのデータに、どのルールで、誰の承認のもとに処理を適用したかという4点です。処理スクリプトの実行ログに、実行日時・対象テーブル・ルール版番号・処理件数を自動出力する仕組みを組み込んでください。手作業で行った修正についても、修正内容と理由を記録するシートを用意します。ログの粒度は、1回の実行につき1行という単位で十分に説明責任を果たせます。
生産データのクレンジングに取り組む際の判断軸
着手にあたっては、手段・範囲・体制という3つの判断が必要になります。どれも正解が1つに決まるものではなく、データ量や社内リソースによって選択が変わるのです。判断の材料となる基準を、具体的な数値とともに示します。
手作業・ETL・専用ツールの使い分けを決める基準
手段の選択は、データ量と処理の反復頻度で決まります。月1回・1万行以下の処理であれば、ExcelのPower Queryで十分に対応できます。日次で数十万行を処理するなら、ETLツールやSQLベースの処理基盤が必要です。データ品質の監視や名寄せの精度が求められる場合は、専用のデータプレパレーション製品を検討します。初期費用と学習コストを回収できるかどうかは、年間の処理回数と対象人数から見積もってください。
データプレパレーションとは?ETLとの違いから成功ポイントまで徹底解説
手段 | 適するデータ量 | 初期コストの目安 | 属人化リスク |
|---|---|---|---|
手作業・Excel | 月1万行以下 | ほぼゼロ | 高い |
SQL・ETLツール | 日次数十万行まで | 数十万円から数百万円 | 中程度 |
専用ツール | 日次数百万行以上 | 年間数百万円から | 低い |
判断を誤りやすいのが、最初から専用ツールを導入してしまう進め方です。ルールが固まっていない段階でツールを入れると、設定作業そのものが手戻りの対象になります。推奨する順序は、Excelまたは手書きのSQLで処理内容を確定させ、安定してからツールへ移行する流れです。移行の判断基準は、処理時間が1回あたり2時間を超えた時点、あるいは対象テーブルが10を超えた時点に設定してください。この2つを超えると、手作業による運用は現実的に維持できなくなります。
全社展開と特定ラインからの着手のどちらを選ぶか
着手範囲の判断は、成果の出やすさと横展開のしやすさで決まります。全社展開は、標準を一度に定義できる利点がある一方、合意形成に半年以上を要する例が多くなっています。特定ラインからの着手は3か月程度で成果を示せますが、他ラインへの展開時に設計の見直しが発生する可能性があるのです。判断基準として、拠点数が3以上、または関係部門が5以上の場合は、特定ラインからの着手を選びます。合意形成のコストが、標準化による利点を上回るためです。
進め方 | 成果が出るまでの期間 | 主な利点 | 主なリスク |
|---|---|---|---|
全社一括で標準化する | 6〜12か月 | 標準が一度でそろう | 合意形成が長期化する |
特定ラインから着手する | 3〜4か月 | 早期に成果を示せる | 横展開時に手戻りが出る |
特定ラインから着手する場合の選び方には、条件があります。生産量が多く、不良率の改善余地があり、現場の協力が得られるラインを選んでください。最初の対象は、成功確率が高いラインを意図的に選ぶ判断が有効です。横展開を見据えて、ルール文書とコード体系だけは全社共通の形式で作成します。ライン固有の事情を設定ファイルに切り出しておけば、2ライン目以降の展開工数を半分程度まで圧縮できます。1ライン目で作った文書は、2ライン目の着手時にそのまま雛形として使えるのです。
データ品質の維持を担う体制と役割分担の設計
体制の設計では、3つの役割を明確にします。データの内容に責任を持つ所管部門、処理の実装と運用を担うデータ担当、品質基準を決めて調停する推進役の3者です。製造業では所管部門が保全・生産管理・品質保証に分かれるため、推進役の存在が特に効いてきます。推進役を置かないまま進めると、部門間で判断が止まり、処理の実装が待ち状態になるのです。専任である必要はなく、兼務でも意思決定の権限が明確であれば機能します。
データガバナンス体制とは?構築の手順・役割分担・運用のポイントをわかりやすく解説
役割分担は、文書に書くだけでは動きません。月1回の定例で、品質指標の推移と未解決の課題を確認する場を設けてください。確認する指標は、欠損率、重複率、未突合件数、異常候補の確認完了率の4つに絞ります。指標はダッシュボード化し、担当者が随時確認できる状態にしておくと運用が回りやすくなります。指標が悪化した際に誰が対応するかを、指標ごとにあらかじめ決めておく運用が有効です。立ち上げ期は月1回、安定後は四半期に1回という頻度で運営すると、負担を抑えたまま維持できます。
まとめ:生産データのクレンジングは処理順序と運用設計で決まる
生産データのクレンジングは、技術的な処理よりも設計の巧拙で成果が分かれます。ここまで扱った内容を、着手前に確認しておきたい観点として整理します。
押さえるべき要点は5つです。生データを保持したまま加工データを分離すること、標準化を名寄せより先に行うことの2つが土台になります。加えて、外れ値を異常候補として現場判断へ回すこと、現場の暗黙知を文書化すること、ルールの改訂履歴を残すことが続くのです。この5つを外さなければ、処理の手戻りは大きく減らせます。着手範囲は、拠点数が3以上なら特定ラインから始める判断が現実的です。
最初の一歩は、対象データの棚卸し表を1枚作ることから始めてください。システム名、列名、発生源、粒度、更新頻度、保有期間、所管部署を並べるだけで、着手すべき箇所が見えてきます。所要は1ライン・4系統でおおむね3〜5人日です。この表を関係部門で共有した時点から、クレンジングは個人の作業から組織の運用へと変わっていきます。
- 生データ層への上書き更新を禁止する設定になっているか
- 標準化ルールを名寄せより先に適用する順序になっているか
- 外れ値をフラグ付けで残す設計になっているか
- 処理ログに実行日時・対象・ルール版番号・件数を出力しているか
- 設備導入・品番登録・工程変更の手順書にデータ側の対応が含まれているか
「これから生産データのクレンジングに関する取り組みを実施したいけれど、何から手をつけたらいいかわからない」「データ専門家の知見を取り入れたい」という方は、データ領域の実績豊富な弊社、データビズラボにお気軽にご相談ください。
貴社の課題や状況に合わせて、生産データの取り組みをご提案させていただきます。








