AI活用におけるデータ準備とは?6ステップと失敗しない進め方を解説

AI活用におけるデータ準備とは?6ステップと失敗しない進め方を解説

AI活用の成果は、モデルの性能だけでなく、投入するデータの状態で決まります。検証では良い数字が出たのに本番で使えない、部門ごとに集計結果が食い違うといった問題の多くは、データ準備の工程に原因があります。

本記事で扱うのは、AI活用に向けたデータ準備の全体像と、着手から運用定着までを6ステップに分解した進め方です。

読み終えたときには、自社のどのデータから着手すべきかを判断し、最初の3か月で実施する作業を洗い出せる状態を目指しています。手を動かす前の設計図として活用してください。

目次

AI活用におけるデータ準備とは、社内データをAIが扱える状態にすること

AI活用のためのデータ準備は、単なるファイル整理ではありません。AIが読み取れる形式・粒度・意味づけを与える一連の設計作業を指すものです。ここでは対象となる作業範囲、機械学習と生成AIでの違い、前処理との関係、検証止まりになる構造という4点を順に整理します。

データ準備が対象とする範囲:棚卸し・統合・整形・変換

データ準備の対象範囲は、大きく4つの作業に分かれます。1つ目はどこにどのようなデータが存在するかを洗い出す棚卸し、2つ目は複数システムのデータを1つのテーブルへ寄せる統合です。3つ目は形式や桁数をそろえる整形、4つ目はAIが解釈できる形へ置き換える変換になります。この4つをまとめてデータプレパレーションと呼ぶこともあるのです。実務では棚卸しに全体工数の2〜3割を費やす例が多く、ここを省略すると後工程で必ず手戻りが生じます。

  • そのデータをAI活用に利用してよいか(契約・規約・社内規程を確認する)
  • 過去何年分までさかのぼって取得できるか
  • 更新は日次・週次・月次のいずれで行われているか
  • 個人情報や機密情報が含まれていないか
  • 項目定義書やカラム説明が残っているか

棚卸しで最初に作るのは、データ資産の一覧表です。確認するのは、システム名、テーブル名、保有件数、更新頻度、管理部門、個人情報の有無という6項目です。この一覧を並べるだけでも、利用可能なデータと手を出せないデータの線引きができます。件数が1万件に満たないテーブルや、更新が年1回しかないマスタは、初期の対象から外す判断もあり得るでしょう。一覧表は後の権利確認でもそのまま使うため、最初から共有フォルダに置いて更新していきます。

データプレパレーションとは?ETLとの違いから成功ポイントまで徹底解説

機械学習向けと生成AI向けでは準備する内容が異なる

同じデータ準備という言葉でも、機械学習を使う場合と生成AIを使う場合では作業がほとんど重なりません。機械学習では数値やカテゴリを含む表形式のデータを整え、正解ラベルを付ける作業が中心になります。生成AIではマニュアルや議事録といった文書を扱い、AIが参照しやすい単位へ分割する作業が主になるのです。着手前に、どちらの道筋を進むのかを明確にしてください。判断を先送りにすると、集めるデータの範囲が定まらないままになるのです。

比較軸

機械学習向け

生成AI向け

主に扱うデータ

数値・カテゴリを含む表形式データ

マニュアル・議事録などの文書

中心となる作業

欠損補完、外れ値処理、特徴量の作成

文書の分割、不要箇所の除去、出典情報の付与

量の目安

予測対象1件あたり数千〜数万行

対象業務の文書50〜1,000件

品質で効く観点

値のばらつきと正解ラベルの一貫性

記述の最新性と重複文書の排除

更新の考え方

定期的な再学習を前提に蓄積する

原本の改訂に合わせて差し替える

どちらを先に手掛けるかは、社内にあるデータの状態から判断できます。基幹システムに数年分の実績データが蓄積されていれば機械学習の用途から、文書は多いが数値データの整備が進んでいなければ生成AIの用途から着手する形が現実的でしょう。両方を同時に進める計画は担当者が2倍必要になるため、初回は避けたほうが安全です。どちらの場合も、対象業務を1つに絞る点は共通しています。先に決めた1つの用途で成果を出してから、次へ広げる順序が確実でしょう。

データ前処理やデータクレンジングとの関係

データ前処理とデータクレンジングは、データ準備という大きな枠の中に含まれる作業です。クレンジングは表記の揺れや誤入力、重複を取り除いて正しい状態にすることを指します。前処理はそこから一歩進み、AIが学習しやすい形へ数値を変換したり項目を作り直したりする工程です。この2つを合わせても、データ準備の全体をカバーできるわけではありません。棚卸しや権利確認、更新の仕組み作りまで含めた全体が、データ準備の輪郭になるものです。

データ準備には、この2つに加えて棚卸しと権利確認、そして更新の仕組み作りが含まれます。クレンジングだけを外部へ委託した結果、更新方法が決まらず1回限りの整備で終わる例は少なくありません。作業範囲を切り出す際は、誰が継続的に更新するのかを契約時点で決めておいてください。用語の違いを整理しておくと、社内での認識合わせも進めやすくなります。委託する範囲と自社で担う範囲を1枚の図にまとめると、抜けが見つけやすくなるものです。

データクレンジングとは?意味と代表手法を解説!

AI活用がPoC止まりになる原因の多くはデータ側にある

検証で一定の成果が出たのに本番へ進めない案件には、共通する型があります。検証時は担当者が手作業で整えたきれいなデータを使い、本番では同じ品質のデータを供給できないという型です。検証環境で95%の精度が出ても、欠損や表記揺れを含む本番データでは大きく下がってしまいます。精度の差はモデルではなく、入力データの状態の差から生じているわけです。本番に近い状態のデータで検証する設計へ、早い段階で切り替える必要があります。

この落とし穴を避けるには、検証の段階から本番と同じ経路でデータを取得してください。手作業での整形を行った場合は、その作業内容を全て記録に残し、本番で自動化できるかを検証項目へ加えます。判断の目安として、検証で実施した加工のうち自動化できない処理が3割を超えるなら、本番移行の前に準備工程の見直しが必要になるものです。手作業の割合を記録しておけば、この判断は数分で下せます。自動化できない処理の一覧は、次の改善計画へそのまま引き継いでください。

データ準備を整えることでAI活用の何が変わるのか

データ準備に手をかけると、AI活用の何がどう変わるのかを具体的に押さえておきます。効果は精度の向上だけにとどまりません。出力の安定性、全社での再利用、運用の継続性、説明責任という4つの側面から見ていきましょう。

出力が安定し、業務判断に使える水準に近づく

AIの出力がぶれる原因は、モデルよりも入力データの不揃いにあることが多いです。同じ商品を指すコードが3種類存在する、単位がkgとgで混在している、日付が和暦と西暦で混ざっているといった状態では、学習も推論も安定しません。整形の段階でこれらを1つの表記へ統一するだけで、予測誤差が1〜2割改善する例は珍しくないのです。表記の統一は、精度改善の施策としても費用対効果が高い部類に入ります。モデルを差し替える前に、入力側の状態を点検してみてください。

判断に使える水準かどうかは、感覚ではなく閾値で確認します。需要予測であれば誤差率が何パーセント以内なら発注業務へ組み込めるか、分類であれば見逃しが何件までなら許容できるかを、業務部門と事前に合意しておきましょう。合格ラインを決めずに精度を追い続けると、いつまでも本番移行の判断ができません。実務では「現行の担当者の精度を上回ること」を最初の基準に置くと、議論が前に進みます。合意した基準は、議事録ではなく計画書へ明記しておきましょう。

部門ごとに異なる定義をそろえ、全社での活用につながる

売上という1つの言葉でも、営業部門は受注ベース、経理部門は計上ベースで数えていることがあります。この状態のままAIに学習させると、部門ごとに異なる答えを出す仕組みが出来上がってしまうのです。定義の統一は、用語集に「売上=出荷日基準の税抜金額」のように計算方法まで書き切ることから始めます。集計の起点となる日付や、税込か税抜かという条件まで含めて記述してください。定義が1文で書けない指標は、複数へ分けたほうが扱いやすくなります。

定義をそろえる作業は、全項目を一度に扱うと必ず停滞します。最初は経営会議で使う指標を10〜20項目に絞り、各項目に所管部門を1つだけ割り当てる進め方が現実的でしょう。所管部門が2つ以上になった時点で、その指標は分割するか名称を変えると決めておくと議論が長引きません。定義が固まった項目から順にデータカタログへ登録し、参照先を1か所へ集約します。登録時に定義の最終更新日も記入しておくと、古い定義の参照を防げるでしょう。

データ統合とは?統合の目的や初心者向けの進め方を解説

同じ手順で最新データを供給でき、運用後の更新が回る

検証段階の多くは、担当者が手元で加工したファイルを使って進みます。この方法では、担当者が異動した瞬間に同じデータを再現できなくなるのです。加工処理をSQLやスクリプトとして残し、実行すれば毎回同じ結果になる状態を作っておく必要があります。手順書を文章で残すだけでは、再現性は担保できません。実行のたびに同じ出力になるかを、最初に必ず確かめてください。この確認を通せば、担当者が代わっても供給は止まりません。

更新を回す仕組みは、最小構成なら日次バッチ1本から始められます。夜間に前日分を取り込み、加工し、AIが参照する場所へ書き出すという3工程を1つのジョブへまとめる形です。処理が失敗したときに誰へ通知するかを決めておかないと、古いデータのまま推論が続く事故が起きます。通知先は個人ではなく、チームのメールアドレスやチャットのチャンネルへ向けてください。通知が来たときの一次対応手順も、あわせて決めておきましょう。

データの出所と加工履歴を示し、社内外への説明に耐える

AIの出力について社内から根拠を問われたとき、答えられる状態にしておく必要があります。求められるのは、どのシステムのどのテーブルから取得し、どのような加工を経て学習に使ったかという経路の情報です。この経路が追えないと、誤った出力が出た際に原因を特定できません。監査や取引先からの照会に対しても、同じ説明が求められる場面が増えています。説明できる状態を用意しておくことも、データ準備に含まれる作業だと考えてください。

経路を残す方法は、大がかりな仕組みを入れなくても始められます。加工処理を書いたファイルの冒頭に、入力元・出力先・処理の目的・最終更新者の4項目をコメントとして記載するだけでも効果があるものです。記録があるかどうかが、AI活用を全社へ展開できるかどうかの分かれ目になります。月に1度、記録と実際の処理が一致しているかを確認する時間を30分だけ確保しておきましょう。食い違いが見つかった場合は、その場でコメントを修正します。

AI-Readyを支えるデータガバナンスとは?品質・透明性・責任あるAI活用の基盤を築く重要性と実践ポイント

AI活用に向けたデータ準備の進め方6ステップ

データ準備は、着手する順番を誤ると工数が膨らみます。課題定義から運用設計まで、実務で踏むべき工程を6つに分けて示すものです。各段階で何を決め、どこまで進んだら次へ移るのかという判断基準もあわせて確認していきましょう。

STEP1:AIで解決したい業務課題と評価指標を定める

最初に決めるのは、AIで何を良くするのかという業務上の到達点です。「在庫を減らす」では曖昧なので、「特定カテゴリの欠品率を現状の5%から3%へ下げる」まで具体化します。数値目標が置けない場合は、その業務にAIを使う準備がまだ整っていないと判断してもよいでしょう。対象業務を1つに絞ることも、この段階で同時に決めてください。到達点が定まれば、必要なデータの範囲も自然と決まってきます。関係部門との合意は、この段階で文書に残しておくと後が楽です。

評価指標は、AIの精度指標と業務指標の2階建てで設計します。精度指標は誤差率や正解率など技術側で測る値、業務指標は欠品率や対応時間など現場が実感できる値です。この2つを結び付けておかないと、精度が上がったのに業務は何も変わらないという結果に終わります。指標が決まった段階で、必要なデータ項目の候補も自然と絞り込めるはずです。指標の一覧は、後の品質基準づくりでもそのまま使えます。業務部門の担当者にも、同じ表を確認してもらってください。

STEP2:社内データを棚卸しし、利用可否と権利関係を確認する

棚卸しでは、対象業務に関係しそうなシステムを全て洗い出します。基幹システム、CRM、各部門のスプレッドシート、外部から購入したデータまで含めると、中堅企業でも20〜50件の候補が挙がることが一般的です。この一覧に対して、利用可否を「可」「条件付き可」「不可」の3段階で仕分けていきます。仕分けの基準は、データの所在が特定できるか、必要な期間分がそろっているかの2点です。条件付き可としたデータは、条件の内容も一覧へ書き添えておきましょう。

権利関係の確認は、法務部門と早い段階で並走してください。外部から購入したデータには、AIの学習利用は不可と契約書に明記されている例が実際にあります。顧客から取得したデータについても、取得時の利用目的にAI活用が含まれているかを確認する必要があるのです。この確認を後回しにすると、学習が終わった後にデータを差し替える事態を招きます。法務確認に要する期間は、対象が10件程度でも2〜3週間を見込んでおくと安全です。

STEP3:形式・粒度・項目定義を統一する

統一作業は、形式・粒度・定義という3つの層に分けて進めると混乱しません。形式は日付や数値の書き方、粒度は1行が何を表すか、定義は各項目が何を意味するかを指します。この3つを同時に触ると、どの変更が結果へ影響したのか追えなくなるものです。上から順に固めていく進め方を推奨します。形式の統一だけなら、置換処理で1〜2日程度で終わることも多いものです。定義の統一には、部門間の調整を含めて1か月前後かかります。

  • 日付:2026/1/5、2026-01-05、令和8年1月5日が混在している
  • 数値:全角と半角、カンマ区切りの有無が混在している
  • 空欄:空文字、NULL、「なし」、ハイフンが混在している
  • 名称:株式会社の前株と後株、スペースの有無が混在している

粒度をそろえる際は、1行が表す単位を先に宣言してください。「1行=1日1店舗1商品の販売実績」のように文章で書き出すと、集計の重複や取りこぼしに気付きやすくなります。日次と月次のデータを混ぜる場合は、細かいほうへそろえるのが原則です。粗いほうへ集約すると情報が失われ、後から元へ戻せなくなります。元へ戻せるように、加工前のデータは別の場所へ保管しておいてください。保管期間は、対象業務の検証が終わるまでを目安にします。

STEP4:欠損値・外れ値・重複を処理して品質を担保する

欠損値の扱いは、なぜ欠損しているのかを先に確かめます。機器が停止していた期間の未計測なのか、入力漏れなのか、そもそも該当しない項目なのかで対処が変わるからです。未計測なら前後の値からの補完、入力漏れなら該当行の除外、該当なしなら0の代入といった具合に、理由ごとの方針を決めておきましょう。一律に平均値で埋める処理は分布をゆがめるため、安易に選ばないでください。補完の方針は、項目ごとに一覧へ書き出して残します。

外れ値は、機械的に除外すると重要な情報まで捨ててしまいます。異常検知の用途では、外れ値そのものが検知したい対象になるからです。箱ひげ図や散布図で分布を目視し、業務担当者に「この値は実際に起こり得るか」を確認する手順を挟んでください。除外するか残すかの判断は、統計的な基準ではなく業務上の意味で決めます。重複については、完全一致だけでなく主要3項目の一致でも候補として抽出しておくと、取りこぼしが減るのです。

データ品質とは?品質評価項目や品質を向上させるための実務的対策を解説

STEP5:学習データ化や文書の構造化など、AIが参照できる形に変換する

変換の中身は、機械学習と生成AIで大きく異なります。機械学習では、日付から曜日や月末フラグを作る、直近4週間の平均を列として持たせるといった特徴量の作成が中心です。正解ラベルが必要な場合は、判定基準を文書化したうえでアノテーションを進めてください。基準が曖昧なまま複数人で作業すると、ラベルの揺れがそのまま精度低下につながります。作業を始める前に、20〜30件の見本を使って判定基準をそろえる時間を取ってください。

生成AIで社内文書を扱う場合は、文書の分割単位を決めるチャンキングが要になります。1つの塊を大きくしすぎると関係のない記述まで混ざり、小さくしすぎると文脈が切れてしまうのです。日本語のマニュアルであれば、見出し単位で区切りつつ400〜800文字程度を目安にする設定から試してください。分割した各塊には、出典の文書名と最終更新日を必ず付けておきます。出典が付いていれば、回答の根拠を利用者へ示せるようになるからです。

STEP6:更新頻度と管理責任を決め、継続的に供給できる状態にする

更新頻度は、業務での意思決定サイクルに合わせて決めます。日次で発注判断をするなら日次更新、月次の需要計画に使うなら月次更新で十分です。頻度を上げるほど運用負荷と費用が増えるため、必要以上に短くしない判断も求められます。迷った場合は、現行業務でデータを見ている頻度に合わせるところから始めましょう。頻度を決めた後は、実行時刻と所要時間も一覧へ記載します。更新が滞った場合の暫定対応も、同じ一覧に書いておくと安心です。

管理責任は、データ1つひとつに担当部門を割り当てて明文化してください。責任範囲は「値の正しさを保証する部門」と「処理を動かし続ける部門」に分けると整理しやすくなります。前者は業務部門、後者は情報システム部門が担うのが一般的な形です。担当が空欄のまま残ったデータは、いずれ誰も更新しなくなります。四半期に1度、担当表を見直す日をあらかじめ設定しておきましょう。見直しの結果は、担当表の更新履歴として残します。

活用シーン別に見るAIデータ準備の勘所

データ準備で気を付ける点は、AIの使い道によって変わります。需要予測、顧客分析、画像判定、生成AIという4つの代表的な用途を取り上げ、それぞれで押さえるべき勘所を整理していきます。自社の計画に近いものから読み進めてください。

需要予測・数値予測:期間と粒度をそろえ、未来情報の混入を防ぐ

需要予測では、期間と粒度をそろえる作業が土台になります。過去3年分のデータを使うなら、途中で商品コード体系が変わっていないか、店舗の統廃合がなかったかを先に確認してください。体系変更がある場合は、変更前後を対応付ける換算表を作らないと、同じ商品が別物として扱われてしまいます。換算表の作成には、対象規模にもよりますが2〜4週間程度を見込んでおくと安全です。換算表ができた時点で、学習に使う対象期間を確定させてください。

最も避けたいのは、予測時点では知り得ない情報を学習へ混ぜてしまうデータリーケージです。実績が確定した後に更新される列を特徴量へ入れると、検証では高い精度が出るのに本番では全く当たらない状態になります。各列について「予測を実行する時点で値が確定しているか」を1つずつ確認する作業を、必ず工程へ組み込みます。確認結果は列名の一覧に記録し、後から追加する列にも同じ判定を適用してください。判定の記録は、後任者への引き継ぎ資料にもなります。

顧客分析・レコメンド:顧客データの統合精度が結果を左右する

顧客分析の精度は、同一人物を1人として認識できるかで決まります。実店舗の会員番号、ECサイトのアカウント、問い合わせ窓口の記録が別々に管理されていると、同じ顧客が3人分として集計されるからです。統合の鍵になる項目を、会員番号・メールアドレス・電話番号のどれに置くかを最初に決めてください。複数を組み合わせる場合は、照合の優先順位も同時に定めておきます。鍵の候補が複数ある場合は、一致率を事前に測っておくと選びやすいものです。

統合作業では、表記の統一を済ませてから照合へ進む順番を守ります。全角と半角、旧漢字と新漢字、住所の丁目表記が混在したままでは、同じ人物が別人として残るのです。統合結果は必ずサンプルで目視確認し、100件のうち何件が誤って結合されたかを数えておきましょう。誤結合が1%を超える場合は、鍵となる項目の見直しから戻ることを推奨します。確認は1回で終わらせず、統合ルールを変えるたびに繰り返してください。結果は表形式で記録します。

名寄せとは?正確な顧客データ管理の方法と活用ポイントを徹底解説

画像判定・異常検知:取得条件とラベル基準のばらつきを抑える

画像を扱う場合、撮影条件のばらつきが精度に直結します。照明の明るさ、カメラとの距離、背景の写り込みが撮影日ごとに変わると、AIは製品の違いではなく撮影条件の違いを学習してしまうのです。撮影治具を固定し、露出設定を統一するといった物理的な対策を先に打ってください。収集は、良品と不良品を同じ条件かつ同じ時期に撮る形で進めます。撮影条件を記録する台帳を用意し、変更のたびに追記してください。条件が変わった時期は、学習データの区切りとしても使えます。

ラベル基準のばらつきは、判定精度を大きく下げる要因になります。傷とみなす大きさの下限を0.5mmとするのか2mmとするのかで、集まるデータの意味が変わってしまうからです。判定に迷う画像を20〜30枚集めた基準集を作り、作業者全員で同じ答えになるか確認してから本作業へ進みましょう。月に1度は同じ画像を再判定し、基準がずれていないかを点検してください。点検の結果、判定が割れた画像は基準集へ追加していきます。

生成AI・社内問い合わせ対応:文書の分割単位と情報の最新性を管理する

社内問い合わせにAIを使う場合、対象文書の選定から始めます。全ての文書を投入すると、廃止済みの規程や古いマニュアルが回答へ混ざるからです。過去1年以内に参照実績のある文書、現行版であることが確認できる文書という2つの条件で絞り込むと、対象は当初の想定よりかなり少なくなります。最初は50〜100件程度から始める形で十分でしょう。絞り込みの条件は、文書管理の担当部門と一緒に決めてください。対象外とした文書も、理由を添えて一覧に残します。

文書の分割単位と情報の最新性は、運用開始後も管理し続ける対象です。PDFの表や図が多い文書は、テキスト抽出の時点で内容が崩れることがあるため、抽出結果を目視で確認してください。改訂された文書を差し替える手順を決めていないと、回答の誤りが時間とともに増えていきます。原本を管理する部門と、AI側へ反映する担当を紐付けた一覧表を作って運用します。一覧の更新は、原本の改訂と同じ時期に行うと漏れが出ないものです。

構造化データと非構造化データの違い

AI活用のデータ準備でよくある失敗パターン

データ準備でつまずく箇所は、企業規模や業種を問わずよく似ています。ここでは実務で繰り返し見られる5つの失敗を取り上げ、それぞれの兆候と回避策を示します。着手前に目を通しておくと、同じ道をたどらずに済むでしょう。

品質基準を決めないままデータ量の確保を優先してしまう

データは多いほど良いという前提で収集を始めると、途中で行き詰まります。欠損だらけの行が半分を占める10万件より、条件のそろった1万件のほうが実用的な結果を生む場面は多いのです。量を追う前に、どの項目が何パーセント埋まっていれば使えるのかという基準を決めてください。基準を満たさないデータは、集めても投入しないという判断が必要になります。基準は、対象データの主要な10項目程度に絞って設定すると運用しやすいものです。

この失敗の兆候は、進捗報告が件数の話ばかりになることに表れます。「今月で50万件まで集まりました」という報告が続き、使える件数の話が出てこない状態は要注意です。収集の完了条件を件数ではなく、品質基準を満たした件数で定義し直すと軌道修正できます。週次の進捗表に「基準充足件数」の列を1つ追加するだけでも、議論の焦点が変わるでしょう。報告の形式を変えるだけで、収集の優先順位も見直されていきます。充足率が7割を超えた時点で、次の工程へ移ってください。

表記の統一より先に名寄せを行い、統合結果がずれる

作業順序を誤ると、統合そのものをやり直すことになります。「株式会社データビズラボ」と「(株)データビズラボ」が別法人として残ったまま名寄せを実行すれば、当然ながら結合されません。表記の統一、次に名寄せ、最後に重複排除という順序を守る必要があるのです。順序を入れ替えた場合の手戻りは、1〜2週間規模になることも珍しくありません。作業を始める前に、順序を1枚の手順書として配ってください。手順書には、各工程の成果物名も書き添えます。

回避策は、統一ルールを先に文書化して全員で共有することです。法人格の表記、記号の全半角、スペースの扱いという3点を決めるだけでも、結合率は大きく変わります。ルールを決めずに各自の判断で置換を進めると、後から誰がどう直したのか追えなくなります。置換処理は必ずコードとして残し、元データは上書きせず別ファイルへ出力してください。置換ルールの一覧は、後から追加できる形で管理しておくとよいでしょう。新しい表記が見つかるたびに、ルールへ追記します。

検証時と運用時でデータの加工方法が食い違い、精度が落ちる

検証では担当者が表計算ソフトで加工し、運用では別担当がSQLで実装するという分担はよく見られます。この場合、丸め方や欠損の扱いが微妙に異なり、本番稼働後に精度が落ちる結果を招くのです。原因の特定に数週間を要することもあり、影響は小さくありません。検証段階から本番と同じ処理系を使う方針にしておくと、この問題は避けられます。同じ処理系を使えない場合は、加工内容を1行ずつ突き合わせてください。突き合わせの記録は、リリース判定の資料として残すものです。

防ぐには、加工処理を1か所へまとめ、検証と運用の両方から呼び出す構成にします。同じ処理を2回書かない体制を作ることが要点です。処理を書き分けた時点で、いずれ食い違いが起きると考えておいたほうが安全でしょう。どうしても分ける場合は、同じ入力に対する出力が一致するかを比較する確認を、リリース前の手順へ必ず入れておきます。比較の対象は、代表的な100行程度を抜き出す形で十分です。差分が出た場合は、原因を特定するまで先へ進めないでください。

個人情報や利用許諾の確認が後工程に回り、手戻りが発生する

学習用データがそろった段階で法務確認へ回すと、高い確率で差し戻しが起きます。氏名や住所を含む項目が学習対象に入っていた、購入したデータの利用範囲を超えていたといった指摘が典型的です。指摘を受けてからデータを作り直す工数は、当初見積もりの2〜3割に達することもあります。確認は棚卸しの直後、遅くとも整形に入る前に済ませてください。早い段階での確認であれば、対象データの入れ替えも軽い作業で済みます。差し戻しの多くは、この順番を守るだけで防げるものです。

実務では、対象データごとに確認結果を残す簡易な台帳を用意すると進めやすくなります。データ名、個人情報の有無、取得時の利用目的、AI学習利用の可否、確認日、確認者という6項目で十分です。匿名化して使う場合も、どの項目をどう加工したかを記録に残しておく必要があります。台帳は法務部門と共有し、四半期ごとに更新する運用にしておきましょう。更新の際は、契約更新や規程改定の有無もあわせて確認します。確認済みのデータだけを、整形の対象としてください。

パーソナルデータと個人情報の違いとは?取り扱いの注意点をわかりやすく解説

準備作業が担当者依存となり、同じ結果を再現できなくなる

1人の担当者が手元で加工を進めると、短期的には速く進みます。ただし、その人が休んだ日にデータ更新が止まる、退職時に手順が失われるという事態を招くのです。実際に、検証を担当した社員の異動後にプロジェクトが停止する例は少なくありません。属人化は、成果が出ている時期ほど気付きにくい問題です。引き継ぎ資料がないまま担当が代わると、復旧に1〜2か月を要します。進行中の案件ほど、記録を残す時間を確保してください。

回避策は、スモールスタートの段階から仕組み化を意識しておくことです。手作業で1度動かした処理は、次に同じことをする前にスクリプト化する習慣を付けてください。再現できない準備工程は、成果が出ても本番展開の判断ができません。処理ファイル、入力データ、出力結果の3点を同じ場所に保管し、月末に第三者が再実行できるか試す運用も有効になります。再実行できた範囲を記録に残し、できなかった箇所から改善していきましょう。

AI活用のデータ準備を成功させる実務ポイント

失敗を避けるだけでなく、準備工程を成果へつなげるための要点を整理します。品質基準の数値化、仕組み化、役割分担、工数の織り込み、ツール選定という5つの観点です。どれも着手初期に手を打っておくほど、効果が大きくなります。

データ品質の合格基準を数値で定義する

品質を「きれいな状態」と表現している限り、作業は終わりません。完全性、一意性、正確性、適時性という4つの観点それぞれに、数値の合格ラインを置いてください。たとえば必須項目の充足率95%以上、重複率0.5%以下、更新遅延24時間以内といった形です。基準は業務側と合意し、文書として残しておきます。基準値は、現状の実測値より少し高い水準から始めてください。最初から満点を求めると、作業そのものが止まってしまいます。

基準を決めたら、自動で測る仕組みを同時に用意します。日次で充足率と重複率を計算し、閾値を下回った場合に通知する処理を組んでおくと、劣化に早く気付けるからです。測定していない品質基準は、時間の経過とともに形骸化します。測定結果は月次で推移を確認し、悪化傾向が2か月続く項目は原因調査の対象としてください。調査の結果は、品質基準そのものの見直しにもつながります。基準は年1回、業務の変化に合わせて更新するとよいでしょう。

加工処理を仕組み化し、繰り返し実行できる状態にする

仕組み化の第一歩は、手順を書き出して分解することから始まります。実際に行っている操作を1つずつ列挙すると、10〜20の工程へ分かれるのが通常です。このうち条件分岐のない単純作業から順にコード化すると、着手のハードルが下がります。全てを一度に自動化しようとすると、着手前に計画が止まってしまいます。対象を絞れば、最初の自動化は2〜3日で形になるものです。効果が見えた段階で、次の工程へ範囲を広げていきます。

実行環境は、担当者のパソコンではなくサーバー側に置いてください。手元の環境依存が残ると、他の人が実行したときに結果が変わる原因になります。処理の記述、実行の記録、結果の保管という3点がそろって初めて、仕組み化できたと言えるのです。小規模であればスケジューラーで日次実行する構成から始め、規模の拡大に合わせて移行を検討しましょう。移行の判断は、処理時間が業務の締め切りに間に合うかで決めます。間に合わない状態が続く場合は、基盤の見直しが必要です。

業務部門とデータ担当の役割分担を決めておく

データ準備は、技術側だけで完結する作業ではありません。値の意味を判断できるのは業務部門であり、処理を実装できるのはデータ担当だからです。この2者の役割が曖昧なままだと、判断待ちで作業が止まる時間が積み上がっていきます。実務では、週1回30分の確認の場を設けるだけでも滞留が減ります。確認の場では、判断待ちになっている項目を先に処理してください。持ち帰りが増えるようなら、参加者の見直しが必要になるものです。

分担を決める際は、作業ではなく決定事項を基準に線を引くと整理しやすくなります。項目の定義、外れ値を残すかどうか、品質基準の水準という決定は業務部門、実装方法と実行環境の選定はデータ担当という形です。決定権を持たない側に判断を求める依頼が繰り返されると、準備工程は必ず遅れます。担当表には、決定者と相談先を分けて記載しておきましょう。記載がない項目が出たときは、その場で決定者を決めます。決まらない場合は、上位の会議体へ持ち上げてください。

準備工数をプロジェクト計画に織り込む

AI活用の計画では、モデル構築の期間だけが見積もられることがあります。実際にはデータ準備が全工数の6〜8割を占めるため、この配分を最初から計画へ反映してください。初回の取り組みであれば、準備だけで2〜4か月を見込む形が現実的です。2回目以降は仕組みを再利用できるため、期間は半分程度まで短縮できます。計画書には、準備工程を独立した項目として立ててください。モデル構築の中へ含めると、遅延の原因が見えなくなるものです。

工数を圧縮したい場合は、対象データの範囲を狭める判断が最も効きます。全社データを一度に整えるのではなく、1つの業務に必要な3〜5テーブルへ絞る進め方です。範囲を絞れば準備期間は短くなり、成果が出た後に対象を広げる順番のほうが投資判断もしやすくなります。計画書には、次の対象へ広げる条件をあらかじめ書いておきましょう。対象を広げる条件は、精度と業務効果の2つで設定します。条件を満たさないうちは、範囲を固定したまま改善を続けてください。

支援ツールを選ぶ判断基準:自動化の範囲と加工履歴の追跡性

ツール選定では、機能の多さよりも自社の運用に合うかを見てください。判断の軸になるのは、どこまで自動化できるかという範囲と、加工履歴を追えるかという追跡性の2点です。業務部門が自ら加工する体制ならGUI操作で完結する製品、データ担当が集中して担うならコードで管理できる環境が向いています。どちらの体制でも、加工履歴が自動で残るかどうかは必ず確認してください。履歴が残らない環境では、原因調査に何倍もの時間がかかります。

比較軸

表計算ソフト中心

データ準備専用ツール

SQL・Pythonでの内製

自動化の範囲

手作業が中心で再実行は都度対応

画面上で定義した処理を再実行できる

処理を全て記述でき自由度が高い

加工履歴の追跡性

記録が残らないことが多い

処理の流れが画面上に残る

コードと変更履歴で追跡できる

主な利用者

業務部門の担当者

業務部門とデータ担当の両方

データエンジニア

費用の目安

追加費用はほぼ発生しない

1人あたり月1万〜10万円程度

人件費と実行基盤の費用

向いている場面

100行程度の一時的な確認

月次で繰り返す定型的な加工

大量データや複雑な変換

選定を進める際は、実データを使った試用を必ず挟んでください。自社の文字コードや項目数で想定どおり動くかは、資料だけでは判断できないからです。試用では、処理を作る手間ではなく、作った処理を半年後に他の人が引き継げるかを確認します。複数製品を比べる場合は、同じデータで同じ加工を作らせ、所要時間と手順の分かりやすさを記録しておきましょう。試用期間は2〜4週間を確保し、実際の担当者に触ってもらいます。短時間の製品説明だけで判断しないでください。

AI活用に向けてデータ準備に取り組んだ企業の事例

データ準備の効果は、実際の取り組みを通して見るとつかみやすくなります。製造業、小売業、サービス業の3つの例を取り上げ、何を整えて何が変わったのかを具体的に紹介します。自社に近い業種の内容から参考にしてください。

製造業:検査画像のラベル基準を統一し、再学習の負荷を軽減

外観検査へAIを導入した製造業では、当初、判定精度が工場ごとにばらついていました。原因を追うと、傷とみなす大きさの基準が現場ごとに異なり、同じ画像でも付くラベルが違っていたのです。撮影条件も統一されておらず、照明の明るさが工場間で2倍近く違う状態でした。工場ごとに追加学習を繰り返す運用となり、年間の作業量が膨らんでいました。この状態では、追加学習を重ねても精度が安定しません。ばらつきの原因は、モデルではなくデータ側にあったわけです。

対策として、判定に迷う画像30枚を集めた基準集を作成し、全工場の検査員で同じ判定になるまで読み合わせを行いました。撮影についても治具と照明を統一し、同じ条件で撮り直す運用へ切り替えたのです。基準をそろえた結果、工場ごとの追加学習が不要になり、再学習の頻度は月1回から四半期1回まで減りました。人による検査のばらつきも縮まり、教育にかかる時間も短くなっています。基準集は今も更新が続き、新人教育の教材にもなっているのです。

小売業:顧客データの統合精度を高め、需要予測を実用化

実店舗とECを併営する小売業では、需要予測の誤差が大きく、発注業務に使えない状態が続いていました。調査の結果、同一顧客が店舗会員とEC会員で二重に登録され、購買履歴が分断されていることが判明したのです。商品マスタも店舗側とEC側で別々に管理され、同じ商品に2つのコードが割り当てられていました。予測の前提となる実績値そのものが正しくない状態だったわけです。モデルの改良を重ねても、誤差が縮まらない理由はここにありました。

統合にあたっては、商品マスタを1つに統一し、その後に顧客の名寄せへ進む順序を取りました。会員番号を鍵にできない部分は、メールアドレスと電話番号の組み合わせで照合し、判定が難しい約3%については人手で確認する方針です。実績データが正しくつながった結果、予測誤差は従来の約半分まで縮まり、発注業務への組み込みが実現しました。準備に要した期間は3か月ほどですが、予測モデル自体の開発は2週間で完了しています。

サービス業:社内文書を整備し、生成AIの回答精度を改善

問い合わせ対応に生成AIを導入したサービス業では、当初の回答精度が低く、現場から使われない状態でした。原因は、社内共有フォルダにある文書をそのまま全て投入したことにあります。廃止済みの規程や改訂前のマニュアルが混ざり、古い情報を根拠にした回答が生成されていたのです。文書数は約4,000件に上り、どれが現行版かを判別できない状態が続いていました。現場からは、確認の手間がかえって増えたという声も上がっていたのです。

整備では、過去1年以内に参照実績のある文書へ対象を絞り込み、約600件まで削減しました。各文書には所管部門と最終更新日を付与し、改訂時に差し替える担当者も明確にした形です。対象を絞って最新性を管理した結果、回答の正答率は導入当初から大きく改善しました。現在は四半期ごとに対象文書を棚卸しし、参照されていない文書を外す運用を続けています。文書整備にかけた期間は約2か月で、当初の想定より短い結果でした。

まとめ:AI活用の成否はデータ準備の設計段階で決まる

AI活用の成否は、モデル選定よりも前段のデータ準備でほぼ決まります。ここまで見てきた内容を、着手時に確認すべき観点として整理し直しました。

  • AIで解決する業務課題と、精度指標・業務指標の2つを先に決める
  • 対象データの棚卸しと権利確認を、整形に入る前に済ませる
  • 品質の合格基準を、充足率や重複率などの数値で置く
  • 加工処理はコードとして残し、同じ結果を再現できる状態にする
  • 更新頻度と担当部門を明記し、四半期ごとに見直す

取り組みを始める際は、全社のデータを一度に整えようとせず、1つの業務に必要な3〜5テーブルから着手してください。品質基準を数値で置き、加工処理を仕組みとして残し、担当と更新頻度を明記します。この3点がそろえば、次の業務へ広げる際の土台がそのまま再利用できます。準備工程を設計した段階で、AI活用が成果へ届くかどうかはおおむね決まっているのです。

「これからAI活用に向けたデータ準備を実施したいけれど、何から手をつけたらいいかわからない」「データ専門家の知見を取り入れたい」という方は、データ領域の実績豊富な弊社、データビズラボにお気軽にご相談ください。

貴社の課題や状況に合わせて、データ準備の取り組みをご提案させていただきます。

データビズラボの実績無料相談・お見積り

このブログについて

データビズラボが運営する、データの価値を最大化するためのナレッジ共有メディアです。
戦略策定から具体的な分析手法、ツールの活用術まで、データの現場で培われた実践的な取り組みから
得られた知見や気づきを発信しています。

データのことなら、
まずはお気軽にご相談ください。

データ活用に、万能の正解はありません。
貴社の業界特性や課題に合わせて、最適な進め方を一緒に設計します。