第4部|分析編 ―― AIと読み解く
第10章 分析以前 ── データ整形とクリーニングをAIに任せる
この章の要点
- 分析の前に立ちはだかる「データ整形」こそ、AIが最も労力を肩代わりする領域
- 欠損・表記ゆれ・名寄せ・形式の不統一を、AIと一緒に片付ける
- 「きれいなデータ」が、正確で速い分析の前提になる
分析の8割は、「準備」である
データ分析の現場には、よく知られた経験則があります。
分析にかかる時間の大半は、計算ではなく「データの準備」に費やされる。
集めたばかりのデータは、たいてい"汚れて"います。空欄(欠損値)がある、表記がばらばら(「男性」「男」「M」が混在)、日付の形式が揃っていない、同じ人が違う名前で重複している──。この状態では、人間もAIも正確に分析できません。各論①で「整理された情報ほど、AIは正確に・速く扱える」とお伝えしたのは、まさにこのことです。
⸻
「データクリーニング」でやること
整形(データクリーニング)の主な作業は、こんなものです。
- 欠損値の確認と処理(空欄をどう扱うか)
- 表記ゆれの統一(「男性/男/M」を揃える)
- 形式の統一(日付・単位・桁を揃える)
- 重複の除去(同じ対象の二重登録を見つける)
- 名寄せ(表記の違う同一人物・同一項目を突き合わせる)
地味で、根気のいる作業です。これまで、多くの研究者・実務者が、ここで膨大な時間を溶かしてきました。
⸻
こここそ、AIの独壇場
そして、この退屈で時間のかかる作業こそ、AIが最も鮮やかに肩代わりする領域です。各論②で触れたように、AIはコードを書いて実際にデータを処理できます(ChatGPTやClaudeの「データ分析機能」「コード実行機能」)。
匿名化したデータを渡し、「表記ゆれを統一して」「欠損値の状況を一覧にして」「重複を見つけて」と頼めば、AIがコードを書いて処理し、きれいになったデータを返してくれます。あなたはコードを一行も書きません。 各論②で身につけた「AIに作業させる」発想が、ここで生きます。
ただし、ここでもローカルファイル活用編・第2章の原則を忘れずに。生の個人データは渡さない。 匿名化したもの、あるいは「こういう構造のデータを、こう整形したい」という相談だけでも、AIは十分に役立ちます。
💡 AIにデータ整形をさせたら、「何を・どう変えたか」を必ず報告させ、元データのバックアップを残すこと。意図しない変換が混じることがあるからです。各論②で学んだ「大きな変更の前には確認」の精神を、ここでも。
試してみるプロンプト
あなたはデータ分析の前処理に詳しいデータサイエンティストです。 以下は、わたしが分析したい匿名化済みデータの「構造(列名と、各列のサンプル数行)」です。
- このデータに含まれていそうな問題(欠損・表記ゆれ・形式の不統一・重複など)を指摘してください。
- それぞれをどう整形すべきか、方針を提案してください。
- 整形を実行する場合は、何をどう変えたかを必ず一覧で報告してください。
- 整形によって失われる情報・注意点があれば教えてください。
【データ構造】 (匿名化した列名とサンプル行を貼る)
第10章のまとめ
- 分析時間の大半は「データの準備」。ここがAIの最も得意な領域
- 欠損・表記ゆれ・重複・名寄せを、AIにコードを書かせて片付ける
- 生データは渡さない。整形内容は必ず報告させ、バックアップを残す