データマイニング
更新日:
用語解説
データマイニングは、大量の蓄積データへ統計、機械学習、パターン認識などを適用し、人手では見つけにくい規則、関連、分類、クラスタ、異常など有用な知識候補を発見する分析活動です。
■ 試験で押さえるポイント
目的定義、データ理解、前処理、モデル化、評価、業務適用を反復し、発見したパターンが意思決定に役立つかを検証します。
購買のアソシエーション分析、解約の分類、顧客クラスタリング、不正取引の異常検知など、目的変数の有無に応じた手法を選びます。
欠損・外れ値・重複・偏りを処理し、学習データと評価データを分けて、過学習とデータ漏えいを防ぎます。
相関パターンは因果関係を自動的に示しません。偶然の規則、プライバシー、差別的利用、説明可能性も評価します。
■ 選択肢での判断ポイント
単なる検索・集計ではなく、データから未知の有用パターンを発見する点が中心です。手法名より、分類・クラスタ・関連・異常という目的を見分けます。
例: 購買履歴から「商品A購入者の60%がBも購入」という規則を発見しても、AがB購入の原因とは限りません。別期間で再現性と施策効果を検証します。