テキストマイニング
更新日:
用語解説
テキストマイニングは、アンケート自由記述、問合せ、ニュース、SNSなど大量の自然言語テキストを前処理・数値化し、頻出語、話題、感情、関係、分類規則など有用な知識を抽出する分析です。
■ 試験で押さえるポイント
文字正規化、文・単語分割、形態素解析、原形化、不要語除去を行い、表記ゆれや同義語を目的に応じて統合します。
単語頻度、TF-IDF、共起、トピックモデル、感情分析、文書分類、固有表現抽出などを使い、文章を特徴量又は構造化情報へ変換します。
否定、皮肉、多義語、専門語、文脈で意味が変わるため、自動結果を標本レビューし、適合率・再現率などで評価します。
相関・頻度だけで原因を断定せず、個人情報、著作権、偏見、学習データの代表性を確認し、原文へ戻れる追跡性を保ちます。
■ 選択肢での判断ポイント
数値表でなく自然言語を対象に、形態素解析などで構造化して知識を抽出します。単なる全文検索や特定語件数の表示だけより広い概念です。
例: 1万件の問合せを形態素解析し、「接続」と「切断」の共起増加を発見して障害候補を抽出します。否定文「切断しない」を誤分類しない検証も必要です。