テキストマイニング

更新日:

用語解説

テキストマイニングは、アンケート自由記述、問合せ、ニュース、SNSなど大量の自然言語テキストを前処理・数値化し、頻出語、話題、感情、関係、分類規則など有用な知識を抽出する分析です。

■ 試験で押さえるポイント

  • 文字正規化、文・単語分割、形態素解析、原形化、不要語除去を行い、表記ゆれや同義語を目的に応じて統合します。

  • 単語頻度、TF-IDF、共起、トピックモデル、感情分析、文書分類、固有表現抽出などを使い、文章を特徴量又は構造化情報へ変換します。

  • 否定、皮肉、多義語、専門語、文脈で意味が変わるため、自動結果を標本レビューし、適合率・再現率などで評価します。

  • 相関・頻度だけで原因を断定せず、個人情報、著作権、偏見、学習データの代表性を確認し、原文へ戻れる追跡性を保ちます。

■ 選択肢での判断ポイント

数値表でなく自然言語を対象に、形態素解析などで構造化して知識を抽出します。単なる全文検索や特定語件数の表示だけより広い概念です。

例: 1万件の問合せを形態素解析し、「接続」と「切断」の共起増加を発見して障害候補を抽出します。否定文「切断しない」を誤分類しない検証も必要です。

音声で聞く

同じ分野の用語