テキストマイニングツール
■できること
- 形態素解析結果を表示
- 単語の頻度表示
- 共起の単位を表示
- 共起ネットワークを表示
- 階層的クラスター分析を表示
- 単語検索を表示
- ワードクラウドを表示
■使い方
- 辞書の読み込みが完了する(ステータスが「準備完了」になる)まで待つ.
- テキストボックスに文章を入力するか,「サンプル文を入力」を押す.
- テキストファイルから読み込む場合は,「テキストファイルを読み込む」を押してファイルを選ぶか,ファイルをテキストボックスにドラッグ&ドロップする(ドラッグ中は枠が緑の点線になる.テキストボックスの外にドロップするとブラウザがファイルを開いてしまうので注意).読み込んだ内容はテキストボックスに入り,ボタンの横にファイル名と文字数が表示される.文字コードは UTF-8 と Shift_JIS に対応し,自動で判別する.読み込んだ後,必要に応じて編集してから「解析する」を押す.
- 「解析する」を押すと形態素解析が実行され,7つの表示ボタンが押せるようになる.
- 「形態素解析結果を表示」:形態素ごとに分割された結果を,品詞・活用型・活用形・原形・読み・発音まで含めて表で表示する.
- 「単語の頻度を表示」:抽出した単語を出現回数の多い順に並べた表を表示する.集計対象の品詞はチェックボックスで選べる(既定では名詞・動詞・形容詞・形容動詞・副詞のみが対象).「原形でまとめる」を外すと,活用形ごとに別の単語として数える.「CSVで書き出し」で現在の表(順位・単語・品詞・出現回数・割合・累積割合)をCSVファイルとして保存できる.表の単語をクリックすると「7. 単語検索」が一番上(入力欄のすぐ下)に移動して表示され,その単語で自動検索される.「累積割合」の列は上位から積み上げた割合を示し,パレート分析(上位◯語で全体の何%を占めるか)に使える.累積80%に達した行は黄色くハイライトされる.
- 「共起の単位を表示」:共起を数えるときに文章がどのような単位に区切られるかを一覧表示する.「共起の単位」で「文」「段落」「文章全体」「前後◯語以内」を切り替えられる.各単位の中の対象語(「3. 単語の頻度」で選んだ品詞・「原形でまとめる」の設定に従う)が黄色でハイライトされ,その単位の対象語と共起の組の数が表示される(「前後◯語以内」では,各対象語と後ろ◯語以内の対象語の組を表示する).「共起ネットワーク・クラスター分析に適用」を押すと,選んだ単位が「5. 共起ネットワーク」「6. 階層的クラスター分析」の「共起の単位」にも反映される.単位が多い場合は先頭300件のみ表示する.
- 「共起ネットワークを表示」:同じ単位の中で一緒に出現した単語どうしを線で結んだ図を表示する.表示語数を変えると再描画され,ノードはドラッグで動かして見やすく配置できる.対象の品詞・「原形でまとめる」・非表示リストはこのパネル専用で,他の項目の設定とは独立している.「反発の強さ」「ばねの強さ」「減衰」「中心への引力」「線の基本の長さ」のスライダーで,ノードの散らばり方や動きの収まり方をリアルタイムに調整できる(「既定値に戻す」でリセット).
- 共起ネットワークの「最小共起回数(閾値)」「線の太さの倍率」はスライダーでリアルタイムに調整できる.要約欄には,ノード数・共起関係の数に加えて「平均次数」(ノード1つあたりの平均のつながりの数)と「密度」(考えられる全ての組み合わせのうち実際に線で結ばれている割合)も表示される.
- 共起ネットワークの「PNG画像として保存」で現在の図を画像として,「ノードをCSVで書き出し」「エッジをCSVで書き出し」でノード(単語・品詞・出現数・次数中心性・媒介中心性)とエッジ(2語とその共起回数)のデータをそれぞれCSVファイルとして保存できる.
- 「階層的クラスター分析を表示」:同じ単位への出現パターンが近い単語ほど低い位置(距離が近い位置)で結合される樹形図を表示する.「クラスタ数」を変えると,その数に切り分けたときの色分けと,下の一覧に表示されるクラスタの中身が更新される.対象の品詞・「原形でまとめる」・非表示リストはこのパネル専用で,他の項目の設定とは独立している.
- 階層的クラスター分析の「連結法」:クラスター間の距離の決め方を「群平均法」(既定)「最短距離法」「最長距離法」「ウォード法」から選べる.同じ単語データでも連結法によって樹形図の形(連鎖しやすいか,塊になりやすいか)が変わる.
- 階層的クラスター分析の樹形図に表示される赤いカットライン(ひし形の付いた破線)はドラッグで上下に動かせる.動かした高さで切り分けたときのクラスタ数が「クラスタ数」欄に反映され,色分けと下の一覧もリアルタイムに更新される.
- 階層的クラスター分析の樹形図の枝(結合線)をクリックすると,その枝から下のまとまり(サブツリー)に含まれる単語だけが選択色でハイライトされ,下に一覧表示される.「選択を解除」を押すと通常のクラスタ色分け表示に戻る.
- 階層的クラスター分析の樹形図の葉(下端の単語ラベル)をクリックすると,その単語が使われている文が一覧表示され,該当箇所がハイライトされる.
- 階層的クラスター分析の「クラスタ数ごとの品質指標」表では,クラスタ数(2〜10)ごとのシルエットスコアを確認できる.値は-1〜1の範囲で,1に近いほど各クラスタがまとまり良く分かれていることを示す.現在の「クラスタ数」の行は太字で強調され,最もスコアが高い行には「★最良」と表示される.
- 階層的クラスター分析では,各クラスタの「代表語」(同じクラスタ内の他の単語との平均距離が最も近い,最もそのクラスタらしい単語)が自動計算され,下の一覧と樹形図の単語ラベルの両方で★印付きの太字として強調表示される.
- 階層的クラスター分析の「PNG画像として保存」で,現在の樹形図を画像としてダウンロードできる.
- 「共起の単位」(共起ネットワーク・階層的クラスター分析にそれぞれ独立して設定可):「文」(句点などで区切る,既定),「段落」(空行で区切る),「文章全体」(区切らずに1つの単位として扱う),「前後◯語以内」(文をまたいでも,指定した語数以内に出てくる単語どうしを共起とみなす)から選べる.
- 共起ネットワークの「ノードの大きさの基準」「ノードの色の基準」:大きさ・色をそれぞれ「出現した単位の数」「次数中心性(つながっている単語の種類数)」「媒介中心性(異なるグループ同士をどれだけ橋渡ししているか)」から選べる(色はさらに「品詞」「階層的クラスター分析のクラスタ」も選べる).「階層的クラスター分析のクラスタ」を選ぶと,「6. 階層的クラスター分析」で計算した色分けがそのままノードの色に反映される(クラスタ情報がない単語は灰色).
- 「単語検索を表示」:検索欄に単語を入力すると,その単語が使われている文を一覧表示し,該当箇所を黄色でハイライトする.「原形が一致する語も含める」を外すと,入力した表記そのままの語だけを対象にする.
- 「ワードクラウドを表示」:出現回数が多い単語ほど大きな文字で表示する.対象の品詞と「原形でまとめる」はこのパネル専用のチェックボックスで選べ,「3. 単語の頻度」の設定とは独立している.単語をクリックすると単語検索が一番上(入力欄のすぐ下)に移動して表示され,その単語で自動検索される.
- ワードクラウドの「非表示にする単語」欄に単語を入力して「非表示リストに追加」を押すと,その単語をワードクラウドから除外できる(Shiftキーを押しながら単語をクリックしても同様に追加される).リストの単語の「×」で個別に,「リストを空にする」で一括して解除できる.
- ワードクラウドの「PNG画像として保存」で,現在の図を画像としてダウンロードできる.
- 各ボタンを押して表示した項目は,入力欄のすぐ下(結果の一番上)に表示される.後から表示した項目ほど上に来る.単語の頻度の表やワードクラウドの単語をクリックして単語検索に切り替えたときも,単語検索が一番上に移動する.項目を表示しているあいだは,対応する表示ボタンの背景が灰色になる(単語のクリックで単語検索が開いたときも「単語検索を表示」ボタンが灰色になる).各ボタンはもう一度押すと非表示に戻り,ボタンの背景も元に戻る.表示中の項目は,品詞やテキストの変更に応じて自動的に更新される.
ホーム>>カテゴリー別分類>>データ分析>>kテキストマイニングツール
最終更新日:2026年9月30日