中級者向け No.080

テキスト分析ツール

テキストを読み込んで単語頻度・文字数・センテンス数を分析し頻度グラフで可視化するツール。

🎯 難易度: ★★★ 📦 ライブラリ: tkinter(標準ライブラリ), matplotlib ⏱️ 制作時間: 30〜90分

1. アプリ概要

テキストを読み込んで単語頻度・文字数・センテンス数を分析し頻度グラフで可視化するツール。

このアプリはdataカテゴリの実践的なPythonアプリです。使用ライブラリは tkinter(標準ライブラリ)・matplotlib、難易度は ★★★ です。

このアプリは「データ処理」カテゴリです。データ分析・処理アプリは Python の真骨頂と言える領域で、生データから意味ある可視化・要約までを一通り体験できます。tkinter(標準ライブラリ)・matplotlib を活かして実装するこの構造は、他のアプリにも応用が効きます。

動かしながら読むことが理解の最短経路です。まずはコードをコピーして実行し、想定どおりに動くことを確認したうえで解説と照らし合わせてください。

カスタマイズでは「機能追加」「UI 改善」「エラー耐性」の三方向で考えると視野が広がります。練習問題にもそれぞれの方向の具体例を用意しています。

テキスト分析ツール 実行画面(Windows)
実行画面(Windows)
テキスト分析ツール 実行画面(Linux Mint)
実行画面(Linux Mint)

2. 機能一覧

  • 「📂 ファイルを開く」ボタン(_open_file())・「▶ 分析」ボタン(_analyze())・「🗑 クリア」ボタン(_clear())で操作
  • イベント <<Modified>> から _on_text_change() を実行
  • ttk.Treeview による表形式の一覧表示
  • filedialog.askopenfilename() によるファイル選択ダイアログ
  • messagebox.showwarning() によるダイアログ通知
  • ウィンドウはタイトル「テキスト分析ツール」・サイズ 1050x660 で起動

3. 事前準備・環境

ℹ️
動作確認環境

Python 3.10 以上 / Windows 11(実機)で起動・基本操作を確認 / Linux Mint 22.3(仮想マシン)で起動・画面表示を確認(macOS は未検証)

Windows 11(実機)で起動と基本操作を確認しています(全機能の網羅テストではありません)。Linux Mint 22.3(仮想マシン)では起動と画面表示を確認しました。macOS は必要なライブラリ(pip install)を入れれば動作する想定ですが、未検証です。

  • Python 3.10 以上
  • OS: Windows 11(実機で起動・基本操作を確認)・Linux Mint 22.3(仮想マシンで起動・画面表示を確認)

インストールが必要なライブラリ

pip install matplotlib

4. 完全なソースコード

💡
コードのコピー方法

右上の「コピー」ボタンをクリックするとコードをクリップボードにコピーできます。

📦 必要なライブラリをインストール(初回のみ)
pip install matplotlib
app080.py
import tkinter as tk
from tkinter import ttk, messagebox, filedialog
import re
import math
import threading
import collections

try:
    import matplotlib
    matplotlib.use("TkAgg")
    from matplotlib.figure import Figure
    from matplotlib.backends.backend_tkagg import FigureCanvasTkAgg
    from matplotlib import font_manager
    MATPLOTLIB_AVAILABLE = True
except ImportError:
    MATPLOTLIB_AVAILABLE = False

if MATPLOTLIB_AVAILABLE:
    # グラフ内の日本語が豆腐(□)にならないよう、入っている和文フォントを1つ選ぶ
    _installed = {f.name for f in font_manager.fontManager.ttflist}
    for _name in ("Meiryo", "Yu Gothic", "Noto Sans CJK JP", "Noto Sans JP",
                  "Hiragino Sans", "IPAexGothic", "MS Gothic", "DejaVu Sans"):
        if _name in _installed:
            matplotlib.rcParams["font.family"] = _name
            break
    matplotlib.rcParams["axes.unicode_minus"] = False


class App080:
    """テキスト分析ツール"""

    # 日本語・英語ストップワード(簡易版)
    STOP_WORDS = {
        "の", "に", "は", "を", "た", "が", "で", "て", "と", "し", "れ", "さ",
        "ある", "いる", "も", "する", "から", "な", "こと", "として", "い", "や",
        "れる", "など", "なっ", "ない", "この", "ため", "その", "あっ", "よう",
        "また", "もの", "という", "あり", "まで", "られ", "なる", "へ", "か",
        "だ", "これ", "によって", "により", "おり", "より", "による", "ず", "なり",
        "a", "an", "the", "is", "are", "was", "were", "be", "been", "being",
        "have", "has", "had", "do", "does", "did", "will", "would", "could",
        "should", "may", "might", "shall", "can", "to", "of", "in", "for",
        "on", "with", "at", "by", "from", "as", "or", "and", "but", "not",
        "this", "that", "it", "its", "i", "you", "he", "she", "we", "they",
    }

    def __init__(self, root):
        self.root = root
        self.root.title("テキスト分析ツール")
        self.root.geometry("1050x660")
        self.root.minsize(1050, 660)
        self.root.configure(bg="#1e1e1e")
        self._text = ""
        self._build_ui()

    def _build_ui(self):
        header = tk.Frame(self.root, bg="#252526", pady=6)
        header.pack(fill=tk.X)
        tk.Label(header, text="📝 テキスト分析ツール",
                 font=("Noto Sans JP", 12, "bold"),
                 bg="#252526", fg="#4fc3f7").pack(side=tk.LEFT, padx=12)

        # ツールバー
        tb = tk.Frame(self.root, bg="#2d2d2d", pady=4)
        tb.pack(fill=tk.X)
        ttk.Button(tb, text="📂 ファイルを開く",
                   command=self._open_file).pack(side=tk.LEFT, padx=4)
        tk.Button(tb, text="▶ 分析", command=self._analyze,
                  bg="#1565c0", fg="white", relief=tk.FLAT,
                  font=("Arial", 10, "bold"), padx=12, pady=4,
                  activebackground="#0d47a1", bd=0).pack(side=tk.LEFT, padx=4)
        ttk.Button(tb, text="🗑 クリア",
                   command=self._clear).pack(side=tk.LEFT, padx=4)

        self.stop_var = tk.BooleanVar(value=True)
        tk.Checkbutton(tb, text="ストップワード除外",
                       variable=self.stop_var,
                       bg="#2d2d2d", fg="#ccc", selectcolor="#3c3c3c",
                       activebackground="#2d2d2d").pack(side=tk.LEFT, padx=8)

        # メインエリア (PanedWindow)
        paned = ttk.PanedWindow(self.root, orient=tk.HORIZONTAL)
        paned.pack(fill=tk.BOTH, expand=True, padx=4, pady=4)

        # 左: テキスト入力
        left = tk.Frame(paned, bg="#1e1e1e")
        paned.add(left, weight=1)
        tk.Label(left, text="テキスト入力", bg="#1e1e1e", fg="#888",
                 font=("Arial", 9)).pack(anchor="w")
        self.text_input = tk.Text(left, bg="#0d1117", fg="#c9d1d9",
                                   font=("Arial", 10), relief=tk.FLAT,
                                   insertbackground="white",
                                   wrap=tk.WORD)
        txsb = ttk.Scrollbar(left, command=self.text_input.yview)
        self.text_input.configure(yscrollcommand=txsb.set)
        txsb.pack(side=tk.RIGHT, fill=tk.Y)
        self.text_input.pack(fill=tk.BOTH, expand=True)
        self.text_input.bind("<<Modified>>", self._on_text_change)

        # 右: 分析結果
        right = tk.Frame(paned, bg="#1e1e1e")
        paned.add(right, weight=1)

        # 統計ノートブック
        nb = ttk.Notebook(right)
        nb.pack(fill=tk.BOTH, expand=True)

        # タブ1: 基本統計
        tab_stat = tk.Frame(nb, bg="#1e1e1e")
        nb.add(tab_stat, text="基本統計")
        self.stat_text = tk.Text(tab_stat, bg="#0d1117", fg="#c9d1d9",
                                  font=("Courier New", 9), relief=tk.FLAT,
                                  state=tk.DISABLED)
        self.stat_text.pack(fill=tk.BOTH, expand=True)

        # タブ2: 単語頻度
        tab_freq = tk.Frame(nb, bg="#1e1e1e")
        nb.add(tab_freq, text="単語頻度")
        cols = ("rank", "word", "count", "pct")
        self.freq_tree = ttk.Treeview(tab_freq, columns=cols,
                                       show="headings", height=18)
        self.freq_tree.heading("rank",  text="#")
        self.freq_tree.heading("word",  text="単語")
        self.freq_tree.heading("count", text="出現数")
        self.freq_tree.heading("pct",   text="割合")
        self.freq_tree.column("rank",  width=40,  anchor="center")
        self.freq_tree.column("word",  width=140, anchor="w")
        self.freq_tree.column("count", width=70,  anchor="center")
        self.freq_tree.column("pct",   width=70,  anchor="center")
        fsb = ttk.Scrollbar(tab_freq, command=self.freq_tree.yview)
        self.freq_tree.configure(yscrollcommand=fsb.set)
        fsb.pack(side=tk.RIGHT, fill=tk.Y)
        self.freq_tree.pack(fill=tk.BOTH, expand=True)

        # タブ3: グラフ
        tab_chart = tk.Frame(nb, bg="#0d1117")
        nb.add(tab_chart, text="グラフ")
        if MATPLOTLIB_AVAILABLE:
            self.fig = Figure(figsize=(5, 4), facecolor="#0d1117")
            self.ax  = self.fig.add_subplot(111)
            self.mpl_canvas = FigureCanvasTkAgg(self.fig, master=tab_chart)
            self.mpl_canvas.get_tk_widget().pack(fill=tk.BOTH, expand=True)
        else:
            tk.Label(tab_chart,
                     text="pip install matplotlib でグラフが表示されます",
                     bg="#0d1117", fg="#555").pack(expand=True)

        # タブ4: 文字解析
        tab_char = tk.Frame(nb, bg="#1e1e1e")
        nb.add(tab_char, text="文字解析")
        self.char_text = tk.Text(tab_char, bg="#0d1117", fg="#c9d1d9",
                                  font=("Courier New", 9), relief=tk.FLAT,
                                  state=tk.DISABLED)
        self.char_text.pack(fill=tk.BOTH, expand=True)

        self.status_var = tk.StringVar(value="テキストを入力または読み込んでください")
        tk.Label(self.root, textvariable=self.status_var,
                 bg="#252526", fg="#858585", font=("Arial", 9),
                 anchor="w", padx=8).pack(fill=tk.X, side=tk.BOTTOM)

    # ── ファイル ─────────────────────────────────────────────
    def _open_file(self):
        path = filedialog.askopenfilename(
            filetypes=[("テキスト", "*.txt *.md *.csv"), ("すべて", "*.*")])
        if not path:
            return
        for enc in ("utf-8-sig", "utf-8", "shift-jis", "cp932", "euc-jp"):
            try:
                with open(path, encoding=enc) as f:
                    text = f.read()
                break
            except UnicodeDecodeError:
                continue
        self.text_input.delete("1.0", tk.END)
        self.text_input.insert("1.0", text)
        self.status_var.set(f"読み込み: {path}")

    def _on_text_change(self, _=None):
        self.text_input.edit_modified(False)

    def _clear(self):
        self.text_input.delete("1.0", tk.END)
        for widget in (self.stat_text, self.char_text):
            widget.configure(state=tk.NORMAL)
            widget.delete("1.0", tk.END)
            widget.configure(state=tk.DISABLED)
        self.freq_tree.delete(*self.freq_tree.get_children())

    # ── 分析 ─────────────────────────────────────────────────
    def _analyze(self):
        text = self.text_input.get("1.0", tk.END).strip()
        if not text:
            messagebox.showwarning("警告", "テキストを入力してください")
            return
        self._text = text
        self.status_var.set("分析中...")
        threading.Thread(target=self._do_analyze, daemon=True).start()

    def _do_analyze(self):
        text = self._text
        use_stop = self.stop_var.get()

        # --- 基本統計 ---
        chars   = len(text)
        chars_ns = len(text.replace(" ", "").replace("\n", ""))
        lines   = text.count("\n") + 1
        words_raw = re.findall(r"\w+", text, re.UNICODE)
        words   = len(words_raw)
        sents   = len(re.findall(r"[。.!?!?]", text)) or 1
        paras   = len([p for p in text.split("\n\n") if p.strip()])
        avg_wl  = sum(len(w) for w in words_raw) / max(1, words)
        avg_sw  = words / sents

        # ユニーク語数
        unique  = len(set(w.lower() for w in words_raw))
        # 日本語文字率
        jp_chars = len(re.findall(r"[\u3040-\u9fff]", text))
        jp_rate  = jp_chars / max(1, chars) * 100

        stat_str = (
            f"━━ 基本統計 ━━━━━━━━━━━━━━━━━━\n"
            f"  文字数 (全体):   {chars:>8,}\n"
            f"  文字数 (空白除): {chars_ns:>8,}\n"
            f"  行数:            {lines:>8,}\n"
            f"  段落数:          {paras:>8,}\n"
            f"  単語数:          {words:>8,}\n"
            f"  ユニーク語数:    {unique:>8,}\n"
            f"  文数 (句点等):   {sents:>8,}\n"
            f"  平均語長:        {avg_wl:>8.2f} 文字\n"
            f"  平均文長:        {avg_sw:>8.1f} 語/文\n"
            f"  日本語文字率:    {jp_rate:>7.1f}%\n"
            f"\n━━ 可読性 ━━━━━━━━━━━━━━━━━━━\n"
        )
        # Flesch-Kincaid (英語向け簡易計算)
        syllables = sum(max(1, len(re.findall(r"[aeiouAEIOU]", w)))
                        for w in words_raw)
        fk = max(0, 206.835 - 1.015 * (words / sents)
                  - 84.6 * (syllables / max(1, words)))
        stat_str += f"  Flesch Reading Ease: {fk:.1f}\n"

        # --- 単語頻度 ---
        tokens = [w.lower() for w in words_raw]
        if use_stop:
            tokens = [t for t in tokens if t not in self.STOP_WORDS and len(t) > 1]
        counter = collections.Counter(tokens)
        top50   = counter.most_common(50)
        total_t = sum(counter.values())

        # --- 文字解析 ---
        hiragana = len(re.findall(r"[\u3041-\u3096]", text))
        katakana = len(re.findall(r"[\u30a1-\u30f6]", text))
        kanji    = len(re.findall(r"[\u4e00-\u9fff]", text))
        ascii_a  = len(re.findall(r"[a-zA-Z]", text))
        digits   = len(re.findall(r"\d", text))
        punct    = len(re.findall(r"[、。,.「」『』【】・…—\-!?!?]", text))

        char_str = (
            f"━━ 文字種別 ━━━━━━━━━━━━━━━━━\n"
            f"  ひらがな: {hiragana:>7,}\n"
            f"  カタカナ: {katakana:>7,}\n"
            f"  漢字:     {kanji:>7,}\n"
            f"  ASCII英字:{ascii_a:>7,}\n"
            f"  数字:     {digits:>7,}\n"
            f"  句読点等: {punct:>7,}\n"
        )

        self.root.after(0, self._update_ui, stat_str, top50, total_t, char_str)

    def _update_ui(self, stat_str, top50, total_t, char_str):
        # 基本統計
        self.stat_text.configure(state=tk.NORMAL)
        self.stat_text.delete("1.0", tk.END)
        self.stat_text.insert("1.0", stat_str)
        self.stat_text.configure(state=tk.DISABLED)

        # 単語頻度
        self.freq_tree.delete(*self.freq_tree.get_children())
        for i, (word, cnt) in enumerate(top50, 1):
            pct = cnt / max(1, total_t) * 100
            self.freq_tree.insert("", tk.END,
                                   values=(i, word, cnt, f"{pct:.2f}%"))

        # グラフ
        if MATPLOTLIB_AVAILABLE and top50:
            words = [w for w, _ in top50[:20]]
            counts = [c for _, c in top50[:20]]
            self.ax.clear()
            self.ax.set_facecolor("#0d1117")
            bars = self.ax.barh(list(reversed(words)), list(reversed(counts)),
                                  color="#4fc3f7")
            self.ax.set_title("単語頻度 Top 20", color="#c9d1d9", fontsize=10)
            self.ax.tick_params(colors="#8b949e", labelsize=7)
            for spine in self.ax.spines.values():
                spine.set_edgecolor("#30363d")
            self.ax.grid(True, axis="x", color="#21262d", linewidth=0.5)
            self.fig.tight_layout()
            self.mpl_canvas.draw()

        # 文字解析
        self.char_text.configure(state=tk.NORMAL)
        self.char_text.delete("1.0", tk.END)
        self.char_text.insert("1.0", char_str)
        self.char_text.configure(state=tk.DISABLED)

        self.status_var.set(
            f"分析完了: {len(self._text):,} 文字  Top語: "
            f"{top50[0][0] if top50 else '-'} ({top50[0][1] if top50 else 0} 回)")


if __name__ == "__main__":
    root = tk.Tk()
    app = App080(root)
    root.mainloop()

5. コード解説

テキスト分析ツールのコードを、実際に書かれている実装に沿って解説します。

クラス設計とコンストラクタ

App080 クラスにアプリの全機能をまとめています(メソッド8個・全312行)。__init__ ではタイトル「テキスト分析ツール」とウィンドウサイズ 1050x660 を設定します。あわせて状態を保持する変数(self._text)を初期化し、最後に _build_ui() で画面を組み立てます。

※ 該当部分のコード本体は 「4. 完全なソースコード」 をご参照ください(重複表示を避けるため再掲を省略しています)。

ウィジェット構成

画面は tk.Frame×8・tk.Label×4・ttk.Button×2・tk.Buttontk.Checkbuttonttk.PanedWindowtk.Text×3・ttk.Scrollbar×2・ttk.Notebookttk.Treeview で構成しています。PanedWindow を使っているので、ペインの境界をマウスでドラッグして幅を変えられます。

※ 該当部分のコード本体は 「4. 完全なソースコード」 をご参照ください(重複表示を避けるため再掲を省略しています)。

イベント処理とボタンの接続

「📂 ファイルを開く」ボタン(_open_file())・「▶ 分析」ボタン(_analyze())・「🗑 クリア」ボタン(_clear())を command= で接続しています。また bind("<<Modified>>", ...) から _on_text_change() を呼べるようにイベントも登録しています。

※ 該当部分のコード本体は 「4. 完全なソースコード」 をご参照ください(重複表示を避けるため再掲を省略しています)。

例外処理

try-except で ImportErrorUnicodeDecodeError を捕捉しています。あわせて messagebox.showwarning() のダイアログで、ユーザーへの通知・確認を行います。

※ 該当部分のコード本体は 「4. 完全なソースコード」 をご参照ください(重複表示を避けるため再掲を省略しています)。

6. ステップバイステップガイド

このアプリをゼロから自分で作る手順を解説します。コードをコピーするだけでなく、実際に手順を追って自分で書いてみましょう。

  1. 1
    ファイルを作成する

    新しいファイルを作成して app080.py と保存します。外部ライブラリ matplotlib を使います。先に pip install matplotlib を実行してください。

  2. 2
    クラスの骨格を作る

    App080 クラスを定義し、__init__ と、末尾の root = tk.Tk()mainloop() の最小構成を書いて、まず空のウィンドウが出ることを確認します。

  3. 3
    ウィンドウを設定する

    title("テキスト分析ツール")geometry("1050x660")configure(bg="#1e1e1e")minsize(1050, 660) をコンストラクタで設定します。

  4. 4
    画面部品を並べる

    _build_ui() の中で、tk.Frame×8・tk.Label×4・ttk.Button×2・tk.Buttontk.Checkbuttonttk.PanedWindowtk.Text×3・ttk.Scrollbar×2・ttk.Notebookttk.Treeview を作って配置します(掲載コードと同じ並び順で書くとレイアウトが一致します)。まず表示だけ確認しましょう。

  5. 5
    イベントを接続する

    「2. 機能一覧」で挙げた各ボタンを command= で対応するメソッド(_open_file()_analyze()_clear())につなぎます。bind("<<Modified>>", ...) の登録も忘れずに。

  6. 6
    中心になるメソッドを実装する

    アプリの本体である _update_ui()(39行)・_open_file()(15行)・_analyze()(8行)など を実装します。

  7. 7
    動作確認する

    python app080.py で起動し、各ボタンが反応することを確認します。

7. カスタマイズアイデア

基本機能を習得したら、以下のカスタマイズに挑戦してみましょう。

💡 ダークモードを追加する

bg色・fg色を辞書で管理し、ボタン1つでダークモード・ライトモードを切り替えられるようにしましょう。

💡 クラス定数を書き換えて動きを変える

データはクラス定数(STOP_WORDS)にまとまっています。中身を書き換えて動きが変わることを確かめましょう。複数の定数が対応関係にある場合は、セットで整合させる必要がある点に注意してください。

💡 設定ダイアログ

フォントサイズや色などの設定をユーザーが変更できるオプションダイアログを追加しましょう。

8. よくある問題と解決法

❌ 文字のフォントが崩れる・見た目が違う

原因:このコードは font=("Noto Sans JP", ...) のようにフォント名を直接指定しています。環境にこのフォントが入っていないと、OS が代わりのフォントで表示するため、見本と見た目が変わることがあります。

解決法:動作には支障ありません。気になる場合は font 引数の名前を自分の OS に入っているフォントへ書き換えるか、font 引数を省略してください。

❌ ウィンドウの大きさが画面に合わない

原因:geometry("1050x660") の固定サイズで起動するためです。

解決法:geometry()minsize() の両方の数値を書き換えて起動サイズを調整してください。なお、このコードにはウィンドウサイズを固定する設定(resizable の指定)が無いため、ウィンドウの端をドラッグしたサイズ変更は既定どおり可能です。ただし minsize(1050, 660) を指定しているため、起動時の大きさより小さくは縮められません(縮めると画面部品が表示されなくなるのを防ぐためです)。

9. 練習問題

アプリの理解を深めるための練習問題です。

  1. 課題1:機能拡張

    テキスト分析ツールに新しい機能を1つ追加してみましょう。

  2. 課題2:UIの改善

    色・フォント・レイアウトを変更して、より使いやすいUIにカスタマイズしましょう。

  3. 課題3:保存機能の追加

    処理結果をファイルに保存する機能を追加しましょう。

🚀
次に挑戦するアプリ

このアプリをマスターしたら、次のアプリに挑戦しましょう。

🐛
エラーが出て動かないときは

写経中に赤いエラー文が出たら、Pythonエラー一覧&解決法(英語メッセージ逆引き)で原因と直し方をすぐ確認できます。

📖
次のレベルへ進む参考書

このレベルのアプリが作れたら、入門書の次の「作るための本」へ進む時期です。実践におすすめのPython本(当サイトの参考書ランキング総合3〜4位)で自動化とコードの書き方の2冊を、その直後の用途別専門書の節でデータ分析・Web・AIの本を比較しています。