重複ファイル検出
ハッシュ値を比較して重複ファイルを検出し削除候補を一覧表示するツール。hashlib・os活用。
1. アプリ概要
ハッシュ値を比較して重複ファイルを検出し削除候補を一覧表示するツール。hashlib・os活用。
このアプリはfileカテゴリの実践的なPythonアプリです。使用ライブラリは tkinter(標準ライブラリ)、難易度は ★★★ です。
このアプリは「ファイル操作」カテゴリです。ファイル操作は業務スクリプトの心臓部で、I/O のパターンは他のあらゆる Python プログラムで再利用できます。tkinter(標準ライブラリ) を活かして実装するこの構造は、他のアプリにも応用が効きます。
コードを読む前に実行することをおすすめします。動いている挙動を先に把握しておくと、解説で出てくる関数や処理がどこに対応するかが頭に入りやすくなります。
応用のヒントは、機能を 1 つ増やす・見た目を整える・例外を一つでも丁寧に扱う、のいずれかから始めるのがおすすめです。
2. 機能一覧
- 「参照」ボタン(
_pick_folder())・「▶ スキャン開始」ボタン(_start_scan())・「🗑 選択削除」ボタン(_delete_selected())で操作 ttk.Treeviewによる表形式の一覧表示filedialog.askdirectory()によるファイル選択ダイアログmessagebox.askyesno()・messagebox.showerror()・messagebox.showinfo()によるダイアログ通知- ウィンドウはタイトル「重複ファイル検出」・サイズ 860x580 で起動
3. 事前準備・環境
Python 3.10 以上 / Windows 11(実機)で起動・基本操作を確認 / Linux Mint 22.3(仮想マシン)で起動・画面表示を確認(macOS は未検証)
Windows 11(実機)で起動と基本操作を確認しています(全機能の網羅テストではありません)。Linux Mint 22.3(仮想マシン)では起動と画面表示を確認しました。macOS は標準ライブラリの範囲で動作する想定ですが、未検証です。
- Python 3.10 以上
- OS: Windows 11(実機で起動・基本操作を確認)・Linux Mint 22.3(仮想マシンで起動・画面表示を確認)
4. 完全なソースコード
右上の「コピー」ボタンをクリックするとコードをクリップボードにコピーできます。
import tkinter as tk
from tkinter import ttk, messagebox, filedialog
import os
import hashlib
import threading
from collections import defaultdict
class App053:
"""重複ファイル検出"""
def __init__(self, root):
self.root = root
self.root.title("重複ファイル検出")
self.root.geometry("860x580")
self.root.configure(bg="#1e1e1e")
self._scanning = False
self._build_ui()
def _build_ui(self):
header = tk.Frame(self.root, bg="#252526", pady=6)
header.pack(fill=tk.X)
tk.Label(header, text="🔍 重複ファイル検出",
font=("Noto Sans JP", 12, "bold"),
bg="#252526", fg="#4fc3f7").pack(side=tk.LEFT, padx=12)
# フォルダ選択
top = tk.Frame(self.root, bg="#1e1e1e", pady=4)
top.pack(fill=tk.X, padx=8)
tk.Label(top, text="スキャン対象:", bg="#1e1e1e", fg="#ccc",
font=("Arial", 9)).pack(side=tk.LEFT)
self.folder_var = tk.StringVar()
ttk.Entry(top, textvariable=self.folder_var,
width=50).pack(side=tk.LEFT, padx=4)
ttk.Button(top, text="参照",
command=self._pick_folder).pack(side=tk.LEFT)
# オプション
opt = tk.Frame(self.root, bg="#1e1e1e", pady=2)
opt.pack(fill=tk.X, padx=8)
self.recurse_var = tk.BooleanVar(value=True)
tk.Checkbutton(opt, text="サブフォルダも含める",
variable=self.recurse_var,
bg="#1e1e1e", fg="#ccc", selectcolor="#3c3c3c",
activebackground="#1e1e1e").pack(side=tk.LEFT)
tk.Label(opt, text="比較方法:", bg="#1e1e1e", fg="#ccc",
font=("Arial", 9)).pack(side=tk.LEFT, padx=(12, 4))
self.method_var = tk.StringVar(value="md5")
ttk.Combobox(opt, textvariable=self.method_var,
values=["md5", "sha256", "サイズ+名前"],
state="readonly", width=12).pack(side=tk.LEFT)
ttk.Button(opt, text="▶ スキャン開始",
command=self._start_scan).pack(side=tk.LEFT, padx=12)
ttk.Button(opt, text="🗑 選択削除",
command=self._delete_selected).pack(side=tk.LEFT)
# 結果ツリー
result_f = tk.Frame(self.root, bg="#1e1e1e")
result_f.pack(fill=tk.BOTH, expand=True, padx=8, pady=4)
self.tree = ttk.Treeview(result_f, columns=("path", "size", "hash"),
show="tree headings", selectmode="extended")
self.tree.heading("#0", text="グループ / ファイル")
self.tree.heading("path", text="パス")
self.tree.heading("size", text="サイズ")
self.tree.heading("hash", text="ハッシュ/識別子")
self.tree.column("#0", width=220, anchor="w")
self.tree.column("path", width=340, anchor="w")
self.tree.column("size", width=80, anchor="e")
self.tree.column("hash", width=120, anchor="w")
sb = ttk.Scrollbar(result_f, command=self.tree.yview)
self.tree.configure(yscrollcommand=sb.set)
sb.pack(side=tk.RIGHT, fill=tk.Y)
self.tree.pack(fill=tk.BOTH, expand=True)
self.tree.tag_configure("group", foreground="#ffd700", font=("Arial", 9, "bold"))
self.tree.tag_configure("dup", foreground="#f48771")
# 進捗
self.progress = ttk.Progressbar(self.root, mode="indeterminate")
self.progress.pack(fill=tk.X, padx=8)
self.status_var = tk.StringVar(value="フォルダを選択してスキャンしてください")
tk.Label(self.root, textvariable=self.status_var,
bg="#252526", fg="#858585", font=("Arial", 9),
anchor="w", padx=8).pack(fill=tk.X, side=tk.BOTTOM)
def _pick_folder(self):
folder = filedialog.askdirectory()
if folder:
self.folder_var.set(folder)
def _start_scan(self):
folder = self.folder_var.get().strip()
if not folder or not os.path.isdir(folder):
messagebox.showerror("エラー", "有効なフォルダを指定してください")
return
self.progress.start()
self.status_var.set("スキャン中...")
threading.Thread(target=self._do_scan, args=(folder,),
daemon=True).start()
def _do_scan(self, folder):
try:
files = []
if self.recurse_var.get():
for dirpath, _, filenames in os.walk(folder):
for fn in filenames:
files.append(os.path.join(dirpath, fn))
else:
files = [os.path.join(folder, f)
for f in os.listdir(folder)
if os.path.isfile(os.path.join(folder, f))]
method = self.method_var.get()
groups = defaultdict(list)
for path in files:
try:
key = self._file_key(path, method)
groups[key].append(path)
except Exception:
pass
duplicates = {k: v for k, v in groups.items() if len(v) > 1}
self.root.after(0, self._show_results, duplicates, len(files))
except Exception as e:
self.root.after(0, self._on_error, str(e))
def _file_key(self, path, method):
size = os.path.getsize(path)
if method == "サイズ+名前":
return f"{size}_{os.path.basename(path)}"
algo = hashlib.md5() if method == "md5" else hashlib.sha256()
with open(path, "rb") as f:
for chunk in iter(lambda: f.read(65536), b""):
algo.update(chunk)
return algo.hexdigest()
def _show_results(self, duplicates, total):
self.progress.stop()
self.tree.delete(*self.tree.get_children())
total_dup = sum(len(v) for v in duplicates.values())
total_groups = len(duplicates)
for i, (key, paths) in enumerate(duplicates.items(), 1):
size = os.path.getsize(paths[0])
size_str = self._fmt_size(size)
wasted = self._fmt_size(size * (len(paths) - 1))
group_node = self.tree.insert(
"", tk.END,
text=f"グループ {i} ({len(paths)} 件, 無駄: {wasted})",
values=("", "", key[:16]),
tags=("group",), open=True)
for path in paths:
self.tree.insert(group_node, tk.END,
text=os.path.basename(path),
values=(path, size_str, ""),
tags=("dup",))
self.status_var.set(
f"スキャン完了: {total} 件中 {total_dup} 件の重複を検出 "
f"({total_groups} グループ)")
def _on_error(self, msg):
self.progress.stop()
messagebox.showerror("エラー", msg)
self.status_var.set("エラーが発生しました")
def _delete_selected(self):
sel = self.tree.selection()
if not sel:
return
to_delete = []
for iid in sel:
path = self.tree.set(iid, "path")
if path and os.path.isfile(path):
to_delete.append(path)
if not to_delete:
messagebox.showinfo("情報", "削除対象のファイルが選択されていません")
return
if not messagebox.askyesno(
"削除確認",
f"{len(to_delete)} 件のファイルを削除します。\n"
"この操作は元に戻せません。よろしいですか?"):
return
ok = err = 0
for path in to_delete:
try:
os.remove(path)
ok += 1
except Exception:
err += 1
self.status_var.set(f"削除完了: {ok} 件成功 / {err} 件失敗")
self._start_scan()
@staticmethod
def _fmt_size(size):
for unit in ("B", "KB", "MB", "GB"):
if size < 1024:
return f"{size:.1f} {unit}"
size /= 1024
return f"{size:.1f} TB"
if __name__ == "__main__":
root = tk.Tk()
app = App053(root)
root.mainloop()
5. コード解説
重複ファイル検出のコードを、実際に書かれている実装に沿って解説します。
クラス設計とコンストラクタ
App053 クラスにアプリの全機能をまとめています(メソッド10個・全209行)。__init__ ではタイトル「重複ファイル検出」とウィンドウサイズ 860x580 を設定します。最後に _build_ui() で画面を組み立てます。
※ 該当部分のコード本体は 「4. 完全なソースコード」 をご参照ください(重複表示を避けるため再掲を省略しています)。
ウィジェット構成
画面は tk.Frame×4・tk.Label×4・ttk.Entry・ttk.Button×3・tk.Checkbutton・ttk.Combobox・ttk.Treeview・ttk.Scrollbar・ttk.Progressbar で構成しています。
※ 該当部分のコード本体は 「4. 完全なソースコード」 をご参照ください(重複表示を避けるため再掲を省略しています)。
イベント処理とボタンの接続
「参照」ボタン(_pick_folder())・「▶ スキャン開始」ボタン(_start_scan())・「🗑 選択削除」ボタン(_delete_selected())を command= で接続しています。
※ 該当部分のコード本体は 「4. 完全なソースコード」 をご参照ください(重複表示を避けるため再掲を省略しています)。
例外処理
try-except で Exception を捕捉しています。あわせて messagebox.askyesno()・messagebox.showerror()・messagebox.showinfo() のダイアログで、ユーザーへの通知・確認を行います。
※ 該当部分のコード本体は 「4. 完全なソースコード」 をご参照ください(重複表示を避けるため再掲を省略しています)。
6. ステップバイステップガイド
このアプリをゼロから自分で作る手順を解説します。コードをコピーするだけでなく、実際に手順を追って自分で書いてみましょう。
-
1ファイルを作成する
新しいファイルを作成して app053.py と保存します。使うのは
collections・hashlib・os・threading・tkinterだけなので、追加インストールは不要です。 -
2クラスの骨格を作る
App053クラスを定義し、__init__と、末尾のroot = tk.Tk()~mainloop()の最小構成を書いて、まず空のウィンドウが出ることを確認します。 -
3ウィンドウを設定する
title("重複ファイル検出")・geometry("860x580")・configure(bg="#1e1e1e")をコンストラクタで設定します。 -
4画面部品を並べる
_build_ui()の中で、tk.Frame×4・tk.Label×4・ttk.Entry・ttk.Button×3・tk.Checkbutton・ttk.Combobox・ttk.Treeview・ttk.Scrollbar・ttk.Progressbarを作って配置します(掲載コードと同じ並び順で書くとレイアウトが一致します)。まず表示だけ確認しましょう。 -
5イベントを接続する
「2. 機能一覧」で挙げた各ボタンを
command=で対応するメソッド(_pick_folder()・_start_scan()・_delete_selected())につなぎます。 -
6中心になるメソッドを実装する
アプリの本体である
_show_results()(24行)・_on_error()(4行)・_delete_selected()(26行)など を実装します。 -
7動作確認する
python app053.pyで起動し、各ボタンが反応することを確認します。
7. カスタマイズアイデア
基本機能を習得したら、以下のカスタマイズに挑戦してみましょう。
💡 ダークモードを追加する
bg色・fg色を辞書で管理し、ボタン1つでダークモード・ライトモードを切り替えられるようにしましょう。
💡 結果をファイルに保存する
このコードに保存処理はないため、表示中の数値や結果はアプリを閉じると消えます。テキストファイルへ書き出して、次回起動時に読み込む機能を追加してみましょう。
💡 設定ダイアログ
フォントサイズや色などの設定をユーザーが変更できるオプションダイアログを追加しましょう。
8. よくある問題と解決法
❌ 文字のフォントが崩れる・見た目が違う
原因:このコードは font=("Noto Sans JP", ...) のようにフォント名を直接指定しています。環境にこのフォントが入っていないと、OS が代わりのフォントで表示するため、見本と見た目が変わることがあります。
解決法:動作には支障ありません。気になる場合は font 引数の名前を自分の OS に入っているフォントへ書き換えるか、font 引数を省略してください。
❌ ウィンドウの大きさが画面に合わない
原因:geometry("860x580") の固定サイズで起動するためです。
解決法:この数値を書き換えて起動サイズを調整してください。なお、このコードにはウィンドウサイズを固定する設定(resizable の指定)が無いため、ウィンドウの端をドラッグしたサイズ変更は既定どおり可能です。
9. 練習問題
アプリの理解を深めるための練習問題です。気になるものから挑戦してみてください(課題3は定型の発展課題です)。「🗑 選択削除」は os.remove() でファイルを本当に消します。ごみ箱には入らず元に戻せないので、練習は、消えても困らないファイルをコピーした専用のフォルダを新しく作って行ってください。「▶ スキャン開始」だけならファイルを読むだけで、書き換えは起きません。追加のライブラリは要りません。
-
課題1:グループの最後の1つまで消せてしまう
重複したファイルは1つ残せば足りますが、「🗑 選択削除」は選ばれた行をすべて消します。グループの中の全部を選ぶと、コピー元まで丸ごと消えます。少なくとも1つは残るようにしてください。
期待結果:同じ内容のファイルを
a.txt・b.txtの2つ置いたフォルダをスキャンする。「グループ 1」の下に並ぶ2行を両方選び、「🗑 選択削除」を押す。確認ダイアログは2 件のファイルを削除します。と出て、「はい」を押すと2つとも消え、末尾の再スキャンでステータスはスキャン完了: 0 件中 0 件の重複を検出 (0 グループ)になる。直したあとは1つが残り、スキャン完了: 1 件中 0 件の重複を検出 (0 グループ)と出る。合格条件
- グループの中の1つだけを選んだときは、これまでどおり消える
- 2つのグループの全行をまとめて選んだときは、グループごとに1つずつ残る
- 確認ダイアログの件数と、実際に消えた数が一致する
ヒント①(どこを触るか): 触るのは
_delete_selected()の2か所です。for iid in sel:のループの中と、そのループが終わったあと(if not to_delete:の手前)です。
ヒント②(使うもの):self.tree.parent(iid)で属するグループ見出しの ID、self.tree.get_children(gid)でグループ内の全行が取れます。6行目で読み込み済みのdefaultdict(list)にグループごとの選択行をためて、全行そろったグループだけ1件外します。
つまずきやすい点: グループ見出しの行を選んでも、self.tree.set(iid, "path")は空文字なので削除対象になりません。見出しだけを選ぶと「削除対象のファイルが選択されていません」と出ます。削除のあとは末尾のself._start_scan()が一覧を作り直すため、1件だけになったグループは一覧から消えます。 -
課題2:重複で無駄になっている合計容量が出ない
一覧の見出し行にはグループごとの無駄容量が出ますが、下のステータスバーは件数だけです。グループが10個あれば、10個の数字を自分で足すことになります。合計を出してください。
期待結果:同じ内容のファイル(1つ 150 バイト)を3つ置いたフォルダをスキャンすると、見出し行は
グループ 1 (3 件, 無駄: 300.0 B)、ステータスはスキャン完了: 3 件中 3 件の重複を検出 (1 グループ)になる。合計はどこにも出ない。直したあとは、ステータスの末尾に合計 300.0 Bが加わる。合格条件
- 重複が0件のときは、合計を
0.0 Bと出すか、これまでどおりの文面にする - 見出し行の「無駄」を全部足した値と、ステータスの合計が一致する
- 単位の付け方を一覧とそろえる(
_fmt_size()を使う)
ヒント①(どこを触るか): 触るのは
_show_results()の2か所です。total_dup = sum(...)のあたりで合計を数える所と、末尾のself.status_var.set(...)です。
ヒント②(使うもの): グループごとの無駄容量はsize * (len(paths) - 1)として、ループの中ですでに計算しています。同じ式をtotal_dup = sum(...)の隣に1行足してwasted_total = sum(os.path.getsize(v[0]) * (len(v) - 1) for v in duplicates.values())とまとめ、最後にself._fmt_size(wasted_total)で単位を付けてください。
つまずきやすい点:_fmt_size()は@staticmethodですが、self._fmt_size(...)の形で呼べます。1024 バイト未満は小数第1位まで出るので、300 バイトなら300.0 Bという表示。比較方法を「サイズ+名前」にしたときは、名前とサイズが同じだけで中身の違うファイルも同じグループに入るため、その合計は「消せば空く容量」ではありません。 - 重複が0件のときは、合計を
-
課題3:保存機能の追加
処理結果をファイルに保存する機能を追加しましょう。
写経中に赤いエラー文が出たら、Pythonエラー一覧&解決法(英語メッセージ逆引き)で原因と直し方をすぐ確認できます。
このレベルのアプリが作れたら、入門書の次の「作るための本」へ進む時期です。実践におすすめのPython本(当サイトの参考書ランキング総合3〜4位)で自動化とコードの書き方の2冊を、その直後の用途別専門書の節でデータ分析・Web・AIの本を比較しています。