Whisper 字幕作成ツール
v1.0 / 2026年9月公開
MP4 や MP3 を放り込むだけで、AI(OpenAI Whisper)が話している内容を聞き取り、 字幕ファイル(SRT / VTT / JSON)を書き出す Windows 用のフリーソフトです。
処理はすべて自分のパソコンの中で完結します。 クラウドの文字起こしサービスと違い、音声データを外部に送信しません。 社外秘の会議録画や、公開前の動画にも使えます。
対応:Windows 10 / 11 | NVIDIA GPU 対応(無くても動作) | 日本語対応 | 無料・商用利用可
配布ファイルは約 31 KB です。必要な部品はセットアップ時に自動で取得されます。
できること
- 音声を外に出さない ― 文字起こしはすべて手元のパソコンで処理します。
- GPU で高速処理 ― NVIDIA のグラフィックボードがあれば自動で使います。無い場合も CPU で動きます。
- まとめて処理 ― 複数ファイルを登録して順番に処理。フォルダごと追加、ドラッグ&ドロップも可能。
- 3 つの形式で出力 ― SRT / VTT / JSON を同時に書き出せます。ファイル名は自動生成。
- 字幕として読める形に整形 ― 指定した文字数で自動改行し、禁則処理も行います。
- 句読点を補う ― 日本語で句読点が省かれやすい問題に対応します。
- 途中で中止できる ― 長いファイルでも、間違えたと思ったら止められます。
出力される字幕の例
同じ音声を、自動整形の有無で比べたものです。 AI の生の出力は 1 行が 35 文字を超えることも多く、そのままでは字幕として読めません。
整形なし(AI の生の出力)
2
00:00:05,300 --> 00:00:13,120
今日の天気は晴れです 音声認識が正しく動いているかどうかを確認しています
本ツールの出力(句読点の補完+自動改行)
2
00:00:05,280 --> 00:00:13,120
今日の天気は晴れです。音声認識が正しく
動いているかどうかを確認しています。
1 行あたりの文字数と行数は画面から変更できます。初期値は「20 文字 × 2 行」で、 これはテレビ字幕の慣習に近い設定です。指定を超えた分は次の字幕に自動で分割され、 表示時間も文字数に応じて割り振られます。
処理時間のめやす
10 分の動画を標準設定(medium モデル)で処理した場合の目安です。
| 環境 | 処理時間 | 備考 |
|---|---|---|
| NVIDIA GeForce RTX 3060 Ti | 約 1〜2 分 | VRAM 8GB。動作確認に使った環境 |
| GPU なし(CPU のみ) | 約 20〜40 分 | small モデルへの変更を推奨 |
初回のみ、AI モデル(約 1.5 GB)のダウンロード時間が加わります。2 回目以降は不要です。
動作環境
| OS | Windows 10 / 11(64bit) |
|---|---|
| Python | 3.10 〜 3.12 未導入の場合は 公式サイトから。「Install Now」を押すだけで、管理者権限は不要です |
| 空き容量 | GPU あり:約 6 GB / GPU なし:約 3 GB |
| 推奨 GPU | NVIDIA 製・VRAM 5GB 以上(GeForce RTX 3060 / 4060 以上) |
| ネット接続 | 初回セットアップ時のみ必要 |
対応形式:MP4 / MKV / MOV / AVI / WebM / WMV / FLV / TS / M4V / MPG / WAV / MP3 / M4A / FLAC / OGG / OPUS / AAC / WMA / AIFF
導入手順
- ダウンロードして展開する
ZIP を好きな場所(デスクトップなど)に展開します。 - 「セットアップ.bat」をダブルクリック
必要な部品が自動で入ります。初回のみ 10〜40 分ほどかかります。 インストール先はこのフォルダの中だけで、パソコンの他の場所は変更しません。 - 「起動.bat」をダブルクリック
2 回目以降はこれだけです。
うまく動かないときは FAQ・困ったとき をご覧ください。
使用しているオープンソースソフトウェア
| 名称 | 用途 | ライセンス |
|---|---|---|
| OpenAI Whisper | 音声認識 | MIT |
| PyTorch | 機械学習の実行基盤(GPU 処理) | BSD-3-Clause |
| PyAV / FFmpeg | 動画・音声の読み込み | BSD-3-Clause / LGPL |
| tkinterdnd2 | ドラッグ&ドロップ | MIT |
更新履歴
| バージョン | 日付 | 内容 |
|---|---|---|
| v1.0 | 2026-09-09 | 初回公開。SRT / VTT / JSON 出力、GPU 自動判定、複数ファイル処理、 字幕の自動改行、日本語の句読点補完、残り時間表示に対応。 |
過去のバージョンは GitHub の Releases から取得できます。
ライセンスと注意
本ツールは無料で利用でき、商用・業務利用も可能です。 内部で利用している OpenAI Whisper(MIT License)、 PyTorch(BSD-3-Clause)、 PyAV / FFmpeg のライセンスに従います。