FAQ・困ったとき

最終更新:2026年9月

まずこれを試してください 原因が分からないときは 環境チェック.bat を実行してください。 「Run the full test?」と聞かれたら Enter を押すと、 テスト用の音声を実際に 1 回文字起こしして、どこで失敗しているかを特定します(1 分ほど)。

導入・起動について

「Python was not found」と表示される

Python がこのパソコンに入っていません。 Python 公式サイト からインストールしてください。最初の画面で「Install Now」を押すだけです。

管理者権限は必要ありません。 既定では自分のユーザーフォルダ(%LOCALAPPDATA%\Programs\Python\)に入ります。

なお「Add python.exe to PATH」にチェックを入れ忘れた場合でも、 セットアップ側がよくあるインストール先を自動で探すようにしてあるため、 ほとんどの場合そのまま動きます。

セットアップが途中で止まる・失敗する

ほとんどが通信エラーです。もう一度 セットアップ.bat を実行してください。 ダウンロード済みの部分はキャッシュされているため、2 回目は速く終わります。

それでも失敗する場合、次の可能性があります。

  • 空き容量が足りない(GPU ありで約 6 GB 必要)
  • 展開先が書き込み不可の場所にある(Program Files の中など)
  • ウイルス対策ソフトが処理を止めている

フォルダをデスクトップに移動してから再実行すると解決することがあります。

フォルダごと圧縮して他の人に渡したが、相手の環境で動かない

セットアップ後のフォルダには .venv(約 4 GB)が作られますが、 これは他のパソコンでは動作しません。

.venv は Python の標準ライブラリを持っておらず、 セットアップを実行したパソコンの Python の場所を記録して、そこを参照しにいく仕組みだからです。 パスが存在しない環境では起動できません。

他の人に渡すときは、配布用の ZIP をそのまま渡し、 相手のパソコンで セットアップ.bat を実行してもらってください。

広告

処理・GPU について

NVIDIA の GPU があるのに CPU で処理されてしまう

画面のログに「CPU(CUDA 未検出)」と出ている場合、次を確認してください。

  • グラフィックドライバが古い → NVIDIA 公式サイトから最新版を入れる
  • セットアップ時に GPU が認識されていなかった → ドライバ更新後にもう一度 セットアップ.bat を実行

セットアップは nvidia-smi コマンドの有無で GPU 版と CPU 版を切り替えています。 ドライバが入っていないと CPU 版が導入されます。

処理が遅い。どれくらいかかるのが普通?

10 分の動画を medium モデルで処理した場合の目安です。

環境処理時間
NVIDIA RTX 3060 Ti(VRAM 8GB)約 1〜2 分
CPU のみ約 20〜40 分

CPU で使う場合は、モデルを small に下げると実用的な速度になります。 日本語の精度は medium より落ちますが、下書きとしては十分使えます。

「中止」を押してもすぐ止まらない

仕様です。AI は音声を 30 秒ごとの区切りで処理しており、 区切りの途中では止められません。 GPU なら 1〜2 秒、CPU では数十秒待つことがあります。

止まった時点で、書きかけの中途半端なファイルが残ることはありません。

GPU のメモリが足りないと言われる/large-v3 が動かない

VRAM が不足した場合は自動的に CPU に切り替えて処理を続けるため、 エラーで止まることはありません。ただし極端に遅くなります。

必要な VRAM の目安は、small が約 2 GB、medium が約 5 GB、large-v3 が約 10 GB です。 VRAM 8 GB の GPU では large-v3 は収まりません。

認識結果について

認識精度が悪い・誤字が多い

次の順で試してください。

  1. 言語を「日本語」に固定する — 自動検出の誤りがなくなります
  2. モデルを上げる — medium → large-v3 で精度が上がります(その分遅くなります)
  3. 音源を見直す — 音質が悪い、複数人が同時に話す、BGM が大きい場合は精度が大きく落ちます

専門用語や固有名詞は苦手です。 出力された SRT はテキストファイルなので、メモ帳などで直接修正できます。

同じ文章が何度も繰り返される

無音区間や BGM だけの区間で、AI が直前の文を繰り返してしまう既知の現象です。 本ツールでは前の文脈を引き継がない設定にして発生を抑えていますが、完全にはなくなりません。

該当箇所は出力された字幕ファイルから手で削除してください。

句読点が付かない

認識設定の「日本語の句読点を補う」にチェックが入っているか確認してください。 この機能は言語が日本語と判定されたときだけ働きます。

言語を「自動検出」にしていて英語などと誤判定された場合は働かないため、 「日本語」に固定してみてください。

字幕の 1 行が長すぎる/短く区切りたい

出力設定の「長い字幕を自動で折り返す」で、1 行の文字数と行数を変更できます。 初期値は 20 文字 × 2 行です。

小さい画面向けなら 15 文字前後、PC 視聴前提の解説動画なら 25 文字程度が目安です。 指定を超えた分は次の字幕に自動で分割され、表示時間も配分されます。

広告

その他

音声はインターネットに送信されますか?

送信されません。 文字起こしはすべてあなたのパソコンの中で処理されます。

インターネットに接続するのは、セットアップ時に必要な部品を取得するときと、 AI モデルを初回ダウンロードするときだけです。 それ以降はオフラインでも動作します。

モデルのダウンロードだけ失敗する(社内ネットワークなど)

セットアップは通るのにモデルの取得だけ止まる場合、 モデル配信元への接続が制限されている可能性があります。

この場合、モデルファイル(medium.pt)を別途入手し、 ツールのフォルダの中に models というフォルダを作って入れてください。 ダウンロードなしでそこから読み込みます。

Whisper字幕作成ツール\models\medium.pt
ウイルス対策ソフトに止められる

.bat ファイルは、インターネットからダウンロードした ZIP を展開すると 警告の対象になることがあります。

ZIP を右クリック →「プロパティ」→「セキュリティ:許可する」にチェックを入れてから 展開すると、警告が出にくくなります。

商用利用・業務利用はできますか?

できます。本ツールおよび内部で使用している OpenAI Whisper は MIT License、 PyTorch は BSD-3-Clause で提供されています。

ただし音声認識の結果は完全ではありません。 納品物や公開用の字幕として使う場合は、必ず内容を確認・修正してください。 本ツールの利用によって生じた損害について、作者は責任を負いません。

Mac や Linux で使えますか?

現在は Windows 用としてのみ配布しています。 本体は Python で書かれているため他の OS でも動く可能性はありますが、 動作確認は行っていません。


解決しない場合は運営者情報のページからご連絡ください。 その際、環境チェック.bat の実行結果を添えていただけると原因を特定しやすくなります。