動画・音声を99言語でテキストに
Whisper large-v3 が言語を自動判別し、単語ごとにタイムスタンプを付けます。段落テキスト、きれいに分割されたSRT/VTT字幕、希望すれば英語訳も。最大3時間・1 GB。
99言語・自動判別TXT・SRT・VTT・JSON最大3時間・1 GB
無料で試す ↓
ベータ期間中は無料

使い方
使い方
01
動画または音声をアップロード
MP4・MOV・WebM・MKV・MP3・WAV・M4Aなど、最大1 GB。言語を選ぶか自動のままに。
02
Whisperがタイムスタンプ付きで文字起こし
large-v3モデルと音声検出で、無音や音楽を飛ばし、各単語に時刻を付けます。
03
テキストと字幕をダウンロード
段落テキストのTXT、YouTubeや編集ソフトにそのまま使えるSRT/VTT、単語付きJSON。1時間後に削除。
FAQ
よくある質問
対応言語は?
Whisperの99言語:日本語、英語、スペイン語、フランス語、ドイツ語、中国語、韓国語、アラビア語など。自動判別され、複数言語が混ざる音声では固定もできます。
精度は?
参考となる有料ツールと同じ大型モデル(large-v3)を使い、無音区間で文章を作り出さないよう音声フィルターを併用。クリアな音声なら人の文字起こしに迫ります。
字幕の形式は?
業界の作法どおり:最大2行×42文字、1枚あたり最長7秒、間や句読点で区切ります。YouTube、Premiere、DaVinciにそのまま読み込めます。
翻訳できますか?
はい。「英語訳も追加」にチェックすると、英語のTXT・SRT・VTTも受け取れます(Whisper自身の翻訳)。
どのくらい時間がかかりますか?
ウォーム状態で音声20〜30分あたり約1分、コールドスタート時はさらに1〜2分。バーに目安が表示されます。
動画は保存されますか?
いいえ。処理後に削除されます。ダウンロードの1時間後、最長でも24時間です。コピーは残しません。



















