文字起こし 音声・動画
精度・対応形式・YouTubeについて
既存のWhisperモデルを使用します。雑音や固有名詞で誤認識することがあるため、結果を確認してください。話者の識別には対応していません。標準で不足する場合は高精度モデル、端末で動作が重い場合は軽量モデルか短いファイルをお試しください。
高精度モデルは初回に数百MB、large-v3-turboは約1.6GBの通信が発生し、多くのメモリと処理時間を使います。large-v3-turboはWebGPU対応PC専用です。端末内で動くため、サイト運営者のサーバーへ音声・動画は送信されません。
同じ語句が異常に反復した場合は、その時刻の音声だけを条件を変えて再解析します。会話として自然な数回の繰り返しは、そのまま残します。
MP3・WAV・M4A・MP4・MOV・WebMなどに対応しますが、コーデックによって読み込めない場合があります。
YouTubeのURL直接入力には対応していません。権利・利用条件を確認し、手元にある音声・動画ファイルを選んでください。