🎬 FFmpeg個人リファレンス

Whisper用音声を作る

音声認識(OpenAI Whisperなど)に渡す音声は、16kHz・モノラル・WAV(PCM 16bit) に揃えるのが定番です。 ファイルが軽くなり、認識も安定します。

基本:16kHz / モノラル / WAVへ変換

ffmpeg -i input.mp3 -ar 16000 -ac 1 -c:a pcm_s16le output.wav
  • -ar 16000 … サンプルレート16kHz
  • -ac 1 … モノラル
  • -c:a pcm_s16le … 非圧縮PCM 16bit(Whisperが扱いやすい)

動画から直接Whisper用WAVを作る

ffmpeg -i input.mp4 -vn -ar 16000 -ac 1 -c:a pcm_s16le output.wav

-vn は映像を捨てるオプションです。

長い音声を分割する(任意)

長尺は一定時間で分割すると扱いやすくなります。下は600秒(10分)ごとに分割する例です。

ffmpeg -i input.wav -f segment -segment_time 600 -ar 16000 -ac 1 -c:a pcm_s16le chunk_%03d.wav

無音をならして認識を安定させる(任意)

ffmpeg -i input.wav -af "highpass=f=80, loudnorm=I=-16:TP=-1.5:LRA=11" -ar 16000 -ac 1 -c:a pcm_s16le output.wav
メモ
ファイル形式の違いはMP3 / WAV / M4A の違い、整音はPodcast音声を整えるも参考になります。