Whisper用音声を作る
音声認識(OpenAI Whisperなど)に渡す音声は、16kHz・モノラル・WAV(PCM 16bit) に揃えるのが定番です。 ファイルが軽くなり、認識も安定します。
基本:16kHz / モノラル / WAVへ変換
ffmpeg -i input.mp3 -ar 16000 -ac 1 -c:a pcm_s16le output.wav
-ar 16000… サンプルレート16kHz-ac 1… モノラル-c:a pcm_s16le… 非圧縮PCM 16bit(Whisperが扱いやすい)
動画から直接Whisper用WAVを作る
ffmpeg -i input.mp4 -vn -ar 16000 -ac 1 -c:a pcm_s16le output.wav
-vn は映像を捨てるオプションです。
長い音声を分割する(任意)
長尺は一定時間で分割すると扱いやすくなります。下は600秒(10分)ごとに分割する例です。
ffmpeg -i input.wav -f segment -segment_time 600 -ar 16000 -ac 1 -c:a pcm_s16le chunk_%03d.wav
無音をならして認識を安定させる(任意)
ffmpeg -i input.wav -af "highpass=f=80, loudnorm=I=-16:TP=-1.5:LRA=11" -ar 16000 -ac 1 -c:a pcm_s16le output.wavメモ
ファイル形式の違いはMP3 / WAV / M4A の違い、整音はPodcast音声を整えるも参考になります。