AI 入门:5 步把音频转成博客稿,新手也能跑通
从零安装 Whisper 和 FFmpeg,学会音频转文字、整理草稿,30 分钟跑通第一个 AI 流程。
准备环境
你需要一台电脑(Windows / Mac / Linux 都行),能联网,装好两个工具:FFmpeg(处理音频的万能工具)和 Whisper(OpenAI 的免费语音转文字模型)。
- FFmpeg 下载:去 ffmpeg.org 点 Download,选你的系统版本,解压后把 bin 文件夹加入系统 PATH。
- Whisper 安装:打开终端,输入
pip install openai-whisper。如果没装 Python,先去 python.org 下载 3.8 以上版本。
常见坑:Windows 用户装 Whisper 前要先装 PyTorch(一个 AI 计算库),去 pytorch.org 选你的系统,复制命令运行。
处理音频文件
Whisper 喜欢干净的音频。用 FFmpeg 把录音转成标准格式:
- 打开终端,进入音频所在文件夹。
- 运行命令:
ffmpeg -i 你的文件.wav -ar 16000 -ac 1 -af silenceremove=1:0:-50dB 输出.wav。这会把音频变成 16kHz 单声道,并删除静音段。 - 如果原文件是视频,先提取音频:
ffmpeg -i 视频.mp4 -vn 音频.wav。
常见坑:立体声或低采样率会让 Whisper 乱猜词,务必转成 16kHz 单声道。
运行 Whisper 转文字
在终端输入:whisper 输出.wav --model tiny --output_format json。等几分钟,你会得到一个 JSON 文件。
- 模型 tiny:最小最快,没显卡也能用,准确度对对话足够。
- JSON 格式:包含每句话的开始时间、结束时间和文字,方便后续校对。
常见坑:第一次运行会下载模型,大约 100MB,请保持网络畅通。
整理草稿
JSON 文件直接看很乱。写一个简单脚本(或手动复制)提取文字和时间戳:
- 用记事本打开 JSON,找到
segments数组,里面每个对象有start、end、text。 - 把 text 按时间顺序拼成段落,每行前面加上
[00:01:23]这类时间戳。 - 删掉“嗯”“啊”等口头禅,保留关键信息。
常见坑:不要直接复制纯文字输出,没有时间戳后面校对会崩溃。
下一步可以做什么
你已经有了一篇带时间戳的草稿。接下来可以:
- 把草稿贴到博客编辑器里,加标题和分段。
- 用 Dev.to 等平台发布,注意标题用 H1,正文从 H2 开始。
- 尝试更大的模型(如 base、small)提高准确率,但需要 GPU。
记住:AI 只是帮你省打字时间,最终的文章质量靠你删改和重组。跑通一次后,你就能批量处理录音了。
内容来源
DEV Tutorial
发布时间
2026-07-15 01:46