极客前沿

AI 入门:5 步把音频转成博客稿,新手也能跑通

2026-07-15 01:46
DEV Tutorial
查看原文

从零安装 Whisper 和 FFmpeg,学会音频转文字、整理草稿,30 分钟跑通第一个 AI 流程。

准备环境

你需要一台电脑(Windows / Mac / Linux 都行),能联网,装好两个工具:FFmpeg(处理音频的万能工具)和 Whisper(OpenAI 的免费语音转文字模型)。

  • FFmpeg 下载:去 ffmpeg.org 点 Download,选你的系统版本,解压后把 bin 文件夹加入系统 PATH。
  • Whisper 安装:打开终端,输入 pip install openai-whisper。如果没装 Python,先去 python.org 下载 3.8 以上版本。

常见坑:Windows 用户装 Whisper 前要先装 PyTorch(一个 AI 计算库),去 pytorch.org 选你的系统,复制命令运行。

处理音频文件

Whisper 喜欢干净的音频。用 FFmpeg 把录音转成标准格式:

  1. 打开终端,进入音频所在文件夹。
  2. 运行命令:ffmpeg -i 你的文件.wav -ar 16000 -ac 1 -af silenceremove=1:0:-50dB 输出.wav。这会把音频变成 16kHz 单声道,并删除静音段。
  3. 如果原文件是视频,先提取音频:ffmpeg -i 视频.mp4 -vn 音频.wav

常见坑:立体声或低采样率会让 Whisper 乱猜词,务必转成 16kHz 单声道。

运行 Whisper 转文字

在终端输入:whisper 输出.wav --model tiny --output_format json。等几分钟,你会得到一个 JSON 文件。

Tutorial Image
  • 模型 tiny:最小最快,没显卡也能用,准确度对对话足够。
  • JSON 格式:包含每句话的开始时间、结束时间和文字,方便后续校对。

常见坑:第一次运行会下载模型,大约 100MB,请保持网络畅通。

整理草稿

JSON 文件直接看很乱。写一个简单脚本(或手动复制)提取文字和时间戳:

  1. 用记事本打开 JSON,找到 segments 数组,里面每个对象有 startendtext
  2. 把 text 按时间顺序拼成段落,每行前面加上 [00:01:23] 这类时间戳。
  3. 删掉“嗯”“啊”等口头禅,保留关键信息。

常见坑:不要直接复制纯文字输出,没有时间戳后面校对会崩溃。

下一步可以做什么

你已经有了一篇带时间戳的草稿。接下来可以:

  • 把草稿贴到博客编辑器里,加标题和分段。
  • Dev.to 等平台发布,注意标题用 H1,正文从 H2 开始。
  • 尝试更大的模型(如 base、small)提高准确率,但需要 GPU。

记住:AI 只是帮你省打字时间,最终的文章质量靠你删改和重组。跑通一次后,你就能批量处理录音了。

内容来源

DEV Tutorial

发布时间

2026-07-15 01:46

返回 AI技术