极客前沿

第一次跑通语音转文字:新手入门安装与使用指南

2026-07-15 01:48
DEV Machine Learning
查看原文

本文教你从零安装 OpenAI Whisper,用一行命令把录音转成文字,并给出常见坑的避坑提醒。

准备工作:你需要什么?

要跑通语音转文字,你需要一台电脑(Windows / macOS / Linux 都可以),以及一点耐心。核心工具是 OpenAI Whisper,一个免费的开源模型,能把音频文件直接变成文字。它支持中文、英文等多种语言,而且你不需要联网也能用。

安装步骤

下面三步就能装好:

Tutorial Image
  1. 安装 Python:Whisper 需要 Python 3.8 以上版本。去 python.org 下载安装包,安装时记得勾选“Add Python to PATH”。
  2. 安装 FFmpeg:Whisper 用它处理音频。Windows 用户可以从 ffmpeg.org 下载,解压后把 bin 文件夹路径加到系统环境变量 Path 里。macOS 用户用 Homebrew 安装:brew install ffmpeg
  3. 安装 Whisper:打开终端(Windows 用命令提示符或 PowerShell),输入:pip install openai-whisper。等待下载完成即可。

验证是否成功

找一段短的录音(比如 30 秒的 MP3 文件),在终端里输入:whisper 你的音频文件.mp3 --model tiny --language zh。第一次运行会下载模型(几百 MB),之后就能看到文字逐句输出。如果看到中文文字,恭喜你成功了!

常见坑与下一步

  • 坑 1:安装 FFmpeg 后终端报错“ffmpeg 不是内部命令”。检查环境变量有没有加对,重启终端再试。
  • 坑 2:音频太长或噪音大,结果不准确。先用 Audacity 等工具把音频裁剪、降噪,再喂给 Whisper。
  • 下一步:你可以把输出保存成 txt 文件:whisper 音频文件.mp3 --output_format txt。然后就能复制到文档里用了。

现在你已经能跑通语音转文字了。试试把你的会议录音、播客片段转成文字,你会发现效率提升一大截。

内容来源

DEV Machine Learning

发布时间

2026-07-15 01:48

返回 AI技术