手把手:在 CPU 笔记本上跑通本地语音 AI
学会在无 GPU 的笔记本上安装 Ollama,并用 Whisper 和 Qwen2.5 实现 300ms 内的语音识别与回复。
本教程带你从零开始,在自己的 CPU 笔记本上跑通一个本地语音 AI 应用。你不需要显卡,不需要云服务,只需要一台普通电脑。读完你就能让电脑听懂你说的话,并给出语音回复。
准备环境
你需要安装两个核心工具:Ollama 和 Whisper。Ollama 是一个让你在本地运行大语言模型的工具(大语言模型就是能理解文字并回答问题的 AI)。Whisper 是 OpenAI 开源的语音识别模型,能把你说的话转成文字。
- 下载 Ollama:访问 ollama.com,选择你的操作系统(Windows/macOS/Linux),下载并安装。
- 下载 Whisper:我们使用 Whisper v3 Turbo(一个更快的语音识别版本)。在终端或命令行里输入:
pip install openai-whisper。 - 确保你的 Python 版本是 3.8 以上。如果不会安装 Python,可以先搜索“Python 安装教程”。
安装步骤
- 启动 Ollama:打开终端,输入
ollama serve,保持这个窗口开着。 - 下载模型:我们选用 Qwen2.5 1.5B(一个轻量级的大语言模型,适合 CPU 运行)。在另一个终端输入:
ollama pull qwen2.5:1.5b。等待下载完成(大约 1-2GB)。 - 测试语音识别:在终端输入 Python,然后运行以下代码(或者保存为 .py 文件执行):
import whisper
model = whisper.load_model('turbo')
result = model.transcribe('你的音频文件.wav')
print(result['text'])
如果打印出文字,说明 Whisper 工作正常。 - 组合运行:写一个简单的 Python 脚本,先录音,再用 Whisper 转文字,然后发给 Ollama 的 Qwen2.5 模型得到回复,最后用 本地 TTS(文字转语音,比如 pyttsx3)播放。一个简单的例子:
import whisper, ollama, pyttsx3
whisper_model = whisper.load_model('turbo')
text = whisper_model.transcribe('input.wav')['text']
response = ollama.chat(model='qwen2.5:1.5b', messages=[{'role':'user','content':text}])
engine = pyttsx3.init()
engine.say(response['message']['content'])
engine.runAndWait()
验证是否成功
运行上面的脚本,对着麦克风说一句话(比如“今天天气怎么样”),如果电脑在 1-2 秒内用语音回答了你,就成功了!注意:第一次运行 Whisper 会慢一些,后续会快起来。如果回答很慢(超过 3 秒),可以试试更小的模型,比如 ollama pull qwen2.5:0.5b。
下一步可以做什么
- 换成其他 Ollama 模型:比如
gemma3:2b(英文更好)或deepseek-r1:1.5b(但注意它可能会混入中文思考过程,需要加正则过滤)。 - 优化速度:如果觉得慢,可以尝试用 streaming(流式输出),让 TTS 边生成边播放,不用等完整回复。
- 做成对话循环:让程序持续监听麦克风,实现连续对话。
现在你已经迈出了本地语音 AI 的第一步,尽情探索吧!
内容来源
DEV Ollama
发布时间
2026-07-16 01:32