极客前沿

AI 入门:本地语音助手安装与运行指南

2026-06-28 01:32
DEV Ollama
查看原文

零基础学会安装 Ollama 和 HoldSpeak,搭建本地语音助手,实现语音转命令。

准备环境:你需要什么

在开始之前,请确保你的电脑是 macOS 系统(苹果电脑),并安装了 Homebrew(一个帮你安装软件的工具,类似手机上的应用商店)。如果还没有 Homebrew,在终端(Terminal)里输入以下命令安装:

Tutorial Image
  • /bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)"

安装步骤

  1. 安装 Ollama:Ollama 是一个让你在本地运行 AI 模型的工具,不需要联网。在终端输入 brew install ollama,等待安装完成。
  2. 启动 Ollama 服务:在终端输入 ollama serve,然后保持这个终端窗口打开。
  3. 下载 AI 模型:打开一个新的终端窗口,输入 ollama pull llama3.2,下载一个轻量级的 AI 模型(约 2GB)。这是你的“大脑”,负责把语音转成命令。
  4. 安装 HoldSpeak:HoldSpeak 是一个语音识别工具,能把你说的话转成文字。在终端依次输入:
    git clone https://github.com/karolswdev/HoldSpeak.git
    cd HoldSpeak
    pip3 install -e .
  5. 授权麦克风和辅助功能:打开“系统设置” > “隐私与安全性” > “麦克风”,允许终端访问麦克风。然后进入“辅助功能”,同样允许终端控制电脑(否则按键监听会失效)。
  6. 运行测试脚本:创建一个 Python 文件(例如 demo.py),写入以下代码:
    from holdspeak.hotkey import HotkeyListener
    from holdspeak.audio import AudioRecorder
    from holdspeak.transcribe import Transcriber
    import subprocess

    def on_activate():
    recorder = AudioRecorder()
    audio = recorder.record()
    text = Transcriber().transcribe(audio)
    print(f"你说了:{text}")
    # 这里可以调用 Ollama 生成命令,简单起见先打印

    listener = HotkeyListener(on_activate)
    listener.start()

    然后在终端运行 python3 demo.py,按住键盘上的 Right Option 键(右 Alt 键),对着麦克风说话,松开后就能看到识别的文字。

验证是否成功

如果一切顺利,当你按住 Right Option 键说话并松开后,终端会打印出你所说的文字。例如,你说“列出文件”,它会显示“你说了:列出文件”。这说明语音识别正常工作。接下来你可以继续学习如何让 Ollama 把文字转成真正的命令。

下一步可以做什么

  • 尝试用 Ollama 生成命令:在 on_activate 函数中,把识别到的文字发给 Ollama,让它返回一个 shell 命令。
  • 学习 Python 基础:如果看不懂代码,建议先学一点 Python 语法。
  • 探索其他模型:Ollama 支持很多模型,可以试试 ollama pull llama3.1 等。

内容来源

DEV Ollama

发布时间

2026-06-28 01:32

返回 AI技术