Ollama 调优:第一次跑通本地 AI 模型
零基础学会安装 Ollama、运行模型,并调整 num_batch 参数提升速度,轻松上手本地 AI。
准备环境:你需要什么?
要运行本地 AI 模型,你需要一台带 GPU(显卡) 的电脑。GPU 是专门处理图形和计算的芯片,能加速 AI 运行。推荐 NVIDIA 显卡(如 RTX 系列),并安装最新驱动。
- Ollama:一个免费工具,帮你轻松下载和运行 AI 模型。访问 ollama.com,点击“Download”按钮,选择你的系统(Windows/Mac/Linux)下载安装包。
- 模型:Ollama 自带模型库,你不需要自己找文件。本文以 gemma4:26b 为例,它是一个 260 亿参数的中文友好模型。
安装步骤:一步步来
- 安装 Ollama:运行下载的安装程序,一路默认即可。完成后打开终端(Windows 用命令提示符或 PowerShell,Mac 用终端)。
- 下载模型:在终端输入
ollama pull gemma4:26b,回车。等待下载完成(可能需要几分钟到半小时,视网络而定)。 - 测试运行:输入
ollama run gemma4:26b,然后随便问个问题,比如“你好”。如果模型回复了,说明安装成功!
调优参数:让模型跑得更快
默认设置下,模型可能不是最快的。Ollama 允许你调整 num_batch 参数,它控制一次处理多少数据。数值越大,理论上越快,但会消耗更多电量和显存。最佳值因显卡而异。
下面是一个简单测试方法:
- 先运行模型,记下默认速度(每秒生成多少字)。
- 修改参数:运行
ollama run gemma4:26b --num-batch 256,再测一次。 - 对比速度。如果提升明显且显卡不热,就保留这个值。如果继续增大(如 512)速度没变多少,但显卡更热,就选 256。
注意:不同模型和任务的最佳值不同,建议从 128 开始试,每次翻倍,找到平衡点。
下一步可以做什么
现在你已经能运行本地 AI 了!可以试试:
- 用不同模型:
ollama pull llama3等。 - 调整其他参数:比如 num_ctx(上下文长度),控制模型能记住多少对话历史。
- 写个简单脚本:用 Python 或 Node.js 调用 Ollama 的 API,实现自动问答。
记住:调优时一次只改一个参数,记录速度和结果,这样才能找到最适合你的设置。
内容来源
DEV Ollama
发布时间
2026-07-21 01:31