极客前沿

Ollama 调优:第一次跑通本地 AI 模型

2026-07-21 01:31
DEV Ollama
查看原文

零基础学会安装 Ollama、运行模型,并调整 num_batch 参数提升速度,轻松上手本地 AI。

准备环境:你需要什么?

要运行本地 AI 模型,你需要一台带 GPU(显卡) 的电脑。GPU 是专门处理图形和计算的芯片,能加速 AI 运行。推荐 NVIDIA 显卡(如 RTX 系列),并安装最新驱动。

  • Ollama:一个免费工具,帮你轻松下载和运行 AI 模型。访问 ollama.com,点击“Download”按钮,选择你的系统(Windows/Mac/Linux)下载安装包。
  • 模型:Ollama 自带模型库,你不需要自己找文件。本文以 gemma4:26b 为例,它是一个 260 亿参数的中文友好模型。

安装步骤:一步步来

  1. 安装 Ollama:运行下载的安装程序,一路默认即可。完成后打开终端(Windows 用命令提示符或 PowerShell,Mac 用终端)。
  2. 下载模型:在终端输入 ollama pull gemma4:26b,回车。等待下载完成(可能需要几分钟到半小时,视网络而定)。
  3. 测试运行:输入 ollama run gemma4:26b,然后随便问个问题,比如“你好”。如果模型回复了,说明安装成功!

调优参数:让模型跑得更快

默认设置下,模型可能不是最快的。Ollama 允许你调整 num_batch 参数,它控制一次处理多少数据。数值越大,理论上越快,但会消耗更多电量和显存。最佳值因显卡而异。

Tutorial Image

下面是一个简单测试方法:

  • 先运行模型,记下默认速度(每秒生成多少字)。
  • 修改参数:运行 ollama run gemma4:26b --num-batch 256,再测一次。
  • 对比速度。如果提升明显且显卡不热,就保留这个值。如果继续增大(如 512)速度没变多少,但显卡更热,就选 256。

注意:不同模型和任务的最佳值不同,建议从 128 开始试,每次翻倍,找到平衡点。

Tutorial Image

下一步可以做什么

现在你已经能运行本地 AI 了!可以试试:

  • 用不同模型:ollama pull llama3 等。
  • 调整其他参数:比如 num_ctx(上下文长度),控制模型能记住多少对话历史。
  • 写个简单脚本:用 Python 或 Node.js 调用 Ollama 的 API,实现自动问答。

记住:调优时一次只改一个参数,记录速度和结果,这样才能找到最适合你的设置。

内容来源

DEV Ollama

发布时间

2026-07-21 01:31

返回 AI技术