极客前沿

本地AI模型入门:装Ollama、跑通第一个推理模型

2026-07-01 01:32
DEV Ollama
查看原文

零基础学会安装Ollama,运行gemma4:12b推理模型,并理解思考模式开关的实用技巧。

准备环境:什么是Ollama?

Ollama是一个让你在本地电脑上运行AI模型的免费工具,不需要联网,也不用懂复杂编程。它就像一个AI的“播放器”,你下载模型文件就能直接使用。支持Windows、macOS和Linux。

Tutorial Image

安装步骤

  1. 打开浏览器,访问Ollama官网(ollama.com),根据你的系统下载安装包。
  2. 双击安装,一路默认选项即可。安装后,终端(命令提示符或终端应用)输入 ollama --version,看到版本号就成功了。
  3. 在终端输入 ollama pull gemma4:12b,下载这个模型。文件约8GB,耐心等待。
  4. 下载完成后,输入 ollama run gemma4:12b,你就进入聊天界面了!试试问:“一件衬衫打八折后40美元,原价多少?”

验证是否成功:第一次跑通

如果模型回答正确(原价50美元),恭喜你跑通了!但你可能遇到“空回复”——这是新手常见坑:num_predict(最大生成令牌数)设得太小,导致模型只生成了思考过程,没来得及输出答案。修复方法:在请求中设置 num_predict: 256(或更大),确保有足够空间。

Tutorial Image

更高级一点,你可以尝试打开思考模式(reasoning)。在API调用中,添加 "think": true 参数,模型会输出内部思考过程,但速度慢很多。测试一下:对比思考开/关的结果,你会发现复杂问题(如排序)思考模式更准,但简单算术题没必要开。

下一步可以做什么

  • 试试其他模型:ollama pull llama3.2qwen2.5,体验不同风格。
  • 用Python调用API:写几行代码,让模型帮你写邮件、总结文章。
  • 调整参数:temperature(温度,控制创意程度,0最严谨,1最随机)和seed(随机种子,固定值可复现结果)——在API请求的 options 里设置。

内容来源

DEV Ollama

发布时间

2026-07-01 01:32

返回 AI技术