本地AI模型入门:装Ollama、跑通第一个推理模型
零基础学会安装Ollama,运行gemma4:12b推理模型,并理解思考模式开关的实用技巧。
准备环境:什么是Ollama?
Ollama是一个让你在本地电脑上运行AI模型的免费工具,不需要联网,也不用懂复杂编程。它就像一个AI的“播放器”,你下载模型文件就能直接使用。支持Windows、macOS和Linux。
安装步骤
- 打开浏览器,访问Ollama官网(ollama.com),根据你的系统下载安装包。
- 双击安装,一路默认选项即可。安装后,终端(命令提示符或终端应用)输入
ollama --version,看到版本号就成功了。 - 在终端输入
ollama pull gemma4:12b,下载这个模型。文件约8GB,耐心等待。 - 下载完成后,输入
ollama run gemma4:12b,你就进入聊天界面了!试试问:“一件衬衫打八折后40美元,原价多少?”
验证是否成功:第一次跑通
如果模型回答正确(原价50美元),恭喜你跑通了!但你可能遇到“空回复”——这是新手常见坑:num_predict(最大生成令牌数)设得太小,导致模型只生成了思考过程,没来得及输出答案。修复方法:在请求中设置 num_predict: 256(或更大),确保有足够空间。
更高级一点,你可以尝试打开思考模式(reasoning)。在API调用中,添加 "think": true 参数,模型会输出内部思考过程,但速度慢很多。测试一下:对比思考开/关的结果,你会发现复杂问题(如排序)思考模式更准,但简单算术题没必要开。
下一步可以做什么
- 试试其他模型:
ollama pull llama3.2或qwen2.5,体验不同风格。 - 用Python调用API:写几行代码,让模型帮你写邮件、总结文章。
- 调整参数:temperature(温度,控制创意程度,0最严谨,1最随机)和seed(随机种子,固定值可复现结果)——在API请求的
options里设置。
内容来源
DEV Ollama
发布时间
2026-07-01 01:32