本地跑AI模型:从零开始的Ollama安装与入门教程
教你安装Ollama,下载量化模型,用本地GPU跑AI,零成本替代API调用。
准备环境:你需要什么
要本地运行AI模型,你需要一台带NVIDIA显卡(比如RTX 3060,至少4GB显存)的电脑,或者一台Mac(Apple Silicon)。本文以Windows/Linux为例。Ollama是一个免费工具,帮你下载和运行AI模型,就像手机上的应用商店一样简单。你还需要安装Docker(一个容器工具,让程序在隔离环境中运行)。
安装步骤:一步步来
- 下载Ollama:访问ollama.com,点击“Download”,选择你的操作系统(Windows、macOS或Linux),安装后打开终端(命令提示符)。
- 验证安装:在终端输入
ollama --version,如果显示版本号,说明安装成功。 - 下载模型:输入
ollama pull llama3.2:1b,这是最小版本的Llama模型,只有1B参数,适合入门。Ollama会自动下载到本地。 - 运行模型:输入
ollama run llama3.2:1b,稍等几秒,你就可以在终端里和AI聊天了!输入“Hello”试试。
验证是否成功:跑通第一个对话
如果看到模型开始回复,恭喜你,本地AI已经跑通!你可以在终端中继续提问。如果想用图形界面,可以安装Open WebUI(一个网页聊天界面):docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:main。然后打开浏览器访问 http://localhost:3000,注册账号后就能在网页上聊天了。
下一步可以做什么
- 尝试更大模型:如果显存足够(比如8GB),可以下载
llama3.2:3b或llama3:8b(注意:8B模型需要约4GB显存)。 - 量化模型:使用
q4_0等量化版本,能大幅减少显存占用,性能下降很小。例如ollama pull llama3:8b-q4_0。 - 多实例共享GPU:通过Docker的GPU时间切片,多个AI应用可共享一张显卡,互不干扰。
常见坑:如果模型运行很慢,检查显卡驱动是否最新;如果显存不足,尝试更小的模型或量化版本。现在,你已经迈出了本地AI的第一步,尽情探索吧!
内容来源
DEV Ollama
发布时间
2026-06-21 01:32