极客前沿

本地跑AI模型:从零开始的Ollama安装与入门教程

2026-06-21 01:32
DEV Ollama
查看原文

教你安装Ollama,下载量化模型,用本地GPU跑AI,零成本替代API调用。

准备环境:你需要什么

要本地运行AI模型,你需要一台带NVIDIA显卡(比如RTX 3060,至少4GB显存)的电脑,或者一台Mac(Apple Silicon)。本文以Windows/Linux为例。Ollama是一个免费工具,帮你下载和运行AI模型,就像手机上的应用商店一样简单。你还需要安装Docker(一个容器工具,让程序在隔离环境中运行)。

Tutorial Image

安装步骤:一步步来

  1. 下载Ollama:访问ollama.com,点击“Download”,选择你的操作系统(Windows、macOS或Linux),安装后打开终端(命令提示符)。
  2. 验证安装:在终端输入 ollama --version,如果显示版本号,说明安装成功。
  3. 下载模型:输入 ollama pull llama3.2:1b,这是最小版本的Llama模型,只有1B参数,适合入门。Ollama会自动下载到本地。
  4. 运行模型:输入 ollama run llama3.2:1b,稍等几秒,你就可以在终端里和AI聊天了!输入“Hello”试试。

验证是否成功:跑通第一个对话

如果看到模型开始回复,恭喜你,本地AI已经跑通!你可以在终端中继续提问。如果想用图形界面,可以安装Open WebUI(一个网页聊天界面):docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:main。然后打开浏览器访问 http://localhost:3000,注册账号后就能在网页上聊天了。

下一步可以做什么

  • 尝试更大模型:如果显存足够(比如8GB),可以下载 llama3.2:3bllama3:8b(注意:8B模型需要约4GB显存)。
  • 量化模型:使用 q4_0 等量化版本,能大幅减少显存占用,性能下降很小。例如 ollama pull llama3:8b-q4_0
  • 多实例共享GPU:通过Docker的GPU时间切片,多个AI应用可共享一张显卡,互不干扰。

常见坑:如果模型运行很慢,检查显卡驱动是否最新;如果显存不足,尝试更小的模型或量化版本。现在,你已经迈出了本地AI的第一步,尽情探索吧!

内容来源

DEV Ollama

发布时间

2026-06-21 01:32

返回 AI技术