极客前沿

AI 入门:用 Ollama 在笔记本上跑大模型,一步步带你装好

2026-07-11 01:32
DEV Ollama
查看原文

零基础学会在笔记本上安装 Ollama,下载模型并运行,了解 iGPU 的 VRAM 限制,避免常见坑。

准备环境:先了解你的笔记本

在开始之前,你需要知道:大模型(LLM)运行需要大量显存(VRAM)。如果你的笔记本没有独立显卡(独显),用的是集成显卡(iGPU)——就是和 CPU 做在一起的显卡,它会从系统内存(RAM)里划出一部分当显存用。通常 Windows 和 Linux 只允许最多用 50% 的 RAM 当显存,比如 16GB 内存的笔记本最多只能用 8GB 显存。所以,别想跑 70B 的大模型啦,我们从小模型开始。

安装 Ollama:两步搞定

Ollama 是目前最简单的本地大模型运行工具,免费开源。跟着做:

  1. 下载安装包:打开 ollama.com,点击 Download,选择你的操作系统(Windows、macOS 或 Linux)。Windows 用户下载 .exe 文件,双击安装,一路默认即可。
  2. 验证安装:安装完成后,打开命令行(Windows 按 Win+R 输入 cmd 回车),输入 ollama --version,如果显示版本号(比如 0.1.29),就说明成功了。

下载并运行第一个模型

我们选一个轻量级模型:Llama 3.2 1B(1B 表示 10 亿参数,参数越少越省显存,适合新手)。在命令行输入:

  • ollama run llama3.2:1b

Ollama 会自动下载模型(大约 1GB 左右),然后进入对话界面。你可以直接打字提问,比如“你好!介绍一下你自己。”按回车,它就会回答。想退出对话?输入 /bye 回车。

Tutorial Image

常见坑和优化技巧

坑一:模型太大跑不动。如果你的笔记本只有 8GB 内存,别选超过 3B 参数的模型(比如 llama3.2:3b 可能勉强,但 7B 以上基本会卡死)。如果运行后打字没反应或特别慢,按 Ctrl+C 终止,换更小的模型。

坑二:显存不够怎么办。在 Ollama 里,可以通过设置 量化(Quantization) 来减小模型体积。比如运行 ollama run llama3.2:1b --quantize q4_0 使用 4-bit 量化,显存占用更低。但新手可以先不管,默认就好。

坑三:想用显卡加速? 如果你有独显,Ollama 会自动用上。如果是 iGPU,默认也能用,但性能有限。在 LM Studio(另一个工具)里可以手动调整 GPU 层数,但 Ollama 更傻瓜化,推荐新手先用它。

下一步可以做什么

  • 换模型玩:在 Ollama 模型库 浏览更多模型,比如 qwen2.5:1.5b(中文好)或 mistral:7b(需要至少 8GB 显存)。
  • 用 API 调用:Ollama 默认开启本地 API(地址 http://localhost:11434),你可以用 Python 写代码调用它,实现自己的 AI 应用。
  • 监控资源:在任务管理器(Windows)或活动监视器(Mac)里看内存和 GPU 占用,确保不爆显存。

内容来源

DEV Ollama

发布时间

2026-07-11 01:32

返回 AI技术