极客前沿

AI 入门:在集成显卡上跑大模型,一步步搞定

2026-06-22 01:31
DEV Ollama
查看原文

学会用 Ollama 或 LM Studio 在集成显卡上运行大语言模型,避开常见坑,第一次跑通。

准备环境

首先,你需要一台带集成显卡(iGPU)的电脑,比如 Intel Arc 或 AMD Radeon 780M。集成显卡没有自己的显存,会借用系统内存,所以最好有 16GB 以上内存。

Tutorial Image
  • 下载并安装 Ollama(从 ollama.com 下载)或 LM Studio(从 lmstudio.ai 下载)。
  • 确保显卡驱动是最新的,避免兼容问题。

安装步骤

  1. 打开 Ollama 或 LM Studio,首次启动会自动检测硬件。
  2. 选择一个量化(quantization)模型,比如 Llama 3.2 1B Q4_K_M。量化就是压缩模型,让它能在有限内存里跑。
  3. 在 LM Studio 中,进入“GPU Offload”设置,限制推送到 GPU 的层数(比如 10 层),防止内存爆满。

验证是否成功

在 Ollama 终端输入 ollama run llama3.2:1b,如果出现对话提示,说明运行成功。在 LM Studio 中点击“Start Server”,然后打开聊天窗口测试。

下一步可以做什么

  • 尝试更大的模型(如 7B),但注意调低量化级别,比如 Q4。
  • ollama list 查看已下载的模型,用 ollama pull 模型名 下载新模型。
  • 在 LM Studio 中调整 GPU 层数,找到性能与内存的平衡点。

内容来源

DEV Ollama

发布时间

2026-06-22 01:31

返回 AI技术