AI 入门:在集成显卡上跑大模型,一步步搞定
学会用 Ollama 或 LM Studio 在集成显卡上运行大语言模型,避开常见坑,第一次跑通。
准备环境
首先,你需要一台带集成显卡(iGPU)的电脑,比如 Intel Arc 或 AMD Radeon 780M。集成显卡没有自己的显存,会借用系统内存,所以最好有 16GB 以上内存。
- 下载并安装 Ollama(从 ollama.com 下载)或 LM Studio(从 lmstudio.ai 下载)。
- 确保显卡驱动是最新的,避免兼容问题。
安装步骤
- 打开 Ollama 或 LM Studio,首次启动会自动检测硬件。
- 选择一个量化(quantization)模型,比如 Llama 3.2 1B Q4_K_M。量化就是压缩模型,让它能在有限内存里跑。
- 在 LM Studio 中,进入“GPU Offload”设置,限制推送到 GPU 的层数(比如 10 层),防止内存爆满。
验证是否成功
在 Ollama 终端输入 ollama run llama3.2:1b,如果出现对话提示,说明运行成功。在 LM Studio 中点击“Start Server”,然后打开聊天窗口测试。
下一步可以做什么
- 尝试更大的模型(如 7B),但注意调低量化级别,比如 Q4。
- 用
ollama list查看已下载的模型,用ollama pull 模型名下载新模型。 - 在 LM Studio 中调整 GPU 层数,找到性能与内存的平衡点。
内容来源
DEV Ollama
发布时间
2026-06-22 01:31