极客前沿

AI 入门实战:在 24GB 显卡上跑大模型(一步步安装)

2026-07-04 01:32
DEV Ollama
查看原文

零基础学会安装 Ollama、下载模型、调整参数,在 24GB 显卡上运行 70B 大模型。

准备环境:你需要什么

在开始之前,请确认你的电脑满足以下条件:

Tutorial Image
  • 一张 24GB 显存 的显卡(如 RTX 3090 或 4090),显存是显卡自己的内存,越大能跑的模型越大。
  • 至少 32GB 系统内存(RAM)和足够的硬盘空间(模型文件约 40-50GB)。
  • Windows 或 Linux 系统均可,推荐 Windows 用户安装 Ollama(一个让你轻松运行大模型的工具)。

安装步骤:从零到跑起来

  1. 下载并安装 Ollama:访问 ollama.com,点击下载对应系统的安装包,双击安装即可。安装后打开终端(Windows 按 Win+R 输入 cmd),输入 ollama --version 检查是否成功。
  2. 下载一个模型:Ollama 支持很多模型。在终端输入 ollama pull llama3.3:70b-q4_K_M,这会下载一个 70B 参数的模型(参数越多模型越聪明,但需要更多显存)。下载时间取决于网速,文件约 42GB。
  3. 运行模型:下载完成后,输入 ollama run llama3.3:70b-q4_K_M。如果显存不够,你会看到错误提示。别担心,下一步教你调整。
  4. 调整显存使用:Ollama 默认尝试把整个模型放入显存,但 24GB 显存放不下 70B 模型。你需要创建一个 Modelfile(文本文件),写入 FROM llama3.3:70b-q4_K_MPARAMETER num_gpu 45(数字 45 表示只把 45 层放到显卡,其余用 CPU 计算)。然后运行 ollama create mymodel -f Modelfile 创建自定义模型,再 ollama run mymodel 即可。

验证是否成功:看速度

运行后,你可以输入任意问题测试。注意观察输出速度:如果每秒生成 6-12 个词(tok/s),说明设置正确。如果速度极慢(低于 4 tok/s),说明 CPU 负担太重,可以尝试增加 num_gpu 数值(比如 50),但小心别超出显存导致崩溃。

下一步可以做什么

  • 尝试更小的模型:如果速度不理想,推荐使用 32B 参数的模型(如 llama3.2:32b),它完全适合 24GB 显存,速度可达 30+ tok/s。
  • 学习调整上下文长度:在 Modelfile 中添加 PARAMETER num_ctx 2048 可减少显存占用。
  • 体验不同模型:Ollama 支持多种模型,如 qwen2.5:7b 适合中文,mistral:7b 轻量快速。用 ollama list 查看已下载的模型。

内容来源

DEV Ollama

发布时间

2026-07-04 01:32

返回 AI技术