AI 入门实战:在 24GB 显卡上跑大模型(一步步安装)
零基础学会安装 Ollama、下载模型、调整参数,在 24GB 显卡上运行 70B 大模型。
准备环境:你需要什么
在开始之前,请确认你的电脑满足以下条件:
- 一张 24GB 显存 的显卡(如 RTX 3090 或 4090),显存是显卡自己的内存,越大能跑的模型越大。
- 至少 32GB 系统内存(RAM)和足够的硬盘空间(模型文件约 40-50GB)。
- Windows 或 Linux 系统均可,推荐 Windows 用户安装 Ollama(一个让你轻松运行大模型的工具)。
安装步骤:从零到跑起来
- 下载并安装 Ollama:访问 ollama.com,点击下载对应系统的安装包,双击安装即可。安装后打开终端(Windows 按 Win+R 输入 cmd),输入
ollama --version检查是否成功。 - 下载一个模型:Ollama 支持很多模型。在终端输入
ollama pull llama3.3:70b-q4_K_M,这会下载一个 70B 参数的模型(参数越多模型越聪明,但需要更多显存)。下载时间取决于网速,文件约 42GB。 - 运行模型:下载完成后,输入
ollama run llama3.3:70b-q4_K_M。如果显存不够,你会看到错误提示。别担心,下一步教你调整。 - 调整显存使用:Ollama 默认尝试把整个模型放入显存,但 24GB 显存放不下 70B 模型。你需要创建一个 Modelfile(文本文件),写入
FROM llama3.3:70b-q4_K_M和PARAMETER num_gpu 45(数字 45 表示只把 45 层放到显卡,其余用 CPU 计算)。然后运行ollama create mymodel -f Modelfile创建自定义模型,再ollama run mymodel即可。
验证是否成功:看速度
运行后,你可以输入任意问题测试。注意观察输出速度:如果每秒生成 6-12 个词(tok/s),说明设置正确。如果速度极慢(低于 4 tok/s),说明 CPU 负担太重,可以尝试增加 num_gpu 数值(比如 50),但小心别超出显存导致崩溃。
下一步可以做什么
- 尝试更小的模型:如果速度不理想,推荐使用 32B 参数的模型(如 llama3.2:32b),它完全适合 24GB 显存,速度可达 30+ tok/s。
- 学习调整上下文长度:在 Modelfile 中添加
PARAMETER num_ctx 2048可减少显存占用。 - 体验不同模型:Ollama 支持多种模型,如
qwen2.5:7b适合中文,mistral:7b轻量快速。用ollama list查看已下载的模型。
内容来源
DEV Ollama
发布时间
2026-07-04 01:32