极客前沿

一步步搭建本地AI:从零开始安装并跑通LLM

2026-07-05 01:32
DEV Machine Learning
查看原文

本文教你从零开始安装本地大语言模型,包括环境准备、下载模型、运行脚本,并解决常见问题。

准备环境

首先,你需要一台有NVIDIA显卡(即英伟达生产的图形处理器,能加速AI计算)的电脑,并安装CUDA(英伟达的并行计算平台,让显卡运行AI程序)。去NVIDIA官网下载CUDA,按提示安装即可。同时,你需要一个llama-server.exe程序(一个运行大语言模型的服务端),可以从GitHub上的llama.cpp项目下载预编译版本。

Tutorial Image

安装步骤

  1. 下载llama.cpp的Windows版本,解压到文件夹,比如C:\llama
  2. 下载一个.gguf格式的模型文件(一种压缩后的AI模型,可直接运行)。推荐从Hugging Face(AI模型分享网站)找小模型,比如Qwen2.5-0.5B-Instruct-Q4_K_M.gguf,放到C:\llama\models文件夹。
  3. 打开命令提示符(CMD),进入C:\llama,运行:llama-server.exe -m models\你的模型文件名.gguf -c 4096 --port 8080。其中-c 4096是上下文长度(即AI能记住的对话字数),--port 8080是访问端口。
  4. 打开浏览器,访问http://localhost:8080,你会看到一个聊天界面,输入文字即可与AI对话。

验证是否成功

如果浏览器能正常显示聊天框并回复,说明安装成功。你可以通过任务管理器(按Ctrl+Shift+Esc打开)查看显卡VRAM(显存,显卡专用内存)使用情况。如果显存占用接近满载但生成速度变慢,可能是上下文太长导致数据溢出到RAM(系统内存,速度比显存慢),这会影响速度。

下一步可以做什么

  • 尝试不同大小的模型,比如7B或13B参数(参数越多模型越聪明,但需要更多显存)。
  • 调整上下文长度(-c参数),观察显存和生成速度变化。
  • 使用nvidia-smi命令(在CMD中输入)查看GPU实时状态,监控显存和功耗。

内容来源

DEV Machine Learning

发布时间

2026-07-05 01:32

返回 AI技术