一步步搭建本地AI:从零开始安装并跑通LLM
本文教你从零开始安装本地大语言模型,包括环境准备、下载模型、运行脚本,并解决常见问题。
准备环境
首先,你需要一台有NVIDIA显卡(即英伟达生产的图形处理器,能加速AI计算)的电脑,并安装CUDA(英伟达的并行计算平台,让显卡运行AI程序)。去NVIDIA官网下载CUDA,按提示安装即可。同时,你需要一个llama-server.exe程序(一个运行大语言模型的服务端),可以从GitHub上的llama.cpp项目下载预编译版本。
安装步骤
- 下载llama.cpp的Windows版本,解压到文件夹,比如
C:\llama。 - 下载一个.gguf格式的模型文件(一种压缩后的AI模型,可直接运行)。推荐从Hugging Face(AI模型分享网站)找小模型,比如
Qwen2.5-0.5B-Instruct-Q4_K_M.gguf,放到C:\llama\models文件夹。 - 打开命令提示符(CMD),进入
C:\llama,运行:llama-server.exe -m models\你的模型文件名.gguf -c 4096 --port 8080。其中-c 4096是上下文长度(即AI能记住的对话字数),--port 8080是访问端口。 - 打开浏览器,访问
http://localhost:8080,你会看到一个聊天界面,输入文字即可与AI对话。
验证是否成功
如果浏览器能正常显示聊天框并回复,说明安装成功。你可以通过任务管理器(按Ctrl+Shift+Esc打开)查看显卡VRAM(显存,显卡专用内存)使用情况。如果显存占用接近满载但生成速度变慢,可能是上下文太长导致数据溢出到RAM(系统内存,速度比显存慢),这会影响速度。
下一步可以做什么
- 尝试不同大小的模型,比如7B或13B参数(参数越多模型越聪明,但需要更多显存)。
- 调整上下文长度(-c参数),观察显存和生成速度变化。
- 使用nvidia-smi命令(在CMD中输入)查看GPU实时状态,监控显存和功耗。
内容来源
DEV Machine Learning
发布时间
2026-07-05 01:32