Qwen3.6-35B-A3B 本地安装教程:手把手带你跑通
本文教你从零开始,在本地安装并运行 Qwen3.6-35B-A3B 模型,只需 24GB 显存,轻松体验 AI 编程助手。
准备环境:你需要什么?
要运行这个模型,你的电脑需要一张 24GB 显存 的显卡,比如 RTX 3090、4090 或 5090。如果还没有,也可以租用云 GPU,比如 RunPod 上的 RTX 4090,每小时只要几毛钱。另外,请确保已经安装了 Ollama(一个让你轻松运行 AI 模型的工具)。
安装步骤:一步步来
- 安装 Ollama:前往官网下载并安装。Windows 和 macOS 有安装包,Linux 用户用命令行安装。
- 下载模型:打开终端,输入以下命令:
ollama pull qwen3.6-35b-a3b
这个命令会下载约 24GB 的模型文件,请耐心等待几分钟。 - 运行模型:下载完成后,输入:
ollama run qwen3.6-35b-a3b
稍等几秒,模型就会加载到显存中,然后你就可以在终端里跟它对话了。
验证是否成功:测试一下
在终端里输入一个问题,比如“写一个 Python 函数计算斐波那契数列”,看看它是否能正常回复。如果一切顺利,你会看到每秒生成 40~70 个 token(相当于几十个字),速度飞快。
如果你想把它作为后台服务,供其他程序调用,可以运行:ollama serve
然后访问 http://localhost:11434/v1 即可。用 curl 测试:curl http://localhost:11434/v1/chat/completions -d '{"model":"qwen3.6-35b-a3b","messages":[{"role":"user","content":"你好"}]}'
下一步可以做什么
- 调整参数:在 Ollama 的 Modelfile 中设置
PARAMETER temperature 0.7,这样模型回答更稳定,适合编程任务。 - 集成到编辑器:很多代码编辑器(如 VS Code)支持连接本地 Ollama 服务,让你在写代码时直接调用 AI 助手。
- 注意上下文长度:24GB 显存下,建议不要超过 16K~32K 的上下文(即一次输入太多文字),否则可能内存不足。
内容来源
DEV Ollama
发布时间
2026-06-26 01:31