极客前沿

Qwen3.6-35B-A3B 本地安装教程:手把手带你跑通

2026-06-26 01:31
DEV Ollama
查看原文

本文教你从零开始,在本地安装并运行 Qwen3.6-35B-A3B 模型,只需 24GB 显存,轻松体验 AI 编程助手。

准备环境:你需要什么?

要运行这个模型,你的电脑需要一张 24GB 显存 的显卡,比如 RTX 3090、4090 或 5090。如果还没有,也可以租用云 GPU,比如 RunPod 上的 RTX 4090,每小时只要几毛钱。另外,请确保已经安装了 Ollama(一个让你轻松运行 AI 模型的工具)。

安装步骤:一步步来

  1. 安装 Ollama:前往官网下载并安装。Windows 和 macOS 有安装包,Linux 用户用命令行安装。
  2. 下载模型:打开终端,输入以下命令:
    ollama pull qwen3.6-35b-a3b
    这个命令会下载约 24GB 的模型文件,请耐心等待几分钟。
  3. 运行模型:下载完成后,输入:
    ollama run qwen3.6-35b-a3b
    稍等几秒,模型就会加载到显存中,然后你就可以在终端里跟它对话了。

验证是否成功:测试一下

在终端里输入一个问题,比如“写一个 Python 函数计算斐波那契数列”,看看它是否能正常回复。如果一切顺利,你会看到每秒生成 40~70 个 token(相当于几十个字),速度飞快。

Tutorial Image

如果你想把它作为后台服务,供其他程序调用,可以运行:
ollama serve
然后访问 http://localhost:11434/v1 即可。用 curl 测试:
curl http://localhost:11434/v1/chat/completions -d '{"model":"qwen3.6-35b-a3b","messages":[{"role":"user","content":"你好"}]}'

下一步可以做什么

  • 调整参数:在 Ollama 的 Modelfile 中设置 PARAMETER temperature 0.7,这样模型回答更稳定,适合编程任务。
  • 集成到编辑器:很多代码编辑器(如 VS Code)支持连接本地 Ollama 服务,让你在写代码时直接调用 AI 助手。
  • 注意上下文长度:24GB 显存下,建议不要超过 16K~32K 的上下文(即一次输入太多文字),否则可能内存不足。

内容来源

DEV Ollama

发布时间

2026-06-26 01:31

返回 AI技术