在 M2 MacBook 上跑 AI 智能体:入门安装指南
手把手教你在 M2 MacBook 上安装 Ollama,下载量化模型,并用 CrewAI 跑通第一个本地 AI 智能体。
准备工作:了解你的 M2 MacBook
Apple Silicon(如 M2 芯片)的 统一内存 让 CPU 和 GPU 共享同一块 RAM,所以即使只有 8GB,也能运行小模型。但 macOS 和常用应用会占用 3-4GB,留给模型的空间大约 4-5GB。因此,选择 4-bit 量化 的 3B 模型(约 1.5GB)是最稳妥的入门选择。量化就是压缩模型大小,几乎不影响效果。
第一步:安装 Ollama
Ollama 是本地运行大模型的最简单工具,它帮你下载、管理模型,并提供本地 API。
- 访问 ollama.com,下载 macOS 版本并安装。
- 打开终端(Terminal),运行:
ollama pull llama3.2:3b。这会下载一个 3B 参数的量化模型。 - 下载完成后,输入
ollama run llama3.2:3b测试是否能对话。输入“Hello”看回复。
常见坑:如果下载慢,可以换个网络或使用代理。模型大小约 2GB,请确保磁盘空间充足。
第二步:验证模型运行
打开另一个终端窗口,运行 ollama ps,查看当前加载的模型和内存占用。如果内存占用接近空闲内存(比如 4GB 中占了 3.5GB),建议换更小的模型(如 llama3.2:1b)或缩短上下文长度,否则智能体循环可能因内存不足而卡死。
第三步:用 CrewAI 跑第一个智能体
CrewAI 是一个轻量级智能体框架,可以调用本地模型。
- 安装 Python(如果没装,从 python.org 下载)。
- 终端运行:
pip install crewai。 - 创建一个 Python 文件(比如 agent.py),写入以下代码:
from crewai import Agent, Task, Crew from langchain_community.llms import Ollama llm = Ollama(model="llama3.2:3b") agent = Agent( role='助手', goal='回答用户问题', backstory='你是一个友好的助手', llm=llm ) task = Task(description='告诉我今天的日期', agent=agent) crew = Crew(agents=[agent], tasks=[task]) result = crew.kickoff() print(result) - 运行:
python agent.py。如果一切正常,你会看到智能体调用模型并输出结果。
关键设置:在 Agent 中设置 max_iter=3,限制循环次数,防止小模型陷入死循环。
下一步可以做什么
尝试让智能体调用工具,比如搜索本地文件或计算。但记住内存预算:8GB 机器上,3B 模型是稳定之选。如果必须用更大模型,考虑使用云 API 或专用 GPU 服务器。
内容来源
DEV Ollama
发布时间
2026-07-08 01:35