零基础也能上手:用 Python 和本地模型跑通第一个 AI 智能体
教你安装 Ollama、Qwen 和 Python 环境,运行一个简单的本地 AI 智能体,并学会用规则和 LLM 打分来测试它是否靠谱。
准备环境:你需要装什么?
要跟着本教程动手,你只需要一台电脑(Windows / macOS / Linux 都行),然后装三样东西:
- Python:一种编程语言,用来写控制 AI 的脚本。如果你还没装,去 python.org 下载最新版,安装时记得勾上“Add Python to PATH”。
- Ollama:一个让你在本地跑 AI 模型的免费工具,不用联网付费。去 ollama.com 下载安装包,装好后打开终端(命令行)输入
ollama --version,看到版本号就成功了。 - Qwen 模型:一个中文友好的 AI 模型,我们用它来当智能体和裁判。打开终端,输入
ollama pull qwen3.5:4b,等待下载完成(大约 2-3GB,需要一些时间)。如果你的电脑内存小于 8GB,可以换成qwen3.5:0.8b,效果会差一点但也能用。
安装步骤:一步步跑通代码
首先,创建一个项目文件夹,并在里面新建一个虚拟环境(避免和其他 Python 项目冲突):
- 打开终端,输入
mkdir ai-agent-test && cd ai-agent-test。 - 输入
python -m venv venv,然后激活它:Windows 用venv\Scripts\activate,Mac/Linux 用source venv/bin/activate。 - 安装必要的 Python 包:
pip install langchain langchain-community langchain-ollama。
现在,创建一个 agent.py 文件,复制以下代码(这是原文中简化后的智能体,包含两个小工具):
from langchain_ollama import ChatOllama
from langchain.agents import AgentExecutor, create_tool_calling_agent
from langchain.tools import tool
from langchain.prompts import ChatPromptTemplate
@tool
def current_time() -> str:
"""返回当前时间。"""
from datetime import datetime
return datetime.now().strftime("%Y-%m-%d %H:%M:%S")
@tool
def word_count(text: str) -> int:
"""返回输入文本的单词数。"""
return len(text.split())
tools = [current_time, word_count]
llm = ChatOllama(model="qwen3.5:4b", temperature=0)
prompt = ChatPromptTemplate.from_messages([
("system", "你是一个有帮助的助手,可以调用工具。"),
("human", "{input}"),
("placeholder", "{agent_scratchpad}")
])
agent = create_tool_calling_agent(llm, tools, prompt)
agent_executor = AgentExecutor(agent=agent, tools=tools, verbose=True)接着,创建 test.py 文件,写入测试代码(简化版):
from agent import agent_executor
test_cases = [
{"input": "现在几点了?", "expected_tool": "current_time"},
{"input": "帮我数一下'Hello world'有几个单词", "expected_tool": "word_count"}
]
for case in test_cases:
result = agent_executor.invoke({"input": case["input"]})
print(f"输入: {case['input']}\n输出: {result['output']}\n")最后,在终端运行 python test.py。如果一切顺利,你会看到智能体调用对应工具并输出结果。如果报错,检查 Ollama 是否在运行(终端输入 ollama serve 开启服务)。
验证是否成功:用规则和 LLM 来判分
上面的测试只是手动看结果。要自动化评估,我们可以加两种检查:
- 规则检查:比如“输出里是否包含某个词”或“是否调用了预期的工具”。这是最快最准的方法。
- LLM 裁判:让另一个 AI 模型(这里我们用同一个 Qwen,但换个提示词)来评判回答好不好。比如问它“这个回答是否回答了用户的问题”,它会给通过/不通过。
在原文中,作者构建了一个完整的评估框架,包含测试用例、规则断言和 LLM 裁判。你可以参考原文扩展你的 test.py,但作为入门,先跑通上面最简单的测试即可。
常见坑:如果智能体不调用工具,可能是模型太小或提示词不清晰。试着把 temperature 设为 0 让输出更确定。如果 Ollama 报内存不足,换用更小的模型(如 qwen3.5:0.8b)。
下一步可以做什么
你已经成功在本地跑通了一个 AI 智能体!接下来可以:
- 给智能体添加更多工具,比如搜索、计算器。
- 写更多的测试用例,覆盖不同场景。
- 参考原文实现完整的 LLM-as-judge 评估框架,让你的智能体更可靠。
记住:本地跑 AI 的好处是免费、隐私,坏处是受限于电脑性能。多试几次,你会越来越熟练。
内容来源
freeCodeCamp
发布时间
2026-07-19 01:30