一步步搭建本地视觉AI:用Ollama给AI装上“眼睛”
本文教你从零开始,用Ollama安装MiniCPM-V模型,并配置MCP服务器,让Cursor等工具能看懂截图和文档。
准备环境:你需要什么?
首先,你需要在电脑上安装两个东西:Ollama(一个让你在本地运行AI模型的工具)和Python 3.10+(编程语言环境)。Ollama像应用商店,可以下载并运行各种AI模型,而Python用来写连接代码。
- 下载Ollama:访问ollama.com,根据你的系统(Windows、macOS、Linux)下载安装包。安装后,在终端输入
ollama --version检查是否成功。 - 安装Python:从python.org下载最新版,安装时勾选“Add Python to PATH”。完成后打开终端,输入
python --version确认。
安装模型:下载MiniCPM-V
MiniCPM-V是一个轻量级视觉模型,只有1.3B参数(参数越多模型越聪明,但这里足够用),大小约1.6GB,适合在普通电脑上运行。在终端执行以下命令:
- 运行
ollama pull minicpm-v,Ollama会自动下载模型。下载时间取决于网速,耐心等待。 - 下载完成后,输入
ollama run minicpm-v测试。如果出现对话提示,说明模型已就绪。输入/bye退出。
常见坑:如果下载失败,检查网络连接或更换DNS。Mac用户确保有至少4GB空闲内存。
配置MCP服务器:让AI工具连上视觉能力
MCP(Model Context Protocol)是一种标准协议,让不同AI工具(如Cursor、Claude Desktop)能共享同一个视觉服务。我们需要写一个Python脚本作为服务器。
- 创建一个文件夹,比如
vision-mcp,在里面新建文件server.py。 - 复制以下代码(简化版)到文件中:
import json, base64, requests
from mcp.server import Server, stdio_server
server = Server('vision-server')
@server.tool('describe_image')
def describe_image(path: str, question: str = '描述这个图片') -> str:
with open(path, 'rb') as f:
img_b64 = base64.b64encode(f.read()).decode()
resp = requests.post('http://localhost:11434/api/chat', json={
'model': 'minicpm-v',
'messages': [{'role': 'user', 'content': question, 'images': [img_b64]}]
})
return resp.json()['message']['content']
if __name__ == '__main__':
stdio_server.run(server) - 在终端进入该文件夹,运行
pip install mcp requests安装依赖。 - 运行
python server.py,看到“Server started”表示成功。
常见坑:Ollama服务必须保持运行(默认开机自启)。如果报错“Connection refused”,检查Ollama是否启动。
验证:在Cursor中使用
以Cursor为例,配置MCP连接:
- 打开Cursor,进入设置 → MCP。
- 添加一个MCP服务器:名称随意,类型选“stdio”,命令填
python /绝对路径/server.py(替换为你的实际路径)。 - 重启Cursor。在聊天窗口输入“describe_image 图片路径”,如果返回描述,就成功了!
你也可以在Claude Desktop或Hermes中做类似配置。现在,你的AI助手不仅能看文字,还能“看”图片了——所有数据都在本地,无需上传云端。
下一步:试试用 ocr_document 识别发票,或用 compare_images 对比两张截图的不同。更多示例可参考原文中的 examples/ 文件夹。
内容来源
DEV Ollama
发布时间
2026-06-24 01:38