第一次跑通本地AI:Ollama安装与并发测试入门
学会安装Ollama、下载模型、运行并发请求,理解本地AI的并行限制。
准备环境:下载和安装Ollama
Ollama是一个让你在本地电脑上运行AI模型的工具,不需要联网。首先,打开浏览器访问ollama.com,点击下载对应你操作系统的版本(Windows、macOS、Linux都支持)。安装过程很简单,一路默认即可。
安装步骤:下载第一个模型并运行
- 安装完成后,打开终端(Windows用户打开命令提示符或PowerShell)。
- 输入命令
ollama pull gemma:2b,这个命令会下载一个约1.5GB的轻量模型,适合新手测试。等待下载完成。 - 输入
ollama run gemma:2b,启动模型。你会看到一个提示符,输入任何问题,比如“你好”,模型会回复你。按Ctrl+D退出。
验证是否成功:测试并发请求
为了看看你的电脑能同时处理多少个AI请求,我们可以运行一个简单的Python脚本。注意:你需要先安装Python(从python.org下载)。
- 创建一个新文件
test_concurrency.py,复制以下代码:import requests, concurrent.futures
url = 'http://localhost:11434/api/generate'
def send_request(prompt):
data = {'model':'gemma:2b','prompt':prompt,'stream':False,'options':{'num_predict':100}}
resp = requests.post(url, json=data)
return resp.json()['eval_count']
with concurrent.futures.ThreadPoolExecutor(max_workers=4) as executor:
futures = [executor.submit(send_request, f'Tell me about number {i}') for i in range(4)]
for f in concurrent.futures.as_completed(futures):
print(f.result()) - 在终端运行
python test_concurrency.py。如果所有请求都返回类似数字(比如100),说明安装成功。
常见坑:如果报错“Connection refused”,说明Ollama服务没启动,先运行 ollama serve 启动服务。
下一步可以做什么
你可以尝试更大的模型,比如 ollama pull llama3(约4GB)。注意:并发数(同时发送的请求数量)受内存限制。默认情况下,Ollama会根据内存自动限制并行数量。如果你有16GB内存,可能只能同时处理1个请求。要调整并行数,可以设置环境变量 OLLAMA_NUM_PARALLEL=4 再启动Ollama,但小心内存不足。
内容来源
DEV Ollama
发布时间
2026-07-02 01:32