极客前沿

第一次跑通本地AI:Ollama安装与并发测试入门

2026-07-02 01:32
DEV Ollama
查看原文

学会安装Ollama、下载模型、运行并发请求,理解本地AI的并行限制。

准备环境:下载和安装Ollama

Ollama是一个让你在本地电脑上运行AI模型的工具,不需要联网。首先,打开浏览器访问ollama.com,点击下载对应你操作系统的版本(Windows、macOS、Linux都支持)。安装过程很简单,一路默认即可。

Tutorial Image

安装步骤:下载第一个模型并运行

  1. 安装完成后,打开终端(Windows用户打开命令提示符或PowerShell)。
  2. 输入命令 ollama pull gemma:2b,这个命令会下载一个约1.5GB的轻量模型,适合新手测试。等待下载完成。
  3. 输入 ollama run gemma:2b,启动模型。你会看到一个提示符,输入任何问题,比如“你好”,模型会回复你。按 Ctrl+D 退出。

验证是否成功:测试并发请求

为了看看你的电脑能同时处理多少个AI请求,我们可以运行一个简单的Python脚本。注意:你需要先安装Python(从python.org下载)。

Tutorial Image
  • 创建一个新文件 test_concurrency.py,复制以下代码:
    import requests, concurrent.futures
    url = 'http://localhost:11434/api/generate'
    def send_request(prompt):
    data = {'model':'gemma:2b','prompt':prompt,'stream':False,'options':{'num_predict':100}}
    resp = requests.post(url, json=data)
    return resp.json()['eval_count']
    with concurrent.futures.ThreadPoolExecutor(max_workers=4) as executor:
    futures = [executor.submit(send_request, f'Tell me about number {i}') for i in range(4)]
    for f in concurrent.futures.as_completed(futures):
    print(f.result())
  • 在终端运行 python test_concurrency.py。如果所有请求都返回类似数字(比如100),说明安装成功。

常见坑:如果报错“Connection refused”,说明Ollama服务没启动,先运行 ollama serve 启动服务。

下一步可以做什么

你可以尝试更大的模型,比如 ollama pull llama3(约4GB)。注意:并发数(同时发送的请求数量)受内存限制。默认情况下,Ollama会根据内存自动限制并行数量。如果你有16GB内存,可能只能同时处理1个请求。要调整并行数,可以设置环境变量 OLLAMA_NUM_PARALLEL=4 再启动Ollama,但小心内存不足。

内容来源

DEV Ollama

发布时间

2026-07-02 01:32

返回 AI技术