现在位置: 首页 > Ollama 教程 > 正文

Ollama Cloud 本地与云端混合

本地显存不够,又想用几百 B 参数的超大模型?Ollama Cloud 给了第三种选择:模型在云端 GPU 上跑,你的代码和工具链却感受不到任何变化。

本章节介绍 Cloud 模型的运行方式、直连 API、纯本地模式与退役机制,最后给出混合使用的选型策略。


Cloud 模型是什么

Cloud 模型是 Ollama 的一种新模型形态:权重存放在 Ollama 的云端,推理在官方 GPU 集群完成,本地只负责转发请求。

它解决的痛点非常具体:几百 B 的旗舰开源模型动辄需要数百 GB 显存,个人和小团队根本无法本地部署,但用它的需求又是真实存在的。

可用的 Cloud 模型在模型库中带 cloud 标签,以 qwen3.5 家族为例,旗舰规格就是 qwen3.5:cloud。


四种方式运行 Cloud 模型

先完成一次性准备:注册并登录 Ollama 账号,然后拉取 cloud 标签(它只是一个"指针",不会下载权重)。

使用登录 Ollama 账号(云模型需要):

ollama signin

在浏览器弹出的登录窗口输入邮箱即可(后面如果需要用手机验证,国内手机即可):

拉取 cloud 标签,几乎瞬间完成:

ollama pull qwen3.5:cloud

运行,与本地模型完全一致的体验:

ollama run qwen3.5:cloud

界面端可以看到有个云的图标:

Python 调用

实例

from ollama import chat

# 与本地模型唯一的区别:模型名带 :cloud
stream = chat(
    model='qwen3.5:cloud',
    messages=[{'role': 'user', 'content': '用一句话介绍 RUNOOB 菜鸟教程'}],
    stream=True,
)

for chunk in stream:
    print(chunk.message.content, end='', flush=True)

JavaScript 调用

实例

import ollama from 'ollama'

const response = await ollama.chat({
  model: 'qwen3.5:cloud',
  messages: [{ role: 'user', content: '用一句话介绍 RUNOOB 菜鸟教程' }],
  stream: true,
})

for await (const chunk of response) {
  process.stdout.write(chunk.message.content)
}

curl 调用

实例

curl http://localhost:11434/api/chat -d '{
  "model": "qwen3.5:cloud",
  "messages": [{ "role": "user", "content": "用一句话介绍 RUNOOB 菜鸟教程" }],
  "stream": false
}'


透明转发:本地 API 也能调云模型

Cloud 优雅的地方在于转发逻辑完全由本地服务处理。

本地与云端混合流转:统一入口按模型名后缀分流

向 localhost:11434 请求一个 :cloud 模型时,本地服务会自动完成到云端的鉴权与转发,你的应用代码、Agent 工具、编辑器集成完全无感。

这意味着已有集成可以立刻享受大模型能力:把 Claude Code 的模型名换成 qwen3.5:cloud,同一个工具链就切换到了旗舰规格。

当前有一个已知的能力边界:Cloud 模型暂不支持结构化输出(format 参数),需要 JSON Schema 约束的任务仍应安排给本地模型,或在应用层自行解析。


直连 ollama.com/api

除了经本地服务转发,也可以跳过本地直接调用云端 API,适合服务器没有安装 Ollama 的场景。

先在官网设置页创建 API Key,然后以 Bearer 方式携带:

实例

# 云端接口与本地接口路径结构一致
curl https://ollama.com/api/chat \
  -H "Authorization: Bearer $OLLAMA_API_KEY" \
  -d '{
    "model": "qwen3.5",
    "messages": [{ "role": "user", "content": "用一句话介绍 RUNOOB 菜鸟教程" }],
    "stream": false
  }'


# 云端也可列出可用的模型
curl https://ollama.com/api/tags

官方 SDK 同样支持指定 host 与认证头,连接方式见编程接入章节的 Client(host=...) 示例,把 host 换成 https://ollama.com 即可。

API Key 目前不会过期,但可以随时在官网设置页吊销;它等同于你的云端用量凭证,不要提交进代码仓库。


纯本地模式:彻底关掉云端

对数据出域零容忍的团队,可以把 Ollama 的云端功能整体关闭,让它成为纯粹的本地软件。

两种关闭方式任选其一,改完重启 Ollama 生效:

实例

# 方式一:配置文件 ~/.ollama/server.json 写入:
# { "disable_ollama_cloud": true }

# 方式二:环境变量
OLLAMA_NO_CLOUD=1 ollama serve

# 生效后日志中会出现:Ollama cloud disabled: true

关闭云功能会同时失去云模型与联网搜索能力,本地模型的全部功能不受任何影响。配合防火墙封锁出站,可以构建完全物理隔离的模型服务。


云模型的退役机制

云模型有生命周期:随着更强的开源模型发布,官方会定期退役旧云模型,并通过邮件和官网公告提前通知,同时给出推荐替代。

官方公告的样式是一张"退役日期 - 模型 - 推荐替代"映射表,例如某云模型将在某日下线、迁移到哪个新版本,照着换模型名即可。

两条工程建议:

其一,自动化流程里引用云模型时,把模型名做成配置项而不是硬编码,退役切换时只改配置。

其二,关键业务准备好同能力的本地替代模型,云模型退役或网络异常时可立刻降级。

退役只针对云模型:下载到本地的模型权重永远可用,这也是本教程始终强调本地主线的原因。


选型策略:什么时候用哪个

场景推荐方案理由
显存装得下的日常任务本地模型零成本、零延迟、数据不出设备
隐私敏感数据本地模型(或纯本地模式)合规可控
超大模型需求 / 无 GPU 设备Cloud 模型无需硬件投入,工具链不变
新模型尝鲜Cloud 先试,确认价值再本地化避免为试用购置硬件
长期自动化流程本地为主 + 云备用云有退役机制,本地无此风险

混合架构的最佳实践一句话:日常流量走本地,重任务按需 :cloud,模型名全部进配置文件。