核心概念

控制台反复用到几个词,先把它们分清,后面的页面才好读。

逻辑模型

逻辑模型是路由的落点,也是客户端请求里写的那个模型名。它本身不是一个真实模型,只是一个名字,下面挂着一批真实的供应商模型。

  • 请求命中某个逻辑模型后,由它下面的供应商模型真正去跑。
  • 内置的 default 逻辑模型是兜底:没命中任何策略的请求都落到这里。它不能被改名或删除(说明可以编辑)。
  • 逻辑模型卡片的两种模式:故障转移(在下挂的模型里按顺序试)与手动指定(固定用一个,其余待命)。

详见逻辑模型。

供应商与供应商模型

  • 供应商(Provider):一家上游服务,比如 OpenAI、DeepSeek、某自建集群。凭据(API Key)、默认接口地址、请求超时都记在供应商这一层。
  • 供应商模型:供应商下的一个真实模型(如 gpt-4.1-mini)。它是真正被调用的一方,也是逻辑模型里挂载的对象。

一个供应商模型可以声明支持多个协议(同一行模型,多个端点),它始终只占队列里的一行。详见供应商与模型。

协议与传输形态

  • 协议:请求说哪种话。本服务接受 OpenAI Chat Completions、OpenAI Responses、Anthropic Messages 三种(见本服务支持的协议)。
  • 传输形态:非流式、流式、WebSocket。是否流式由请求本身决定。

协议转换是可选能力:默认不转换、原样透传。只有当某个端点显式开启转换后,它才可能接住其他协议的请求(兼容层,部分参数可能丢失)。

路由

路由回答「一条请求落到哪个逻辑模型」。它有两种模式,同一时刻只有一种生效:

  • 工作流编排:画布上的节点图,能表达分支、循环、脚本与 LLM 判定。
  • 路由规则:一张按顺序读的规则表,第一条命中且有落点的胜出,都不命中走兜底。

详见请求选路。

故障转移与冷却

故障转移指某个供应商失败时自动改试下一个候选。冷却指连续失败达到阈值后,把该供应商(或该供应商模型)暂时移出候选,过一段时间再放回来。

默认连续失败 3 次进入冷却,初始冷却 30 秒、随失败次数递增、上限 5 分钟。详见故障转移。

缓存亲和

缓存亲和让同一会话的请求尽量粘在最近一次成功的供应商模型上,以保护供应商侧的提示词缓存。详见缓存亲和。

一句话串起来

flowchart LR
  A[请求里的模型名] --> B[路由]
  B --> C[逻辑模型]
  C --> D[供应商模型 1]
  C --> E[供应商模型 2]
  D --> F[供应商]
  E --> F

客户端写的模型名 → 路由决定落到哪个逻辑模型 → 逻辑模型按故障转移选中一个供应商模型 → 供应商模型经协议发往供应商。


概念清楚了,去供应商与模型配第一个上游。