核心概念
控制台反复用到几个词,先把它们分清,后面的页面才好读。
逻辑模型
逻辑模型是路由的落点,也是客户端请求里写的那个模型名。它本身不是一个真实模型,只是一个名字,下面挂着一批真实的供应商模型。
- 请求命中某个逻辑模型后,由它下面的供应商模型真正去跑。
- 内置的
default逻辑模型是兜底:没命中任何策略的请求都落到这里。它不能被改名或删除(说明可以编辑)。 - 逻辑模型卡片的两种模式:故障转移(在下挂的模型里按顺序试)与手动指定(固定用一个,其余待命)。
详见逻辑模型。
供应商与供应商模型
- 供应商(Provider):一家上游服务,比如 OpenAI、DeepSeek、某自建集群。凭据(API Key)、默认接口地址、请求超时都记在供应商这一层。
- 供应商模型:供应商下的一个真实模型(如
gpt-4.1-mini)。它是真正被调用的一方,也是逻辑模型里挂载的对象。
一个供应商模型可以声明支持多个协议(同一行模型,多个端点),它始终只占队列里的一行。详见供应商与模型。
协议与传输形态
- 协议:请求说哪种话。本服务接受 OpenAI Chat Completions、OpenAI Responses、Anthropic Messages 三种(见本服务支持的协议)。
- 传输形态:非流式、流式、WebSocket。是否流式由请求本身决定。
协议转换是可选能力:默认不转换、原样透传。只有当某个端点显式开启转换后,它才可能接住其他协议的请求(兼容层,部分参数可能丢失)。
路由
路由回答「一条请求落到哪个逻辑模型」。它有两种模式,同一时刻只有一种生效:
- 工作流编排:画布上的节点图,能表达分支、循环、脚本与 LLM 判定。
- 路由规则:一张按顺序读的规则表,第一条命中且有落点的胜出,都不命中走兜底。
详见请求选路。
故障转移与冷却
故障转移指某个供应商失败时自动改试下一个候选。冷却指连续失败达到阈值后,把该供应商(或该供应商模型)暂时移出候选,过一段时间再放回来。
默认连续失败 3 次进入冷却,初始冷却 30 秒、随失败次数递增、上限 5 分钟。详见故障转移。
缓存亲和
缓存亲和让同一会话的请求尽量粘在最近一次成功的供应商模型上,以保护供应商侧的提示词缓存。详见缓存亲和。
一句话串起来
flowchart LR A[请求里的模型名] --> B[路由] B --> C[逻辑模型] C --> D[供应商模型 1] C --> E[供应商模型 2] D --> F[供应商] E --> F
客户端写的模型名 → 路由决定落到哪个逻辑模型 → 逻辑模型按故障转移选中一个供应商模型 → 供应商模型经协议发往供应商。
概念清楚了,去供应商与模型配第一个上游。