Lumoswitch 文档

配置示例

示例中的候选模型仅用于说明,请替换为控制台中健康且可路由的模型资源;对外模型名称可按客户端需要设置。保存配置时,Lumoswitch 会同步更新 Lumoswitch Runtime 部署组和 Virtual Key。

固定模型:测试与结果一致性

配置名称:support-test
模式:固定模型
模型:Qwen / qwen-plus
对外模型名称:support-test

Lumoswitch Runtime 始终将请求发送到同一模型;上游失败时直接返回错误。适合评测、提示词测试和固定模型版本的任务。

故障转移:生产高可用

配置名称:support-prod
模式:故障转移
候选顺序:Qwen / qwen-plus -> DeepSeek / deepseek-chat -> OpenAI / gpt-4o-mini
对外模型名称:support-prod

候选顺序代表优先级,不是轮询。当前候选失败时,Lumoswitch Runtime 会尝试下一个部署。上线前应分别验证所有候选的请求格式、工具、流式响应和输出质量。

自动路由:按复杂度选模

配置名称:assistant-auto
模式:自动路由
候选顺序:轻量模型 -> 通用模型 -> 推理模型
对外模型名称:assistant

Lumoswitch 把候选顺序确定性映射到 Lumoswitch Runtime 的 SIMPLEMEDIUMCOMPLEXREASONING 层级。两个或三个候选也可使用,相邻层级会复用候选。按能力从轻到重排序,不要按故障转移优先级排序。

最少繁忙:并发吞吐

配置名称:batch-throughput
模式:最少繁忙
候选:两个以上可互换的模型资源

Lumoswitch Runtime 选择当前活动请求最少的候选。候选应满足相近的接口和质量要求,因为列表顺序不是优先级。

最低延迟:交互响应

配置名称:chat-low-latency
模式:最低延迟
候选:两个以上可互换的模型资源

Lumoswitch Runtime 使用已观测延迟选择响应最快的候选。新配置需要真实但非生产的预热请求形成观测数据,并应持续关注不同请求类型、地区和流式模式下的延迟变化。

多个对外模型映射

配置名称:support-prod
对外模型 support-prod -> 当前配置(使用完整故障转移)
对外模型 support-primary -> Qwen / qwen-plus(直接候选)

同一配置可以暴露多个模型名称。指向“当前配置”的名称使用完整调度逻辑;直接指向候选资源的名称会绕过配置级路由,适合调试或显式选择,但不应误认为具备配置级高可用或负载均衡能力。

测试与生产隔离

为测试和生产分别创建配置与 Access Key。修改候选或对外模型映射后,等待配置状态变为就绪,并立即向Lumoswitch 推理入口发送最小请求验证。

On this page