配置示例
示例中的候选模型仅用于说明,请替换为控制台中健康且可路由的模型资源;对外模型名称可按客户端需要设置。保存配置时,Lumoswitch 会同步更新各调度模块的 Runtime 路由组和同一个 Virtual Key。
固定模型:测试与结果一致性
配置名称:support-test
模式:固定模型
模型:Qwen / qwen-plus
对外模型名称:support-testLumoswitch Runtime 始终将请求发送到同一模型;上游失败时直接返回错误。适合评测、提示词测试和固定模型版本的任务。
故障转移:生产高可用
配置名称:support-prod
模式:故障转移
候选顺序:Qwen / qwen-plus -> DeepSeek / deepseek-chat -> OpenAI / gpt-4o-mini
对外模型名称:support-prod候选顺序代表优先级,不是轮询。当前候选失败时,Lumoswitch Runtime 会尝试下一个部署。上线前应分别验证所有候选的请求格式、工具、流式响应和输出质量。
自动路由:按复杂度选模
配置名称:assistant-auto
模式:自动路由
候选顺序:轻量模型 -> 通用模型 -> 推理模型
对外模型名称:assistantLumoswitch 把候选顺序确定性映射到 Lumoswitch Runtime 的 SIMPLE、MEDIUM、COMPLEX、REASONING 层级。两个或三个候选也可使用,相邻层级会复用候选。按能力从轻到重排序,不要按故障转移优先级排序。
最少繁忙:并发吞吐
配置名称:batch-throughput
模式:最少繁忙
候选:两个以上可互换的模型资源Lumoswitch Runtime 选择当前活动请求最少的候选。候选应满足相近的接口和质量要求,因为列表顺序不是优先级。
最低延迟:交互响应
配置名称:chat-low-latency
模式:最低延迟
候选:两个以上可互换的模型资源Lumoswitch Runtime 使用已观测延迟选择响应最快的候选。新配置需要真实但非生产的预热请求形成观测数据,并应持续关注不同请求类型、地区和流式模式下的延迟变化。
多个对外模型映射
配置名称:support-prod
对外模型 support-prod -> 生产故障转移(使用完整调度模块)
对外模型 support-primary -> Qwen / qwen-plus(直接候选)同一配置可以暴露多个模型名称。每个名称都先选择调度模块,再选择完整模块或具体候选;不需要切换上方正在编辑的模块。完整模块使用其全部调度逻辑,直接候选会绕过模块路由,适合调试或显式选择。
一个配置使用多种调度
配置名称:mixed-production
模块 1:support -> a -> b -> c(故障转移)
模块 2:batch -> d / e / f(最少繁忙)客户端共用一个 Access Key,通过不同 model 名称进入各自的调度模块。两个模块独立编译、独立选择候选,不需要拆成两个配置。
测试与生产隔离
为测试和生产分别创建配置与 Access Key。修改候选或对外模型映射后,等待配置状态变为就绪,并立即向Lumoswitch 推理入口发送最小请求验证。