统一鉴权与配额
为不同应用、团队和环境分配独立 Key、预算和速率限制。生产环境不用再把供应商密钥散落到各个服务里。
能力边界
适合需要同时接入多家模型、控制成本、稳定生产调用链的开发团队和企业业务线。
为不同应用、团队和环境分配独立 Key、预算和速率限制。生产环境不用再把供应商密钥散落到各个服务里。
按成本、延迟、上下文长度和可用性选择模型。供应商异常时,网关自动切换到备用路径,业务侧接口不变。
按模型、应用、Key 和用户维度查看 Token、费用、失败率和耗时。异常尖峰可被及时发现,而不是月底才看到账单。
路由策略
切换下面的策略,查看一次请求在网关内如何被解析、分配、回退和记录。
策略:成本优先
网关先匹配低成本模型池;当上下文长度、失败重试或质量阈值不满足时,再自动升级到更强模型。
识别任务类型与 Token 预算。
选择低成本模型池。
失败后按规则重试或升级。
记录费用、耗时与命中策略。
运行视图
请求、延迟、重试和成本放在同一张运行视图里,方便值班、排障和预算复盘。
接入方式
迁移路径以“先代理、再治理、再优化”为原则,降低上线风险,避免一次性改动所有业务代码。
为开发、测试、生产环境分离密钥,并配置预算、并发和允许模型。
沿用 OpenAI SDK 或兼容客户端,将请求统一转入网关。
按业务场景启用成本、延迟、质量策略,并观察真实调用表现。
import OpenAI from "openai";
const client = new OpenAI({
apiKey: process.env.ZQXSOBER_GATEWAY_KEY,
baseURL: "https://www.zqxsober.cloud/v1"
});
const completion = await client.chat.completions.create({
model: "gateway:auto",
messages: [
{ role: "system", content: "你是生产环境助手。" },
{ role: "user", content: "总结这段客户反馈。" }
],
metadata: {
app: "support-console",
route: "latency-first"
}
});