同一个 AI 应用,有时要用强模型处理难题,有时只需便宜模型回答简单问题。Microsoft Foundry 的模型路由器就是这类“自动分单台”:应用保持同一入口,由平台按任务和配置选择后端模型。如今,它的全球标准部署从 2 个区域扩至 28 个,数据区域部署增至 21 个,让有延迟、数据驻留或合规要求的企业有了更多落点。
据 InfoQ 报道,模型池新增 Claude Opus 4.8 和 GPT-5.6 系列,同时移除四款已到生命周期终点的模型。默认使用 Balanced(兼顾质量与成本)模式的团队无需重新部署,更新会自动生效;限定了模型子集的团队则不会自动纳入新模型。
值得留意的是,接口不变不等于结果不变。后端模型更换仍可能影响回答风格、工具调用、延迟、Token 用量和拒答行为。微软未公布准确率、成本或额外延迟的实测数据,建议团队在生产上线前自行测试;每次响应会返回实际选中的模型,方便追踪。换句话说,多模型自动调度正成为云平台的标准能力,但模型池更新也应被当作一次需要验证的依赖升级。