跳到主要内容

性能与成本优化

优化 AI 服务时,应同时观察任务效果、响应速度和消费。通过路由、推理配置与模型选择进行调整后,使用相同场景比较结果,避免只降低单价而损失业务效果。

先记录基线​

选择一组有代表性的请求,记录模型与版本、输入输出规模、成功率、首 Token 延迟、完整响应时间和消费。比较变更前后的结果时,保持请求样例和流量条件一致。

目标可关注的信息
缩短开始等待时间TTFT、Prompt Cache、实例冷启动与负载
提高请求成功率上游健康、请求分布、错误类型与限流
减少费用实际输入输出用量、所选价格、重复请求与模型任务效果

调整路由与缓存亲和性​

对重复上下文或多轮对话,可评估会话哈希是否有助于上游复用 Prompt/KV Cache。比较调整前后的缓存指标与 TTFT,同时观察是否形成负载不均。

Prompt/KV Cache 由上游推理服务提供,用于复用输入上下文的计算结果。使用前,请确认上游支持的缓存方式和计费规则。

检查自建推理配置​

公共推理的最小副本数为 0 时可空闲缩容,下一次请求需要冷启动。需要更稳定首 Token 延迟的业务,可以评估保留运行副本带来的收益与资源费用。配置入口见公共推理管理。

专属实例可调整资源、运行时和副本数;部分变更需暂停并重启。参见实例设置与推理框架。调整推理参数后,可通过网关指标观察缓存命中率和响应延迟的变化。

验证模型与配置变化​

使用业务样例检查输出是否仍满足要求,并结合模型评测补充离线验证。记录变更内容,再对照网关指标和费用观察变化。

先使用离线评测和测试请求检查模型效果,再观察实际业务中的响应表现与费用变化。具体可用路由与推理选项以部署页面为准。