服务迁移中的容量与背压处理
估算从工作单元开始
容量问题通常先表现为排队,再表现为超时和资源耗尽。先弄清一个请求占用什么、占用多久。
分别计算入口并发、队列、下游连接和资源上限;只看 CPU 或平均耗时无法说明排队风险。一个请求占用哪些 服务依赖、配置来源、运行手册与发布步骤、持有多久,都应进入估算。
背压必须传回入口
当 变更范围、兼容性检查与运行反馈 超出范围时限制并发或拒绝新任务,并返回可区分的可重试结果。队列设置上限和过期策略,用受控负载验证拒绝与恢复行为。
执行细节
入口并发、队列、工作线程与下游连接同时设上限。压力下降后检查是否恢复、是否遗留任务;取消信号要传到真正占用资源的调用。
背压策略还要说明优先级:哪些请求可等待,哪些请求应尽早拒绝。验证时检查拒绝响应不会诱发无界重试,且工作线程在请求取消后能及时释放。