作者:互联网 时间: 2026-07-22 17:26:57
TMAP平台通过多卡并行、Attention加速、量化与缓存优化,在保证质量无损的前提下实现4.87倍推理加速,单次成本降至0.15元/秒以下。核心内容:1. 针对图生视频模型推理瓶颈的四大优化领域2. 关键加速技术:序列并行、SageAttention算子与混合量化3. 自研DPCache缓存方案带来的全局最优调度效果






我们服务的视频生成业务特点:
流量多为在线流量, 对堆积的容忍度较低;
同等质量下, 生成越快给用户的体感越好, 就越具有竞争力.
会结合多种加速策略














的输出
的输出
差异很小,则可直接复用。但在推理过程中,只有完成了当前步的计算,才能进行这个比较,这就导致了“不计算就无法知道差异”的矛盾。为了解决这个矛盾,TeaCache 提出:模型输入与输出存在强相关性,且可以通过一个多项式对其进行拟合。


计算并缓存输出。对于后续时间步
并累加。
若累加和
(设定的阈值),则复用缓存;若
,则进行完整计算并更新缓存。

taylorseer论文原图(https://arxiv.org/pdf/2503.06923)



该阶段于线上初始化时进行,在给定只能完整计算 K 次的情况下,以 PACT 为成本,动态规划为最优路径算法,计算最优采样序列。该阶段的优化目标如下:


其中 D[m, k] 为用 m 个关键步到达时间步 k 的最小累积成本,P[m, k] 则记录了达成该最小成本时的上一个关键步(用于回溯最优路径)。
该阶段得到的关键时间步序列与采样配置绑定,一旦生成,可在生产环境长期复用,直到配置变化才需要重新计算。
在线推理时,对于每一个时间步执行如下策略:
关键步:执行完整模型前向计算,得到该时间步输出,并把指定特征写入缓存;
非关键步:调用与校准时完全相同的预测器,根据缓存快速生成该时间步所需特征。
生成质量:生成结果退化比例明显低于 TeaCache 及 TaylorSeer。
加速性能:由于 DPCache 能够通过校准找到最优的采样序列,因此可以进一步减少完整计算步数,加速效果约为 140%-160%。

通过对三种缓存方案的实践与对比,可以得出以下结论:
TeaCache 是视频生成缓存加速领域的经典方法,但在高质量生成场景下,其启发式阈值难以平衡质量与速度。
TaylorSeer 证明了“预测范式”的有效性,大幅提升了加速比,但固定间隔限制了其进一步优化空间,且额外的显存占用对实际落地影响较大。
DPCache 在大多数情况下是更好的选择。它通过路径感知成本与动态规划的结合,从而找到全局最优的计算路径。在线上AB测试中,DPCache 不仅继承且进一步提升了 TaylorSeer 的高加速比,且在灵活性及生成质量稳定性上实现了突破。



服务端技术 | 技术质量 | 数据算法
登录查看剩余 70% 内容