腾讯混元全链路开源 AngelSpec:DFly 解码加速,D - cut 提升高并发吞吐

发布时间:2026/7/30 21:18:19
腾讯混元全链路开源 AngelSpec:DFly 解码加速,D - cut 提升高并发吞吐 【导语腾讯混元团队正式全链路开源 AngelSpec这是一个覆盖训练、架构设计到线上部署的投机解码框架。该框架中的新一代 drafter DFly 取得新 SOTAD - cut 能提升高并发吞吐MTP TTT 攻克对话场景难题将投机解码加速做到端到端可用。】DFly 解码新一代 drafter 创 SOTA 佳绩腾讯混元团队此次开源的 AngelSpec 中新一代 drafter DFly 表现亮眼。在 4 - 64 全并发档位、六大 benchmark 中DFly 均取得更高吞吐较 AR 基线平均加速 1.98 - 2.40×代码/数学峰值 2.86×比 DFlash 再快 10.5 - 11.8%平均接受长度较 DFlash 30%、约为 MTP 的 1.6 倍。针对性改进DFly 突破 DFlash 短板DFlash 虽能以扩散方式并行生成 block 内所有 token使 draft 延迟几乎与 block 长度无关但存在所有 draft 层共享同一份 target 上下文且 block 内 token 互相不可见、后段接受率快速衰减的短板。DFly 针对性地做了三项改进。一是混合 target 条件注入结合 DFlash 的全连接共享投影与 DFlare 的逐层加权融合让每个 draft 层同时获得全局语义和匹配自身深度的 target 特征二是隐状态校正自回归头在并行主干上加轻量校正头用前一位置已选 token 修正当前位置的分布三是面向接受率的训练目标先用 D - PACE 加权的 LK 损失冷启动再切换到端到端 TV 损失直接优化期望接受长度。三项叠加后DFly 平均接受长度达4.79在结构性强的场景优势更大Math500 达5.23HumanEval 达5.52。D - cut 优化榨干高并发提升吞吐长 block 在部署侧存在代价高并发下 target 验证成为计算瓶颈被拒绝的 draft 后缀白白占用 batch 容量。D - cut 在每个解码步做两件事一是用 drafter 的逐 token 置信度估计各请求在不同验证深度下的期望推进量进行跨请求全局排序保留收益最高的前缀二是结合启动时预先测好的延迟表选择「期望收益 / 实际成本」最大的验证比例。效果上负载低时自动保留深 draft负载高时主动裁剪。在 Hy3 线上流量回放中并发 48/56/64 相对 DFly 分别提升 3.0% / 9.2% / 15.7%同等每用户延迟下聚合吞吐高 14%。MTP TTT攻克对话场景训练 - 推理不一致AngelSpec 采用双 drafter 路线DFly 负责代码/数学MTP 负责高熵对话。原始 MTP 块按单步 teacher forcing 训练推理时深层位置接受率大幅下降。团队用 TTT 修复这一训练 - 推理不一致配合 target 模型 rollout 生成的训练数据平均接受率从 52.8% 提升至 66.4%平均接受长度从 2.58 提升至 2.99。编辑观点腾讯混元开源 AngelSpec 为行业带来新突破其在解码加速和高并发处理上的成果显著有望推动投机解码技术在更多场景落地提升行业整体效率。

相关新闻