开源项目

腾讯开源AngelSpec框架提升大模型推理效率

Heooo 07月30日12时01分 30 阅读

「腾讯正式开源统训框架AngelSpec,旨在解决大模型自回归解码的高昂成本问题。该框架通过创新的DFly块扩散架构,结合混合目标条件编码与动态验证机制,在保持高吞吐量并行生成的同时优化了特征利用率与资源平衡。在Hy3模型系列测试中,搭载DFly的方案在并发数4到64的范围内均实现了最高平均吞吐量,显著优于传统自回归解码,为大模型高效推理提供了开源工具支持。」

在当前大模型规模与服务需求持续增长的背景下,如何降低自回归解码的高昂成本成为了行业的一大痛点。为此,腾讯技术团队正式开源了统训框架AngelSpec,旨在通过创新的架构设计破解大模型真实推理效率难题。

AngelSpec框架针对不同应用场景下文本特征的差异,提出了名为DFly的创新块扩散框架。该框架通过混合目标条件编码骨干与前序条件自回归头,在保持高吞吐量并行生成的同时,大幅优化了目标特征利用率与块内依赖建模。这种设计使得模型在生成过程中能够更高效地利用上下文信息,减少冗余计算,从而提升整体推理速度。

此外,系统引入了动态验证机制,可结合当前在线负载、硬件条件及前缀置信度,在运行时自适应调整验证深度。这一机制能够在计算资源与吞吐效率之间实现动态平衡,避免了传统固定验证策略带来的资源浪费或性能瓶颈。例如,在高负载场景下,系统可以适当降低验证深度以优先保证吞吐量;而在低负载时,则可以增加验证深度以提升生成质量。

在Hy3模型系列的系统测试中,搭载DFly的方案展现出显著的性能优势。在并发数从4到64的各项测试中,该方案均实现了最高的平均吞吐量,相比传统的自回归解码提升显著。这一结果验证了AngelSpec框架在真实场景中的实用价值,为大模型的工程化落地与高效推理提供了坚实的开源工具支持。

目前,AngelSpec框架已正式开源,项目地址位于GitHub,相关论文也已发布在arXiv上。开发者可以通过这些资源深入了解框架的实现细节,并将其应用于自己的大模型推理优化工作中。腾讯此举不仅推动了AI技术社区的发展,也为行业解决大模型推理效率问题提供了新的思路。

# 腾讯 # AngelSpec # 大模型 # 推理效率 # 开源 # DFly

来源:Heooo AI工具导航