技术进展

SeT-Diff:面向HPC遥测数据的语义基础模型

Heooo 07月28日12时02分 31 阅读

「研究人员提出SeT-Diff,首个面向高性能计算节点遥测数据和时间序列的基础模型。该模型采用扩散生成架构,通过语义描述解耦系统动态与数据集结构,在真实超算数据集上实现0.0470的重构平均绝对误差。SeT-Diff具备零样本排列稳定性,即使传感器顺序被打乱也能保持精度。单个预训练模型可同时执行数据插补、预测和虚拟传感任务,在热推理中达到0.033的MAE,成为HPC系统高效的数据驱动数字孪生方案。」

高性能计算(HPC)数据中心的运维正面临日益复杂的挑战。计算节点需要精确且灵活的数字孪生模型,以模拟工作负载、环境参数和物理指标之间错综复杂的相互作用。然而,当前用于HPC及其遥测数据的机器学习方法,通常依赖于针对单一任务定制的静态匿名传感器变量子集。这种刚性架构导致模型在目标任务发生变化或传感器指标出现变动时迅速失效。

来自研究团队的论文《SeT-Diff: Towards Semantic Foundation Models for HPC Telemetry and Time-Series》提出了一种全新的解决方案。SeT-Diff被设计为首个面向计算节点遥测数据和时间序列的基础模型。与传统的固定架构不同,该模型采用扩散生成方法,将生成过程的条件设定为每个传感器的语义描述,从而成功将系统动态与数据集结构解耦。这意味着模型不再依赖传感器在数据集中的固定位置或编号,而是理解每个传感器所代表的物理含义。

实验基于真实世界的超算数据集进行。结果显示,SeT-Diff在重构任务上实现了0.0470的平均绝对误差(MAE)。更值得关注的是,该模型展现出零样本排列稳定性——即使传感器被随机打乱顺序,模型依然能够保持精度,性能下降微乎其微。这一特性在实际数据中心运维中极具价值,因为传感器配置和布局时常会发生变化。

SeT-Diff的通用性同样令人印象深刻。单个预训练模型能够有效执行多种任务:数据插补(填补缺失值)、时间序列预测以及虚拟传感。在热推理这一典型虚拟传感任务中,模型取得了0.033的MAE。这些结果表明,SeT-Diff可以作为一个高效的数据驱动数字孪生体,为HPC系统的实时监控、故障预测和能效优化提供坚实的技术基础。

从技术演进的角度看,SeT-Diff的提出标志着HPC领域从任务专用模型向通用基础模型的重要转变。过去,运维团队需要为每种遥测分析任务单独训练和部署模型,不仅耗时耗力,而且难以适应动态变化的硬件环境。SeT-Diff通过语义条件生成技术,让一个模型能够理解不同传感器的物理角色,从而在多种任务间无缝切换。

这种语义解耦的思路也为更广泛的时序数据建模提供了新范式。在工业物联网、智能电网、气候监测等领域,传感器种类繁多且配置频繁变动的问题同样存在。SeT-Diff所展示的零样本适应能力和多任务泛化能力,有望推动基础模型在更多时序分析场景中的应用。

该研究目前已在arXiv上公开,论文详细阐述了模型架构、训练策略以及实验结果。随着数据中心规模持续扩大和运维复杂度不断上升,像SeT-Diff这样能够灵活应对传感器变化、同时支持多种分析任务的基础模型,将成为构建下一代智能运维系统的关键组件。未来,研究团队计划进一步探索模型在更大规模集群上的表现,并优化其推理效率以满足实时性要求。

# 基础模型 # HPC # 时序数据 # 数字孪生 # 扩散模型

来源:Heooo AI工具导航