技术进展

TW3Cast登顶GIFT-Eval时序预测榜单

Heooo 09月25日12时03分 27 阅读

「TW3Cast是一种基于冻结路由机制的时序预测系统,在GIFT-Eval基准中以平均MASE排名19.4位列第三。该系统不依赖智能体或语言模型,而是通过在训练集上构建的静态路由表选择轻量微调的基础模型,结合多策略融合与严格防偏机制,显著优于单一基础模型。」

近日,一项名为TW3Cast的新型时间序列预测系统在权威基准GIFT-Eval上取得突破性成绩。截至2026年9月14日,TW3Cast在该榜单130个参赛系统中以平均MASE(Mean Absolute Scaled Error)排名19.4的成绩位列第三,仅次于两个属于“智能体”类别的多步推理系统。值得注意的是,TW3Cast完全不使用任何智能体(agent)或大语言模型(LLM),其核心创新在于一种“冻结路由”(frozen router)架构。

TW3Cast的设计理念强调高效、透明与可复现。系统为GIFT-Eval中涵盖的97种数据集、频率与预测视距(horizon)组合,预先在训练集划分上构建一张静态路由表。该表一旦生成即被冻结,不再随测试数据动态调整。对于每个配置,路由表会从四种模式中选择其一:一是“专家模型”(specialist),即对Chronos-2、TiRex或Toto等公开基础模型进行LoRA或全参数微调,且训练数据经过显式规则清洗与增强;二是包含专家模型的分位数融合(quantile blend);三是多个基础模型的加权融合;四是基于从训练集中切分出的回测窗口(backtest)所进行的“选拔赛”(selection tournament)。

所有路由决策均基于该回测窗口得出。只有当一个候选专家模型在回测中表现优于当前选拔赛结果时,才会被纳入路由表。这一机制使得每次候选评估仅需几兆字节存储和几分钟GPU时间,失败的候选则不会对系统造成任何影响,极大提升了开发效率与资源利用率。

为防止模型选择过程中的过拟合与偏差,TW3Cast引入了三重防护机制:首先,采用准确率与校准度(calibration)双重标准进行评估;其次,对在训练阶段已接触过目标序列的候选模型施加不对称性能裕度(asymmetric margin)惩罚;最后,设置保守的逐窗口门控(per-window gates)以限制高风险预测。更进一步,这些选择规则本身也是在时间维度上的元回测(temporal meta-backtest)中优化确定的,确保策略的稳健性。

实验结果显示,单独使用最佳基础模型时,平均MASE排名仅为33.8;若在所有配置上统一采用选拔赛机制,排名为38.0;而完整的TW3Cast路由系统则将性能大幅提升至19.4,充分验证了其架构的有效性。研究团队已开源路由表、专家索引、固定版本的基础模型、提交的分数文件以及公共榜单的快照,并提供一键复现脚本,确保所有结果完全可验证。

这一工作展示了在不依赖复杂推理链或大规模语言模型的前提下,通过精心设计的模型选择与融合策略,依然能在时序预测任务中达到顶尖水平,为高效、轻量化的AI预测系统提供了新范式。

# 时间序列预测 # 基础模型微调 # GIFT-Eval # 模型融合 # 开源AI

来源:Heooo AI工具导航