技术博客
硬件

当时间序列基础模型终于学会"放大就更好":Toto 2.0 论文解读

Truman2026-07-09 14:38
当时间序列基础模型终于学会"放大就更好":Toto 2.0 论文解读

论文原标题:

Toto 2.0: Time Series Forecasting Enters the Scaling Era

论文链接:

https://arxiv.org/abs/2605.20119

论文主页:

https://www.datadoghq.com/blog/ai/toto-2/

论文代码:

https://github.com/DataDog/toto




一个一直存在的问题


你或许听说过过去两年里时间序列基础模型(Time Series Foundation Model,TSFM)、)的爆发,TimesFM、Chronos、Moirai、Toto 1.0 一个接一个发布,在很多预测任务上已经接近甚至超过精心调教过的统计基线。Datadog 团队在新论文里把这称作 TSFM 的"BERT 时刻"。


但有一件事一直让研究者别扭:这些模型放大不一定变好。Chronos-2 比 Chronos Bolt 大,但在某些基准上反而退步,Moirai 2 也未必稳定胜过 Moirai 1.1,TimesFM 2.5 与 2.0 的关系也并非"越大越强"。这和我们在 GPT、LLaMA 这条线上看到的"放大就变好"完全不是一回事。



Toto2.0


Toto 1.0(151M 参数)的骨架是一个 decoder-only patched transformer,注意力层在"时间轴(因果)"和"变量轴(双向)"之间交替,这部分 2.0 保留了。改的是五个地方。


第一,把自回归解码换成 Contiguous Patch Masking(CPM)。Toto 1.0 像 GPT 那样一块 patch 一块 patch 往后吐,预测一个 1024 步的 horizon,需要前向多少次就累加多少次的误差。CPM 借鉴自 TiRex,训练时随机挖空一段连续 patch 让模型同时预测,推理时把整个 horizon 都用 mask token 填上,一次前向传播就完成预测


论文里有一个挺有意思的发现:CPM 原本是为 xLSTM 这种递归结构设计的,但作者发现在 transformer 上反而更有效,递归结构每个 mask 位置都得算一次,而 transformer 真的就是一次搞定。


第二,输出头从 Student-T 混合模型换成 9 个分位数。Toto 1.0 输出的是一个混合 t 分布的参数(让模型预测均值、方差、自由度)。Toto 2.0 直接预测 9 个分位数 {0.1, 0.2, ..., 0.9},用 pinball loss 训练。


论文实测发现 Student-T 在放大到大模型时会数值爆炸,尤其是当预测值接近零时,分布的归一化项里的方差会发散。分位数头没有这个问题,而且现在已经是 Chronos-2、TimesFM 2.5、Moirai 2 的共识方案。


第三,优化器从 AdamW 换成 NorMuon。pinball loss 的梯度按公式只有三个可能取值:-τ、0、(1-τ),完全不携带"错了多少"的信息。AdamW 的优势之一是用历史梯度方差自适应步长,这套机制在 pinball 上几乎失效。Muon 优化器(Jordan et al. 2024,被 Moonshot AI 的 Kimi K2 拿来训练万亿模型)用 Newton–Schulz 迭代把动量矩阵正交化,但又彻底丢掉了 Adam 的 β₂ 方差机制。


NorMuon 在 Muon 之后按每个神经元(每一行)累计自己的二阶矩,既保留了正交化的几何好处,又把 β₂ 机制以"每神经元"的形式重新引入。


第四,u-μP 超参数迁移管道。这是论文工程价值最高的一块。直觉是这样的:大模型的最优学习率与小模型完全不同,经验上每加倍宽度,最优学习率会偏移一个数量级。


如果对 5 个尺寸各自独立调参,光调参就要烧掉几十次完整训练。μ-Parametrization(μP)证明可以通过特定的参数化方式,让最优学习率与模型宽度无关,u-μP 是 μP + Unit Scaling 的合体。Toto 2.0 在一个 10M 参数的"代理模型"上跑了四轮 Optuna 搜索(架构 → 数据配比 → 优化器 → 衰减),然后把同一组超参直接迁移到 4M / 22M / 313M / 1B / 2.5B 五个尺寸,几乎不用重调。


论文明确说"据我们所知,这是 μP 在时间序列预测领域的首次应用",并开源了配套的 dd_unit_scaling 库,补丁了 FSDP2 / torch.compile / 序列长度不变性等工程坑。



第五,还有几个细节值得提一下,patch size 从 64 降到 32(序列变长、表示更细),输入加 arcsinh 归一化适应可观测性指标的多数量级跨度,patch projection 从线性层换成带残差的 SiLU MLP。



反直觉的数据配比



这是 Toto 2.0 第二个反直觉之处。常识上,你既然要在 GIFT-Eval 这种公开基准上拿 SOTA,训练集里多放点公开数据应该有帮助,但 Toto 2.0 的 hyperparameter sweep 反复跑出来的结论是:加入公开数据反而恶化代理模型的性能,所以最终预训练完全不用公开数据。


不过论文也老实承认这是经验性发现,fine-tune 阶段他们又把 45% 的公开数据放进去了。"为什么 pretrain 不要、fine-tune 要"作者没给出原则性解释,直接把"数据 curation"列入了未来工作。



三个基准上的结果


BOOM(Datadog 自家的可观测性基准,2807 条真实工程指标):Toto 2.0 五个尺寸全部在帕累托前沿上,给定参数预算,没有任何其他 TSFM 更好。2.5B 模型 CRPS rank = 3.88,1B = 3.96,313m = 4.26。22M 模型已经超过了 Toto 1.0(151M),等于"7 倍更少参数达到上一代性能"。


GIFT-Eval(Salesforce 出的通用基准,177M 数据点,跨 7 个领域)基础模型榜上前三名被 Toto 2.0 包揽。如果允许 fine-tune 和模型集成,Toto 2.0 "Family and Friends"(把五个 Toto 2.0 + Chronos-2 + TimesFM 2.5 + TiRex + FlowState + PatchTST 用 FFORMA 集成)直接登顶整个 leaderboard,而且 meta-learner 自动分配给 Toto 2.0 家族 39% 的权重。


TIME(2026 年新发布的抗污染基准,98 个任务):三个最大尺寸再次包揽前三。



总结


如果只能记住一句话,我想是这样:Toto 2.0 不是在 TSFM 性能上做了革命性突破,而是把"放大就变好"这条 NLP 里的常识第一次稳定复现到时间序列领域


这听起来不像突破,但工程意义巨大:它告诉社区"在 TSFM 上投钱训更大的模型是值得的",这种信心是过去两年里 TSFM 社区一直缺的。配套开源的五个权重(Apache 2.0,从 16MB 的 4M 到 9GB 的 2.5B,覆盖边缘到服务端)和 dd_unit_scaling 库也很有诚意。





点赞收藏
// 评论0
0 / 500
还没有评论,快来抢沙发