谷歌研究院在9月中旬发布了时间序列基础模型TimesFM-3,参数规模3.3亿,训练数据超过一万亿个时间点。与只盯着单一指标的上一代模型不同,TimesFM-3可以同时处理多个相关变量,并把促销排期、天气预报这类已知的未来事件纳入预测过程,让需求预测第一次具备了多因素联动的能力。
在零售、金融、制造、医疗与科学研究等领域,这个模型家族从2024年至今已被持续部署。第三代最重要的变化不是参数变大,而是把逐块推算改成了单次全通生成,同时把输入从单条序列扩展到相互关联的变量组。
过去的时间序列模型按块预测未来,先算出一段,再拿这段结果去推算下一段。谷歌在技术说明中承认,这种做法速度慢、算力消耗大,而且误差会随着每一段预测的叠加不断累积。TimesFM-3的做法是把所有未来时间步全部标记为空白,然后用一次前向传播把空白一次性填满。
架构上它仍然基于Transformer,但把连续32个数据点打包成一个补丁,并对每条序列做统一尺度归一化,让量级差异极大的指标可以直接放在一起比较。模型沿两个方向交替处理数据:沿时间轴寻找单条序列内部的规律,只使用历史值以避免未来信息泄漏;跨序列比较同一时刻的所有变量,学习它们之间的关联关系。这种双向注意力让模型在处理促销这类事件时有了依据,因为它不只知道某个商品自己的历史曲线,还知道同一时刻其他商品和外部变量处在什么状态,从而把联动关系写进预测。
TimesFM-3可以同时处理三类补充信息。第一类是多个相互关联的变量,比如预测冰淇淋销量时同步预测不同口味的表现;第二类是仅存在于历史中的因素,比如过去的客流量;第三类是已知的未来事件,比如计划中的折扣排期或者天气预报。这三类数据在传统模型里往往要分开处理,再靠人工拼接进预测结果。
谷歌用零售场景演示了差别。一个只看历史销量的模型会沿着惯常的周度规律外推,对即将到来的促销一无所知;当TimesFM-3拿到折扣排期后,它会从历史数据中学到促销对需求的拉动幅度,进而预测每个促销日的销量大约高出20%。模型也不再只输出单点估计,而是每个时间步给出九个数值,用来刻画预测的范围与不确定性。九个数值对应不同的分位点,业务方既可以用中位数做常规排产,也可以用上分位数为旺季备货留出缓冲,预测结果因此从单一答案变成了可以按风险偏好取用的区间。
谷歌称TimesFM-3在Gift-Eval、FEV-Bench与Time三个基准上,点预测精度与不确定性校准均排名所有预训练预测模型第一。对比对象包括亚马逊的Chronos-2、Toto-2.0家族以及谷歌自家的TimesFM-2.5,后者在Time基准上被拉开明显差距。
即使把条件限制在单变量场景,TimesFM-3也能追平或超过现有模型,而且接入更多相关数据后领先幅度会进一步拉开。这一点对实际部署很关键,因为企业往往先从一个指标开始试用,再逐步扩展到多指标联动,模型在两种形态下都不需要重新训练,迁移成本接近于零。这也解释了为什么零样本能力在这类模型上格外重要:企业数据往往带有强烈的行业特征,如果每接一个客户都要重新训练,预测模型的落地周期与成本都会远超它带来的收益。
与前两代一样,TimesFM-3保持零样本能力,面对一家新企业的数据不需要额外训练即可直接推理。模型已在GitHub与Hugging Face开放,谷歌计划在未来几周把它接入BigQuery,此前TimesFM-2.5已经在BigQuery中通过AI.FORECAST命令承担单变量预测任务。
从2024年至今,TimesFM家族已被部署在零售、金融、制造、医疗与科学研究等领域。上一代TimesFM-2.5发布于2025年9月,只能处理单条数据序列,第三代原生支持多变量,被谷歌视为这一代最重要的能力跨越,也是它从分析工具走向业务系统组件的前提。对已经使用数据仓库的团队来说,接入门槛被压到了一条查询命令,这意味着时间序列预测有机会像聚合查询一样,成为分析师日常工作里随手可用的基础能力。
对销售、库存与人力排班团队来说,多变量预测模型的价值在于把促销、天气、关联商品这些因素一次性纳入决策链条。谷歌给出的思路是,先用模型估算一次促销能带来多少增量,再拿实际结果与估算做对比,逐步校准企业内部积累的历史经验参数。
但变量越多,对数据治理的要求也越高。已知未来事件是否准确录入、历史因素的统计口径是否稳定、不同业务线的指标能否统一归一化,都会直接影响预测质量。模型把过去需要多年经验积累的判断部分自动化了,同时也把数据质量的短板暴露得更彻底。过去靠人工经验兜底的模糊判断,现在会被模型以明确的数值形式呈现出来,一旦输入数据本身有偏差,错误结论会以更高的可信度进入决策流程,这要求企业在采用模型之前先把口径统一这件事做扎实。