TinyCast:一个只有14万参数的时间序列预测模型

你有没有想过,一台安装在工厂车间里的传感器,要预测接下来一天的温度变化,到底需要多聪明的大脑?

大多数人的直觉是,越聪明越好。这几年时间序列预测领域确实也是这么干的,各家都在拼参数量,动辄几百万到几十亿。但2026年发表的TinyCast做了一件反常的事:它把参数量压到了14万6千505个,比很多手机APP的一个图标文件还小,却在概率预测的准确度上,超过了所有比它小、且公开承诺没用测试数据作弊的同类模型。

这不是一个"更小但更弱"的妥协方案。它是在问一个更根本的问题:如果我们把预测这件事拆开看,哪些部分其实根本不需要"学习",用简单的数学公式算一算就够了?

先说清楚,这件事难在哪

时间序列预测,说白了就是看着一堆历史数据,猜接下来会发生什么。工厂的能耗曲线、医院的病人数量、电网的负荷,本质上都是这类问题。

传统做法是"一个数据集配一个模型":你要预测电费账单,就专门训练一个电费模型;换成预测水表读数,这套模型直接作废,得重新收集数据、重新训练、重新验证。

这套流程最贵的不是算力,是人力。

一个工厂里可能有几十种不同的传感器信号,每一种都要单独维护一套模型,这意味着几十次的验收测试、几十次的固件更新周期。这才是真正拖后腿的成本,而且这个成本不会随着芯片变便宜而消失。

时间序列基础模型(Time Series Foundation Model)*:一种在海量多样化数据上预训练好的通用模型,遇到从没见过的新数据也能直接预测,不需要重新训练,这种能力叫"零样本"(zero-shot)。

这个思路的出现,本该终结"一个数据集一个模型"的窘境。但问题也随之而来:这些通用模型往往体积巨大,装不进一台工业传感器那种只有几百KB闪存、没有网络连接的微控制器里。

更麻烦的是第二个问题。当时市面上体积小于1MB、并且公开声明没有用测试数据作弊的模型,几乎全都只吐出一个数字作为预测结果。

这就好比你去医院做检查,医生只告诉你"血压是130",却不告诉你这个数值的正常范围是多少、误差有多大。你根本没法判断这个130到底该不该担心。工业场景里同样如此,一个报警阈值、一个控制回路,靠的从来不是单一预测值,而是这个值周围的不确定性区间。没有这个区间,你根本不知道该多信任这个预测。

于是TinyCast瞄准的其实是两条同时收缩的战线:模型要足够小,同时预测结果要带着"我有多大把握"这句话。在它之前,这两条线几乎没有同时达成过。

核心思路:能算的东西,就别浪费参数去学

TinyCast的设计哲学可以用一句话概括:在这么小的参数预算下,任何用来"重新发现周期性"的容量,都是从别处偷来的容量。

这话听起来有点绕,翻译一下就是:很多时间序列都有周期规律,比如电力负荷每天都有早晚高峰、超市销量每周都有周末小高峰。市面上大部分模型都是靠海量数据和注意力机制,让神经网络自己"悟"出这个周期规律。但"悟"是要花参数的,就像你雇一个员工专门负责观察记录哪天是周末,这个员工的工资是要算进成本的。

TinyCast的想法是:既然周期性这个东西,用一次傅里叶变换就能直接算出来,为什么还要雇一个昂贵的员工去"学"它?

傅里叶变换(Fourier Transform)*:一种数学工具,能把一段随时间变化的信号,转换成它由哪些"频率成分"组成,从而揪出隐藏在数据里的周期规律。

这就是TinyCast最核心的设计决定:用一个零参数的频谱探测器,直接从上下文数据里算出主导周期,省下来的参数预算,全部投入到真正需要学习的、没有固定公式可循的复杂结构上。

这里必须做一个类比来说清楚代价和收益。假设你在装修一套房子,预算有限。你可以雇一个全能装修队,让他们连"这面墙朝南还是朝北"都要现场勘测半天才能确定,这样固然灵活,但你多付的钱其实是在为一个可以用指南针几秒钟解决的问题买单。TinyCast的做法相当于先用指南针把方位定好,告诉装修队"这面墙朝南",装修队就不用再浪费预算去猜朝向,可以把钱都花在真正需要手艺的部分,比如墙面造型和收纳设计上。如果不这么做,会发生什么?论文里做了对照实验:把同样14万6千505个参数的模型重新训练一遍,但关掉这个频谱探测器,结果点预测准确度掉了0.0071(这个指标越小越好),大约是三次独立训练之间正常波动幅度的8倍。省下来的探测器工作量,被证明确实值这个价钱。

架构长什么样:四个部件的接力

TinyCast整个流程是四步接力:先测周期,再把周期变成位置信息,然后用一个卷积网络编码整段历史,最后用一个解码器在未来的每一个时间点上查询答案。

先看第一步。模型拿到一段历史数据后,会先做归一化处理,把数值压缩到0到1之间。

归一化(Normalization)*:把不同量纲、不同范围的数值统一缩放到同一个尺度上,方便模型处理,这里用的是每段数据自己的最大值和最小值来做缩放。

接着是频谱探测。模型对去掉均值的历史数据做一次实数快速傅里叶变换,得到一个"频谱图",看看哪些频率的能量特别突出。这里用了一个叫Fisher显著性检验的统计方法,把统计上不显著的峰值过滤掉,只留下真正靠谱的周期候选。它最多保留4个周期槽位,这样一个信号可以同时携带比如"每天一个周期"和"每周一个周期"这两种共存的规律。检验之后没通过的槽位会被置零,这些槽位对应的位置信息也归零,退化成整个上下文的平均值。

这个探测器有个很实在的验证:白噪声(也就是完全没有规律的数据)拿去测试,只有4.7%会被误判成有周期性,跟理论上设定的5%的容错率几乎吻合,说明这个检验没有乱报警。但研究者也诚实地报告了一个局限:如果数据只是自相关(比如今天的值受昨天影响,但并非真正周期性),这个检验很容易被骗,AR(1)自回归系数为0.5的伪造数据里,98.9%都被误判成"有周期"。这提醒我们,这个探测器筛掉的是纯随机噪声,而不是"非周期性"本身。

测出周期之后,第二步是把这些周期数字变成模型能"看懂"的坐标。这里没有用传统Transformer里那种固定的位置编码表,而是让每个检测到的周期生成一对相位特征,也就是这个位置在周期里转到了哪个角度,用正弦和余弦函数表示。同时还加了5个"新近度"通道,标记这个位置离最后一个观测点有多远。

位置编码(Positional Encoding)*:告诉模型序列里每个位置的"坐标"信息,因为卷积和注意力机制本身不知道数据的先后顺序,需要额外告诉它。

这一步的巧妙之处在于,这些相位频率不是固定死的,而是根据这条具体序列检测出来的周期动态设定的。相当于给每条信号量身定做一把尺子,而不是所有信号共用一把标准尺。如果用标准尺硬套所有信号,会发生什么?后面的实验会告诉我们答案。

第三步是编码器,负责把整段2048个时间步的历史数据"消化"成一个内部表示。这里没用时下流行的注意力机制,而是用了一种叫扩张因果卷积的结构。

扩张卷积(Dilated Convolution)*:一种让卷积核"跳着看"数据的技巧,卷积核不是逐点扫描,而是隔几个点采样一次,这样用很少的层数就能覆盖很长的历史窗口。

10层卷积块,每一层的"跳跃步长"翻倍(从1一路翻到512),最终这10层叠加起来的感受野能覆盖2047个时间步,只比整个2048步的窗口少一步,几乎是把整段历史都看了一遍。这里的类比很直接:如果你要巡视一条2000米长的走廊,你可以雇2000个保安每人守1米(这就是注意力机制的做法,两两互相关注,计算量随长度平方增长),或者你可以让保安每隔一段距离站一个岗,但每个岗的视野被望远镜放大好几倍,站得越靠后的保安望远镜倍数越高,这样十几个保安就能把整条走廊都覆盖到,而且巡逻速度是线性增长而不是平方增长的。如果不用这种跳跃式覆盖,硬要用普通卷积从头扫到尾,你要么得堆几百层网络,要么感受野根本不够长,看不到几天甚至几周前的规律。

编码器为了省参数还做了两个精简:卷积部分是"深度可分离"的,也就是每个通道单独处理,减少了参数间的耦合;同时10层里只用了一套共享的前馈网络参数(一种叫ALBERT的参数共享手法),相当于10个员工共用同一本操作手册,而不是每人一本。这两项精简一共省下19万1680个参数,如果不做这个精简,同样的架构会膨胀到33万8185个参数,是现在部署版本的两倍还多。

解码器:三条线索拼出一个查询

第四步,也是整个架构里最有意思的部分:解码器。

解码器一次生成48步的预测,每一步都要吐出9个分位数(10%到90%,每隔10%一个),这样就不是一个孤零零的数字,而是一整条概率分布带。如果要预测更长的未来(论文里测到了720步),就把这48步一组的预测循环拼接起来,每组结束后取中位数喂回去当作下一组的"历史"。

分位数(Quantile)*:把数据从小到大排序后,切在某个百分比位置上的值,比如50%分位数就是中位数,分位数越多,描绘出的不确定性区间就越精细。

解码器给每一个未来时刻组装一个"查询向量",这个向量由三条线索拼成。

第一条是池化摘要,把整段历史的平均状态和最后一个时刻的状态拼在一起,代表整体上下文信息,这条线索对所有未来时刻都是一样的。

第二条是相位分箱(Phase Binning),这是整个架构家族里贡献最大的单项设计。它把历史上所有落在同一个周期相位(也就是"处于周期中同一个阶段")的时间点找出来,取平均,做成一个"周期模板"。比如检测到周期是24小时,就把历史上所有"凌晨3点"的数据点平均起来,做成一个属于"凌晨3点"这个相位槽的模板。未来某个时刻要预测,只需要去查它自己所在的相位槽对应的模板值。这一步的实验证据非常扎实:在架构消融实验里,加上相位分箱能让点预测误差下降0.098,是所有单项改动里效果最大的。

这里的类比可以这样理解:假设你是便利店老板,要预测下周二下午3点的客流量。一种笨办法是把过去一整年每一天都当成独立样本去学规律,另一种聪明办法是,你专门把过去所有"周二下午3点"的历史记录挑出来,算个平均值,直接当作参考。相位分箱做的正是后者,它没有强行让卷积网络自己去"悟"出"每周同一个时间点会重复"这个规律,而是直接把同相位的数据折叠平均,把这个先验知识摆在桌面上。如果不这样折叠,而是让网络自己从原始时间序列里隐式学出周期结构,实验显示效果差了将近十个百分点,这十个百分点不是小数目,相当于每预测10次就多错1次。

第三条线索叫"未来卷积修正"(future-conv),这是专门用来捕捉"预测点附近序列具体怎么变化"的细节,因为前两条线索都是"一视同仁"地看待所有未来位置,没有真正回答"这一步和上一步比会怎么走"。这条线索先算一个"草稿",也就是历史上同相位数值的简单平均,作为免费的种子预测,再和位置编码一起喂进一个6层的因果卷积网络,产出修正量。在组件消融实验里,这条修正线索贡献了0.015的点预测提升,是第二大的单项改进。

三条线索拼好之后,过一层残差连接的SwiGLU前馈网络加RMS归一化,最后一个线性层吐出9个分位数,再反归一化回原始数值范围。

训练怎么做,数据从哪来

TinyCast用了一种叫"计划采样"(Scheduled Sampling)的训练技巧,训练时按四个48步的区块滚动预测,每完成一个区块,就有一定概率(从0慢慢升到50%)把这个区块自己预测出来的中位数喂回去当下一个区块的输入,而不是永远用真实答案喂养。这样训练出来的模型,在真正部署、只能靠自己预测结果续接的场景下,表现会更稳。

损失函数用的是九分位数的"pinball loss"(分位数回归常用的损失),再加了一个作者自己设计的"承诺项",只有当"照抄上一个周期的值"这种偷懒策略反而比模型自己预测得更准的时候才会被激活,逼着模型至少要追上这种简单策略的水平。

训练数据来自GIFT-Eval-Pretrain这个公开语料库,加上Chronos项目发布的KernelSynth合成数据,再加四份自己生成的合成数据分片。这里有一个细节值得单独说:训练前,作者把所有和测试集(GIFT-Eval和Chronos-ZS)重叠的数据集,以及三份网格气象数据都从训练语料里剔除掉了,确保是真正的"零样本"评测,不是变相作弊。

整个训练过程用8块RTX 3090显卡,跑了7.8小时,约62个GPU小时,学习率峰值3乘以10的负3次方,总共训练1亿5千万个样本。最终发布的权重是训练末期8个检查点的平均值。

跑分:14万参数能打赢谁

现在到了最关键的部分:这套设计到底管不管用?

在GIFT-Eval这个横跨97种配置、7个领域、3种预测跨度的权威基准上,TinyCast拿到了0.774的nGMASE(一种相对于"季节性朴素预测"的归一化点误差,数值越小越好,1.0代表和"照抄上一个周期"打平)。

nGMASE和nWQL*:都是相对于"季节性朴素预测"(即简单地重复上一个周期的值)归一化后的误差指标,前者衡量点预测准确度,后者衡量概率预测(分位数)的准确度,数值越小代表表现越好。

| 模型 | 参数量 | nGMASE↓ | nWQL↓ | nMSIS↓ |

|---|---|---|---|---|

| **TinyCast(本文)** | **146K** | 0.774 | 0.545 | 0.554 |

| Reverso-Nano | 200K | 0.760 | (0.661) | (2.035) |

| Reverso-Small | 550K | 0.726 | (0.626) | (1.945) |

| TTM-R3 | 1.4M | 0.724 | 0.520 | 0.501 |

| Reverso | 2.6M | **0.711** | (0.610) | (1.905) |

| Toto-2.0-4m | 4.1M | 0.757 | 0.524 | **0.455** |

| YingLong-6m | 7.3M | 0.880 | 0.609 | 0.534 |

| FlowState-9.1M | 9.1M | 0.726 | **0.502** | 0.563 |

| Kairos-10m | 9.9M | 0.753 | 0.554 | 0.776 |

| AutoARIMA | 0 | 1.074 | 0.912 | 0.948 |

| FLAIR | 0 | 0.838 | 0.587 | 0.538 |

(括号内数值代表该模型不输出概率分布,只是单一预测值的误差,仅供参考比较,不是同一性质的指标)

表格里最值得琢磨的一行,是TinyCast和Reverso-Nano的对比。Reverso-Nano有20万参数,比TinyCast多了3万5千多,点预测误差是0.760,比TinyCast的0.774略好一点点。但Reverso-Nano不输出概率分布,只吐一个数字。而在nWQL这一列,也就是概率预测的准确度上,所有比TinyCast表现更好的模型,参数量全都在140万以上,是TinyCast的至少10倍。

这就是论文标题里"probabilistic"(概率性)这个词的分量所在。点预测这条赛道上,比TinyCast小的模型确实存在(Reverso-Nano),但一旦要求模型必须同时给出不确定性区间,14万参数这个体量下就再没有对手了。

再看另一组数据。在Chronos-ZS这个27个数据集的测试集上,TinyCast的相对MASE是0.880,相对WQL是0.722,跑赢了所有不需要训练数据的统计学方法。有意思的是,在这个测试集上,AutoARIMA和AutoTheta这两个纯统计方法在点预测上反而领先了TinyCast一到两个百分点,这是全文三个基准测试里唯一一处统计方法在点或概率准确度上赢过TinyCast的地方。原因也很直白:Chronos-ZS里14个任务的季节周期只有4步或更短,10个任务干脆没有季节性,这种场景下相位折叠这套武器基本无用武之地,直接外推趋势反而更管用。

在fev-bench这个覆盖100个任务的基准上,TinyCast相对MASE是0.819,相对WQL是0.658,跑赢了所有统计学基线,而且每一个跑分比它好的发布模型,参数量都是它的28到62倍。

消融实验:拆开看每个部件到底值多少钱

论文做了大量控制实验,来确认到底是哪个设计在起作用。这部分很实诚,连失败的尝试都写进去了。

架构家族的实验里,把14万6千505参数的完整模型,重新训练一遍但关掉频谱探测器(读数被强制置零,但相位读出层的16448个参数继续保留、不重新分配),结果nGMASE从0.7743涨到0.7814,涨了0.0071;nWQL从0.5441涨到0.5483,涨了0.0042。这个差距大约是三次独立种子训练之间正常波动的8倍(点预测)和2倍(概率预测)左右。换句话说,这套探测器确实带来了实打实的提升,而不是噪声误差。

更有意思的是接下来的三个"替换实验"。研究者想搞清楚:探测器带来的好处,到底是因为它"选对了正确的周期",还是仅仅因为它"提供了某种周期形状的输入"?于是设计了三个对照:一是给所有序列都套用一套固定不变、和具体数据无关的周期集合;二是把探测器算出来的周期结果,故意打乱后套用到错误的序列上;三是完全屏蔽输出(相当于前面说的对照组)。

结果是,固定周期集合的表现,比完全不提供周期信息还要差;打乱后错配的周期,恢复了探测器价值的九成,但依然比不提供任何信息略差。这说明周期性探测最核心的价值,不在于"提供了一堆看起来像周期的数字",而在于这个周期确实是从这条具体序列本身测量出来的、和它相配的信息。硬塞一个序列根本不具备的周期进去,是一种主动伤害,比什么都不给还糟糕。这就好比给一个南方沿海城市的居民发一份"东北冬季供暖时间表",这份表看起来内容详实、格式规范,但因为压根不对应这个居民的真实生活场景,反而会造成困扰,不如干脆什么都不给,让他自己判断。

参数量的分配也做了对照实验。给相位分箱这个模块多加33K参数做成一个"新近度门控",收益是把nGMASE再压低0.0156。也就是说,这是目前测出来第二有效的参数投入方式,但每个参数的效率大概只有相位分箱的十分之一。这也从侧面印证了,相位分箱这个设计不是靠"参数多"取胜的,而是靠"选对了该学什么"取胜的。

减小到最终部署体积这一步也做了验证:把一个44万5513参数的中间版本,砍掉近一半降到22万5865参数(去掉前馈网络的扩展倍数、绑定前馈层、去掉新近度分箱和门控),配对比较下来点预测和概率预测都没有明显变差,区间预测质量反而变好了。这说明这次"瘦身"几乎是免费的,之前那些参数其实是冗余的。

上芯片:从论文到真实的一块开发板

TinyCast最打动人的地方,或许不是跑分,而是它真的能塞进一块几十块钱的开发板里跑起来。

整个混合运算路径(也就是学习出来的那部分)只用到了卷积、矩阵乘法、归一化和逐元素门控这四种运算,没有一个是Softmax注意力那种全局混合操作。这意味着它可以直接导出成静态INT8整数格式。

INT8量化(INT8 Quantization)*:把模型原本用32位浮点数表示的权重和计算,压缩成8位整数来表示和运算,这样能大幅减少存储体积和计算功耗,代价是精度会有损失。

为什么这件事重要?因为像Softmax注意力这种机制,计算量会随序列长度平方增长,而且包含非线性的归一化操作,很难精确映射到整数运算上;状态空间模型(比如Mamba那类结构)虽然内存占用是常数级的,但需要一种专门的"扫描"计算核,普通嵌入式运行时根本没有现成实现,而且容易出现异常值通道,让训练后量化变得棘手。TinyCast选择的扩张卷积恰好是四种主流的注意力替代方案里唯一同时满足"内存有界"和"完全由整数运行时自带的运算构成"这两个条件的。

研究者把这套模型部署到了一块STM32H753开发板上,芯片是Arm Cortex-M7内核,主频480MHz,没有神经网络加速器,也没有片外内存。整个INT8权重文件只有138.1KiB,一次完整预测(重新编码整个2048步历史,再解码48步)耗时4.08秒,估算每次预测消耗1.5到2焦耳的电能,一瓦时的存储电量大概能支撑两千次预测。

这个数字放在生活场景里怎么理解?一节5号电池的能量大约是9千焦耳,按这个耗电估算,够这块板子跑大约4500到6000次完整预测。如果换成一台需要联网、需要云端算力支持的大模型来做同样的预测,光是网络往返的延迟和服务器电费,成本就完全不是一个量级了。

而且这套代码经过了严格的跨硬件一致性验证:同一套权重在三种不同的整数矩阵乘法后端(CMSIS-NN官方库、手写SMLAD汇编指令、纯量标量循环)上跑,输出结果完全一致,三次重复启动结果也完全一致。在32个测试样本上,板子和电脑主机的输出有55.4%是逐字节完全相同的,其余的误差集中在个别接近INT8量化边界的数值上,属于离散舍入误差,不是系统性偏移。

这套设计还有哪些没解决的问题

论文没有回避自己的局限,这点值得称赞。

第一个明显的短板是,每次预测都要重新编码整个2048步的历史窗口,即便只是往前推进了一步,也要把过去的活儿重新干一遍。研究者尝试过一种逐步流式处理的变体,理论上能省下大量重复计算,但在缩小预算的消融实验里,这个变体在短历史场景下反而丢了准确度,所以最终没有采用。

第二,模型是单变量的,不认协变量(也就是额外的辅助输入信息),也不利用多变量之间的关联结构。fev-bench里46个任务提供协变量、35个任务是多变量的,TinyCast统统没法利用这些额外信息,这天然是一种劣势,但即便在只保留单变量、无协变量任务的子集上单独比较,TinyCast和专门为跨变量建模设计的CITRAS-FM之间的差距反而更大而不是更小,这说明差距的根源可能不完全在于"没用上"这些额外信息。

第三,覆盖率的问题。九个分位数意味着最宽的置信区间只能到80%,如果你需要95%或99%这种更极端的报警阈值,这套模型直接给不了。而且经过实测,模型整体偏"自信"了一点,名义上80%的区间实际只覆盖了68%的真实值,长期预测的覆盖偏差更大,这说明区块自回归的解码方式,没有让不确定性随着预测跨度增长而合理扩大。

这篇论文站在了谁的肩膀上,又指向了哪里

TinyCast的思路并不是凭空出现的。论文里能看出至少两条清晰的传承线索。

一条是"测量周期而不是学习周期"这条线。早在2023年,SparseTSF这篇工作就已经证明,只用不到一千个参数、配合一个人工指定的周期长度做下采样,也能做长期预测。同年的FITS更进一步,用大约一万个参数在复数频域里做插值,明确把边缘设备部署当成目标场景。这两篇工作都验证了"按相位索引重组数据"这个思路在极小参数量下是划算的,但它们有一个共同的限制:周期长度需要人为指定,而且模型是针对它要预测的那条具体序列训练的,不是零样本的。

TinyCast往前推进的地方在于,它把"周期长度"这个原本要人工填的超参数,变成了模型自己从数据里实时算出来的东西,这才让它有资格叫"零样本"。同一时期发布的FlowState走的是类似的思路,但FlowState依赖数据集元数据里记录的采样周期来缩放它的状态空间编码器,TinyCast则完全从原始信号里现场检测,这意味着面对一个完全没有任何元数据标注的陌生信号,TinyCast依然能工作,FlowState则做不到。

另一条线索是"参数越小越好"这场军备竞赛。Reverso这个系列,把长卷积和一种叫DeltaNet的线性循环层交织在一起,训练出200K到2.6M三个不同尺寸的版本,其中2.6M的版本能匹配甚至打赢比它大一到三个数量级的模型,是这场"缩小竞赛"里TinyCast最直接的对标对象和最近的邻居。TinyCast把体积进一步压到146K,同时守住了输出概率分布这条底线,这是Reverso家族里体积最小的Reverso-Nano都没能做到的事情。

再往外扩展一层,2026年发布的Toto 2.0、FlowState、Kairos等一系列千万参数量级以下的模型,走的路径是"让学习出来的计算更高效",比如动态分片、交错块注意力、跨变量建模模块。TinyCast走的是另一条路,"把活儿从学习计算里挪出去",让固定的数学公式去干那些不需要智能、只需要算力的事情。这两条路径未必互斥,未来完全可能出现把两者结合起来的工作,既做高效的可学习计算,又把可测量的结构提前算好。

Q&A

Q1:TinyCast是什么?

A:TinyCast是一个只有14万6千505个参数的时间序列预测模型,它的核心特点是用一个不需要训练、零参数的频谱探测器直接算出数据的周期规律,再把学习到的参数集中用在其他更复杂的结构上,是目前已知能同时做到"体积极小"和"输出概率预测分布"的零样本预测模型。

Q2:TinyCast能在什么设备上运行?

A:TinyCast已经被部署到了一块STM32H753开发板上,这是一块基于Arm Cortex-M7内核、主频480MHz、没有神经网络加速器和片外内存的普通嵌入式芯片,模型以INT8整数格式运行,整个权重文件只有138.1KiB,单次完整预测耗时约4.08秒。

Q3:TinyCast和其他小模型相比表现怎么样?

A:在GIFT-Eval基准测试上,TinyCast的参数量小于所有能确认参数规模的同类零样本模型,在概率预测准确度上,所有比它表现更好的模型参数量都至少是它的10倍以上,在Chronos-ZS和fev-bench基准上,跑赢它的神经网络模型参数量都至少是它的28倍。

作者声明:作品含AI生成内容
举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询