Synthetic Series-Symbol Data Generation for Time Series Foundation Models (NeurIPS 2025)
近年来,时间序列分析 (TSA) 的基础模型受到了广泛关注。然而,相比于计算机视觉和自然语言处理领域,时间序列分析中训练数据稀缺和分布不平衡等挑战持续阻碍着其发展。受复杂动态系统理论的启发,我们提出了一种序列(Series)-符号(Symbol)双模态数据生成机制,能够无限制地生成高质量时间序列数据及其对应的符号表达式。为了充分利用具有强相关性的序列-符号合成数据对,我们基于掩码建模和对比学习构建了一种预训练基础模型SymTime。该模型经过下游任务的微调后,在五个主要的 TSA 任务中展现出极具竞争力的性能,可与基于真实数据集预训练的基础模型相媲美。该方法凸显了序列-符号数据生成和预训练机制在克服数据稀缺和提升任务性能方面的潜力。
paper: https://arxiv.org/abs/2510.08445
code: https://github.com/wwhenxuan/SymTime