0. 这份讲义的定位:教"怎么选模型",而不是教模型本身
这份 2026 年 9 月 6 日的培训讲义(数学与统计学院,张冠东老师)面向研究生数学建模竞赛,开篇就给出了非常清醒的目标:帮助学生建立"数据模态 → 归纳偏置 → 模型选择"的条件反射,避免在比赛中盲目套用模型。
所谓"数据模态",指的是你的赛题数据长什么样:是随时间变化的序列?是无序的表格?还是带有网络拓扑、随时间演化的时空数据?所谓"归纳偏置"(inductive bias),是模型架构里"预先写死的关于数据规律的假设"——比如卷积网络假设"相邻像素相关",循环网络假设"时间上有先后依赖"。数据模态与模型偏置匹配,模型才学得快、泛化得好;选错了,不仅精度差,还会被评委质疑"缺乏对问题本质的理解"。
讲义还强调两个竞赛现实:
- 论文的逻辑闭环比模型复杂度更重要——评分关键在于"为什么选这个模型"的叙事是否自洽,每一类模型都有自己独特的"故事线"。
- 规避算力陷阱——比赛只有 3~4 天,团队算力多为消费级显卡,所以选出来的代表模型都有"轻量、开源、收敛快"的共性。
讲义将模型分为三大类(时间序列预测、表格数据、时空网络),共讲了 4 个代表模型。下面逐个精读。
1. 总览:三类数据模态 × 四个代表模型
| 数据模态 | 赛题特征 | 代表模型 | 一句话卖点 |
|---|---|---|---|
| 多变量时间序列 | 多传感器同步监测(温度/湿度/电压等),序列很长 | CIBG-Mamba-IRM | 通道独立 + 双向门控 Mamba,线性复杂度不丢细节 |
| 时间序列(有分布漂移) | 经济/气象/交通流,规律随时间变 | ShifTS | 先治时间偏移(RevIN)再治概念漂移(SAM)的通用插件框架 |
| 表格数据 | 列无序、类型混杂(数值+类别),要可解释 | FusANet | 全局+局部双重注意力,能打树模型还能自解释 |
| 时空网络数据 | 图拓扑 + 时间演化 + 物理约束(电网/交通/物流) | ST-GNN(GRNN-FR) | 图注意力动态适配拓扑,可行性恢复层保证输出合规 |
记忆方法:先问"我的数据是什么模态",再从对应行里挑模型——这正是讲义说的"条件反射"。
2. 时间序列预测模型一:CIBG-Mamba-IRM
论文:《Channel Independence Bidirectional Gated Mamba With Interactive Recurrent Mechanism for Time Series Forecasting》(IEEE)。
2.1 它要解决的痛点
多变量时间序列(MTS)预测里,两大主流各有致命伤:
- Transformer 类:自注意力的计算复杂度是序列长度的平方。遇到长序列(比如数月的分钟级数据)显存爆炸,还容易丢失局部的细粒度波动。
- 基础 Mamba 模型:线性复杂度、擅长抓全局趋势(这是 Mamba 作为状态空间模型的优势),但面对多变量时往往"一锅炖"——把所有通道直接混在一起输入,导致跨通道特征融合不足、局部微小波动被忽略。
2.2 三个核心模块(创新点)
- CIE(Channel Independence Embedding,通道独立嵌入):不把所有变量混在一起,而是每个变量(通道)独立分块、独立嵌入。这是对"一锅炖"的直接回应。
- CIBG-Mamba(通道独立双向门控 Mamba):把传统 GRU(门控循环单元)里的线性层替换成 Mamba 模块,保留更新门(Update Gate)、重置门(Reset Gate)、候选激活(Candidate Activation)的 GRU 结构,并且从前向后、从后向前双向扫描——兼顾过去信息和未来上下文。
- IRM(Interactive Recurrent Mechanism,交互式循环机制):在双向扫描过程中,把"前向隐藏状态"与"后向隐藏状态"交叉融合,并使用特定通道的自适应状态转移函数——每个通道有自己的动态,不被平均化。
2.3 论文叙事的"三个优势"
- 预测精度较高;
- 对"不规则/脏数据"有极强的鲁棒性;
- 极致的轻量化。
竞赛中的用法:当赛题给的是多传感器、多指标的长序列(如电网负荷、环境监测)时,它是兼顾精度和算力的好选择。论文地址见讲义原文(IEEE 11077763)。
3. 时间序列预测模型二:ShifTS 框架
论文:《Tackling Time-Series Forecasting Generalization via Mitigating Concept Drift》(ICLR 2026)。
3.1 痛点:模型在测试集上失效的两大元凶
现实数据(经济指标、气象、交通流)是动态变化的,训练集上学到的规律到测试集就失灵。讲义把"分布偏移"拆成两种:
- Temporal Shift(时间偏移/非平稳性):数据的边缘分布 P(Y) 随时间变(均值、方差漂移),但变量间的条件关系 P(Y|X) 不变。好比仪器的零点漂了,但物理规律没变。
- Concept Drift(概念漂移):外生变量 X 与目标 Y 之间的条件分布 P(Y|X) 本身随时间改变——"历史规律在未来失效了",典型例子是疫情前后消费习惯的改变。这个问题在时间序列里被严重忽视,而且传统的概念漂移方法(如不变风险最小化 IRM)需要"环境标签"——在时间序列中我们根本不知道哪个时间段属于哪个"环境"。
3.2 核心思想:先治 Temporal Shift,再治 Concept Drift
ShifTS 的流程四步走:
- Normalization:用 RevIN(Reversible Instance Normalization,可逆实例归一化)在输入前归一化,消除均值/方差漂移(治时间偏移);
- Forecast Surrogate Features:用 SAM(Soft Attention Masking,软注意力掩码) 提取"不变模式"(治概念漂移)——关键洞察是:仅用历史窗口 X_L 预测未来 Y_H 不够,未来窗口 X_H 中可能隐藏着与目标 Y_H 有稳定因果关系的"不变模式",SAM 把它们软性筛出来;
- Aggregation:用提取的不变特征预测目标;
- Denormalization:RevIN 反归一化,恢复真实量纲。
3.3 三个优势与竞赛叙事
- 模型无关性(Model-Agnostic):ShifTS 不是具体预测模型,而是插件框架,可无缝接入 PatchTST、iTransformer、Crossformer 等 SOTA 模型并稳定提升精度;
- 碾压现有分布偏移方法:8 个评估指标中 6 个第一,全面超越针对概念漂移的 IRM、GroupDRO 和针对时间序列偏移的 FOIL;
- 提升幅度与互信息正相关:外生变量未来窗口 X_H 与目标 Y_H 之间的互信息 I(X_H; Y_H) 越大,ShifTS 增益越大——意味着"外部环境确实在动态影响目标"的数据最适合用它。
竞赛中的用法:套在任何基础预测模型外面都行,尤其当赛题背景里发生了"结构性事件"(政策变化、疫情、技术换代)时,这是论文里非常好的创新点叙事。
4. 表格数据模型:FusANet
论文:《Fusing global attention and self-attention for better performance and interpretability on tabular data》(Expert Systems with Applications)。
4.1 痛点:深度学习在表格数据上的两道坎
- 打不过树模型:与图像(空间局部性)、文本(严格顺序)不同,表格数据的列是无序的(交换列顺序不影响结果)、类型混杂(连续数值+离散类别)。Transformer 的位置编码在表格里毫无意义,直接套用会失效。传统强手 XGBoost 等树模型长期霸榜。
- 黑盒问题:现有深度表格模型(如 FT-Transformer)虽然性能提升,但缺乏可解释性,且难以同时捕捉"全局统计规律"和"局部样本特异性"。
4.2 三个核心模块
- 置换等变的特征嵌入(Permutation-Equivariant Embedding):彻底抛弃位置编码——数值特征用线性投影,类别特征用独立 Embedding 查表。列怎么排都不影响结果,这才是表格数据的正确偏置。
- 全局与局部双重注意力(Dual Attention):
- 全局注意力:学习一个整个数据集共享的注意力矩阵,捕捉特征间普遍的统计相关性(例:全局数据中"收入"与"教育程度"总是强相关);
- 局部注意力:标准自注意力,针对每一个具体样本捕捉特有交互(例:某个特定样本里"年龄×病史"的交互比全局规律更重要)。
- 交叉注意力融合(Cross-Attention Fusion):局部注意力输出作为 Query,全局注意力输出作为 Key 和 Value,交叉融合——让每个样本"带着自己的特异性去查询全局规律"。
4.3 三个优势与竞赛叙事
- 预测精度较高;
- 极强的双重可解释性:全局注意力权重 → 数据集级别解释(哪些特征整体最重要);局部注意力权重 → 样本级解释(对这个预测结果,哪些特征起了决定作用)。可解释性正是数模论文最缺的加分项;
- 无需预训练、端到端:相比需要复杂预训练的表格基础模型,FusANet 完全参数化、直接训练、实现轻量。
竞赛中的用法:赛题给的是问卷数据、评价体系、统计报表这类表格时,优先考虑它——既能和 XGBoost 掰手腕,又能直接从注意力权重里"读出"指标重要性,写进论文 sensitivity 分析一节。
5. 时空网络模型:ST-GNN(GRNN-FR)
论文:《Spatio-Temporal Graph Neural Networks for Multi-Period Optimal Power Flow》(IEEE)。
5.1 痛点:"图拓扑 + 时间演化 + 物理约束"三重夹击
以多周期最优潮流(电网调度)为例,问题必须同时满足:
- 空间约束:电网物理拓扑与潮流方程(基尔霍夫定律:节点注入功率 = 流出功率);
- 时间约束:发电机爬坡限制(不能瞬间改变发电量)、储能充放电连续性。
现有方法的缺陷:
- 传统优化求解器:精度极高,但计算时间随网络规模指数级增长,无法实时调度;
- 纯数据驱动模型:FNN/RNN 忽略电网空间拓扑;传统 GCN 只能处理单周期静态问题,捕捉不了时间耦合;而且纯深度学习是黑盒,预测结果可能违反物理定律(比如预测发电量总和与需求不匹配,功率不平衡)——工程上绝对不可接受。
5.2 两组创新点
(1)时空特征联合提取:
- 空间维度:不用固定邻接矩阵,而是用图注意力(Graph Attention)动态计算节点间权重——某条输电线路突然断开(拓扑变化),模型能自动适应;
- 时间维度:引入类 RNN 的隐藏状态传递机制,把上一时刻的电网状态作为输入,捕捉爬坡约束等时间耦合;
- 参数共享:参数量不随电网规模和时间跨度增加——极强的可扩展性。
(2)可行性恢复层(FRL,Feasibility Restoration Layer):
神经网络输出的解可能违反物理约束。FRL 引入可微优化层:在训练和推理时求解一个二次规划(QP)问题,像一个"物理修正器"——在距离神经网络预测值最近的解里,找 100% 满足物理定律的可行解。这保证了模型输出在工程上的绝对安全。
5.3 三个优势与竞赛叙事
- 计算速度快(对比传统求解器的指数爆炸);
- 精度高、最优性间隙极低:预测误差(MAE)比基线降低 50%,与全局最优解的差距(Optimality Gap)仅 0.2%~0.5%;
- 对拓扑突变强鲁棒:模拟"N-1 线路故障"(随机断开一条关键输电线)时,传统 FNN/RNN 误差飙升 5%~6%,GRNN 靠图注意力误差仅增加 0.1%。
竞赛中的用法:这套"图注意力抓空间 + 循环抓时间 + 可微优化层兜底物理约束"的范式,可直接迁移到能源调度、交通网络流分配、供应链物流、传染病时空传播等赛题——凡是有"网络结构 + 演化 + 约束"三件套的题目。
6. 建模竞赛心得:从这份讲义提炼的方法论
- 先分类数据模态,再选模型。拿到赛题第一件事:数据是序列?表格?还是图上的时空数据?然后到对应家族里挑轻量代表,而不是上来就无脑上 LSTM/XGBoost。
- 模型选型的理由要写成论文叙事。讲义反复强调"逻辑闭环":每个模型都有痛点—机制—优势的完整故事线。评委会问"为什么不用 XX",你的架构里每个模块都应该是针对某个痛点的回应。
- 算力预算内做选择。3~4 天赛程 + 消费级显卡,Transformer 级别的平方复杂度要谨慎,Mamba 线性复杂度、插件框架、端到端轻量模型是安全选项。
- 物理约束问题要加"保险层"。凡是题目有硬约束(守恒律、容量限制、非负性),纯数据驱动输出一定会翻车——FRL 的"可微优化层修正"思路值得借鉴:预测之后接一个小型优化问题,把输出拉回可行域。
- 可解释性是分数。FusANet 的双重注意力直接给出数据集级和样本级解释——把注意力权重画成热力图/条形图放进论文,比堆模型复杂度更能打动评委。
7. 小结
这份讲义的精华不在模型细节,而在"数据模态 → 归纳偏置 → 模型选择"这条决策链:多变量长序列 → 通道独立 + 线性复杂度(CIBG-Mamba-IRM);分布漂移严重 → 先归一化再提不变模式的插件框架(ShifTS);无序表格 + 要解释 → 全局/局部双重注意力(FusANet);网络拓扑 + 物理约束 → 图注意力 + 可行性恢复层(GRNN-FR)。把这四条故事线记住,赛场上就能快速锁定候选模型,把省下的时间花在论文叙事和验证上。