这一篇在干嘛?

番茄植株里 α-淀粉酶、过氧化物酶和苯丙氨酸解氨酶的活性,传统化学法全都要破坏取样才能测。这篇论文改用 370~1715 nm 的高光谱反射光谱来间接反推酶活性:先剔除噪声波段并做标准化等预处理,再用遗传算法(GA)从高维光谱里挑出 1460~1574 nm 等有效波段,交给 PLS 等四种回归算法建模。其中 GA-PLS 表现最佳,叶片近红外模型在 21 株独立验证集上拿到平均决定系数 0.815、RMSEP 1.659。最终结论是:叶片优于茎秆、近红外优于可见光,GA-PLS 是最可靠的无损检测方案。

1 引言:为什么要”看光谱”就知道酶活性

番茄是全球重要的蔬菜作物,富含抗氧化物质、维生素和矿物质。决定番茄植株品质与产量的因素很多,其中植株体内特定酶的含量是一个关键内因——酶含量直接反映植株的生理与代谢状态,与生长发育、抗逆、抗病和抗氧化能力密切相关。本文关注对番茄生长响应最灵敏的三种酶:

  • α-淀粉酶(α-AMS):淀粉代谢的关键酶,把淀粉分解为可溶性糖,影响果实的甜度与口感;
  • 过氧化物酶(POD):植物抗氧化防御体系的重要成员,催化过氧化氢分解为水和氧,清除活性氧自由基,保护细胞膜和细胞器免受氧化损伤;
  • 苯丙氨酸解氨酶(PAL):苯丙氨酸代谢通路的关键酶,催化苯丙氨酸转化为肉桂酸,促进花青素等次生代谢物的合成。

要检测酶活性,传统做法是”化学法”:先把植株破坏、取样,再用各种手段测定。常见方法各有优劣:分光光度法灵敏度高,但只适合吸光度在 0.05~1.0 之间的稀溶液,且对温度敏感;化学比色法定量准确,但步骤繁琐、需要专门试剂设备;酶动力学法信息丰富,但对温度、pH 等实验条件要求苛刻;免疫法特异性好、可用于复杂样品,但需要特异抗体、成本高;比色法操作简单,却容易被样品本色干扰、精度有限。最要命的一点是:它们全都要求破坏样品。你不可能为了测一次酶活就把田里的番茄拔了。

光谱分析技术提供了一条出路。它的逻辑链条是这样的:酶作为催化剂,调控番茄体内的生化反应;生化反应改变了糖类、有机酸、色素等化学成分的含量与比例;而这些成分在特定波长下有各自特征的光吸收与反射特性。于是,“酶活性变化 → 化学成分变化 → 反射光谱变化”,通过测光谱就能间接反推酶活性——植株完好无损。

当然,间接推断必须有一个”金标准”来校准。本研究用经典化学法(双抗体夹心法)测得的酶活作为基准:用特异性抗体包被微孔板,结合样品中的酶和辣根过氧化物酶(HRP)标记抗体,形成”抗体—抗原—酶标抗体”复合物;再加入 TMB(3,3’,5,5’-四甲基联苯胺)显色底物,HRP 催化其生成黄色产物,颜色深浅与酶含量正相关;在 450 nm 处测吸光度,按 Beer–Lambert 定律从标准曲线算出酶活浓度。三种酶各自催化特异性反应、生成可检测的产物:POD 催化过氧化氢氧化愈创木酚(邻甲氧基苯酚),生成在 470 nm 处有最大吸收的红棕色产物;α-AMS 催化淀粉分解产生还原糖,还原糖经 TMB/HRP 反应,在酸性条件下转变为 450 nm 处有最大吸收的黄色产物;PAL 催化苯丙氨酸脱羧生成反式肉桂酸,同样经由 TMB/HRP 显色体系测定。

还有一个实际问题:便携式光谱仪难以在田间完美采集所需数据,实验中需要把植株挖出后采谱;但植株一旦离开原生长环境,酶活性就会变化。解决办法是液氮冷冻——把植株放入真空袋液氮速冻,锁住离体瞬间的酶活状态,保证测到的酶活与生长在土地中的植株一致。挖出与冷冻只发生在建模前的数据采集阶段,最终提出的检测方法本身仍是无损的。

综上,本文的思路是:采集 370~1715 nm 的番茄叶片与茎的可见—近红外反射光谱,先预处理提高数据质量,再用光谱选择算法从高维数据中提取有效波段,最后与回归算法结合建立预测模型。其中最核心的组合是遗传算法(GA)与偏最小二乘回归(PLS),即 GA-PLS 模型。同类研究中,GA 与逐投影算法(SPA)是光谱选择里最常用、最有效的两种;本文对比后发现 GA 在番茄反射光谱的选择上更优,选出的波段集中在 1460~1574 nm。为了验证 GA-PLS 是不是最优方案,作者还用 GA 选出的光谱配合另外三种算法——支持向量机(SVM)、粒子群优化—反向传播神经网络(PSO-BP)和随机森林(RF)——建立了三个对比模型。

2 材料与方法

2.1 高光谱成像系统

高光谱成像不同于普通拍照:普通照片每个像素只记录红绿蓝三个通道,而高光谱图像在数百个连续波长上各记录一层,等于给每个像素都留下一条完整的光谱曲线。本研究的成像系统由四部分组成:

  1. 底部水平支撑板:连接步进电机(Leashine,20CM003,100 r/min),可水平移动,带动样品逐行扫描;
  2. 相机支架:固定相机并调节其垂直位置,镜头与平台间距保持 50 cm;
  3. 两台高光谱相机:Specim FX10-CHINA 与 Specim FX17-CHINA,覆盖可见—近红外范围;
  4. 双照明系统:提供稳定光源。


图 1 高光谱成像系统示意图

原始图像必须先做黑白参考校正。原因很直观:相机的每个探测器单元都有自己的响应偏差,光源亮度也随波长起伏,如果直接用原始读数,光谱里混着”仪器与光源的指纹”而非样品本身的信息。校正方法是把样品分别与标准白色参考板、标准黑色参考(盖镜头盖)的读数比较,按下式折算成相对反射率——100 表示与白板反射率相同,0 表示与黑参考相同:

其中 是番茄高光谱图像的反射光强, 是标准黑背景上的反射光强, 是标准白背景上的反射光强。这样得到的 才是真正反映样品特性的相对反射率。

2.2 分光光度计与总体实验流程

化学测定部分使用 UV3600 型 UV-Vis-NIR 双光束分光光度计(OPTOSKY,中国)测量 450 nm 处的吸光度。

整体流程可以概括为一条主线:用波长范围 370~1715 nm、光谱分辨率 1 nm 的高光谱系统采集番茄植株的反射光谱;在相同处理条件下,于 1~8 周的不同生长阶段采集叶片和茎样品;同时用传统化学法测定 α-AMS、POD、PAL 三种酶的含量;再用多种建模技术建立基于高光谱的酶含量预测模型,比较预测精度,选出较优的检测模型。


图 2 研究流程图

2.3 酶浓度的金标准检测

化学法测得的酶活性在本文中作为金标准。具体做法是:通过线性回归方程先算出样品中酶的浓度,再乘以稀释倍数得到实际浓度。三种酶的活性单位(U)定义如下:

三个式子的含义相同:每分钟、每克鲜重(FW)样品在 470 nm(POD)或 450 nm(α-AMS、PAL)处吸光度的变化量,就是该酶的一个活性单位。

化学测定结果(全部样本)的描述统计如下表:

统计量POD (mU/g)PAL (U/g)AMS (U/g)
平均值5.1087.34735.845
标准误0.0730.0600.440
标准差0.5140.7215.215
方差0.2650.52027.20
最小值3.816.1225.8
最大值6.219.0144.37

即样本中三种酶的平均活性分别约为 5.108 mU/g、7.347 U/g 和 35.845 U/g,其中 α-AMS 的含量波动最大(方差 27.20),这对后续建模来说意味着更大的动态范围。

2.4 光谱选择与四种预测模型

为什么要做光谱选择? 高光谱数据有数百个波长变量,其中大量波段信息重复(冗余)或只是噪声。直接拿全部波段建模,模型又慢又不稳定。光谱选择就是从高维数据中提取有效波长变量,剔除冗余与噪声,从而提高模型的精度和稳定性。好处有四:一是可以聚焦特定光谱区域,更准确地识别和定量样品中的成分;二是针对特定成分挑选谱线能提高检测灵敏度;三是选择性好,可减少性质相近的其他成分的光谱干扰;四是快速锁定感兴趣区域,加快分析速度。

本研究用了两种选择算法并加以对比:

  • 遗传算法(GA):模拟生物进化中的自然选择与遗传机制——把每个波长变量看作一个”基因”,一个波长子集看作一条”染色体”,以预测误差作为适应度函数,通过种群的交叉、变异和选择操作不断逼近最优波长组合。它的强项是全局搜索能力,能处理非线性、多峰、离散的优化问题,可有效避免陷入局部最优,泛化能力好,也扛得住大规模数据集。
  • 逐投影算法(SPA):一种前向变量选择方法,通过逐步投影、以变量间协方差最小为准则来挑选波长,构建”冗余最小、与目标变量相关性最大”的波长子集。计算效率高、实现简单,特别适合高度共线性的光谱数据。

两种算法都与 PLS 结合建立预测模型,用统一的标准建模:

其中 是目标变量,即酶活性的预测值; 是自变量,即(光谱/化学)测量数据; 是由 PLS 算法求出的回归系数; 是误差项,代表预测值与真实值之差。

PLS(偏最小二乘) 是整个建模流程的核心回归器。它是一种多变量统计方法,一个算法同时完成三件事:回归建模(多元线性回归)、数据结构简化(类似主成分分析)和两组变量间的相关分析(典型相关分析)。其做法是把自变量和因变量的高维数据空间分别投影到相应的低维空间,得到各自相互正交的特征向量,再在特征向量之间建立单向线性回归关系。这样既克服了光谱波段之间严重的共线性问题,又在挑选特征向量时强调自变量对因变量的解释和预测作用、剔除了无用噪声的影响,使模型包含的变量数最少。

在 GA 选出最佳波长子集之后,作者又用三种机器学习算法与 GA 组合,与 GA-PLS 同台竞技:

  • SVM(支持向量机):监督学习模型,基本思想是寻找一个最优超平面(或超曲面),使不同类别数据点之间的间隔最大化(最大间隔超平面),从而实现良好的分类与回归。
  • PSO-BP 神经网络:把粒子群优化(PSO)与 BP 神经网络结合。BP 网络本身做非线性拟合容易陷入局部最优且收敛慢,PSO 模拟鸟群觅食行为进行全局搜索,用它来优化 BP 网络的权重和阈值,可提升网络性能与收敛速度。
  • RF(随机森林):集成学习方法,训练时构建多棵决策树,输出类别投票(分类)或平均预测(回归),学习策略是间隔最大化,可形式化为求解凸二次规划,等价于最小化正则化的合页损失函数。

模型好坏怎么评?用两个指标:三种酶的平均决定系数 衡量模型对数据的拟合程度(越大越好),三种酶的平均均方根误差 RMSEP 衡量预测误差(越小越好)。比较流程是先在 GA 与 SPA 之间分出胜负,再把胜者的光谱分别输入 PLS、SVM、PSO-BP、RF 四种算法,观察预测结果——这就形成了”光谱预处理 → GA 选波段 → PLS 等四种模型 → 指标对比择优”的完整建模链条。

3 结果

3.1 番茄叶片与茎的高光谱图像数据提取

研究对象是番茄植株的叶片和茎。用高光谱成像系统对植株成像后,可以清晰区分不同颜色与形状的叶和茎。以近红外(NIR)波段与可见光(VIS)波段的照片对比为例:同一株植株在两个波段下呈现的面貌差异明显,这正是不同波段携带不同生化信息的表现。


图 3(a) 近红外波段下的番茄植株照片


图 3(b) 可见光波段下的番茄植株照片

为了分析光谱信息,用 ENVI 软件处理图像:对所有叶片(或茎)上每个点的光谱在不同波长范围内取平均,得到平均光谱曲线。横轴是波长,纵轴是探测器接收到的光强。


图 4(a) 近红外波段番茄茎的反射光谱


图 4(b) 近红外波段番茄叶的反射光谱


图 5(a) 可见光波段番茄茎的反射光谱


图 5(b) 可见光波段番茄叶的反射光谱

对比这些曲线可以发现:茎和叶的光谱曲线走势相似——这并不意外,因为它们共享相似的生理生化基础;但细看原始图像和光谱数据,其中存在明显噪声。噪声集中在三个高频抖动区间:低端的 370~430 nm,以及高端的 880~940 nm 和 1640~1715 nm。噪声可能来自仪器、环境或样品本身,如果不处理,会直接污染后续建模。因此预处理阶段的决策是:整段剔除这三个噪声区间,只保留 430~880 nm 和 940~1640 nm 两个干净的波段范围用于后续的光谱选择与建模。

3.2 数据预处理

拿到光谱数据后,第一件事不是急着建模,而是先做预处理。原始光谱里混着噪声、基线漂移、散射效应等各种干扰因素,如果不清理掉,光谱和目标物质(这里是酶活性)之间的相关性就会被掩盖,后面建出来的模型自然不准确。预处理的目的就是提升光谱信号的质量和可比性,让”光谱—酶活性”的对应关系更清晰。

论文用了三种预处理手段,各自解决的问题不一样:

  • 变量标准化:不同波长的反射率数值大小可能差别很大,量纲和尺度不统一,数值大的变量会在模型里”声音太大”,数值小的被淹没。标准化把每个变量都变成均值为 0、标准差为 1 的分布,公式为:

其中 是该变量的均值, 是标准差。这样所有波长都站在同一条起跑线上,模型更稳定、泛化能力也更好。

  • 截断操作:光谱从头到尾几千个波长点,但不是每一段都和酶活性有关。截断就是把明显无关或冗余的波段裁掉,既降低数据维度,也减少计算量。

  • 剔除异常样本:个别样本可能因为测量失误或状态异常而偏离整体规律,留着它们会拉偏模型,所以要先剔掉。

图6(a) 未预处理的番茄茎秆在近红外波段的光谱信息

图6(b) 预处理后番茄茎秆在近红外波段的光谱信息

图6 直观展示了预处理前后的对比:(a) 是未处理的原始光谱,曲线毛糙、有明显的漂移和噪声;(b) 是预处理后的光谱,曲线明显平滑干净了。数据质量上来了,后续的光谱分析才有可靠的基础。

3.3 光谱波段选择

预处理之后,光谱维度仍然不小,需要进一步挑出”最有用”的波长。论文用了两种特征波段选择算法——遗传算法(GA)和连续投影算法(SPA),分别筛选后对比效果。

GA 筛选结果:设置好种群规模、交叉概率、变异概率等参数,迭代若干轮后收敛。最终 GA 给出的最优解是:叶片和茎秆在可见光(VIS)波段分别选出 31 个和 26 个波长,在近红外(NIR)波段分别选出 35 个和 28 个波长。

SPA 筛选结果:先设定要选的波长个数,再运行算法,结果为:叶片和茎秆在 VIS 波段选出 27 个和 20 个波长变量,在 NIR 波段选出 25 个和 19 个波长变量。

以 GA 模型下叶片在 NIR 波段的结果为例:GA 会给每个波段算一个”重要性”,代表这个波段对酶活性预测的贡献程度。按照重要性排序并结合累计贡献率,最终确定第 179 个(1460 nm)到第 214 个(1574 nm)共 35 个波段入选。为了降维并突出特征光谱的分析价值,论文把重要性超过 80% 的变量保留下来用于分析,也就是第 179~214 号波段。其余七种”部位×波段”组合的筛选过程同理。

图7 GA 模型下叶片在近红外波段各波段的显著性

图7 画的就是 GA 模型中叶片 NIR 波段的重要性分布:横轴是波长序号,纵轴是重要性。可以看到波峰集中在一个连续区间,这正是后面选定的 1460~1574 nm 波段的来源。波段选好之后,就要用这些波段的反射率数据划分校准集和验证集了。

3.4 校准集与验证集划分

建模数据需要拆成两部分:一部分用来训练模型(校准/测试集),另一部分模型从未见过,用来检验模型的真实预测能力(验证集)。论文采用随机划分法,按 11:3 的比例把数据集分成测试集和验证集。

实验共有 100 株番茄,全部做光谱分析后送去做化学检测。最终 21 株作为验证集,其余 79 株作为测试集。

先比一比:GA 和 SPA 谁选的波段更好

为了对比两种波段选择算法,论文分别把 GA 和 SPA 与偏最小二乘回归(PLS)结合,在叶片和茎秆、VIS 和 NIR 四种组合下预测三种酶的活性,用三种酶的平均预测均方根误差(RMSEP)和平均决定系数()作为评价指标。

先解释这两个指标,后面所有表格都要用到它们:

**决定系数 (这里记作 ,下标 p 表示对预测集/验证集计算)**衡量预测值和实测值的吻合程度,取值范围通常在 0 到 1 之间:

其中 是实测值, 是预测值, 是实测值的均值。 越接近 1,说明预测和实测越贴合;越接近 0,说明模型基本没抓到规律。

**均方根误差(RMSE)**衡量预测值偏离实测值的平均幅度:

单位和酶活性指标一致,所以越小越好。RMSE 用在校准集上反映拟合误差,用在验证集上就称为 RMSEP(prediction),反映模型对”没见过”的样本的真实预测误差——这个数更能说明模型靠不靠谱。

表2 中 LEAF-NIR 表示叶片在近红外波段下的分析结果( 为平均决定系数,RMSE 为平均均方根误差),LEAF-VIS、STEM-NIR、STEM-VIS 的含义同理。

表2 GA 与 SPA 两种光谱选择方法的精度对比

预测模型测试集 测试集 RMSE验证集 验证集 RMSEP
GA-PLS-LEAF-NIR0.8341.5640.8151.659
SPA-PLS-LEAF-NIR0.7931.6740.7551.946
GA-PLS-STEM-NIR0.7871.9860.7742.032
SPA-PLS-STEM-NIR0.7052.5430.6872.633
GA-PLS-LEAF-VIS0.8121.5850.7831.754
SPA-PLS-LEAF-VIS0.7751.7410.7332.003
GA-PLS-STEM-VIS0.7462.0010.7112.113
SPA-PLS-STEM-VIS0.6992.7230.6552.722

结果非常一致:八组对比里,GA-PLS 每一组的 都更高、RMSEP 都更低。例如叶片 NIR 波段,GA-PLS 的验证集 RMSEP 为 1.659、 为 0.815,而 SPA-PLS 分别是 1.946 和 0.755;茎秆 VIS 波段差距更大,RMSEP 从 2.722(SPA-PLS)降到 2.113(GA-PLS)。结论明确:GA-PLS 的预测精度和稳定性都优于 SPA-PLS,所以后续实验统一采用 GA 作为光谱选择算法。

3.5 预测结果

选定 GA 之后,论文把它分别与四种回归算法结合——PLS、支持向量机(SVM)、粒子群优化反向传播神经网络(PSO-BP)和随机森林(RF),构成 GA-PLS、GA-SVM、GA-PSO-BP、GA-RF 四个预测模型,分别在 NIR 和 VIS 波段下预测番茄茎秆和叶片的酶活性。

评价方式与前面相同:用三种酶的平均决定系数 和平均均方根误差 (验证集为 )作指标,结果见表3。

表3 四种预测模型的精度对比

预测模型研究对象测试集 测试集 验证集 验证集
GA-PLSLEAF-NIR0.8341.5640.8151.659
GA-PLSSTEM-NIR0.7871.9860.7742.032
GA-PLSLEAF-VIS0.8121.5850.7831.754
GA-PLSSTEM-VIS0.7462.0010.7112.113
GA-SVMLEAF-NIR0.8051.5880.7991.773
GA-SVMSTEM-NIR0.7821.8650.7561.866
GA-SVMLEAF-VIS0.7881.7920.7761.911
GA-SVMSTEM-VIS0.7571.9540.7321.995
GA-PSO-BPLEAF-NIR0.8651.0050.8321.559
GA-PSO-BPSTEM-NIR0.7722.0060.7591.992
GA-PSO-BPLEAF-VIS0.7941.8830.7641.865
GA-PSO-BPSTEM-VIS0.7021.9540.6942.131
GA-RFLEAF-NIR0.7981.8870.7861.859
GA-RFSTEM-NIR0.7831.8730.7521.975
GA-RFLEAF-VIS0.7342.1130.7102.221
GA-RFSTEM-VIS0.7151.8740.7012.201

为了更直观地看清模型的预测表现,论文以 GA-PLS-LEAF-NIR 为例,把模型预测值与化学检测值做了描述性统计(表4)。三种酶分别是过氧化物酶(POD)、苯丙氨酸解氨酶(PAL)和 -淀粉酶(-AMS)。

表4 GA-PLS-LEAF-NIR 模型预测三种酶的描述性统计分析

统计量POD 真实值POD 预测值PAL 真实值PAL 预测值-AMS 真实值-AMS 预测值
平均值4.9726666674.8540952337.3948287.30620734.6643338.18133
标准误差0.0704924110.0680113760.1294170.1088561.102191.055575
标准差0.3861028390.3725136470.696930.5862076.0369445.781625
方差0.1490754020.1387664170.4857120.34363936.4446933.42718
最小值4.334.117696.256.3826.8430.32
最大值5.845.727698.818.5544.3647.96

怎么读这张表?核心是看真实值和预测值两列是否”长得像”。以 POD 为例:平均值 4.97 对 4.85,标准差 0.386 对 0.373,最小值、最大值也都很接近,说明预测值整体的分布形态和实测值基本一致——模型没有系统性地偏高或偏低,也没有把数据的波动幅度压扁。PAL 和 -AMS 同理,预测值的各项统计量都与真实值处于同一水平。

3.6 番茄酶含量预测模型的验证

统计表格只是概览,最终还要用独立验证来”考试”。论文把未参与建模的样本随机选出 21 个作为验证集,用 GA-PLS-LEAF-NIR 模型预测这 21 个样本的三种酶含量,再把预测值与实测值画成散点图对比。图中 real value 是化学检测得到的酶活性真实值,predicted value 是 GA-PLS-LEAF-NIR 模型的预测值。

图8(a) POD 酶含量验证集数据对比图

图8(b) PAL 酶含量验证集数据对比图

图8(c) -AMS 酶含量验证集数据对比图

图8 中三张图分别是 POD、PAL 和 -AMS 的验证集对比。看这种图有个小技巧:散点越贴近”预测值 = 真实值”的对角线,说明模型预测越准;如果点散得开或整体偏向一侧,就说明误差大或存在系统性偏差。

定量来看,GA-PLS 叶片近红外模型(GA-PLS-LEAF-NIR)的 为 0.815,RMSEP 为 1.659—— 接近 0.82 说明模型解释了大部分酶活性变化,RMSEP 的数值也控制在可接受范围内,拟合和预测效果良好。

把四种模型放在一起横向比较,可以得出三条结论:

  1. GA-PLS 综合表现最好,预测精度和稳定性都高于 GA-SVM、GA-PSO-BP 和 GA-RF;
  2. 叶片优于茎秆:预测番茄酶含量时,叶片模型的精度整体高于茎秆模型;
  3. 近红外优于可见光:NIR 波段的预测效果整体好于 VIS 波段。

这也从验证角度再次印证了 GA-PLS 模型在番茄酶含量无损检测中的可靠性。