什么是偏最小二乘 (PLS) 回归?
近红外 (NIR) 光谱由数千个单独的波长点组成。由于近红外光吸收表现为宽广、重叠的振动泛音而不是尖锐的峰值,因此单个波长很少足以预测化学浓度。我们需要多元统计,特别是对于复杂的统计化学和制药应用.
偏最小二乘 (PLS) 回归是金标准化学计量学算法。它将数千个高度共线性的光谱变量减少为几个正交因子(称为潜在变量 (LV)或主成分),最大化光谱数据和目标实验室参考浓度之间的协方差。
开发模型过去需要在 MATLAB 或 R 中手动编写脚本。在 caliX AutoML Suite 内(构建高度准确的caliXAutoML 模型),这个工作流程被简化为五个清晰的阶段。
---第 1 步:数据对齐和导入
首先,准备一个校准电子表格(CSV 或 Excel),将您的光谱文件名与其湿化学实验室结果相匹配。caliX支持直接导入原始光谱仪数据库格式和标准光谱交换格式(如 JCAMP-DX)。
导入后,caliX自动分割您的数据集:75% 用于校准和交叉验证(训练模型)和25% 作为独立验证集(完全分开以测试最终的预测性能)。
第 2 步:选择光谱预处理
原始 NIR 光信号包含由颗粒尺寸变化、样品填充密度或探头距离引起的物理散射噪声。光谱预处理在数学上消除了这些物理基线,因此 PLS 模型纯粹关注化学吸收。
在caliX管道,您可以应用并链接标准预处理步骤:
- 标准正态变量 (SNV):对每个单独的光谱进行居中和缩放以消除乘法缩放和偏移变化。
- 乘性散射校正 (MSC):将每个光谱与平均光谱进行回归,以隔离和消除散射斜率。
- Savitzky-Golay 衍生物(一阶或二阶):计算局部多项式拟合以获取导数,解决重叠带并消除基线偏移。
提示:caliX的 AutoML 引擎将自动对数十种预处理组合运行网格搜索,以建议矩阵的最佳序列。
第 3 步:选择潜在变量 (LV)
选择正确数量的潜在变量对于防止过度拟合至关重要。如果您选择的 LV 太少,您的模型就会拟合不足并错过化学相关性。如果您选择太多 LV,您的模型将开始拟合随机光谱噪声,这在扫描新样本时将会失败。
看看交叉验证的均方根误差 (RMSECV)曲线。选择曲线“弯头”处的 LV 数量,此时误差不再显着下降。超出这一点添加更多组件只会产生噪音。
# Sample Model Statistics Output in caliX
---------------------------------------------
Target Parameter: Crude Protein
Preprocessing: SNV + S-G 1st Derivative (15pt)
Selected Latent Variables (LVs): 6
Calibration R²: 0.982
Calibration RMSEC: 0.09%
Cross-Validation RMSECV: 0.11%
Validation RMSEP: 0.12%
Bias: -0.01%
---------------------------------------------
第 4 步:独立验证
要使模型符合工厂部署的条件,请在 25% 独立测试集上运行预测。这预测均方根误差 (RMSEP)测量在线使用传感器时您将看到的真实精度。稳健的模型应该显示非常接近交叉验证错误 (RMSECV) 的 RMSEP。
第 5 步:导出到 ProChem
一旦您对模型性能感到满意,请单击《出口模型包》。这会生成一个安全的`.caliX` 模型文件。直接加载该文件到ProChem 过程控制软件在您的生产线上。 ProChem 将自动将预先配置的预处理步骤应用于在线光谱并实时预测浓度,将结果直接发送到您的工厂 PLC。
概括
通过将严格的 PLS 回归逻辑与自动预处理优化相结合,caliXSuite 使质量控制工程师能够在不牺牲科学深度的情况下使用化学计量学。您在第一天就可以获得可靠、强大的模型来保护您的 B2B 利润。
参考
- Martens, H., & N-s, T. (1989)。多变量校准。约翰·威利父子。
- “近红外光谱的预处理技术:工业从业者化学计量指南”分析化学学报,2022 年。
- Geladi, P. 和 Kowalski, B. R. (1986)。 “偏最小二乘回归:教程”分析化学学报,185,1-17。