Qu'est-ce que la régression des moindres carrés partiels (PLS) ?
Les spectres du proche infrarouge (NIR) sont constitués de milliers de points de longueur d'onde individuels. Étant donné que l’absorption de la lumière NIR se manifeste par de larges nuances vibratoires qui se chevauchent plutôt que par des pics nets, une seule longueur d’onde suffit rarement à prédire une concentration chimique. Nous avons besoin de statistiques multivariées, en particulier pour les applications chimiques et pharmaceutiques.
Régression des moindres carrés partiels (PLS)est l’algorithme chimiométrique de référence. Il réduit les milliers de variables spectrales hautement colinéaires en quelques facteurs orthogonaux (appelés Variables latentes (LV)ou composants principaux) qui maximisent la covariance entre les données spectrales et les concentrations de référence du laboratoire cible.
Développer un modèle nécessitant des scripts manuels dans MATLAB ou R. Au sein du caliXAutoML Suite (qui construit des caliXModèles AutoML), ce flux de travail est simplifié en cinq étapes claires.
---Étape 1 : alignement et importation des données
Tout d’abord, préparez une feuille de calcul d’étalonnage (CSV ou Excel) faisant correspondre les noms de vos fichiers spectraux à leurs résultats de laboratoire de chimie humide. caliXprend en charge l'importation directe de formats de base de données de spectromètres bruts et de formats d'échange spectroscopiques standard tels que JCAMP-DX.
Une fois importé, caliXdivise automatiquement votre ensemble de données :75 % pour l'étalonnage et la validation croisée(pour entraîner le modèle) et 25 % en tant qu'ensemble de validation indépendant(conservé complètement séparé pour tester les performances prédictives finales).
Étape 2 : Choisir le prétraitement spectral
Les signaux lumineux bruts NIR contiennent un bruit de diffusion physique provoqué par les variations de taille des particules, la densité de compactage de l'échantillon ou la distance de la sonde. Le prétraitement spectral élimine mathématiquement ces lignes de base physiques, de sorte que le modèle PLS se concentre uniquement sur l'absorption chimique.
En caliXpipeline, vous pouvez appliquer et enchaîner les étapes de prétraitement standards :
- Standard Normal Varié (SNV) :Centrer et mettre à l'échelle chaque spectre individuel pour supprimer les variations de mise à l'échelle multiplicative et de décalage.
- Correction de diffusion multiplicative (MSC) :Régresse chaque spectre par rapport au spectre moyen pour isoler et supprimer les pentes de dispersion.
- Savitzky-Golay Dérivés (1er ou 2ème) :Calcule les ajustements polynomiaux locaux pour prendre des dérivées, en résolvant les bandes qui se chevauchent et en supprimant les décalages de la ligne de base.
Astuce : caliXLe moteur AutoML d' exécutera automatiquement une recherche dans la grille sur des dizaines de combinaisons de prétraitement pour suggérer la séquence optimale pour votre matrice.
Étape 3 : Sélection des variables latentes (LV)
La sélection du nombre correct de variables latentes est essentielle pour éviter le surapprentissage. Si vous sélectionnez trop peu de LV, votre modèle est sous-ajusté et manque de corrélations chimiques. Si vous sélectionnez trop de LV, votre modèle commence à ajuster un bruit spectral aléatoire, ce qui échouera lors de l'analyse de nouveaux échantillons.
Regardez le Erreur quadratique moyenne de validation croisée (RMSECV)courbe. Sélectionnez le nombre de LV au "coude" de la courbe, là où l'erreur cesse de baisser de manière significative. L'ajout de composants supplémentaires au-delà de ce point ne correspond qu'au bruit.
# Sample Model Statistics Output in caliX
---------------------------------------------
Target Parameter: Crude Protein
Preprocessing: SNV + S-G 1st Derivative (15pt)
Selected Latent Variables (LVs): 6
Calibration R²: 0.982
Calibration RMSEC: 0.09%
Cross-Validation RMSECV: 0.11%
Validation RMSEP: 0.12%
Bias: -0.01%
---------------------------------------------
Étape 4 : Validation indépendante
Pour qualifier le modèle pour un déploiement en usine, exécutez des prédictions sur l'ensemble de tests indépendant à 25 %. Le Erreur quadratique moyenne de prédiction (RMSEP)mesure la véritable précision que vous verrez lors de l'utilisation du capteur en ligne. Un modèle robuste doit afficher un RMSEP très proche de votre erreur de validation croisée (RMSECV).
Étape 5 : Exportation vers ProChem
Une fois que vous êtes satisfait des performances du modèle, cliquez sur« Package de modèles d'exportation ». Cela génère un fichier modèle `.caliX` sécurisé. Chargez ce fichier directement dans le ProChem Logiciel de contrôle de processus sur votre ligne de production. ProChem appliquera automatiquement les étapes de prétraitement préconfigurées aux spectres en ligne et prédit les concentrations en temps réel, envoyant les résultats directement à votre usine PLC.
Résumé
En combinant une logique de régression PLS rigoureuse avec une optimisation du prétraitement automatisé, le caliXSuite rend la chimiométrie accessible aux ingénieurs de contrôle qualité sans sacrifier la profondeur scientifique. Vous disposez de modèles fiables et robustes, prêts à protéger vos marges B2B dès le premier jour.
Références
- Martens, H. et Næs, T. (1989).Calibrage multivarié. John Wiley et fils.
- "Techniques de prétraitement en spectroscopie proche infrarouge : un guide chimiométrique pour les praticiens industriels",Analytica Chimica Acta, 2022.
- Geladi, P. et Kowalski, BR (1986). "Régression partielle des moindres carrés : un didacticiel",Analytica Chimica Acta, 185, 1-17.