Est-ce que ça se mesure ? Quarante-cinq minutes suffisent pour le savoir.Parlons de votre processLangueFREN

Combien d’échantillons faut-il pour calibrer un modèle ?

C’est la première question posée dans presque tous les projets. Elle a une réponse, et cette réponse commence par une liste plutôt que par un nombre.

Combien de lots différents, combien de fournisseurs de matière première et combien de saisons vos échantillons couvrent-ils aujourd’hui ? C’est cette liste qui fixe la taille du jeu de calibration. Le nombre s’en déduit, et il se calcule. Annoncé avant elle, il ne tient à rien de votre process.

La couverture détermine la qualité d’un modèle. Pas le compte.

Un modèle calibré sur échantillons apprend une relation statistique sur la population qu’on lui montre, et elle ne vaut que sur cette population. La question utile n’est donc pas « combien d’échantillons », mais « quelles sources de variation vos échantillons contiennent-ils, et lesquelles manquent ».

Trente échantillons bien répartis valent mieux que deux cents prélevés le même jour sur le même lot. Les deux cents ne sont, statistiquement, presque qu’un seul échantillon mesuré deux cents fois.


En bref

Il faut couvrir six dimensions : la gamme de la grandeur, extrémités comprises, les lots, les fournisseurs de matière première, les saisons pour une matière naturelle, les opérateurs et les équipements. Ces dimensions se multiplient entre elles : c’est leur produit qui fixe la taille du jeu de calibration, pas une valeur absolue.


Les six dimensions qu’un jeu de calibration doit couvrir

DimensionCe qu’il faut avoir vuCe qui arrive si on ne l’a pas vu
La gamme de la grandeurDes valeurs réparties sur toute la plage utile, extrémités comprises, et non massées autour de la cible.Le modèle est précis au centre et faux aux bornes, là où se prennent les décisions.
Les lotsPlusieurs lots de production distincts, fabriqués à des dates différentes.Le modèle apprend les particularités d’un lot et les prend pour la loi générale.
Les fournisseurs de matière premièreChaque fournisseur qualifié, et si possible plusieurs qualités par fournisseur.Un changement de source fait sortir le modèle de son domaine sans prévenir.
Les saisonsPour toute matière d’origine naturelle : plusieurs récoltes, plusieurs origines géographiques.Un modèle construit sur une seule campagne décroche l’année suivante.
Les opérateursLes façons de présenter l’échantillon, de positionner la sonde, de tasser une poudre.La variabilité de manipulation se loge dans l’erreur de prédiction, sans qu’on sache d’où elle vient.
Les équipementsLes lignes, cuves ou instruments sur lesquels la méthode sera réellement utilisée.Le modèle fonctionne sur la ligne où il est né, et nulle part ailleurs.

Ces six dimensions se multiplient entre elles, et c’est ce produit, non une valeur absolue, qui fixe la taille du jeu de calibration. Un process mono-fournisseur, mono-ligne, à matière synthétique stable demandera beaucoup moins qu’un process alimentaire à trois origines et deux saisons.

Votre jeu de calibration contient-il des lots non conformes ?

La quasi-totalité des jeux de calibration récupérés en production ne contiennent que des lots conformes. C’est logique, ce sont ceux qu’on fabrique, et c’est précisément là où on attend le modèle qu’il a le moins appris.

Un modèle entraîné uniquement sur des lots conformes a appris à décrire la normalité. Confronté à un lot qui en sort, il ne dit pas « je ne sais pas ». Il rend la valeur la plus proche de ce qu’il connaît. Autrement dit, il tire le résultat vers la conformité. C’est le pire comportement possible pour un dispositif censé protéger le patient ou le consommateur.

Une gamme trop étroite se lit dans les indicateurs, et elle flatte

Un modèle calibré sur une plage resserrée affiche souvent d’excellents coefficients de corrélation. La statistique récompense l’étalement, pas la justesse. Un coefficient élevé sur une plage étroite n’est pas une preuve de performance. Ce qu’il faut regarder, c’est l’erreur en valeur absolue, comparée à la tolérance de la spécification.

Ce qu’une validation croisée établit réellement

La validation croisée consiste à retirer une partie des échantillons, à recalculer le modèle sans eux, puis à prédire leurs valeurs. C’est un outil utile. Pour choisir un nombre de variables latentes, par exemple. La preuve de performance, elle, vient d’un jeu de validation indépendant.

Si vos échantillons viennent tous du même lot, ceux que vous retirez ressemblent en tout point à ceux qui restent. Le modèle les prédit parfaitement. L’indicateur obtenu décrit une capacité à interpoler à l’intérieur d’un lot, pas à traiter le lot de la semaine prochaine. C’est une performance mesurée sur une question qui ne se pose pas en production.

  • Découpez par lot, pas par échantillon. Retirer un lot entier, recalculer, prédire ce lot : c’est la seule validation croisée qui simule la situation réelle.
  • Réservez un jeu de validation vraiment indépendant, fait de lots que le modèle n’a jamais vus et jamais réintégrés au jeu de calibration « pour améliorer le résultat ». Cette réintégration détruit l’indépendance et ne se rattrape pas.
  • Rapportez l’erreur sur ce jeu-là, en unités de la grandeur mesurée, face à la tolérance de votre spécification. C’est ce qu’attend une validation de méthode, et ce qu’un évaluateur cherchera en premier.

Ce n’est pas une position d’école. USP <1039> l’écrit : les lots ayant servi à la calibration et à la validation croisée ne peuvent être ni considérés ni réutilisés comme jeu indépendant pour la validation de méthode. Et Ph. Eur. 5.21 nomme le découpage par lot — leave-block-out cross-validation — puis impose la partition en trois jeux : apprentissage, test interne, et test externe généré indépendamment.

Fabriquer la variabilité que la production n’a pas encore fournie

Quand la production ne fournit pas l’étendue nécessaire, deux voies existent. Et il faut savoir laquelle vous est ouverte avant de vous engager sur un calendrier.

Vous pouvez fabriquer des lots volontairement décalés

C’est la situation confortable. Un plan d’expérience sur des lots de développement construit rapidement une couverture que la production mettrait des années à fournir. Teneur volontairement basse et haute, humidité hors cible, temps de mélange raccourci.

Une seule précaution : que les lots décalés le soient de la façon dont un vrai incident les décalerait. Un sous-dosage obtenu en retirant du principe actif ne ressemble pas toujours à un sous-dosage venu d’une ségrégation au transfert.

La production tourne comme elle tourne, un cas fréquent

Produit stérile, process continu qualifié, capacité saturée : fabriquer un lot exprès n’est pas praticable. On travaille alors avec ce qu’on a, échantillons d’archive, lots historiquement écartés, dérives de démarrage et de fin de campagne, essais à échelle réduite.

Et l’on assume la conséquence : domaine de validité étroit au départ, surveillance renforcée, plan d’enrichissement progressif. C’est un choix documenté, pas un défaut caché.

Les valeurs de référence ont leur propre incertitude

Un modèle calibré sur échantillons ne prédit pas la vérité. Il prédit ce qu’aurait donné la méthode de laboratoire sur laquelle il a été calibré. Son erreur, mesurée contre cette méthode, ne peut pas se démontrer inférieure à celle de la méthode : elle la contient (Ph. Eur. 5.21). Et si les valeurs de référence sont dispersées, doubler le nombre d’échantillons ne rattrape rien. Avant de compter des échantillons, il faut savoir ce que vaut la méthode qui leur donnera une valeur.

Cette erreur se détermine, et le protocole est court. Deux analystes exécutent la méthode de référence sur les mêmes échantillons, l’un le premier jour, l’autre le second. La différence moyenne entre eux est le biais entre opérateurs ; un test apparié dit s’il est significatif. S’il ne l’est pas, l’écart-type de ces différences donne l’erreur de la méthode, à un facteur près : il porte sur l’écart entre deux mesures, et c’est donc cet écart-type divisé par √2 qu’il faut retenir. Le chiffre obtenu englobe le jour et l’opérateur, et c’est bien ce plafond-là qui intéresse un modèle. Une dizaine d’échantillons suffisent, et le résultat s’écrit dans le protocole de validation.

Une conséquence, et une nuance qui compte. La conséquence : un modèle dont l’erreur passe nettement sous celle de la référence n’a pas fait mieux que le laboratoire, il a rencontré quelque chose qui mérite d’être examiné. La nuance : ce plafond porte sur l’erreur mesurée contre la référence. La fidélité propre de la mesure en ligne peut être meilleure que celle du laboratoire, précisément parce qu’elle évite le sous-échantillonnage que celui-ci est obligé de faire.

Un échantillon de référence doit correspondre à ce que le capteur a vu

Le spectre est acquis sur quelques milligrammes de matière. La valeur de référence, elle, vient d’un prélèvement de plusieurs grammes analysé au laboratoire. Si le produit est hétérogène à cette échelle, l’appariement est faux et le modèle apprend un bruit d’échantillonnage. C’est la question de la représentativité, et elle précède toute question de quantité.

En calibration sur composants purs, la question change de nature

Tout ce qui précède vaut pour le modèle calibré sur échantillons : celui où l’on régresse un spectre sur des valeurs de référence. Il existe une autre approche, où la question du nombre d’échantillons disparaît.

En calibration sur composants purs, on ne construit pas un modèle sur une population de produits. On décompose chaque spectre sur une bibliothèque de spectres de composants purs. Plus de lots à collecter, plus de saisons à attendre, plus de plan d’expérience à négocier avec la production. L’effort se déplace vers la qualification de la bibliothèque. Étalons traçables, spectres acquis dans le solvant réel, série de dilution couvrant la plage utile, sélectivité vérifiée entre composants.

Cette approche a ses conditions strictes : composition déclarable, grandeur qui est bien une concentration, trajet optique fixe. Sa limite propre est ailleurs : le modèle ne voit que ce qu’on lui a déclaré. Mais quand elles sont réunies, la réponse à « combien d’échantillons » devient : aucun de vos lots. C’est la première chose à instruire dans une phase de cadrage.

La question à poser à un fournisseur

Une phrase suffit à trier les interlocuteurs, et elle ne porte pas sur un nombre :

« Sur combien de lots, sur combien de fournisseurs de matière première, et avec quel jeu de validation indépendant ? »

Qui répond « soixante échantillons » sans mentionner de lots ni de validation indépendante vous décrit un délai, pas une méthode. Qui répond « cela dépend de la variabilité de votre matière, et voici comment on la caractérise avant de chiffrer » vous décrit un travail.

Une question précède d’ailleurs celle du nombre : chaque spectre aura-t-il sa propre valeur de référence ? Soixante spectres appariés à deux valeurs de groupe ne font pas soixante échantillons de calibration. Apparier le spectre et sa référence.

Questions fréquentes

Existe-t-il vraiment un minimum absolu ?

Il existe des minima techniques liés à la méthode statistique. On ne calcule pas un modèle à plusieurs variables latentes sur une poignée d’échantillons. Mais ce qui limite est le nombre de lots distincts et l’étendue de la gamme couverte, jamais ce minimum. On voit des modèles inexploitables à deux cents échantillons et des modèles robustes à quarante.

Les modèles génériques livrés avec un instrument dispensent-ils de tout cela ?

Ils font gagner du temps au démarrage, et c’est réel. Ils ne dispensent pas de vérifier la justesse sur vos matières : ils ont été construits sur une population qui n’est pas la vôtre. La démarche minimale consiste à mesurer un jeu de vos propres échantillons, à comparer aux valeurs de référence et à corriger le biais éventuel. Cette vérification est elle-même une campagne, plus courte.

Peut-on démarrer petit et enrichir ensuite ?

C’est souvent la meilleure stratégie, à condition de l’assumer. Un modèle initial à domaine étroit, avec surveillance des résidus et plan d’enrichissement daté, vaut mieux qu’un modèle large bâti sur des échantillons mal répartis. Ce qu’il ne faut pas faire, c’est élargir le domaine déclaré sans avoir ajouté les échantillons correspondants. Faire vivre un modèle est une activité continue.

Combien de temps prend une campagne de calibration ?

Le temps de mesure est négligeable. Ce qui prend du temps, c’est d’attendre les lots. Si vous en produisez deux par mois et qu’il vous en faut une vingtaine de distincts, le calendrier est fixé par la production, pas par la chimiométrie. D’où l’importance de savoir si vous pouvez fabriquer des lots de développement décalés, et, plus encore, quel effort de calibration s’applique. La construction du modèle elle-même est décrite sur la page chimiométrie.

Et si la variabilité n’existe tout simplement pas ?

Cela arrive, et c’est une bonne nouvelle mal reçue. Si tous vos lots donnent la même valeur, un modèle quantitatif n’a rien à apprendre et n’apportera rien. Le besoin devient une détection d’écart plutôt qu’un dosage, ce qui relève d’une autre approche, moins coûteuse. Le dire est plus utile que vendre une calibration.

Décrivez-nous votre variabilité. Nous vous dirons ce qu’il faut collecter, et sur combien de temps.

Quarante-cinq minutes suffisent : identifier les sources de variation à couvrir, savoir si vos lots historiques y suffisent, et vérifier si votre cas relève d’un effort de calibration qui vous éviterait la campagne entière.