4 SEPTEMBRE 2026

Comment calibrer et valider un modèle ? Guide de terrain, du carbone du sol à la biomasse des arbres

Aperçu

Le mot calibration désigne quatre choses différentes, et la plupart des désaccords sur les modèles validés opposent deux personnes qui n’emploient pas le même sens. Cet article distingue ces acceptions, puis parcourt la démarche qui leur est commune : pourquoi un bon ajustement ne prouve presque rien, ce qu’estime réellement chaque niveau d’un découpage des données, en quoi le schéma de validation croisée retenu engage une affirmation sur la tâche de prédiction, quelles métriques ne valent rien isolément, et ce qu’il faut pour qu’une incertitude annoncée soit honnête. Trois outils interactifs : sur le surajustement, sur les schémas de validation, et sur les nombreux jeux de paramètres qui s’ajustent aussi bien les uns que les autres.

Thèmes

Modélisation // Validation // MRV // Incertitude

Auteurs

Dr. Thomas Fungenzi

Share

LinkedInEmail

Un modèle produit un nombre. Quelqu’un doit ensuite décider s’il faut y croire, et cette personne n’est généralement pas celle qui l’a construit. C’est un vérificateur qui lit un document de projet, une responsable développement durable qui se demande si elle peut inscrire le chiffre dans une déclaration, ou un relecteur à qui l’on a confié un manuscrit. Le nombre arrive accompagné d’un nom, RothC, une équation de Chave ou une forêt aléatoire, et ce nom fait une part étonnante du travail. Il ne devrait en faire presque aucune.

Rien dans l’architecture d’un modèle ne rend sa sortie digne de confiance. La confiance vient de preuves sur la façon dont il se comporte face à des données qui n’ont pas servi à le construire, et ces preuves figurent dans la documentation ou n’y figurent pas. En pratique, elles n’y figurent souvent pas. Un document de projet décrira le modèle en détail, nommera les paramètres, citera la publication d’origine, et dira remarquablement peu de chose de ce qui a été mis de côté, de la manière dont on l’a mis de côté, et de l’allure des erreurs quand le modèle s’y est confronté.

Cet article porte sur cette moitié manquante. Il s’insère entre deux autres articles de ce site. La question de savoir comment choisir un modèle de carbone du sol vient en premier, celle de savoir où un modèle ajusté peut être appliqué vient après. Celui-ci occupe le milieu : une fois un modèle choisi, comment l’ajuster, comment le tester, et à quelles conditions le test voudrait dire quelque chose.

La réponse, avant le raisonnement

Un mot, quatre sens

Traçabilité des instruments, ajustement empirique, estimation des paramètres d’un modèle de processus, et calibration d’un énoncé probabiliste. Leurs critères de réussite diffèrent, leurs modes de défaillance aussi.

Bien ajuster ne prouve rien

L’erreur d’entraînement diminue à mesure que le modèle gagne en flexibilité, sans limite et sans signification. Seule l’erreur sur des données tenues à l’écart de l’ajustement renseigne sur la prochaine prédiction.

Le découpage est une affirmation

Le k-fold aléatoire, le leave-site-out et la validation temporelle répondent à des questions différentes. Une erreur de validation croisée rapportée sans son schéma n’est pas interprétable, et les schémas ne sont pas comparables entre eux.

Aucune métrique ne suffit seule

Le biais, la dispersion et le gain par rapport à une référence sont trois questions distinctes, et la corrélation ne répond à aucune d’elles. Un modèle peut être parfaitement corrélé à la vérité et se tromper de moitié.

La couverture se vérifie

Un intervalle à 90 % contient la vérité environ 90 % du temps sur des données mises de côté, ou il ne la contient pas. C’est une mesure, pas une affirmation, et elle est rarement rapportée.

Rien de tout cela ne relève de statistiques avancées. C’est la discipline ordinaire du domaine, appliquée avec constance, et l’essentiel de la distance entre un chiffre modélisé défendable et un chiffre indéfendable se franchit simplement en l’appliquant.

Un mot, quatre métiers

Assistez à une réunion de validation et comptez les sens. Le développeur explique que le modèle a été calibré sur douze essais de longue durée. Le vérificateur demande s’il a été validé. La responsable de la télédétection précise que sa calibration a utilisé quatre cents spectres, dont cent mis de côté. Le statisticien, resté silencieux jusque-là, demande si les intervalles sont calibrés. Quatre personnes, un mot, et au moins trois opérations différentes sur la table.

Aucun d’eux n’emploie le mot à tort. Le mot calibration porte quatre sens établis dans les disciplines qui se croisent au sein d’un projet carbone, et ce ne sont pas des nuances d’une même idée. Ils diffèrent par ce que l’on ajuste, par ce qui compte comme une réussite, et par la façon dont ils échouent. C’est en glissant de l’un à l’autre qu’une réunion finit par s’accorder sur un mot tout en restant en désaccord sur tout ce que ce mot était censé trancher.

Le sens le plus ancien est métrologique. Un instrument fournit une indication, et la calibration (que le vocabulaire métrologique français nomme étalonnage) met cette indication en relation avec des valeurs fournies par des étalons de mesure, chacune assortie de sa propre incertitude, puis transforme cette relation en un moyen d’obtenir un résultat de mesure à partir d’une lecture1. Un analyseur par combustion sèche est calibré à l’aide de matériaux de référence certifiés de teneur en carbone connue. Un détail est ici à l’origine de bien des approximations ultérieures : la calibration ne modifie pas l’instrument. Régler un système pour qu’il fournisse des indications prescrites est une opération distincte qui porte son propre nom, l’ajustage, et le vocabulaire précise explicitement à la fois qu’il ne faut pas confondre les deux et que la calibration est un préalable à l’ajustage1. En ce sens, la calibration produit une connaissance sur un instrument, pas un meilleur instrument.

Le deuxième sens est l’ajustement statistique d’un modèle empirique. Une équation allométrique reliant le diamètre à la biomasse, ou un modèle spectral reliant la réflectance à la concentration en carbone, possède des coefficients estimés à partir de données. Les données qui servent à les estimer forment le jeu de calibration ; ce qui est mis de côté forme le jeu de validation. Rien ici n’est rendu traçable à un étalon. On ajuste une forme fonctionnelle, et la question qui compte est son comportement sur des données qu’elle n’a pas vues. La spectroscopie des sols est le terrain où les deux premiers sens se télescopent le plus souvent. Prédire une propriété du sol à partir d’un spectre de réflectance diffuse consiste à ajuster une régression sur un jeu de calibration et à la tester sur des échantillons mis de côté2, si bien que le mot y désigne la régression et non un quelconque réglage du spectromètre, alors même qu’il y a un spectromètre dans la pièce.

Le troisième sens est l’estimation des paramètres d’un modèle de processus. Les constantes de vitesse de décomposition de RothC, ou les paramètres analogues de Century et de DayCent, ne sont pas des grandeurs que l’on peut aller mesurer sur une exploitation donnée. On les infère en faisant tourner le modèle et en les ajustant jusqu’à ce qu’il reproduise une série temporelle observée. Chaque jeu de paramètres candidat exige une nouvelle simulation complète pour savoir de combien il manque la cible, et c’est ce qui fait de l’exercice un problème inverse et non un ajustement3. La différence avec le deuxième sens ne tient pas à la technique mais à l’obligation : ces paramètres sont censés avoir un sens physique. Une vitesse de décomposition réglée sur la valeur, quelle qu’elle soit, qui minimise les résidus a cessé d’être une vitesse de décomposition pour devenir un paramètre libre affublé d’une étiquette mécaniste. C’est aussi là que plusieurs jeux de paramètres différents se révèlent reproduire à peu près aussi bien les mêmes observations, un problème qui a son propre nom et sa propre littérature4.

Le quatrième sens porte sur des énoncés probabilistes plutôt que sur des prédictions. Une prévision est calibrée lorsque les événements auxquels elle attribue une probabilité de 90 % se produisent environ 90 % du temps, et un intervalle de prédiction à 90 % est calibré lorsqu’il contient la vérité environ 90 % du temps. C’est le seul sens dans lequel un modèle peut être parfaitement calibré et totalement inutile. Prédisez chaque fois la moyenne de long terme, joignez-y des intervalles assez larges pour absorber toute la variation, et la couverture sera excellente alors que la prévision n’apprend rien à personne. La calibration est ici nécessaire, mais elle doit être jugée conjointement avec l’étroitesse de l’énoncé, ce que la littérature sur la prévision appelle la finesse (sharpness)5.

1 // Calibration d’un instrumentMétrologie

Ce que l’on ajuste

Rien sur l’instrument. La relation entre son indication et une valeur de référence d’incertitude connue.

Signe de réussite

Le résultat est traçable à un étalon, avec une incertitude déclarée.

Échoue quand

Une dérive entre deux calibrations, ou une chaîne de traçabilité supposée plutôt que documentée.

2 // Ajustement d’un modèle empiriqueStatistique // chimiométrie

Ce que l’on ajuste

Les coefficients d’une forme fonctionnelle choisie, estimés sur un jeu de calibration.

Signe de réussite

Une capacité prédictive sur des données tenues à l’écart de l’ajustement.

Échoue quand

Le surajustement, et des données de validation qui ne sont pas indépendantes des données de calibration.

3 // Estimation des paramètres d’un modèle de processusModélisation biogéochimique

Ce que l’on ajuste

Des paramètres censés avoir un sens physique, inférés par inversion à partir de séries temporelles observées.

Signe de réussite

Le modèle reproduit des sites sur lesquels il n’a pas été réglé, avec des paramètres qui restent physiquement plausibles.

Échoue quand

L’équifinalité, et des paramètres poussés au-delà du sens physique pour absorber une erreur structurelle.

4 // Calibration d’une probabilitéPrévision

Ce que l’on ajuste

La largeur et la forme de l’incertitude annoncée, pas la prédiction centrale.

Signe de réussite

La couverture atteinte correspond à la couverture nominale, avec une finesse utile.

Échoue quand

Des intervalles si larges que la couverture est atteinte et que l’énoncé est vide.

Pour un projet carbone, la conséquence est assez précise pour qu’on la guette. Un vérificateur demande si le modèle a été validé. Le développeur répond qu’il a été calibré sur des essais locaux de longue durée, ce qui est une affirmation vraie et pertinente sur le troisième sens. Le vérificateur pensait peut-être au deuxième, c’est-à-dire à un test sur des données mises de côté, ou au quatrième, c’est-à-dire à la question de savoir si l’incertitude attachée au chiffre final repose sur une quelconque couverture. Trois questions raisonnables, une seule réponse, et l’écart entre elles n’apparaît pas dans le compte rendu.

Un débat plus ancien sous-tend celui-ci. La vérification relève des systèmes fermés : une structure purement formelle peut être démontrée par manipulation symbolique, et un algorithme au sein d’un programme peut être contrôlé de la même manière. Un modèle construit à partir de tels composants n’est pas lui-même fermé, car les paramètres dont il a besoin ne sont jamais complètement connus, et l’affirmation selon laquelle un modèle de système environnemental ouvert aurait été validé en un sens absolu est contestée depuis le milieu des années quatre-vingt-dix6. Les manuels destinés aux modélisateurs tracent la même ligne, pour des raisons pratiques. L’un traite un modèle comme une hypothèse scientifique lorsque la question est de savoir si ses processus se comportent comme les processus réels, une hypothèse qui peut être invalidée mais jamais définitivement validée. Il traite le même modèle comme un outil d’ingénieur lorsque la question n’est pas de savoir comment il fonctionne mais à quel point il fonctionne bien, et appelle cela évaluation7. L’autre refuse le mot validation pour la troisième phase d’un projet de modélisation et nomme cette phase évaluation. Confronter les prédictions aux observations n’est qu’un des éléments, parmi plusieurs, qui rendent un modèle utile à sa finalité, et le mot validation laisse entendre qu’il existe un modèle correct à découvrir8. Rien dans cet article n’oblige à prendre parti dans ce débat. Il oblige en revanche à lire validation comme un raccourci désignant un test précis sur des données précises, et non comme un certificat.

Un bon ajustement ne coûte rien

Prenez douze arbres, mesurez leur diamètre, déterminez leur biomasse par échantillonnage destructif, et ajustez un polynôme. Au degré deux, la courbe passe près des points. Au degré onze, elle passe exactement par chacun d’eux. Les résidus sont nuls, le coefficient de détermination vaut un, et l’ajustement est parfait, au seul sens que le mot puisse revêtir sur l’échantillon d’ajustement lui-même. Entre les points, la courbe oscille vers des valeurs physiquement impossibles, et un treizième arbre tombera très loin d’elle.

Ce n’est pas une pathologie propre aux polynômes. C’est le comportement général des modèles flexibles, et la raison pour laquelle la performance sur l’échantillon d’ajustement porte si peu d’information. À mesure qu’un modèle gagne en liberté, son erreur d’entraînement diminue de façon monotone, sans autre plancher que zéro et sans point où cette baisse signalerait quoi que ce soit. L’erreur sur des données tenues à l’écart de l’ajustement se comporte autrement : elle diminue tant que la flexibilité ajoutée capte une structure qui se généralise, puis s’inverse et remonte lorsque cette même flexibilité commence à absorber le bruit propre à l’échantillon dont on dispose9.

Le mécanisme admet une décomposition classique. L’erreur attendue en un nouveau point se décompose en un terme de biais, qui mesure de combien le modèle se trompe en moyenne, un terme de variance, qui mesure à quel point le modèle ajusté bouge lorsqu’on tire un nouvel échantillon d’entraînement, et un terme irréductible, la variance de la cible autour de sa propre moyenne vraie, qu’aucun effort de modélisation ne peut supprimer. La flexibilité échange le premier contre le second. Un modèle rigide est plus biaisé et plus stable, un modèle flexible moins biaisé et plus instable, et la zone utile ne se trouve à aucune des deux extrémités9.

Erreur de prédiction attendue en un nouveau point
E[(y − ŷ)²] = Bias(ŷ)² + Var(ŷ) + σ²irréductible
y, ŷ
La valeur vraie en un nouveau point, et la prédiction qu’en fait le modèle.
Bias(ŷ)²
De combien le modèle se trompe en moyenne.
Var(ŷ)
À quel point le modèle ajusté bouge lorsqu’on tire un nouvel échantillon d’entraînement.
σ²
La variance de la cible autour de sa propre moyenne vraie. Aucun effort de modélisation ne la supprime.

Un corollaire mérite d’être énoncé à part, car il survit dans la documentation de projet bien après le moment où il aurait dû être mis au rebut. Le coefficient de détermination calculé sur l’échantillon d’ajustement ne diminue jamais lorsqu’on ajoute un prédicteur. Ajoutez une colonne de nombres aléatoires à une régression et le R² augmentera. Les formes corrigées, comme le R² ajusté, pénalisent le nombre de paramètres et règlent une partie du problème, mais aucune statistique calculée sur l’échantillon d’ajustement ne répond à la question qui compte, à savoir ce qui se passe sur le site suivant et non sur celui-ci.

Dans ce domaine, le piège prend une forme précise. Une équation allométrique ajustée localement, estimée sur quelques dizaines d’arbres d’une seule plantation, battra une équation pantropicale publiée sur ces mêmes arbres pratiquement à chaque fois. Cette comparaison ne prouve pas que l’équation locale est meilleure, et elle est couramment présentée comme si c’était le cas. La comparaison honnête met de côté des arbres que l’équation locale n’a jamais vus, et c’est précisément la comparaison qu’un petit jeu de données destructif rend douloureuse, car chaque arbre mis de côté est un arbre qui ne sert pas à l’ajustement. La tension est réelle. La faire disparaître en rapportant la performance sur l’échantillon d’ajustement ne la résout pas.

Le même échec se retrouve à l’échelle des cartes. Des modèles écologiques à grande échelle, validés en mettant de côté des pixels au hasard, ont affiché de fortes performances prédictives qui se sont effondrées dès que les données mises de côté ont été séparées spatialement des données d’entraînement, parce que des pixels voisins ne sont pas des observations indépendantes et qu’un découpage aléatoire souffle discrètement les réponses au modèle10. Cet échec précis fait l’objet d’un article complémentaire et n’est pas repris ici ; ce qui a sa place ici, c’est la leçon générale : c’est le découpage qui fait le travail, pas la métrique calculée ensuite.

Anatomie d’une validation

Le mot validation recouvre une hiérarchie qu’il vaut la peine de démonter, car ses niveaux estiment des choses différentes et sont couramment confondus en un seul. Dans la version la plus propre, les données tiennent trois rôles, et chaque observation en joue exactement un.

Jeu d’entraînement

Estime les paramètres. L’erreur mesurée ici indique que le modèle sait reproduire des données qu’il a déjà vues, ce dont personne ne doute.

Jeu de validation

Départage les candidats : quelle forme fonctionnelle, combien de termes, quels hyperparamètres. L’erreur mesurée ici guide la sélection, et elle est biaisée vers le bas dès l’instant où on l’utilise à cette fin.

Jeu de test

Estime la performance du modèle retenu sur des données nouvelles. Il n’est sans biais que tant qu’on n’y a pas touché, et il ne peut servir qu’une seule fois.

C’est la distinction entre le deuxième et le troisième rôle qui disparaît. Supposons que l’on essaie huit configurations de modèle, que l’on évalue chacune sur le même bloc mis de côté, que l’on retienne celle qui obtient le meilleur score, puis que l’on présente ce score comme la performance attendue du modèle. Le chiffre est trop beau, et il l’est pour une raison qui n’a rien à voir avec la malhonnêteté : on a retenu le maximum de huit estimations bruitées, et l’on a donc sélectionné en partie une capacité réelle et en partie un bruit favorable. Plus on a essayé de configurations, plus le score rapporté contient de bruit que l’on est allé chercher11.

Lorsque les données sont trop rares pour mettre de côté un jeu de test auquel on ne touche jamais, la réponse établie consiste à imbriquer la procédure : une boucle interne qui effectue la sélection, une boucle externe qui ne voit jamais que des modèles déjà choisis, de sorte que l’estimation externe ne sert jamais à choisir quoi que ce soit11. Cela coûte du calcul et ne coûte rien en données, ce qui rend son absence dans la plupart des travaux appliqués difficile à justifier par des raisons pratiques.

Sous ces trois niveaux se trouve un mot porteur que l’arithmétique ne vérifie pas d’elle-même. Les données mises de côté doivent être indépendantes, et l’indépendance est ici une affirmation sur le monde plutôt que sur le tableur. Deux carottes prélevées dans la même parcelle à dix mètres d’intervalle sont deux lignes dans un tableau et, à peu de chose près, une seule observation du sol. Deux années sur le même site ne sont pas deux tests indépendants d’un modèle temporel. Découper un tableau au hasard garantit que les lignes sont séparées. Cela ne garantit absolument rien quant à la séparation de l’information.

La famille de la validation croisée, et ce que suppose chacun de ses membres

Mettre de côté un unique jeu de test gaspille des données, et avec quelques centaines d’observations, ce gaspillage fait mal. La validation croisée en récupère l’essentiel en faisant tourner le rôle de l’échantillon mis de côté : on partitionne les données, on entraîne sur toutes les parties sauf une, on teste sur la partie laissée de côté, on recommence jusqu’à ce que chaque partie soit passée à son tour, puis on fait la moyenne. L’idée est ancienne, simple, et presque toujours rapportée sous une forme qui omet le seul détail dont le lecteur a besoin.

Ce détail, c’est la manière dont la partition a été faite. La validation croisée n’est pas une procédure mais une famille, dont les membres diffèrent par la façon d’affecter les observations aux blocs (folds). Cette affectation n’est pas une préférence technique. C’est un énoncé sur ce que l’on demandera au modèle de faire, et chaque choix estime l’erreur d’une tâche différente12.

K-fold aléatoire

Question posée

Le modèle prédit-il bien une autre observation tirée du même ensemble ?

Adapté lorsque

Des observations réellement échangeables, sans regroupement, sans agrégation spatiale et sans ordre temporel.

Tombe en défaut lorsque

Des données groupées ou autocorrélées, où les proches voisins d’un bloc se trouvent dans le jeu d’entraînement et laissent fuiter la réponse.

Leave-one-out

Question posée

La même question, avec des blocs d’une seule observation.

Adapté lorsque

Les petits jeux de données, et les modèles linéaires, pour lesquels elle se calcule sous forme analytique au lieu de réajuster le modèle n fois.

Tombe en défaut lorsque

Son estimation a une forte variance, et elle hérite de tous les problèmes de fuite du k-fold aléatoire.

Leave-site-out

Question posée

Le modèle prédit-il bien un site qui n’a rien apporté à l’ajustement ?

Adapté lorsque

Tout modèle destiné à être appliqué là où il n’a pas été calibré, ce qui couvre la plupart des travaux de projet.

Tombe en défaut lorsque

Pessimiste si l’usage prévu est réellement l’interpolation entre des sites connus, et il faut assez de sites pour pouvoir moyenner.

Validation temporelle

Question posée

Le modèle prédit-il bien la suite à partir des données disponibles ?

Adapté lorsque

Tout ce qui projette une trajectoire, là où s’entraîner sur le futur pour prédire le passé n’aurait aucun sens.

Tombe en défaut lorsque

Consacre au test les données les plus récentes, en général les plus pertinentes, et une seule fenêtre mise de côté ne donne qu’une estimation bruitée.

Faites passer le même jeu de données par plusieurs de ces schémas et l’erreur rapportée bouge, souvent beaucoup. Ce mouvement est l’essentiel, pas un désagrément. Une erreur de validation croisée est un énoncé conditionnel, et la condition, c’est la partition. Deux nombres produits selon des schémas différents ne sont pas deux estimations d’une même grandeur : les comparer, ou comparer un résultat en leave-site-out à un résultat publié en k-fold aléatoire, est une erreur de catégorie déguisée en benchmark. L’outil ci-dessous fait passer un même jeu de données groupé par site par trois schémas, pour que l’ampleur du mouvement soit visible plutôt qu’affirmée.

Le cas spatial a plus de structure que cette section ne lui en accorde : à quelle distance un bloc doit se trouver pour compter comme indépendant, comment le découpage en blocs peut verser dans le pessimisme, et que faire lorsque les cibles de prédiction visées sont elles-mêmes groupées. Cela relève de l’article sur la représentativité, qui commence là où s’arrête cette section.

Des métriques qui ne valent qu’accompagnées

Une fois le découpage arrêté, il faut calculer quelque chose sur l’ensemble, et l’habitude est ici de rapporter un seul nombre. Aucun nombre isolé ne décrit les erreurs d’un modèle, car les erreurs ont au moins trois propriétés indépendantes : penchent-elles d’un côté, quelle est leur taille typique, et le modèle fait-il mieux qu’une alternative triviale. Une métrique répond à l’une de ces questions et reste muette sur les autres.

L’erreur moyenne, c’est-à-dire la moyenne des résidus signés, mesure cette inclinaison. C’est celle qui compte le plus en comptabilité carbone, car un décalage systématique ne rétrécit pas quand le projet grandit : le biais se cumule, alors que l’erreur aléatoire se compense en partie. C’est aussi la métrique la plus facile à satisfaire par accident, puisque de grosses erreurs positives et négatives donnent en moyenne un zéro rassurant.

La racine de l’erreur quadratique moyenne (RMSE) mesure la taille typique, dans l’unité de la grandeur, et pèse lourdement sur les gros écarts puisqu’elle élève au carré avant de moyenner. L’erreur absolue moyenne (MAE) pose la même question sans cette pondération. Rapporter les deux est instructif : lorsque la RMSE dépasse largement la MAE, la distribution des erreurs a une queue, et une queue dans un jeu de validation signale généralement une sous-population que le modèle traite mal plutôt que de la malchance.

Aucune des deux ne dit si le modèle vaut la peine d’être utilisé. Il faut pour cela une référence, et c’est ce que fournit l’efficience du modèle : elle compare l’erreur quadratique du modèle à l’erreur commise en prédisant simplement la moyenne des observations, et rapporte la part de cette variance initiale dont le modèle rend compte13. Un correspond à la perfection, zéro signifie que la moyenne aurait fait aussi bien, et une valeur négative, qu’elle aurait fait mieux. Les valeurs négatives apparaissent dans les travaux publiés sur les sols et la biomasse plus souvent que le ton du texte qui les entoure ne l’admet d’ordinaire. C’est une impression de lecteur, pas un chiffre comptabilisé.

Efficience du modèle, par rapport à la moyenne des observations
EF = 1 − Σ(oᵢ − pᵢ)² / Σ(oᵢ − ō)²
EF
Efficience du modèle. Un correspond à la perfection, zéro signifie que la moyenne aurait fait aussi bien, une valeur négative qu’elle aurait fait mieux.
oᵢ
La valeur observée pour l’échantillon i.
pᵢ
La valeur prédite par le modèle pour ce même échantillon.
ō
La moyenne des valeurs observées, soit la référence sans modèle.

La métrique à traiter avec le plus de méfiance est le coefficient de corrélation et son carré. La corrélation mesure si deux séries varient ensemble, pas si elles concordent. Un modèle qui renvoie exactement la moitié de la biomasse réelle de chaque arbre est parfaitement corrélé à la vérité, avec un R² égal à un, et se trompe de 50 % partout. Ce n’est pas un cas artificiel : une prédiction affectée d’un facteur d’échelle systématique est précisément ce que produit un modèle mal calibré, et c’est précisément ce à quoi le R² est aveugle. Le coefficient de corrélation de concordance de Lin existe pour cette raison. Il récompense l’accord avec la droite 1:1 plutôt qu’avec une droite quelconque, si bien qu’il baisse lorsqu’un modèle présente un biais proportionnel, même quand la corrélation reste parfaite14.

Reste le graphique que tout le monde trace et qu’un nombre surprenant de gens tracent mal. Lorsque les valeurs observées et prédites sont portées l’une contre l’autre et qu’on ajuste une droite pour tester une pente de un et une ordonnée à l’origine nulle, le choix des axes n’est pas cosmétique. Régresser les prédictions sur les observations et régresser les observations sur les prédictions donnent des pentes différentes, et une seule des deux teste l’hypothèse sur la performance du modèle que le graphique est censé tester. La convention qui s’appuie sur l’argument statistique place les valeurs observées sur l’axe vertical et les prédictions sur l’axe horizontal, car les prédictions sont la grandeur évaluée et les hypothèses de la régression tombent alors là où elles le doivent15.

On dispose d’un exemple documenté d’évaluation plus complète. Lorsque le modèle sol-culture STICS a été testé avec un seul jeu de paramètres standard sur quinze cultures et une large gamme de sols et de climats français, l’évaluation a été découpée en trois volets. La précision reposait sur la RMSE, la RMSE relative et l’efficience du modèle, ainsi que sur la part de l’erreur due au biais ou à la dispersion. La robustesse examinait si l’ampleur de l’erreur dépendait de la culture ou de l’environnement. Le comportement examinait si le modèle reproduisait les différences observées entre conditions environnementales et pratiques de gestion contrastées16. Les trois répondent à des questions différentes, et une section de validation qui ne rapporte que le premier n’a répondu qu’à l’une d’elles.

Calibrer un modèle de processus est un autre métier

Tout ce qui précède supposait un modèle dont les paramètres sont libres de prendre les valeurs qui s’ajustent le mieux, parce qu’ils n’ont pas d’autre sens que l’ajustement. Les modèles de processus rompent avec cette hypothèse. Les vitesses de décomposition des compartiments de RothC, les constantes de renouvellement de Century et les paramètres azotés de DayCent sont écrits comme des grandeurs physiques, et la prétention du modèle à projeter au-delà de ses données de calibration repose entièrement sur leur caractère physique. C’est cette prétention qui rend leur réglage délicat.

Les instruments de ce travail sont les essais de longue durée, dont certains se poursuivent depuis plus d’un siècle, où le carbone du sol a été suivi sous traitements fixes. Ce sont les seules données capables de contraindre un modèle décennal à l’échelle de temps sur laquelle il prétend fonctionner. Il y en a donc peu, elles sont inégalement réparties entre les climats et les sols du monde, et la même poignée d’essais revient d’une calibration à l’autre. L’atelier qui a commencé à confronter systématiquement les modèles de matière organique du sol à des jeux de données de longue durée en a donné la raison : la matière organique du sol évolue lentement, si bien que seules des données de longue durée permettent d’en tester un modèle. Ses jeux de données provenaient, de son propre aveu, de la zone tempérée17. Un modèle réglé sur des essais arables tempérés et appliqué à l’agroforesterie tropicale a été calibré avec un instrument qui n’a jamais rien mesuré qui ressemble à la cible18.

La pratique s’étend sur un spectre. À une extrémité, un modélisateur ajuste les paramètres à la main jusqu’à ce que les courbes simulées et observées paraissent proches, ce qui est rapide, non documenté et non reproductible. Au milieu, un optimiseur minimise une fonction de perte, ce qui est reproductible et renvoie un unique meilleur jeu, sans rien dire de l’avance qu’il avait sur les autres. À l’autre extrémité, la calibration bayésienne traite les paramètres comme des variables aléatoires, combine une loi a priori avec la vraisemblance des observations, et renvoie une distribution a posteriori : non pas une réponse, mais la description de toutes les réponses que les données tolèrent, avec leur propre incertitude19.

Ce cadre fait aussi place à quelque chose que les deux autres ignorent. Les modèles réels sont structurellement faux, et l’erreur structurelle ne se comporte pas comme un bruit de mesure. La calibration renvoie une valeur de meilleur ajustement, pas une valeur physique, et une vitesse de décomposition peut finir à la valeur, quelle qu’elle soit, qui compense un processus que le modèle ne représente pas. Le modèle s’ajuste toujours. Ce n’est plus une vitesse de décomposition, et une projection qui s’appuie sur son sens physique s’appuie sur quelque chose qui a discrètement cessé d’être physique19.

L’autre raison de préférer une distribution à un meilleur ajustement est que ce meilleur ajustement n’est généralement guère meilleur qu’un grand nombre d’alternatives très différentes. De nombreux jeux de paramètres reproduisent à peu près aussi bien une trajectoire de carbone observée, et ils ne s’accordent pas entre eux sur l’avenir, car s’ajuster au même passé est une contrainte bien plus faible qu’il n’y paraît. La réponse n’est pas de désigner le vainqueur et de rapporter sa projection, mais de propager l’ensemble des jeux acceptables et de le laisser produire une fourchette4. L’outil ci-dessous le rend visible sur un modèle jouet à un compartiment et deux inconnues : la région de l’espace des paramètres compatible avec les données est large, elle se resserre à mesure que les données arrivent, et elle ne se réduit jamais à un point.

Une autre interaction passe facilement inaperçue. Le point de départ d’un modèle de processus est lui-même une décision de calibration. La répartition du stock initial entre compartiments rapide, lent et inerte est rarement mesurable, le plus souvent estimée, et modifie sensiblement une projection à trente ans. Calibrer des paramètres sur une trajectoire dont le point de départ a lui-même été supposé revient à ajuster deux inconnues sur une seule courbe. Ce problème, et la procédure de spin-up qui y apporte la réponse défendable, sont traités dans l’article sur le choix d’un modèle de carbone du sol.

Un énoncé d’incertitude est une prédiction, et il peut être testé

Retour au quatrième sens de la calibration, là où échouent discrètement la plupart des incertitudes de modèle rapportées. Un projet présente son estimation sous la forme d’une valeur centrale assortie d’un intervalle à 90 %. Cet intervalle n’est ni une précaution oratoire ni un geste d’humilité. C’est une affirmation réfutable : sur un grand nombre d’énoncés de ce type, la vérité devrait tomber à l’intérieur d’environ 90 % d’entre eux. La fraction où c’est effectivement le cas est la couverture atteinte, et la comparer aux 90 % nominaux est une mesure ordinaire que presque personne n’effectue.

Quand on l’effectue, les intervalles sont généralement trop étroits. Trois causes en expliquent l’essentiel. L’incertitude sur les paramètres est abandonnée, si bien que l’intervalle reflète la dispersion résiduelle autour d’un seul modèle ajusté plutôt que l’incertitude sur le modèle qui était le bon. L’erreur structurelle est ignorée, car aucun terme du calcul ne représente la possibilité que la forme du modèle soit fausse. Et des observations corrélées sont comptées comme indépendantes, ce qui gonfle la taille d’échantillon effective et resserre chaque intervalle calculé à partir d’elle, un mécanisme détaillé dans l’article sur la représentativité.

La correction ne consiste pas à élargir les intervalles jusqu’à ce qu’ils couvrent, ce qui est le mode d’échec inverse et produit des énoncés trop vagues pour guider une action. Couverture et finesse sont deux axes distincts, et la cible est l’intervalle le plus étroit qui couvre encore à son taux nominal5. Ce qui rend la chose praticable, c’est que les deux se mesurent sur des données mises de côté, avec les découpages déjà construits pour évaluer la prédiction centrale. Une validation qui rapporte la couverture atteinte à côté de la RMSE a répondu à une question qu’un vérificateur est en droit de poser et qu’il ne sait généralement pas formuler.

Ce que les référentiels exigent réellement

Deux questions surgissent chaque fois que ce sujet rencontre un projet réel. Quelqu’un l’exige-t-il, et quelqu’un le vérifie-t-il ? Les réponses courtes : la comptabilité fondée sur des modèles s’accompagne bien d’exigences de validation, ces exigences sont moins précises que la discussion statistique qui précède, et l’écart entre ce qu’exige un référentiel et ce qui rend un chiffre défendable est le lieu où s’exerce l’essentiel du jugement professionnel.

Le cadre du GIEC fixe le vocabulaire. Le niveau 3 (Tier 3) est celui où un inventaire recourt à des modèles ou à la mesure directe plutôt qu’à des facteurs d’émission par défaut, et l’exigence attachée à la version fondée sur des modèles est énoncée sans détour : les inventaires de niveau 3 fondés sur des modèles exigent des mesures pour calibrer et valider les modèles utilisés pour estimer les variations de stocks de carbone20. Les deux moitiés de cet article tiennent dans cette phrase, reliées par un « et » plutôt que traitées comme une seule chose. Des mesures pour calibrer, et des mesures pour valider. Qu’un inventaire donné les maintienne séparées, la phrase ne peut pas l’imposer.

Sur le marché volontaire, les exigences sont plus explicites. La méthodologie de Verra pour l’amélioration de la gestion des terres agricoles autorise un modèle biogéochimique à simuler l’évolution du carbone du sol, et l’assortit de tout un dispositif : un rapport de validation du modèle, évalué par un expert indépendant en modélisation et soumis à nouveau à mesure que les campagnes de mesure ultérieures étendent le jeu de données de calibration et de validation, ainsi qu’une déduction pour incertitude appliquée aux réductions délivrées21. Un module distinct porte les exigences de calibration et de validation elles-mêmes22. La déduction est l’élément qui mérite d’être relevé, car son principe de conception est bon. Elle augmente avec l’erreur type relative de l’estimation, de sorte que l’incertitude n’est pas seulement déclarée mais tarifée, et qu’un projet incapable de démontrer un modèle bien contraint se voit délivrer moins de crédits pour le même carbone mesuré.

Sur la partition elle-même, le module est plus précis que la plupart des praticiens ne s’y attendent, et plus exigeant. Il impose que l’indépendance des données de calibration et de validation soit démontrable, et il précise ce que cela signifie : les jeux de données ne doivent pas se recouper quant au lieu de recherche expérimentale, et ne doivent pas provenir de la même étude expérimentale22. Le découpage d’un ensemble unique est autorisé, et le k-fold est cité comme moyen d’y parvenir, mais la condition d’indépendance s’applique toujours : les blocs doivent donc respecter l’étude et le lieu plutôt qu’être tirés au hasard parmi les lignes. Sur le fond, c’est bien plus proche du leave-site-out que de la mise de côté aléatoire que la plupart des gens imaginent, et une équipe qui s’est contentée d’un k-fold aléatoire sur des placettes groupées n’a pas satisfait l’exigence, si bon que paraisse le chiffre obtenu. La façon dont un vérificateur lit l’affirmation qui en résulte fait l’objet de l’article complémentaire.

Les questions à poser à tout chiffre issu d’un modèle

Rien de ce qui suit n’exige que la personne qui pose les questions soit modélisatrice. Ce sont les questions qui distinguent un chiffre adossé à des preuves d’un chiffre adossé à une citation, et on peut les poser en réunion.

Dix questions

  1. 1Quand vous dites que le modèle est calibré, lequel des quatre sens entendez-vous ?
  2. 2Quelles données ont été tenues à l’écart de l’ajustement, et comment ont-elles été choisies ?
  3. 3En quoi ces données mises de côté sont-elles indépendantes : autre site, autre année, autre région ?
  4. 4Combien de configurations du modèle ont été évaluées avant que celle-ci soit rapportée ?
  5. 5Les données qui ont servi à choisir le modèle sont-elles les mêmes que celles qui servent à rapporter sa performance ?
  6. 6Quel est le biais, séparément de la RMSE, dans l’unité de la grandeur ?
  7. 7Par rapport à quelle référence la performance est-elle mesurée, et le modèle fait-il mieux que la simple prédiction de la moyenne ?
  8. 8Sur le graphique observé contre prédit, quelles sont la pente et l’ordonnée à l’origine ?
  9. 9La couverture de l’incertitude annoncée a-t-elle été vérifiée, et quelle fraction des observations mises de côté se trouvait à l’intérieur ?
  10. 10Les conditions dans lesquelles le modèle sera appliqué se situent-elles dans la gamme sur laquelle il a été calibré ?

Une équipe capable de répondre aux dix a fait le travail. Une équipe qui juge plusieurs d’entre elles déraisonnables vous a, elle aussi, appris quelque chose d’utile.

Les poser ne relève pas de la suspicion. La plupart des chiffres modélisés dans ce domaine sont produits par des gens qui font de leur mieux avec de petits jeux de données et de vraies échéances, et les lacunes tiennent d’ordinaire à des conventions héritées plutôt qu’à des raccourcis délibérés. Mais un chiffre qui entre dans une déclaration, une délivrance de crédits ou un document de politique publique a quitté les mains du modélisateur, et dès lors, la seule chose qui le sépare d’une décision est de savoir si quelqu’un a demandé à quoi il a été confronté.

Points clés

  1. Le mot calibration désigne quatre opérations différentes : rendre un instrument traçable, ajuster un modèle empirique, estimer les paramètres d’un modèle de processus, et calibrer un énoncé probabiliste. Elles échouent de manières différentes, et la plupart des différends sur les modèles validés tiennent à un décalage entre deux d’entre elles.

  2. L’erreur d’entraînement diminue sans limite à mesure qu’un modèle gagne en flexibilité, et ne renseigne en rien sur la prochaine prédiction. Seule l’erreur sur des données tenues à l’écart de l’ajustement le fait.

  3. Le coefficient de détermination calculé sur l’échantillon d’ajustement ne diminue jamais lorsqu’on ajoute un prédicteur, y compris un prédicteur fait de nombres aléatoires. Une allométrie ajustée localement qui bat une allométrie globale sur ses propres arbres de calibration ne prouve rien.

  4. Les données qui servent à choisir un modèle ne peuvent pas aussi mesurer sa performance. Retenir la meilleure de plusieurs configurations sur un même échantillon mis de côté signifie que le score rapporté est en partie le bruit que l’on a sélectionné ; imbriquer la procédure corrige ce défaut sans rien coûter en données.

  5. Le schéma de validation croisée est une affirmation sur la tâche de prédiction. Le k-fold aléatoire, le leave-site-out et la validation temporelle répondent à des questions différentes et ne sont pas comparables : une erreur rapportée sans sa partition ne peut donc pas être interprétée.

  6. Aucune métrique ne suffit seule. Le biais, la dispersion et le gain par rapport à une référence sont des propriétés distinctes, et la corrélation ne mesure aucune d’entre elles : un modèle qui renvoie exactement la moitié de chaque valeur réelle est parfaitement corrélé à la vérité.

  7. Pour les modèles de processus, de nombreux jeux de paramètres s’ajustent à peu près aussi bien à la même trajectoire et divergent sur l’avenir. Propager l’ensemble des jeux acceptables est plus défendable que rapporter la projection du seul meilleur ajustement.

  8. Une incertitude annoncée est une prédiction testable. La couverture atteinte sur des données mises de côté correspond ou non au taux nominal, elle se mesure avec les découpages déjà construits pour l’estimation centrale, et elle n’est presque jamais rapportée.

Références

  • 1.JCGM (Joint Committee for Guides in Metrology) (2012). International vocabulary of metrology: Basic and general concepts and associated terms (VIM), 3rd edition. JCGM 200:2012. Bureau International des Poids et Mesures. bipm.org
  • 2.Viscarra Rossel, R.A., Walvoort, D.J.J., McBratney, A.B. et al. (2006). Visible, near infrared, mid infrared or combined diffuse reflectance spectroscopy for simultaneous assessment of various soil properties. Geoderma, 131(1–2), 59–75. doi:10.1016/j.geoderma.2005.03.007
  • 3.Haefner, J.W. (2005). Modeling Biological Systems: Principles and Applications, 2nd edition. Springer, New York. doi:10.1007/b106568
  • 4.Beven, K., Freer, J. (2001). Equifinality, data assimilation, and uncertainty estimation in mechanistic modelling of complex environmental systems using the GLUE methodology. Journal of Hydrology, 249(1–4), 11–29. doi:10.1016/s0022-1694(01)00421-8
  • 5.Gneiting, T., Balabdaoui, F., Raftery, A.E. (2007). Probabilistic Forecasts, Calibration and Sharpness. Journal of the Royal Statistical Society Series B: Statistical Methodology, 69(2), 243–268. doi:10.1111/j.1467-9868.2007.00587.x
  • 6.Oreskes, N., Shrader-Frechette, K., Belitz, K. (1994). Verification, Validation, and Confirmation of Numerical Models in the Earth Sciences. Science, 263(5147), 641–646. doi:10.1126/science.263.5147.641
  • 7.Wallach, D., Makowski, D., Jones, J.W. et al. (2019). Model evaluation. In: Working with Dynamic Crop Models: Methods, Tools and Examples for Agriculture and Environment, 3rd edition, pp. 311–373. Academic Press. doi:10.1016/B978-0-12-811756-9.00009-5
  • 8.Grant, W.E., Swannack, T.M. (2008). Ecological Modeling: A Common-Sense Approach to Theory and Practice. Blackwell Publishing. ISBN 978-1-4051-6168-8. wiley.com
  • 9.Hastie, T., Tibshirani, R., Friedman, J. (2009). The Elements of Statistical Learning. Springer Series in Statistics. doi:10.1007/978-0-387-84858-7
  • 10.Ploton, P., Mortier, F., Réjou-Méchain, M. et al. (2020). Spatial validation reveals poor predictive performance of large-scale ecological mapping models. Nature Communications, 11(1), 4540. doi:10.1038/s41467-020-18321-y
  • 11.Varma, S., Simon, R. (2006). Bias in error estimation when using cross-validation for model selection. BMC Bioinformatics, 7(1), 91. doi:10.1186/1471-2105-7-91
  • 12.Roberts, D.R., Bahn, V., Ciuti, S. et al. (2017). Cross‐validation strategies for data with temporal, spatial, hierarchical, or phylogenetic structure. Ecography, 40(8), 913–929. doi:10.1111/ecog.02881
  • 13.Nash, J.E., Sutcliffe, J.V. (1970). River flow forecasting through conceptual models part I — A discussion of principles. Journal of Hydrology, 10(3), 282–290. doi:10.1016/0022-1694(70)90255-6
  • 14.Lin, L.I.K. (1989). A Concordance Correlation Coefficient to Evaluate Reproducibility. Biometrics, 45(1), 255. doi:10.2307/2532051
  • 15.Piñeiro, G., Perelman, S., Guerschman, J.P. et al. (2008). How to evaluate models: Observed vs. predicted or predicted vs. observed?. Ecological Modelling, 216(3–4), 316–322. doi:10.1016/j.ecolmodel.2008.05.006
  • 16.Coucheney, E., Buis, S., Launay, M. et al. (2015). Accuracy, robustness and behavior of the STICS soil–crop model for plant, water and nitrogen outputs: Evaluation over a wide range of agro-environmental conditions in France. Environmental Modelling & Software, 64, 177–190. doi:10.1016/j.envsoft.2014.11.024
  • 17.Powlson, D.S., Smith, P., Smith, J.U. (eds.) (1996). Evaluation of Soil Organic Matter Models Using Existing Long-Term Datasets. NATO ASI Series I: Global Environmental Change, vol. 38. Springer, Berlin. doi:10.1007/978-3-642-61094-3
  • 18.Smith, P., Smith, J.U., Powlson, D.S. et al. (1997). A comparison of the performance of nine soil organic matter models using datasets from seven long-term experiments. Geoderma, 81(1–2), 153–225. doi:10.1016/s0016-7061(97)00087-6
  • 19.Kennedy, M.C., O'Hagan, A. (2001). Bayesian Calibration of Computer Models. Journal of the Royal Statistical Society Series B: Statistical Methodology, 63(3), 425–464. doi:10.1111/1467-9868.00294
  • 20.IPCC (2019). 2019 Refinement to the 2006 IPCC Guidelines for National Greenhouse Gas Inventories. Volume 4 (AFOLU), Chapter 2. IPCC, Switzerland. ipcc.ch
  • 21.Verra (2024). VM0042 Methodology for Improved Agricultural Land Management, v2.2. Verified Carbon Standard. Verra, Washington DC. verra.org
  • 22.Verra (2025). VMD0053 Model Calibration, Validation and Uncertainty Guidance for Biogeochemical Modeling for Agricultural Land Management Projects, v2.1. VCS Module, 25 March 2025. Verra, Washington DC. verra.org

Share this article

LinkedInEmail