Un programme d’approvisionnement en cacao établit une référence de carbone organique du sol pour sa première origine. L’équipe prélève des échantillons dans tout le bassin d’approvisionnement, ajuste un modèle qui prédit le stock de carbone à partir de covariables de sol et de paysage, et le valide par validation croisée. Le R² vaut 0,78. Suffisant pour être rapporté. Un an plus tard, le programme s’étend à une deuxième origine dans un autre pays, et réutilise le même modèle pour estimer la nouvelle référence, car le reconstruire coûterait une campagne de terrain que le budget ne peut pas payer. Le vérificateur pose une seule question : quelle preuve avez-vous que la deuxième origine se situe dans la gamme de conditions sur lesquelles le modèle a été calibré ? L’équipe invoque le 0,78. Mais ce nombre décrit la qualité des prédictions du modèle à l’intérieur des conditions de la première origine. Il ne dit rien de la seconde. Le silence se fait dans la salle.
C’est le problème de représentativité que les équipes de suivi rencontrent le plus souvent et nomment le moins clairement. Il ne porte pas vraiment sur l’échantillon. Il porte sur la relation entre trois éléments : où l’on a mesuré, où l’on veut désormais un chiffre, et la portion du monde que le modèle a réellement vue.
Deux questions cachées dans un seul mot
La représentativité recouvre deux affirmations distinctes, et c’est en les confondant que les ennuis commencent. La première affirmation porte sur un échantillon et une population : à savoir que l’échantillon reflète la zone que l’on veut décrire, de sorte qu’une moyenne qui en est tirée soit une estimation juste de la vraie moyenne. C’est le domaine de la conception d’échantillonnage, et le sens que nous développons dans Quelle doit être la taille de votre campagne d’échantillonnage du carbone du sol ? et Signal contre bruit.
La seconde affirmation porte sur un nouveau point et un modèle. La plupart des suivis d’aujourd’hui ne s’arrêtent pas à une moyenne d’échantillon. On ajuste un modèle, une équation allométrique, une carte de carbone du sol, une calibration spectrale, un modèle de processus comme RothC, ou un facteur d’émission par défaut, et on l’applique à des lieux où rien n’a été mesuré. Une prédiction en un nouveau lieu ne vaut que ce que vaut l’expérience qu’a le modèle de conditions semblables à celles de ce lieu. Hors de la gamme de conditions présentes dans les données d’entraînement, le modèle extrapole, et son erreur n’est ni bornée ni chiffrable à partir des statistiques d’ajustement.
Ces deux affirmations correspondent aux deux modes classiques d’inférence. L’inférence fondée sur le plan (design-based) tire sa validité de la façon dont l’échantillon a été sélectionné, et répond à la question de l’échantillon à la population. L’inférence fondée sur le modèle (model-based) tire sa validité du fait que le modèle est correct là où il est appliqué, et répond à la question du nouveau point au modèle 78. Un échantillon peut être un tirage probabiliste exemplaire de sa propre population et malgré tout placer une prédiction bien au-delà de l’expérience d’un modèle emprunté. Les deux questions sont indépendantes, et la seconde est celle qui fait taire la salle.
Le domaine d’applicabilité, défini
Le concept qui gouverne la seconde question a déjà un nom, emprunté à un domaine qui a appris la leçon tôt. En chimie, les modèles quantitatifs structure-activité prédisent les propriétés d’une molécule à partir de sa structure, et les régulateurs ont remarqué que ces modèles produisaient des prédictions assurées et fausses pour des molécules ne ressemblant à rien de ce que contenait le jeu d’entraînement. La réponse a été de définir un domaine d’applicabilité : la région de l’espace des entrées où un modèle produit des prédictions fiables, assortie d’une règle explicite pour décider si un nouveau cas s’y trouve 12.
Le suivi environnemental recourt à la même idée, le plus souvent sans lui donner ce nom. Toute équation allométrique est ajustée sur une gamme de diamètres d’arbres 11, et l’appliquer au-delà de cette gamme est une extrapolation, ce qui explique que la règle pratique consiste à tracer la distribution des diamètres de votre inventaire par rapport à la gamme d’ajustement de l’équation, comme nous le décrivons dans Comment calculer la quantité de carbone dans un arbre ? Une gamme de diamètres est un domaine d’applicabilité à une dimension. Un modèle de sol moderne dépend de nombreuses covariables à la fois, les facteurs SCORPAN que formalise la cartographie numérique des sols 9, et les données d’entraînement occupent un nuage dans cet espace de grande dimension. Le domaine d’applicabilité est la région de cet espace que le nuage couvre réellement, et toute la question devient géométrique : le nouveau point se trouve-t-il à l’intérieur du nuage, ou dans un coin que le modèle n’a jamais visité ?
Votre jeu de calibration couvre-t-il la nouvelle région ?
Tout ce qui précède traite un point à la fois, ce qui est la bonne question quand on s’apprête à rapporter un chiffre pour une exploitation. C’est la mauvaise question quand un programme se demande si un modèle construit dans une origine peut être réutilisé sur toute une deuxième origine. Il s’agit là d’une question portant sur deux distributions, et elle se teste directement, en une après-midi.
Étiquetez 0 chaque échantillon de calibration et 1 chaque site de la zone cible. Jetez les valeurs de carbone du sol et ne gardez que les covariables. Entraînez maintenant un classificateur à distinguer les deux étiquettes, et validez-le par validation croisée. Si le classificateur ne fait pas mieux que le hasard, les deux ensembles sont statistiquement indiscernables sur les variables qu’utilise le modèle, et vos données de calibration constituent un échantillon plausible des conditions de la cible. S’il les sépare facilement, vous avez un décalage de covariables, et vous en tenez désormais une mesure chiffrée plutôt qu’un argument. C’est le test à deux échantillons par classificateur, et la théorie qui autorise à lire une distance entre domaines dans la performance d’un classificateur est plus ancienne que son usage ici 2223.
Le classificateur apporte trois choses qu’un R² mis en avant ne peut pas donner. Sa performance, lue comme l’aire sous la courbe ROC, est le chiffre de synthèse. Ses importances de variables disent quelle covariable est à l’origine du décalage, c’est-à-dire ce sur quoi on agirait effectivement. Et ses probabilités ajustées donnent le rapport de densités entre les deux populations, la quantité qui formalise le décalage de covariables 24 et que l’on retrouve lorsque nous en viendrons à l’incertitude.
ESS = (Σ wi)² / Σ wi²
La seconde ligne est celle à poser devant un client. Repondérer un jeu de calibration vers une nouvelle population cible est une pratique courante 25, mais les poids concentrent le travail sur une poignée d’échantillons de plus en plus réduite, et la taille d’échantillon effective de Kish mesure combien il en reste 26. Un jeu de calibration de 200 échantillons qui, une fois repondéré, tombe à 14 en effectif utile pour la nouvelle région a répondu à la question. Ce chiffre est plus difficile à contester que n’importe quelle statistique d’ajustement, parce qu’il compte les données qui font réellement le travail.
Déplacez les curseurs ci-dessous et observez les trois chiffres bouger ensemble. Deux comportements méritent d’être provoqués délibérément. Éloignez la zone cible du jeu de calibration : le classificateur les sépare, la taille d’échantillon effective s’effondre, et la part de la cible située dans le domaine diminue ; quand l’aire sous la courbe atteint 0,94, soixante-dix échantillons de calibration n’en valent plus que quinze. Remettez ensuite le décalage à zéro et élargissez plutôt la cible. Le classificateur retombe à 0,50, déclarant en apparence les deux ensembles identiques, alors que bien moins de la moitié de la cible se trouve encore dans le domaine.
Ce second cas est la limite honnête de la méthode, et elle compte. Un classificateur linéaire sépare sur la moyenne : il est donc aveugle à une cible qui partage le centre du jeu de calibration et couvre simplement plus de terrain, ce que fait exactement un bassin d’approvisionnement lorsqu’il s’étend à des terrains plus variables. Utilisez un apprenant souple plutôt qu’une régression logistique, et ne lisez jamais le classificateur seul : rapportez-le à côté de la part de la cible qui tombe dans le domaine. Un chiffre détecte un décalage de position, l’autre un décalage de dispersion, et un programme peut souffrir de l’un comme de l’autre.
Pour un plan de suivi, cette part est la phrase qui mérite d’être écrite : non pas « le modèle est applicable », mais « 62 % du nouveau bassin d’approvisionnement tombe à l’intérieur du domaine de calibration, le reste se concentre dans le nord très pluvieux, et voici ce que nous avons fait à ce sujet ».
Comment savoir si un nouveau point est dans le domaine
L’appartenance au domaine est mesurable, et les méthodes forment une échelle plutôt qu’un menu. Chaque échelon corrige un aveuglement précis de celui qui le précède, si bien que la question utile n’est pas de savoir quelle méthode est la meilleure, mais quel aveuglement vous pouvez vous permettre.
Une variable à la fois. Pour chaque covariable, le nouveau site tombe-t-il entre le minimum et le maximum des données d’entraînement ? Cela repère l’extrapolation la plus grossière en cinq minutes. La version publiée de ce contrôle, la surface de similarité environnementale multivariée (MESS), note un site de 0 à 100 selon la profondeur à laquelle sa variable la plus extrême se situe dans la distribution de référence, et devient négative dès qu’une variable sort de la plage de référence, la grandeur donnant alors l’écart en pourcentage de la plage de cette variable 17. Un score de 100 signifie que le point se situe à la médiane des données de référence pour chaque variable.
Sa faiblesse est structurelle : il retient le minimum sur l’ensemble des variables, il n’est donc multivarié qu’à peine. Un point peut se situer confortablement dans la plage de chaque variable et rester une combinaison impossible que le modèle n’a jamais vue, la pluviométrie d’un site humide associée à la teneur en argile d’un site sec. Aucun contrôle variable par variable, si poussé soit-il, ne le détectera.
Les combinaisons inédites. La méthode de détection d’extrapolation (ExDet) sépare explicitement la nouveauté en deux types 16. Son premier indice somme, pour chaque variable, l’écart au-delà de la plage de référence, exprimé en fraction de cette plage, et vaut zéro dès lors que toutes les variables sont dans la plage. Son second indice divise la distance de Mahalanobis d’un point au centroïde de référence par la plus grande de ces distances parmi les données de référence elles-mêmes. Des valeurs supérieures à 1 signifient que le point est plus éloigné du centre du nuage d’entraînement qu’aucun point d’entraînement ne l’a jamais été : une combinaison inédite, invisible à tout contrôle de plage.
NT2 = D²(x, μref) / maxi∈ref D²(xi, μref)
La distance au nuage d’entraînement. Sous les deux précédentes se trouve la distance de Mahalanobis, qui mesure la distance dans les unités de dispersion et de corrélation propres aux données d’entraînement : un pas dans une direction que ces données ont à peine explorée compte donc plus qu’un pas dans une direction qu’elles ont bien couverte. Sa distribution de référence est un khi-deux à autant de degrés de liberté que de covariables, ce qui donne un seuil plutôt qu’une impression : signalez tout ce qui dépasse le 95e percentile. Pour un modèle linéaire, la même idée apparaît sous la forme de l’effet levier, la diagonale de la matrice chapeau, avec la ligne d’alerte classique à trois fois le levier moyen, et le graphique du levier en fonction du résidu standardisé est le diagnostic qu’utilisent réellement les régulateurs de la discipline qui a donné son nom au domaine d’applicabilité 1210.
h(x) = xᵀ (XᵀX)−1 x signaler si h > 3p / n
Deux réserves décident si cela fonctionne en pratique. La matrice de covariance doit être estimée de façon robuste, car une poignée de points d’entraînement atypiques la gonflent, et la matrice gonflée déclare alors que tout est dans le domaine. Et elle s’inverse mal quand les covariables sont colinéaires ou nombreuses, ce que les covariables de sol sont immanquablement : travaillez donc dans l’espace des composantes principales retenues, ou utilisez un estimateur à rétrécissement. Lorsque les variables mêlent continu et catégoriel, la distance de Gower et les simples distances aux plus proches voisins constituent le repli non paramétrique robuste.
L’aire d’applicabilité, pour les cartes. Quand le modèle produit une carte continue, la question est spatiale : à quels pixels le modèle peut-il être appliqué ? La méthode de l’aire d’applicabilité répond exactement à cela 3. Elle standardise les covariables, pondère chacune par son importance dans le modèle ajusté, mesure dans cet espace pondéré la distance de chaque pixel au point d’entraînement le plus proche, et la divise par la moyenne de toutes les distances entre paires de points d’entraînement. Les pixels au-delà d’un seuil dérivé des dissimilarités propres aux données d’entraînement sont hors de l’aire d’applicabilité, et l’erreur rapportée du modèle ne s’y applique pas. Une carte régionale peut paraître complète et faire autorité, alors que de larges portions en sont, selon cette mesure, hors domaine 4.
seuil = plus grand DI non aberrant parmi les données d’entraînement en validation croisée
Ce seuil mérite d’être énoncé avec précision, car il est très souvent mal cité. C’est le maximum, valeurs aberrantes retirées, des indices de dissimilarité des points d’entraînement eux-mêmes. L’expression familière de la moustache supérieure, le 75e percentile plus 1,5 fois l’écart interquartile, est la règle qui décide quelles valeurs comptent comme aberrantes, et non le seuil lui-même. La préversion qui circule librement indique encore une autre règle, le quantile 0,95, modifiée lors de l’évaluation par les pairs ; c’est la version publiée qu’il faut mettre en œuvre.
Quel appui, et pas seulement quelle proximité. L’indice de dissimilarité ne regarde que le point d’entraînement le plus proche : il ne peut donc pas distinguer un site soutenu par un unique échantillon isolé d’un site adossé à deux cents. Compter combien de points d’entraînement tombent à l’intérieur de la distance seuil d’un site comble ce manque, et ce décompte est corrélé à la qualité réelle des prédictions du modèle en ce lieu 15. C’est une mesure a posteriori qui ne coûte rien de plus une fois les distances calculées, et c’est la différence entre « dans le domaine » et « dans le domaine, et bien étayé ».
Les calibrations spectrales ont leur propre version. Si le carbone du sol est prédit à partir de spectres dans le moyen infrarouge plutôt que de covariables, l’analyse en composantes principales du jeu de calibration définit l’espace qu’elle connaît, et deux statistiques sont nécessaires ensemble plutôt que séparément. Le T² de Hotelling mesure à quelle distance du centre un nouveau spectre se situe à l’intérieur de cet espace ; le résidu Q mesure à quelle distance il se situe à l’extérieur, dans des directions que la calibration n’a jamais modélisées. Un échantillon peut passer l’un ou l’autre pris isolément et rester un échantillon que la calibration n’a jamais appris à lire.
| Contrôle | Détecte | Manque |
|---|---|---|
| Plage variable par variable // MESS | Toute variable hors de sa plage calibrée | Les combinaisons inédites de variables pourtant dans la plage |
| ExDet NT1 + NT2 | La nouveauté de plage et les combinaisons inédites, séparément | Quelle direction de l’espace des covariables manque d’appui |
| Mahalanobis // effet levier | La distance au nuage, dans les unités de sa propre dispersion | Les trous locaux à l’intérieur de l’enveloppe globale |
| Aire d’applicabilité | La distance par pixel, pondérée par l’importance des covariables | Combien de points d’entraînement fournissent l’appui |
| Densité locale des points de données | Un appui ténu dans une région nominalement couverte | Si la relation elle-même a changé |
| T² de Hotelling + Q | Les spectres différents de la calibration, dans et hors de son espace | Rien, si les deux sont lus ensemble |
Le piège de la validation : pourquoi un bon R² peut mentir
Il existe une manière bien précise dont cela tourne mal, et elle flatte le praticien. Quand un modèle est validé par une validation croisée aléatoire ordinaire, les points mis de côté sont dispersés parmi les points d’entraînement. Si les données sont spatialement autocorrélées, et les données de sol et de végétation le sont presque toujours, alors chaque point mis de côté a un proche voisin dans le jeu d’entraînement. Le modèle est testé presque entièrement à l’intérieur de son domaine, sur des points faciles. La validation à structure spatiale, qui met de côté des blocs entiers d’espace, révèle de façon répétée que des modèles aux excellents scores de validation croisée aléatoire prédisent mal dès qu’ils doivent s’aventurer plus loin 56. Une carte régionale peut être sans biais en moyenne sur toute son étendue et rester fausse pour chaque projet individuel qu’elle recouvre.
La réponse honnête n’est pas simplement de remplacer la validation croisée aléatoire par la validation spatiale et de passer à autre chose, car le bon plan de validation est lui-même débattu : le blocage spatial peut être pessimiste s’il met de côté des régions que l’on ne demanderait jamais au modèle de prédire, et l’option la plus défendable, quand le budget le permet, est un échantillon de validation distinct tiré par échantillonnage probabiliste dans la zone cible, qui estime la précision de la carte sans s’appuyer le moins du monde sur le modèle 78. Le point qui survit au débat est plus simple : un chiffre de précision n’a de sens qu’accompagné d’un énoncé indiquant où, dans l’espace des covariables et l’espace géographique, il a été mesuré, et si le lieu où l’on veut désormais une prédiction y ressemble.
Il existe désormais une réponse plus fine que de choisir un camp. Plutôt que de découper l’espace en blocs arbitraires, ajustez la validation à la prédiction : mettez de côté des points de sorte que la distribution des distances entre point de test et données d’entraînement ressemble à la distribution des distances entre les lieux que vous prédirez réellement et ces mêmes données 13. La validation croisée mesure alors la portée que l’on demandera vraiment au modèle, sans être flattée par des voisins proches ni pénalisée pour des régions dont personne ne se soucie. La formulation d’origine retirait un point à la fois et ne passait pas à l’échelle ; la version en k blocs ramène un jeu de données groupé de quatre mille points de plusieurs jours à environ une minute 14, ce qui compte, car la raison habituelle pour laquelle les équipes se rabattent sur la validation croisée aléatoire est que l’option honnête était hors de portée en calcul. Les échantillons groupés demandent des précautions qui leur sont propres 39.
Ce que « gonfler l’incertitude » devrait vouloir dire
Le conseil d’élargir les barres d’erreur pour les points limites est facile à donner et difficile à suivre. L’élargir de combien ? Il existe une réponse rigoureuse, et ses limites sont aussi instructives que ses garanties.
La prédiction conforme par découpage (split conformal) construit un intervalle à partir de résidus mis de côté plutôt qu’à partir d’une hypothèse quelconque sur la forme des erreurs 18. Ajustez le modèle sur une partie des données, calculez les résidus absolus sur un jeu de calibration mis de côté, et prenez une statistique d’ordre précise de ces résidus comme demi-largeur de l’intervalle. L’intervalle obtenu couvre la vérité au moins 1 − α du temps, à taille d’échantillon finie, sans la moindre hypothèse de distribution.
n ≥ ⌈1/α⌉ − 1 un intervalle à 95 % exige donc au moins 19 points de calibration
La seconde ligne n’est pas un détail technique. En dessous de ce nombre de points de calibration, la méthode renvoie un intervalle de largeur infinie, sa façon honnête de dire que les données ne peuvent pas soutenir ce qu’on leur demande d’affirmer. Une méthode qui refuse de répondre quand elle ne le peut pas vaut mieux, pour un programme de suivi, qu’une méthode qui produit toujours un chiffre.
Une demi-largeur constante sur tout un projet est rarement ce que l’on veut, et le remède est standard : mesurez la conformité par rapport à des quantiles ajustés plutôt qu’à une moyenne ajustée, et l’intervalle s’adapte au degré d’incertitude du modèle en chaque lieu tout en conservant la garantie de couverture 20. Les sites dans des conditions bien échantillonnées obtiennent des intervalles serrés, les sites délicats des intervalles larges, et personne n’a à choisir le facteur de gonflement à la main.
Voici le piège, et c’est tout le sujet de cet article. Cette garantie ne tient que si les points de calibration et le nouveau point sont échangeables, ce que passer à une nouvelle région brise précisément. La prédiction conforme n’est pas une échappatoire au problème du domaine. Appliquée naïvement de part et d’autre d’une frontière de domaine, elle produit des intervalles qui paraissent rigoureux et ne le sont pas.
Ce qui la sauve est la quantité que nous avons déjà construite. Si vous connaissez le rapport de densités entre la population cible et la population de calibration, vous pouvez en pondérer chaque résidu de calibration et retrouver la garantie sous décalage de covariables 19. Le mécanisme est élégant : le nouveau point apporte son propre poids au quantile, de sorte qu’à mesure qu’il s’enfonce dans un territoire que les données de calibration couvrent à peine, une part croissante de la masse de probabilité se place à l’infini et l’intervalle s’élargit de lui-même, devenant non borné dès que ce poids dépasse α. C’est le classificateur de la section sur la couverture qui fournit ce rapport, et c’est pourquoi les deux sections vont de pair. Une réserve honnête : la garantie n’est exacte que si le rapport est connu, or en pratique il est estimé ; traitez donc la couverture comme approchée, et se dégradant avec la qualité de cette estimation.
Une limite plus dure mérite d’être connue avant que quiconque ne la promette. Une couverture conditionnelle aux valeurs exactes des covariables d’un site ne peut pas être obtenue de façon non triviale pour des covariables continues : toute procédure qui la revendique doit renvoyer des intervalles de largeur infinie 21. Le compromis praticable consiste à garantir la couverture à l’intérieur de strates déclarées à l’avance, par région, par texture de sol ou par usage des terres, chacune avec son propre jeu de calibration. C’est la bonne forme pour le MRV, et cela porte une conséquence opérationnelle : une région peu échantillonnée reçoit une garantie grossière ou aucune garantie, ce qui est une information plutôt qu’un défaut.
Une règle de décision que l’on peut défendre
Mis bout à bout, le test de domaine est un flux de travail court et reproductible qui tient sur une page d’un plan de suivi. Définir le domaine de calibration (la distribution multivariée des covariables dans les données d’entraînement). Situer chaque nouveau point par rapport à lui : d’abord le contrôle de plage variable par variable, puis une métrique de distance. Le classer comme dans le domaine, limite, ou hors domaine par rapport à des seuils fixés à l’avance. Puis agir selon la classe : les points dans le domaine reçoivent la prédiction telle quelle ; les points limites la reçoivent avec une incertitude explicitement gonflée et un signalement ; les points hors domaine ne reçoivent aucun chiffre emprunté, ils déclenchent un échantillonnage de référence local et une réestimation.
L’intérêt de l’écrire est que cela transforme un argument (« nous pensons que la nouvelle région est assez semblable ») en preuve (« voici où tombe chaque nouveau point, et voici la règle que nous avons appliquée »). C’est la différence entre une affirmation qu’un vérificateur accepte et une qu’il sonde.
Un exemple traité : un modèle, deux régions
Un modèle de carbone du sol est calibré sur des exploitations en plein soleil et sous ombrage léger d’une région d’approvisionnement. L’approvisionnement s’étend à une deuxième région d’agroforesterie ombragée de longue date. Cinq des covariables du modèle, comparées au site représentatif de la nouvelle région :
| Covariable | Plage de calibration (A) | Nouveau site (B) | Dans la plage ? |
|---|---|---|---|
| Argile (%) | 12–34 | 41 | Non (au-dessus) |
| Pluviométrie annuelle moyenne (mm) | 900–1500 | 1850 | Non (au-dessus) |
| Température annuelle moyenne (°C) | 23–27 | 25 | Oui |
| Altitude (m) | 40–320 | 180 | Oui |
| Couvert d’ombrage (%) | 0–15 | 55 | Non (au-dessus) |
Trois covariables sur cinq tombent hors de la plage calibrée, et les deux qui comptent le plus pour le carbone, la pluviométrie et l’ombrage, en font partie. Une distance de Mahalanobis ou un indice d’aire d’applicabilité placerait ce site bien au-delà du nuage d’entraînement. Le verdict est sans ambiguïté : le modèle est hors domaine ici, et l’appliquer reviendrait à rapporter un chiffre sans aucun appui. C’est le même constat, en miniature, que celui auquel parviennent des évaluations indépendantes à l’échelle continentale, où des relations de carbone du sol calibrées sur des systèmes tempérés de grandes cultures ne se transfèrent pas à des systèmes pérennes ombragés sans réestimation locale. Nous abordons le choix du modèle et la recalibration locale dans Comment modéliser l’évolution du carbone du sol dans le temps ?
Quand la réponse est « hors domaine » : étendre le domaine à moindre coût
« Déclencher un échantillonnage local » est l’endroit où s’arrêtent la plupart des traitements de ce sujet, et c’est le moment où un responsable de programme a le plus besoin d’aide. La bonne nouvelle est qu’étendre un domaine coûte bien moins cher que d’en construire un, et que les nombres en jeu sont étonnamment petits.
Choisissez les nouveaux points pour couvrir l’espace, non pour imiter la population. L’échantillonnage par hypercube latin conditionné, l’option par défaut en cartographie numérique des sols, sélectionne les sites de sorte que l’échantillon reproduise les distributions marginales des covariables et leurs corrélations 29. L’échantillonnage de couverture, lui, partitionne la zone cible en grappes dans l’espace des covariables et prélève près de chaque centre de grappe, couvrant l’espace conjoint plutôt que d’en reproduire les marges 30. Pour calibrer un modèle, c’est en général la couverture que l’on veut, et une comparaison recommande d’étaler l’échantillon dans l’espace des covariables les plus importantes 31.
Méfiez-vous de quiconque vous vend un vainqueur net entre les deux. Les résultats sont réellement partagés : l’échantillonnage de couverture l’emporte en moyenne dans certaines comparaisons, l’hypercube latin l’emporte aux petites tailles d’échantillon dans d’autres, et dans la plupart d’entre elles la taille d’échantillon compte plus que le choix de la méthode. Les comparaisons fondées sur une seule réalisation de chaque plan sont à peu près sans information, car les distributions de résultats se recouvrent largement.
Il n’est souvent pas nécessaire de reconstruire le modèle. La spectroscopie du sol l’a appris la première : une grande bibliothèque qui échoue localement peut être réparée en lui ajoutant une poignée d’échantillons locaux, une pratique appelée dopage (spiking). Les chiffres de la littérature sont cohérents et faibles : une quinzaine d’échantillons locaux réduisent nettement le biais de prédiction 32, douze ont fait passer la performance d’un modèle régional d’un R² de 0,07 à 0,36 à un R² de 0,69 à 0,86 33, et douze à vingt échantillons locaux associés à une grande bibliothèque ont égalé des calibrations propres au site construites sur jusqu’à trois cents échantillons 34. Dix à trente échantillons bien choisis constituent la fourchette de travail.
La même économie se retrouve en allométrie. En utilisant des équations publiées comme lois a priori plutôt qu’en repartant de zéro, six arbres suffisent à estimer les paramètres aussi bien que quarante à soixante dans l’approche classique 35. C’est la mutualisation partielle qui fait le travail : le modèle emprunté fournit la forme, les données locales le tirent vers la vérité locale, et la composante de variance inter-sites est elle-même une mesure du caractère transférable de la relation au départ.
Si vous n’avez les moyens que de tester, testez le biais. Un petit échantillon local qui ne peut pas soutenir un réajustement peut tout de même dire si le modèle emprunté se trompe systématiquement ici. C’est une comparaison à deux échantillons, et elle utilise la même formule de puissance que n’importe quel plan de détection de changement, que nous développons dans Quelle doit être la taille de votre campagne d’échantillonnage du carbone du sol ? En substituant le biais qui vous importerait à la différence minimale détectable, on obtient le nombre d’échantillons locaux nécessaires pour le repérer.
Un résultat contre-intuitif mérite sa place dans toute décision de transfert. Lorsque des fonctions de pédotransfert ont été transposées dans une nouvelle région, celles construites sur le sable et l’argile seuls ont fait mieux que les versions utilisant onze covariables 38. Plus de prédicteurs, c’est un espace de plus grande dimension, un nuage d’entraînement plus clairsemé, et davantage de façons pour un nouveau site d’en sortir. La parcimonie n’est pas seulement une préférence esthétique ; c’est une stratégie de domaine. Le coût d’une erreur sur ce point est bien documenté : des équations pantropicales ont surestimé la biomasse d’environ 40 % sur un site d’Afrique centrale 36, et les équations construites sur de petits échantillons portent un biais moyen à l’échelle du site proche de +70 %, s’échelonnant de −4 % à +193 % 37.
Le rééchantillonnage, et le domaine qui se déplace
Il existe une deuxième façon, plus discrète, dont la représentativité échoue, et elle se manifeste précisément quand un programme fait tout le reste correctement. Le suivi repose sur le rééchantillonnage : revisiter le même réseau au fil du temps, comparer, et rapporter le changement. L’hypothèse non dite est que le réseau reste représentatif du système qu’il surveille. Les systèmes bougent. La gestion change, un programme d’ombrage arrive à maturité, une sécheresse remodèle le régime d’humidité du sol, l’usage des terres se déplace en bordure du bassin d’approvisionnement. Un modèle calibré une fois sur le système d’origine peut glisser hors du domaine par rapport au système qui existe désormais, sans que personne ne relance de contrôle. Les statisticiens appellent cela un décalage de covariables ou une dérive de concept ; sur le terrain, cela ressemble à une référence qui cesse discrètement de décrire le présent.
La dérive se teste avec l’instrument déjà présenté. Faites tourner le classificateur de domaine entre cycles de suivi plutôt qu’entre régions : étiquetez 0 les covariables du premier cycle et 1 celles du second, et voyez si un classificateur sait distinguer les années. S’il y parvient, le système s’est déplacé par rapport au modèle, et les importances de variables nomment ce qui a bougé. Cela ne coûte rien de plus que des covariables déjà en votre possession, et cela transforme une mise en garde en contrôle programmé.
Pourquoi les vérificateurs commencent à poser la question
L’affirmation selon laquelle le suivi environnemental recourt à cette idée sans la nommer appelle une correction, et elle est utile. La VM0042 de Verra la nomme. Sa section de définitions définit un domaine de projet comme l’ensemble des conditions, type de culture, texture de sol et climat compris, dans lesquelles l’application du modèle a été validée 40. Le domaine d’applicabilité n’est pas ici une abstraction empruntée à la chimie ; c’est un terme défini dans la méthodologie selon laquelle est rédigée une large part des projets de carbone du sol.
Son module compagnon transforme la définition en un test auditable. Chaque zone climatique ou région agricole définie au niveau national que le projet déclare doit figurer dans le jeu de données de validation ; les trois classes texturales de sol censées dominer la zone de projet doivent y être incluses ; et les données doivent couvrir 15 points de pourcentage de teneur en argile. Le module énonce clairement son objectif : confirmer que le modèle n’a pas été hypercalibré sur une seule combinaison de conditions puis appliqué ailleurs. Deux limites méritent d’être énoncées avec exactitude : l’exigence porte sur la quantification par mesure et modélisation, et non sur la délivrance de crédits fondée sur la seule mesure, et elle ne fixe aucun nombre minimal de sites. La discipline porte sur la couverture, pas sur la taille d’échantillon.
Le reste du paysage est plus souple, et il vaut mieux ne pas le surestimer. Le GIEC en fait une bonne pratique à l’échelle nationale, en recommandant que les modèles de niveau 3 soient calibrés et testés face à des mesures reflétant la variabilité de climat, de sol et d’usage des terres sur laquelle ils seront appliqués. Le règlement européen sur les absorptions de carbone, malgré des affirmations fréquentes en sens inverse, n’impose aucune exigence de validation de modèle : son obligation de représentativité porte sur la référence, et le fond est renvoyé à des actes délégués encore à venir. Quiconque l’invoque à cette fin ne l’a pas lu.
Ce n’est plus seulement une subtilité méthodologique. Les cadres comptables qui gouvernent les allégations sur le carbone convergent vers l’exigence que l’incertitude soit quantifiée et divulguée, et une prédiction appliquée hors du domaine d’un modèle est une incertitude qui a été dissimulée plutôt que quantifiée. Les lignes directrices GHG Protocol Land Sector and Removals, en vigueur au 1ᵉʳ janvier 2027, demandent aux entreprises de calibrer les approches fondées sur des modèles ou sur la télédétection avec des données empiriques propres au terrain et aux pratiques analysées, et, lorsqu’il s’agit d’absorptions, cette recommandation devient une exigence, avec un rééchantillonnage au moins tous les cinq ans. L’Affinement 2019 du GIEC pousse vers des facteurs de niveau supérieur, adaptés localement, plutôt que des valeurs par défaut empruntées, précisément parce que ces valeurs par défaut sont hors domaine pour bon nombre des lieux où on les applique 12. Les vérificateurs commencent à demander une validation à structure spatiale ou indépendante plutôt qu’un simple R² mis en avant, et des preuves qu’un modèle réutilisé convient au site sur lequel on le réutilise. Les équipes qui sauront répondre à ces questions sont celles qui ont testé l’appartenance au domaine avant qu’on le leur demande, et qui peuvent en apporter la preuve.
Points clés
La représentativité porte deux questions distinctes : l’échantillon est-il représentatif de la population (conception d’échantillonnage), et un nouveau point est-il à l’intérieur du domaine calibré du modèle (applicabilité). La seconde est celle que la plupart des programmes laissent de côté.
Un échantillon peut être parfaitement représentatif de sa propre population et tomber malgré tout hors du domaine d’applicabilité d’un modèle emprunté. Les deux sont indépendants.
Le domaine d’applicabilité est la région de l’espace des covariables que les données d’entraînement couvrent réellement. La gamme de diamètres d’une équation allométrique est cette idée à une dimension ; le domaine d’une carte de carbone du sol est la même idée en plusieurs.
Pour une région entière plutôt qu’un point, entraînez un classificateur à séparer les échantillons de calibration des sites cibles à partir des seules covariables. Une AUC proche de 0,5 signifie que les ensembles sont indiscernables ; la taille d’échantillon effective des poids obtenus dit combien d’échantillons de calibration font réellement le travail.
Lisez ce classificateur à côté de la part de la cible située dans le domaine. Un classificateur linéaire sépare sur la moyenne : il est donc aveugle à une cible qui partage le centre de la calibration et couvre simplement plus de terrain.
L’appartenance au domaine est une échelle, chaque échelon corrigeant un aveuglement de celui qui le précède : la plage variable par variable et le MESS, puis la séparation opérée par ExDet entre nouveauté de plage et combinaisons inédites, puis la distance de Mahalanobis face à un seuil du khi-deux, puis l’aire d’applicabilité pour les cartes, puis la densité locale des points de données pour savoir de quel appui on dispose.
Le seuil de l’aire d’applicabilité est le maximum, valeurs aberrantes retirées, des indices de dissimilarité propres aux données d’entraînement. L’expression de la moustache supérieure est la règle des valeurs aberrantes, pas le seuil, et la préversion qui circule librement indique une règle différente de celle de l’article publié.
Un score élevé de validation croisée aléatoire peut être un artefact de l’autocorrélation spatiale. Ajustez la validation à la prédiction par appariement des distances aux plus proches voisins, ou utilisez un échantillon probabiliste indépendant, et indiquez toujours où la précision a été mesurée.
« Gonfler l’incertitude » a une forme rigoureuse : la prédiction conforme donne des intervalles sans hypothèse de distribution, mais seulement sous échangeabilité, que brise le passage à une nouvelle région. Pondérer par le rapport de densités rétablit la garantie, et les barres d’erreur du modèle lui-même n’aideront pas : les forêts de régression quantile se resserrent au bord de la gamme d’entraînement au lieu de s’élargir.
Étendre un domaine coûte peu. Dix à trente échantillons locaux bien choisis réparent une calibration spectrale empruntée ; six arbres assortis de lois a priori informatives en valent quarante à soixante sans elles. Moins de covariables se transfèrent souvent mieux, car il est plus facile de sortir d’un nuage clairsemé en grande dimension.
La VM0042 de Verra définit déjà un domaine de projet comme les conditions dans lesquelles l’application du modèle a été validée, et son module compagnon rend auditable la couverture des zones climatiques, des textures de sol et d’un intervalle de 15 points d’argile. Le règlement européen sur les absorptions de carbone, contrairement à ce qu’on affirme souvent, n’exige rien de tel.
Références
- 1.Netzeva, T.I. et al. (2005). Current status of methods for defining the applicability domain of (quantitative) structure-activity relationships. ATLA Alternatives to Laboratory Animals, 33(2), 155–173. doi:10.1177/026119290503300209
- 2.Jaworska, J., Nikolova-Jeliazkova, N., Aldenberg, T. (2005). QSAR applicability domain estimation by projection of the training set in descriptor space, a review. ATLA, 33(5), 445–459. doi:10.1177/026119290503300508
- 3.Meyer, H., Pebesma, E. (2021). Predicting into unknown space? Estimating the area of applicability of spatial prediction models. Methods in Ecology and Evolution, 12(9), 1620–1633. doi:10.1111/2041-210X.13650
- 4.Meyer, H., Pebesma, E. (2022). Machine learning-based global maps of ecological variables and the challenge of assessing them. Nature Communications, 13, 2208. doi:10.1038/s41467-022-29838-9
- 5.Ploton, P. et al. (2020). Spatial validation reveals poor predictive performance of large-scale ecological mapping models. Nature Communications, 11, 4540. doi:10.1038/s41467-020-18321-y
- 6.Roberts, D.R. et al. (2017). Cross-validation strategies for data with temporal, spatial, hierarchical, or phylogenetic structure. Ecography, 40(8), 913–929. doi:10.1111/ecog.02881
- 7.Wadoux, A.M.J-C., Heuvelink, G.B.M., de Bruin, S., Brus, D.J. (2021). Spatial cross-validation is not the right way to evaluate map accuracy. Ecological Modelling, 457, 109692. doi:10.1016/j.ecolmodel.2021.109692
- 8.Brus, D.J., Kempen, B., Heuvelink, G.B.M. (2011). Sampling for validation of digital soil maps. European Journal of Soil Science, 62(3), 394–407. doi:10.1111/j.1365-2389.2011.01364.x
- 9.McBratney, A.B., Mendonça Santos, M.L., Minasny, B. (2003). On digital soil mapping. Geoderma, 117(1–2), 3–52. doi:10.1016/S0016-7061(03)00223-4
- 10.Sheridan, R.P. et al. (2004). Similarity to molecules in the training set is a good discriminator for prediction accuracy in QSAR. Journal of Chemical Information and Computer Sciences, 44(6), 1912–1928. doi:10.1021/ci049782w
- 11.Chave, J. et al. (2014). Improved allometric models to estimate the aboveground biomass of tropical trees. Global Change Biology, 20(10), 3177–3190. doi:10.1111/gcb.12629
- 12.IPCC (2019). 2019 Refinement to the 2006 IPCC Guidelines for National Greenhouse Gas Inventories. Intergovernmental Panel on Climate Change. ipcc.ch
- 13.Milà, C., Mateu, J., Pebesma, E., Meyer, H. (2022). Nearest neighbour distance matching Leave-One-Out Cross-Validation for map validation. Methods in Ecology and Evolution, 13(6), 1304–1316. doi:10.1111/2041-210X.13851
- 14.Linnenbrink, J., Milà, C., Ludwig, M., Meyer, H. (2024). kNNDM CV: k-fold nearest-neighbour distance matching cross-validation for map accuracy estimation. Geoscientific Model Development, 17(15), 5897–5912. doi:10.5194/gmd-17-5897-2024
- 15.Schumacher, F.L., Knoth, C., Ludwig, M., Meyer, H. (2025). Estimation of local training data point densities to support the assessment of spatial prediction uncertainty. Geoscientific Model Development, 18(24), 10185–10202. doi:10.5194/gmd-18-10185-2025
- 16.Mesgaran, M.B., Cousens, R.D., Webber, B.L. (2014). Here be dragons: a tool for quantifying novelty due to covariate range and correlation change when projecting species distribution models. Diversity and Distributions, 20(10), 1147–1159. doi:10.1111/ddi.12209
- 17.Elith, J., Kearney, M., Phillips, S. (2010). The art of modelling range-shifting species. Methods in Ecology and Evolution, 1(4), 330–342. doi:10.1111/j.2041-210X.2010.00036.x
- 18.Lei, J., G'Sell, M., Rinaldo, A., Tibshirani, R.J., Wasserman, L. (2018). Distribution-free predictive inference for regression. Journal of the American Statistical Association, 113(523), 1094–1111. doi:10.1080/01621459.2017.1307116
- 19.Tibshirani, R.J., Foygel Barber, R., Candès, E.J., Ramdas, A. (2019). Conformal prediction under covariate shift. Advances in Neural Information Processing Systems 32. arXiv:1904.06019
- 20.Romano, Y., Patterson, E., Candès, E.J. (2019). Conformalized quantile regression. Advances in Neural Information Processing Systems 32. arXiv:1905.03222
- 21.Vovk, V. (2012). Conditional validity of inductive conformal predictors. Proceedings of the Asian Conference on Machine Learning, PMLR 25, 475–490. proceedings.mlr.press
- 22.Lopez-Paz, D., Oquab, M. (2017). Revisiting classifier two-sample tests. International Conference on Learning Representations. arXiv:1610.06545
- 23.Ben-David, S., Blitzer, J., Crammer, K., Kulesza, A., Pereira, F., Vaughan, J.W. (2010). A theory of learning from different domains. Machine Learning, 79(1–2), 151–175. doi:10.1007/s10994-009-5152-4
- 24.Shimodaira, H. (2000). Improving predictive inference under covariate shift by weighting the log-likelihood function. Journal of Statistical Planning and Inference, 90(2), 227–244. doi:10.1016/S0378-3758(00)00115-4
- 25.Sugiyama, M., Suzuki, T., Nakajima, S., Kashima, H., von Bünau, P., Kawanabe, M. (2008). Direct importance estimation for covariate shift adaptation. Annals of the Institute of Statistical Mathematics, 60(4), 699–746. doi:10.1007/s10463-008-0197-x
- 26.Kish, L. (1965). Survey Sampling. John Wiley & Sons, New York. The effective sample size used here is the algebraic restatement of Kish's unequal-weighting design effect.
- 27.Dega, S., Dietrich, P., Schrön, M., Paasche, H. (2023). Probabilistic prediction by means of the propagation of response variable uncertainty through a Monte Carlo approach in regression random forest. Frontiers in Environmental Science, 11, 1009191. doi:10.3389/fenvs.2023.1009191
- 28.Hateffard, F., Steinbuch, L., Heuvelink, G.B.M. (2024). Evaluating the extrapolation potential of random forest digital soil mapping. Geoderma, 441, 116740. doi:10.1016/j.geoderma.2023.116740
- 29.Minasny, B., McBratney, A.B. (2006). A conditioned Latin hypercube method for sampling in the presence of ancillary information. Computers & Geosciences, 32(9), 1378–1388. doi:10.1016/j.cageo.2005.12.009
- 30.Ma, T., Brus, D.J., Zhu, A.-X., Zhang, L., Scholten, T. (2020). Comparison of conditioned Latin hypercube and feature space coverage sampling for predicting soil classes using simulation from soil maps. Geoderma, 370, 114366. doi:10.1016/j.geoderma.2020.114366
- 31.Wadoux, A.M.J-C., Brus, D.J., Heuvelink, G.B.M. (2019). Sampling design optimization for soil mapping with a random forest. Geoderma, 355, 113913. doi:10.1016/j.geoderma.2019.113913
- 32.Seidel, M. et al. (2019). Strategies for the efficient estimation of soil organic carbon at the field scale with vis-NIR spectroscopy: Spectral libraries and spiking vs. local calibrations. Geoderma, 354, 113856. doi:10.1016/j.geoderma.2019.07.014
- 33.Guy, A.L., Siciliano, S.D., Lamb, E.G. (2015). Spiking regional vis-NIR calibration models with local samples to predict soil organic carbon in two High Arctic polar deserts using a vis-NIR probe. Canadian Journal of Soil Science, 95(3), 237–249. doi:10.4141/cjss-2015-004
- 34.Lobsey, C.R., Viscarra Rossel, R.A., Roudier, P., Hedley, C.B. (2017). rs-local data-mines information from spectral libraries to improve local calibrations. European Journal of Soil Science, 68(6), 840–852. doi:10.1111/ejss.12490
- 35.Zapata-Cuartas, M., Sierra, C.A., Alleman, L. (2012). Probability distribution of allometric coefficients and Bayesian estimation of aboveground tree biomass. Forest Ecology and Management, 277, 173–179. doi:10.1016/j.foreco.2012.04.030
- 36.Ngomanda, A. et al. (2014). Site-specific versus pantropical allometric equations: Which option to estimate the biomass of a moist central African forest?. Forest Ecology and Management, 312, 1–9. doi:10.1016/j.foreco.2013.10.029
- 37.Duncanson, L., Rourke, O., Dubayah, R. (2015). Small sample sizes yield biased allometric equations in temperate forests. Scientific Reports, 5, 17153. doi:10.1038/srep17153
- 38.Schoch, J., Nussbaum, M., Walthert, L., Carminati, A., Lehmann, P. (2025). Transferability of pedotransfer functions for estimating soil hydraulic properties: An analysis of controlling factors for forest soils in Switzerland. Geoderma, 460, 117397. doi:10.1016/j.geoderma.2025.117397
- 39.de Bruin, S., Brus, D.J., Heuvelink, G.B.M., van Ebbenhorst Tengbergen, T., Wadoux, A.M.J.-C. (2022). Dealing with clustered samples for assessing map accuracy by cross-validation. Ecological Informatics, 69, 101665. doi:10.1016/j.ecoinf.2022.101665
- 40.Verra (2025). VM0042 Methodology for Improved Agricultural Land Management, v2.2, and VMD0053 Model Calibration, Validation and Uncertainty Guidance for Biogeochemical Modeling, v2.1. Verified Carbon Standard. verra.org
- 41.Meinshausen, N. (2006). Quantile regression forests. Journal of Machine Learning Research, 7(35), 983–999. jmlr.org