10 DE JULIO DE 2026

¿Representativa de qué? Cuando una nueva muestra queda fuera del dominio de tu modelo

Resumen

«Toma una muestra representativa» encierra dos tareas distintas: si una muestra refleja el área que quieres describir, y si una nueva ubicación se sitúa dentro de las condiciones que un modelo calibrado ha visto realmente. La segunda pregunta, el dominio de aplicabilidad, es la que la mayoría de los programas de monitoreo pasan por alto. Cómo comprobar si tu conjunto de calibración cubre una región entera, cómo puntuar un punto individual con una escalera de métodos publicados, con sus fórmulas y sus umbrales, qué adjuntar a una predicción límite en lugar de una vaguedad, y qué tan pocas muestras locales hacen falta para extender un dominio. Con lo que la VM0042 de Verra ya exige, y lo que el CRCF de la UE no. Tres herramientas interactivas para mover los controles tú mismo.

Temas

Representatividad // Dominio de aplicabilidad // Muestreo // MRV

Autores

Dr. Thomas Fungenzi

Share

LinkedInEmail

Un programa de abastecimiento de cacao construye una línea de base de carbono orgánico del suelo para su primer origen. El equipo recolecta muestras a lo largo de la cuenca de suministro, ajusta un modelo que predice el stock de carbono a partir de covariables del suelo y del paisaje, y lo valida con validación cruzada. El R² es de 0.78. Suficiente para reportar. Un año después el programa se expande a un segundo origen en otro país, y reutiliza el mismo modelo para estimar la nueva línea de base, porque reconstruirlo costaría una campaña de campo que el presupuesto no tiene. El verificador hace una sola pregunta: ¿cuál es tu evidencia de que el segundo origen cae dentro del rango de condiciones sobre el que se calibró el modelo? El equipo señala el 0.78. Pero ese número describe qué tan bien predice el modelo dentro de las condiciones del primer origen. No dice nada sobre el segundo. La sala queda en silencio.

Este es el problema de representatividad con el que los equipos de monitoreo se topan más a menudo y que nombran con menos claridad. En realidad no se trata de la muestra. Se trata de la relación entre tres cosas: dónde mediste, dónde quieres ahora un número, y la porción del mundo que el modelo ha visto realmente.

Dos preguntas escondidas en una sola palabra

La representatividad se usa para dos afirmaciones distintas, y confundirlas es donde empiezan los problemas. La primera afirmación es sobre una muestra y una población: que la muestra refleja el área que quieres describir, de modo que un promedio calculado a partir de ella es una estimación justa del promedio verdadero. Este es el terreno del diseño de muestreo, y el sentido que desarrollamos en ¿Qué tan grande debe ser tu campaña de muestreo de carbono del suelo? y Señal frente a ruido.

La segunda afirmación es sobre un nuevo punto y un modelo. La mayor parte del monitoreo actual no se detiene en un promedio muestral. Ajusta un modelo, una ecuación alométrica, un mapa de carbono del suelo, una calibración espectral, un modelo de procesos como RothC, o un factor de emisión por defecto, y lo aplica a ubicaciones donde no se midió nada. Una predicción en una nueva ubicación solo es tan confiable como la experiencia del modelo con condiciones semejantes a las de esa ubicación. Fuera del rango de condiciones de los datos de entrenamiento, el modelo está extrapolando, y su error no está acotado ni es conocible a partir de los estadísticos de ajuste.

Estas se corresponden con los dos modos clásicos de inferencia. La inferencia basada en el diseño obtiene su validez de cómo se seleccionó la muestra, y responde a la pregunta de la muestra a la población. La inferencia basada en el modelo obtiene su validez de que el modelo sea correcto allí donde se aplica, y responde a la pregunta del nuevo punto al modelo 78. Una muestra puede ser una muestra probabilística de manual de su propia población y aun así situar una predicción bien fuera de la experiencia de un modelo prestado. Las dos preguntas son independientes, y la segunda es la que hace callar a la sala.

El dominio de aplicabilidad, definido

El concepto que gobierna la segunda pregunta ya tiene nombre, tomado de un campo que aprendió la lección temprano. En química, los modelos cuantitativos de estructura-actividad predicen las propiedades de una molécula a partir de su estructura, y los reguladores notaron que estos modelos hacían predicciones seguras y equivocadas para moléculas distintas de todo lo que había en el conjunto de entrenamiento. La respuesta fue definir un dominio de aplicabilidad: la región del espacio de entrada donde un modelo produce predicciones fiables, con una regla explícita para decidir si un nuevo caso cae dentro de ella 12.

El monitoreo ambiental usa la misma idea, por lo general sin el nombre. Toda ecuación alométrica se ajusta sobre un rango de diámetros de árbol 11, y aplicarla más allá de ese rango es extrapolación, razón por la cual la regla práctica es graficar la distribución de diámetros de tu inventario frente al rango de ajuste de la ecuación, como describimos en ¿Cómo calcular la cantidad de carbono en un árbol? Un rango de diámetros es un dominio de aplicabilidad en una dimensión. Un modelo de suelos moderno depende de muchas covariables a la vez, los factores SCORPAN que la cartografía digital de suelos formaliza 9, y los datos de entrenamiento ocupan una nube en ese espacio de alta dimensión. El dominio de aplicabilidad es la región de ese espacio que la nube efectivamente cubre, y toda la cuestión se vuelve geométrica: ¿el nuevo punto se sitúa dentro de la nube, o en un rincón que el modelo nunca visitó?

¿Cubre tu conjunto de calibración la nueva región?

Todo lo anterior trata un punto a la vez, que es la pregunta correcta cuando estás a punto de reportar un número para una sola finca. Es la pregunta equivocada cuando un programa se plantea si un modelo construido en un origen puede reutilizarse en todo un segundo origen. Esa es una pregunta sobre dos distribuciones, y tiene una prueba directa que lleva una tarde.

Etiqueta con 0 cada muestra de calibración y con 1 cada ubicación del área objetivo. Descarta los valores de carbono del suelo y quédate solo con las covariables. Ahora entrena un clasificador para distinguir las dos etiquetas, y valídalo de forma cruzada. Si el clasificador no lo hace mejor que el azar, los dos conjuntos son estadísticamente indistinguibles en las variables que el modelo usa, y tus datos de calibración son una muestra plausible de las condiciones del objetivo. Si los separa con facilidad, tienes desplazamiento de covariables, y ahora tienes un número para ello en lugar de una discusión al respecto. Esta es la prueba de dos muestras basada en clasificador, y la teoría que autoriza leer una distancia entre dominios a partir de la exactitud de un clasificador es más antigua que su uso aquí 2223.

El clasificador te da tres cosas que un R² de titular no puede dar. Su exactitud, leída como el área bajo la curva ROC, es el número resumen. Sus importancias de variables dicen cuál covariable impulsa el desajuste, que es sobre lo que realmente actuarías. Y sus probabilidades ajustadas dan el cociente de densidades entre las dos poblaciones, la cantidad que formaliza el desplazamiento de covariables 24 y que reaparece cuando lleguemos a la incertidumbre.

Cociente de densidades // y el tamaño muestral que te deja
w(x) = p(x) / (1 − p(x)) × ncal / ntarget
ESS = (Σ wi)² / Σ wi²

La segunda línea es la que conviene poner delante de un cliente. Reponderar un conjunto de calibración hacia una nueva población objetivo es práctica estándar 25, pero los pesos concentran el trabajo en un puñado cada vez menor de muestras, y el tamaño muestral efectivo de Kish mide cuántas quedan 26. Un conjunto de calibración de 200 muestras que se repondera a un efectivo de 14 para la nueva región ya ha respondido la pregunta. Ese número es más difícil de rebatir que cualquier estadístico de bondad de ajuste, porque es un recuento de los datos que de verdad están haciendo el trabajo.

Mueve los controles de abajo y observa cómo los tres números se mueven juntos. Vale la pena provocar dos comportamientos a propósito. Aleja el área objetivo del conjunto de calibración y el clasificador los separa, el tamaño muestral efectivo se desploma y la proporción del objetivo que queda dentro del dominio cae; para cuando el área bajo la curva llega a 0.94, setenta muestras de calibración valen unas quince efectivas. Después vuelve a poner el desplazamiento en cero y ensancha el objetivo en su lugar. El clasificador baja de nuevo a 0.50, declarando en apariencia que los dos conjuntos son idénticos, mientras bastante menos de la mitad del objetivo sigue estando dentro del dominio.

Ese segundo caso es la limitación honesta del método, y no es menor. Un clasificador lineal separa por la media, así que es ciego ante un objetivo que comparte el centro del conjunto de calibración y simplemente abarca más terreno, que es justo lo que hace una cuenca de suministro cuando se expande hacia terrenos más variables. Usa un algoritmo de aprendizaje flexible en lugar de una regresión logística, y nunca leas el clasificador por su cuenta: repórtalo junto con la proporción del objetivo que cae dentro del dominio. Un número detecta un desplazamiento de posición, el otro detecta un desplazamiento de dispersión, y un programa puede sufrir cualquiera de los dos.

Para un plan de monitoreo, esa proporción es la frase que vale la pena dejar por escrito: no «el modelo es aplicable», sino «el 62% de la nueva cuenca de suministro cae dentro del dominio de calibración, el resto se concentra en el norte de alta precipitación, y esto es lo que hicimos al respecto».

Cómo saber si un nuevo punto está dentro del dominio

La pertenencia al dominio es medible, y los métodos forman una escalera más que un menú. Cada peldaño corrige una ceguera concreta del peldaño anterior, de modo que la pregunta útil no es qué método es mejor, sino qué ceguera te puedes permitir.

Una variable a la vez. Para cada covariable, ¿el nuevo sitio cae entre el mínimo y el máximo de los datos de entrenamiento? Esto detecta la extrapolación más burda en cinco minutos. La versión publicada de esta comprobación, la superficie de similitud ambiental multivariante, puntúa una ubicación de 0 a 100 según qué tan adentro de la distribución de referencia se sitúa su variable más extrema, y se vuelve negativa en cuanto alguna variable sale del rango de referencia, con la magnitud indicando la salida como porcentaje del rango de esa variable 17. Una puntuación de 100 significa que el punto se sitúa en la mediana de los datos de referencia en todas las variables.

Su debilidad es estructural: toma el mínimo entre variables, así que apenas es multivariante. Un punto puede estar cómodamente dentro del rango de todas las variables y aun así ser una combinación imposible que el modelo nunca vio, la precipitación de un sitio húmedo con el contenido de arcilla de uno seco. Ninguna cantidad de comprobaciones por variable encuentra eso.

Combinaciones novedosas. El método de detección de extrapolación separa la novedad en sus dos tipos de forma explícita 16. Su primer índice suma la salida de cada variable más allá del rango de referencia, expresada como fracción de ese rango, y vale cero siempre que todas las variables estén en rango. Su segundo índice divide la distancia de Mahalanobis de un punto al centroide de referencia entre la mayor de esas distancias entre los propios datos de referencia. Valores por encima de 1 significan que el punto está más lejos del centro de la nube de entrenamiento de lo que jamás estuvo ningún punto de entrenamiento: una combinación novedosa, invisible para cualquier comprobación de rango.

Detección de extrapolación // novedad de rango y novedad de combinación
NT1 = Σj min( xj − minj , maxj − xj , 0 ) / ( maxj − minj )
NT2 = D²(x, μref) / maxi∈ref D²(xi, μref)

Distancia a la nube de entrenamiento. Debajo de ambos está la distancia de Mahalanobis, que mide la distancia en unidades de la propia dispersión y correlación de los datos de entrenamiento, de modo que un paso en una dirección que los datos de entrenamiento apenas exploraron cuenta más que un paso en una que cubrieron bien. Su distribución de referencia es una chi-cuadrado con tantos grados de libertad como covariables, lo que da un umbral en lugar de una intuición: marca todo lo que pase del percentil 95. Para un modelo lineal la misma idea aparece como leverage, la diagonal de la matriz sombrero, con la línea de alerta clásica en tres veces el leverage medio, y un gráfico del leverage frente al residuo estandarizado es el diagnóstico que de hecho usan los reguladores del campo que bautizó el dominio de aplicabilidad 1210.

Distancia de Mahalanobis // leverage // y sus umbrales
D²(x) = (x − μ)ᵀ Σ−1 (x − μ)    marcar si D² > χ²p, 0.95
h(x) = xᵀ (XᵀX)−1 x    marcar si h > 3p / n

Dos salvedades deciden si esto funciona en la práctica. La matriz de covarianzas tiene que estimarse de forma robusta, porque un puñado de puntos de entrenamiento inusuales la infla y la matriz inflada declara entonces que todo está dentro del dominio. Y se invierte mal cuando las covariables son colineales o numerosas, que es justo lo que las covariables de suelo son de forma fiable, así que trabaja en el espacio de las componentes principales retenidas o usa un estimador de contracción. Cuando las variables mezclan continuas y categóricas, la distancia de Gower y las simples distancias al vecino más cercano son el recurso no paramétrico robusto.

El área de aplicabilidad, para mapas. Cuando el modelo produce un mapa continuo de extremo a extremo, la pregunta es espacial: ¿a qué píxeles se puede aplicar el modelo? El método del área de aplicabilidad responde exactamente esto 3. Estandariza las covariables, pondera cada una por su importancia en el modelo ajustado, mide la distancia de cada píxel al punto de entrenamiento más cercano en ese espacio ponderado, y la divide entre la media de todas las distancias entre pares de los datos de entrenamiento. Los píxeles que superan un umbral derivado de las propias disimilitudes de los datos de entrenamiento quedan fuera del área de aplicabilidad, y el error reportado del modelo no se aplica ahí. Un mapa regional puede parecer completo y fidedigno mientras grandes porciones de él están, según esta medida, fuera del dominio 4.

Índice de disimilitud // y el umbral que fijan los datos de entrenamiento
DI(k) = mini d(k, i) / d̄    sobre covariables estandarizadas y ponderadas por importancia
umbral = mayor DI no atípico entre los datos de entrenamiento validados de forma cruzada

Vale la pena enunciar ese umbral con precisión, porque se cita mal con frecuencia. Es el máximo, una vez retirados los atípicos, de los índices de disimilitud de los propios puntos de entrenamiento. La conocida expresión del bigote superior, el percentil 75 más 1.5 veces el rango intercuartílico, es la regla para decidir qué valores cuentan como atípicos, no el umbral en sí. El preprint que circula libremente especifica otra regla más, el cuantil .95, que se cambió durante la revisión por pares; la versión publicada es la que hay que implementar.

Cuánto respaldo, no solo qué tan cerca. El índice de disimilitud mira únicamente el punto de entrenamiento más cercano, así que no puede distinguir una ubicación sostenida por una sola muestra solitaria de otra respaldada por doscientas. Contar cuántos puntos de entrenamiento caen dentro de la distancia umbral de una ubicación cierra ese hueco, y el recuento se correlaciona con qué tan bien se desempeña el modelo allí en realidad 15. Es una medida a posteriori que no cuesta nada adicional una vez calculadas las distancias, y es la diferencia entre «dentro del dominio» y «dentro del dominio, y bien respaldado».

Las calibraciones espectrales tienen su propia versión. Si el carbono del suelo se predice a partir de espectros del infrarrojo medio en lugar de covariables, el análisis de componentes principales del conjunto de calibración define el espacio que conoce, y hacen falta dos estadísticos como pareja, no por separado. El T² de Hotelling mide qué tan lejos del centro se sitúa un nuevo espectro dentro de ese espacio; el residuo Q mide qué tan lejos se sitúa fuera de él, en direcciones que la calibración nunca modeló. Una muestra puede pasar cualquiera de los dos por separado y aun así ser una que la calibración nunca fue entrenada para leer.

ComprobaciónDetectaSe le escapa
Rango por variable // MESSCualquier variable fuera de su rango calibradoCombinaciones novedosas de variables en rango
ExDet NT1 + NT2Novedad de rango y combinaciones novedosas, por separadoQué dirección del espacio de covariables carece de respaldo
Mahalanobis // leverageDistancia a la nube, en unidades de su propia dispersiónHuecos locales dentro de la envolvente general
Área de aplicabilidadDistancia por píxel, ponderada por la importancia de cada covariableCuántos puntos de entrenamiento dan el respaldo
Densidad local de puntos de datosRespaldo escaso dentro de una región nominalmente cubiertaSi la propia relación ha cambiado
T² de Hotelling + QEspectros distintos de la calibración, dentro y fuera de su espacioNada, si los dos se leen juntos

La trampa de la validación: por qué un buen R² puede mentir

Hay una forma específica en que esto sale mal y que halaga al profesional. Cuando un modelo se valida por validación cruzada aleatoria ordinaria, los puntos retenidos quedan dispersos entre los puntos de entrenamiento. Si los datos están autocorrelacionados espacialmente, y los datos de suelo y vegetación casi siempre lo están, entonces cada punto retenido tiene un vecino cercano en el conjunto de entrenamiento. El modelo se está probando casi por completo dentro de su dominio, sobre puntos fáciles. La validación estructurada espacialmente, que retiene bloques enteros de espacio, revela una y otra vez que modelos con excelentes puntajes de validación cruzada aleatoria predicen mal cuando tienen que alcanzar más lejos 56. Un mapa regional puede ser insesgado en promedio a lo largo de su extensión y aun así estar equivocado en cada proyecto individual dentro de él.

La respuesta honesta no es simplemente cambiar la validación cruzada aleatoria por la espacial y seguir adelante, porque el diseño de validación correcto es en sí mismo objeto de debate: el bloqueo espacial puede ser pesimista si retiene regiones que nunca se le pediría al modelo predecir, y la opción más defendible, cuando el presupuesto lo permite, es una muestra de validación separada extraída por muestreo probabilístico del área objetivo, que estima la exactitud del mapa sin apoyarse en absoluto en el modelo 78. El punto que sobrevive al debate es más simple: un número de exactitud solo tiene sentido junto con una declaración de dónde, en el espacio de covariables y geográfico, se midió, y de si el lugar donde ahora quieres una predicción se le parece.

Ahora hay una respuesta más afilada que tomar partido. En lugar de bloquear el espacio de forma arbitraria, ajusta la validación a la predicción: retén puntos de modo que la distribución de distancias del punto de prueba a los datos de entrenamiento se parezca a la distribución de distancias desde los lugares donde realmente vas a predecir hasta esos mismos datos 13. La validación cruzada mide entonces el alcance que de verdad se le va a pedir al modelo, sin que la halaguen los vecinos cercanos ni la penalicen regiones por las que nadie va a preguntar. La formulación original dejaba fuera un punto cada vez y no escalaba; la versión por k grupos baja un conjunto agrupado de cuatro mil puntos de días a alrededor de un minuto 14, lo cual importa, porque la razón habitual por la que los equipos recaen en la validación cruzada aleatoria es que la alternativa honesta quedaba fuera de alcance computacional. Las muestras agrupadas requieren cuidados propios 39.

Qué debería significar realmente «inflar la incertidumbre»

El consejo de ensanchar las barras de error para los puntos límite es fácil de dar y difícil de aplicar. ¿Ensancharlas cuánto? Hay una respuesta rigurosa, y sus limitaciones son tan instructivas como sus garantías.

La predicción conforme dividida construye un intervalo a partir de residuos retenidos y no de ningún supuesto sobre la forma de los errores 18. Ajusta el modelo con una parte de los datos, calcula los residuos absolutos en un conjunto de calibración retenido, y toma un estadístico de orden concreto de esos residuos como semiamplitud del intervalo. El intervalo resultante cubre la verdad al menos 1 − α de las veces, en muestras finitas, sin supuesto distribucional alguno.

Conforme dividida // el intervalo y el tamaño de calibración que necesita
Ĉ(x) = μ̂(x) ± q    donde q = el ⌈(n+1)(1−α)⌉-ésimo menor |yi − μ̂(xi)|
n ≥ ⌈1/α⌉ − 1    así que un intervalo del 95% necesita al menos 19 puntos de calibración

La segunda línea no es un tecnicismo. Por debajo de ese número de puntos de calibración el método devuelve un intervalo infinitamente ancho, que es su manera honesta de decir que los datos no pueden sostener la afirmación que se les pide. Un método que se niega a responder cuando no puede vale más para un programa de monitoreo que uno que siempre produce un número.

Una semiamplitud constante para todo un proyecto rara vez es lo que quieres, y el arreglo es estándar: puntúa la conformidad frente a cuantiles ajustados en lugar de frente a una media ajustada, y el intervalo se adapta a cuán incierto es el modelo en cada ubicación conservando la garantía de cobertura 20. Los sitios en condiciones bien muestreadas reciben intervalos estrechos, los incómodos reciben intervalos anchos, y nadie tiene que elegir el factor de inflación a mano.

Aquí está la trampa, y es el asunto entero de este artículo. Esa garantía se sostiene solo si los puntos de calibración y el nuevo punto son intercambiables, que es justo lo que rompe pasar a una región nueva. La predicción conforme no es una vía de escape del problema del dominio. Aplicada de forma ingenua a través de una frontera de dominio, produce intervalos que parecen rigurosos y no lo son.

Lo que la rescata es la cantidad que ya construimos. Si conoces el cociente de densidades entre la población objetivo y la de calibración, puedes ponderar con él cada residuo de calibración y recuperar la garantía bajo desplazamiento de covariables 19. El mecanismo es elegante: el nuevo punto aporta su propio peso al cuantil, así que a medida que se adentra en territorio que los datos de calibración apenas cubren, más masa de probabilidad queda en el infinito y el intervalo se ensancha solo, hasta volverse no acotado en cuanto ese peso supera α. El clasificador de la sección sobre cobertura es lo que suministra el cociente, y por eso las dos secciones van juntas. Una salvedad honesta: la garantía es exacta solo cuando el cociente se conoce, y en la práctica se estima, así que trata la cobertura como aproximada y degradándose con la calidad de esa estimación.

Conviene conocer un límite más duro antes de que alguien lo prometa. La cobertura condicionada a los valores exactos de las covariables de un sitio no puede lograrse de forma no trivial con covariables continuas: cualquier procedimiento que la afirme tiene que devolver intervalos infinitamente anchos 21. El compromiso practicable es garantizar la cobertura dentro de estratos que declares de antemano, por región, textura del suelo o uso de la tierra, cada uno con su propio conjunto de calibración. Esta es la forma correcta para el MRV, y trae una consecuencia operativa: una región poco muestreada recibe una garantía gruesa o ninguna, lo cual es información y no un defecto.

Una regla de decisión que puedes defender

En conjunto, la comprobación de dominio es un flujo de trabajo breve y repetible que cabe en una página de un plan de monitoreo. Define el dominio de calibración (la distribución multivariante de las covariables en los datos de entrenamiento). Ubica cada nuevo punto en relación con él: primero la comprobación de rango por variable, luego una métrica de distancia. Clasifícalo como dentro del dominio, límite o fuera del dominio frente a umbrales fijados de antemano. Después actúa según la clase: los puntos dentro del dominio reciben la predicción tal cual; los puntos límite la reciben con una incertidumbre explícitamente inflada y una marca; los puntos fuera del dominio no reciben ningún número prestado, sino que activan un muestreo de referencia local y una reestimación.

El valor de dejar esto por escrito es que convierte un argumento («creemos que la nueva región es lo bastante parecida») en evidencia («aquí es donde cae cada nuevo punto, y esta es la regla que aplicamos»). Esa es la diferencia entre una afirmación que un verificador acepta y una que un verificador escudriña.

Un ejemplo resuelto: un modelo, dos regiones

Un modelo de carbono del suelo se calibra en fincas a pleno sol y con sombra ligera de una región de abastecimiento. El abastecimiento se expande a una segunda región de agroforestería con sombra ya establecida. Cinco de las covariables del modelo, contrastadas con el sitio representativo de la nueva región:

CovariableRango de calibración (A)Nuevo sitio (B)¿En rango?
Arcilla (%)12–3441No (por encima)
Precipitación media anual (mm)900–15001850No (por encima)
Temperatura media anual (°C)23–2725Sí
Elevación (m)40–320180Sí
Cobertura de dosel de sombra (%)0–1555No (por encima)

Tres de cinco covariables caen fuera del rango calibrado, y las dos que más importan para el carbono, la precipitación y la sombra, están entre ellas. Una distancia de Mahalanobis o un índice de área de aplicabilidad situarían este sitio bien más allá de la nube de entrenamiento. El veredicto es inequívoco: el modelo está fuera del dominio aquí, y aplicarlo reportaría un número sin sustento. Este es el mismo hallazgo, en miniatura, al que llegan las evaluaciones independientes a escala continental, donde las relaciones de carbono del suelo calibradas en sistemas templados de cultivos en hilera no se transfieren a sistemas perennes con sombra sin una reestimación local. Retomamos la elección del modelo y la recalibración local en ¿Cómo modelar el cambio del carbono del suelo en el tiempo?

Cuando la respuesta es «fuera»: extender el dominio a bajo costo

«Activa un muestreo local» es donde se detienen la mayoría de los tratamientos de este tema, y es justo el punto en el que un gestor de programa necesita más ayuda. La noticia útil es que extender un dominio sale mucho más barato que construir uno, y las cifras son sorprendentemente pequeñas.

Elige los puntos nuevos para cubrir el espacio, no para imitar a la población. El muestreo por hipercubo latino condicionado, el predeterminado en cartografía digital de suelos, selecciona sitios de modo que la muestra reproduzca las distribuciones marginales de las covariables y sus correlaciones 29. El muestreo por cobertura, en cambio, agrupa el área objetivo en el espacio de covariables y muestrea cerca de cada centro de grupo, abarcando el espacio conjunto en lugar de reproducir sus márgenes 30. Para calibrar un modelo, abarcar suele ser lo que quieres, y una comparación recomienda repartir la muestra por el espacio de características de las covariables más importantes 31.

Desconfía de quien te venda un ganador limpio entre los dos. La evidencia es genuinamente mixta: el muestreo por cobertura gana en promedio en algunas comparaciones, el hipercubo latino gana con tamaños de muestra pequeños en otras, y en la mayoría de ellas el tamaño de muestra importa más que la elección del método. Las comparaciones basadas en una sola realización de cada diseño son casi ininformativas, porque las distribuciones de resultados se solapan mucho.

A menudo no hace falta reconstruir el modelo en absoluto. La espectroscopía de suelos lo aprendió primero: una biblioteca grande que falla localmente puede repararse añadiéndole un puñado de muestras locales, una práctica llamada spiking. Las cifras a lo largo de la literatura son consistentes y pequeñas: alrededor de quince muestras locales reducen fuertemente el sesgo de predicción 32, doce llevaron el desempeño de un modelo regional de un R² de 0.07 a 0.36 hasta 0.69 a 0.86 33, y de doce a veinte muestras locales combinadas con una biblioteca grande igualaron a calibraciones específicas de sitio construidas con hasta trescientas 34. De diez a treinta muestras bien elegidas es el rango de trabajo.

La misma economía aparece en la alometría. Usando ecuaciones publicadas como distribuciones previas en lugar de empezar de cero, seis árboles pueden estimar los parámetros tan bien como cuarenta a sesenta en el enfoque clásico 35. Es la agrupación parcial haciendo el trabajo: el modelo prestado aporta la forma, los datos locales lo tiran hacia la verdad local, y la componente de varianza entre sitios es en sí misma una medida de cuán transferible era la relación desde el principio.

Si solo te alcanza para probar, prueba el sesgo. Una muestra local pequeña que no puede sostener un reajuste todavía puede responder si el modelo prestado está sistemáticamente equivocado aquí. Eso es una comparación de dos muestras, y usa la misma fórmula de potencia que cualquier diseño de detección de cambio, que desarrollamos en ¿Qué tan grande debe ser tu campaña de muestreo de carbono del suelo? Sustituir la diferencia mínima detectable por el sesgo que te importaría da el número de muestras locales necesarias para detectarlo.

Un hallazgo contraintuitivo merece un lugar en cualquier decisión de transferencia. Cuando se trasladaron funciones de pedotransferencia a una región nueva, las construidas solo con arena y arcilla superaron a las versiones que usaban once covariables 38. Más predictores significan un espacio de mayor dimensión, una nube de entrenamiento más rala, y más maneras de que un sitio nuevo caiga fuera de ella. La parsimonia no es solo una preferencia estética; es una estrategia de dominio. El costo de equivocarse en esto está bien documentado: las ecuaciones pantropicales sobrestimaron la biomasa en cerca de un 40% en un sitio de África central 36, y las ecuaciones construidas a partir de muestras pequeñas cargan un sesgo medio a nivel de sitio cercano al +70%, con un rango de −4% a +193% 37.

El remuestreo, y el dominio que se mueve

Hay una segunda forma, más silenciosa, en que falla la representatividad, y aparece justo cuando un programa hace todo lo demás bien. El monitoreo se construye sobre el remuestreo: revisitar la misma red a lo largo del tiempo, comparar y reportar el cambio. El supuesto no dicho es que la red sigue siendo representativa del sistema que monitorea. Los sistemas cambian. El manejo cambia, un programa de sombra madura, una sequía reconfigura el régimen de humedad del suelo, el uso de la tierra se desplaza en los bordes de la cuenca de suministro. Un modelo calibrado una vez frente al sistema original puede deslizarse fuera del dominio respecto del sistema que ahora existe, sin que nadie vuelva a correr una comprobación. Los estadísticos llaman a esto desplazamiento de covariables o deriva de concepto; en el campo se ve como una línea de base que en silencio deja de describir el presente.

La deriva se puede probar con el instrumento ya presentado. Corre el clasificador de dominio entre ciclos de monitoreo en lugar de entre regiones: etiqueta con 0 las covariables del primer ciclo y con 1 las del segundo, y mira si un clasificador puede distinguir los años. Si puede, el sistema se ha movido respecto del modelo, y las importancias de variables nombran qué se movió. No cuesta nada más allá de las covariables que ya tienes, y convierte una advertencia en una comprobación programada.

Por qué los verificadores empiezan a preguntar

La afirmación de que el monitoreo ambiental usa esta idea sin nombrarla necesita una corrección, y es una corrección útil. La VM0042 de Verra sí la nombra. Su sección de definiciones define el dominio del proyecto como el conjunto de condiciones, incluidos el tipo de cultivo, la textura del suelo y el clima, en las que se ha validado la aplicación del modelo 40. Aquí el dominio de aplicabilidad no es una abstracción prestada de la química; es un término definido en la metodología con la que se redacta una buena parte de los proyectos de carbono del suelo.

Su módulo complementario convierte la definición en una prueba auditable. Toda zona climática o región agrícola definida nacionalmente que el proyecto declare debe aparecer en el conjunto de datos de validación; las tres clases texturales de suelo que se espera que dominen el área del proyecto deben estar incluidas; y los datos deben abarcar 15 puntos porcentuales de contenido de arcilla. El módulo enuncia el propósito con claridad: confirmar que el modelo no ha sido hipercalibrado a una combinación de condiciones y aplicado después en otra parte. Vale la pena enunciar con precisión dos límites: el requisito recae sobre la cuantificación por medición y modelo, no sobre la acreditación solo por medición, y no fija un número mínimo de sitios. La disciplina es la cobertura, no el tamaño de muestra.

El resto del panorama es más blando, y conviene no exagerarlo. El IPCC lo trata como buena práctica a escala nacional, recomendando que los modelos de Nivel 3 se calibren y se contrasten con mediciones que reflejen la variabilidad de clima, suelo y uso de la tierra sobre la que se van a aplicar. El reglamento de absorciones de carbono de la UE, pese a las afirmaciones frecuentes en sentido contrario, no impone requisito alguno de validación de modelos: su deber de representatividad recae sobre la línea de base, y el fondo queda diferido a actos delegados aún por venir. Quien lo cite con este propósito no lo ha leído.

Esto ya no es solo un refinamiento metodológico. Los marcos de contabilidad que gobiernan las afirmaciones sobre carbono convergen en la exigencia de que la incertidumbre se cuantifique y se declare, y una predicción aplicada fuera del dominio de un modelo es incertidumbre que se ha ocultado en lugar de cuantificarse. La Guía GHG Protocol Land Sector and Removals, en vigor desde el 1 de enero de 2027, pide a las empresas que calibren los enfoques basados en modelos y en teledetección con datos empíricos propios del terreno y del manejo analizados, y cuando se reclaman absorciones esa recomendación se convierte en requisito, con remuestreo al menos cada cinco años. El Refinamiento de 2019 del IPCC empuja hacia factores de nivel superior, apropiados localmente, en lugar de los valores por defecto prestados, precisamente porque los valores por defecto están fuera del dominio para muchos de los lugares donde se aplican 12. Los verificadores empiezan a pedir validación estructurada espacialmente o independiente en lugar de un R² de titular, y evidencia de que un modelo reutilizado se ajusta al sitio en el que se está reutilizando. Los equipos que superarán estas preguntas son los que comprobaron la pertenencia al dominio antes de que se les pidiera, y pueden mostrar el trabajo.

Ideas clave

  1. La representatividad encierra dos preguntas separadas: si la muestra es representativa de la población (diseño de muestreo), y si un nuevo punto está dentro del dominio calibrado del modelo (aplicabilidad). La segunda es la que la mayoría de los programas pasan por alto.

  2. Una muestra puede ser perfectamente representativa de su propia población y aun así quedar fuera del dominio de aplicabilidad de un modelo prestado. Las dos cosas son independientes.

  3. El dominio de aplicabilidad es la región del espacio de covariables que los datos de entrenamiento efectivamente cubren. El rango de diámetros de una ecuación alométrica es esta idea en una dimensión; el dominio de un mapa de carbono del suelo es la misma idea en muchas.

  4. Para una región entera y no para un punto, entrena un clasificador que separe las muestras de calibración de las ubicaciones objetivo usando solo covariables. Un AUC cercano a 0.5 significa que los conjuntos son indistinguibles; el tamaño muestral efectivo de los pesos resultantes dice cuántas muestras de calibración están haciendo realmente el trabajo.

  5. Lee ese clasificador junto con la proporción del objetivo que queda dentro del dominio. Un clasificador lineal separa por la media, así que es ciego ante un objetivo que comparte el centro de calibración y simplemente abarca más terreno.

  6. La pertenencia al dominio es una escalera, y cada peldaño corrige una ceguera del anterior: rango por variable y MESS, luego la separación de ExDet entre novedad de rango y combinaciones novedosas, luego la distancia de Mahalanobis frente a un umbral chi-cuadrado, luego el área de aplicabilidad para mapas, y por último la densidad local de puntos de datos para saber cuánto respaldo existe.

  7. El umbral del área de aplicabilidad es el máximo, una vez retirados los atípicos, de los propios índices de disimilitud de los datos de entrenamiento. La expresión del bigote superior es la regla de atípicos, no el umbral, y el preprint que circula libremente especifica una regla distinta de la del artículo publicado.

  8. Un puntaje alto de validación cruzada aleatoria puede ser un artefacto de la autocorrelación espacial. Ajusta la validación a la predicción emparejando distancias al vecino más cercano, o usa una muestra probabilística independiente, y reporta siempre dónde se midió la exactitud.

  9. «Inflar la incertidumbre» tiene una forma rigurosa: la predicción conforme da intervalos libres de distribución, pero solo bajo intercambiabilidad, que una región nueva rompe. Ponderar por el cociente de densidades restaura la garantía, y las barras de error del propio modelo no ayudan: los bosques de regresión cuantílica se vuelven más estrechos en el borde del rango de entrenamiento, no más anchos.

  10. Extender un dominio es barato. De diez a treinta muestras locales bien elegidas reparan una calibración espectral prestada; seis árboles con distribuciones previas informativas igualan a cuarenta o sesenta sin ellas. Menos covariables suelen transferirse mejor, porque de una nube de alta dimensión más rala es más fácil quedar fuera.

  11. La VM0042 de Verra ya define un dominio del proyecto como las condiciones en las que se ha validado la aplicación del modelo, y su módulo complementario hace auditable la cobertura de zonas climáticas, texturas de suelo y un rango de 15 puntos de arcilla. El reglamento de absorciones de carbono de la UE, en contra de lo que suele afirmarse, no exige nada por el estilo.

Referencias

  • 1.Netzeva, T.I. et al. (2005). Current status of methods for defining the applicability domain of (quantitative) structure-activity relationships. ATLA Alternatives to Laboratory Animals, 33(2), 155–173. doi:10.1177/026119290503300209
  • 2.Jaworska, J., Nikolova-Jeliazkova, N., Aldenberg, T. (2005). QSAR applicability domain estimation by projection of the training set in descriptor space, a review. ATLA, 33(5), 445–459. doi:10.1177/026119290503300508
  • 3.Meyer, H., Pebesma, E. (2021). Predicting into unknown space? Estimating the area of applicability of spatial prediction models. Methods in Ecology and Evolution, 12(9), 1620–1633. doi:10.1111/2041-210X.13650
  • 4.Meyer, H., Pebesma, E. (2022). Machine learning-based global maps of ecological variables and the challenge of assessing them. Nature Communications, 13, 2208. doi:10.1038/s41467-022-29838-9
  • 5.Ploton, P. et al. (2020). Spatial validation reveals poor predictive performance of large-scale ecological mapping models. Nature Communications, 11, 4540. doi:10.1038/s41467-020-18321-y
  • 6.Roberts, D.R. et al. (2017). Cross-validation strategies for data with temporal, spatial, hierarchical, or phylogenetic structure. Ecography, 40(8), 913–929. doi:10.1111/ecog.02881
  • 7.Wadoux, A.M.J-C., Heuvelink, G.B.M., de Bruin, S., Brus, D.J. (2021). Spatial cross-validation is not the right way to evaluate map accuracy. Ecological Modelling, 457, 109692. doi:10.1016/j.ecolmodel.2021.109692
  • 8.Brus, D.J., Kempen, B., Heuvelink, G.B.M. (2011). Sampling for validation of digital soil maps. European Journal of Soil Science, 62(3), 394–407. doi:10.1111/j.1365-2389.2011.01364.x
  • 9.McBratney, A.B., Mendonça Santos, M.L., Minasny, B. (2003). On digital soil mapping. Geoderma, 117(1–2), 3–52. doi:10.1016/S0016-7061(03)00223-4
  • 10.Sheridan, R.P. et al. (2004). Similarity to molecules in the training set is a good discriminator for prediction accuracy in QSAR. Journal of Chemical Information and Computer Sciences, 44(6), 1912–1928. doi:10.1021/ci049782w
  • 11.Chave, J. et al. (2014). Improved allometric models to estimate the aboveground biomass of tropical trees. Global Change Biology, 20(10), 3177–3190. doi:10.1111/gcb.12629
  • 12.IPCC (2019). 2019 Refinement to the 2006 IPCC Guidelines for National Greenhouse Gas Inventories. Intergovernmental Panel on Climate Change. ipcc.ch
  • 13.Milà, C., Mateu, J., Pebesma, E., Meyer, H. (2022). Nearest neighbour distance matching Leave-One-Out Cross-Validation for map validation. Methods in Ecology and Evolution, 13(6), 1304–1316. doi:10.1111/2041-210X.13851
  • 14.Linnenbrink, J., Milà, C., Ludwig, M., Meyer, H. (2024). kNNDM CV: k-fold nearest-neighbour distance matching cross-validation for map accuracy estimation. Geoscientific Model Development, 17(15), 5897–5912. doi:10.5194/gmd-17-5897-2024
  • 15.Schumacher, F.L., Knoth, C., Ludwig, M., Meyer, H. (2025). Estimation of local training data point densities to support the assessment of spatial prediction uncertainty. Geoscientific Model Development, 18(24), 10185–10202. doi:10.5194/gmd-18-10185-2025
  • 16.Mesgaran, M.B., Cousens, R.D., Webber, B.L. (2014). Here be dragons: a tool for quantifying novelty due to covariate range and correlation change when projecting species distribution models. Diversity and Distributions, 20(10), 1147–1159. doi:10.1111/ddi.12209
  • 17.Elith, J., Kearney, M., Phillips, S. (2010). The art of modelling range-shifting species. Methods in Ecology and Evolution, 1(4), 330–342. doi:10.1111/j.2041-210X.2010.00036.x
  • 18.Lei, J., G'Sell, M., Rinaldo, A., Tibshirani, R.J., Wasserman, L. (2018). Distribution-free predictive inference for regression. Journal of the American Statistical Association, 113(523), 1094–1111. doi:10.1080/01621459.2017.1307116
  • 19.Tibshirani, R.J., Foygel Barber, R., Candès, E.J., Ramdas, A. (2019). Conformal prediction under covariate shift. Advances in Neural Information Processing Systems 32. arXiv:1904.06019
  • 20.Romano, Y., Patterson, E., Candès, E.J. (2019). Conformalized quantile regression. Advances in Neural Information Processing Systems 32. arXiv:1905.03222
  • 21.Vovk, V. (2012). Conditional validity of inductive conformal predictors. Proceedings of the Asian Conference on Machine Learning, PMLR 25, 475–490. proceedings.mlr.press
  • 22.Lopez-Paz, D., Oquab, M. (2017). Revisiting classifier two-sample tests. International Conference on Learning Representations. arXiv:1610.06545
  • 23.Ben-David, S., Blitzer, J., Crammer, K., Kulesza, A., Pereira, F., Vaughan, J.W. (2010). A theory of learning from different domains. Machine Learning, 79(1–2), 151–175. doi:10.1007/s10994-009-5152-4
  • 24.Shimodaira, H. (2000). Improving predictive inference under covariate shift by weighting the log-likelihood function. Journal of Statistical Planning and Inference, 90(2), 227–244. doi:10.1016/S0378-3758(00)00115-4
  • 25.Sugiyama, M., Suzuki, T., Nakajima, S., Kashima, H., von Bünau, P., Kawanabe, M. (2008). Direct importance estimation for covariate shift adaptation. Annals of the Institute of Statistical Mathematics, 60(4), 699–746. doi:10.1007/s10463-008-0197-x
  • 26.Kish, L. (1965). Survey Sampling. John Wiley & Sons, New York. El tamaño muestral efectivo usado aquí es la reformulación algebraica del efecto de diseño por ponderación desigual de Kish.
  • 27.Dega, S., Dietrich, P., Schrön, M., Paasche, H. (2023). Probabilistic prediction by means of the propagation of response variable uncertainty through a Monte Carlo approach in regression random forest. Frontiers in Environmental Science, 11, 1009191. doi:10.3389/fenvs.2023.1009191
  • 28.Hateffard, F., Steinbuch, L., Heuvelink, G.B.M. (2024). Evaluating the extrapolation potential of random forest digital soil mapping. Geoderma, 441, 116740. doi:10.1016/j.geoderma.2023.116740
  • 29.Minasny, B., McBratney, A.B. (2006). A conditioned Latin hypercube method for sampling in the presence of ancillary information. Computers & Geosciences, 32(9), 1378–1388. doi:10.1016/j.cageo.2005.12.009
  • 30.Ma, T., Brus, D.J., Zhu, A.-X., Zhang, L., Scholten, T. (2020). Comparison of conditioned Latin hypercube and feature space coverage sampling for predicting soil classes using simulation from soil maps. Geoderma, 370, 114366. doi:10.1016/j.geoderma.2020.114366
  • 31.Wadoux, A.M.J-C., Brus, D.J., Heuvelink, G.B.M. (2019). Sampling design optimization for soil mapping with a random forest. Geoderma, 355, 113913. doi:10.1016/j.geoderma.2019.113913
  • 32.Seidel, M. et al. (2019). Strategies for the efficient estimation of soil organic carbon at the field scale with vis-NIR spectroscopy: Spectral libraries and spiking vs. local calibrations. Geoderma, 354, 113856. doi:10.1016/j.geoderma.2019.07.014
  • 33.Guy, A.L., Siciliano, S.D., Lamb, E.G. (2015). Spiking regional vis-NIR calibration models with local samples to predict soil organic carbon in two High Arctic polar deserts using a vis-NIR probe. Canadian Journal of Soil Science, 95(3), 237–249. doi:10.4141/cjss-2015-004
  • 34.Lobsey, C.R., Viscarra Rossel, R.A., Roudier, P., Hedley, C.B. (2017). rs-local data-mines information from spectral libraries to improve local calibrations. European Journal of Soil Science, 68(6), 840–852. doi:10.1111/ejss.12490
  • 35.Zapata-Cuartas, M., Sierra, C.A., Alleman, L. (2012). Probability distribution of allometric coefficients and Bayesian estimation of aboveground tree biomass. Forest Ecology and Management, 277, 173–179. doi:10.1016/j.foreco.2012.04.030
  • 36.Ngomanda, A. et al. (2014). Site-specific versus pantropical allometric equations: Which option to estimate the biomass of a moist central African forest?. Forest Ecology and Management, 312, 1–9. doi:10.1016/j.foreco.2013.10.029
  • 37.Duncanson, L., Rourke, O., Dubayah, R. (2015). Small sample sizes yield biased allometric equations in temperate forests. Scientific Reports, 5, 17153. doi:10.1038/srep17153
  • 38.Schoch, J., Nussbaum, M., Walthert, L., Carminati, A., Lehmann, P. (2025). Transferability of pedotransfer functions for estimating soil hydraulic properties: An analysis of controlling factors for forest soils in Switzerland. Geoderma, 460, 117397. doi:10.1016/j.geoderma.2025.117397
  • 39.de Bruin, S., Brus, D.J., Heuvelink, G.B.M., van Ebbenhorst Tengbergen, T., Wadoux, A.M.J.-C. (2022). Dealing with clustered samples for assessing map accuracy by cross-validation. Ecological Informatics, 69, 101665. doi:10.1016/j.ecoinf.2022.101665
  • 40.Verra (2025). VM0042 Methodology for Improved Agricultural Land Management, v2.2, and VMD0053 Model Calibration, Validation and Uncertainty Guidance for Biogeochemical Modeling, v2.1. Verified Carbon Standard. verra.org
  • 41.Meinshausen, N. (2006). Quantile regression forests. Journal of Machine Learning Research, 7(35), 983–999. jmlr.org

Share this article

LinkedInEmail