4 DE SEPTIEMBRE DE 2026

¿Cómo se calibra y se valida un modelo? Una guía de campo, del carbono del suelo a la biomasa arbórea

Resumen

La palabra calibración designa cuatro cosas distintas, y la mayoría de las discusiones sobre modelos validados son dos personas que usan acepciones diferentes. Este artículo separa esos sentidos y luego recorre el procedimiento que comparten: por qué ajustar bien no demuestra casi nada, qué estima realmente cada nivel de una partición de datos, cómo el esquema de validación cruzada que se elige codifica una afirmación sobre la tarea de predicción, qué métricas no valen nada por sí solas y qué hace falta para que una incertidumbre declarada sea honesta. Tres herramientas interactivas: sobre el sobreajuste, sobre los esquemas de validación y sobre los numerosos conjuntos de parámetros que se ajustan igual de bien.

Temas

Modelización // Validación // MRV // Incertidumbre

Autores

Dr. Thomas Fungenzi

Share

LinkedInEmail

Un modelo produce un número. Después alguien tiene que decidir si lo cree, y esa persona casi nunca es quien lo construyó. Es un verificador que lee el documento de un proyecto, o una responsable de sostenibilidad que decide si incluir la cifra en una divulgación, o un revisor al que le han entregado un manuscrito. El número llega con un nombre adjunto, RothC o una ecuación de Chave o un bosque aleatorio, y el nombre hace una cantidad sorprendente de trabajo. No debería hacer casi ninguno.

Nada en la arquitectura de un modelo hace que su resultado sea fiable. La confianza proviene de la evidencia sobre cómo se comporta con datos a partir de los cuales no se construyó, y esa evidencia figura en la documentación o no figura. En la práctica, a menudo no figura. El documento de un proyecto describirá el modelo en detalle, nombrará los parámetros, citará la publicación original y dirá notablemente poco sobre qué se reservó, cómo se reservó y qué aspecto tenían los errores cuando el modelo se enfrentó a ello.

Este artículo trata de esa mitad que falta. Se sitúa entre otros dos de este sitio. Cómo elegir un modelo de carbono del suelo va primero, y cómo saber dónde puede aplicarse un modelo ajustado va después. Este es el tramo intermedio: una vez elegido algo, cómo se ajusta, cómo se pone a prueba y qué haría falta para que la prueba signifique algo.

La respuesta, antes del razonamiento

Calibración son cuatro palabras

Trazabilidad de instrumentos, ajuste empírico, estimación de parámetros de modelos de procesos y calibración de un enunciado probabilístico. Tienen criterios de éxito distintos y modos de fallo distintos.

Ajustar bien no demuestra nada

El error de entrenamiento disminuye a medida que un modelo se vuelve más flexible, sin límite y sin significado. Solo el error sobre datos reservados del ajuste aporta información sobre la próxima predicción.

El esquema de partición es una afirmación

El k-fold aleatorio, dejar un sitio fuera (leave-site-out) y la reserva temporal responden a preguntas distintas. Un error de validación cruzada reportado sin su esquema no es interpretable, y los esquemas no son comparables entre sí.

Ninguna métrica funciona sola

Sesgo, dispersión y destreza frente a una referencia son tres preguntas separadas, y la correlación no responde a ninguna. Un modelo puede correlacionar perfectamente con la verdad y equivocarse en la mitad del valor.

La cobertura es comprobable

Un intervalo del noventa por ciento contiene la verdad alrededor del noventa por ciento de las veces en datos reservados, o no la contiene. Es una medición, no una afirmación, y rara vez se reporta.

Nada de esto es estadística avanzada. Es la disciplina ordinaria del campo, aplicada de forma coherente, y la mayor parte de la distancia entre una cifra modelada defendible y una indefendible se recorre simplemente con aplicarla.

Una palabra, cuatro oficios

Basta con asistir a una reunión de validación y contar las acepciones. El desarrollador dice que el modelo se calibró con doce ensayos de largo plazo. El verificador pregunta si ha sido validado. La responsable de teledetección menciona que su calibración usó cuatrocientos espectros, con cien reservados. El estadístico, callado hasta entonces, pregunta si los intervalos están calibrados. Cuatro personas, una palabra y al menos tres operaciones distintas sobre la mesa.

Ninguno de ellos usa mal la palabra. Calibración tiene cuatro significados establecidos en las disciplinas que confluyen en un proyecto de carbono, y no son matices de una misma idea. Difieren en qué se ajusta, en qué cuenta como éxito y en cómo fallan. Deslizarse de uno a otro es la manera en que una sala termina de acuerdo sobre una palabra y en desacuerdo sobre todo lo que esa palabra debía zanjar.

El sentido más antiguo es el metrológico. Un instrumento produce una indicación, y la calibración relaciona esa indicación con valores proporcionados por patrones de medida, cada uno con su propia incertidumbre, y luego convierte esa relación en una forma de obtener un resultado de medida a partir de una lectura1. Un analizador por combustión seca se calibra con materiales de referencia certificados de contenido de carbono conocido. Un detalle está en el origen de buena parte de las imprecisiones posteriores: la calibración no modifica el instrumento. Configurar un sistema para que dé indicaciones prescritas es una operación distinta con nombre propio, el ajuste del sistema de medida, y el vocabulario es explícito tanto en que no deben confundirse como en que la calibración es un requisito previo del ajuste1. En este sentido, la calibración produce conocimiento sobre un instrumento, no un instrumento mejor.

El segundo sentido es el ajuste estadístico de un modelo empírico. Una ecuación alométrica que relaciona el diámetro con la biomasa, o un modelo espectral que relaciona la reflectancia con la concentración de carbono, tiene coeficientes estimados a partir de datos. Los datos usados para estimarlos forman el conjunto de calibración; lo que se reserva es el conjunto de validación. Aquí nada se vuelve trazable a un patrón. Se ajusta una forma funcional, y la pregunta que importa es cómo se comporta con datos que no ha visto. La espectroscopía de suelos es donde los dos primeros sentidos chocan con más frecuencia. Predecir una propiedad del suelo a partir de un espectro de reflectancia difusa significa ajustar una regresión sobre un conjunto de calibración y probarla con muestras reservadas2, de modo que allí la palabra designa la regresión y no un ajuste del espectrómetro, aunque haya un espectrómetro en la sala.

El tercer sentido es la estimación de parámetros de un modelo de procesos. Las constantes de velocidad de descomposición de RothC, o los parámetros análogos de Century y DayCent, no son magnitudes que alguien pueda salir a medir en una finca concreta. Se infieren ejecutando el modelo y ajustándolas hasta que reproduce una serie temporal observada. Cada conjunto candidato de parámetros exige otra ejecución completa para saber cuánto se desvía, y eso es lo que convierte la tarea en un problema inverso y no en un ajuste3. La diferencia con el segundo sentido no es de técnica sino de obligación: estos parámetros deben significar algo físico. Una tasa de descomposición afinada hasta cualquier valor que minimice los residuos ha dejado de ser una tasa de descomposición y se ha convertido en un parámetro libre con etiqueta mecanicista. Es también donde varios conjuntos de parámetros distintos resultan reproducir las mismas observaciones aproximadamente igual de bien, un problema con nombre propio y literatura propia4.

El cuarto sentido atañe a enunciados probabilísticos y no a predicciones. Un pronóstico está calibrado cuando los eventos a los que asigna una probabilidad del noventa por ciento ocurren aproximadamente el noventa por ciento de las veces, y un intervalo de predicción del noventa por ciento está calibrado cuando contiene la verdad aproximadamente el noventa por ciento de las veces. Es el único sentido en el que un modelo puede estar calibrado a la perfección y ser completamente inútil. Basta con predecir siempre la media de largo plazo y adjuntar intervalos lo bastante anchos como para tragarse la variación: la cobertura será excelente mientras el pronóstico no le dice nada a nadie. Aquí la calibración es necesaria, pero debe juzgarse junto con la estrechez del enunciado, lo que la literatura de pronóstico llama agudeza (sharpness)5.

1 // Calibración de instrumentosMetrología

Qué se ajusta

Nada en el instrumento. La relación entre su indicación y un valor de referencia de incertidumbre conocida.

Cómo se ve el éxito

El resultado es trazable a un patrón, con una incertidumbre declarada.

Falla cuando

Deriva entre calibraciones, o una cadena de trazabilidad supuesta en lugar de documentada.

2 // Ajuste de un modelo empíricoEstadística // quimiometría

Qué se ajusta

Coeficientes de una forma funcional elegida, estimados a partir de un conjunto de calibración.

Cómo se ve el éxito

Capacidad predictiva sobre datos reservados del ajuste.

Falla cuando

Sobreajuste, y datos de validación que no son independientes de los de calibración.

3 // Estimación de parámetros de modelos de procesosModelización biogeoquímica

Qué se ajusta

Parámetros que deben tener significado físico, inferidos por inversión frente a series temporales observadas.

Cómo se ve el éxito

El modelo reproduce sitios con los que no fue afinado, con parámetros que siguen siendo físicamente plausibles.

Falla cuando

Equifinalidad, y parámetros forzados más allá del sentido físico para absorber el error estructural.

4 // Calibración de una probabilidadPronóstico

Qué se ajusta

La anchura y la forma de la incertidumbre declarada, no la predicción central.

Cómo se ve el éxito

La cobertura lograda coincide con la nominal, con una agudeza útil.

Falla cuando

Intervalos tan anchos que la cobertura se cumple y el enunciado queda vacío.

La consecuencia para un proyecto de carbono es lo bastante concreta como para estar atento a ella. Un verificador pregunta si el modelo ha sido validado. El desarrollador responde que se calibró con ensayos locales de largo plazo, lo cual es una afirmación verdadera y pertinente sobre el tercer sentido. Puede que el verificador preguntara por el segundo, es decir, una prueba con datos reservados, o por el cuarto, es decir, si la incertidumbre asociada a la cifra final tiene alguna cobertura que la respalde. Tres preguntas razonables, una respuesta, y la distancia entre ellas no aparece en el acta.

Por debajo de esta discusión hay otra más antigua. La verificación pertenece a los sistemas cerrados: una estructura puramente formal puede demostrarse mediante manipulación simbólica, y un algoritmo dentro de un programa puede comprobarse del mismo modo. Un modelo construido con tales componentes no es en sí mismo cerrado, porque los parámetros que necesita nunca se conocen por completo, y la afirmación de que un modelo de un sistema ambiental abierto ha sido validado en algún sentido absoluto se discute desde mediados de los noventa6. Los manuales escritos para modelizadores trazan la misma línea por razones prácticas. Uno trata un modelo como una hipótesis científica cuando la pregunta es si sus procesos se comportan como los reales, una hipótesis que puede invalidarse pero nunca validarse de forma definitiva. Trata ese mismo modelo como una herramienta de ingeniería cuando la pregunta no es cómo funciona sino cuán bien funciona, y a eso lo llama evaluación7. El otro rechaza la palabra validación para la tercera fase de un proyecto de modelización y llama a esa fase evaluación. Comparar predicciones con observaciones es solo una de las varias cosas que hacen útil un modelo para su propósito, y validación sugiere que existe un modelo correcto por encontrar8. Nada en este artículo exige tomar partido en esa discusión. Sí exige leer validación como abreviatura de una prueba concreta frente a datos concretos, y no como un certificado.

El ajuste sale barato

Se toman doce árboles, se mide el diámetro, se muestrea la biomasa de forma destructiva y se ajusta un polinomio. Con grado dos, la curva pasa cerca de los puntos. Con grado once, pasa exactamente por cada uno de ellos. Los residuos son cero, el coeficiente de determinación es uno, y el ajuste es perfecto en el único sentido que la palabra admite dentro de la muestra. Entre los puntos, la curva oscila hasta valores físicamente imposibles, y un decimotercer árbol caerá muy lejos de ella.

No es una patología de los polinomios. Es el comportamiento general de los modelos flexibles, y la razón por la que el rendimiento dentro de la muestra aporta tan poca información. A medida que un modelo gana libertad, su error de entrenamiento disminuye de forma monótona, sin otro suelo que el cero y sin ningún punto en el que el descenso indique algo. El error sobre datos reservados del ajuste se comporta de otro modo: disminuye mientras la flexibilidad añadida compra estructura que se generaliza, y luego se da la vuelta y sube cuando esa misma flexibilidad empieza a absorber ruido propio de la muestra disponible9.

El mecanismo tiene una descomposición estándar. El error esperado en un punto nuevo se divide en un término de sesgo, que es cuánto se equivoca el modelo en promedio, un término de varianza, que es cuánto se mueve el modelo ajustado cuando se vuelve a extraer la muestra de entrenamiento, y un término irreducible, la varianza del objetivo en torno a su propia media verdadera, que ninguna modelización puede eliminar. La flexibilidad intercambia el primero por el segundo. Un modelo rígido está más sesgado y es más estable; uno flexible, menos sesgado y más inestable, y el punto útil no está en ninguno de los dos extremos9.

Error de predicción esperado en un punto nuevo
E[(y − ŷ)²] = Bias(ŷ)² + Var(ŷ) + σ²irreducible
y, ŷ
El valor verdadero en un punto nuevo, y la predicción que el modelo hace de él.
Bias(ŷ)²
Cuánto se equivoca el modelo en promedio.
Var(ŷ)
Cuánto se mueve el modelo ajustado cuando se vuelve a extraer la muestra de entrenamiento.
σ²
La varianza del objetivo en torno a su propia media verdadera. Ninguna modelización la elimina.

Un corolario merece enunciarse por separado, porque sobrevive en la documentación de los proyectos mucho después de cuando debería haberse retirado. El coeficiente de determinación dentro de la muestra nunca disminuye al añadir un predictor. Si se añade una columna de números aleatorios a una regresión, el R² sube. Las versiones ajustadas penalizan el número de parámetros y corrigen parte del problema, pero ningún estadístico dentro de la muestra responde a la pregunta que importa, que es qué ocurre en el sitio siguiente y no en este.

En este campo la trampa tiene una forma concreta. Una ecuación alométrica ajustada localmente, estimada con unas pocas decenas de árboles de una plantación, superará prácticamente siempre a una ecuación pantropical publicada sobre esos mismos árboles. Esa comparación no es evidencia de que la ecuación local sea mejor, y de forma rutinaria se presenta como si lo fuera. La comparación honesta reserva árboles que la ecuación local nunca vio, que es precisamente la comparación que un conjunto de datos destructivo pequeño vuelve dolorosa, porque cada árbol reservado es un árbol que no se usa para el ajuste. La tensión es real. Hacerla desaparecer reportando la destreza dentro de la muestra no la resuelve.

El mismo fallo escala hasta los mapas. Modelos ecológicos de gran escala validados reservando píxeles al azar han reportado un fuerte rendimiento predictivo que se desplomó en cuanto los datos reservados se separaron espacialmente de los de entrenamiento, porque los píxeles vecinos no son observaciones independientes y una partición aleatoria le entrega al modelo las respuestas sin que se note10. Ese fallo concreto es el tema de un artículo complementario y no se repite aquí; lo que corresponde aquí es la lección general de que el trabajo lo hace la partición, no la métrica que se calcula después.

Anatomía de una validación

La palabra validación abarca una jerarquía que vale la pena desmontar, porque sus niveles estiman cosas distintas y de forma rutinaria se funden en uno solo. En la versión más limpia hay tres funciones para los datos, y cada observación cumple exactamente una de ellas.

Conjunto de entrenamiento

Estima los parámetros. El error medido aquí indica que el modelo puede reproducir datos que ya ha visto, algo que no está en duda.

Conjunto de validación

Elige entre candidatos: qué forma funcional, cuántos términos, qué hiperparámetros. El error aquí guía la selección, y queda sesgado a la baja en cuanto se usa para ello.

Conjunto de prueba

Estima cómo rendirá el modelo elegido con datos nuevos. Solo es insesgado mientras permanece intacto, y puede gastarse una única vez.

La distinción entre la segunda y la tercera función es la que se pierde. Supóngase que se prueban ocho configuraciones del modelo, se evalúa cada una en el mismo bloque reservado, se elige la que puntúa mejor y luego se reporta esa puntuación como el rendimiento esperado del modelo. La cifra es demasiado buena, y lo es por una razón que no tiene nada que ver con la deshonestidad: se ha seleccionado el máximo de ocho estimaciones ruidosas, así que se ha seleccionado en parte por destreza genuina y en parte por ruido favorable. Cuantas más configuraciones se prueban, mayor es la parte de la puntuación reportada que es ruido que uno salió a buscar11.

Cuando los datos son demasiado escasos para reservar un conjunto de prueba que nunca se toque, la respuesta establecida es anidar el procedimiento: un bucle interno que hace la selección y un bucle externo que solo ve modelos ya elegidos, de modo que la estimación externa nunca se usa para elegir nada11. Cuesta cómputo y no cuesta nada en datos, lo que hace difícil defender por razones prácticas su ausencia en la mayor parte del trabajo aplicado.

Por debajo de los tres niveles hay una palabra que lo sostiene todo y que la aritmética no puede comprobar por nadie. Los datos reservados tienen que ser independientes, y la independencia es aquí una afirmación sobre el mundo y no sobre la hoja de cálculo. Dos testigos de la misma parcela, a diez metros de distancia, son dos filas en una tabla y, más o menos, una sola observación sobre el suelo. Dos años del mismo sitio no son dos pruebas independientes de un modelo temporal. Partir una tabla al azar garantiza que las filas queden separadas. No garantiza nada en absoluto sobre si la información lo está.

La familia de la validación cruzada, y lo que supone cada miembro

Reservar un único conjunto de prueba desperdicia datos, y con unos pocos cientos de observaciones ese desperdicio duele. La validación cruzada recupera la mayor parte rotando la función de reserva: se dividen los datos en partes, se entrena con todas menos una, se prueba con la que quedó fuera, se repite hasta que cada parte haya tenido su turno y se promedia. La idea es antigua, sencilla, y casi siempre se reporta de una forma que omite el único detalle que el lector necesita.

Ese detalle es cómo se hizo la partición. La validación cruzada no es un procedimiento sino una familia, y sus miembros difieren en cómo asignan las observaciones a los pliegues (folds). Esa asignación no es una preferencia técnica. Es una declaración sobre lo que se le pedirá al modelo, y cada elección estima el error de una tarea distinta12.

k-fold aleatorio

Pregunta que responde

¿Con qué acierto predice otra observación extraída del mismo conjunto?

Apropiado cuando

Observaciones genuinamente intercambiables, sin agrupamiento, sin agregación espacial y sin orden temporal.

Deja de funcionar cuando

Datos agrupados o autocorrelacionados, donde los vecinos cercanos de un pliegue están en el conjunto de entrenamiento y filtran la respuesta.

Dejar uno fuera

Pregunta que responde

La misma pregunta, con pliegues de uno.

Apropiado cuando

Conjuntos de datos pequeños, y modelos lineales en los que puede calcularse en forma cerrada en lugar de reajustarse n veces.

Deja de funcionar cuando

Su estimación tiene una varianza alta, y hereda todos los problemas de filtración del k-fold aleatorio.

Dejar un sitio fuera

Pregunta que responde

¿Con qué acierto predice un sitio que no aportó nada al ajuste?

Apropiado cuando

Cualquier modelo destinado a aplicarse en algún lugar donde no ha sido calibrado, lo que abarca la mayor parte del trabajo en proyectos.

Deja de funcionar cuando

Pesimista si el uso previsto es de verdad la interpolación dentro de sitios conocidos, y necesita suficientes sitios para promediar.

Reserva temporal

Pregunta que responde

¿Con qué acierto predice hacia adelante a partir de los datos disponibles?

Apropiado cuando

Todo lo que proyecta una trayectoria, donde entrenar con el futuro para predecir el pasado carecería de sentido.

Deja de funcionar cuando

Gasta en la prueba los datos más recientes y, por lo general, más pertinentes, y una sola ventana reservada es una sola estimación ruidosa.

Si se pasa el mismo conjunto de datos por varios de estos esquemas, el error reportado se mueve, a menudo mucho. Ese movimiento es lo esencial, no una molestia. Un error de validación cruzada es un enunciado condicional, y la condición es la partición. Dos cifras obtenidas con esquemas distintos no son dos estimaciones de una misma magnitud, así que compararlas, o comparar un resultado propio de dejar un sitio fuera con un resultado publicado de k-fold aleatorio, es un error de categoría disfrazado de comparación de referencia. La herramienta de abajo pasa un conjunto de datos agrupado por sitios por tres esquemas, para que la magnitud del movimiento se vea en lugar de afirmarse.

El caso espacial tiene más estructura de la que le da esta sección: a qué distancia tiene que estar un bloque para contar como independiente, cómo el bloqueo puede excederse y caer en el pesimismo y qué hacer cuando los propios objetivos de predicción previstos están agrupados. Eso corresponde al artículo sobre representatividad, que empieza donde esta sección termina.

Métricas que solo funcionan acompañadas

Una vez resuelta la partición, hay que calcular algo sobre ella, y aquí la costumbre es reportar una sola cifra. Ninguna cifra aislada describe los errores de un modelo, porque los errores tienen al menos tres propiedades independientes: si se inclinan hacia un lado, qué tamaño tienen habitualmente y si el modelo supera a una alternativa trivial. Una métrica responde a una de ellas y calla sobre las demás.

El error medio, el promedio de los residuos con signo, mide la inclinación. Es el que más importa para la contabilidad de carbono, porque un desvío sistemático no se reduce cuando el proyecto crece: el sesgo se acumula, mientras que el error aleatorio se compensa en parte. Es también la métrica que con más facilidad se satisface por accidente, ya que grandes errores positivos y negativos se promedian en un cómodo cero.

La raíz del error cuadrático medio (RMSE) mide el tamaño típico, en las unidades de la magnitud, y pondera mucho los fallos grandes porque eleva al cuadrado antes de promediar. El error absoluto medio (MAE) plantea la misma pregunta sin esa ponderación. Reportar ambos es informativo: cuando la RMSE supera con creces al MAE, la distribución de los errores tiene una cola, y una cola en un conjunto de validación suele indicar una subpoblación que el modelo maneja mal, más que mala suerte.

Ninguna de las dos dice si vale la pena tener el modelo. Para eso hace falta una referencia, que es lo que aporta la eficiencia del modelo: compara el error cuadrático del modelo con el error de predecir simplemente la media de las observaciones, y reporta la proporción de esa varianza inicial que el modelo explica13. Uno es la perfección, cero indica que la media habría funcionado igual de bien, y un valor negativo indica que la media habría funcionado mejor. Los valores negativos aparecen en trabajos publicados sobre suelo y biomasa con más frecuencia de la que suele admitir el tono del texto que los rodea. Es una impresión de lectura, no una cifra contabilizada.

Eficiencia del modelo, frente a la media de las observaciones
EF = 1 − Σ(oᵢ − pᵢ)² / Σ(oᵢ − ō)²
EF
Eficiencia del modelo. Uno es perfecto, cero indica que la media habría funcionado igual de bien, un valor negativo indica que habría funcionado mejor.
oᵢ
El valor observado para la muestra i.
pᵢ
El valor que el modelo predijo para esa misma muestra.
ō
La media de los valores observados, que es la referencia sin modelo.

La métrica que merece más desconfianza es el coeficiente de correlación y su cuadrado. La correlación mide si dos series se mueven juntas, no si coinciden. Un modelo que devuelve exactamente la mitad de la biomasa verdadera de cada árbol correlaciona perfectamente con la verdad, con un R² de uno, y se equivoca en un cincuenta por ciento en todas partes. No es un caso artificioso: una predicción escalada de forma sistemática es precisamente lo que produce un modelo mal calibrado, y es precisamente aquello ante lo que el R² es ciego. El coeficiente de correlación de concordancia de Lin existe por esta razón. Premia la coincidencia con la recta uno a uno y no con cualquier recta, de modo que disminuye cuando un modelo tiene un sesgo proporcional aunque la correlación siga siendo perfecta14.

Queda el gráfico que todos dibujan y que un número sorprendente dibuja mal. Cuando se representan los valores observados frente a los predichos y se ajusta una recta para comprobar una pendiente de uno y una ordenada en el origen de cero, la elección del eje no es cosmética. Hacer la regresión de los predichos sobre los observados y la de los observados sobre los predichos da pendientes distintas, y solo una de ellas pone a prueba la hipótesis sobre el rendimiento del modelo que el gráfico pretende poner a prueba. La convención respaldada por el argumento estadístico coloca los valores observados en el eje vertical y los predichos en el horizontal, porque las predicciones son la magnitud que se evalúa y los supuestos de la regresión recaen donde deben15.

Hay constancia de cómo es una evaluación más completa. Cuando el modelo suelo-cultivo STICS se puso a prueba con un único conjunto estándar de parámetros en quince cultivos y una amplia gama de suelos y climas franceses, la evaluación se dividió en tres. La exactitud se midió con la RMSE, la RMSE relativa y la eficiencia del modelo, junto con si el error era sobre todo sesgo o dispersión. La robustez indagó si el tamaño del error dependía del cultivo o del entorno. El comportamiento indagó si el modelo reproducía las diferencias observadas entre condiciones ambientales y prácticas de manejo contrastadas16. Las tres responden a preguntas distintas, y una sección de validación que solo reporta la primera ha respondido a una de ellas.

Calibrar un modelo de procesos es otro oficio

Todo lo anterior suponía un modelo cuyos parámetros son libres de tomar los valores que mejor se ajusten, porque no tienen significado más allá del ajuste. Los modelos de procesos rompen ese supuesto. Las tasas de descomposición de los compartimentos de RothC, las constantes de renovación de Century y los parámetros de nitrógeno de DayCent están escritos como magnitudes físicas, y la pretensión del modelo de proyectar más allá de sus datos de calibración descansa por completo en que lo sean. Esa pretensión es lo que vuelve delicado afinarlos.

Los instrumentos para esta tarea son los experimentos de largo plazo, algunos en marcha desde hace más de un siglo, donde el carbono del suelo se ha seguido bajo tratamientos fijos. Son los únicos datos que restringen un modelo decadal en la escala temporal en la que dice funcionar, lo que también significa que no hay muchos, que están distribuidos de forma desigual entre los climas y los suelos del mundo, y que el mismo puñado aparece en una calibración tras otra. El taller que empezó a poner a prueba de forma sistemática los modelos de materia orgánica del suelo frente a conjuntos de datos de largo plazo dio la razón: los cambios en la materia orgánica del suelo son lentos, de modo que solo los datos de largo plazo pueden poner a prueba un modelo de ellos. Sus conjuntos de datos procedían, según su propio relato, de la región templada17. Un modelo afinado con ensayos arables templados y aplicado a la agroforestería tropical se ha calibrado con un instrumento que nunca midió nada parecido al objetivo18.

La práctica recorre un espectro. En un extremo, un modelizador ajusta los parámetros a mano hasta que las curvas simuladas y observadas parecen próximas, lo que es rápido, no queda documentado y no puede repetirse. En el punto intermedio, un optimizador minimiza una función de pérdida, lo que es repetible y devuelve un único conjunto óptimo sin ninguna indicación de cuánto mejor era que las alternativas. En el otro extremo, la calibración bayesiana trata los parámetros como variables aleatorias, combina una distribución a priori con la verosimilitud de las observaciones y devuelve una distribución a posteriori: no una respuesta, sino una descripción de todas las respuestas que los datos toleran, con su propia incertidumbre adjunta19.

Ese planteamiento deja además espacio para algo que los otros dos ignoran. Los modelos reales son estructuralmente erróneos, y el error estructural no se comporta como el ruido de medición. La calibración devuelve un valor de mejor ajuste, no uno físico, y una tasa de descomposición puede terminar en el valor que compense un proceso que el modelo no representa. El ajuste sigue siendo bueno. Ya no es una tasa de descomposición, y una proyección que se apoya en su significado físico se apoya en algo que, sin que se note, ha dejado de ser físico19.

La otra razón para preferir una distribución a un mejor ajuste es que el mejor ajuste no suele ser mucho mejor que un gran número de alternativas bastante distintas. Muchos conjuntos de parámetros reproducen una trayectoria de carbono observada aproximadamente igual de bien, y no coinciden entre sí sobre el futuro, porque ajustarse al mismo pasado es una restricción mucho más débil de lo que parece. La respuesta no es elegir al ganador y reportar su proyección, sino llevar adelante el conjunto aceptable y dejar que produzca un rango4. La herramienta de abajo lo hace visible en un modelo de juguete de un compartimento con dos incógnitas: la región del espacio de parámetros compatible con los datos es amplia, se estrecha a medida que llegan más datos y nunca se reduce a un punto.

Hay una interacción más que es fácil pasar por alto. Dónde arranca un modelo de procesos es en sí una decisión de calibración. El reparto del stock inicial entre los compartimentos rápido, lento e inerte rara vez es medible, por lo general se estima y cambia de forma sustancial una proyección a treinta años. Calibrar parámetros frente a una trayectoria cuyo punto de partida también se supuso significa ajustar dos incógnitas a una sola curva. Ese problema, y el procedimiento de spin-up que es la respuesta defendible, se desarrollan en el artículo sobre cómo elegir un modelo de carbono del suelo.

Un enunciado de incertidumbre es una predicción, y puede ponerse a prueba

Conviene volver al cuarto sentido de calibración, que es donde fracasa, sin que se note, la mayor parte de la incertidumbre de modelo que se reporta. Un proyecto declara su estimación como un valor central con un intervalo del noventa por ciento. Ese intervalo no es una salvedad ni un gesto de humildad. Es una afirmación refutable: a lo largo de muchos enunciados de ese tipo, la verdad debería caer dentro de aproximadamente el noventa por ciento de ellos. La fracción en la que realmente cae es la cobertura lograda, y compararla con el noventa nominal es una medición corriente que casi nadie realiza.

Cuando se realiza, los intervalos suelen resultar demasiado estrechos. Tres causas explican la mayor parte. Se descarta la incertidumbre de los parámetros, de modo que el intervalo refleja la dispersión residual en torno a un único modelo ajustado y no la incertidumbre sobre qué modelo era el correcto. Se ignora el error estructural, porque ningún término de la aritmética representa la posibilidad de que la forma del modelo sea errónea. Y se cuentan como independientes observaciones correlacionadas, lo que infla el tamaño efectivo de la muestra y encoge cada intervalo calculado a partir de ella, un mecanismo que se desarrolla en el artículo sobre representatividad.

La corrección no consiste en ensanchar los intervalos hasta que cubran, que es el modo de fallo en la dirección contraria y produce enunciados demasiado vagos para actuar sobre ellos. Cobertura y agudeza son ejes separados, y el objetivo es el intervalo más estrecho que siga cubriendo a su tasa nominal5. Lo que lo hace abordable en la práctica es que ambas son medibles en datos reservados, con las mismas particiones ya construidas para evaluar la predicción central. Una validación que reporta la cobertura lograda junto a la RMSE ha respondido a una pregunta que un verificador tiene derecho a hacer y que por lo general no sabe cómo formular.

Lo que piden de verdad los estándares

Dos preguntas surgen siempre que este material se encuentra con un proyecto real. Si alguien lo exige, y si alguien lo comprueba. Las respuestas breves son que la contabilidad basada en modelos sí conlleva requisitos de validación, que estos son menos específicos que la discusión estadística anterior, y que la distancia entre lo que exige un estándar y lo que hace defendible una cifra es donde reside la mayor parte del juicio profesional.

El marco del IPCC fija el vocabulario. El Nivel 3 es aquel en el que un inventario usa modelos o mediciones directas en lugar de factores de emisión por defecto, y el requisito asociado a la versión basada en modelos se enuncia con claridad: los inventarios de Nivel 3 basados en modelos requieren mediciones para calibrar y validar los modelos usados para estimar los cambios en los stocks de carbono20. Las dos mitades de este artículo están en esa frase, unidas por una y en lugar de tratarse como una sola cosa. Mediciones para calibrar, y mediciones para validar. Si un inventario concreto las mantiene separadas es algo que la frase no puede imponer.

En el mercado voluntario los requisitos son más explícitos. La metodología de Verra para la mejora del manejo de tierras agrícolas permite que un modelo biogeoquímico simule el cambio del carbono del suelo, y le adjunta un mecanismo: un informe de validación del modelo, evaluado por un experto independiente en modelización y presentado de nuevo a medida que campañas de medición posteriores amplían el conjunto de datos de calibración y validación, y una deducción por incertidumbre aplicada a las reducciones emitidas21. Un módulo aparte contiene los propios requisitos de calibración y validación22. La deducción es la parte que merece mencionarse, porque el principio de diseño es bueno. Crece con el error estándar relativo de la estimación, de modo que la incertidumbre no solo se divulga sino que se le pone precio, y un proyecto que no puede demostrar un modelo bien acotado emite menos créditos por el mismo carbono medido.

Sobre la partición en sí, el módulo es más específico de lo que la mayoría de los profesionales espera, y más exigente. Exige que los datos de calibración y de validación sean demostrablemente independientes, y dice qué significa eso: los conjuntos de datos no deben solaparse en la ubicación de la investigación experimental ni proceder del mismo estudio experimental22. Se permite dividir un único conjunto, y el k-fold se menciona como una forma de hacerlo, pero la condición de independencia sigue vigente, así que los pliegues tienen que respetar el estudio y la ubicación en lugar de extraerse al azar entre filas. En sustancia, eso está mucho más cerca de dejar un sitio fuera que de la reserva aleatoria que la mayoría imagina, y un equipo que se dio por satisfecho con un k-fold aleatorio sobre parcelas agrupadas no ha cumplido el requisito, por bueno que parezca el número resultante. Cómo lee un verificador la afirmación resultante se trata en el artículo complementario.

Qué preguntar ante cualquier cifra modelada

Nada de lo que sigue exige que quien pregunta sea modelizador. Son las preguntas que separan una cifra con evidencia detrás de una cifra con una cita detrás, y pueden hacerse en una reunión.

Diez preguntas

  1. 1Cuando dicen que el modelo está calibrado, ¿a cuál de los cuatro sentidos se refieren?
  2. 2¿Qué datos se reservaron del ajuste y cómo se eligieron?
  3. 3¿En qué sentido son independientes esos datos reservados: otro sitio, otro año, otra región?
  4. 4¿Cuántas configuraciones del modelo se evaluaron antes de reportar esta?
  5. 5¿Los datos usados para elegir el modelo fueron los mismos que se usaron para reportar su rendimiento?
  6. 6¿Cuál es el sesgo, por separado de la RMSE, en las unidades de la magnitud?
  7. 7¿Frente a qué referencia se mide la destreza, y supera el modelo a la predicción de la media?
  8. 8En el gráfico de observados frente a predichos, ¿cuáles son la pendiente y la ordenada en el origen?
  9. 9¿Se ha comprobado la cobertura de la incertidumbre declarada, y qué fracción de las observaciones reservadas cayó dentro?
  10. 10¿Están las condiciones en las que se aplicará dentro del rango con el que se calibró?

Un equipo que puede responder las diez ha hecho el trabajo. Un equipo que considera varias de ellas poco razonables también ha dicho algo útil.

La razón para hacerlas no es la sospecha. La mayoría de las cifras modeladas en este campo las producen personas que hacen lo que pueden con conjuntos de datos pequeños y plazos reales, y las lagunas suelen ser convenciones heredadas más que atajos. Pero una cifra que entra en una divulgación, una emisión de créditos o un documento de política ha salido de las manos del modelizador, y a partir de ese momento lo único que se interpone entre ella y una decisión es si alguien preguntó frente a qué se puso a prueba.

Ideas clave

  1. Calibración designa cuatro operaciones distintas: hacer trazable un instrumento, ajustar un modelo empírico, estimar los parámetros de un modelo de procesos y calibrar un enunciado probabilístico. Fallan de maneras distintas, y la mayoría de las disputas sobre modelos validados son un desajuste entre dos de ellas.

  2. El error de entrenamiento disminuye sin límite a medida que un modelo gana flexibilidad y no aporta información sobre la próxima predicción. Solo la aporta el error sobre datos reservados del ajuste.

  3. El coeficiente de determinación dentro de la muestra nunca disminuye al añadir un predictor, incluido un predictor de números aleatorios. Que una alometría ajustada localmente supere a una global sobre sus propios árboles de calibración no es evidencia de nada.

  4. Los datos usados para elegir un modelo no pueden medir también su rendimiento. Seleccionar la mejor de varias configuraciones en una sola reserva significa que la puntuación reportada es en parte el ruido por el que se seleccionó; anidar el procedimiento lo corrige sin coste en datos.

  5. El esquema de validación cruzada es una afirmación sobre la tarea de predicción. El k-fold aleatorio, dejar un sitio fuera y la reserva temporal responden a preguntas distintas y no son comparables, de modo que un error reportado sin su partición no puede interpretarse.

  6. Ninguna métrica funciona sola. Sesgo, dispersión y destreza frente a una referencia son propiedades separadas, y la correlación no mide ninguna de ellas: un modelo que devuelve exactamente la mitad de cada valor verdadero correlaciona perfectamente con la verdad.

  7. En los modelos de procesos, muchos conjuntos de parámetros se ajustan a la misma trayectoria aproximadamente igual de bien y discrepan sobre el futuro. Llevar adelante el conjunto aceptable es más defendible que reportar la proyección del único mejor ajuste.

  8. Una incertidumbre declarada es una predicción comprobable. La cobertura lograda sobre datos reservados coincide o no con la tasa nominal, es medible con las particiones ya construidas para la estimación central, y casi nunca se reporta.

Referencias

  • 1.JCGM (Joint Committee for Guides in Metrology) (2012). International vocabulary of metrology: Basic and general concepts and associated terms (VIM), 3rd edition. JCGM 200:2012. Bureau International des Poids et Mesures. bipm.org
  • 2.Viscarra Rossel, R.A., Walvoort, D.J.J., McBratney, A.B. et al. (2006). Visible, near infrared, mid infrared or combined diffuse reflectance spectroscopy for simultaneous assessment of various soil properties. Geoderma, 131(1–2), 59–75. doi:10.1016/j.geoderma.2005.03.007
  • 3.Haefner, J.W. (2005). Modeling Biological Systems: Principles and Applications, 2nd edition. Springer, New York. doi:10.1007/b106568
  • 4.Beven, K., Freer, J. (2001). Equifinality, data assimilation, and uncertainty estimation in mechanistic modelling of complex environmental systems using the GLUE methodology. Journal of Hydrology, 249(1–4), 11–29. doi:10.1016/s0022-1694(01)00421-8
  • 5.Gneiting, T., Balabdaoui, F., Raftery, A.E. (2007). Probabilistic Forecasts, Calibration and Sharpness. Journal of the Royal Statistical Society Series B: Statistical Methodology, 69(2), 243–268. doi:10.1111/j.1467-9868.2007.00587.x
  • 6.Oreskes, N., Shrader-Frechette, K., Belitz, K. (1994). Verification, Validation, and Confirmation of Numerical Models in the Earth Sciences. Science, 263(5147), 641–646. doi:10.1126/science.263.5147.641
  • 7.Wallach, D., Makowski, D., Jones, J.W. et al. (2019). Model evaluation. In: Working with Dynamic Crop Models: Methods, Tools and Examples for Agriculture and Environment, 3rd edition, pp. 311–373. Academic Press. doi:10.1016/B978-0-12-811756-9.00009-5
  • 8.Grant, W.E., Swannack, T.M. (2008). Ecological Modeling: A Common-Sense Approach to Theory and Practice. Blackwell Publishing. ISBN 978-1-4051-6168-8. wiley.com
  • 9.Hastie, T., Tibshirani, R., Friedman, J. (2009). The Elements of Statistical Learning. Springer Series in Statistics. doi:10.1007/978-0-387-84858-7
  • 10.Ploton, P., Mortier, F., Réjou-Méchain, M. et al. (2020). Spatial validation reveals poor predictive performance of large-scale ecological mapping models. Nature Communications, 11(1), 4540. doi:10.1038/s41467-020-18321-y
  • 11.Varma, S., Simon, R. (2006). Bias in error estimation when using cross-validation for model selection. BMC Bioinformatics, 7(1), 91. doi:10.1186/1471-2105-7-91
  • 12.Roberts, D.R., Bahn, V., Ciuti, S. et al. (2017). Cross‐validation strategies for data with temporal, spatial, hierarchical, or phylogenetic structure. Ecography, 40(8), 913–929. doi:10.1111/ecog.02881
  • 13.Nash, J.E., Sutcliffe, J.V. (1970). River flow forecasting through conceptual models part I — A discussion of principles. Journal of Hydrology, 10(3), 282–290. doi:10.1016/0022-1694(70)90255-6
  • 14.Lin, L.I.K. (1989). A Concordance Correlation Coefficient to Evaluate Reproducibility. Biometrics, 45(1), 255. doi:10.2307/2532051
  • 15.Piñeiro, G., Perelman, S., Guerschman, J.P. et al. (2008). How to evaluate models: Observed vs. predicted or predicted vs. observed?. Ecological Modelling, 216(3–4), 316–322. doi:10.1016/j.ecolmodel.2008.05.006
  • 16.Coucheney, E., Buis, S., Launay, M. et al. (2015). Accuracy, robustness and behavior of the STICS soil–crop model for plant, water and nitrogen outputs: Evaluation over a wide range of agro-environmental conditions in France. Environmental Modelling & Software, 64, 177–190. doi:10.1016/j.envsoft.2014.11.024
  • 17.Powlson, D.S., Smith, P., Smith, J.U. (eds.) (1996). Evaluation of Soil Organic Matter Models Using Existing Long-Term Datasets. NATO ASI Series I: Global Environmental Change, vol. 38. Springer, Berlin. doi:10.1007/978-3-642-61094-3
  • 18.Smith, P., Smith, J.U., Powlson, D.S. et al. (1997). A comparison of the performance of nine soil organic matter models using datasets from seven long-term experiments. Geoderma, 81(1–2), 153–225. doi:10.1016/s0016-7061(97)00087-6
  • 19.Kennedy, M.C., O'Hagan, A. (2001). Bayesian Calibration of Computer Models. Journal of the Royal Statistical Society Series B: Statistical Methodology, 63(3), 425–464. doi:10.1111/1467-9868.00294
  • 20.IPCC (2019). 2019 Refinement to the 2006 IPCC Guidelines for National Greenhouse Gas Inventories. Volume 4 (AFOLU), Chapter 2. IPCC, Switzerland. ipcc.ch
  • 21.Verra (2024). VM0042 Methodology for Improved Agricultural Land Management, v2.2. Verified Carbon Standard. Verra, Washington DC. verra.org
  • 22.Verra (2025). VMD0053 Model Calibration, Validation and Uncertainty Guidance for Biogeochemical Modeling for Agricultural Land Management Projects, v2.1. VCS Module, 25 March 2025. Verra, Washington DC. verra.org

Share this article

LinkedInEmail