4 DE SETEMBRO DE 2026

Como se calibra e se valida um modelo? Um guia de campo, do carbono do solo à biomassa das árvores

Visão geral

A palavra calibração designa quatro coisas diferentes, e boa parte das discussões sobre modelos validados são duas pessoas usando sentidos diferentes. Este artigo separa esses sentidos e depois percorre o trabalho que eles compartilham: por que ajustar bem não prova quase nada, o que cada nível de uma partição de dados realmente estima, como o esquema de validação cruzada escolhido traduz uma afirmação sobre a tarefa de previsão, quais métricas nada valem isoladamente e o que é preciso para que uma incerteza declarada seja honesta. Três ferramentas interativas: sobre o sobreajuste, sobre os esquemas de validação e sobre os muitos conjuntos de parâmetros que se ajustam igualmente bem.

Temas

Modelagem // Validação // MRV // Incerteza

Autores

Dr. Thomas Fungenzi

Share

LinkedInEmail

Um modelo produz um número. Alguém precisa então decidir se acredita nele, e essa pessoa em geral não é quem o construiu. É um verificador lendo um documento de projeto, ou uma liderança de sustentabilidade decidindo se coloca o número em um relato público, ou um revisor que recebeu um manuscrito. O número chega com um nome anexado, RothC, uma equação de Chave ou uma floresta aleatória (random forest), e o nome faz uma quantidade surpreendente de trabalho. Não deveria fazer quase nenhum.

Nada na arquitetura de um modelo torna seu resultado confiável. A confiança vem de evidências sobre como ele se comporta com dados que não serviram para construí-lo, e essas evidências ou estão na documentação ou não estão. Na prática, muitas vezes não estão. Um documento de projeto descreve o modelo em detalhe, nomeia os parâmetros, cita a publicação original e diz notavelmente pouco sobre o que foi retido, como foi retido e como eram os erros quando o modelo se deparou com esses dados.

Este artigo trata dessa metade ausente. Ele se situa entre dois outros neste site. Como escolher um modelo de carbono do solo vem antes, e como saber onde um modelo ajustado pode ser aplicado vem depois. Este é o meio: escolhido um modelo, como ajustá-lo, como testá-lo e o que seria preciso para que o teste significasse alguma coisa.

A resposta, antes do raciocínio

Calibração são quatro palavras

Rastreabilidade de instrumentos, ajuste empírico, estimação de parâmetros de modelos de processo e calibração de uma afirmação probabilística. Têm critérios de sucesso diferentes e modos de falha diferentes.

Ajustar bem não prova nada

O erro de treinamento cai à medida que um modelo ganha flexibilidade, sem limite e sem significado. Só o erro em dados retirados do ajuste traz informação sobre a próxima previsão.

O esquema de partição é uma afirmação

O k-fold aleatório, o leave-site-out e a retenção temporal respondem a perguntas diferentes. Um erro de validação cruzada reportado sem o seu esquema não é interpretável, e os esquemas não são comparáveis entre si.

Nenhuma métrica funciona sozinha

Viés, dispersão e habilidade frente a uma referência são três perguntas separadas, e a correlação não responde a nenhuma delas. Um modelo pode ter correlação perfeita com a verdade e errar pela metade.

A cobertura é verificável

Um intervalo de noventa por cento ou contém a verdade em cerca de noventa por cento das vezes, em dados retidos, ou não contém. Isso é uma medição, não uma afirmação, e raramente é reportado.

Nada disso é estatística avançada. É a disciplina corrente da área, aplicada de forma consistente, e a maior parte da distância entre um número modelado defensável e um indefensável se percorre simplesmente fazendo-a.

Uma palavra, quatro funções

Assista a uma reunião de validação e conte os sentidos. O desenvolvedor diz que o modelo foi calibrado em doze ensaios de longo prazo. O verificador pergunta se ele foi validado. A responsável por sensoriamento remoto comenta que a calibração dela usou quatrocentos espectros, com cem retidos. O estatístico, calado até então, pergunta se os intervalos estão calibrados. Quatro pessoas, uma palavra e pelo menos três operações diferentes sobre a mesa.

Nenhum deles usa a palavra de forma errada. Calibração tem quatro significados estabelecidos nas disciplinas que se encontram em um projeto de carbono, e eles não são nuances de uma mesma ideia. Diferem no que é ajustado, no que conta como sucesso e na forma como falham. É deslizando entre eles que uma sala acaba concordando sobre uma palavra enquanto discorda de tudo o que a palavra deveria resolver.

O sentido mais antigo é o metrológico. Um instrumento produz uma indicação, e a calibração relaciona essa indicação a valores fornecidos por padrões de medição, cada um com sua própria incerteza, e depois transforma essa relação em uma forma de obter um resultado de medição a partir de uma leitura1. Um analisador por combustão seca é calibrado com materiais de referência certificados de teor de carbono conhecido. Um detalhe aqui está na origem de muita conversa imprecisa mais adiante: a calibração não altera o instrumento. Regular um sistema para que forneça indicações prescritas é uma operação distinta, com nome próprio, o ajuste, e o vocabulário é explícito tanto em que as duas não devem ser confundidas quanto em que a calibração é um pré-requisito do ajuste1. Nesse sentido, a calibração produz conhecimento sobre um instrumento, não um instrumento melhor.

O segundo sentido é o ajuste estatístico de um modelo empírico. Uma equação alométrica que relaciona diâmetro e biomassa, ou um modelo espectral que relaciona refletância e concentração de carbono, tem coeficientes estimados a partir de dados. Os dados usados para estimá-los formam o conjunto de calibração; o que fica retido é o conjunto de validação. Nada aqui está sendo tornado rastreável a um padrão. Ajusta-se uma forma funcional, e a pergunta que importa é como ela se comporta com dados que não viu. A espectroscopia de solos é onde os dois primeiros sentidos colidem com mais frequência. Prever uma propriedade do solo a partir de um espectro de refletância difusa significa ajustar uma regressão em um conjunto de calibração e testá-la em amostras retidas2, de modo que ali a palavra designa a regressão, e não um ajuste do espectrômetro, mesmo havendo um espectrômetro na sala.

O terceiro sentido é a estimação de parâmetros de um modelo de processo. As constantes de taxa de decomposição do RothC, ou os parâmetros análogos do Century e do DayCent, não são grandezas que alguém possa ir medir em uma dada fazenda. São inferidas rodando o modelo e ajustando-as até que ele reproduza uma série temporal observada. Cada conjunto candidato de parâmetros exige mais uma rodada completa para saber quanto erra, e é isso que faz disso um problema inverso, e não um ajuste3. A diferença em relação ao segundo sentido não é de técnica, mas de obrigação: esses parâmetros deveriam significar algo físico. Uma taxa de decomposição ajustada para qualquer valor que minimize os resíduos deixou de ser uma taxa de decomposição e virou um parâmetro livre com um rótulo mecanicista. É também aqui que vários conjuntos de parâmetros diferentes acabam reproduzindo as mesmas observações quase igualmente bem, um problema com nome e literatura próprios4.

O quarto sentido diz respeito a afirmações probabilísticas, e não a previsões. Uma previsão probabilística está calibrada quando os eventos aos quais ela atribui noventa por cento de probabilidade acontecem em cerca de noventa por cento das vezes, e um intervalo de previsão de noventa por cento está calibrado quando contém a verdade em cerca de noventa por cento das vezes. Este é o único sentido em que um modelo pode estar perfeitamente calibrado e ser completamente inútil. Preveja sempre a média de longo prazo, anexe intervalos largos o bastante para engolir a variação, e a cobertura será excelente enquanto a previsão não diz nada a ninguém. Aqui a calibração é necessária, mas precisa ser julgada junto com o quão estreita é a afirmação, o que a literatura de previsão chama de nitidez (sharpness)5.

1 // Calibração de instrumentosMetrologia

O que é ajustado

Nada no instrumento. A relação entre sua indicação e um valor de referência de incerteza conhecida.

Como é o sucesso

O resultado é rastreável a um padrão, com uma incerteza declarada.

Falha quando

Deriva entre calibrações, ou uma cadeia de rastreabilidade suposta em vez de documentada.

2 // Ajuste de um modelo empíricoEstatística // quimiometria

O que é ajustado

Coeficientes de uma forma funcional escolhida, estimados a partir de um conjunto de calibração.

Como é o sucesso

Habilidade preditiva em dados retidos do ajuste.

Falha quando

Sobreajuste, e dados de validação que não são independentes dos dados de calibração.

3 // Estimação de parâmetros de modelos de processoModelagem biogeoquímica

O que é ajustado

Parâmetros que deveriam ter significado físico, inferidos por inversão contra séries temporais observadas.

Como é o sucesso

O modelo reproduz locais nos quais não foi ajustado, com parâmetros que continuam fisicamente plausíveis.

Falha quando

Equifinalidade, e parâmetros forçados além do sentido físico para absorver erro estrutural.

4 // Calibração de uma probabilidadePrevisão

O que é ajustado

A largura e a forma da incerteza declarada, não a previsão central.

Como é o sucesso

A cobertura obtida corresponde à cobertura nominal, com nitidez útil.

Falha quando

Intervalos tão largos que a cobertura é atingida e a afirmação fica vazia.

A consequência para um projeto de carbono é específica o bastante para ficar de olho. Um verificador pergunta se o modelo foi validado. O desenvolvedor responde que ele foi calibrado com ensaios locais de longo prazo, o que é uma afirmação verdadeira e pertinente sobre o terceiro sentido. O verificador pode ter perguntado sobre o segundo, ou seja, um teste com dados retidos, ou sobre o quarto, ou seja, se a incerteza anexada ao número final tem alguma cobertura por trás. Três perguntas razoáveis, uma resposta, e a distância entre elas não aparece na ata.

Um argumento mais antigo está por baixo deste. A verificação pertence aos sistemas fechados: uma estrutura puramente formal pode ser provada por manipulação simbólica, e um algoritmo dentro de um programa pode ser checado da mesma forma. Um modelo construído com esses componentes não é, ele próprio, fechado, porque os parâmetros de que precisa nunca são completamente conhecidos, e a afirmação de que um modelo de um sistema ambiental aberto foi validado em qualquer sentido absoluto é contestada desde meados dos anos noventa6. Manuais escritos para modeladores traçam a mesma linha por razões práticas. Um deles trata um modelo como uma hipótese científica quando a pergunta é se seus processos se comportam como os reais, uma hipótese que pode ser invalidada, mas nunca validada de forma definitiva. Trata o mesmo modelo como uma ferramenta de engenharia quando a pergunta não é como ele funciona, mas quão bem funciona, e chama isso de avaliação7. O outro recusa a palavra validação para a terceira fase de um projeto de modelagem e chama essa fase de avaliação. Comparar previsões com observações é só uma das várias coisas que tornam um modelo útil para o seu propósito, e validação sugere que existe um modelo correto a ser encontrado8. Nada neste artigo exige tomar partido nessa discussão. Exige, sim, ler validação como abreviação de um teste específico contra dados específicos, e não como um certificado.

Ajustar é barato

Pegue doze árvores, meça o diâmetro, amostre a biomassa de forma destrutiva e ajuste um polinômio. No grau dois, a curva passa perto dos pontos. No grau onze, passa exatamente por cada um deles. Os resíduos são zero, o coeficiente de determinação é um, e o ajuste é perfeito no único sentido que a palavra comporta dentro da amostra. Entre os pontos, a curva oscila até valores fisicamente impossíveis, e uma décima terceira árvore vai cair bem longe dela.

Isso não é uma patologia dos polinômios. É o comportamento geral dos modelos flexíveis, e a razão pela qual o desempenho dentro da amostra carrega tão pouca informação. À medida que um modelo ganha liberdade, seu erro de treinamento cai monotonicamente, sem outro piso além de zero e sem nenhum ponto em que a queda sinalize alguma coisa. O erro em dados retirados do ajuste se comporta de outra forma: cai enquanto a flexibilidade adicional está comprando estrutura que se generaliza, depois se inverte e sobe enquanto a mesma flexibilidade passa a absorver ruído específico da amostra em mãos9.

O mecanismo tem uma decomposição clássica. O erro esperado em um novo ponto se divide em um termo de viés, que é o quanto o modelo erra em média, um termo de variância, que é o quanto o modelo ajustado se move quando a amostra de treinamento é sorteada de novo, e um termo irredutível, a variância do alvo em torno de sua própria média verdadeira, que nenhuma quantidade de modelagem consegue remover. A flexibilidade troca o primeiro pelo segundo. Um modelo rígido é mais enviesado e mais estável, um flexível é menos enviesado e mais instável, e o lugar útil não está em nenhum dos extremos9.

Erro de previsão esperado em um novo ponto
E[(y − ŷ)²] = Bias(ŷ)² + Var(ŷ) + σ²irredutível
y, ŷ
O valor verdadeiro em um novo ponto e a previsão do modelo para ele.
Bias(ŷ)²
O quanto o modelo erra em média.
Var(ŷ)
O quanto o modelo ajustado se move quando a amostra de treinamento é sorteada de novo.
σ²
A variância do alvo em torno de sua própria média verdadeira. Nenhuma quantidade de modelagem a remove.

Um corolário merece ser dito à parte, porque sobrevive na documentação de projetos muito depois de já dever ter sido aposentado. O coeficiente de determinação dentro da amostra nunca cai quando se acrescenta um preditor. Acrescente uma coluna de números aleatórios a uma regressão e o R² vai subir. As versões ajustadas penalizam o número de parâmetros e corrigem parte do problema, mas nenhuma estatística dentro da amostra responde à pergunta que importa, que é o que acontece no próximo local, e não neste.

Na nossa própria área, a armadilha tem uma forma específica. Uma equação alométrica ajustada localmente, estimada com algumas dezenas de árvores de uma única plantação, vai superar uma equação pantropical publicada nessas mesmas árvores praticamente todas as vezes. Essa comparação não é evidência de que a equação local seja melhor, e é rotineiramente apresentada como se fosse. A comparação honesta retém árvores que a equação local nunca viu, que é justamente a comparação que um pequeno conjunto de dados destrutivos torna penosa, porque cada árvore retida é uma árvore a menos no ajuste. A tensão é real. Fingir que ela não existe reportando a habilidade dentro da amostra não a resolve.

A mesma falha se amplia para os mapas. Modelos ecológicos de grande escala validados retendo pixels ao acaso reportaram forte desempenho preditivo, que desabou quando os dados retidos foram separados espacialmente dos dados de treinamento, porque pixels vizinhos não são observações independentes e uma partição aleatória entrega silenciosamente as respostas ao modelo10. Essa falha específica é o tema de um artigo complementar e não se repete aqui; o que cabe aqui é a lição geral de que quem faz o trabalho é a partição, não a métrica calculada depois dela.

Anatomia de uma validação

A palavra validação cobre uma hierarquia que vale a pena desmontar, porque os níveis estimam coisas diferentes e são rotineiramente fundidos em um só. Na versão mais limpa há três papéis para os dados, e cada observação desempenha exatamente um deles.

Conjunto de treinamento

Estima os parâmetros. O erro medido aqui diz que o modelo consegue reproduzir dados que já viu, o que não está em dúvida.

Conjunto de validação

Escolhe entre candidatos: qual forma funcional, quantos termos, quais hiperparâmetros. O erro aqui orienta a seleção, e fica enviesado para baixo no momento em que é usado para isso.

Conjunto de teste

Estima como o modelo escolhido vai se sair com dados novos. Só é não enviesado enquanto permanece intocado, e só pode ser gasto uma única vez.

A distinção entre o segundo e o terceiro papéis é a que se perde. Suponha que você teste oito configurações de modelo, avalie cada uma no mesmo bloco retido, escolha a de melhor escore e então reporte esse escore como o desempenho esperado do modelo. O número é bom demais, e é bom demais por uma razão que nada tem a ver com desonestidade: você selecionou o máximo de oito estimativas ruidosas, de modo que selecionou em parte habilidade genuína e em parte ruído favorável. Quanto mais configurações você testou, maior a parte do escore reportado que é ruído que você foi buscar11.

Quando os dados são escassos demais para reter um conjunto de teste que nunca seja tocado, a resposta estabelecida é aninhar o procedimento: um laço interno que faz a seleção e um laço externo que só vê modelos já escolhidos, de modo que a estimativa externa nunca é usada para escolher nada11. Isso custa computação e não custa nada em dados, o que torna difícil defender, por razões práticas, sua ausência na maior parte do trabalho aplicado.

Por baixo dos três níveis há uma palavra que sustenta tudo e que a aritmética não consegue verificar por você. Os dados retidos precisam ser independentes, e independência aqui é uma afirmação sobre o mundo, não sobre a planilha. Duas amostras de solo coletadas no mesmo campo a dez metros uma da outra são duas linhas em uma tabela e mais ou menos uma observação sobre o solo. Dois anos do mesmo local não são dois testes independentes de um modelo temporal. Dividir uma tabela ao acaso garante que as linhas estejam separadas. Não garante absolutamente nada sobre se a informação está.

A família da validação cruzada, e o que cada membro pressupõe

Reter um único conjunto de teste desperdiça dados, e com algumas centenas de observações esse desperdício dói. A validação cruzada recupera a maior parte dele fazendo rodar o papel de dado retido: particione os dados, treine com todas as partes menos uma, teste na parte deixada de fora, repita até que cada parte tenha tido sua vez e tire a média. A ideia é antiga, simples e quase universalmente reportada de uma forma que omite o único detalhe de que o leitor precisa.

O detalhe é como a partição foi feita. A validação cruzada não é um procedimento, mas uma família, e seus membros diferem na forma de atribuir as observações às dobras (folds). Essa atribuição não é uma preferência técnica. É uma declaração sobre o que o modelo terá de fazer, e cada escolha estima o erro de uma tarefa diferente12.

k-fold aleatório

Pergunta que responde

Quão bem isto prevê outra observação tirada do mesmo conjunto?

Adequado quando

Observações genuinamente intercambiáveis, sem agrupamento, sem aglomeração espacial e sem ordenação no tempo.

Deixa de funcionar quando

Dados agrupados ou autocorrelacionados, em que os vizinhos próximos de uma dobra estão no conjunto de treinamento e vazam a resposta.

Leave-one-out

Pergunta que responde

A mesma pergunta, com dobras de uma única observação.

Adequado quando

Conjuntos de dados pequenos, e modelos lineares em que pode ser calculada em forma fechada em vez de reajustada n vezes.

Deixa de funcionar quando

Sua estimativa tem variância alta, e ela herda todos os problemas de vazamento do k-fold aleatório.

Leave-site-out

Pergunta que responde

Quão bem isto prevê um local que não contribuiu em nada para o ajuste?

Adequado quando

Qualquer modelo destinado a ser aplicado onde não foi calibrado, o que abrange a maior parte do trabalho em projetos.

Deixa de funcionar quando

Pessimista se o uso pretendido for de fato a interpolação entre locais conhecidos, e exige locais suficientes para tirar uma média.

Retenção temporal

Pergunta que responde

Quão bem isto prevê para a frente a partir dos dados disponíveis?

Adequado quando

Tudo o que projeta uma trajetória, quando treinar com o futuro para prever o passado não faria sentido.

Deixa de funcionar quando

Gasta no teste os dados mais recentes e, em geral, mais relevantes, e uma única janela retida é uma única estimativa ruidosa.

Passe o mesmo conjunto de dados por vários desses esquemas e o erro reportado se move, muitas vezes bastante. Esse movimento é o ponto, e não um incômodo. Um erro de validação cruzada é uma afirmação condicional, e a condição é a partição. Dois números produzidos sob esquemas diferentes não são duas estimativas de uma mesma grandeza; por isso compará-los, ou comparar seu resultado leave-site-out com um resultado publicado de k-fold aleatório, é um erro de categoria disfarçado de benchmark. A ferramenta abaixo passa um conjunto de dados agrupado por local por três esquemas, para que o tamanho do movimento fique visível em vez de apenas afirmado.

O caso espacial tem mais estrutura do que esta seção lhe dá: a que distância um bloco precisa estar para contar como independente, como o bloqueio pode passar do ponto e cair no pessimismo, e o que fazer quando os próprios alvos de previsão pretendidos são agrupados. Isso pertence ao artigo sobre representatividade, que começa onde esta seção para.

Métricas que só funcionam acompanhadas

Resolvida a partição, algo precisa ser calculado sobre ela, e aqui o hábito é reportar um único número. Nenhum número isolado descreve os erros de um modelo, porque os erros têm pelo menos três propriedades independentes: se tendem para um lado, qual é o seu tamanho típico e se o modelo supera uma alternativa trivial. Uma métrica responde a uma dessas perguntas e se cala sobre as outras.

O erro médio, a média dos resíduos com sinal, mede essa tendência. É a métrica que mais importa para a contabilidade de carbono, porque um desvio sistemático não diminui quando o projeto cresce: o viés se acumula, enquanto o erro aleatório se cancela em parte. É também a métrica mais facilmente satisfeita por acaso, já que grandes erros positivos e negativos se compensam em uma média confortavelmente nula.

A raiz do erro quadrático médio (RMSE) mede o tamanho típico, nas unidades da grandeza, e pesa muito os erros grandes porque eleva ao quadrado antes de tirar a média. O erro absoluto médio (MAE) faz a mesma pergunta sem essa ponderação. Reportar os dois é informativo: quando o RMSE excede em muito o MAE, a distribuição dos erros tem uma cauda, e uma cauda em um conjunto de validação costuma indicar uma subpopulação que o modelo trata mal, e não azar.

Nenhum dos dois diz se vale a pena ter o modelo. Para isso é preciso uma referência, e é isso que a eficiência do modelo fornece: ela compara o erro quadrático do modelo com o erro de simplesmente prever a média das observações e reporta a proporção dessa variância inicial que o modelo explica13. Um é a perfeição, zero diz que a média teria se saído igualmente bem, e um valor negativo diz que a média teria se saído melhor. Valores negativos aparecem em trabalhos publicados sobre solo e biomassa com mais frequência do que o tom do texto ao redor costuma admitir. Isso é uma impressão de leitura, não um número contabilizado.

Eficiência do modelo, frente à média das observações
EF = 1 − Σ(oᵢ − pᵢ)² / Σ(oᵢ − ō)²
EF
Eficiência do modelo. Um é perfeito, zero diz que a média teria se saído igualmente bem, negativo diz que ela teria se saído melhor.
oᵢ
O valor observado para a amostra i.
pᵢ
O valor que o modelo previu para essa mesma amostra.
ō
A média dos valores observados, que é a referência sem modelo.

A métrica a tratar com mais desconfiança é o coeficiente de correlação e seu quadrado. A correlação mede se duas séries se movem juntas, não se concordam. Um modelo que devolve exatamente metade da biomassa verdadeira de cada árvore tem correlação perfeita com a verdade, R² igual a um, e erra em cinquenta por cento em toda parte. Não é um caso artificial: uma previsão sistematicamente escalonada é precisamente o que um modelo mal calibrado produz, e é precisamente aquilo a que o R² é cego. O coeficiente de correlação de concordância de Lin existe por esse motivo. Ele recompensa a concordância com a reta um para um, e não com qualquer reta, de modo que cai quando um modelo tem viés proporcional, mesmo com a correlação continuando perfeita14.

Resta o gráfico que todo mundo desenha e que um número surpreendente de pessoas desenha errado. Quando valores observados e previstos são plotados um contra o outro e se ajusta uma reta para testar uma inclinação igual a um e um intercepto igual a zero, a escolha do eixo não é cosmética. Regredir o previsto sobre o observado e regredir o observado sobre o previsto dão inclinações diferentes, e só uma delas testa a hipótese sobre o desempenho do modelo que o gráfico deveria testar. A convenção sustentada pelo argumento estatístico coloca os valores observados no eixo vertical e os previstos no horizontal, porque as previsões são a grandeza avaliada e os pressupostos da regressão recaem onde devem15.

Como é uma avaliação mais completa está documentado. Quando o modelo solo-cultura STICS foi testado com um único conjunto padrão de parâmetros em quinze culturas e em uma ampla gama de solos e climas franceses, a avaliação foi dividida em três. A acurácia veio do RMSE, do RMSE relativo e da eficiência do modelo, junto com a questão de o erro ser sobretudo viés ou dispersão. A robustez perguntou se o tamanho do erro dependia da cultura ou do ambiente. O comportamento perguntou se o modelo reproduzia as diferenças observadas entre condições ambientais e práticas de manejo contrastantes16. As três respondem a perguntas diferentes, e uma seção de validação que reporta só a primeira respondeu a uma delas.

Calibrar um modelo de processo é outro trabalho

Tudo o que veio acima pressupunha um modelo cujos parâmetros são livres para assumir os valores que melhor se ajustem, porque não carregam nenhum significado além do ajuste. Os modelos de processo quebram esse pressuposto. As taxas de decomposição dos compartimentos do RothC, as constantes de renovação do Century e os parâmetros de nitrogênio do DayCent são escritos como grandezas físicas, e a pretensão do modelo de projetar além de seus dados de calibração repousa inteiramente no fato de elas serem físicas. É essa pretensão que torna delicado ajustá-los.

Os instrumentos para essa tarefa são os experimentos de longo prazo, alguns em curso há mais de um século, nos quais o carbono do solo foi acompanhado sob tratamentos fixos. São os únicos dados que restringem um modelo decenal na escala de tempo em que ele afirma funcionar, o que também significa que não são muitos, estão distribuídos de forma desigual entre os climas e solos do mundo, e o mesmo punhado aparece em uma calibração após a outra. O workshop que começou a testar de forma sistemática modelos de matéria orgânica do solo contra conjuntos de dados de longo prazo deu a razão: as mudanças na matéria orgânica do solo são lentas, então só dados de longo prazo conseguem testar um modelo delas. Seus conjuntos de dados vinham, segundo o próprio relato, da região temperada17. Um modelo ajustado em ensaios aráveis de clima temperado e aplicado à agrofloresta tropical foi calibrado contra um instrumento que nunca mediu nada parecido com o alvo18.

Na prática, há um espectro. Em um extremo, um modelador ajusta os parâmetros à mão até que as curvas simuladas e observadas pareçam próximas, o que é rápido, não documentado e irrepetível. No meio, um otimizador minimiza uma função de perda, o que é repetível e devolve um único melhor conjunto, sem nenhuma indicação de quão melhor ele era que as alternativas. No outro extremo, a calibração bayesiana trata os parâmetros como variáveis aleatórias, combina uma distribuição a priori com a verossimilhança das observações e devolve uma distribuição a posteriori: não uma resposta, mas uma descrição de todas as respostas que os dados toleram, com sua própria incerteza anexada19.

Esse enquadramento também abre espaço para algo que os outros dois ignoram. Os modelos reais são estruturalmente errados, e o erro estrutural não se comporta como ruído de medição. A calibração devolve o valor que melhor se ajusta, não um valor físico, e uma taxa de decomposição pode acabar em qualquer valor que compense um processo que o modelo não representa. O ajuste continua bom. Ela já não é uma taxa de decomposição, e uma projeção que se apoia em seu significado físico está se apoiando em algo que silenciosamente deixou de ser físico19.

A outra razão para preferir uma distribuição a um melhor ajuste é que o melhor ajuste em geral não é muito melhor que um grande número de alternativas bem diferentes. Muitos conjuntos de parâmetros reproduzem uma trajetória de carbono observada quase igualmente bem, e eles não concordam entre si sobre o futuro, porque ajustar o mesmo passado é uma restrição muito mais fraca do que parece. A resposta não é escolher o vencedor e reportar sua projeção, mas levar adiante o conjunto aceitável e deixar que ele produza uma faixa4. A ferramenta abaixo torna isso visível em um modelo simplificado de um compartimento com duas incógnitas: a região do espaço de parâmetros compatível com os dados é larga, estreita-se à medida que chegam mais dados e nunca colapsa em um ponto.

Uma interação a mais é fácil de deixar passar. O ponto de partida de um modelo de processo é, ele próprio, uma decisão de calibração. A divisão do estoque inicial entre compartimentos rápido, lento e inerte raramente é mensurável, costuma ser estimada e muda materialmente uma projeção de trinta anos. Calibrar parâmetros contra uma trajetória cujo ponto de partida também foi suposto significa ajustar duas incógnitas a uma única curva. Esse problema, e o procedimento de spin-up que é a resposta defensável a ele, é tratado em detalhe no artigo sobre como escolher um modelo de carbono do solo.

Uma declaração de incerteza é uma previsão, e pode ser testada

Volte ao quarto sentido de calibração, que é onde a maior parte da incerteza de modelos reportada falha silenciosamente. Um projeto declara sua estimativa como um valor central com um intervalo de noventa por cento. Esse intervalo não é uma ressalva nem um gesto de humildade. É uma afirmação falseável: ao longo de muitas declarações desse tipo, a verdade deveria cair dentro de cerca de noventa por cento delas. A fração que de fato cai é a cobertura obtida, e compará-la com os noventa nominais é uma medição comum que quase ninguém faz.

Quando ela é feita, os intervalos costumam ser estreitos demais. Três causas explicam a maior parte disso. A incerteza dos parâmetros é descartada, de modo que o intervalo reflete a dispersão residual em torno de um único modelo ajustado, e não a incerteza sobre qual modelo estava certo. O erro estrutural é ignorado, porque nenhum termo da aritmética representa a possibilidade de a forma do modelo estar errada. E observações correlacionadas são contadas como independentes, o que infla o tamanho efetivo da amostra e encolhe cada intervalo calculado a partir dele, um mecanismo tratado em detalhe no artigo sobre representatividade.

A correção não é alargar os intervalos até que cubram, que é o modo de falha pelo outro lado e produz afirmações vagas demais para orientar qualquer ação. Cobertura e nitidez são eixos separados, e o alvo é o intervalo mais estreito que ainda cobre na sua taxa nominal5. O que torna isso viável na prática é que ambas são mensuráveis em dados retidos, usando as mesmas partições já construídas para avaliar a previsão central. Uma validação que reporta a cobertura obtida ao lado do RMSE respondeu a uma pergunta que um verificador tem o direito de fazer e, em geral, não sabe como formular.

O que as normas de fato exigem

Duas perguntas surgem sempre que este material encontra um projeto real. Alguém exige isso? E alguém confere? As respostas curtas são que a contabilidade baseada em modelos carrega, sim, exigências de validação, que elas são menos específicas que a discussão estatística acima, e que a distância entre o que uma norma exige e o que torna um número defensável é onde vive a maior parte do julgamento profissional.

O arcabouço do IPCC define o vocabulário. O Tier 3 é o nível em que um inventário usa modelos ou medição direta em vez de fatores de emissão padrão, e a exigência associada à versão baseada em modelos é enunciada com clareza: inventários Tier 3 baseados em modelos requerem medições para calibrar e validar os modelos usados para estimar as mudanças nos estoques de carbono20. As duas metades deste artigo estão nessa frase, unidas por um “e” em vez de tratadas como uma coisa só. Medições para calibrar, e medições para validar. Se um dado inventário as mantém separadas é algo que a frase não tem como impor.

No mercado voluntário, as exigências são mais explícitas. A metodologia da Verra para manejo aprimorado de terras agrícolas permite que um modelo biogeoquímico simule a mudança do carbono do solo e acopla a isso um mecanismo: um relatório de validação do modelo, avaliado por um especialista independente em modelagem e reapresentado à medida que campanhas de medição posteriores ampliam o conjunto de dados de calibração e validação, e uma dedução por incerteza aplicada às reduções emitidas21. Um módulo separado traz as próprias exigências de calibração e validação22. A dedução é a parte que merece ser nomeada, porque o princípio de desenho é bom. Ela cresce com o erro padrão relativo da estimativa, de modo que a incerteza não é apenas divulgada, mas precificada, e um projeto que não consegue demonstrar um modelo bem restringido emite menos créditos para o mesmo carbono medido.

Sobre a própria partição, o módulo é mais específico do que a maioria dos profissionais espera, e mais exigente. Ele requer que os dados de calibração e de validação sejam comprovadamente independentes, e diz o que isso significa: os conjuntos de dados não podem se sobrepor quanto ao local de pesquisa experimental e não podem vir do mesmo estudo experimental22. Dividir um único conjunto é permitido, e o k-fold é citado como uma forma de fazê-lo, mas a condição de independência continua valendo, de modo que as dobras precisam respeitar estudo e local, em vez de serem sorteadas ao acaso entre linhas. Em substância, isso está muito mais perto do leave-site-out do que da retenção aleatória que a maioria das pessoas imagina, e uma equipe que se deu por satisfeita com um k-fold aleatório sobre parcelas agrupadas não cumpriu a exigência, por melhor que pareça o número resultante. Como um verificador lê a afirmação resultante é o tema do artigo complementar.

O que perguntar a qualquer número modelado

Nenhuma das perguntas a seguir exige que quem pergunta seja modelador. São as perguntas que separam um número com evidências por trás de um número com uma citação por trás, e podem ser feitas em uma reunião.

Dez perguntas

  1. 1Quando você diz que o modelo está calibrado, a qual dos quatro sentidos se refere?
  2. 2Que dados foram retidos do ajuste, e como foram escolhidos?
  3. 3Em que sentido esses dados retidos são independentes: outro local, outro ano, outra região?
  4. 4Quantas configurações de modelo foram avaliadas antes de esta ser reportada?
  5. 5Os dados usados para escolher o modelo foram os mesmos usados para reportar seu desempenho?
  6. 6Qual é o viés, separadamente do RMSE, nas unidades da grandeza?
  7. 7Frente a qual referência a habilidade é medida, e o modelo supera a previsão da média?
  8. 8No gráfico de observado contra previsto, quais são a inclinação e o intercepto?
  9. 9A incerteza declarada teve sua cobertura verificada, e que fração das observações retidas caiu dentro dela?
  10. 10As condições em que isto será aplicado estão dentro da faixa em que foi calibrado?

Uma equipe que consegue responder às dez fez o trabalho. Uma equipe que trata várias delas como descabidas também lhe disse algo útil.

O motivo para fazê-las não é desconfiança. A maioria dos números modelados nesta área é produzida por pessoas fazendo o melhor que podem com conjuntos de dados pequenos e prazos reais, e as lacunas costumam ser convenções herdadas, não atalhos. Mas um número que entra em um relato público, em uma emissão de créditos ou em um documento de política pública já saiu das mãos do modelador, e a essa altura a única coisa entre ele e uma decisão é se alguém perguntou contra o que ele foi testado.

Pontos-chave

  1. Calibração designa quatro operações diferentes: tornar um instrumento rastreável, ajustar um modelo empírico, estimar os parâmetros de um modelo de processo e calibrar uma afirmação probabilística. Elas falham de maneiras diferentes, e a maioria das disputas sobre modelos validados é um desencontro entre duas delas.

  2. O erro de treinamento cai sem limite à medida que um modelo ganha flexibilidade e não traz informação alguma sobre a próxima previsão. Só o erro em dados retirados do ajuste traz.

  3. O coeficiente de determinação dentro da amostra nunca cai quando se acrescenta um preditor, inclusive um preditor de números aleatórios. Uma alometria ajustada localmente que supera uma global nas suas próprias árvores de calibração não é evidência de nada.

  4. Dados usados para escolher um modelo não podem também medir seu desempenho. Selecionar a melhor de várias configurações em um único conjunto retido significa que o escore reportado é em parte o ruído que você selecionou; aninhar o procedimento resolve isso sem custo algum em dados.

  5. O esquema de validação cruzada é uma afirmação sobre a tarefa de previsão. O k-fold aleatório, o leave-site-out e a retenção temporal respondem a perguntas diferentes e não são comparáveis, de modo que um erro reportado sem sua partição não pode ser interpretado.

  6. Nenhuma métrica funciona sozinha. Viés, dispersão e habilidade frente a uma referência são propriedades separadas, e a correlação não mede nenhuma delas: um modelo que devolve exatamente metade de cada valor verdadeiro tem correlação perfeita com a verdade.

  7. Nos modelos de processo, muitos conjuntos de parâmetros ajustam a mesma trajetória quase igualmente bem e discordam sobre o futuro. Levar adiante o conjunto aceitável é mais defensável do que reportar a projeção do único melhor ajuste.

  8. Uma incerteza declarada é uma previsão testável. A cobertura obtida em dados retidos corresponde ou não à taxa nominal, é mensurável com partições já construídas para a estimativa central e quase nunca é reportada.

Referências

  • 1.JCGM (Joint Committee for Guides in Metrology) (2012). International vocabulary of metrology: Basic and general concepts and associated terms (VIM), 3rd edition. JCGM 200:2012. Bureau International des Poids et Mesures. bipm.org
  • 2.Viscarra Rossel, R.A., Walvoort, D.J.J., McBratney, A.B. et al. (2006). Visible, near infrared, mid infrared or combined diffuse reflectance spectroscopy for simultaneous assessment of various soil properties. Geoderma, 131(1–2), 59–75. doi:10.1016/j.geoderma.2005.03.007
  • 3.Haefner, J.W. (2005). Modeling Biological Systems: Principles and Applications, 2nd edition. Springer, New York. doi:10.1007/b106568
  • 4.Beven, K., Freer, J. (2001). Equifinality, data assimilation, and uncertainty estimation in mechanistic modelling of complex environmental systems using the GLUE methodology. Journal of Hydrology, 249(1–4), 11–29. doi:10.1016/s0022-1694(01)00421-8
  • 5.Gneiting, T., Balabdaoui, F., Raftery, A.E. (2007). Probabilistic Forecasts, Calibration and Sharpness. Journal of the Royal Statistical Society Series B: Statistical Methodology, 69(2), 243–268. doi:10.1111/j.1467-9868.2007.00587.x
  • 6.Oreskes, N., Shrader-Frechette, K., Belitz, K. (1994). Verification, Validation, and Confirmation of Numerical Models in the Earth Sciences. Science, 263(5147), 641–646. doi:10.1126/science.263.5147.641
  • 7.Wallach, D., Makowski, D., Jones, J.W. et al. (2019). Model evaluation. In: Working with Dynamic Crop Models: Methods, Tools and Examples for Agriculture and Environment, 3rd edition, pp. 311–373. Academic Press. doi:10.1016/B978-0-12-811756-9.00009-5
  • 8.Grant, W.E., Swannack, T.M. (2008). Ecological Modeling: A Common-Sense Approach to Theory and Practice. Blackwell Publishing. ISBN 978-1-4051-6168-8. wiley.com
  • 9.Hastie, T., Tibshirani, R., Friedman, J. (2009). The Elements of Statistical Learning. Springer Series in Statistics. doi:10.1007/978-0-387-84858-7
  • 10.Ploton, P., Mortier, F., Réjou-Méchain, M. et al. (2020). Spatial validation reveals poor predictive performance of large-scale ecological mapping models. Nature Communications, 11(1), 4540. doi:10.1038/s41467-020-18321-y
  • 11.Varma, S., Simon, R. (2006). Bias in error estimation when using cross-validation for model selection. BMC Bioinformatics, 7(1), 91. doi:10.1186/1471-2105-7-91
  • 12.Roberts, D.R., Bahn, V., Ciuti, S. et al. (2017). Cross‐validation strategies for data with temporal, spatial, hierarchical, or phylogenetic structure. Ecography, 40(8), 913–929. doi:10.1111/ecog.02881
  • 13.Nash, J.E., Sutcliffe, J.V. (1970). River flow forecasting through conceptual models part I — A discussion of principles. Journal of Hydrology, 10(3), 282–290. doi:10.1016/0022-1694(70)90255-6
  • 14.Lin, L.I.K. (1989). A Concordance Correlation Coefficient to Evaluate Reproducibility. Biometrics, 45(1), 255. doi:10.2307/2532051
  • 15.Piñeiro, G., Perelman, S., Guerschman, J.P. et al. (2008). How to evaluate models: Observed vs. predicted or predicted vs. observed?. Ecological Modelling, 216(3–4), 316–322. doi:10.1016/j.ecolmodel.2008.05.006
  • 16.Coucheney, E., Buis, S., Launay, M. et al. (2015). Accuracy, robustness and behavior of the STICS soil–crop model for plant, water and nitrogen outputs: Evaluation over a wide range of agro-environmental conditions in France. Environmental Modelling & Software, 64, 177–190. doi:10.1016/j.envsoft.2014.11.024
  • 17.Powlson, D.S., Smith, P., Smith, J.U. (eds.) (1996). Evaluation of Soil Organic Matter Models Using Existing Long-Term Datasets. NATO ASI Series I: Global Environmental Change, vol. 38. Springer, Berlin. doi:10.1007/978-3-642-61094-3
  • 18.Smith, P., Smith, J.U., Powlson, D.S. et al. (1997). A comparison of the performance of nine soil organic matter models using datasets from seven long-term experiments. Geoderma, 81(1–2), 153–225. doi:10.1016/s0016-7061(97)00087-6
  • 19.Kennedy, M.C., O'Hagan, A. (2001). Bayesian Calibration of Computer Models. Journal of the Royal Statistical Society Series B: Statistical Methodology, 63(3), 425–464. doi:10.1111/1467-9868.00294
  • 20.IPCC (2019). 2019 Refinement to the 2006 IPCC Guidelines for National Greenhouse Gas Inventories. Volume 4 (AFOLU), Chapter 2. IPCC, Switzerland. ipcc.ch
  • 21.Verra (2024). VM0042 Methodology for Improved Agricultural Land Management, v2.2. Verified Carbon Standard. Verra, Washington DC. verra.org
  • 22.Verra (2025). VMD0053 Model Calibration, Validation and Uncertainty Guidance for Biogeochemical Modeling for Agricultural Land Management Projects, v2.1. VCS Module, 25 March 2025. Verra, Washington DC. verra.org

Share this article

LinkedInEmail