10 DE JULHO DE 2026

Representativo de quê? Quando uma nova amostra cai fora do domínio do seu modelo

Visão geral

“Colete uma amostra representativa” carrega dois trabalhos diferentes: se uma amostra reflete a área que você quer descrever, e se um novo local está dentro das condições que um modelo calibrado de fato observou. A segunda questão, o domínio de aplicabilidade, é a que a maioria dos programas de monitoramento ignora. Como testar se uma região inteira é coberta pelo seu conjunto de calibração, como pontuar um ponto individual contra uma escada de métodos publicados com suas fórmulas e limiares, o que anexar a uma previsão limítrofe em vez de um aceno vago, e quão poucas amostras locais bastam para estender um domínio. Com o que a VM0042 da Verra já exige, e o que o CRCF da UE não exige. Três ferramentas interativas para você mesmo mover os controles.

Temas

Representatividade // Domínio de aplicabilidade // Amostragem // MRV

Autores

Dr. Thomas Fungenzi

Share

LinkedInEmail

Um programa de compra de cacau constrói uma linha de base de carbono orgânico do solo para sua primeira origem. A equipe coleta amostras por toda a bacia de fornecimento, ajusta um modelo que prevê o estoque de carbono a partir de covariáveis de solo e paisagem, e o valida por validação cruzada. O R² é 0.78. Bom o suficiente para reportar. Um ano depois, o programa se expande para uma segunda origem em outro país e reutiliza o mesmo modelo para estimar a nova linha de base, porque reconstruí-lo custaria uma campanha de campo que o orçamento não tem. O verificador faz uma pergunta: qual é a sua evidência de que a segunda origem está dentro da faixa de condições em que o modelo foi calibrado? A equipe aponta para o 0.78. Mas esse número descreve o quão bem o modelo prevê dentro das condições da primeira origem. Nada diz sobre a segunda. A sala fica em silêncio.

Este é o problema de representatividade que as equipes de monitoramento encontram com mais frequência e nomeiam com menos clareza. Não se trata realmente da amostra. Trata-se da relação entre três coisas: onde você mediu, onde você agora quer um número, e a fatia do mundo que o modelo de fato observou.

Duas perguntas escondidas em uma palavra

Representatividade é usada para duas afirmações distintas, e confundi-las é onde os problemas começam. A primeira afirmação é sobre uma amostra e uma população: que a amostra reflete a área que você quer descrever, de modo que uma média calculada a partir dela é uma estimativa justa da verdadeira média. Este é o domínio do delineamento amostral, e o sentido que trabalhamos em Qual deve ser o tamanho da sua campanha de amostragem de carbono do solo? e Sinal versus Ruído.

A segunda afirmação é sobre um novo ponto e um modelo. A maior parte do monitoramento hoje não para em uma média amostral. Ajusta-se um modelo, uma equação alométrica, um mapa de carbono do solo, uma calibração espectral, um modelo de processo como o RothC, ou um fator de emissão padrão, e aplica-se a locais onde nada foi medido. Uma previsão em um novo local é apenas tão confiável quanto a experiência do modelo com condições semelhantes às daquele local. Fora da faixa de condições dos dados de treinamento, o modelo está extrapolando, e seu erro não é nem limitado nem cognoscível a partir das estatísticas de ajuste.

Isso corresponde aos dois modos clássicos de inferência. A inferência baseada em delineamento obtém sua validade de como a amostra foi selecionada, e responde à pergunta amostra-para-população. A inferência baseada em modelo obtém sua validade do modelo estar correto onde é aplicado, e responde à pergunta novo-ponto-para-modelo 78. Uma amostra pode ser uma amostra probabilística de manual de sua própria população e ainda assim posicionar uma previsão bem fora da experiência de um modelo emprestado. As duas perguntas são independentes, e a segunda é a que silencia a sala.

O domínio de aplicabilidade, definido

O conceito que governa a segunda pergunta já tem um nome, tomado emprestado de um campo que aprendeu a lição cedo. Na química, os modelos quantitativos de estrutura-atividade preveem as propriedades de uma molécula a partir de sua estrutura, e os reguladores notaram que esses modelos faziam previsões confiantes e erradas para moléculas diferentes de qualquer coisa no conjunto de treinamento. A resposta foi definir um domínio de aplicabilidade: a região do espaço de entrada onde um modelo produz previsões confiáveis, com uma regra explícita para decidir se um novo caso está dentro dela 12.

O monitoramento ambiental usa a mesma ideia, em geral sem o nome. Toda equação alométrica é ajustada sobre uma faixa de diâmetros de árvore 11, e aplicá-la além dessa faixa é extrapolação, razão pela qual a regra prática é plotar a distribuição de diâmetros do seu inventário contra a faixa ajustada da equação, como descrevemos em Como calcular a quantidade de carbono em uma árvore? Uma faixa de diâmetros é um domínio de aplicabilidade em uma dimensão. Um modelo de solo moderno depende de muitas covariáveis ao mesmo tempo, os fatores SCORPAN que o mapeamento digital de solos formaliza 9, e os dados de treinamento ocupam uma nuvem nesse espaço de alta dimensionalidade. O domínio de aplicabilidade é a região desse espaço que a nuvem de fato cobre, e toda a questão se torna geométrica: o novo ponto está dentro da nuvem, ou lá num canto que o modelo nunca visitou?

O seu conjunto de calibração cobre a nova região?

Tudo até aqui trata de um ponto por vez, que é a pergunta certa quando você está prestes a reportar um número para uma fazenda. É a pergunta errada quando um programa quer saber se um modelo construído em uma origem pode ser reutilizado em toda uma segunda origem. Essa é uma pergunta sobre duas distribuições, e tem um teste direto que leva uma tarde.

Rotule cada amostra de calibração como 0 e cada local da área-alvo como 1. Descarte os valores de carbono do solo e mantenha apenas as covariáveis. Agora treine um classificador para distinguir os dois rótulos, e faça sua validação cruzada. Se o classificador não conseguir superar o acaso, os dois conjuntos são estatisticamente indistinguíveis nas variáveis que o modelo usa, e os seus dados de calibração são uma amostra plausível das condições do alvo. Se ele os separa com facilidade, você tem deslocamento de covariáveis, e agora tem um número para ele em vez de uma discussão sobre ele. Este é o teste de duas amostras por classificador, e a teoria que autoriza ler uma distância entre domínios a partir da acurácia de um classificador é mais antiga do que seu uso aqui 2223.

O classificador lhe dá três coisas que um R² de destaque não dá. Sua acurácia, lida como a área sob a curva ROC, é o número-resumo. Suas importâncias de variáveis dizem qual covariável dirige o descompasso, que é sobre o que você de fato agiria. E suas probabilidades ajustadas dão a razão de densidades entre as duas populações, a quantidade que formaliza o deslocamento de covariáveis 24 e que reaparece quando chegamos à incerteza.

Razão de densidades // e o tamanho amostral que ela lhe deixa
w(x) = p(x) / (1 − p(x)) × ncal / nalvo
ESS = (Σ wi)² / Σ wi²

A segunda linha é a que se coloca diante de um cliente. Reponderar um conjunto de calibração em direção a uma nova população-alvo é prática padrão 25, mas os pesos concentram o trabalho em um punhado cada vez menor de amostras, e o tamanho amostral efetivo de Kish mede quantas restam 26. Um conjunto de calibração de 200 amostras que, reponderado, equivale a um efetivo de 14 para a nova região já respondeu à pergunta. Esse número é mais difícil de contestar do que qualquer estatística de qualidade de ajuste, porque é uma contagem dos dados que de fato fazem o trabalho.

Mova os controles abaixo e observe os três números se moverem juntos. Vale provocar deliberadamente dois comportamentos. Afaste a área-alvo do conjunto de calibração e o classificador os separa, o tamanho amostral efetivo desaba, e a fração do alvo dentro do domínio cai; quando a área sob a curva chega a 0.94, setenta amostras de calibração valem um efetivo de quinze. Depois volte o deslocamento a zero e, em vez disso, alargue o alvo. O classificador cai de volta para 0.50, aparentemente declarando os dois conjuntos idênticos, enquanto bem menos da metade do alvo continua dentro do domínio.

Esse segundo caso é a limitação honesta do método, e ela importa. Um classificador linear separa pela média, então é cego a um alvo que compartilha o centro do conjunto de calibração e simplesmente abrange mais terreno, que é exatamente o que uma bacia de fornecimento faz quando se expande para terrenos mais variáveis. Use um aprendiz flexível em vez de uma regressão logística, e nunca leia o classificador sozinho: reporte-o junto com a fração do alvo que cai dentro do domínio. Um número detecta um deslocamento de posição, o outro detecta um deslocamento de dispersão, e um programa pode sofrer de qualquer um dos dois.

Para um plano de monitoramento, essa fração é a frase que vale a pena registrar: não “o modelo é aplicável”, mas “62% da nova bacia de fornecimento cai dentro do domínio de calibração, o restante está concentrado no norte de alta precipitação, e aqui está o que fizemos a respeito”.

Como saber se um novo ponto está dentro do domínio

A pertinência ao domínio é mensurável, e os métodos formam uma escada, não um cardápio. Cada degrau corrige uma cegueira específica do degrau abaixo, então a pergunta útil não é qual método é melhor, mas qual cegueira você pode se permitir.

Uma variável por vez. Para cada covariável, o novo local cai entre o mínimo e o máximo dos dados de treinamento? Isso pega a extrapolação mais grosseira em cinco minutos. A versão publicada dessa verificação, a superfície de similaridade ambiental multivariada, pontua um local de 0 a 100 pelo quão fundo dentro da distribuição de referência está a sua variável mais extrema, e fica negativa assim que qualquer variável deixa a faixa de referência, com a magnitude dando o afastamento como porcentagem da faixa daquela variável 17. Uma pontuação de 100 significa que o ponto está na mediana dos dados de referência em todas as variáveis.

Sua fraqueza é estrutural: ela toma o mínimo entre as variáveis, então é apenas superficialmente multivariada. Um ponto pode estar confortavelmente dentro da faixa de todas as variáveis e ainda ser uma combinação impossível que o modelo nunca viu, a precipitação de um local úmido com o teor de argila de um seco. Nenhuma quantidade de verificação variável a variável encontra isso.

Combinações inéditas. O método de detecção de extrapolação divide explicitamente a novidade nos dois tipos 16. Seu primeiro índice soma o afastamento de cada variável para além da faixa de referência, expresso como fração dessa faixa, e é zero sempre que todas as variáveis estão dentro da faixa. Seu segundo índice divide a distância de Mahalanobis de um ponto ao centroide de referência pela maior distância desse tipo entre os próprios dados de referência. Valores acima de 1 significam que o ponto está mais longe do centro da nuvem de treinamento do que qualquer ponto de treinamento jamais esteve: uma combinação inédita, invisível a qualquer verificação de faixa.

Detecção de extrapolação // novidade de faixa e novidade de combinação
NT1 = Σj min( xj − minj , maxj − xj , 0 ) / ( maxj − minj )
NT2 = D²(x, μref) / maxi∈ref D²(xi, μref)

Distância à nuvem de treinamento. Sob os dois está a distância de Mahalanobis, que mede a distância em unidades da própria dispersão e correlação dos dados de treinamento, de modo que um passo numa direção que os dados de treinamento mal exploraram conta mais do que um passo numa direção que eles cobriram bem. Sua distribuição de referência é a qui-quadrado com tantos graus de liberdade quantas são as covariáveis, o que dá um limiar em vez de uma impressão: sinalize tudo além do percentil 95. Para um modelo linear, a mesma ideia aparece como alavancagem, a diagonal da matriz chapéu, com a linha de alerta consagrada em três vezes a alavancagem média, e um gráfico de alavancagem contra resíduo padronizado é o diagnóstico que os reguladores do campo que batizou o domínio de aplicabilidade de fato usam 1210.

Distância de Mahalanobis // alavancagem // e seus limiares
D²(x) = (x − μ)ᵀ Σ−1 (x − μ)    sinalizar se D² > χ²p, 0.95
h(x) = xᵀ (XᵀX)−1 x    sinalizar se h > 3p / n

Duas ressalvas decidem se isso funciona na prática. A matriz de covariância precisa ser estimada de forma robusta, porque um punhado de pontos de treinamento atípicos a infla, e a matriz inflada passa então a declarar que tudo está dentro do domínio. E ela inverte mal quando as covariáveis são colineares ou numerosas, o que as covariáveis de solo confiavelmente são, então trabalhe no espaço dos componentes principais retidos ou use um estimador com encolhimento. Onde as variáveis são mistas, contínuas e categóricas, a distância de Gower e as simples distâncias aos vizinhos mais próximos são a alternativa não paramétrica robusta.

A área de aplicabilidade, para mapas. Quando o modelo produz um mapa contínuo de ponta a ponta, a questão é espacial: a quais pixels o modelo pode ser aplicado? O método da área de aplicabilidade responde exatamente a isso 3. Ele padroniza as covariáveis, pondera cada uma por sua importância no modelo ajustado, mede a distância de cada pixel ao seu ponto de treinamento mais próximo nesse espaço ponderado, e divide pela média de todas as distâncias entre pares dos dados de treinamento. Pixels além de um limiar derivado das próprias dissimilaridades dos dados de treinamento estão fora da área de aplicabilidade, e o erro reportado do modelo não se aplica ali. Um mapa regional pode parecer completo e categórico enquanto grandes partes dele estão, por esta medida, fora do domínio 4.

Índice de dissimilaridade // e o limiar que os dados de treinamento definem
DI(k) = mini d(k, i) / d̄    sobre covariáveis padronizadas e ponderadas por importância
limiar = maior DI não atípico entre os dados de treinamento validados cruzadamente

Vale enunciar esse limiar com precisão, porque ele é amplamente citado de forma errada. Ele é o máximo, removidos os valores atípicos, dos próprios índices de dissimilaridade dos pontos de treinamento. A expressão familiar do bigode superior, o percentil 75 mais 1.5 vezes a amplitude interquartil, é a regra para decidir quais valores contam como atípicos, não o limiar em si. O preprint que circula livremente especifica ainda outra regra, o quantil .95, que foi alterada durante a revisão por pares; a versão publicada é a que se deve implementar.

Quanto suporte, não apenas quão perto. O índice de dissimilaridade olha apenas para o único ponto de treinamento mais próximo, então não consegue distinguir um local escorado por uma amostra solitária de outro sustentado por duzentas. Contar quantos pontos de treinamento caem dentro da distância-limiar de um local fecha essa lacuna, e a contagem se correlaciona com o quão bem o modelo de fato se sai ali 15. É uma medida posterior que não custa nada a mais depois que as distâncias são calculadas, e é a diferença entre “dentro do domínio” e “dentro do domínio, e bem sustentado”.

As calibrações espectrais têm sua própria versão. Se o carbono do solo é previsto a partir de espectros no infravermelho médio em vez de covariáveis, a análise de componentes principais do conjunto de calibração define o espaço que ela conhece, e duas estatísticas são necessárias em par, não isoladamente. O Hotelling's T² mede o quão longe do centro um novo espectro está dentro desse espaço; o Q-residual mede o quão longe ele está fora dele, em direções que a calibração nunca modelou. Uma amostra pode passar em qualquer uma delas isoladamente e ainda ser uma que a calibração nunca foi treinada para ler.

VerificaçãoDetectaDeixa passar
Faixa por variável // MESSQualquer variável fora de sua faixa calibradaCombinações inéditas de variáveis dentro da faixa
ExDet NT1 + NT2Novidade de faixa e combinações inéditas, separadamenteQual direção no espaço de covariáveis carece de sustentação
Mahalanobis // alavancagemDistância à nuvem, em unidades de sua própria dispersãoLacunas locais dentro do envelope geral
Área de aplicabilidadeDistância por pixel, ponderada pela importância das covariáveisQuantos pontos de treinamento dão a sustentação
Densidade local de pontos de dadosSustentação rala dentro de uma região nominalmente cobertaSe a própria relação mudou
Hotelling's T² + QEspectros diferentes da calibração, dentro e fora de seu espaçoNada, se as duas forem lidas em conjunto

A armadilha da validação: por que um bom R² pode mentir

Há uma forma específica de isso dar errado que lisonjeia o praticante. Quando um modelo é validado por validação cruzada aleatória comum, os pontos retidos ficam espalhados entre os pontos de treinamento. Se os dados são espacialmente autocorrelacionados, e dados de solo e vegetação quase sempre o são, então cada ponto retido tem um vizinho próximo no conjunto de treinamento. O modelo está sendo testado quase inteiramente dentro do seu domínio, em pontos fáceis. A validação estruturada espacialmente, que retém blocos inteiros de espaço, revela repetidamente que modelos com excelentes escores de validação cruzada aleatória preveem mal quando precisam se estender 56. Um mapa regional pode ser não enviesado em média ao longo de sua extensão e ainda estar errado em cada projeto individual dentro dele.

A resposta honesta não é simplesmente trocar a validação cruzada aleatória pela espacial e seguir em frente, porque o próprio delineamento de validação correto é objeto de debate: o bloqueio espacial pode ser pessimista se retiver regiões que o modelo jamais seria solicitado a prever, e a opção mais defensável, quando o orçamento permite, é uma amostra de validação separada, extraída por amostragem probabilística da área-alvo, que estima a acurácia do mapa sem se apoiar no modelo de forma alguma 78. O ponto que sobrevive ao debate é mais simples: um número de acurácia só é significativo em conjunto com uma declaração de onde, no espaço de covariáveis e geográfico, ele foi medido, e se o lugar onde você agora quer uma previsão se assemelha a isso.

Há agora uma resposta mais afiada do que escolher um lado. Em vez de bloquear o espaço arbitrariamente, faça a validação corresponder à previsão: retenha pontos de modo que a distribuição das distâncias do ponto de teste aos dados de treinamento se assemelhe à distribuição das distâncias dos lugares que você de fato vai prever até os dados de treinamento 13. A validação cruzada passa então a medir o alcance que o modelo realmente terá de exercer, nem lisonjeada por vizinhos próximos nem penalizada por regiões sobre as quais ninguém vai perguntar. A formulação original retinha um ponto por vez e não escalava; a versão em k dobras leva um conjunto agrupado de quatro mil pontos de dias para cerca de um minuto 14, o que importa, porque a razão usual pela qual as equipes recorrem à validação cruzada aleatória é que a alternativa honesta estava computacionalmente fora de alcance. Amostras agrupadas exigem cuidados próprios 39.

O que “inflar a incerteza” deveria de fato significar

O conselho de alargar as barras de erro para pontos limítrofes é fácil de dar e difícil de seguir. Alargar em quanto? Existe uma resposta rigorosa, e suas limitações são tão instrutivas quanto suas garantias.

A previsão conforme dividida constrói um intervalo a partir de resíduos retidos, e não de qualquer suposição sobre a forma dos erros 18. Ajuste o modelo em parte dos dados, calcule os resíduos absolutos em um conjunto de calibração retido, e tome uma estatística de ordem específica desses resíduos como semiamplitude do intervalo. O intervalo resultante cobre a verdade pelo menos 1 − α das vezes, em amostras finitas, sem suposição distribucional alguma.

Conforme dividida // o intervalo e o tamanho de calibração que ele exige
Ĉ(x) = μ̂(x) ± q    onde q = o ⌈(n+1)(1−α)⌉-ésimo menor |yi − μ̂(xi)|
n ≥ ⌈1/α⌉ − 1    logo um intervalo de 95% exige ao menos 19 pontos de calibração

A segunda linha não é um detalhe técnico. Abaixo desse número de pontos de calibração, o método devolve um intervalo infinitamente largo, que é sua maneira honesta de dizer que os dados não sustentam a afirmação que se pede deles. Um método que se recusa a responder quando não pode vale mais para um programa de monitoramento do que um que sempre produz um número.

Uma semiamplitude constante ao longo de um projeto inteiro raramente é o que se quer, e a correção é padrão: pontue a conformidade contra quantis ajustados em vez de uma média ajustada, e o intervalo se adapta ao quanto o modelo é incerto em cada local, mantendo a garantia de cobertura 20. Locais em condições bem amostradas recebem intervalos estreitos, os incômodos recebem intervalos largos, e ninguém precisa escolher o fator de inflação à mão.

Eis a pegadinha, e ela é todo o assunto deste artigo. Essa garantia só vale se os pontos de calibração e o novo ponto forem permutáveis, que é precisamente o que a mudança para uma nova região quebra. A previsão conforme não é uma fuga do problema do domínio. Aplicada ingenuamente através de uma fronteira de domínio, ela produz intervalos que parecem rigorosos e não são.

O que a resgata é a quantidade que já construímos. Se você conhece a razão de densidades entre as populações alvo e de calibração, pode ponderar por ela cada resíduo de calibração e recuperar a garantia sob deslocamento de covariáveis 19. O mecanismo é elegante: o novo ponto contribui com seu próprio peso para o quantil, de modo que, à medida que ele avança para um território que os dados de calibração mal cobrem, mais massa de probabilidade se acumula no infinito e o intervalo se alarga por conta própria, tornando-se ilimitado assim que esse peso ultrapassa α. O classificador da seção de cobertura é o que fornece a razão, e é por isso que as duas seções andam juntas. Uma ressalva honesta: a garantia é exata apenas quando a razão é conhecida, e na prática ela é estimada, então trate a cobertura como aproximada e como algo que se degrada com a qualidade dessa estimativa.

Vale conhecer um limite mais duro antes que alguém o prometa. A cobertura condicional aos valores exatos das covariáveis de um local não pode ser obtida de forma não trivial para covariáveis contínuas: qualquer procedimento que a reivindique tem de devolver intervalos infinitamente largos 21. O compromisso viável é garantir a cobertura dentro de estratos que você declara de antemão, por região, textura do solo ou uso da terra, cada um com seu próprio conjunto de calibração. Esse é o formato certo para o MRV, e traz uma consequência operacional: uma região pouco amostrada recebe uma garantia grosseira ou nenhuma, o que é informação e não um defeito.

Uma regra de decisão que você pode defender

Reunido, o teste de domínio é um fluxo de trabalho curto e repetível que cabe em uma página de um plano de monitoramento. Defina o domínio de calibração (a distribuição multivariada das covariáveis nos dados de treinamento). Localize cada novo ponto em relação a ele: primeiro a verificação de faixa por variável, depois uma métrica de distância. Classifique-o como dentro do domínio, limítrofe, ou fora do domínio contra limiares fixados de antemão. Então aja conforme a classe: pontos dentro do domínio recebem a previsão como está; pontos limítrofes a recebem com uma incerteza explicitamente inflada e um sinalizador; pontos fora do domínio não recebem número emprestado algum, eles disparam amostragem de referência local e reestimação.

O valor de colocar isso por escrito é que converte um argumento (“achamos que a nova região é semelhante o suficiente”) em evidência (“aqui está onde cada novo ponto cai, e aqui está a regra que aplicamos”). Essa é a diferença entre uma afirmação que um verificador aceita e uma que um verificador sonda.

Um exemplo trabalhado: um modelo, duas regiões

Um modelo de carbono do solo é calibrado em fazendas a pleno sol e de sombra leve em uma região de fornecimento. O fornecimento se expande para uma segunda região de agrofloresta sombreada estabelecida. Cinco das covariáveis do modelo, verificadas contra o local representativo da nova região:

CovariávelFaixa de calibração (A)Novo local (B)Dentro da faixa?
Argila (%)12–3441Não (acima)
Precipitação média anual (mm)900–15001850Não (acima)
Temperatura média anual (°C)23–2725Sim
Elevação (m)40–320180Sim
Cobertura de copa de sombra (%)0–1555Não (acima)

Três das cinco covariáveis caem fora da faixa calibrada, e as duas que mais importam para o carbono, precipitação e sombra, estão entre elas. Uma distância de Mahalanobis ou um índice de área de aplicabilidade colocaria este local bem além da nuvem de treinamento. O veredito é inequívoco: o modelo está fora do domínio aqui, e aplicá-lo reportaria um número sem sustentação. Esta é a mesma constatação, em miniatura, que avaliações independentes alcançam em escala continental, onde relações de carbono do solo calibradas em sistemas temperados de culturas em linha não se transferem para sistemas perenes sombreados sem reestimação local. Retomamos a escolha de modelo e a recalibração local em Como modelar a variação do carbono do solo ao longo do tempo?

Quando a resposta é “fora”: estendendo o domínio de forma barata

“Dispare a amostragem local” é onde a maioria dos tratamentos deste assunto para, e é o ponto em que um gerente de programa mais precisa de ajuda. A notícia útil é que estender um domínio é bem mais barato do que construir um, e os números são surpreendentemente pequenos.

Escolha os novos pontos para cobrir o espaço, não para imitar a população. A amostragem por hipercubo latino condicionado, o padrão no mapeamento digital de solos, seleciona locais de modo que a amostra reproduza as distribuições marginais das covariáveis e suas correlações 29. A amostragem por cobertura, em vez disso, agrupa a área-alvo no espaço de covariáveis e amostra perto de cada centro de agrupamento, abrangendo o espaço conjunto em vez de reproduzir suas marginais 30. Para calibrar um modelo, abranger costuma ser o que se quer, e uma comparação recomenda espalhar a amostra pelo espaço de atributos das covariáveis mais importantes 31.

Resista a quem vender um vencedor claro entre os dois. A evidência é genuinamente mista: a amostragem por cobertura vence em média em algumas comparações, o hipercubo latino vence em tamanhos amostrais pequenos em outras, e o tamanho da amostra importa mais do que a escolha do método na maioria delas. Comparações baseadas em uma única realização de cada delineamento são quase não informativas, porque as distribuições dos resultados se sobrepõem fortemente.

Muitas vezes você não precisa reconstruir o modelo. A espectroscopia de solos aprendeu isso primeiro, onde uma biblioteca grande que falha localmente pode ser reparada acrescentando-lhe um punhado de amostras locais, prática chamada de spiking. Os números na literatura são consistentes e pequenos: cerca de quinze amostras locais reduzem fortemente o viés de previsão 32, doze levaram o desempenho de um modelo regional de um R² de 0.07 a 0.36 para 0.69 a 0.86 33, e de doze a vinte amostras locais combinadas com uma biblioteca grande igualaram calibrações específicas de local construídas a partir de até trezentas 34. De dez a trinta amostras bem escolhidas é a faixa de trabalho.

A mesma economia aparece na alometria. Usando equações publicadas como distribuições a priori em vez de começar do zero, seis árvores conseguem estimar parâmetros tão bem quanto quarenta a sessenta na abordagem clássica 35. É o agrupamento parcial fazendo o trabalho: o modelo emprestado fornece a forma, os dados locais o puxam em direção à verdade local, e o componente de variância entre locais é, ele próprio, uma medida de quão transferível a relação era desde o início.

Se você só puder pagar por um teste, teste o viés. Uma pequena amostra local que não sustenta um reajuste ainda pode responder se o modelo emprestado está sistematicamente errado aqui. Essa é uma comparação de duas amostras, e usa a mesma fórmula de poder de qualquer delineamento de detecção de mudança, que trabalhamos em Qual deve ser o tamanho da sua campanha de amostragem de carbono do solo? Substituir a diferença mínima detectável pelo viés que lhe importaria dá o número de amostras locais necessárias para pegá-lo.

Uma constatação contraintuitiva merece lugar em qualquer decisão de transferência. Quando funções de pedotransferência foram levadas para uma nova região, as construídas apenas com areia e argila superaram versões que usavam onze covariáveis 38. Mais preditores significam um espaço de dimensionalidade mais alta, uma nuvem de treinamento mais esparsa, e mais maneiras de um novo local cair fora dela. A parcimônia não é apenas uma preferência estética; é uma estratégia de domínio. O custo de errar nisso está bem documentado: equações pantropicais superestimaram a biomassa em cerca de 40% em um local da África central 36, e equações construídas a partir de amostras pequenas carregam um viés médio em nível de local perto de +70%, variando de −4% a +193% 37.

Reamostragem, e o domínio que se move

Há uma segunda maneira, mais silenciosa, de a representatividade falhar, e ela aparece precisamente quando um programa faz todo o resto certo. O monitoramento se baseia na reamostragem: revisitar a mesma rede ao longo do tempo, comparar, e reportar a variação. A suposição não declarada é que a rede permanece representativa do sistema que ela monitora. Os sistemas se movem. O manejo muda, um programa de sombreamento amadurece, uma seca remodela o regime de umidade do solo, o uso da terra se desloca nas bordas da bacia de fornecimento. Um modelo calibrado uma vez contra o sistema original pode escorregar para fora do domínio em relação ao sistema que agora existe, sem que ninguém refaça uma verificação. Os estatísticos chamam isso de deslocamento de covariáveis ou deriva de conceito; no campo, parece uma linha de base que silenciosamente deixa de descrever o presente.

A deriva é testável com o instrumento já apresentado. Rode o classificador de domínio entre ciclos de monitoramento em vez de entre regiões: rotule as covariáveis do primeiro ciclo como 0 e as do segundo ciclo como 1, e veja se um classificador consegue distinguir os anos. Se conseguir, o sistema se moveu em relação ao modelo, e as importâncias das variáveis nomeiam o que se moveu. Não custa nada além das covariáveis que você já tem, e transforma um alerta em uma verificação agendada.

Por que os verificadores estão começando a perguntar

A afirmação de que o monitoramento ambiental usa essa ideia sem nomeá-la precisa de uma correção, e ela é útil. A VM0042 da Verra a nomeia. Sua seção de definições define um domínio do projeto como o conjunto de condições, incluindo tipo de cultura, textura do solo e clima, em que a aplicação do modelo foi validada 40. Aqui, o domínio de aplicabilidade não é uma abstração emprestada da química; é um termo definido na metodologia contra a qual uma grande parcela dos projetos de carbono do solo é escrita.

Seu módulo complementar transforma a definição em um teste auditável. Toda zona climática ou região agrícola definida nacionalmente que o projeto declarar precisa aparecer no conjunto de dados de validação; as três classes texturais de solo que se espera que dominem a área do projeto precisam estar incluídas; e os dados precisam abranger 15 pontos percentuais de teor de argila. O módulo enuncia o propósito com clareza, que é confirmar que o modelo não foi hipercalibrado para uma combinação de condições e depois aplicado em outro lugar. Vale enunciar dois limites com precisão: a exigência recai sobre a quantificação por medição-e-modelo, e não sobre a creditação apenas por medição, e ela não fixa número mínimo de locais. A disciplina é de cobertura, não de tamanho amostral.

O resto do panorama é mais brando, e vale não exagerá-lo. O IPCC trata isso como boa prática em escala nacional, recomendando que os modelos de Nível 3 sejam calibrados e testados contra medições que reflitam a variabilidade de clima, solo e uso da terra sobre a qual serão aplicados. O regulamento europeu de remoções de carbono, apesar de afirmações frequentes em contrário, não impõe exigência alguma de validação de modelo: seu dever de representatividade recai sobre a linha de base, e a substância fica adiada para atos delegados ainda por vir. Quem o cita para este fim não o leu.

Isso já não é apenas um preciosismo metodológico. Os arcabouços de contabilidade que governam as alegações de carbono estão convergindo para a exigência de que a incerteza seja quantificada e divulgada, e uma previsão aplicada fora do domínio de um modelo é incerteza que foi ocultada em vez de quantificada. O Guia GHG Protocol Land Sector and Removals, em vigor a partir de 1º de janeiro de 2027, pede que as empresas calibrem as abordagens baseadas em modelos e em sensoriamento remoto com dados empíricos próprios do terreno e do manejo analisados, e, quando se reivindicam remoções, essa recomendação se torna exigência, com reamostragem pelo menos a cada cinco anos. O Refinamento de 2019 do IPCC empurra na direção de fatores de nível superior, localmente apropriados, em vez de padrões emprestados, precisamente porque os padrões estão fora do domínio para muitos dos lugares onde são aplicados 12. Os verificadores estão começando a pedir validação estruturada espacialmente ou independente em vez de um R² de destaque, e evidência de que um modelo reutilizado se ajusta ao local em que está sendo reutilizado. As equipes que passarão por essas perguntas são as que testaram a pertinência ao domínio antes de serem questionadas, e conseguem mostrar o trabalho.

Pontos-chave

  1. Representatividade carrega duas perguntas distintas: a amostra é representativa da população (delineamento amostral), e um novo ponto está dentro do domínio calibrado do modelo (aplicabilidade). A segunda é a que a maioria dos programas ignora.

  2. Uma amostra pode ser perfeitamente representativa de sua própria população e ainda cair fora do domínio de aplicabilidade de um modelo emprestado. As duas coisas são independentes.

  3. O domínio de aplicabilidade é a região do espaço de covariáveis que os dados de treinamento de fato cobrem. A faixa de diâmetros de uma equação alométrica é essa ideia em uma dimensão; o domínio de um mapa de carbono do solo é a mesma ideia em muitas.

  4. Para uma região inteira, e não um ponto, treine um classificador para separar as amostras de calibração dos locais-alvo apenas pelas covariáveis. Uma AUC perto de 0.5 significa que os conjuntos são indistinguíveis; o tamanho amostral efetivo dos pesos resultantes diz quantas amostras de calibração estão de fato fazendo o trabalho.

  5. Leia esse classificador junto com a fração do alvo que está dentro do domínio. Um classificador linear separa pela média, então é cego a um alvo que compartilha o centro da calibração e simplesmente abrange mais terreno.

  6. A pertinência ao domínio é uma escada, cada degrau corrigindo uma cegueira do degrau abaixo: faixa por variável e MESS, depois a divisão do ExDet entre novidade de faixa e combinações inéditas, depois a distância de Mahalanobis contra um limiar qui-quadrado, depois a área de aplicabilidade para mapas, depois a densidade local de pontos de dados para saber quanta sustentação existe.

  7. O limiar da área de aplicabilidade é o máximo, removidos os valores atípicos, dos próprios índices de dissimilaridade dos dados de treinamento. A expressão do bigode superior é a regra dos atípicos, não o limiar, e o preprint que circula livremente especifica uma regra diferente da do artigo publicado.

  8. Um escore alto de validação cruzada aleatória pode ser um artefato de autocorrelação espacial. Faça a validação corresponder à previsão por correspondência de distâncias ao vizinho mais próximo, ou use uma amostra probabilística independente, e sempre reporte onde a acurácia foi medida.

  9. “Inflar a incerteza” tem uma forma rigorosa: a previsão conforme dá intervalos livres de distribuição, mas apenas sob permutabilidade, que uma nova região quebra. Ponderar pela razão de densidades restaura a garantia, e as barras de erro do próprio modelo não vão ajudar: as florestas de regressão quantílica ficam mais estreitas na borda da faixa de treinamento, não mais largas.

  10. Estender um domínio é barato. De dez a trinta amostras locais bem escolhidas reparam uma calibração espectral emprestada; seis árvores com distribuições a priori informativas igualam quarenta a sessenta sem elas. Menos covariáveis muitas vezes transferem melhor, porque é mais fácil cair fora de uma nuvem esparsa de alta dimensionalidade.

  11. A VM0042 da Verra já define um domínio do projeto como as condições em que a aplicação do modelo foi validada, e seu módulo complementar torna auditável a cobertura de zonas climáticas, texturas de solo e uma amplitude de 15 pontos de argila. O regulamento europeu de remoções de carbono, ao contrário do que se alega comumente, não exige nada disso.

Referências

  • 1.Netzeva, T.I. et al. (2005). Current status of methods for defining the applicability domain of (quantitative) structure-activity relationships. ATLA Alternatives to Laboratory Animals, 33(2), 155–173. doi:10.1177/026119290503300209
  • 2.Jaworska, J., Nikolova-Jeliazkova, N., Aldenberg, T. (2005). QSAR applicability domain estimation by projection of the training set in descriptor space, a review. ATLA, 33(5), 445–459. doi:10.1177/026119290503300508
  • 3.Meyer, H., Pebesma, E. (2021). Predicting into unknown space? Estimating the area of applicability of spatial prediction models. Methods in Ecology and Evolution, 12(9), 1620–1633. doi:10.1111/2041-210X.13650
  • 4.Meyer, H., Pebesma, E. (2022). Machine learning-based global maps of ecological variables and the challenge of assessing them. Nature Communications, 13, 2208. doi:10.1038/s41467-022-29838-9
  • 5.Ploton, P. et al. (2020). Spatial validation reveals poor predictive performance of large-scale ecological mapping models. Nature Communications, 11, 4540. doi:10.1038/s41467-020-18321-y
  • 6.Roberts, D.R. et al. (2017). Cross-validation strategies for data with temporal, spatial, hierarchical, or phylogenetic structure. Ecography, 40(8), 913–929. doi:10.1111/ecog.02881
  • 7.Wadoux, A.M.J-C., Heuvelink, G.B.M., de Bruin, S., Brus, D.J. (2021). Spatial cross-validation is not the right way to evaluate map accuracy. Ecological Modelling, 457, 109692. doi:10.1016/j.ecolmodel.2021.109692
  • 8.Brus, D.J., Kempen, B., Heuvelink, G.B.M. (2011). Sampling for validation of digital soil maps. European Journal of Soil Science, 62(3), 394–407. doi:10.1111/j.1365-2389.2011.01364.x
  • 9.McBratney, A.B., Mendonça Santos, M.L., Minasny, B. (2003). On digital soil mapping. Geoderma, 117(1–2), 3–52. doi:10.1016/S0016-7061(03)00223-4
  • 10.Sheridan, R.P. et al. (2004). Similarity to molecules in the training set is a good discriminator for prediction accuracy in QSAR. Journal of Chemical Information and Computer Sciences, 44(6), 1912–1928. doi:10.1021/ci049782w
  • 11.Chave, J. et al. (2014). Improved allometric models to estimate the aboveground biomass of tropical trees. Global Change Biology, 20(10), 3177–3190. doi:10.1111/gcb.12629
  • 12.IPCC (2019). 2019 Refinement to the 2006 IPCC Guidelines for National Greenhouse Gas Inventories. Intergovernmental Panel on Climate Change. ipcc.ch
  • 13.Milà, C., Mateu, J., Pebesma, E., Meyer, H. (2022). Nearest neighbour distance matching Leave-One-Out Cross-Validation for map validation. Methods in Ecology and Evolution, 13(6), 1304–1316. doi:10.1111/2041-210X.13851
  • 14.Linnenbrink, J., Milà, C., Ludwig, M., Meyer, H. (2024). kNNDM CV: k-fold nearest-neighbour distance matching cross-validation for map accuracy estimation. Geoscientific Model Development, 17(15), 5897–5912. doi:10.5194/gmd-17-5897-2024
  • 15.Schumacher, F.L., Knoth, C., Ludwig, M., Meyer, H. (2025). Estimation of local training data point densities to support the assessment of spatial prediction uncertainty. Geoscientific Model Development, 18(24), 10185–10202. doi:10.5194/gmd-18-10185-2025
  • 16.Mesgaran, M.B., Cousens, R.D., Webber, B.L. (2014). Here be dragons: a tool for quantifying novelty due to covariate range and correlation change when projecting species distribution models. Diversity and Distributions, 20(10), 1147–1159. doi:10.1111/ddi.12209
  • 17.Elith, J., Kearney, M., Phillips, S. (2010). The art of modelling range-shifting species. Methods in Ecology and Evolution, 1(4), 330–342. doi:10.1111/j.2041-210X.2010.00036.x
  • 18.Lei, J., G'Sell, M., Rinaldo, A., Tibshirani, R.J., Wasserman, L. (2018). Distribution-free predictive inference for regression. Journal of the American Statistical Association, 113(523), 1094–1111. doi:10.1080/01621459.2017.1307116
  • 19.Tibshirani, R.J., Foygel Barber, R., Candès, E.J., Ramdas, A. (2019). Conformal prediction under covariate shift. Advances in Neural Information Processing Systems 32. arXiv:1904.06019
  • 20.Romano, Y., Patterson, E., Candès, E.J. (2019). Conformalized quantile regression. Advances in Neural Information Processing Systems 32. arXiv:1905.03222
  • 21.Vovk, V. (2012). Conditional validity of inductive conformal predictors. Proceedings of the Asian Conference on Machine Learning, PMLR 25, 475–490. proceedings.mlr.press
  • 22.Lopez-Paz, D., Oquab, M. (2017). Revisiting classifier two-sample tests. International Conference on Learning Representations. arXiv:1610.06545
  • 23.Ben-David, S., Blitzer, J., Crammer, K., Kulesza, A., Pereira, F., Vaughan, J.W. (2010). A theory of learning from different domains. Machine Learning, 79(1–2), 151–175. doi:10.1007/s10994-009-5152-4
  • 24.Shimodaira, H. (2000). Improving predictive inference under covariate shift by weighting the log-likelihood function. Journal of Statistical Planning and Inference, 90(2), 227–244. doi:10.1016/S0378-3758(00)00115-4
  • 25.Sugiyama, M., Suzuki, T., Nakajima, S., Kashima, H., von Bünau, P., Kawanabe, M. (2008). Direct importance estimation for covariate shift adaptation. Annals of the Institute of Statistical Mathematics, 60(4), 699–746. doi:10.1007/s10463-008-0197-x
  • 26.Kish, L. (1965). Survey Sampling. John Wiley & Sons, New York. O tamanho amostral efetivo usado aqui é a reformulação algébrica do efeito de delineamento por ponderação desigual de Kish.
  • 27.Dega, S., Dietrich, P., Schrön, M., Paasche, H. (2023). Probabilistic prediction by means of the propagation of response variable uncertainty through a Monte Carlo approach in regression random forest. Frontiers in Environmental Science, 11, 1009191. doi:10.3389/fenvs.2023.1009191
  • 28.Hateffard, F., Steinbuch, L., Heuvelink, G.B.M. (2024). Evaluating the extrapolation potential of random forest digital soil mapping. Geoderma, 441, 116740. doi:10.1016/j.geoderma.2023.116740
  • 29.Minasny, B., McBratney, A.B. (2006). A conditioned Latin hypercube method for sampling in the presence of ancillary information. Computers & Geosciences, 32(9), 1378–1388. doi:10.1016/j.cageo.2005.12.009
  • 30.Ma, T., Brus, D.J., Zhu, A.-X., Zhang, L., Scholten, T. (2020). Comparison of conditioned Latin hypercube and feature space coverage sampling for predicting soil classes using simulation from soil maps. Geoderma, 370, 114366. doi:10.1016/j.geoderma.2020.114366
  • 31.Wadoux, A.M.J-C., Brus, D.J., Heuvelink, G.B.M. (2019). Sampling design optimization for soil mapping with a random forest. Geoderma, 355, 113913. doi:10.1016/j.geoderma.2019.113913
  • 32.Seidel, M. et al. (2019). Strategies for the efficient estimation of soil organic carbon at the field scale with vis-NIR spectroscopy: Spectral libraries and spiking vs. local calibrations. Geoderma, 354, 113856. doi:10.1016/j.geoderma.2019.07.014
  • 33.Guy, A.L., Siciliano, S.D., Lamb, E.G. (2015). Spiking regional vis-NIR calibration models with local samples to predict soil organic carbon in two High Arctic polar deserts using a vis-NIR probe. Canadian Journal of Soil Science, 95(3), 237–249. doi:10.4141/cjss-2015-004
  • 34.Lobsey, C.R., Viscarra Rossel, R.A., Roudier, P., Hedley, C.B. (2017). rs-local data-mines information from spectral libraries to improve local calibrations. European Journal of Soil Science, 68(6), 840–852. doi:10.1111/ejss.12490
  • 35.Zapata-Cuartas, M., Sierra, C.A., Alleman, L. (2012). Probability distribution of allometric coefficients and Bayesian estimation of aboveground tree biomass. Forest Ecology and Management, 277, 173–179. doi:10.1016/j.foreco.2012.04.030
  • 36.Ngomanda, A. et al. (2014). Site-specific versus pantropical allometric equations: Which option to estimate the biomass of a moist central African forest?. Forest Ecology and Management, 312, 1–9. doi:10.1016/j.foreco.2013.10.029
  • 37.Duncanson, L., Rourke, O., Dubayah, R. (2015). Small sample sizes yield biased allometric equations in temperate forests. Scientific Reports, 5, 17153. doi:10.1038/srep17153
  • 38.Schoch, J., Nussbaum, M., Walthert, L., Carminati, A., Lehmann, P. (2025). Transferability of pedotransfer functions for estimating soil hydraulic properties: An analysis of controlling factors for forest soils in Switzerland. Geoderma, 460, 117397. doi:10.1016/j.geoderma.2025.117397
  • 39.de Bruin, S., Brus, D.J., Heuvelink, G.B.M., van Ebbenhorst Tengbergen, T., Wadoux, A.M.J.-C. (2022). Dealing with clustered samples for assessing map accuracy by cross-validation. Ecological Informatics, 69, 101665. doi:10.1016/j.ecoinf.2022.101665
  • 40.Verra (2025). VM0042 Methodology for Improved Agricultural Land Management, v2.2, and VMD0053 Model Calibration, Validation and Uncertainty Guidance for Biogeochemical Modeling, v2.1. Verified Carbon Standard. verra.org
  • 41.Meinshausen, N. (2006). Quantile regression forests. Journal of Machine Learning Research, 7(35), 983–999. jmlr.org

Share this article

LinkedInEmail