Sebuah program pengadaan kakao membangun garis dasar karbon organik tanah untuk wilayah asal pertamanya. Tim mengumpulkan sampel di seluruh wilayah pasokan, mencocokkan sebuah model yang memprediksi stok karbon dari kovariat tanah dan bentang lahan, lalu memvalidasinya dengan validasi silang. Nilai R² adalah 0.78. Cukup baik untuk dilaporkan. Setahun kemudian program itu meluas ke wilayah asal kedua di negara yang berbeda, dan menggunakan kembali model yang sama untuk memperkirakan garis dasar baru, karena membangunnya ulang akan menuntut sebuah kampanye lapangan yang tidak dimiliki anggaran. Verifikator mengajukan satu pertanyaan: apa bukti Anda bahwa wilayah asal kedua berada dalam rentang kondisi tempat model dikalibrasi? Tim menunjuk ke angka 0.78. Namun angka itu menggambarkan seberapa baik model memprediksi di dalam kondisi wilayah asal pertama. Ia tidak mengatakan apa pun tentang yang kedua. Ruangan pun hening.
Inilah masalah representativitas yang paling sering ditemui tim pemantauan dan paling jarang diberi nama dengan jelas. Persoalannya sebenarnya bukan tentang sampel. Ia tentang hubungan antara tiga hal: di mana Anda mengukur, di mana Anda kini menginginkan sebuah angka, dan potongan dunia yang benar-benar pernah dilihat oleh model.
Dua pertanyaan yang bersembunyi dalam satu kata
Representativitas dipakai untuk dua klaim yang berbeda, dan mencampuradukkan keduanya adalah awal dari masalah. Klaim pertama tentang sampel dan populasi: bahwa sampel mencerminkan wilayah yang ingin Anda deskripsikan, sehingga rata-rata yang dihitung darinya merupakan taksiran yang wajar bagi rata-rata sebenarnya. Ini adalah ranah rancangan pengambilan sampel, makna yang kami telusuri dalam Seberapa Besar Kampanye Pengambilan Sampel Karbon Tanah Anda Seharusnya? dan Sinyal versus Derau.
Klaim kedua tentang titik baru dan model. Sebagian besar pemantauan saat ini tidak berhenti pada rata-rata sampel. Pemantauan itu mencocokkan sebuah model, sebuah persamaan alometrik, sebuah peta karbon tanah, sebuah kalibrasi spektral, sebuah model proses seperti RothC, atau sebuah faktor emisi bawaan, lalu menerapkannya ke lokasi-lokasi tempat tidak ada yang diukur. Sebuah prediksi di lokasi baru hanya sepercaya pengalaman model terhadap kondisi seperti lokasi tersebut. Di luar rentang kondisi dalam data pelatihan, model sedang mengekstrapolasi, dan galatnya tidak terbatasi maupun dapat diketahui dari statistik kecocokan.
Keduanya berpadanan dengan dua moda inferensi klasik. Inferensi berbasis rancangan memperoleh keabsahannya dari cara sampel dipilih, dan menjawab pertanyaan sampel-ke-populasi. Inferensi berbasis model memperoleh keabsahannya dari benarnya model di tempat ia diterapkan, dan menjawab pertanyaan titik-baru-ke-model 78. Sebuah sampel dapat menjadi sampel probabilitas yang sesuai buku teks bagi populasinya sendiri dan tetap menempatkan sebuah prediksi jauh di luar pengalaman sebuah model pinjaman. Kedua pertanyaan itu saling bebas, dan yang kedua adalah yang membuat ruangan terdiam.
Domain keberlakuan, didefinisikan
Konsep yang mengatur pertanyaan kedua sudah punya nama, dipinjam dari sebuah bidang yang belajar pelajarannya lebih awal. Dalam kimia, model struktur-aktivitas kuantitatif memprediksi sifat-sifat sebuah molekul dari strukturnya, dan para regulator memperhatikan bahwa model-model ini menghasilkan prediksi yang meyakinkan namun keliru bagi molekul yang tidak menyerupai apa pun dalam himpunan pelatihan. Tanggapannya adalah mendefinisikan sebuah domain keberlakuan: kawasan ruang masukan tempat sebuah model menghasilkan prediksi yang andal, disertai aturan eksplisit untuk memutuskan apakah sebuah kasus baru berada di dalamnya 12.
Pemantauan lingkungan menggunakan gagasan yang sama, biasanya tanpa namanya. Setiap persamaan alometrik dicocokkan pada suatu rentang diameter pohon 11, dan menerapkannya di luar rentang itu adalah ekstrapolasi, itulah sebabnya aturan praktisnya adalah memplot distribusi diameter inventarisasi Anda terhadap rentang tercocok persamaan tersebut, seperti yang kami uraikan dalam Bagaimana Menghitung Jumlah Karbon dalam Sebuah Pohon? Sebuah rentang diameter adalah domain keberlakuan dalam satu dimensi. Sebuah model tanah modern bergantung pada banyak kovariat sekaligus, faktor-faktor SCORPAN yang diformalkan oleh pemetaan tanah digital 9, dan data pelatihan menempati sebuah awan dalam ruang berdimensi tinggi itu. Domain keberlakuan adalah kawasan ruang tersebut yang benar-benar dicakup oleh awan itu, dan seluruh pertanyaan menjadi geometris: apakah titik baru berada di dalam awan, atau jauh di sebuah sudut yang tak pernah dikunjungi model?
Apakah himpunan kalibrasi Anda mencakup kawasan baru itu?
Segala yang dibahas sejauh ini memperlakukan satu titik dalam satu waktu, dan itulah pertanyaan yang tepat ketika Anda hendak melaporkan sebuah angka untuk satu kebun. Itu menjadi pertanyaan yang keliru ketika sebuah program bertanya apakah model yang dibangun di satu wilayah asal dapat digunakan ulang di seluruh wilayah asal kedua. Itu adalah pertanyaan tentang dua distribusi, dan ada pengujian langsung untuknya yang cukup memakan waktu satu sore.
Berilah label 0 pada setiap sampel kalibrasi dan label 1 pada setiap lokasi di wilayah sasaran. Buang nilai karbon tanahnya dan simpan hanya kovariatnya. Kini latihlah sebuah pengklasifikasi untuk membedakan kedua label itu, lalu validasi silang. Jika pengklasifikasi tidak dapat bekerja lebih baik daripada tebakan acak, kedua himpunan itu secara statistik tak terbedakan pada variabel-variabel yang dipakai model, dan data kalibrasi Anda merupakan sampel yang masuk akal bagi kondisi sasaran. Jika ia memisahkan keduanya dengan mudah, Anda menghadapi pergeseran kovariat, dan kini Anda punya angka untuknya, bukan sekadar perdebatan tentangnya. Inilah uji dua sampel berbasis pengklasifikasi, dan teori yang membenarkan pembacaan jarak antardomain dari akurasi sebuah pengklasifikasi sudah ada jauh sebelum penggunaannya di sini 2223.
Pengklasifikasi memberi Anda tiga hal yang tak dapat diberikan oleh R² utama. Akurasinya, dibaca sebagai luas di bawah kurva ROC, adalah angka ringkasannya. Kepentingan variabelnya menunjukkan kovariat mana yang mendorong ketidakcocokan itu, dan itulah yang benar-benar dapat Anda tindak lanjuti. Lalu peluang tercocoknya memberikan rasio kerapatan antara kedua populasi, besaran yang memformalkan pergeseran kovariat 24 dan yang muncul lagi ketika kita sampai pada ketidakpastian.
ESS = (Σ wi)² / Σ wi²
Baris kedua itulah yang layak disodorkan kepada klien. Membobot ulang sebuah himpunan kalibrasi ke arah populasi sasaran yang baru adalah praktik baku 25, tetapi pembobotan memusatkan pekerjaan pada segelintir sampel yang kian menyusut, dan ukuran sampel efektif Kish mengukur berapa sedikit yang tersisa 26. Sebuah himpunan kalibrasi berisi 200 sampel yang setelah dibobot ulang tinggal setara 14 sampel efektif bagi kawasan baru sudah menjawab pertanyaan itu. Angka tersebut lebih sulit dibantah daripada statistik kecocokan mana pun, karena ia adalah cacahan data yang benar-benar mengerjakan pekerjaannya.
Geserlah penggeser di bawah ini dan amati ketiga angka bergerak bersamaan. Ada dua perilaku yang layak dipancing dengan sengaja. Dorong wilayah sasaran menjauh dari himpunan kalibrasi: pengklasifikasi akan memisahkan keduanya, ukuran sampel efektif runtuh, dan porsi sasaran yang berada di dalam domain menurun; saat luas di bawah kurva mencapai 0.94, tujuh puluh sampel kalibrasi hanya setara lima belas sampel efektif. Lalu kembalikan pergeseran ke nol dan sebagai gantinya lebarkan sebaran sasaran. Pengklasifikasi turun lagi ke 0.50, seolah-olah menyatakan kedua himpunan itu identik, padahal jauh kurang dari separuh sasaran yang masih berada di dalam domain.
Kasus kedua itu adalah keterbatasan jujur dari metode ini, dan ia penting. Pengklasifikasi linear memisahkan berdasarkan rata-rata, sehingga ia buta terhadap sasaran yang berbagi pusat yang sama dengan himpunan kalibrasi namun sekadar membentang lebih luas, dan itu persis yang terjadi pada sebuah wilayah pasokan ketika meluas ke medan yang lebih beragam. Gunakan pembelajar yang lentur alih-alih regresi logistik, dan jangan pernah membaca pengklasifikasi itu sendirian: laporkan ia berdampingan dengan porsi sasaran yang jatuh di dalam domain. Angka yang satu mendeteksi pergeseran letak, angka yang lain mendeteksi pergeseran sebaran, dan sebuah program dapat mengalami salah satu di antaranya.
Bagi sebuah rencana pemantauan, porsi itulah kalimat yang layak dituliskan: bukan “model ini berlaku”, melainkan “62% dari wilayah pasokan baru berada di dalam domain kalibrasi, sisanya terkonsentrasi di bagian utara yang curah hujannya tinggi, dan inilah yang kami lakukan terhadapnya”.
Cara mengetahui apakah sebuah titik baru berada di dalam domain
Keanggotaan domain dapat diukur, dan metode-metodenya membentuk sebuah tangga, bukan sebuah daftar pilihan. Setiap anak tangga memperbaiki satu kebutaan tertentu pada anak tangga di bawahnya, sehingga pertanyaan yang berguna bukanlah metode mana yang terbaik, melainkan kebutaan mana yang sanggup Anda tanggung.
Satu variabel dalam satu waktu. Untuk setiap kovariat, apakah lokasi baru jatuh di antara nilai minimum dan maksimum data pelatihan? Ini menangkap ekstrapolasi paling kasar dalam lima menit. Versi terpublikasi dari pemeriksaan ini, yaitu permukaan kemiripan lingkungan multivariat, memberi skor 0 hingga 100 kepada sebuah lokasi menurut seberapa dalam variabel paling ekstremnya berada di dalam distribusi acuan, dan menjadi negatif begitu ada variabel yang keluar dari rentang acuan, dengan besarannya menyatakan simpangan itu sebagai persentase rentang variabel tersebut 17. Skor 100 berarti titik itu berada tepat pada median data acuan untuk setiap variabel.
Kelemahannya bersifat struktural: ia mengambil nilai minimum lintas variabel, sehingga sifat multivariatnya nyaris tak ada. Sebuah titik bisa berada nyaman di dalam rentang setiap variabel dan tetap merupakan kombinasi mustahil yang tak pernah dilihat model, misalnya curah hujan sebuah lokasi basah dengan kandungan liat sebuah lokasi kering. Sebanyak apa pun pemeriksaan per variabel tidak akan menemukannya.
Kombinasi yang baru. Metode deteksi ekstrapolasi memilah kebaruan menjadi dua jenis secara eksplisit 16. Indeks pertamanya menjumlahkan simpangan setiap variabel di luar rentang acuan, dinyatakan sebagai pecahan dari rentang tersebut, dan bernilai nol setiap kali semua variabel berada di dalam rentang. Indeks keduanya membagi jarak Mahalanobis sebuah titik dari sentroid acuan dengan jarak serupa terbesar di antara data acuan itu sendiri. Nilai di atas 1 berarti titik itu lebih jauh dari pusat awan pelatihan daripada titik pelatihan mana pun yang pernah ada: sebuah kombinasi baru, yang tak terlihat oleh pemeriksaan rentang mana pun.
NT2 = D²(x, μref) / maxi∈ref D²(xi, μref)
Jarak ke awan pelatihan. Di bawah keduanya terletak jarak Mahalanobis, yang mengukur jarak dalam satuan sebaran dan korelasi data pelatihan itu sendiri, sehingga satu langkah pada arah yang nyaris tak dijelajahi data pelatihan berbobot lebih besar daripada satu langkah pada arah yang mereka cakup dengan baik. Distribusi acuannya adalah khi-kuadrat dengan derajat bebas sebanyak jumlah kovariat, yang memberikan sebuah ambang alih-alih sekadar firasat: tandai apa pun yang melampaui persentil ke-95. Untuk model linear, gagasan yang sama muncul sebagai leverage, yakni diagonal matriks hat, dengan garis peringatan lama pada tiga kali leverage rata-rata, dan plot leverage terhadap residual terbakukan adalah diagnostik yang benar-benar dipakai para regulator di bidang yang menamai domain keberlakuan 1210.
h(x) = xᵀ (XᵀX)−1 x tandai jika h > 3p / n
Dua catatan menentukan apakah ini bekerja dalam praktik. Matriks kovariansi harus ditaksir secara tegar, karena segelintir titik pelatihan yang tak lazim akan menggelembungkannya, dan matriks yang menggelembung itu lalu menyatakan segala sesuatu berada di dalam domain. Selain itu, matriks tersebut sulit diinvers ketika kovariat bersifat kolinear atau berjumlah banyak, dan kovariat tanah hampir selalu demikian, jadi bekerjalah dalam ruang komponen utama yang dipertahankan atau gunakan penaksir penyusutan. Ketika variabelnya bercampur kontinu dan kategorik, jarak Gower dan jarak tetangga terdekat sederhana adalah cadangan nonparametrik yang tegar.
Wilayah keberlakuan, untuk peta. Ketika model menghasilkan peta yang menyeluruh, pertanyaannya bersifat spasial: piksel mana saja yang boleh diterapi model? Metode wilayah keberlakuan menjawab tepat hal ini 3. Metode ini membakukan kovariat, membobot masing-masing menurut kepentingannya dalam model tercocok, mengukur jarak dari setiap piksel ke titik pelatihan terdekatnya dalam ruang terbobot itu, lalu membaginya dengan rata-rata seluruh jarak antarpasangan di antara data pelatihan. Piksel di luar ambang yang diturunkan dari ketidakserupaan data pelatihan itu sendiri berada di luar wilayah keberlakuan, dan galat model yang dilaporkan tidak berlaku di sana. Sebuah peta regional dapat tampak lengkap dan otoritatif padahal sebagian besarnya, menurut ukuran ini, berada di luar domain 4.
ambang = DI bukan-pencilan terbesar di antara data pelatihan tervalidasi silang
Ambang itu layak dinyatakan dengan tepat, karena ia luas disalahkutip. Ia adalah nilai maksimum indeks ketidakserupaan titik-titik pelatihan itu sendiri setelah pencilan dibuang. Ungkapan sungut-atas yang lazim, yakni persentil ke-75 ditambah 1.5 kali rentang antarkuartil, adalah aturan untuk memutuskan nilai mana yang dihitung sebagai pencilan, bukan ambangnya itu sendiri. Pracetak yang beredar bebas menyebutkan aturan yang berbeda lagi, yaitu kuantil .95, yang diubah selama telaah sejawat; versi terbitanlah yang harus diterapkan.
Seberapa besar dukungannya, bukan sekadar seberapa dekat. Indeks ketidakserupaan hanya menengok satu titik pelatihan terdekat, sehingga ia tak dapat membedakan lokasi yang ditopang satu sampel kesepian dari lokasi yang didukung dua ratus sampel. Menghitung berapa banyak titik pelatihan yang jatuh dalam jarak ambang dari sebuah lokasi menutup celah itu, dan cacahan tersebut berkorelasi dengan seberapa baik model sebenarnya berkinerja di sana 15. Ini adalah ukuran pascafakta yang tidak menambah biaya sedikit pun begitu jarak-jaraknya dihitung, dan ia adalah beda antara “di dalam domain” dan “di dalam domain, dan terdukung dengan baik”.
Kalibrasi spektral memiliki versinya sendiri. Jika karbon tanah diprediksi dari spektra inframerah tengah alih-alih dari kovariat, analisis komponen utama atas himpunan kalibrasi mendefinisikan ruang yang dikenalnya, dan dua statistik dibutuhkan sebagai pasangan, bukan sendiri-sendiri. Hotelling’s T² mengukur seberapa jauh sebuah spektrum baru berada dari pusat di dalam ruang itu; Q-residual mengukur seberapa jauh ia berada di luar ruang tersebut, pada arah-arah yang tak pernah dimodelkan kalibrasi. Sebuah sampel dapat lolos salah satunya saja dan tetap merupakan sampel yang tak pernah dilatih untuk dibaca oleh kalibrasi.
| Pemeriksaan | Menangkap | Melewatkan |
|---|---|---|
| Rentang per variabel // MESS | Variabel mana pun di luar rentang terkalibrasinya | Kombinasi baru dari variabel yang masih dalam rentang |
| ExDet NT1 + NT2 | Kebaruan rentang dan kombinasi baru, secara terpisah | Arah mana dalam ruang kovariat yang tak terdukung |
| Mahalanobis // leverage | Jarak dari awan, dalam satuan sebarannya sendiri | Rongga lokal di dalam selubung keseluruhan |
| Wilayah keberlakuan | Jarak per piksel, dibobot menurut kepentingan kovariat | Berapa banyak titik pelatihan yang memberi dukungan |
| Kerapatan titik data lokal | Dukungan tipis di dalam kawasan yang secara nominal tercakup | Apakah hubungannya sendiri telah berubah |
| Hotelling’s T² + Q | Spektra yang tak menyerupai kalibrasi, di dalam dan di luar ruangnya | Tidak ada, jika keduanya dibaca bersama |
Jebakan validasi: mengapa R² yang baik dapat menyesatkan
Ada satu cara khusus di mana hal ini keliru dan justru menyanjung praktisi. Ketika sebuah model divalidasi dengan validasi silang acak biasa, titik-titik yang disisihkan tersebar di antara titik-titik pelatihan. Jika data terautokorelasi secara spasial, dan data tanah serta vegetasi hampir selalu demikian, maka setiap titik yang disisihkan memiliki tetangga dekat di dalam himpunan pelatihan. Model diuji hampir sepenuhnya di dalam domainnya, pada titik-titik yang mudah. Validasi berstruktur spasial, yang menyisihkan seluruh blok ruang, berulang kali mengungkap bahwa model dengan skor validasi silang acak yang sangat baik justru berkinerja buruk saat harus menjangkau jauh 56. Sebuah peta regional dapat tak bias secara rata-rata di seluruh cakupannya namun tetap keliru di setiap proyek individual di dalamnya.
Tanggapan yang jujur bukan sekadar mengganti validasi silang acak dengan yang spasial lalu melangkah maju, karena rancangan validasi yang tepat itu sendiri masih diperdebatkan: pemblokan spasial bisa pesimistis jika ia menyisihkan kawasan yang tak akan pernah diminta diprediksi model, dan pilihan yang paling dapat dipertahankan, bila anggaran memungkinkan, adalah sampel validasi terpisah yang diambil melalui pengambilan sampel probabilitas dari wilayah sasaran, yang menaksir akurasi peta tanpa bersandar sama sekali pada model 78. Butir yang bertahan dari perdebatan itu lebih sederhana: sebuah angka akurasi baru bermakna bila disertai pernyataan tentang di mana, dalam ruang kovariat dan ruang geografis, ia diukur, dan apakah tempat yang kini Anda inginkan prediksinya menyerupai tempat itu.
Kini ada jawaban yang lebih tajam daripada sekadar memihak salah satu. Alih-alih memblok ruang secara sembarang, cocokkan validasi dengan prediksinya: sisihkan titik-titik sedemikian rupa sehingga distribusi jarak dari titik uji ke data pelatihan menyerupai distribusi jarak dari tempat-tempat yang benar-benar akan Anda prediksi ke data pelatihan 13. Validasi silang itu lalu mengukur jangkauan yang sungguh-sungguh akan diminta dari model, tanpa disanjung oleh tetangga dekat maupun dihukum karena kawasan yang tak akan ditanyakan siapa pun. Rumusan aslinya menyisihkan satu titik dalam satu waktu dan tidak terskalakan; versi k-lipatnya menurunkan pemrosesan data terklaster berisi empat ribu titik dari hitungan hari menjadi sekitar satu menit 14, dan itu penting, karena alasan lazim tim kembali memakai validasi silang acak adalah bahwa alternatif yang jujur berada di luar jangkauan komputasi. Sampel terklaster menuntut kehati-hatiannya sendiri 39.
Apa yang seharusnya dimaksud dengan “gelembungkan ketidakpastian”
Nasihat untuk melebarkan batang galat bagi titik-titik ambang batas mudah diberikan dan sulit dijalankan. Dilebarkan seberapa banyak? Ada jawaban yang ketat untuk itu, dan keterbatasannya sama mendidiknya dengan jaminannya.
Prediksi konformal terpisah membangun sebuah selang dari residual yang disisihkan alih-alih dari asumsi apa pun tentang bentuk galatnya 18. Cocokkan model pada sebagian data, hitung residual mutlak pada himpunan kalibrasi yang disisihkan, lalu ambil statistik terurut tertentu dari residual-residual itu sebagai setengah lebar selang. Selang yang dihasilkan meliputi nilai sebenarnya sekurang-kurangnya 1 − α dari waktu, pada sampel berhingga, tanpa asumsi distribusional apa pun.
n ≥ ⌈1/α⌉ − 1 jadi selang 95% butuh sekurang-kurangnya 19 titik kalibrasi
Baris kedua bukan sekadar seluk-beluk teknis. Di bawah jumlah titik kalibrasi tersebut, metode ini mengembalikan selang yang lebarnya tak terhingga, dan itulah caranya secara jujur mengatakan bahwa data tidak dapat menopang klaim yang diminta darinya. Sebuah metode yang menolak menjawab ketika ia tak mampu lebih berharga bagi program pemantauan daripada metode yang selalu menghasilkan angka.
Setengah lebar yang tetap di seluruh proyek jarang menjadi yang Anda inginkan, dan perbaikannya sudah baku: nilai konformitas terhadap kuantil tercocok alih-alih terhadap rata-rata tercocok, dan selang itu akan menyesuaikan diri dengan seberapa tidak pasti model di setiap lokasi sambil mempertahankan jaminan cakupannya 20. Lokasi dengan kondisi yang tersampel baik memperoleh selang yang sempit, lokasi yang canggung memperoleh selang yang lebar, dan tak seorang pun perlu memilih faktor penggelembungan dengan tangan.
Inilah jebakannya, dan ia adalah keseluruhan pokok bahasan tulisan ini. Jaminan itu hanya berlaku jika titik-titik kalibrasi dan titik baru bersifat dapat dipertukarkan, dan justru itulah yang dipatahkan oleh perpindahan ke kawasan baru. Prediksi konformal bukanlah jalan keluar dari masalah domain. Diterapkan secara naif melintasi batas domain, ia menghasilkan selang yang tampak ketat padahal tidak.
Yang menyelamatkannya adalah besaran yang sudah kita bangun tadi. Jika Anda mengetahui rasio kerapatan antara populasi sasaran dan populasi kalibrasi, Anda dapat membobot setiap residual kalibrasi dengannya dan memulihkan jaminan itu di bawah pergeseran kovariat 19. Mekanismenya elegan: titik baru menyumbangkan bobotnya sendiri ke kuantil, sehingga saat ia bergerak ke wilayah yang nyaris tak tercakup data kalibrasi, semakin banyak massa peluang yang bertengger di tak hingga dan selang itu melebar dengan sendirinya, menjadi tak terbatas begitu bobot tersebut melampaui α. Pengklasifikasi dari bagian tentang cakupan itulah yang memasok rasionya, dan itulah sebabnya kedua bagian tersebut saling melengkapi. Satu catatan jujur: jaminan itu hanya eksak ketika rasionya diketahui, sedangkan dalam praktik ia ditaksir, jadi perlakukan cakupannya sebagai hampiran yang memburuk seiring turunnya mutu taksiran tersebut.
Ada batas yang lebih keras yang perlu diketahui sebelum ada orang yang menjanjikannya. Cakupan yang bersyarat pada nilai kovariat persis sebuah lokasi tidak dapat dicapai secara nontrivial untuk kovariat kontinu: prosedur apa pun yang mengklaimnya pasti mengembalikan selang yang lebarnya tak terhingga 21. Kompromi yang dapat dikerjakan adalah menjamin cakupan di dalam strata yang Anda nyatakan di muka, menurut kawasan, tekstur tanah, atau tata guna lahan, masing-masing dengan himpunan kalibrasinya sendiri. Inilah bentuk yang tepat bagi MRV, dan ia membawa konsekuensi operasional: kawasan yang tersampel tipis memperoleh jaminan yang kasar atau tidak sama sekali, dan itu adalah informasi, bukan cacat.
Sebuah aturan keputusan yang dapat Anda pertahankan
Bila dirangkai, pengujian domain adalah alur kerja yang ringkas dan dapat diulang, yang muat dalam satu halaman rencana pemantauan. Definisikan domain kalibrasi (distribusi multivariat kovariat dalam data pelatihan). Letakkan setiap titik baru relatif terhadapnya: pemeriksaan rentang per variabel dahulu, lalu sebuah metrik jarak. Golongkan sebagai di dalam domain, ambang batas, atau di luar domain terhadap ambang-ambang yang ditetapkan di muka. Kemudian bertindaklah sesuai golongannya: titik di dalam domain mendapatkan prediksi apa adanya; titik ambang batas mendapatkannya dengan ketidakpastian yang secara eksplisit digelembungkan dan sebuah penanda; titik di luar domain tidak mendapatkan angka pinjaman sama sekali, melainkan memicu pengambilan sampel acuan lokal dan penaksiran ulang.
Nilai dari menuliskan ini adalah bahwa ia mengubah sebuah argumen (“kami rasa kawasan baru cukup serupa”) menjadi bukti (“inilah tempat setiap titik baru jatuh, dan inilah aturan yang kami terapkan”). Itulah perbedaan antara klaim yang diterima verifikator dan klaim yang dicecar verifikator.
Sebuah contoh terkerjakan: satu model, dua wilayah
Sebuah model karbon tanah dikalibrasi pada kebun bermatahari penuh dan bernaungan ringan di satu wilayah pengadaan. Pengadaan meluas ke wilayah kedua berupa agroforestri bernaungan yang sudah mapan. Lima dari kovariat model, diperiksa terhadap lokasi representatif wilayah baru:
| Kovariat | Rentang kalibrasi (A) | Lokasi baru (B) | Dalam rentang? |
|---|---|---|---|
| Liat (%) | 12–34 | 41 | Tidak (di atas) |
| Curah hujan tahunan rata-rata (mm) | 900–1500 | 1850 | Tidak (di atas) |
| Suhu tahunan rata-rata (°C) | 23–27 | 25 | Ya |
| Elevasi (m) | 40–320 | 180 | Ya |
| Tutupan kanopi naungan (%) | 0–15 | 55 | Tidak (di atas) |
Tiga dari lima kovariat jatuh di luar rentang terkalibrasi, dan dua yang paling penting bagi karbon, yakni curah hujan dan naungan, termasuk di antaranya. Sebuah jarak Mahalanobis atau indeks wilayah keberlakuan akan menempatkan lokasi ini jauh di luar awan pelatihan. Vonisnya tegas: model berada di luar domain di sini, dan menerapkannya berarti melaporkan sebuah angka tanpa dukungan. Ini adalah temuan yang sama, dalam bentuk mini, yang dicapai oleh evaluasi independen pada skala benua, tempat hubungan karbon tanah yang dikalibrasi pada sistem tanaman baris beriklim sedang tidak beralih ke sistem menahun bernaungan tanpa penaksiran ulang lokal. Kami membahas pemilihan model dan rekalibrasi lokal dalam Bagaimana Anda Memodelkan Perubahan Karbon Tanah dari Waktu ke Waktu?
Ketika jawabannya “di luar”: memperluas domain dengan murah
“Picu pengambilan sampel lokal” adalah tempat sebagian besar pembahasan pokok ini berhenti, dan justru di titik itulah seorang manajer program paling membutuhkan bantuan. Kabar bergunanya, memperluas sebuah domain jauh lebih murah daripada membangunnya, dan angka-angkanya mengejutkan kecilnya.
Pilih titik-titik baru untuk mencakup ruangnya, bukan untuk meniru populasinya. Pengambilan sampel hiperkubus Latin terkondisi, pilihan bawaan dalam pemetaan tanah digital, memilih lokasi sedemikian rupa sehingga sampel mereproduksi distribusi marginal kovariat beserta korelasinya 29. Sebaliknya, pengambilan sampel cakupan mengelompokkan wilayah sasaran dalam ruang kovariat lalu mengambil sampel di dekat setiap pusat klaster, membentangi ruang gabungannya alih-alih mencocokkan marginalnya 30. Untuk mengalibrasi sebuah model, membentangi ruang biasanya yang Anda butuhkan, dan salah satu perbandingan menganjurkan penyebaran sampel ke seluruh ruang fitur kovariat yang paling penting 31.
Tolaklah siapa pun yang menjual pemenang mutlak di antara keduanya. Buktinya benar-benar campur aduk: pengambilan sampel cakupan menang secara rata-rata dalam sebagian perbandingan, hiperkubus Latin menang pada ukuran sampel kecil dalam perbandingan lain, dan ukuran sampel lebih menentukan daripada pilihan metodenya pada sebagian besar di antaranya. Perbandingan yang berdasar pada satu realisasi tunggal tiap rancangan nyaris tak informatif, karena distribusi hasilnya bertumpang tindih berat.
Sering kali Anda sama sekali tidak perlu membangun ulang modelnya. Spektroskopi tanah belajar hal ini lebih dahulu: sebuah pustaka besar yang gagal secara lokal dapat diperbaiki dengan menambahkan segelintir sampel lokal ke dalamnya, praktik yang disebut spiking. Angka-angka di seluruh literatur konsisten dan kecil: sekitar lima belas sampel lokal memangkas bias prediksi secara tajam 32, dua belas sampel mengangkat kinerja model regional dari R² 0.07 hingga 0.36 menjadi 0.69 hingga 0.86 33, dan dua belas sampai dua puluh sampel lokal yang digabungkan dengan pustaka besar menyamai kalibrasi spesifik lokasi yang dibangun dari hingga tiga ratus sampel 34. Sepuluh sampai tiga puluh sampel yang dipilih dengan baik adalah rentang kerjanya.
Penghematan yang sama muncul dalam alometri. Dengan memakai persamaan terpublikasi sebagai prior alih-alih memulai dari nol, enam pohon dapat menaksir parameter sebaik empat puluh sampai enam puluh pohon dalam pendekatan klasik 35. Inilah kerja penggabungan sebagian: model pinjaman memasok bentuknya, data lokal menariknya ke arah kebenaran lokal, dan komponen ragam antarlokasi itu sendiri merupakan ukuran seberapa teralihkan hubungan tersebut sejak awal.
Jika Anda hanya sanggup menguji, ujilah biasnya. Sampel lokal yang kecil dan tak dapat menopang pencocokan ulang tetap bisa menjawab apakah model pinjaman itu keliru secara sistematis di sini. Itu adalah perbandingan dua sampel, dan ia memakai rumus daya yang sama dengan rancangan deteksi perubahan mana pun, yang kami telusuri dalam Seberapa Besar Kampanye Pengambilan Sampel Karbon Tanah Anda Seharusnya? Mensubstitusikan bias yang Anda pedulikan sebagai selisih minimum yang terdeteksi memberikan jumlah sampel lokal yang dibutuhkan untuk menangkapnya.
Satu temuan yang berlawanan dengan intuisi layak mendapat tempat dalam setiap keputusan pengalihan. Ketika fungsi pedotransfer dipindahkan ke kawasan baru, fungsi yang dibangun hanya dari pasir dan liat mengungguli versi yang memakai sebelas kovariat 38. Lebih banyak prediktor berarti ruang berdimensi lebih tinggi, awan pelatihan yang lebih renggang, dan lebih banyak cara bagi sebuah lokasi baru untuk jatuh di luarnya. Kehematan bukan sekadar preferensi estetis; ia adalah strategi domain. Ongkos keliru dalam hal ini terdokumentasi dengan baik: persamaan pantropis melebihtaksirkan biomassa sekitar 40% di satu lokasi Afrika tengah 36, dan persamaan yang dibangun dari sampel kecil membawa bias rata-rata pada tingkat lokasi mendekati +70%, berkisar dari −4% hingga +193% 37.
Pengambilan sampel ulang, dan domain yang bergerak
Ada cara kedua, yang lebih senyap, di mana representativitas gagal, dan ia muncul justru ketika sebuah program melakukan segala hal lainnya dengan benar. Pemantauan dibangun di atas pengambilan sampel ulang: kunjungi kembali jaringan yang sama dari waktu ke waktu, bandingkan, dan laporkan perubahannya. Asumsi yang tak terucapkan adalah bahwa jaringan tetap representatif terhadap sistem yang dipantaunya. Sistem bergerak. Pengelolaan berubah, sebuah program naungan menjadi matang, kekeringan membentuk ulang rezim kelembapan tanah, tata guna lahan bergeser di tepi-tepi wilayah pasokan. Sebuah model yang dikalibrasi sekali terhadap sistem asli dapat tergelincir keluar dari domain relatif terhadap sistem yang kini ada, tanpa ada yang menjalankan ulang pemeriksaan. Para statistikawan menyebutnya pergeseran kovariat atau penyimpangan konsep; di lapangan ia tampak seperti garis dasar yang diam-diam berhenti menggambarkan masa kini.
Penyimpangan itu dapat diuji dengan instrumen yang sudah diperkenalkan tadi. Jalankan pengklasifikasi domain antarsiklus pemantauan alih-alih antarkawasan: beri label 0 pada kovariat siklus pertama dan label 1 pada kovariat siklus kedua, lalu lihat apakah sebuah pengklasifikasi dapat membedakan kedua tahun itu. Jika bisa, sistem telah bergerak relatif terhadap model, dan kepentingan variabelnya menyebutkan apa yang bergerak. Ini tidak menuntut biaya apa pun di luar kovariat yang sudah Anda miliki, dan ia mengubah sebuah peringatan menjadi pemeriksaan terjadwal.
Mengapa verifikator mulai menanyakannya
Klaim bahwa pemantauan lingkungan memakai gagasan ini tanpa menamainya perlu satu koreksi, dan koreksi itu berguna. VM0042 milik Verra menamainya. Bagian definisinya mendefinisikan domain proyek sebagai himpunan kondisi, mencakup jenis tanaman, tekstur tanah, dan iklim, tempat penerapan model telah divalidasi 40. Di sini domain keberlakuan bukanlah abstraksi pinjaman dari kimia; ia adalah istilah terdefinisi dalam metodologi yang menjadi acuan penulisan sebagian besar proyek karbon tanah.
Modul pendampingnya mengubah definisi itu menjadi pengujian yang dapat diaudit. Setiap zona iklim atau kawasan pertanian yang ditetapkan secara nasional yang dinyatakan proyek harus muncul dalam kumpulan data validasi; ketiga kelas tekstur tanah yang diperkirakan mendominasi area proyek harus disertakan; dan datanya harus membentang 15 poin persentase kandungan liat. Modul itu menyatakan tujuannya dengan gamblang, yaitu memastikan model tidak dikalibrasi secara berlebihan pada satu kombinasi kondisi lalu diterapkan di tempat lain. Dua batasan layak dinyatakan dengan akurat: kewajiban itu melekat pada kuantifikasi ukur-dan-model, bukan pada pengkreditan berbasis pengukuran saja, dan ia tidak menetapkan jumlah lokasi minimum. Disiplinnya adalah cakupan, bukan ukuran sampel.
Sisa lanskapnya lebih lunak, dan sebaiknya jangan dilebih-lebihkan. IPCC memperlakukan hal ini sebagai praktik yang baik pada skala nasional, dengan menganjurkan agar model Tier 3 dikalibrasi dan diuji terhadap pengukuran yang mencerminkan keragaman iklim, tanah, dan tata guna lahan tempat model itu akan diterapkan. Regulasi penyerapan karbon Uni Eropa, kendati sering diklaim sebaliknya, sama sekali tidak mewajibkan validasi model: kewajiban representativitasnya melekat pada garis dasar, dan isinya ditangguhkan ke tindakan terdelegasi yang belum terbit. Siapa pun yang mengutipnya untuk keperluan ini belum membacanya.
Ini bukan lagi sekadar kehalusan metodologis. Kerangka akuntansi yang mengatur klaim karbon sedang mengerucut pada tuntutan agar ketidakpastian dikuantifikasi dan diungkapkan, dan sebuah prediksi yang diterapkan di luar domain sebuah model adalah ketidakpastian yang disembunyikan alih-alih dikuantifikasi. Panduan GHG Protocol Land Sector and Removals, yang berlaku mulai 1 Januari 2027, meminta perusahaan mengalibrasi pendekatan berbasis model dan penginderaan jauh dengan data empiris yang spesifik untuk lahan dan pengelolaan yang dianalisis, dan ketika yang diklaim adalah penyerapan, anjuran itu mengeras menjadi kewajiban, dengan pengambilan sampel ulang sekurang-kurangnya setiap lima tahun. IPCC 2019 Refinement mendorong ke arah faktor bertingkat lebih tinggi yang sesuai secara lokal ketimbang nilai bawaan pinjaman, justru karena nilai bawaan berada di luar domain bagi banyak tempat yang menerapkannya 12. Verifikator mulai meminta validasi berstruktur spasial atau validasi independen ketimbang R² utama, dan meminta bukti bahwa sebuah model yang digunakan ulang cocok dengan lokasi tempat ia digunakan ulang. Tim yang akan lolos dari pertanyaan-pertanyaan ini adalah mereka yang menguji keanggotaan domain sebelum ditanya, dan dapat menunjukkan pekerjaannya.
Poin-poin utama
Representativitas mengemban dua pertanyaan terpisah: apakah sampel representatif terhadap populasi (rancangan pengambilan sampel), dan apakah sebuah titik baru berada di dalam domain terkalibrasi model (keberlakuan). Yang kedua adalah yang paling sering dilewati sebagian besar program.
Sebuah sampel dapat representatif sempurna terhadap populasinya sendiri dan tetap berada di luar domain keberlakuan sebuah model pinjaman. Keduanya saling bebas.
Domain keberlakuan adalah kawasan ruang kovariat yang benar-benar dicakup data pelatihan. Rentang diameter sebuah persamaan alometrik adalah gagasan ini dalam satu dimensi; domain sebuah peta karbon tanah adalah gagasan yang sama dalam banyak dimensi.
Untuk satu kawasan utuh alih-alih satu titik, latihlah sebuah pengklasifikasi untuk memisahkan sampel kalibrasi dari lokasi sasaran hanya berdasarkan kovariat. AUC mendekati 0.5 berarti kedua himpunan tak terbedakan; ukuran sampel efektif dari bobot yang dihasilkan menunjukkan berapa banyak sampel kalibrasi yang benar-benar mengerjakan pekerjaannya.
Bacalah pengklasifikasi itu berdampingan dengan porsi sasaran yang berada di dalam domain. Pengklasifikasi linear memisahkan berdasarkan rata-rata, sehingga ia buta terhadap sasaran yang berbagi pusat kalibrasi yang sama namun sekadar membentang lebih luas.
Keanggotaan domain adalah sebuah tangga, setiap anak tangganya memperbaiki satu kebutaan di bawahnya: rentang per variabel dan MESS, lalu pemilahan ExDet menjadi kebaruan rentang dan kombinasi baru, lalu jarak Mahalanobis terhadap ambang khi-kuadrat, lalu wilayah keberlakuan untuk peta, lalu kerapatan titik data lokal untuk mengetahui seberapa besar dukungan yang ada.
Ambang wilayah keberlakuan adalah nilai maksimum indeks ketidakserupaan data pelatihan itu sendiri setelah pencilan dibuang. Ungkapan sungut-atas adalah aturan pencilannya, bukan ambangnya, dan pracetak yang beredar bebas menyebutkan aturan yang berbeda dari makalah terbitannya.
Skor validasi silang acak yang tinggi bisa jadi merupakan artefak autokorelasi spasial. Cocokkan validasi dengan prediksinya melalui pencocokan jarak tetangga terdekat, atau gunakan sampel probabilitas independen, dan selalu laporkan di mana akurasi itu diukur.
“Gelembungkan ketidakpastian” punya bentuk yang ketat: prediksi konformal memberikan selang bebas distribusi, tetapi hanya di bawah keterpertukaran, yang dipatahkan oleh kawasan baru. Pembobotan dengan rasio kerapatan memulihkan jaminan itu, dan batang galat milik model sendiri tak akan menolong: quantile regression forest justru menjadi lebih sempit di tepi rentang pelatihan, bukan lebih lebar.
Memperluas domain itu murah. Sepuluh sampai tiga puluh sampel lokal yang dipilih dengan baik memperbaiki kalibrasi spektral pinjaman; enam pohon dengan prior yang informatif menyamai empat puluh sampai enam puluh pohon tanpa prior. Kovariat yang lebih sedikit sering kali lebih mudah dialihkan, karena semakin renggang awan berdimensi tinggi itu, semakin mudah sebuah lokasi jatuh di luarnya.
VM0042 milik Verra sudah mendefinisikan domain proyek sebagai kondisi tempat penerapan model telah divalidasi, dan modul pendampingnya membuat cakupan zona iklim, tekstur tanah, dan rentang liat 15 poin dapat diaudit. Regulasi penyerapan karbon Uni Eropa, berlawanan dengan klaim yang umum beredar, sama sekali tidak mewajibkan hal semacam itu.
Referensi
- 1.Netzeva, T.I. et al. (2005). Current status of methods for defining the applicability domain of (quantitative) structure-activity relationships. ATLA Alternatives to Laboratory Animals, 33(2), 155–173. doi:10.1177/026119290503300209
- 2.Jaworska, J., Nikolova-Jeliazkova, N., Aldenberg, T. (2005). QSAR applicability domain estimation by projection of the training set in descriptor space, a review. ATLA, 33(5), 445–459. doi:10.1177/026119290503300508
- 3.Meyer, H., Pebesma, E. (2021). Predicting into unknown space? Estimating the area of applicability of spatial prediction models. Methods in Ecology and Evolution, 12(9), 1620–1633. doi:10.1111/2041-210X.13650
- 4.Meyer, H., Pebesma, E. (2022). Machine learning-based global maps of ecological variables and the challenge of assessing them. Nature Communications, 13, 2208. doi:10.1038/s41467-022-29838-9
- 5.Ploton, P. et al. (2020). Spatial validation reveals poor predictive performance of large-scale ecological mapping models. Nature Communications, 11, 4540. doi:10.1038/s41467-020-18321-y
- 6.Roberts, D.R. et al. (2017). Cross-validation strategies for data with temporal, spatial, hierarchical, or phylogenetic structure. Ecography, 40(8), 913–929. doi:10.1111/ecog.02881
- 7.Wadoux, A.M.J-C., Heuvelink, G.B.M., de Bruin, S., Brus, D.J. (2021). Spatial cross-validation is not the right way to evaluate map accuracy. Ecological Modelling, 457, 109692. doi:10.1016/j.ecolmodel.2021.109692
- 8.Brus, D.J., Kempen, B., Heuvelink, G.B.M. (2011). Sampling for validation of digital soil maps. European Journal of Soil Science, 62(3), 394–407. doi:10.1111/j.1365-2389.2011.01364.x
- 9.McBratney, A.B., Mendonça Santos, M.L., Minasny, B. (2003). On digital soil mapping. Geoderma, 117(1–2), 3–52. doi:10.1016/S0016-7061(03)00223-4
- 10.Sheridan, R.P. et al. (2004). Similarity to molecules in the training set is a good discriminator for prediction accuracy in QSAR. Journal of Chemical Information and Computer Sciences, 44(6), 1912–1928. doi:10.1021/ci049782w
- 11.Chave, J. et al. (2014). Improved allometric models to estimate the aboveground biomass of tropical trees. Global Change Biology, 20(10), 3177–3190. doi:10.1111/gcb.12629
- 12.IPCC (2019). 2019 Refinement to the 2006 IPCC Guidelines for National Greenhouse Gas Inventories. Intergovernmental Panel on Climate Change. ipcc.ch
- 13.Milà, C., Mateu, J., Pebesma, E., Meyer, H. (2022). Nearest neighbour distance matching Leave-One-Out Cross-Validation for map validation. Methods in Ecology and Evolution, 13(6), 1304–1316. doi:10.1111/2041-210X.13851
- 14.Linnenbrink, J., Milà, C., Ludwig, M., Meyer, H. (2024). kNNDM CV: k-fold nearest-neighbour distance matching cross-validation for map accuracy estimation. Geoscientific Model Development, 17(15), 5897–5912. doi:10.5194/gmd-17-5897-2024
- 15.Schumacher, F.L., Knoth, C., Ludwig, M., Meyer, H. (2025). Estimation of local training data point densities to support the assessment of spatial prediction uncertainty. Geoscientific Model Development, 18(24), 10185–10202. doi:10.5194/gmd-18-10185-2025
- 16.Mesgaran, M.B., Cousens, R.D., Webber, B.L. (2014). Here be dragons: a tool for quantifying novelty due to covariate range and correlation change when projecting species distribution models. Diversity and Distributions, 20(10), 1147–1159. doi:10.1111/ddi.12209
- 17.Elith, J., Kearney, M., Phillips, S. (2010). The art of modelling range-shifting species. Methods in Ecology and Evolution, 1(4), 330–342. doi:10.1111/j.2041-210X.2010.00036.x
- 18.Lei, J., G'Sell, M., Rinaldo, A., Tibshirani, R.J., Wasserman, L. (2018). Distribution-free predictive inference for regression. Journal of the American Statistical Association, 113(523), 1094–1111. doi:10.1080/01621459.2017.1307116
- 19.Tibshirani, R.J., Foygel Barber, R., Candès, E.J., Ramdas, A. (2019). Conformal prediction under covariate shift. Advances in Neural Information Processing Systems 32. arXiv:1904.06019
- 20.Romano, Y., Patterson, E., Candès, E.J. (2019). Conformalized quantile regression. Advances in Neural Information Processing Systems 32. arXiv:1905.03222
- 21.Vovk, V. (2012). Conditional validity of inductive conformal predictors. Proceedings of the Asian Conference on Machine Learning, PMLR 25, 475–490. proceedings.mlr.press
- 22.Lopez-Paz, D., Oquab, M. (2017). Revisiting classifier two-sample tests. International Conference on Learning Representations. arXiv:1610.06545
- 23.Ben-David, S., Blitzer, J., Crammer, K., Kulesza, A., Pereira, F., Vaughan, J.W. (2010). A theory of learning from different domains. Machine Learning, 79(1–2), 151–175. doi:10.1007/s10994-009-5152-4
- 24.Shimodaira, H. (2000). Improving predictive inference under covariate shift by weighting the log-likelihood function. Journal of Statistical Planning and Inference, 90(2), 227–244. doi:10.1016/S0378-3758(00)00115-4
- 25.Sugiyama, M., Suzuki, T., Nakajima, S., Kashima, H., von Bünau, P., Kawanabe, M. (2008). Direct importance estimation for covariate shift adaptation. Annals of the Institute of Statistical Mathematics, 60(4), 699–746. doi:10.1007/s10463-008-0197-x
- 26.Kish, L. (1965). Survey Sampling. John Wiley & Sons, New York. The effective sample size used here is the algebraic restatement of Kish's unequal-weighting design effect.
- 27.Dega, S., Dietrich, P., Schrön, M., Paasche, H. (2023). Probabilistic prediction by means of the propagation of response variable uncertainty through a Monte Carlo approach in regression random forest. Frontiers in Environmental Science, 11, 1009191. doi:10.3389/fenvs.2023.1009191
- 28.Hateffard, F., Steinbuch, L., Heuvelink, G.B.M. (2024). Evaluating the extrapolation potential of random forest digital soil mapping. Geoderma, 441, 116740. doi:10.1016/j.geoderma.2023.116740
- 29.Minasny, B., McBratney, A.B. (2006). A conditioned Latin hypercube method for sampling in the presence of ancillary information. Computers & Geosciences, 32(9), 1378–1388. doi:10.1016/j.cageo.2005.12.009
- 30.Ma, T., Brus, D.J., Zhu, A.-X., Zhang, L., Scholten, T. (2020). Comparison of conditioned Latin hypercube and feature space coverage sampling for predicting soil classes using simulation from soil maps. Geoderma, 370, 114366. doi:10.1016/j.geoderma.2020.114366
- 31.Wadoux, A.M.J-C., Brus, D.J., Heuvelink, G.B.M. (2019). Sampling design optimization for soil mapping with a random forest. Geoderma, 355, 113913. doi:10.1016/j.geoderma.2019.113913
- 32.Seidel, M. et al. (2019). Strategies for the efficient estimation of soil organic carbon at the field scale with vis-NIR spectroscopy: Spectral libraries and spiking vs. local calibrations. Geoderma, 354, 113856. doi:10.1016/j.geoderma.2019.07.014
- 33.Guy, A.L., Siciliano, S.D., Lamb, E.G. (2015). Spiking regional vis-NIR calibration models with local samples to predict soil organic carbon in two High Arctic polar deserts using a vis-NIR probe. Canadian Journal of Soil Science, 95(3), 237–249. doi:10.4141/cjss-2015-004
- 34.Lobsey, C.R., Viscarra Rossel, R.A., Roudier, P., Hedley, C.B. (2017). rs-local data-mines information from spectral libraries to improve local calibrations. European Journal of Soil Science, 68(6), 840–852. doi:10.1111/ejss.12490
- 35.Zapata-Cuartas, M., Sierra, C.A., Alleman, L. (2012). Probability distribution of allometric coefficients and Bayesian estimation of aboveground tree biomass. Forest Ecology and Management, 277, 173–179. doi:10.1016/j.foreco.2012.04.030
- 36.Ngomanda, A. et al. (2014). Site-specific versus pantropical allometric equations: Which option to estimate the biomass of a moist central African forest?. Forest Ecology and Management, 312, 1–9. doi:10.1016/j.foreco.2013.10.029
- 37.Duncanson, L., Rourke, O., Dubayah, R. (2015). Small sample sizes yield biased allometric equations in temperate forests. Scientific Reports, 5, 17153. doi:10.1038/srep17153
- 38.Schoch, J., Nussbaum, M., Walthert, L., Carminati, A., Lehmann, P. (2025). Transferability of pedotransfer functions for estimating soil hydraulic properties: An analysis of controlling factors for forest soils in Switzerland. Geoderma, 460, 117397. doi:10.1016/j.geoderma.2025.117397
- 39.de Bruin, S., Brus, D.J., Heuvelink, G.B.M., van Ebbenhorst Tengbergen, T., Wadoux, A.M.J.-C. (2022). Dealing with clustered samples for assessing map accuracy by cross-validation. Ecological Informatics, 69, 101665. doi:10.1016/j.ecoinf.2022.101665
- 40.Verra (2025). VM0042 Methodology for Improved Agricultural Land Management, v2.2, and VMD0053 Model Calibration, Validation and Uncertainty Guidance for Biogeochemical Modeling, v2.1. Verified Carbon Standard. verra.org
- 41.Meinshausen, N. (2006). Quantile regression forests. Journal of Machine Learning Research, 7(35), 983–999. jmlr.org