4 SEPTEMBER 2026

Bagaimana Cara Mengkalibrasi dan Memvalidasi Model? Panduan Lapangan, dari Karbon Tanah sampai Biomassa Pohon

Ikhtisar

Kata kalibrasi mengandung empat makna yang berbeda, dan sebagian besar perdebatan tentang model yang sudah divalidasi sebenarnya adalah dua orang yang memakai makna berlainan. Tulisan ini memisahkan makna-makna itu, lalu menelusuri alur kerja yang sama-sama mereka butuhkan: mengapa kecocokan yang baik hampir tidak membuktikan apa pun, apa yang sebenarnya diperkirakan oleh tiap tingkat pembagian data, bagaimana skema validasi silang yang Anda pilih memuat klaim tentang tugas prediksi, metrik mana yang tak berarti bila berdiri sendiri, dan apa yang diperlukan agar ketidakpastian yang dinyatakan itu jujur. Tiga alat interaktif, tentang overfitting, tentang skema validasi, dan tentang banyaknya set parameter yang sama baiknya dalam mencocokkan data.

Topik

Pemodelan // Validasi // MRV // Ketidakpastian

Penulis

Dr. Thomas Fungenzi

Share

LinkedInEmail

Sebuah model menghasilkan angka. Seseorang kemudian harus memutuskan apakah angka itu layak dipercaya, dan orang itu biasanya bukan orang yang membangun modelnya. Ia bisa seorang verifikator yang membaca dokumen proyek, seorang pimpinan keberlanjutan yang memutuskan apakah angka itu akan dimasukkan ke dalam sebuah pengungkapan, atau seorang penelaah yang disodori sebuah naskah. Angka itu datang dengan sebuah nama yang melekat padanya, RothC atau persamaan Chave atau random forest, dan nama itu memikul beban yang besarnya mengejutkan. Seharusnya ia hampir tidak memikul apa-apa.

Tidak ada apa pun dalam arsitektur sebuah model yang membuat keluarannya layak dipercaya. Kepercayaan datang dari bukti tentang bagaimana model berperilaku pada data yang tidak dipakai untuk membangunnya, dan bukti itu ada dalam dokumentasi atau tidak ada sama sekali. Dalam praktik, bukti itu sering tidak ada. Sebuah dokumen proyek akan menguraikan model secara terperinci, menyebutkan parameternya, mengutip publikasi aslinya, dan hanya berkata sangat sedikit tentang data apa yang disisihkan, bagaimana data itu disisihkan, dan seperti apa galatnya ketika model berhadapan dengan data tersebut.

Tulisan ini membahas separuh yang hilang itu. Ia berada di antara dua tulisan lain di situs ini. Cara memilih model karbon tanah datang lebih dulu, dan cara mengetahui di mana model yang telah dicocokkan boleh diterapkan datang sesudahnya. Inilah bagian tengahnya: setelah memilih sesuatu, bagaimana Anda mencocokkannya, bagaimana Anda mengujinya, dan apa yang diperlukan agar pengujian itu bermakna.

Jawabannya, sebelum penalarannya

Kalibrasi adalah empat kata

Ketertelusuran instrumen, pencocokan empiris, estimasi parameter model proses, dan kalibrasi pernyataan probabilitas. Keempatnya memiliki kriteria keberhasilan yang berbeda dan mode kegagalan yang berbeda.

Cocok belum membuktikan apa pun

Galat pelatihan turun seiring model menjadi lebih lentur, tanpa batas dan tanpa makna. Hanya galat pada data yang disisihkan dari pencocokan yang membawa informasi tentang prediksi berikutnya.

Skema pembagian adalah klaim

K-fold acak, leave-site-out, dan holdout temporal menjawab pertanyaan yang berbeda. Galat tervalidasi silang yang dilaporkan tanpa skemanya tidak dapat ditafsirkan, dan skema-skema itu tidak dapat dibandingkan satu sama lain.

Tidak ada metrik yang cukup sendirian

Bias, sebaran, dan kecakapan terhadap sebuah baseline adalah tiga pertanyaan terpisah, dan korelasi tidak menjawab satu pun darinya. Sebuah model dapat berkorelasi sempurna dengan kebenaran dan tetap meleset separuhnya.

Cakupan dapat diperiksa

Interval sembilan puluh persen memuat nilai sebenarnya pada sekitar sembilan puluh persen kasus di data yang disisihkan, atau tidak. Ini adalah pengukuran, bukan klaim, dan jarang dilaporkan.

Tidak satu pun dari ini merupakan statistika tingkat lanjut. Ini adalah disiplin biasa di bidang ini, diterapkan secara konsisten, dan sebagian besar jarak antara angka hasil pemodelan yang dapat dipertahankan dan yang tidak dapat dipertahankan sudah tertempuh hanya dengan melakukannya.

Satu kata, empat tugas

Ikutlah dalam sebuah rapat validasi dan hitung maknanya. Pengembang mengatakan model telah dikalibrasi pada dua belas percobaan jangka panjang. Verifikator bertanya apakah model itu sudah divalidasi. Pimpinan penginderaan jauh menyebut bahwa kalibrasinya memakai empat ratus spektrum dengan seratus di antaranya disisihkan. Ahli statistik, yang sejak tadi diam, bertanya apakah intervalnya terkalibrasi. Empat orang, satu kata, dan sedikitnya tiga operasi berbeda di atas meja.

Tidak seorang pun dari mereka memakai kata itu secara keliru. Kalibrasi membawa empat makna yang mapan di berbagai disiplin yang bertemu dalam sebuah proyek karbon, dan keempatnya bukan nuansa dari satu gagasan. Keempatnya berbeda dalam hal apa yang disesuaikan, apa yang dianggap berhasil, dan bagaimana ia gagal. Berpindah-pindah di antara makna-makna itu adalah cara sebuah ruangan berakhir sepakat tentang sebuah kata sambil tidak sepakat tentang semua hal yang seharusnya diselesaikan oleh kata itu.

Makna tertua bersifat metrologis. Sebuah instrumen menghasilkan indikasi, dan kalibrasi menghubungkan indikasi itu dengan nilai-nilai yang disediakan oleh standar pengukuran, masing-masing dengan ketidakpastiannya sendiri, lalu mengubah hubungan itu menjadi cara untuk memperoleh hasil pengukuran dari suatu pembacaan1. Penganalisis pembakaran kering dikalibrasi terhadap bahan acuan bersertifikat dengan kandungan karbon yang diketahui. Satu detail di sini menjadi sumber banyak pembicaraan yang longgar di kemudian hari: kalibrasi tidak mengubah instrumen. Mengatur sebuah sistem agar memberikan indikasi yang ditentukan adalah operasi terpisah dengan namanya sendiri, penyetelan (adjustment), dan kosakata metrologi menyatakan secara eksplisit bahwa keduanya tidak boleh dikacaukan dan bahwa kalibrasi merupakan prasyarat bagi penyetelan1. Kalibrasi dalam makna ini menghasilkan pengetahuan tentang sebuah instrumen, bukan instrumen yang lebih baik.

Makna kedua adalah pencocokan statistik sebuah model empiris. Persamaan alometrik yang menghubungkan diameter dengan biomassa, atau model spektral yang menghubungkan reflektansi dengan konsentrasi karbon, memiliki koefisien yang diestimasi dari data. Data yang dipakai untuk mengestimasinya adalah himpunan kalibrasi; apa pun yang disisihkan adalah himpunan validasi. Tidak ada yang sedang dibuat tertelusur ke sebuah standar di sini. Sebuah bentuk fungsional sedang dicocokkan, dan pertanyaan yang penting adalah bagaimana ia berperilaku pada data yang belum pernah dilihatnya. Spektroskopi tanah adalah tempat dua makna pertama paling sering bertabrakan. Memprediksi sifat tanah dari spektrum reflektansi difus berarti mencocokkan sebuah regresi pada himpunan kalibrasi dan mengujinya pada sampel yang disisihkan2, sehingga kata itu di sana menamai regresinya, bukan penyetelan apa pun pada spektrometer, meskipun ada spektrometer di ruangan itu.

Makna ketiga adalah estimasi parameter untuk model proses. Konstanta laju dekomposisi RothC, atau parameter yang serupa dalam Century dan DayCent, bukanlah besaran yang dapat diukur langsung oleh siapa pun di suatu lahan tertentu. Parameter itu disimpulkan dengan menjalankan model dan menyesuaikannya sampai model mereproduksi deret waktu yang teramati. Setiap kandidat set parameter membutuhkan satu simulasi penuh lagi untuk mengetahui seberapa jauh ia meleset, dan itulah yang menjadikannya masalah invers, bukan pencocokan3. Perbedaannya dengan makna kedua bukan terletak pada teknik, melainkan pada kewajiban: parameter-parameter ini seharusnya bermakna fisik. Laju dekomposisi yang disetel ke nilai apa pun yang meminimalkan residu sudah berhenti menjadi laju dekomposisi dan berubah menjadi parameter bebas yang mengenakan label mekanistik. Di sini pula beberapa set parameter yang berbeda ternyata mereproduksi pengamatan yang sama dengan kebaikan yang kurang lebih setara, sebuah masalah yang memiliki nama dan literaturnya sendiri4.

Makna keempat menyangkut pernyataan probabilitas, bukan prediksi. Sebuah prakiraan terkalibrasi bila peristiwa yang diberinya probabilitas sembilan puluh persen memang terjadi pada sekitar sembilan puluh persen kasus, dan interval prediksi sembilan puluh persen terkalibrasi bila interval itu memuat nilai sebenarnya pada sekitar sembilan puluh persen kasus. Inilah satu-satunya makna yang memungkinkan sebuah model terkalibrasi tanpa cela sekaligus sama sekali tidak berguna. Prediksikan rata-rata jangka panjang setiap kali, lampirkan interval yang cukup lebar untuk menelan variasinya, dan cakupannya akan sangat baik sementara prakiraan itu tidak memberi tahu siapa pun apa pun. Kalibrasi di sini perlu, tetapi harus dinilai bersama seberapa sempit pernyataannya, yang dalam literatur prakiraan disebut ketajaman (sharpness)5.

1 // Kalibrasi instrumenMetrologi

Yang disesuaikan

Tidak ada pada instrumennya. Hubungan antara indikasinya dan nilai acuan dengan ketidakpastian yang diketahui.

Tanda keberhasilan

Hasilnya tertelusur ke sebuah standar, dengan ketidakpastian yang dinyatakan.

Gagal ketika

Pergeseran (drift) di antara dua kalibrasi, atau rantai ketertelusuran yang diasumsikan alih-alih didokumentasikan.

2 // Mencocokkan model empirisStatistika // kemometrika

Yang disesuaikan

Koefisien dari sebuah bentuk fungsional yang dipilih, diestimasi dari himpunan kalibrasi.

Tanda keberhasilan

Kecakapan prediktif pada data yang disisihkan dari pencocokan.

Gagal ketika

Overfitting, dan data validasi yang tidak independen dari data kalibrasi.

3 // Estimasi parameter model prosesPemodelan biogeokimia

Yang disesuaikan

Parameter yang dimaksudkan bermakna fisik, disimpulkan melalui inversi terhadap deret waktu yang teramati.

Tanda keberhasilan

Model mereproduksi lokasi yang tidak dipakai untuk menyetelnya, dengan parameter yang tetap masuk akal secara fisik.

Gagal ketika

Ekuifinalitas, dan parameter yang dibengkokkan melampaui akal sehat fisik untuk menyerap galat struktural.

4 // Kalibrasi sebuah probabilitasPrakiraan

Yang disesuaikan

Lebar dan bentuk ketidakpastian yang dinyatakan, bukan prediksi pusatnya.

Tanda keberhasilan

Cakupan yang tercapai sesuai dengan cakupan nominal, pada ketajaman yang berguna.

Gagal ketika

Interval begitu lebar sehingga cakupan terpenuhi dan pernyataannya kosong.

Konsekuensinya bagi sebuah proyek karbon cukup spesifik untuk diwaspadai. Seorang verifikator bertanya apakah model telah divalidasi. Pengembang menjawab bahwa model dikalibrasi terhadap percobaan jangka panjang setempat, sebuah pernyataan yang benar dan relevan tentang makna ketiga. Verifikator itu mungkin sedang menanyakan makna kedua, yaitu pengujian dengan data yang disisihkan, atau makna keempat, yaitu apakah ketidakpastian yang melekat pada angka akhir memiliki dasar cakupan. Tiga pertanyaan yang wajar, satu jawaban, dan celah di antara keduanya tidak tercatat dalam notulen.

Sebuah argumen yang lebih tua berada di bawah argumen ini. Verifikasi adalah milik sistem tertutup: sebuah struktur yang murni formal dapat dibuktikan melalui manipulasi simbolik, dan sebuah algoritma di dalam program dapat diperiksa dengan cara yang sama. Model yang dibangun dari komponen semacam itu tidak dengan sendirinya tertutup, karena parameter yang dibutuhkannya tidak pernah diketahui sepenuhnya, dan klaim bahwa model sebuah sistem lingkungan yang terbuka telah divalidasi dalam arti mutlak apa pun telah diperdebatkan sejak pertengahan tahun sembilan puluhan6. Buku teks yang ditulis untuk para pemodel menarik garis yang sama dengan alasan praktis. Salah satunya memperlakukan model sebagai hipotesis ilmiah ketika pertanyaannya adalah apakah proses-prosesnya berperilaku seperti proses nyata, sebuah hipotesis yang dapat dibatalkan tetapi tidak pernah dapat divalidasi secara definitif. Buku yang sama memperlakukan model itu sebagai alat rekayasa ketika pertanyaannya bukan bagaimana model bekerja melainkan seberapa baik ia bekerja, dan menyebutnya evaluasi7. Buku yang lain menolak kata validasi untuk fase ketiga sebuah proyek pemodelan dan menyebut fase itu evaluasi. Membandingkan prediksi dengan pengamatan hanyalah satu dari beberapa hal yang membuat sebuah model berguna bagi tujuannya, dan kata validasi menyiratkan bahwa ada model yang benar untuk ditemukan8. Tidak ada dalam tulisan ini yang mengharuskan Anda memihak dalam perdebatan itu. Yang diharuskan adalah membaca validasi sebagai singkatan untuk pengujian tertentu terhadap data tertentu, bukan sebagai sertifikat.

Kecocokan itu murah

Ambil dua belas pohon, ukur diameternya, ambil sampel biomassanya secara destruktif, lalu cocokkan sebuah polinomial. Pada derajat dua, kurvanya melintas dekat titik-titik itu. Pada derajat sebelas, kurvanya melintasi setiap titik dengan tepat. Residunya nol, koefisien determinasinya satu, dan kecocokannya sempurna dalam satu-satunya arti yang dapat dipikul kata itu di dalam sampel. Di antara titik-titik itu, kurvanya berayun ke nilai-nilai yang mustahil secara fisik, dan pohon ketiga belas akan jatuh jauh dari kurva tersebut.

Ini bukan kelainan khas polinomial. Ini adalah perilaku umum model yang lentur, dan alasan mengapa kinerja di dalam sampel membawa begitu sedikit informasi. Seiring model memperoleh keleluasaan, galat pelatihannya turun secara monoton, tanpa batas bawah selain nol dan tanpa titik ketika penurunan itu menandakan sesuatu. Galat pada data yang disisihkan dari pencocokan berperilaku lain: ia turun selama kelenturan tambahan itu membeli struktur yang dapat digeneralisasi, lalu berbalik naik ketika kelenturan yang sama mulai menyerap derau yang khas pada sampel yang sedang dipegang9.

Mekanismenya memiliki dekomposisi baku. Galat yang diharapkan pada sebuah titik baru terurai menjadi suku bias, yaitu seberapa jauh model keliru secara rata-rata, suku varians, yaitu seberapa banyak model yang dicocokkan bergeser ketika sampel pelatihan ditarik ulang, dan suku yang tak tereduksi, yaitu varians target di sekitar rata-rata sebenarnya sendiri, yang tidak dapat dihilangkan oleh pemodelan sebanyak apa pun. Kelenturan menukar suku pertama dengan suku kedua. Model yang kaku lebih bias dan lebih stabil, model yang lentur kurang bias dan lebih gelisah, dan tempat yang berguna tidak berada di salah satu ujungnya9.

Galat prediksi yang diharapkan pada sebuah titik baru
E[(y − ŷ)²] = Bias(ŷ)² + Var(ŷ) + σ²tak tereduksi
y, ŷ
Nilai sebenarnya pada sebuah titik baru, dan prediksi model untuknya.
Bias(ŷ)²
Seberapa jauh model keliru secara rata-rata.
Var(ŷ)
Seberapa banyak model yang dicocokkan bergeser ketika sampel pelatihan ditarik ulang.
σ²
Varians target di sekitar rata-rata sebenarnya sendiri. Pemodelan sebanyak apa pun tidak dapat menghilangkannya.

Satu akibat wajar layak dinyatakan tersendiri, karena ia bertahan dalam dokumentasi proyek lama setelah seharusnya dipensiunkan. Koefisien determinasi di dalam sampel tidak pernah turun ketika sebuah prediktor ditambahkan. Tambahkan satu kolom bilangan acak ke sebuah regresi dan R² akan naik. Bentuk yang disesuaikan (adjusted) memberi penalti pada jumlah parameter dan mengoreksi sebagian masalahnya, tetapi tidak ada statistik di dalam sampel yang menjawab pertanyaan yang penting, yaitu apa yang terjadi di lokasi berikutnya, bukan di lokasi ini.

Di bidang kita sendiri, jebakan ini memiliki bentuk yang spesifik. Persamaan alometrik yang dicocokkan secara lokal, diestimasi pada beberapa lusin pohon dari satu perkebunan, pada dasarnya akan selalu mengalahkan persamaan pantropis yang terpublikasi pada pohon-pohon yang sama itu. Perbandingan itu bukan bukti bahwa persamaan lokal lebih baik, namun secara rutin disajikan seolah-olah demikian. Perbandingan yang jujur menyisihkan pohon-pohon yang tidak pernah dilihat oleh persamaan lokal, dan itulah persis perbandingan yang terasa menyakitkan bagi set data destruktif yang kecil, karena setiap pohon yang disisihkan adalah pohon yang tidak dipakai untuk pencocokan. Ketegangan ini nyata. Berpura-pura ia tidak ada dengan melaporkan kecakapan di dalam sampel bukanlah penyelesaiannya.

Kegagalan yang sama berlaku pula pada skala peta. Model ekologi berskala besar yang divalidasi dengan menyisihkan piksel secara acak telah melaporkan kinerja prediktif yang kuat, yang runtuh begitu data yang disisihkan dipisahkan secara spasial dari data pelatihan, karena piksel yang bertetangga bukanlah pengamatan yang independen dan pembagian acak diam-diam memberikan jawabannya kepada model10. Kegagalan spesifik itu adalah pokok bahasan sebuah tulisan pendamping dan tidak diulang di sini; yang relevan di sini adalah pelajaran umumnya, bahwa pembagianlah yang melakukan pekerjaan, bukan metrik yang dihitung sesudahnya.

Anatomi sebuah validasi

Kata validasi mencakup sebuah hierarki yang layak dibongkar, karena tingkat-tingkatnya memperkirakan hal yang berbeda dan secara rutin diringkus menjadi satu. Dalam versi yang paling bersih ada tiga peran bagi data, dan setiap pengamatan memainkan tepat satu di antaranya.

Data latih

Mengestimasi parameter. Galat yang diukur di sini memberi tahu Anda bahwa model dapat mereproduksi data yang sudah dilihatnya, dan hal itu tidak diragukan.

Data validasi

Memilih di antara kandidat: bentuk fungsional mana, berapa banyak suku, hiperparameter mana. Galat di sini memandu seleksi, dan menjadi bias ke bawah begitu dipakai untuk seleksi itu.

Data uji

Memperkirakan bagaimana model terpilih akan berkinerja pada data baru. Ia tidak bias hanya selama tetap tak tersentuh, dan ia hanya dapat dipakai tepat satu kali.

Perbedaan antara peran kedua dan ketiga itulah yang sering hilang. Misalkan Anda mencoba delapan konfigurasi model, mengevaluasi masing-masing pada blok data disisihkan yang sama, memilih yang skornya terbaik, lalu melaporkan skor itu sebagai kinerja yang diharapkan dari model tersebut. Angkanya terlalu bagus, dan terlalu bagus karena alasan yang sama sekali tidak berkaitan dengan ketidakjujuran: Anda memilih nilai maksimum dari delapan estimasi yang berderau, sehingga Anda memilih sebagian karena kecakapan yang sungguhan dan sebagian karena derau yang menguntungkan. Semakin banyak konfigurasi yang Anda coba, semakin besar bagian skor yang dilaporkan yang merupakan derau yang memang Anda cari11.

Ketika data terlalu langka untuk menyisihkan data uji yang tidak pernah disentuh, jawaban yang mapan adalah membuat prosedurnya bersarang (nested): sebuah loop dalam yang melakukan seleksi, dan sebuah loop luar yang hanya melihat model yang sudah dipilih, sehingga estimasi luar tidak pernah dipakai untuk memilih apa pun11. Cara ini memakan komputasi tetapi sama sekali tidak memakan data, sehingga ketiadaannya dalam sebagian besar pekerjaan terapan sulit dibela dengan alasan praktis.

Di bawah ketiga tingkat itu terdapat sebuah kata penyangga yang tidak dapat diperiksa oleh aritmetika untuk Anda. Data yang disisihkan harus independen, dan independensi di sini adalah klaim tentang dunia, bukan tentang lembar kerja. Dua inti tanah dari lahan yang sama yang berjarak sepuluh meter adalah dua baris dalam tabel dan kira-kira satu pengamatan tentang tanah. Dua tahun dari lokasi yang sama bukanlah dua uji independen bagi sebuah model temporal. Membagi tabel secara acak menjamin bahwa baris-barisnya terpisah. Pembagian itu sama sekali tidak menjamin apakah informasinya terpisah.

Keluarga validasi silang, dan apa yang diasumsikan setiap anggotanya

Menyisihkan satu data uji tunggal memboroskan data, dan dengan beberapa ratus pengamatan pemborosan itu terasa. Validasi silang memulihkan sebagian besarnya dengan menggilir peran data yang disisihkan: partisi datanya, latih pada semua bagian kecuali satu, uji pada bagian yang ditinggalkan, ulangi sampai setiap bagian mendapat giliran, lalu rata-ratakan. Gagasannya tua, sederhana, dan hampir selalu dilaporkan dalam bentuk yang menghilangkan satu-satunya detail yang dibutuhkan pembaca.

Detail itu adalah cara partisi dibuat. Validasi silang bukan satu prosedur melainkan sebuah keluarga, dan para anggotanya berbeda dalam cara menetapkan pengamatan ke dalam lipatan (fold). Penetapan itu bukan preferensi teknis. Ia adalah pernyataan tentang apa yang akan diminta dari model, dan setiap pilihan memperkirakan galat dari tugas yang berbeda12.

K-fold acak

Pertanyaan yang dijawab

Seberapa baik model ini memprediksi pengamatan lain yang diambil dari kumpulan yang sama?

Tepat dipakai ketika

Pengamatan yang benar-benar dapat dipertukarkan, tanpa pengelompokan, tanpa klaster spasial, dan tanpa urutan waktu.

Tidak berlaku ketika

Data yang berkelompok atau berautokorelasi, ketika tetangga dekat dari sebuah fold berada di data latih dan membocorkan jawabannya.

Leave-one-out

Pertanyaan yang dijawab

Pertanyaan yang sama, dengan fold berisi satu pengamatan.

Tepat dipakai ketika

Set data kecil, dan model linear yang memungkinkannya dihitung dalam bentuk tertutup alih-alih dicocokkan ulang n kali.

Tidak berlaku ketika

Estimasinya bervarians tinggi, dan ia mewarisi setiap masalah kebocoran dari k-fold acak.

Leave-site-out

Pertanyaan yang dijawab

Seberapa baik model ini memprediksi sebuah lokasi yang sama sekali tidak menyumbang pada pencocokan?

Tepat dipakai ketika

Setiap model yang dimaksudkan untuk diterapkan di tempat yang belum pernah menjadi tempat kalibrasinya, dan itu mencakup sebagian besar pekerjaan proyek.

Tidak berlaku ketika

Pesimistis bila penggunaan yang dimaksud memang interpolasi di dalam lokasi-lokasi yang sudah dikenal, dan ia membutuhkan cukup banyak lokasi untuk dirata-ratakan.

Holdout temporal

Pertanyaan yang dijawab

Seberapa baik model ini memprediksi ke depan dari data yang ada?

Tepat dipakai ketika

Apa pun yang memproyeksikan sebuah lintasan, ketika melatih dengan masa depan untuk memprediksi masa lalu tidak ada artinya.

Tidak berlaku ketika

Menghabiskan data terbaru, yang biasanya paling relevan, untuk pengujian, dan satu jendela holdout hanyalah satu estimasi yang berderau.

Jalankan set data yang sama melalui beberapa skema ini dan galat yang dilaporkan akan bergerak, sering kali sangat jauh. Pergerakan itu adalah intinya, bukan gangguan. Galat tervalidasi silang adalah pernyataan bersyarat, dan syaratnya adalah partisi. Dua angka yang dihasilkan dengan skema berbeda bukanlah dua estimasi dari satu besaran, sehingga membandingkan keduanya, atau membandingkan hasil leave-site-out Anda dengan hasil k-fold acak yang terpublikasi, adalah kesalahan kategori yang didandani sebagai tolok ukur. Alat di bawah menjalankan satu set data yang berkelompok per lokasi melalui tiga skema, sehingga besarnya pergerakan itu terlihat, bukan sekadar dinyatakan.

Kasus spasial memiliki struktur yang lebih kaya daripada yang diberikan bagian ini: seberapa jauh sebuah blok harus terpisah sebelum dianggap independen, bagaimana pemblokiran bisa kebablasan menjadi pesimisme, dan apa yang harus dilakukan ketika sasaran prediksi yang dimaksud itu sendiri berkelompok. Hal itu termasuk dalam tulisan tentang keterwakilan, yang dimulai tepat di tempat bagian ini berhenti.

Metrik yang hanya berguna bila bersama-sama

Begitu pembagian sudah ditetapkan, sesuatu harus dihitung di seluruhnya, dan di sini kebiasaannya adalah melaporkan satu angka. Tidak ada satu angka pun yang menggambarkan galat sebuah model, karena galat memiliki sedikitnya tiga sifat yang independen: apakah ia condong, seberapa besar ia lazimnya, dan apakah model mengalahkan alternatif yang remeh. Sebuah metrik menjawab salah satunya dan diam tentang yang lain.

Galat rata-rata (mean error), yaitu rata-rata residu bertanda, mengukur kecondongan. Metrik inilah yang paling penting bagi akuntansi karbon, karena selisih sistematis tidak menyusut ketika proyek membesar: bias berakumulasi, sementara galat acak sebagian saling meniadakan. Metrik ini juga yang paling mudah terpenuhi secara kebetulan, karena galat positif dan negatif yang besar dapat merata-rata menjadi nol yang menenangkan.

Root mean square error mengukur ukuran lazimnya, dalam satuan besaran yang diukur, dan memberi bobot besar pada kemelesetan yang besar karena ia mengkuadratkan sebelum merata-ratakan. Mean absolute error mengajukan pertanyaan yang sama tanpa pembobotan itu. Melaporkan keduanya bersifat informatif: bila RMSE jauh melampaui MAE, distribusi galat memiliki ekor, dan ekor dalam data validasi biasanya menandakan subpopulasi yang ditangani model dengan buruk, bukan nasib buruk.

Tidak satu pun dari keduanya mengatakan apakah model itu layak dimiliki. Untuk itu dibutuhkan baseline, dan itulah yang disediakan oleh efisiensi model: ia membandingkan galat kuadrat model dengan galat dari sekadar memprediksi rata-rata pengamatan, dan melaporkan proporsi varians awal yang dapat dijelaskan oleh model13. Satu berarti sempurna, nol berarti rata-rata akan sama baiknya, dan negatif berarti rata-rata akan lebih baik. Nilai negatif muncul dalam karya terpublikasi tentang tanah dan biomassa lebih sering daripada yang biasanya diakui oleh nada teks di sekitarnya. Itu kesan dari membaca, bukan angka hasil penghitungan.

Efisiensi model, terhadap rata-rata pengamatan
EF = 1 − Σ(oᵢ − pᵢ)² / Σ(oᵢ − ō)²
EF
Efisiensi model. Satu berarti sempurna, nol berarti rata-rata akan sama baiknya, negatif berarti rata-rata akan lebih baik.
oᵢ
Nilai teramati untuk sampel i.
pᵢ
Nilai yang diprediksi model untuk sampel yang sama.
ō
Rata-rata nilai teramati, yaitu baseline tanpa model.

Metrik yang paling patut dicurigai adalah koefisien korelasi dan kuadratnya. Korelasi mengukur apakah dua deret bergerak bersama, bukan apakah keduanya sesuai. Model yang mengembalikan tepat separuh biomassa sebenarnya dari setiap pohon berkorelasi sempurna dengan kebenaran, R² sama dengan satu, dan keliru lima puluh persen di mana-mana. Ini bukan kasus yang dibuat-buat: prediksi yang terskala secara sistematis adalah persis apa yang dihasilkan model yang salah kalibrasi, dan persis hal yang tidak terlihat oleh R². Koefisien korelasi konkordansi Lin ada karena alasan ini. Koefisien itu mengganjar kesesuaian dengan garis satu-banding-satu, bukan dengan sembarang garis, sehingga nilainya turun ketika sebuah model bias secara proporsional meskipun korelasinya tetap sempurna14.

Tersisa plot yang digambar semua orang dan, secara mengejutkan, cukup sering digambar keliru. Ketika nilai teramati dan nilai prediksi diplot satu terhadap yang lain dan sebuah garis dicocokkan untuk menguji kemiringan satu dan intersep nol, pilihan sumbu bukanlah soal kosmetik. Meregresikan nilai prediksi terhadap nilai teramati dan meregresikan nilai teramati terhadap nilai prediksi menghasilkan kemiringan yang berbeda, dan hanya satu di antaranya yang menguji hipotesis tentang kinerja model yang memang hendak diuji oleh plot itu. Konvensi yang didukung argumen statistik menempatkan nilai teramati pada sumbu vertikal dan nilai prediksi pada sumbu horizontal, karena prediksilah besaran yang sedang dievaluasi dan asumsi regresi jatuh di tempat yang semestinya15.

Seperti apa evaluasi yang lebih lengkap sudah terdokumentasi. Ketika model tanah-tanaman STICS diuji dengan satu set parameter baku pada lima belas tanaman dan beragam tanah serta iklim Prancis, penilaiannya dibagi tiga. Akurasi dinilai dari RMSE, RMSE relatif, dan efisiensi model, bersama dengan apakah galatnya sebagian besar berupa bias atau dispersi. Ketangguhan menanyakan apakah besarnya galat bergantung pada tanaman atau lingkungan. Perilaku menanyakan apakah model mereproduksi perbedaan yang teramati antara kondisi lingkungan dan praktik pengelolaan yang kontras16. Ketiganya menjawab pertanyaan yang berbeda, dan bagian validasi yang hanya melaporkan yang pertama baru menjawab satu di antaranya.

Mengkalibrasi model proses adalah pekerjaan yang lain

Semua yang di atas mengasumsikan model yang parameternya bebas mengambil nilai apa pun yang paling cocok, karena parameter itu tidak membawa makna di luar kecocokannya. Model proses mematahkan asumsi itu. Laju dekomposisi reservoir dalam RothC, konstanta pergantian dalam Century, dan parameter nitrogen dalam DayCent ditulis sebagai besaran fisik, dan klaim model untuk memproyeksikan melampaui data kalibrasinya sepenuhnya bertumpu pada sifat fisik parameter-parameter itu. Klaim itulah yang membuat penyetelannya rumit.

Instrumen untuk pekerjaan ini adalah eksperimen jangka panjang, sebagian berjalan lebih dari satu abad, tempat karbon tanah diikuti di bawah perlakuan yang tetap. Hanya data itulah yang membatasi model berskala dasawarsa pada skala waktu yang diklaimnya, yang juga berarti jumlahnya tidak banyak, sebarannya tidak merata di antara iklim dan tanah dunia, dan segelintir eksperimen yang sama muncul dalam kalibrasi demi kalibrasi. Lokakarya yang mulai menguji model bahan organik tanah terhadap set data jangka panjang secara sistematis memberikan alasannya: perubahan bahan organik tanah berlangsung lambat, sehingga hanya data jangka panjang yang dapat menguji model tentangnya. Set datanya, menurut pengakuannya sendiri, berasal dari kawasan beriklim sedang17. Model yang disetel pada percobaan lahan garapan beriklim sedang dan diterapkan pada agroforestri tropis telah dikalibrasi terhadap instrumen yang tidak pernah mengukur apa pun yang menyerupai sasarannya18.

Praktiknya membentang di sepanjang sebuah spektrum. Di satu ujung, seorang pemodel menyesuaikan parameter dengan tangan sampai kurva simulasi dan kurva pengamatan tampak berdekatan, cara yang cepat, tidak terdokumentasi, dan tidak dapat diulang. Di tengah, sebuah pengoptimal meminimalkan fungsi kerugian, cara yang dapat diulang dan mengembalikan satu set terbaik tanpa pernyataan tentang seberapa jauh lebih baik set itu dibandingkan alternatifnya. Di ujung terjauh, kalibrasi Bayesian memperlakukan parameter sebagai variabel acak, menggabungkan prior dengan likelihood pengamatan, dan mengembalikan distribusi posterior: bukan satu jawaban, melainkan gambaran setiap jawaban yang dapat ditoleransi data, lengkap dengan ketidakpastiannya sendiri19.

Kerangka itu juga memberi ruang bagi sesuatu yang diabaikan oleh dua pendekatan lainnya. Model nyata keliru secara struktural, dan galat struktural tidak berperilaku seperti derau pengukuran. Kalibrasi menghasilkan nilai yang paling cocok, bukan nilai fisik, dan laju dekomposisi dapat berakhir pada nilai apa pun yang mengompensasi sebuah proses yang tidak direpresentasikan model. Ia tetap cocok. Ia bukan lagi laju dekomposisi, dan proyeksi yang bersandar pada makna fisiknya sedang bersandar pada sesuatu yang diam-diam sudah berhenti bersifat fisik19.

Alasan lain untuk lebih memilih distribusi daripada satu kecocokan terbaik adalah bahwa kecocokan terbaik biasanya tidak jauh lebih baik daripada sejumlah besar alternatif yang cukup berbeda. Banyak set parameter mereproduksi lintasan karbon yang teramati dengan kebaikan yang kurang lebih setara, dan set-set itu tidak sepakat satu sama lain tentang masa depan, karena mencocokkan masa lalu yang sama adalah batasan yang jauh lebih lemah daripada kelihatannya. Tanggapannya bukan memilih pemenang dan melaporkan proyeksinya, melainkan membawa himpunan yang dapat diterima itu ke depan dan membiarkannya menghasilkan sebuah rentang4. Alat di bawah memperlihatkan hal itu pada model mainan satu reservoir dengan dua besaran yang tidak diketahui: wilayah ruang parameter yang konsisten dengan data itu lebar, menyempit ketika lebih banyak data datang, dan tidak pernah menciut menjadi satu titik.

Satu interaksi lagi mudah terlewat. Titik awal sebuah model proses itu sendiri merupakan keputusan kalibrasi. Pembagian stok awal ke dalam reservoir cepat, lambat, dan inert jarang dapat diukur, biasanya diestimasi, dan secara material mengubah proyeksi tiga puluh tahun. Mengkalibrasi parameter terhadap sebuah lintasan yang titik awalnya sendiri diasumsikan berarti mencocokkan dua besaran yang tidak diketahui pada satu kurva. Masalah itu, beserta prosedur spin-up yang merupakan jawaban yang dapat dipertahankan untuknya, diuraikan dalam tulisan tentang memilih model karbon tanah.

Pernyataan ketidakpastian adalah prediksi, dan dapat diuji

Kembali ke makna keempat kalibrasi, tempat sebagian besar ketidakpastian model yang dilaporkan diam-diam gagal. Sebuah proyek menyatakan estimasinya sebagai nilai pusat dengan interval sembilan puluh persen. Interval itu bukan peringatan atau isyarat kerendahan hati. Ia adalah klaim yang dapat difalsifikasi: dari banyak pernyataan semacam itu, nilai sebenarnya semestinya jatuh di dalam sekitar sembilan puluh persennya. Proporsi yang benar-benar demikian adalah cakupan yang tercapai, dan membandingkannya dengan angka nominal sembilan puluh adalah pengukuran biasa yang hampir tidak pernah dilakukan siapa pun.

Ketika pengukuran itu dilakukan, intervalnya biasanya terlalu sempit. Tiga penyebab menjelaskan sebagian besarnya. Ketidakpastian parameter dibuang, sehingga interval mencerminkan sebaran residu di sekitar satu model yang dicocokkan, bukan ketidakpastian tentang model mana yang benar. Galat struktural diabaikan, karena tidak ada suku dalam aritmetika yang mewakili kemungkinan bahwa bentuk model itu keliru. Dan pengamatan yang berkorelasi dihitung sebagai pengamatan independen, yang menggelembungkan ukuran sampel efektif dan menyempitkan setiap interval yang dihitung darinya, sebuah mekanisme yang diuraikan dalam tulisan tentang keterwakilan.

Koreksinya bukan melebarkan interval sampai cakupannya terpenuhi, karena itu adalah mode kegagalan dari arah yang berlawanan dan menghasilkan pernyataan yang terlalu kabur untuk ditindaklanjuti. Cakupan dan ketajaman adalah dua sumbu yang terpisah, dan sasarannya adalah interval tersempit yang masih mencakup pada laju nominalnya5. Yang membuat hal ini dapat dikerjakan dalam praktik adalah bahwa keduanya dapat diukur pada data yang disisihkan, dengan pembagian yang sama yang sudah dibangun untuk mengevaluasi prediksi pusat. Validasi yang melaporkan cakupan yang tercapai di samping RMSE telah menjawab pertanyaan yang berhak diajukan seorang verifikator dan biasanya tidak tahu cara merumuskannya.

Apa yang sebenarnya diminta oleh standar

Dua pertanyaan selalu muncul setiap kali materi ini bertemu proyek nyata. Apakah ada yang mewajibkan ini, dan apakah ada yang memeriksanya. Jawaban singkatnya: akuntansi berbasis model memang membawa persyaratan validasi, persyaratan itu kurang spesifik daripada pembahasan statistik di atas, dan celah antara apa yang diwajibkan sebuah standar dan apa yang membuat sebuah angka dapat dipertahankan adalah tempat sebagian besar penilaian profesional berada.

Kerangka IPCC menetapkan kosakatanya. Tier 3 adalah tingkat ketika sebuah inventarisasi memakai model atau pengukuran langsung alih-alih faktor emisi bawaan, dan persyaratan yang melekat pada versi berbasis model dinyatakan dengan gamblang: inventarisasi Tier 3 berbasis model memerlukan pengukuran untuk mengkalibrasi dan memvalidasi model yang dipakai untuk mengestimasi perubahan stok karbon20. Kedua separuh artikel ini berada dalam kalimat itu, dihubungkan oleh kata “dan”, bukan diperlakukan sebagai satu hal. Pengukuran untuk mengkalibrasi, dan pengukuran untuk memvalidasi. Apakah sebuah inventarisasi tertentu memisahkan keduanya bukanlah sesuatu yang dapat ditegakkan oleh kalimat itu.

Di pasar sukarela, persyaratannya lebih eksplisit. Metodologi Verra untuk pengelolaan lahan pertanian yang lebih baik mengizinkan model biogeokimia untuk menyimulasikan perubahan karbon tanah, dan melekatkan perangkat padanya: laporan validasi model, yang dinilai oleh seorang ahli pemodelan independen dan diajukan ulang ketika kampanye pengukuran berikutnya memperluas set data kalibrasi dan validasi, serta pengurangan ketidakpastian yang diterapkan pada reduksi emisi yang diterbitkan21. Sebuah modul terpisah memuat persyaratan kalibrasi dan validasi itu sendiri22. Pengurangan itulah bagian yang layak disebut, karena prinsip desainnya baik. Besarnya mengikuti galat baku relatif dari estimasi, sehingga ketidakpastian tidak hanya diungkapkan tetapi juga diberi harga, dan proyek yang tidak dapat menunjukkan model yang terbatasi dengan baik menerbitkan lebih sedikit kredit untuk karbon terukur yang sama.

Mengenai partisi itu sendiri, modul tersebut lebih spesifik daripada yang diperkirakan sebagian besar praktisi, dan lebih menuntut. Modul itu mensyaratkan agar data kalibrasi dan data validasi terbukti independen, dan menyatakan apa artinya: set data itu tidak boleh tumpang tindih dalam lokasi penelitian eksperimental, dan tidak boleh diambil dari studi eksperimental yang sama22. Membagi satu kumpulan data diperbolehkan, dan k-fold disebut sebagai salah satu caranya, tetapi syarat independensi tetap mengikat, sehingga fold harus menghormati studi dan lokasi alih-alih diambil secara acak lintas baris. Secara substansi, hal itu jauh lebih dekat ke leave-site-out daripada ke holdout acak yang dibayangkan kebanyakan orang, dan tim yang merasa cukup dengan k-fold acak atas petak-petak yang berkelompok belum memenuhi persyaratan itu, sebagus apa pun angka yang dihasilkannya. Cara seorang verifikator membaca klaim yang dihasilkan adalah pokok bahasan tulisan pendamping.

Apa yang perlu ditanyakan pada setiap angka hasil pemodelan

Tidak satu pun dari pertanyaan berikut mengharuskan penanyanya menjadi pemodel. Inilah pertanyaan-pertanyaan yang memisahkan angka yang didukung bukti dari angka yang hanya didukung kutipan, dan semuanya dapat diajukan dalam sebuah rapat.

Sepuluh pertanyaan

  1. 1Ketika Anda mengatakan model ini terkalibrasi, makna yang mana dari keempat makna itu yang Anda maksud?
  2. 2Data apa yang disisihkan dari pencocokan, dan bagaimana data itu dipilih?
  3. 3Dalam hal apa data yang disisihkan itu independen: lokasi yang berbeda, tahun yang berbeda, kawasan yang berbeda?
  4. 4Berapa banyak konfigurasi model yang dievaluasi sebelum konfigurasi ini dilaporkan?
  5. 5Apakah data yang dipakai untuk memilih model sama dengan data yang dipakai untuk melaporkan kinerjanya?
  6. 6Berapa biasnya, terpisah dari RMSE, dalam satuan besaran yang diukur?
  7. 7Terhadap baseline apa kecakapannya diukur, dan apakah model mengalahkan prediksi berupa rata-rata?
  8. 8Pada plot nilai teramati terhadap nilai prediksi, berapa kemiringan dan intersepnya?
  9. 9Apakah ketidakpastian yang dinyatakan sudah diperiksa cakupannya, dan berapa proporsi pengamatan yang disisihkan yang jatuh di dalamnya?
  10. 10Apakah kondisi tempat model ini akan diterapkan berada di dalam rentang tempat ia dikalibrasi?

Tim yang dapat menjawab kesepuluhnya sudah melakukan pekerjaannya. Tim yang menganggap beberapa di antaranya tidak masuk akal juga telah memberi tahu Anda sesuatu yang berguna.

Alasan untuk menanyakannya bukan kecurigaan. Sebagian besar angka hasil pemodelan di bidang ini dihasilkan oleh orang-orang yang bekerja sebaik mungkin dengan set data kecil dan tenggat yang nyata, dan celah-celahnya biasanya merupakan konvensi warisan, bukan jalan pintas yang disengaja. Namun angka yang masuk ke dalam sebuah pengungkapan, penerbitan kredit, atau dokumen kebijakan telah meninggalkan tangan pemodelnya, dan pada titik itu satu-satunya hal yang berdiri di antara angka itu dan sebuah keputusan adalah apakah ada yang bertanya terhadap apa angka itu diuji.

Poin-poin utama

  1. Kalibrasi menamai empat operasi yang berbeda: membuat instrumen tertelusur, mencocokkan model empiris, mengestimasi parameter model proses, dan mengkalibrasi pernyataan probabilitas. Keempatnya gagal dengan cara yang berbeda, dan sebagian besar perselisihan tentang model yang sudah divalidasi adalah ketidakcocokan antara dua di antaranya.

  2. Galat pelatihan turun tanpa batas seiring model memperoleh kelenturan dan tidak membawa informasi tentang prediksi berikutnya. Hanya galat pada data yang disisihkan dari pencocokan yang membawanya.

  3. Koefisien determinasi di dalam sampel tidak pernah turun ketika sebuah prediktor ditambahkan, termasuk prediktor berupa bilangan acak. Alometri lokal yang mengalahkan alometri global pada pohon-pohon kalibrasinya sendiri bukan bukti apa pun.

  4. Data yang dipakai untuk memilih model tidak dapat sekaligus mengukur kinerjanya. Memilih konfigurasi terbaik dari beberapa konfigurasi pada satu data yang disisihkan berarti skor yang dilaporkan sebagian adalah derau yang Anda pilih; membuat prosedurnya bersarang memperbaikinya tanpa biaya data.

  5. Skema validasi silang adalah klaim tentang tugas prediksi. K-fold acak, leave-site-out, dan holdout temporal menjawab pertanyaan yang berbeda dan tidak dapat dibandingkan, sehingga galat yang dilaporkan tanpa partisinya tidak dapat ditafsirkan.

  6. Tidak ada metrik yang cukup sendirian. Bias, sebaran, dan kecakapan terhadap baseline adalah sifat yang terpisah, dan korelasi tidak mengukur satu pun darinya: model yang mengembalikan tepat separuh dari setiap nilai sebenarnya berkorelasi sempurna dengan kebenaran.

  7. Untuk model proses, banyak set parameter mencocokkan lintasan yang sama dengan kebaikan yang kurang lebih setara dan tidak sepakat tentang masa depan. Membawa himpunan yang dapat diterima ke depan lebih dapat dipertahankan daripada melaporkan proyeksi dari satu kecocokan terbaik.

  8. Ketidakpastian yang dinyatakan adalah prediksi yang dapat diuji. Cakupan yang tercapai pada data yang disisihkan sesuai dengan laju nominal atau tidak, ia dapat diukur dengan pembagian yang sudah dibangun untuk estimasi pusat, dan ia hampir tidak pernah dilaporkan.

Referensi

  • 1.JCGM (Joint Committee for Guides in Metrology) (2012). International vocabulary of metrology: Basic and general concepts and associated terms (VIM), 3rd edition. JCGM 200:2012. Bureau International des Poids et Mesures. bipm.org
  • 2.Viscarra Rossel, R.A., Walvoort, D.J.J., McBratney, A.B. et al. (2006). Visible, near infrared, mid infrared or combined diffuse reflectance spectroscopy for simultaneous assessment of various soil properties. Geoderma, 131(1–2), 59–75. doi:10.1016/j.geoderma.2005.03.007
  • 3.Haefner, J.W. (2005). Modeling Biological Systems: Principles and Applications, 2nd edition. Springer, New York. doi:10.1007/b106568
  • 4.Beven, K., Freer, J. (2001). Equifinality, data assimilation, and uncertainty estimation in mechanistic modelling of complex environmental systems using the GLUE methodology. Journal of Hydrology, 249(1–4), 11–29. doi:10.1016/s0022-1694(01)00421-8
  • 5.Gneiting, T., Balabdaoui, F., Raftery, A.E. (2007). Probabilistic Forecasts, Calibration and Sharpness. Journal of the Royal Statistical Society Series B: Statistical Methodology, 69(2), 243–268. doi:10.1111/j.1467-9868.2007.00587.x
  • 6.Oreskes, N., Shrader-Frechette, K., Belitz, K. (1994). Verification, Validation, and Confirmation of Numerical Models in the Earth Sciences. Science, 263(5147), 641–646. doi:10.1126/science.263.5147.641
  • 7.Wallach, D., Makowski, D., Jones, J.W. et al. (2019). Model evaluation. In: Working with Dynamic Crop Models: Methods, Tools and Examples for Agriculture and Environment, 3rd edition, pp. 311–373. Academic Press. doi:10.1016/B978-0-12-811756-9.00009-5
  • 8.Grant, W.E., Swannack, T.M. (2008). Ecological Modeling: A Common-Sense Approach to Theory and Practice. Blackwell Publishing. ISBN 978-1-4051-6168-8. wiley.com
  • 9.Hastie, T., Tibshirani, R., Friedman, J. (2009). The Elements of Statistical Learning. Springer Series in Statistics. doi:10.1007/978-0-387-84858-7
  • 10.Ploton, P., Mortier, F., Réjou-Méchain, M. et al. (2020). Spatial validation reveals poor predictive performance of large-scale ecological mapping models. Nature Communications, 11(1), 4540. doi:10.1038/s41467-020-18321-y
  • 11.Varma, S., Simon, R. (2006). Bias in error estimation when using cross-validation for model selection. BMC Bioinformatics, 7(1), 91. doi:10.1186/1471-2105-7-91
  • 12.Roberts, D.R., Bahn, V., Ciuti, S. et al. (2017). Cross‐validation strategies for data with temporal, spatial, hierarchical, or phylogenetic structure. Ecography, 40(8), 913–929. doi:10.1111/ecog.02881
  • 13.Nash, J.E., Sutcliffe, J.V. (1970). River flow forecasting through conceptual models part I — A discussion of principles. Journal of Hydrology, 10(3), 282–290. doi:10.1016/0022-1694(70)90255-6
  • 14.Lin, L.I.K. (1989). A Concordance Correlation Coefficient to Evaluate Reproducibility. Biometrics, 45(1), 255. doi:10.2307/2532051
  • 15.Piñeiro, G., Perelman, S., Guerschman, J.P. et al. (2008). How to evaluate models: Observed vs. predicted or predicted vs. observed?. Ecological Modelling, 216(3–4), 316–322. doi:10.1016/j.ecolmodel.2008.05.006
  • 16.Coucheney, E., Buis, S., Launay, M. et al. (2015). Accuracy, robustness and behavior of the STICS soil–crop model for plant, water and nitrogen outputs: Evaluation over a wide range of agro-environmental conditions in France. Environmental Modelling & Software, 64, 177–190. doi:10.1016/j.envsoft.2014.11.024
  • 17.Powlson, D.S., Smith, P., Smith, J.U. (eds.) (1996). Evaluation of Soil Organic Matter Models Using Existing Long-Term Datasets. NATO ASI Series I: Global Environmental Change, vol. 38. Springer, Berlin. doi:10.1007/978-3-642-61094-3
  • 18.Smith, P., Smith, J.U., Powlson, D.S. et al. (1997). A comparison of the performance of nine soil organic matter models using datasets from seven long-term experiments. Geoderma, 81(1–2), 153–225. doi:10.1016/s0016-7061(97)00087-6
  • 19.Kennedy, M.C., O'Hagan, A. (2001). Bayesian Calibration of Computer Models. Journal of the Royal Statistical Society Series B: Statistical Methodology, 63(3), 425–464. doi:10.1111/1467-9868.00294
  • 20.IPCC (2019). 2019 Refinement to the 2006 IPCC Guidelines for National Greenhouse Gas Inventories. Volume 4 (AFOLU), Chapter 2. IPCC, Switzerland. ipcc.ch
  • 21.Verra (2024). VM0042 Methodology for Improved Agricultural Land Management, v2.2. Verified Carbon Standard. Verra, Washington DC. verra.org
  • 22.Verra (2025). VMD0053 Model Calibration, Validation and Uncertainty Guidance for Biogeochemical Modeling for Agricultural Land Management Projects, v2.1. VCS Module, 25 March 2025. Verra, Washington DC. verra.org

Share this article

LinkedInEmail