4 กันยายน 2026

เราสอบเทียบและตรวจสอบความสมเหตุสมผลของแบบจำลองอย่างไร คู่มือภาคสนาม จากคาร์บอนในดินถึงมวลชีวภาพของต้นไม้

ภาพรวม

คำว่าการสอบเทียบ (calibration) หมายถึงสี่สิ่งที่ต่างกัน และข้อถกเถียงส่วนใหญ่เรื่องแบบจำลองที่ผ่านการตรวจสอบความสมเหตุสมผลแล้ว คือคนสองคนที่ใช้ความหมายคนละแบบ บทความนี้แยกความหมายเหล่านั้นออกจากกัน แล้วเดินผ่านขั้นตอนการทำงานที่ทุกความหมายใช้ร่วมกัน ได้แก่ เหตุที่การปรับให้เข้ากับข้อมูลได้ดีแทบไม่พิสูจน์อะไรเลย สิ่งที่การแบ่งข้อมูลแต่ละระดับประมาณค่าได้จริง รูปแบบการตรวจสอบไขว้ที่คุณเลือกบรรจุข้ออ้างเกี่ยวกับงานทำนายไว้อย่างไร ตัวชี้วัดใดไร้ค่าเมื่ออยู่ลำพัง และต้องมีอะไรบ้างค่าความไม่แน่นอนที่ประกาศไว้จึงจะซื่อตรง พร้อมเครื่องมือเชิงโต้ตอบสามชิ้น ว่าด้วยการปรับพอดีเกิน รูปแบบการตรวจสอบความสมเหตุสมผล และชุดพารามิเตอร์จำนวนมากที่เข้ากับข้อมูลได้ดีพอ ๆ กัน

หัวข้อ

การสร้างแบบจำลอง // การตรวจสอบความสมเหตุสมผล // MRV // ความไม่แน่นอน

ผู้เขียน

Dr. Thomas Fungenzi

Share

LinkedInEmail

แบบจำลองให้ตัวเลขออกมาหนึ่งตัว จากนั้นต้องมีใครสักคนตัดสินว่าจะเชื่อตัวเลขนั้นหรือไม่ และคนคนนั้นมักไม่ใช่คนที่สร้างแบบจำลอง เขาอาจเป็นผู้ทวนสอบที่กำลังอ่านเอกสารโครงการ หัวหน้าฝ่ายความยั่งยืนที่กำลังตัดสินใจว่าจะใส่ตัวเลขนี้ลงในการเปิดเผยข้อมูลหรือไม่ หรือผู้ประเมินบทความที่ได้รับต้นฉบับมาพิจารณา ตัวเลขมาถึงพร้อมชื่อกำกับ เช่น RothC สมการของ Chave หรือ random forest และชื่อนั้นทำหน้าที่มากอย่างน่าประหลาดใจ ทั้งที่มันควรแทบไม่ต้องทำหน้าที่อะไรเลย

ไม่มีสิ่งใดในโครงสร้างของแบบจำลองที่ทำให้ผลลัพธ์ของมันน่าเชื่อถือ ความน่าเชื่อถือมาจากหลักฐานว่าแบบจำลองมีพฤติกรรมอย่างไรกับข้อมูลที่ไม่ได้ใช้สร้างมันขึ้นมา และหลักฐานนั้นมีอยู่ในเอกสารประกอบหรือไม่ก็ไม่มี ในทางปฏิบัติ บ่อยครั้งมันไม่มี เอกสารโครงการจะบรรยายแบบจำลองอย่างละเอียด ระบุชื่อพารามิเตอร์ อ้างอิงสิ่งตีพิมพ์ต้นฉบับ แต่กลับพูดถึงน้อยจนน่าแปลกใจว่ากันข้อมูลใดไว้ กันไว้อย่างไร และความคลาดเคลื่อนมีลักษณะอย่างไรเมื่อแบบจำลองพบกับข้อมูลนั้น

บทความนี้ว่าด้วยครึ่งที่ขาดหายไปนั้น มันอยู่ระหว่างบทความอีกสองชิ้นบนเว็บไซต์นี้ วิธี เลือกแบบจำลองคาร์บอนในดิน มาก่อน และวิธีรู้ว่า แบบจำลองที่ปรับพอดีแล้วนำไปใช้ที่ใดได้บ้าง มาทีหลัง บทความนี้คือตรงกลาง: เมื่อเลือกแบบจำลองได้แล้ว จะปรับให้เข้ากับข้อมูลอย่างไร จะทดสอบอย่างไร และต้องมีอะไรบ้างการทดสอบนั้นจึงจะมีความหมาย

คำตอบ ก่อนเหตุผล

การสอบเทียบคือสี่คำในคำเดียว

การสอบกลับได้ของเครื่องมือวัด การปรับแบบจำลองเชิงประจักษ์ให้เข้ากับข้อมูล การประมาณพารามิเตอร์ของแบบจำลองเชิงกระบวนการ และการสอบเทียบข้อความเชิงความน่าจะเป็น แต่ละความหมายมีเกณฑ์ความสำเร็จต่างกัน และล้มเหลวในรูปแบบที่ต่างกัน

เข้ากับข้อมูลได้ดีไม่ได้พิสูจน์อะไร

ความคลาดเคลื่อนในการฝึกลดลงเมื่อแบบจำลองยืดหยุ่นขึ้น อย่างไม่มีขีดจำกัดและไม่มีความหมาย มีเพียงความคลาดเคลื่อนบนข้อมูลที่กันไว้ไม่ให้ใช้ปรับแบบจำลองเท่านั้นที่บอกบางสิ่งเกี่ยวกับการทำนายครั้งถัดไป

รูปแบบการแบ่งข้อมูลคือข้ออ้าง

k-fold แบบสุ่ม การกันออกทีละพื้นที่ (leave-site-out) และการกันข้อมูลตามเวลา (temporal holdout) ตอบคำถามต่างกัน ความคลาดเคลื่อนจากการตรวจสอบไขว้ที่รายงานโดยไม่ระบุรูปแบบนั้นตีความไม่ได้ และรูปแบบเหล่านี้ก็เปรียบเทียบกันไม่ได้

ไม่มีตัวชี้วัดใดใช้ได้ลำพัง

ความเอนเอียง การกระจาย และทักษะการทำนายเทียบกับเกณฑ์อ้างอิง เป็นคำถามสามข้อที่แยกจากกัน และสหสัมพันธ์ไม่ได้ตอบข้อใดเลย แบบจำลองอาจมีสหสัมพันธ์กับค่าจริงอย่างสมบูรณ์ แต่ผิดไปครึ่งหนึ่ง

ความครอบคลุมตรวจสอบได้

ช่วงเก้าสิบเปอร์เซ็นต์จะครอบค่าจริงราวเก้าสิบเปอร์เซ็นต์ของครั้งบนข้อมูลที่กันไว้ หรือไม่ก็ไม่ครอบ นี่คือการวัด ไม่ใช่ข้ออ้าง และแทบไม่มีการรายงาน

ไม่มีสิ่งใดในนี้เป็นสถิติขั้นสูง มันคือวินัยธรรมดาของสาขานี้ที่นำมาใช้อย่างสม่ำเสมอ และระยะห่างส่วนใหญ่ระหว่างตัวเลขจากแบบจำลองที่ปกป้องได้กับที่ปกป้องไม่ได้ ถูกปิดลงเพียงแค่ได้ลงมือทำสิ่งนี้

หนึ่งคำ สี่หน้าที่

ลองนั่งฟังการประชุมหารือเรื่องการตรวจสอบความสมเหตุสมผลสักครั้ง แล้วนับว่ามีการใช้คำนี้ในกี่ความหมาย ผู้พัฒนาบอกว่าแบบจำลองถูกสอบเทียบกับการทดลองระยะยาวสิบสองแห่ง ผู้ทวนสอบถามว่าแบบจำลองผ่านการตรวจสอบความสมเหตุสมผล (validation) แล้วหรือยัง หัวหน้าฝ่ายการสำรวจระยะไกลเล่าว่าการสอบเทียบของเธอใช้สเปกตรัมสี่ร้อยตัวอย่าง โดยกันไว้หนึ่งร้อย นักสถิติที่เงียบมาตลอดถามว่าช่วงความไม่แน่นอนได้รับการสอบเทียบแล้วหรือไม่ สี่คน หนึ่งคำ และมีการดำเนินการที่ต่างกันอย่างน้อยสามแบบอยู่บนโต๊ะ

ไม่มีใครในนั้นใช้คำนี้ผิด การสอบเทียบมีความหมายที่ยอมรับกันอยู่สี่แบบในสาขาวิชาต่าง ๆ ที่มาบรรจบกันในโครงการคาร์บอน และความหมายเหล่านี้ไม่ใช่เฉดต่าง ๆ ของแนวคิดเดียว มันต่างกันที่สิ่งที่ถูกปรับ สิ่งที่นับว่าสำเร็จ และวิธีที่มันล้มเหลว การเลื่อนไหลไปมาระหว่างความหมายเหล่านี้คือเหตุที่คนทั้งห้องลงเอยด้วยการเห็นพ้องกันเรื่องคำ ขณะที่เห็นต่างกันในทุกเรื่องที่คำนั้นควรจะช่วยยุติ

ความหมายที่เก่าแก่ที่สุดมาจากมาตรวิทยา เครื่องมือวัดให้ค่าที่แสดง (indication) และการสอบเทียบเชื่อมโยงค่าที่แสดงนั้นกับค่าที่ได้จากมาตรฐานการวัด ซึ่งแต่ละค่ามีความไม่แน่นอนของตัวเอง จากนั้นแปลงความสัมพันธ์นั้นเป็นวิธีหาผลการวัดจากค่าที่อ่านได้1 เครื่องวิเคราะห์แบบเผาไหม้แห้ง (dry combustion) ถูกสอบเทียบกับวัสดุอ้างอิงรับรองที่ทราบปริมาณคาร์บอน รายละเอียดหนึ่งตรงนี้เป็นต้นเหตุของการพูดกันอย่างหละหลวมจำนวนมากในภายหลัง นั่นคือการสอบเทียบไม่ได้เปลี่ยนเครื่องมือวัด การตั้งระบบให้แสดงค่าตามที่กำหนดเป็นการดำเนินการอีกอย่างหนึ่งที่มีชื่อของตัวเอง คือการปรับตั้ง (adjustment) และศัพท์บัญญัติระบุชัดทั้งว่าไม่ควรสับสนสองอย่างนี้ และว่าการสอบเทียบเป็นเงื่อนไขที่ต้องมีก่อนการปรับตั้ง1 การสอบเทียบในความหมายนี้สร้างความรู้เกี่ยวกับเครื่องมือวัด ไม่ใช่เครื่องมือวัดที่ดีขึ้น

ความหมายที่สองคือการปรับแบบจำลองเชิงประจักษ์ให้เข้ากับข้อมูลทางสถิติ สมการอัลโลเมตริกที่เชื่อมเส้นผ่านศูนย์กลางกับมวลชีวภาพ หรือแบบจำลองสเปกตรัมที่เชื่อมค่าการสะท้อนแสงกับความเข้มข้นของคาร์บอน มีสัมประสิทธิ์ที่ประมาณจากข้อมูล ข้อมูลที่ใช้ประมาณคือชุดสอบเทียบ ส่วนที่กันไว้คือชุดตรวจสอบความสมเหตุสมผล ไม่มีสิ่งใดตรงนี้ถูกทำให้สอบกลับได้ไปยังมาตรฐาน สิ่งที่เกิดขึ้นคือการปรับรูปแบบฟังก์ชันให้เข้ากับข้อมูล และคำถามที่สำคัญคือมันมีพฤติกรรมอย่างไรกับข้อมูลที่ไม่เคยเห็น สเปกโทรสโกปีดินคือจุดที่สองความหมายแรกปะทะกันบ่อยที่สุด การทำนายสมบัติของดินจากสเปกตรัมการสะท้อนแบบกระจาย (diffuse reflectance) หมายถึงการปรับสมการถดถอยบนชุดสอบเทียบแล้วทดสอบกับตัวอย่างที่กันไว้2 คำนี้ในบริบทนั้นจึงหมายถึงสมการถดถอย ไม่ใช่การปรับตั้งเครื่องสเปกโตรมิเตอร์ แม้ว่าจะมีเครื่องสเปกโตรมิเตอร์อยู่ในห้องก็ตาม

ความหมายที่สามคือการประมาณพารามิเตอร์สำหรับแบบจำลองเชิงกระบวนการ ค่าคงที่อัตราการย่อยสลายของ RothC หรือพารามิเตอร์ที่เทียบเคียงกันใน Century และ DayCent ไม่ใช่ปริมาณที่ใครจะออกไปวัดได้ในฟาร์มใดฟาร์มหนึ่ง ค่าเหล่านี้ถูกอนุมานด้วยการรันแบบจำลองและปรับค่า จนกระทั่งแบบจำลองจำลองอนุกรมเวลาที่สังเกตได้ออกมาได้ ชุดพารามิเตอร์ที่เป็นตัวเลือกแต่ละชุดต้องรันแบบจำลองเต็มรอบอีกครั้งเพื่อดูว่าพลาดไปเท่าใด ซึ่งทำให้นี่เป็นปัญหาผกผัน (inverse problem) ไม่ใช่การปรับเส้นโค้ง3 ความต่างจากความหมายที่สองไม่ได้อยู่ที่เทคนิค แต่อยู่ที่พันธะ: พารามิเตอร์เหล่านี้ควรจะมีความหมายทางกายภาพ อัตราการย่อยสลายที่ถูกจูนไปที่ค่าใดก็ได้ที่ทำให้เศษเหลือต่ำที่สุด ได้เลิกเป็นอัตราการย่อยสลายไปแล้ว และกลายเป็นพารามิเตอร์อิสระที่สวมป้ายชื่อเชิงกลไก นี่ยังเป็นจุดที่ชุดพารามิเตอร์หลายชุดที่ต่างกันกลับจำลองค่าสังเกตเดียวกันได้ดีพอ ๆ กัน ซึ่งเป็นปัญหาที่มีชื่อ (equifinality) และวรรณกรรมของตัวเอง4

ความหมายที่สี่เกี่ยวกับข้อความเชิงความน่าจะเป็น ไม่ใช่การทำนาย การพยากรณ์ถือว่าสอบเทียบแล้วเมื่อเหตุการณ์ที่มันให้ความน่าจะเป็นเก้าสิบเปอร์เซ็นต์ เกิดขึ้นราวเก้าสิบเปอร์เซ็นต์ของครั้ง และช่วงการทำนายเก้าสิบเปอร์เซ็นต์ถือว่าสอบเทียบแล้ว เมื่อมันครอบค่าจริงราวเก้าสิบเปอร์เซ็นต์ของครั้ง นี่คือความหมายเดียวที่แบบจำลองอาจสอบเทียบได้อย่างไร้ที่ติแต่ไร้ประโยชน์โดยสิ้นเชิง ทำนายค่าเฉลี่ยระยะยาวทุกครั้ง แนบช่วงที่กว้างพอจะกลืนความแปรผันทั้งหมด แล้วความครอบคลุมจะยอดเยี่ยม ขณะที่การพยากรณ์ไม่ได้บอกอะไรใครเลย การสอบเทียบในความหมายนี้จำเป็น แต่ต้องตัดสินควบคู่กับความแคบของข้อความ ซึ่งวรรณกรรมด้านการพยากรณ์เรียกว่าความคม (sharpness)5

1 // การสอบเทียบเครื่องมือวัดมาตรวิทยา

สิ่งที่ถูกปรับ

ไม่มีสิ่งใดบนตัวเครื่องมือ แต่เป็นความสัมพันธ์ระหว่างค่าที่แสดงกับค่าอ้างอิงที่ทราบความไม่แน่นอน

ความสำเร็จคือ

ผลการวัดสอบกลับได้ไปยังมาตรฐาน พร้อมความไม่แน่นอนที่ระบุไว้

ล้มเหลวเมื่อ

ค่าเลื่อนไหล (drift) ระหว่างการสอบเทียบแต่ละครั้ง หรือห่วงโซ่การสอบกลับได้ที่ถูกสมมติเอา แทนที่จะมีเอกสารยืนยัน

2 // การปรับแบบจำลองเชิงประจักษ์สถิติ // เคมีมิติ

สิ่งที่ถูกปรับ

สัมประสิทธิ์ของรูปแบบฟังก์ชันที่เลือกไว้ ซึ่งประมาณจากชุดสอบเทียบ

ความสำเร็จคือ

ทักษะการทำนายบนข้อมูลที่กันไว้ไม่ให้ใช้ปรับแบบจำลอง

ล้มเหลวเมื่อ

การปรับพอดีเกิน (overfitting) และข้อมูลตรวจสอบที่ไม่เป็นอิสระจากข้อมูลสอบเทียบ

3 // การประมาณพารามิเตอร์ของแบบจำลองเชิงกระบวนการการสร้างแบบจำลองชีวธรณีเคมี

สิ่งที่ถูกปรับ

พารามิเตอร์ที่ควรมีความหมายทางกายภาพ ซึ่งอนุมานด้วยการผกผันเทียบกับอนุกรมเวลาที่สังเกตได้

ความสำเร็จคือ

แบบจำลองจำลองพื้นที่ที่ไม่ได้ใช้จูนได้ โดยพารามิเตอร์ยังคงสมเหตุสมผลทางกายภาพ

ล้มเหลวเมื่อ

ภาวะ equifinality และพารามิเตอร์ที่ถูกดัดจนเลยความสมเหตุสมผลทางกายภาพ เพื่อดูดซับความคลาดเคลื่อนเชิงโครงสร้าง

4 // การสอบเทียบความน่าจะเป็นการพยากรณ์

สิ่งที่ถูกปรับ

ความกว้างและรูปทรงของความไม่แน่นอนที่ระบุไว้ ไม่ใช่ค่าทำนายกลาง

ความสำเร็จคือ

ความครอบคลุมที่ได้จริงตรงกับความครอบคลุมตามที่ระบุ ที่ระดับความคมที่ใช้ประโยชน์ได้

ล้มเหลวเมื่อ

ช่วงกว้างมากจนความครอบคลุมผ่านเกณฑ์ แต่ข้อความว่างเปล่า

ผลที่ตามมาต่อโครงการคาร์บอนเจาะจงพอที่จะเฝ้าระวังได้ ผู้ทวนสอบถามว่าแบบจำลองผ่านการตรวจสอบความสมเหตุสมผลแล้วหรือยัง ผู้พัฒนาตอบว่าแบบจำลองถูกสอบเทียบกับการทดลองระยะยาวในพื้นที่ ซึ่งเป็นข้อความที่จริงและเกี่ยวข้องกับความหมายที่สาม ผู้ทวนสอบอาจกำลังถามถึงความหมายที่สอง คือการทดสอบกับข้อมูลที่กันไว้ หรือความหมายที่สี่ คือความไม่แน่นอนที่แนบกับตัวเลขสุดท้ายมีความครอบคลุมรองรับอยู่หรือไม่ สามคำถามที่สมเหตุสมผล หนึ่งคำตอบ และช่องว่างระหว่างทั้งสองไม่ปรากฏในบันทึกการประชุม

ใต้ข้อถกเถียงนี้มีข้อถกเถียงที่เก่ากว่าซ่อนอยู่ การพิสูจน์ความจริง (verification) เป็นเรื่องของระบบปิด: โครงสร้างที่เป็นทางการล้วน ๆ พิสูจน์ได้ด้วยการจัดการสัญลักษณ์ และอัลกอริทึมภายในโปรแกรมก็ตรวจสอบได้ด้วยวิธีเดียวกัน แบบจำลองที่สร้างจากองค์ประกอบเหล่านั้นไม่ได้เป็นระบบปิดในตัวเอง เพราะพารามิเตอร์ที่มันต้องใช้ไม่เคยเป็นที่รู้ครบถ้วน และข้ออ้างว่าแบบจำลองของระบบสิ่งแวดล้อมแบบเปิดผ่านการตรวจสอบความสมเหตุสมผลแล้ว ในความหมายสัมบูรณ์ใด ๆ ถูกโต้แย้งมาตั้งแต่กลางทศวรรษ 19906 ตำราที่เขียนสำหรับนักสร้างแบบจำลองก็ขีดเส้นเดียวกัน ด้วยเหตุผลเชิงปฏิบัติ เล่มหนึ่งถือว่าแบบจำลองเป็นสมมติฐานทางวิทยาศาสตร์ เมื่อคำถามคือกระบวนการในแบบจำลองมีพฤติกรรมเหมือนกระบวนการจริงหรือไม่ ซึ่งเป็นสมมติฐานที่พิสูจน์ได้ว่าไม่ถูกต้อง แต่ไม่มีวันยืนยันได้อย่างเด็ดขาดว่าถูกต้อง ตำราเล่มเดียวกันถือว่าแบบจำลองเดียวกันเป็นเครื่องมือทางวิศวกรรม เมื่อคำถามไม่ใช่ว่ามันทำงานอย่างไร แต่ทำงานได้ดีเพียงใด และเรียกสิ่งนั้นว่าการประเมิน (evaluation)7 อีกเล่มหนึ่งไม่ใช้คำว่า validation สำหรับขั้นที่สามของโครงการสร้างแบบจำลอง และเรียกขั้นนั้นว่าการประเมิน การเปรียบเทียบค่าทำนายกับค่าสังเกตเป็นเพียงหนึ่งในหลายสิ่ง ที่ทำให้แบบจำลองมีประโยชน์ตามวัตถุประสงค์ และคำว่า validation ชวนให้คิดว่ามีแบบจำลองที่ถูกต้องรอให้ค้นพบอยู่8 ไม่มีสิ่งใดในบทความนี้ที่ต้องเลือกข้างในข้อถกเถียงนั้น แต่บทความนี้ต้องการให้อ่านคำว่าการตรวจสอบความสมเหตุสมผล เป็นคำย่อของการทดสอบเฉพาะกับข้อมูลเฉพาะ ไม่ใช่ใบรับรอง

เข้ากับข้อมูลได้ดี เป็นเรื่องง่าย

เก็บต้นไม้สิบสองต้น วัดเส้นผ่านศูนย์กลาง เก็บตัวอย่างมวลชีวภาพแบบทำลาย (destructive sampling) แล้วปรับพหุนามให้เข้ากับข้อมูล ที่ดีกรีสอง เส้นโค้งผ่านใกล้จุดต่าง ๆ ที่ดีกรีสิบเอ็ด เส้นโค้งผ่านทุกจุดพอดี เศษเหลือเป็นศูนย์ สัมประสิทธิ์การตัดสินใจ (coefficient of determination) เท่ากับหนึ่ง และความพอดีนั้นสมบูรณ์แบบในความหมายเดียวที่คำนี้จะรับได้ภายในตัวอย่าง (in-sample) ระหว่างจุดต่าง ๆ เส้นโค้งแกว่งไปยังค่าที่เป็นไปไม่ได้ทางกายภาพ และต้นไม้ต้นที่สิบสามจะตกห่างจากเส้นโค้งไปมาก

นี่ไม่ใช่ความผิดปกติเฉพาะของพหุนาม แต่เป็นพฤติกรรมทั่วไปของแบบจำลองที่ยืดหยุ่น และเป็นเหตุที่สมรรถนะภายในตัวอย่างบอกข้อมูลได้น้อยมาก เมื่อแบบจำลองได้อิสระเพิ่มขึ้น ความคลาดเคลื่อนในการฝึกจะลดลงแบบทางเดียว (monotonically) โดยไม่มีพื้นต่ำสุดอื่นนอกจากศูนย์ และไม่มีจุดใดที่การลดลงนั้นบ่งชี้อะไร ความคลาดเคลื่อนบนข้อมูลที่กันไว้ไม่ให้ใช้ปรับแบบจำลองมีพฤติกรรมต่างออกไป: มันลดลงขณะที่ความยืดหยุ่นที่เพิ่มขึ้นกำลังได้โครงสร้างที่ใช้ได้ทั่วไปมา จากนั้นเลี้ยวกลับและไต่ขึ้นเมื่อความยืดหยุ่นเดียวกันเริ่มดูดซับสัญญาณรบกวน ที่เฉพาะกับตัวอย่างที่มีอยู่ในมือ9

กลไกนี้มีการแยกส่วนแบบมาตรฐาน ความคลาดเคลื่อนที่คาดหมาย ณ จุดใหม่แยกออกเป็นพจน์ความเอนเอียง คือแบบจำลองผิดไปเท่าใดโดยเฉลี่ย พจน์ความแปรปรวน คือแบบจำลองที่ปรับแล้วเคลื่อนไปเท่าใดเมื่อสุ่มตัวอย่างฝึกใหม่ และพจน์ที่ลดทอนไม่ได้ คือความแปรปรวนของค่าเป้าหมายรอบค่าเฉลี่ยที่แท้จริงของมันเอง ซึ่งการสร้างแบบจำลองมากเท่าใดก็ขจัดไม่ได้ ความยืดหยุ่นแลกพจน์แรกกับพจน์ที่สอง แบบจำลองที่แข็งทื่อเอนเอียงมากกว่าแต่นิ่งกว่า แบบจำลองที่ยืดหยุ่นเอนเอียงน้อยกว่าแต่แกว่งมากกว่า และจุดที่มีประโยชน์ไม่ได้อยู่ที่ปลายด้านใดด้านหนึ่ง9

ความคลาดเคลื่อนของการทำนายที่คาดหมาย ณ จุดใหม่
E[(y − ŷ)²] = Bias(ŷ)² + Var(ŷ) + σ²ลดทอนไม่ได้
y, ŷ
ค่าจริง ณ จุดใหม่ และค่าที่แบบจำลองทำนายสำหรับจุดนั้น
Bias(ŷ)²
แบบจำลองผิดไปเท่าใดโดยเฉลี่ย
Var(ŷ)
แบบจำลองที่ปรับแล้วเคลื่อนไปเท่าใดเมื่อสุ่มตัวอย่างฝึกใหม่
σ²
ความแปรปรวนของค่าเป้าหมายรอบค่าเฉลี่ยที่แท้จริงของมันเอง การสร้างแบบจำลองมากเท่าใดก็ขจัดไม่ได้

ผลพลอยได้ข้อหนึ่งควรกล่าวแยกไว้ต่างหาก เพราะมันยังคงอยู่ในเอกสารโครงการนานเกินกว่าที่ควรถูกปลดระวาง สัมประสิทธิ์การตัดสินใจภายในตัวอย่างไม่เคยลดลงเมื่อเพิ่มตัวทำนาย เพิ่มคอลัมน์ของตัวเลขสุ่มลงในสมการถดถอย แล้ว R² จะสูงขึ้น รูปแบบที่ปรับแก้ (adjusted) ลงโทษจำนวนพารามิเตอร์และแก้ปัญหาได้บางส่วน แต่ไม่มีสถิติภายในตัวอย่างใดตอบคำถามที่สำคัญ ซึ่งคือสิ่งที่จะเกิดขึ้นในพื้นที่ถัดไป ไม่ใช่ในพื้นที่นี้

ในสาขาของเราเอง กับดักนี้มีรูปร่างเฉพาะ สมการอัลโลเมตริกที่ปรับในท้องถิ่นจากต้นไม้ไม่กี่สิบต้นในสวนปลูกแห่งเดียว จะชนะสมการแพนทรอปิคัลที่ตีพิมพ์แล้วบนต้นไม้ชุดเดียวกันนั้นแทบทุกครั้ง การเปรียบเทียบนั้นไม่ใช่หลักฐานว่าสมการท้องถิ่นดีกว่า แต่กลับถูกนำเสนอเหมือนเป็นหลักฐานอยู่เป็นประจำ การเปรียบเทียบที่ซื่อตรงต้องกันต้นไม้ที่สมการท้องถิ่นไม่เคยเห็นไว้ ซึ่งเป็นการเปรียบเทียบที่ชุดข้อมูลแบบทำลายขนาดเล็กทำให้เจ็บปวด เพราะต้นไม้ทุกต้นที่กันไว้คือต้นไม้ที่ไม่ได้ใช้ปรับสมการ ความตึงเครียดนี้มีอยู่จริง การทำเป็นว่ามันไม่มีด้วยการรายงานทักษะภายในตัวอย่างไม่ใช่การแก้ปัญหา

ความล้มเหลวเดียวกันนี้ขยายขนาดไปถึงแผนที่ แบบจำลองนิเวศขนาดใหญ่ที่ตรวจสอบความสมเหตุสมผลด้วยการสุ่มกันพิกเซลไว้ เคยรายงานสมรรถนะการทำนายที่แข็งแกร่ง ซึ่งพังทลายลงเมื่อแยกข้อมูลที่กันไว้ออกจากข้อมูลฝึกในเชิงพื้นที่ เพราะพิกเซลที่อยู่ติดกันไม่ใช่ค่าสังเกตที่เป็นอิสระต่อกัน และการแบ่งแบบสุ่มก็ยื่นคำตอบให้แบบจำลองอย่างเงียบ ๆ10 ความล้มเหลวเฉพาะนั้นเป็นหัวข้อของบทความคู่กันและจะไม่กล่าวซ้ำที่นี่ สิ่งที่ควรอยู่ตรงนี้คือบทเรียนทั่วไปว่า การแบ่งข้อมูลคือสิ่งที่ทำงาน ไม่ใช่ตัวชี้วัดที่คำนวณตามหลังมัน

กายวิภาคของการตรวจสอบความสมเหตุสมผล

คำว่าการตรวจสอบความสมเหตุสมผลครอบคลุมลำดับชั้นที่ควรแยกออกมาดู เพราะแต่ละระดับประมาณสิ่งที่ต่างกัน และมักถูกยุบรวมเป็นระดับเดียว ในรูปแบบที่สะอาดที่สุด ข้อมูลมีบทบาทสามอย่าง และค่าสังเกตแต่ละค่าเล่นบทบาทเพียงหนึ่งเดียว

ชุดฝึก

ประมาณค่าพารามิเตอร์ ความคลาดเคลื่อนที่วัดตรงนี้บอกคุณว่าแบบจำลองจำลองข้อมูลที่เคยเห็นแล้วได้ ซึ่งไม่มีใครสงสัยอยู่แล้ว

ชุดตรวจสอบความสมเหตุสมผล

เลือกระหว่างตัวเลือก ได้แก่ รูปแบบฟังก์ชันใด จำนวนพจน์เท่าใด ไฮเปอร์พารามิเตอร์ใด ความคลาดเคลื่อนตรงนี้ชี้นำการเลือก และจะต่ำกว่าความจริงทันทีที่ถูกใช้เพื่อการนั้น

ชุดทดสอบ

ประมาณว่าแบบจำลองที่เลือกแล้วจะทำงานอย่างไรกับข้อมูลใหม่ มันไม่เอนเอียงก็ต่อเมื่อยังไม่ถูกแตะต้อง และใช้ได้เพียงครั้งเดียวเท่านั้น

ความแตกต่างระหว่างบทบาทที่สองและที่สามคือสิ่งที่มักหายไป สมมติว่าคุณลองโครงแบบแบบจำลองแปดแบบ ประเมินแต่ละแบบบนกลุ่มข้อมูลที่กันไว้กลุ่มเดียวกัน เลือกแบบที่ได้คะแนนดีที่สุด แล้วรายงานคะแนนนั้นเป็นสมรรถนะที่คาดหมายของแบบจำลอง ตัวเลขนั้นดีเกินจริง และดีเกินจริงด้วยเหตุผลที่ไม่เกี่ยวกับความไม่ซื่อสัตย์เลย: คุณเลือกค่าสูงสุดจากค่าประมาณที่มีสัญญาณรบกวนแปดค่า จึงเลือกทั้งจากทักษะที่แท้จริงส่วนหนึ่งและจากสัญญาณรบกวนที่เป็นคุณอีกส่วนหนึ่ง ยิ่งลองโครงแบบมากเท่าใด คะแนนที่รายงานก็ยิ่งเป็นสัญญาณรบกวนที่คุณออกไปตามหามามากเท่านั้น11

เมื่อข้อมูลน้อยเกินกว่าจะกันชุดทดสอบที่ไม่มีวันถูกแตะต้องไว้ได้ คำตอบที่ยอมรับกันคือการซ้อนขั้นตอน (nesting): วงในทำหน้าที่เลือก วงนอกเห็นเฉพาะแบบจำลองที่ถูกเลือกแล้ว ค่าประมาณจากวงนอกจึงไม่เคยถูกใช้เลือกสิ่งใด11 วิธีนี้มีต้นทุนด้านการคำนวณแต่ไม่มีต้นทุนด้านข้อมูลเลย ซึ่งทำให้การที่มันไม่ปรากฏในงานประยุกต์ส่วนใหญ่ยากจะแก้ต่างด้วยเหตุผลเชิงปฏิบัติ

ใต้ทั้งสามระดับมีคำหนึ่งที่รับน้ำหนักทั้งหมดไว้ และเลขคณิตตรวจสอบแทนคุณไม่ได้ ข้อมูลที่กันไว้ต้องเป็นอิสระ และความเป็นอิสระตรงนี้เป็นข้ออ้างเกี่ยวกับโลก ไม่ใช่เกี่ยวกับสเปรดชีต แกนดินสองแกนจากแปลงเดียวกันที่ห่างกันสิบเมตร คือสองแถวในตาราง และราวหนึ่งค่าสังเกตเกี่ยวกับดิน สองปีจากพื้นที่เดียวกันไม่ใช่การทดสอบที่เป็นอิสระสองครั้งสำหรับแบบจำลองเชิงเวลา การแบ่งตารางแบบสุ่มรับประกันว่าแถวถูกแยกออกจากกัน แต่ไม่ได้รับประกันอะไรเลยว่าสารสนเทศถูกแยกออกจากกันหรือไม่

ตระกูลการตรวจสอบไขว้ และสิ่งที่สมาชิกแต่ละตัวสมมติไว้

การกันชุดทดสอบไว้เพียงชุดเดียวสิ้นเปลืองข้อมูล และเมื่อมีค่าสังเกตเพียงไม่กี่ร้อยค่า ความสิ้นเปลืองนั้นเจ็บปวด การตรวจสอบไขว้ (cross-validation) กู้ข้อมูลส่วนใหญ่กลับมาด้วยการหมุนเวียนบทบาทของส่วนที่กันไว้: แบ่งข้อมูลออกเป็นส่วน ๆ ฝึกด้วยทุกส่วนยกเว้นหนึ่งส่วน ทดสอบกับส่วนที่เหลือ ทำซ้ำจนทุกส่วนได้เป็นส่วนที่กันไว้ครบ แล้วหาค่าเฉลี่ย แนวคิดนี้เก่า เรียบง่าย และแทบทุกครั้งถูกรายงานในรูปแบบที่ละรายละเอียดเพียงอย่างเดียวที่ผู้อ่านต้องการไว้

รายละเอียดนั้นคือวิธีแบ่งข้อมูล การตรวจสอบไขว้ไม่ใช่ขั้นตอนเดียวแต่เป็นตระกูล และสมาชิกต่างกันที่วิธีจัดค่าสังเกตเข้าแต่ละกลุ่ม (fold) การจัดนั้นไม่ใช่ความชอบทางเทคนิค แต่เป็นข้อความว่าแบบจำลองจะถูกขอให้ทำอะไร และแต่ละทางเลือกประมาณความคลาดเคลื่อนของงานที่ต่างกัน12

k-fold แบบสุ่ม

คำถามที่มันตอบ

แบบจำลองนี้ทำนายค่าสังเกตอีกค่าที่ดึงจากกลุ่มเดียวกันได้ดีเพียงใด?

เหมาะสมเมื่อ

ค่าสังเกตที่แลกเปลี่ยนกันได้อย่างแท้จริง ไม่มีการจัดกลุ่ม ไม่มีการกระจุกตัวเชิงพื้นที่ และไม่มีลำดับเวลา

ใช้ไม่ได้เมื่อ

ข้อมูลที่จับกลุ่มหรือมีสหสัมพันธ์อัตโนมัติ ซึ่งเพื่อนบ้านใกล้เคียงของกลุ่มที่ทดสอบอยู่ในชุดฝึกและรั่วคำตอบออกไป

กันออกทีละจุด (leave-one-out)

คำถามที่มันตอบ

คำถามเดียวกัน โดยแต่ละกลุ่มมีเพียงหนึ่งค่าสังเกต

เหมาะสมเมื่อ

ชุดข้อมูลขนาดเล็ก และแบบจำลองเชิงเส้นที่คำนวณได้ในรูปแบบปิด (closed form) แทนที่จะต้องปรับใหม่ n ครั้ง

ใช้ไม่ได้เมื่อ

ค่าประมาณของมันมีความแปรปรวนสูง และรับปัญหาการรั่วไหลทุกอย่างของ k-fold แบบสุ่มมาด้วย

กันออกทีละพื้นที่ (leave-site-out)

คำถามที่มันตอบ

แบบจำลองนี้ทำนายพื้นที่ที่ไม่ได้มีส่วนในการปรับแบบจำลองเลยได้ดีเพียงใด?

เหมาะสมเมื่อ

แบบจำลองใดก็ตามที่ตั้งใจนำไปใช้ในที่ที่ไม่ได้สอบเทียบไว้ ซึ่งครอบคลุมงานโครงการส่วนใหญ่

ใช้ไม่ได้เมื่อ

มองในแง่ร้ายเกินไปหากการใช้งานที่ตั้งใจไว้คือการประมาณค่าภายในพื้นที่ที่รู้จักจริง ๆ และต้องมีพื้นที่มากพอให้หาค่าเฉลี่ยได้

กันข้อมูลตามเวลา (temporal holdout)

คำถามที่มันตอบ

แบบจำลองนี้ทำนายไปข้างหน้าจากข้อมูลที่มีอยู่ได้ดีเพียงใด?

เหมาะสมเมื่อ

สิ่งใดก็ตามที่คาดการณ์เส้นทาง ซึ่งการฝึกด้วยอนาคตเพื่อทำนายอดีตจะไร้ความหมาย

ใช้ไม่ได้เมื่อ

ใช้ข้อมูลล่าสุดซึ่งมักเกี่ยวข้องที่สุดไปกับการทดสอบ และหน้าต่างการกันข้อมูลหนึ่งหน้าต่างคือค่าประมาณที่มีสัญญาณรบกวนเพียงหนึ่งค่า

นำชุดข้อมูลเดียวกันผ่านหลายรูปแบบเหล่านี้ แล้วความคลาดเคลื่อนที่รายงานจะเปลี่ยน บ่อยครั้งเปลี่ยนมาก การเปลี่ยนนั้นคือประเด็นหลัก ไม่ใช่สิ่งกวนใจ ความคลาดเคลื่อนจากการตรวจสอบไขว้เป็นข้อความแบบมีเงื่อนไข และเงื่อนไขคือวิธีแบ่งข้อมูล ตัวเลขสองตัวที่ได้ภายใต้รูปแบบต่างกันไม่ใช่ค่าประมาณสองค่าของปริมาณเดียว ดังนั้นการเปรียบเทียบตัวเลขทั้งสอง หรือการเทียบผลแบบกันออกทีละพื้นที่ของคุณกับผล k-fold แบบสุ่มที่ตีพิมพ์ไว้ จึงเป็นความผิดพลาดเชิงประเภท (category error) ที่แต่งตัวเป็นการเทียบมาตรฐาน เครื่องมือด้านล่างนำชุดข้อมูลหนึ่งชุดที่จับกลุ่มตามพื้นที่ผ่านสามรูปแบบ เพื่อให้เห็นขนาดของการเปลี่ยนแปลงแทนที่จะเพียงกล่าวอ้าง

กรณีเชิงพื้นที่มีโครงสร้างมากกว่าที่หัวข้อนี้ให้ไว้ เช่น กลุ่มข้อมูล (block) ต้องห่างกันเพียงใดจึงนับว่าเป็นอิสระ การแบ่งกลุ่มอาจเลยเถิดไปสู่การมองในแง่ร้ายเกินจริงได้อย่างไร และต้องทำอย่างไรเมื่อเป้าหมายการทำนายที่ตั้งใจไว้จับกลุ่มกันเอง เรื่องนั้นเป็นของ บทความว่าด้วยความเป็นตัวแทน ซึ่งเริ่มต้นตรงที่หัวข้อนี้หยุด

ตัวชี้วัดที่ใช้ได้เฉพาะเมื่ออยู่ร่วมกับตัวอื่น

เมื่อตกลงเรื่องการแบ่งข้อมูลได้แล้ว ก็ต้องคำนวณบางสิ่งข้ามการแบ่งนั้น และตรงนี้ความเคยชินคือรายงานตัวเลขเพียงตัวเดียว ไม่มีตัวเลขตัวเดียวที่อธิบายความคลาดเคลื่อนของแบบจำลองได้ เพราะความคลาดเคลื่อนมีคุณสมบัติที่เป็นอิสระต่อกันอย่างน้อยสามอย่าง ได้แก่ มันเอนไปทางใดหรือไม่ โดยทั่วไปมีขนาดใหญ่เพียงใด และแบบจำลองชนะทางเลือกพื้น ๆ ได้หรือไม่ ตัวชี้วัดหนึ่งตัวตอบได้ข้อเดียวและเงียบต่อข้ออื่น

ค่าคลาดเคลื่อนเฉลี่ย (mean error) คือค่าเฉลี่ยของเศษเหลือที่มีเครื่องหมาย ใช้วัดการเอน มันคือตัวที่สำคัญที่สุดสำหรับการบัญชีคาร์บอน เพราะการเหลื่อมเชิงระบบไม่ได้หดลงเมื่อโครงการใหญ่ขึ้น: ความเอนเอียงสะสมรวมกัน ขณะที่ความคลาดเคลื่อนแบบสุ่มหักล้างกันได้บางส่วน มันยังเป็นตัวชี้วัดที่ผ่านเกณฑ์ได้ง่ายที่สุดโดยบังเอิญ เพราะความคลาดเคลื่อนขนาดใหญ่ทั้งบวกและลบเฉลี่ยออกมาเป็นศูนย์ที่ดูสบายใจ

รากที่สองของค่าคลาดเคลื่อนกำลังสองเฉลี่ย (RMSE) วัดขนาดโดยทั่วไป ในหน่วยของปริมาณนั้น และให้น้ำหนักกับการพลาดครั้งใหญ่มาก เพราะยกกำลังสองก่อนหาค่าเฉลี่ย ค่าคลาดเคลื่อนสัมบูรณ์เฉลี่ย (MAE) ถามคำถามเดียวกันโดยไม่มีการถ่วงน้ำหนักนั้น การรายงานทั้งสองค่าให้ข้อมูล: เมื่อ RMSE สูงกว่า MAE มาก การแจกแจงของความคลาดเคลื่อนมีหาง และหางในชุดตรวจสอบความสมเหตุสมผลมักหมายถึงประชากรย่อยที่แบบจำลองจัดการได้ไม่ดี มากกว่าจะเป็นโชคร้าย

ทั้งสองค่าไม่ได้บอกว่าแบบจำลองควรค่าแก่การมีหรือไม่ เรื่องนั้นต้องมีเกณฑ์อ้างอิง ซึ่งประสิทธิภาพของแบบจำลอง (model efficiency) ให้ไว้: มันเปรียบเทียบความคลาดเคลื่อนกำลังสองของแบบจำลอง กับความคลาดเคลื่อนของการทำนายด้วยค่าเฉลี่ยของค่าสังเกตเพียงอย่างเดียว และรายงานสัดส่วนของความแปรปรวนเริ่มต้นนั้นที่แบบจำลองอธิบายได้13 ค่าหนึ่งคือสมบูรณ์แบบ ศูนย์บอกว่าค่าเฉลี่ยก็ทำได้ดีเท่ากัน และค่าติดลบบอกว่าค่าเฉลี่ยทำได้ดีกว่า ค่าติดลบปรากฏในงานตีพิมพ์ด้านดินและมวลชีวภาพบ่อยกว่าที่น้ำเสียงของข้อความรอบ ๆ มักยอมรับ นั่นเป็นความประทับใจจากการอ่าน ไม่ใช่ตัวเลขที่นับไว้

ประสิทธิภาพของแบบจำลอง เทียบกับค่าเฉลี่ยของค่าสังเกต
EF = 1 − Σ(oᵢ − pᵢ)² / Σ(oᵢ − ō)²
EF
ประสิทธิภาพของแบบจำลอง ค่าหนึ่งคือสมบูรณ์แบบ ศูนย์บอกว่าค่าเฉลี่ยก็ทำได้ดีเท่ากัน ค่าติดลบบอกว่าค่าเฉลี่ยทำได้ดีกว่า
oᵢ
ค่าที่สังเกตได้ของตัวอย่าง i
pᵢ
ค่าที่แบบจำลองทำนายสำหรับตัวอย่างเดียวกันนั้น
ō
ค่าเฉลี่ยของค่าที่สังเกตได้ ซึ่งคือเกณฑ์อ้างอิงแบบไม่มีแบบจำลอง

ตัวชี้วัดที่ควรระแวงมากที่สุดคือสัมประสิทธิ์สหสัมพันธ์และค่ากำลังสองของมัน สหสัมพันธ์วัดว่าอนุกรมสองชุดเคลื่อนไปด้วยกันหรือไม่ ไม่ใช่ว่าตรงกันหรือไม่ แบบจำลองที่ให้ค่ามวลชีวภาพเท่ากับครึ่งหนึ่งของค่าจริงพอดีในทุกต้น มีสหสัมพันธ์กับค่าจริงอย่างสมบูรณ์ R² เท่ากับหนึ่ง และผิดไปห้าสิบเปอร์เซ็นต์ในทุกจุด นี่ไม่ใช่กรณีที่ประดิษฐ์ขึ้น: ค่าทำนายที่ถูกย่อขยายอย่างเป็นระบบคือสิ่งที่แบบจำลองที่สอบเทียบผิดให้ออกมาพอดี และคือสิ่งที่ R² มองไม่เห็นพอดี สัมประสิทธิ์สหสัมพันธ์ความสอดคล้องของ Lin (Lin's concordance correlation coefficient) มีขึ้นด้วยเหตุนี้ มันให้รางวัลกับความสอดคล้องกับเส้นหนึ่งต่อหนึ่ง ไม่ใช่กับเส้นใดก็ได้ จึงลดลงเมื่อแบบจำลองมีความเอนเอียงแบบเป็นสัดส่วน แม้สหสัมพันธ์จะยังสมบูรณ์อยู่14

ซึ่งเหลือกราฟที่ทุกคนวาด และจำนวนมากอย่างน่าแปลกใจวาดผิด เมื่อพล็อตค่าสังเกตกับค่าทำนายเทียบกันแล้วปรับเส้น เพื่อทดสอบความชันเท่ากับหนึ่งและจุดตัดแกนเท่ากับศูนย์ การเลือกแกนไม่ใช่เรื่องของความสวยงาม การถดถอยค่าทำนายบนค่าสังเกต กับการถดถอยค่าสังเกตบนค่าทำนาย ให้ความชันต่างกัน และมีเพียงแบบเดียวที่ทดสอบสมมติฐานเกี่ยวกับสมรรถนะของแบบจำลองที่กราฟนั้นตั้งใจจะทดสอบ แบบแผนที่มีเหตุผลทางสถิติรองรับวางค่าสังเกตไว้บนแกนตั้งและค่าทำนายไว้บนแกนนอน เพราะค่าทำนายคือปริมาณที่กำลังถูกประเมิน และข้อสมมติของการถดถอยจึงตกอยู่ในที่ที่ควรเป็น15

การประเมินที่ครบถ้วนกว่านี้มีหน้าตาอย่างไรมีบันทึกไว้แล้ว เมื่อแบบจำลองดินและพืช STICS ถูกทดสอบด้วยชุดพารามิเตอร์มาตรฐานชุดเดียว กับพืชสิบห้าชนิดและดินกับภูมิอากาศที่หลากหลายของฝรั่งเศส การประเมินถูกแบ่งเป็นสามด้าน ความแม่นยำมาจาก RMSE, RMSE สัมพัทธ์ และประสิทธิภาพของแบบจำลอง ร่วมกับว่าความคลาดเคลื่อนส่วนใหญ่เป็นความเอนเอียงหรือการกระจาย ความทนทาน (robustness) ถามว่าขนาดของความคลาดเคลื่อนขึ้นกับพืชหรือสภาพแวดล้อมหรือไม่ พฤติกรรมถามว่าแบบจำลองจำลองความแตกต่างที่สังเกตได้ ระหว่างสภาพแวดล้อมและแนวปฏิบัติการจัดการที่ต่างกันชัดเจนได้หรือไม่16 ทั้งสามด้านตอบคำถามต่างกัน และส่วนการตรวจสอบความสมเหตุสมผลที่รายงานเพียงด้านแรกก็ตอบได้เพียงหนึ่งข้อ

การสอบเทียบแบบจำลองเชิงกระบวนการเป็นงานอีกแบบหนึ่ง

ทุกอย่างข้างต้นสมมติแบบจำลองที่พารามิเตอร์มีอิสระจะรับค่าใดก็ได้ที่เข้ากับข้อมูลดีที่สุด เพราะพารามิเตอร์ไม่มีความหมายใดเกินกว่าการเข้ากับข้อมูล แบบจำลองเชิงกระบวนการทำลายข้อสมมตินั้น อัตราการย่อยสลายของพูลใน RothC ค่าคงที่การหมุนเวียนใน Century และพารามิเตอร์ไนโตรเจนใน DayCent ถูกเขียนขึ้นเป็นปริมาณทางกายภาพ และข้ออ้างของแบบจำลองว่าคาดการณ์ได้เลยข้อมูลสอบเทียบของมัน ขึ้นอยู่กับการที่ค่าเหล่านี้เป็นปริมาณทางกายภาพทั้งหมด ข้ออ้างนั้นคือสิ่งที่ทำให้การจูนค่าเหล่านี้ต้องระมัดระวัง

เครื่องมือสำหรับงานนี้คือการทดลองระยะยาว บางแห่งดำเนินมานานกว่าหนึ่งศตวรรษ ซึ่งติดตามคาร์บอนในดินภายใต้การจัดการที่คงที่ ข้อมูลเหล่านี้เป็นข้อมูลเดียวที่จำกัดแบบจำลองระดับทศวรรษได้ในกรอบเวลาที่แบบจำลองอ้างว่าทำงาน ซึ่งหมายความด้วยว่าการทดลองเช่นนี้มีไม่มาก กระจายตัวไม่สม่ำเสมอในภูมิอากาศและดินของโลก และกลุ่มเดิมไม่กี่แห่งปรากฏซ้ำในการสอบเทียบครั้งแล้วครั้งเล่า การประชุมเชิงปฏิบัติการที่เริ่มทดสอบแบบจำลองอินทรียวัตถุในดิน กับชุดข้อมูลระยะยาวอย่างเป็นระบบให้เหตุผลไว้ว่า การเปลี่ยนแปลงของอินทรียวัตถุในดินเกิดขึ้นช้า จึงมีเพียงข้อมูลระยะยาวที่ทดสอบแบบจำลองของมันได้ ชุดข้อมูลของการประชุมนั้น ตามที่ระบุไว้เอง มาจากภายในเขตอบอุ่น17 แบบจำลองที่จูนบนการทดลองพืชไร่เขตอบอุ่น แล้วนำไปใช้กับวนเกษตรเขตร้อน ได้ถูกสอบเทียบกับเครื่องมือที่ไม่เคยวัดสิ่งใดที่คล้ายกับเป้าหมายเลย18

ในทางปฏิบัติมีแนวทางเรียงเป็นช่วง ที่ปลายด้านหนึ่ง นักสร้างแบบจำลองปรับพารามิเตอร์ด้วยมือจนเส้นโค้งจำลองกับเส้นโค้งสังเกตดูใกล้กัน ซึ่งรวดเร็ว ไม่มีการบันทึก และทำซ้ำไม่ได้ ตรงกลาง ตัวหาค่าเหมาะที่สุด (optimiser) ลดฟังก์ชันสูญเสีย (loss function) ให้ต่ำสุด ซึ่งทำซ้ำได้และคืนชุดที่ดีที่สุดเพียงชุดเดียว โดยไม่บอกว่ามันดีกว่าทางเลือกอื่นมากเพียงใด ที่ปลายอีกด้าน การสอบเทียบแบบเบย์ (Bayesian calibration) ถือว่าพารามิเตอร์เป็นตัวแปรสุ่ม รวมการแจกแจงก่อน (prior) เข้ากับฟังก์ชันภาวะน่าจะเป็น (likelihood) ของค่าสังเกต และคืนการแจกแจงภายหลัง (posterior) ออกมา: ไม่ใช่คำตอบเดียว แต่เป็นคำบรรยายของทุกคำตอบที่ข้อมูลยอมรับได้ พร้อมความไม่แน่นอนของมันเอง19

กรอบคิดนั้นยังเปิดที่ให้กับสิ่งที่อีกสองแนวทางเพิกเฉย แบบจำลองจริงผิดในเชิงโครงสร้าง และความคลาดเคลื่อนเชิงโครงสร้างไม่ได้มีพฤติกรรมเหมือนสัญญาณรบกวนจากการวัด การสอบเทียบคืนค่าที่เข้ากับข้อมูลได้ดีที่สุด ไม่ใช่ค่าทางกายภาพ และอัตราการย่อยสลายอาจลงเอยที่ค่าใดก็ได้ที่ชดเชยกระบวนการซึ่งแบบจำลองไม่ได้แทนไว้ มันยังเข้ากับข้อมูลได้ดี แต่มันไม่ใช่อัตราการย่อยสลายอีกต่อไป และการคาดการณ์ที่พึ่งพาความหมายทางกายภาพของมัน กำลังพึ่งพาสิ่งที่เลิกเป็นปริมาณทางกายภาพไปแล้วอย่างเงียบ ๆ19

อีกเหตุผลที่ควรเลือกการแจกแจงมากกว่าค่าที่เข้ากับข้อมูลดีที่สุด คือค่าที่ดีที่สุดนั้นมักไม่ได้ดีกว่าทางเลือกที่แตกต่างกันมากจำนวนมหาศาลสักเท่าใด ชุดพารามิเตอร์จำนวนมากจำลองเส้นทางคาร์บอนที่สังเกตได้ได้ดีพอ ๆ กัน และไม่ได้เห็นตรงกันเกี่ยวกับอนาคต เพราะการเข้ากับอดีตเดียวกันเป็นข้อจำกัดที่อ่อนกว่าที่เห็นมาก การตอบสนองที่ถูกต้องไม่ใช่การเลือกผู้ชนะแล้วรายงานการคาดการณ์ของมัน แต่คือการนำชุดที่ยอมรับได้ทั้งหมดไปข้างหน้าและปล่อยให้มันสร้างช่วงออกมา4 เครื่องมือด้านล่างแสดงให้เห็นเรื่องนี้บนแบบจำลองของเล่นหนึ่งพูลที่มีตัวแปรไม่ทราบค่าสองตัว: บริเวณของปริภูมิพารามิเตอร์ที่สอดคล้องกับข้อมูลนั้นกว้าง แคบลงเมื่อมีข้อมูลเพิ่ม และไม่เคยยุบลงเป็นจุดเดียว

ยังมีปฏิสัมพันธ์อีกอย่างหนึ่งที่มองข้ามได้ง่าย จุดเริ่มต้นของแบบจำลองเชิงกระบวนการก็เป็นการตัดสินใจด้านการสอบเทียบในตัวเอง การแบ่งปริมาณสะสมเริ่มต้นไปยังพูลเร็ว พูลช้า และพูลเฉื่อย แทบไม่เคยวัดได้ มักใช้การประมาณ และเปลี่ยนการคาดการณ์ระยะสามสิบปีอย่างมีสาระสำคัญ การสอบเทียบพารามิเตอร์กับเส้นทางที่จุดเริ่มต้นเองก็ถูกสมมติไว้ หมายถึงการปรับตัวไม่ทราบค่าสองตัวให้เข้ากับเส้นโค้งเส้นเดียว ปัญหานั้น และกระบวนการ spin-up ซึ่งเป็นคำตอบที่ปกป้องได้ ได้อธิบายไว้อย่างละเอียดใน บทความว่าด้วยการเลือกแบบจำลองคาร์บอนในดิน

ข้อความเรื่องความไม่แน่นอนคือการทำนาย และทดสอบได้

กลับไปที่ความหมายที่สี่ของการสอบเทียบ ซึ่งเป็นจุดที่ความไม่แน่นอนของแบบจำลองที่รายงานกันส่วนใหญ่ล้มเหลวอย่างเงียบ ๆ โครงการระบุค่าประมาณของตนเป็นค่ากลางพร้อมช่วงเก้าสิบเปอร์เซ็นต์ ช่วงนั้นไม่ใช่ข้อแม้หรือท่าทีแสดงความถ่อมตน มันคือข้ออ้างที่พิสูจน์ได้ว่าผิด: เมื่อพิจารณาข้อความลักษณะนี้จำนวนมาก ค่าจริงควรตกอยู่ภายในราวเก้าสิบเปอร์เซ็นต์ของข้อความเหล่านั้น สัดส่วนที่ตกอยู่ภายในจริงคือความครอบคลุมที่ได้จริง (achieved coverage) และการเทียบค่านี้กับค่าเก้าสิบตามที่ระบุไว้เป็นการวัดธรรมดาที่แทบไม่มีใครทำ

เมื่อมีการทำ ช่วงมักแคบเกินไป สาเหตุสามอย่างอธิบายได้เกือบทั้งหมด ความไม่แน่นอนของพารามิเตอร์ถูกตัดทิ้ง ช่วงจึงสะท้อนการกระจายของเศษเหลือรอบแบบจำลองที่ปรับแล้วแบบเดียว แทนที่จะสะท้อนความไม่แน่นอนว่าแบบจำลองใดถูก ความคลาดเคลื่อนเชิงโครงสร้างถูกเพิกเฉย เพราะไม่มีพจน์ใดในเลขคณิตที่แทนความเป็นไปได้ว่ารูปแบบของแบบจำลองผิด และค่าสังเกตที่มีสหสัมพันธ์กันถูกนับเป็นค่าที่เป็นอิสระ ซึ่งทำให้ขนาดตัวอย่างประสิทธิผลพองตัวขึ้นและทำให้ทุกช่วงที่คำนวณจากมันหดลง กลไกนี้อธิบายไว้อย่างละเอียดใน บทความว่าด้วยความเป็นตัวแทน

การแก้ไขไม่ใช่การขยายช่วงจนครอบคลุม ซึ่งเป็นรูปแบบความล้มเหลวจากอีกทิศทางหนึ่ง และให้ข้อความที่คลุมเครือเกินกว่าจะนำไปใช้ตัดสินใจได้ ความครอบคลุมและความคมเป็นคนละแกนกัน และเป้าหมายคือช่วงที่แคบที่สุดที่ยังครอบคลุมได้ตามอัตราที่ระบุไว้5 สิ่งที่ทำให้เรื่องนี้ทำได้จริงในทางปฏิบัติ คือทั้งสองอย่างวัดได้บนข้อมูลที่กันไว้ โดยใช้การแบ่งข้อมูลชุดเดียวกับที่สร้างไว้แล้วเพื่อประเมินค่าทำนายกลาง การตรวจสอบความสมเหตุสมผลที่รายงานความครอบคลุมที่ได้จริงคู่กับ RMSE ได้ตอบคำถามที่ผู้ทวนสอบมีสิทธิ์ถาม และมักไม่รู้ว่าจะตั้งคำถามอย่างไร

มาตรฐานกำหนดอะไรไว้จริง

มีสองคำถามที่ผุดขึ้นทุกครั้งที่เนื้อหานี้พบกับโครงการจริง มีใครกำหนดเรื่องนี้ไว้หรือไม่ และมีใครตรวจหรือไม่ คำตอบสั้น ๆ คือ การบัญชีที่อิงแบบจำลองมีข้อกำหนดด้านการตรวจสอบความสมเหตุสมผลจริง ข้อกำหนดเหล่านั้นเจาะจงน้อยกว่าการอภิปรายทางสถิติข้างต้น และช่องว่างระหว่างสิ่งที่มาตรฐานกำหนดกับสิ่งที่ทำให้ตัวเลขปกป้องได้ คือที่ที่วิจารณญาณทางวิชาชีพส่วนใหญ่อยู่

กรอบของ IPCC เป็นผู้วางศัพท์ Tier 3 คือระดับที่บัญชีรายการใช้แบบจำลองหรือการวัดโดยตรงแทนค่าสัมประสิทธิ์การปล่อยตั้งต้น และข้อกำหนดที่ผูกกับรูปแบบที่อิงแบบจำลองถูกระบุไว้อย่างตรงไปตรงมา: บัญชีรายการ Tier 3 ที่อิงแบบจำลองต้องมีการวัด เพื่อสอบเทียบและตรวจสอบความสมเหตุสมผลของแบบจำลอง ที่ใช้ประมาณการเปลี่ยนแปลงของปริมาณคาร์บอนสะสม20 ทั้งสองครึ่งของบทความนี้อยู่ในประโยคนั้น เชื่อมกันด้วยคำว่า “และ” แทนที่จะถูกถือเป็นสิ่งเดียวกัน การวัดเพื่อสอบเทียบ และการวัดเพื่อตรวจสอบความสมเหตุสมผล บัญชีรายการหนึ่ง ๆ จะแยกสองอย่างนี้ออกจากกันหรือไม่ ไม่ใช่สิ่งที่ประโยคนั้นบังคับได้

ในตลาดภาคสมัครใจ ข้อกำหนดชัดเจนกว่า ระเบียบวิธีของ Verra สำหรับการจัดการที่ดินเกษตรที่ปรับปรุงแล้ว อนุญาตให้ใช้แบบจำลองชีวธรณีเคมีจำลองการเปลี่ยนแปลงคาร์บอนในดิน และผูกกลไกไว้กับมัน ได้แก่ รายงานการตรวจสอบความสมเหตุสมผลของแบบจำลองที่ประเมินโดยผู้เชี่ยวชาญด้านการสร้างแบบจำลองอิสระ และยื่นใหม่เมื่อแคมเปญการวัดครั้งต่อ ๆ มาขยายชุดข้อมูลสอบเทียบและตรวจสอบความสมเหตุสมผล กับการหักลดความไม่แน่นอนที่ใช้กับปริมาณการลดการปล่อยที่ออกให้21 โมดูลแยกต่างหากบรรจุข้อกำหนดด้านการสอบเทียบ และการตรวจสอบความสมเหตุสมผลไว้เอง22 การหักลดคือส่วนที่ควรกล่าวถึง เพราะหลักการออกแบบนั้นดี มันปรับขนาดตามค่าคลาดเคลื่อนมาตรฐานสัมพัทธ์ของค่าประมาณ ความไม่แน่นอนจึงไม่เพียงถูกเปิดเผย แต่ถูกตีราคา และโครงการที่แสดงไม่ได้ว่าแบบจำลองถูกจำกัดไว้อย่างดี จะออกเครดิตได้น้อยลงสำหรับคาร์บอนที่วัดได้ปริมาณเท่าเดิม

ในเรื่องการแบ่งข้อมูลเอง โมดูลนี้เจาะจงกว่าที่ผู้ปฏิบัติงานส่วนใหญ่คาด และเข้มงวดกว่าด้วย มันกำหนดให้ข้อมูลสอบเทียบและข้อมูลตรวจสอบความสมเหตุสมผลต้องเป็นอิสระต่อกันอย่างแสดงให้เห็นได้ และระบุว่านั่นหมายถึงอะไร: ชุดข้อมูลต้องไม่ทับซ้อนกันในด้านสถานที่วิจัยเชิงทดลอง และต้องไม่มาจากการศึกษาทดลองเดียวกัน22 การแบ่งชุดข้อมูลรวมชุดเดียวทำได้ และ k-fold ถูกระบุชื่อเป็นวิธีหนึ่งในการทำ แต่เงื่อนไขความเป็นอิสระยังคงผูกพันอยู่ กลุ่ม (fold) จึงต้องเคารพการศึกษาและสถานที่ แทนที่จะสุ่มดึงข้ามแถว ในสาระแล้วนี่ใกล้เคียงกับการกันออกทีละพื้นที่ มากกว่าการกันข้อมูลแบบสุ่มที่คนส่วนใหญ่นึกภาพไว้มาก และทีมที่พอใจกับ k-fold แบบสุ่มบนแปลงที่จับกลุ่มกัน ยังไม่ผ่านข้อกำหนดนี้ ไม่ว่าตัวเลขที่ได้จะดูดีเพียงใด ผู้ทวนสอบอ่านข้ออ้างที่ได้อย่างไรเป็นหัวข้อของ บทความคู่กัน

สิ่งที่ควรถามต่อตัวเลขใดก็ตามที่ได้จากแบบจำลอง

ไม่มีคำถามใดต่อไปนี้ที่ผู้ถามต้องเป็นนักสร้างแบบจำลอง มันคือคำถามที่แยกตัวเลขที่มีหลักฐานรองรับออกจากตัวเลขที่มีเพียงการอ้างอิงรองรับ และถามได้ในที่ประชุม

สิบคำถาม

  1. 1เมื่อคุณบอกว่าแบบจำลองถูกสอบเทียบแล้ว คุณหมายถึงความหมายใดในสี่ความหมาย?
  2. 2ข้อมูลใดถูกกันไว้ไม่ให้ใช้ปรับแบบจำลอง และเลือกมาอย่างไร?
  3. 3ข้อมูลที่กันไว้นั้นเป็นอิสระในลักษณะใด: ต่างพื้นที่ ต่างปี หรือต่างภูมิภาค?
  4. 4มีการประเมินโครงแบบของแบบจำลองกี่แบบก่อนที่จะรายงานแบบนี้?
  5. 5ข้อมูลที่ใช้เลือกแบบจำลองเป็นข้อมูลชุดเดียวกับที่ใช้รายงานสมรรถนะของมันหรือไม่?
  6. 6ความเอนเอียงมีค่าเท่าใด แยกจาก RMSE ในหน่วยของปริมาณนั้น?
  7. 7ทักษะวัดเทียบกับเกณฑ์อ้างอิงใด และแบบจำลองชนะการทำนายด้วยค่าเฉลี่ยหรือไม่?
  8. 8บนกราฟค่าสังเกตเทียบกับค่าทำนาย ความชันและจุดตัดแกนมีค่าเท่าใด?
  9. 9ความไม่แน่นอนที่ระบุไว้ถูกตรวจสอบความครอบคลุมแล้วหรือไม่ และค่าสังเกตที่กันไว้ตกอยู่ภายในช่วงนั้นในสัดส่วนเท่าใด?
  10. 10เงื่อนไขที่จะนำแบบจำลองไปใช้อยู่ภายในพิสัยที่ใช้สอบเทียบหรือไม่?

ทีมที่ตอบได้ครบทั้งสิบข้อได้ทำงานนั้นแล้ว ทีมที่มองว่าหลายข้อในนี้ไม่สมเหตุสมผล ก็ได้บอกบางสิ่งที่มีประโยชน์กับคุณเช่นกัน

เหตุผลที่ต้องถามไม่ใช่ความระแวง ตัวเลขจากแบบจำลองส่วนใหญ่ในสาขานี้ผลิตโดยคนที่ทำดีที่สุดแล้ว ด้วยชุดข้อมูลขนาดเล็กและกำหนดส่งงานที่มีอยู่จริง และช่องว่างมักเป็นแบบแผนที่สืบทอดกันมามากกว่าการลัดขั้นตอน แต่ตัวเลขที่เข้าไปอยู่ในการเปิดเผยข้อมูล การออกเครดิต หรือเอกสารนโยบาย ได้ออกจากมือของนักสร้างแบบจำลองไปแล้ว และ ณ จุดนั้น สิ่งเดียวที่ขวางกั้นระหว่างตัวเลขนั้นกับการตัดสินใจ คือมีใครถามหรือไม่ว่ามันถูกทดสอบกับอะไร

ประเด็นสำคัญ

  1. คำว่าการสอบเทียบหมายถึงการดำเนินการที่ต่างกันสี่แบบ ได้แก่ การทำให้เครื่องมือวัดสอบกลับได้ การปรับแบบจำลองเชิงประจักษ์ให้เข้ากับข้อมูล การประมาณพารามิเตอร์ของแบบจำลองเชิงกระบวนการ และการสอบเทียบข้อความเชิงความน่าจะเป็น แต่ละแบบล้มเหลวต่างกัน และข้อพิพาทส่วนใหญ่เรื่องแบบจำลองที่ผ่านการตรวจสอบความสมเหตุสมผลแล้ว คือความไม่ตรงกันระหว่างสองในสี่แบบนี้

  2. ความคลาดเคลื่อนในการฝึกลดลงอย่างไม่มีขีดจำกัดเมื่อแบบจำลองยืดหยุ่นขึ้น และไม่ให้ข้อมูลใดเกี่ยวกับการทำนายครั้งถัดไป มีเพียงความคลาดเคลื่อนบนข้อมูลที่กันไว้ไม่ให้ใช้ปรับแบบจำลองเท่านั้นที่ให้ข้อมูลนั้น

  3. สัมประสิทธิ์การตัดสินใจภายในตัวอย่างไม่เคยลดลงเมื่อเพิ่มตัวทำนาย รวมถึงตัวทำนายที่เป็นตัวเลขสุ่ม สมการอัลโลเมตริกที่ปรับในท้องถิ่นชนะสมการระดับโลกบนต้นไม้ที่ใช้สอบเทียบตัวเอง ไม่ใช่หลักฐานของสิ่งใด

  4. ข้อมูลที่ใช้เลือกแบบจำลองไม่สามารถใช้วัดสมรรถนะของมันด้วย การเลือกโครงแบบที่ดีที่สุดจากหลายแบบบนข้อมูลที่กันไว้ชุดเดียว หมายความว่าคะแนนที่รายงานส่วนหนึ่งคือสัญญาณรบกวนที่คุณเลือกมา การซ้อนขั้นตอนแก้ปัญหานี้ได้โดยไม่มีต้นทุนด้านข้อมูล

  5. รูปแบบการตรวจสอบไขว้คือข้ออ้างเกี่ยวกับงานทำนาย k-fold แบบสุ่ม การกันออกทีละพื้นที่ และการกันข้อมูลตามเวลา ตอบคำถามต่างกันและเปรียบเทียบกันไม่ได้ ความคลาดเคลื่อนที่รายงานโดยไม่ระบุวิธีแบ่งข้อมูลจึงตีความไม่ได้

  6. ไม่มีตัวชี้วัดใดใช้ได้ลำพัง ความเอนเอียง การกระจาย และทักษะเทียบกับเกณฑ์อ้างอิง เป็นคุณสมบัติที่แยกจากกัน และสหสัมพันธ์ไม่ได้วัดสิ่งใดในนั้นเลย: แบบจำลองที่ให้ค่าครึ่งหนึ่งของค่าจริงทุกค่าพอดี มีสหสัมพันธ์กับค่าจริงอย่างสมบูรณ์

  7. สำหรับแบบจำลองเชิงกระบวนการ ชุดพารามิเตอร์จำนวนมากเข้ากับเส้นทางเดียวกันได้ดีพอ ๆ กัน และเห็นต่างกันเกี่ยวกับอนาคต การนำชุดที่ยอมรับได้ไปข้างหน้าปกป้องได้มากกว่าการรายงานการคาดการณ์จากค่าที่เข้ากับข้อมูลดีที่สุดเพียงชุดเดียว

  8. ความไม่แน่นอนที่ระบุไว้คือการทำนายที่ทดสอบได้ ความครอบคลุมที่ได้จริงบนข้อมูลที่กันไว้จะตรงกับอัตราตามที่ระบุหรือไม่ก็ไม่ตรง มันวัดได้ด้วยการแบ่งข้อมูลที่สร้างไว้แล้วสำหรับค่าประมาณกลาง และแทบไม่เคยถูกรายงาน

เอกสารอ้างอิง

  • 1.JCGM (Joint Committee for Guides in Metrology) (2012). International vocabulary of metrology: Basic and general concepts and associated terms (VIM), 3rd edition. JCGM 200:2012. Bureau International des Poids et Mesures. bipm.org
  • 2.Viscarra Rossel, R.A., Walvoort, D.J.J., McBratney, A.B. et al. (2006). Visible, near infrared, mid infrared or combined diffuse reflectance spectroscopy for simultaneous assessment of various soil properties. Geoderma, 131(1–2), 59–75. doi:10.1016/j.geoderma.2005.03.007
  • 3.Haefner, J.W. (2005). Modeling Biological Systems: Principles and Applications, 2nd edition. Springer, New York. doi:10.1007/b106568
  • 4.Beven, K., Freer, J. (2001). Equifinality, data assimilation, and uncertainty estimation in mechanistic modelling of complex environmental systems using the GLUE methodology. Journal of Hydrology, 249(1–4), 11–29. doi:10.1016/s0022-1694(01)00421-8
  • 5.Gneiting, T., Balabdaoui, F., Raftery, A.E. (2007). Probabilistic Forecasts, Calibration and Sharpness. Journal of the Royal Statistical Society Series B: Statistical Methodology, 69(2), 243–268. doi:10.1111/j.1467-9868.2007.00587.x
  • 6.Oreskes, N., Shrader-Frechette, K., Belitz, K. (1994). Verification, Validation, and Confirmation of Numerical Models in the Earth Sciences. Science, 263(5147), 641–646. doi:10.1126/science.263.5147.641
  • 7.Wallach, D., Makowski, D., Jones, J.W. et al. (2019). Model evaluation. In: Working with Dynamic Crop Models: Methods, Tools and Examples for Agriculture and Environment, 3rd edition, pp. 311–373. Academic Press. doi:10.1016/B978-0-12-811756-9.00009-5
  • 8.Grant, W.E., Swannack, T.M. (2008). Ecological Modeling: A Common-Sense Approach to Theory and Practice. Blackwell Publishing. ISBN 978-1-4051-6168-8. wiley.com
  • 9.Hastie, T., Tibshirani, R., Friedman, J. (2009). The Elements of Statistical Learning. Springer Series in Statistics. doi:10.1007/978-0-387-84858-7
  • 10.Ploton, P., Mortier, F., Réjou-Méchain, M. et al. (2020). Spatial validation reveals poor predictive performance of large-scale ecological mapping models. Nature Communications, 11(1), 4540. doi:10.1038/s41467-020-18321-y
  • 11.Varma, S., Simon, R. (2006). Bias in error estimation when using cross-validation for model selection. BMC Bioinformatics, 7(1), 91. doi:10.1186/1471-2105-7-91
  • 12.Roberts, D.R., Bahn, V., Ciuti, S. et al. (2017). Cross‐validation strategies for data with temporal, spatial, hierarchical, or phylogenetic structure. Ecography, 40(8), 913–929. doi:10.1111/ecog.02881
  • 13.Nash, J.E., Sutcliffe, J.V. (1970). River flow forecasting through conceptual models part I — A discussion of principles. Journal of Hydrology, 10(3), 282–290. doi:10.1016/0022-1694(70)90255-6
  • 14.Lin, L.I.K. (1989). A Concordance Correlation Coefficient to Evaluate Reproducibility. Biometrics, 45(1), 255. doi:10.2307/2532051
  • 15.Piñeiro, G., Perelman, S., Guerschman, J.P. et al. (2008). How to evaluate models: Observed vs. predicted or predicted vs. observed?. Ecological Modelling, 216(3–4), 316–322. doi:10.1016/j.ecolmodel.2008.05.006
  • 16.Coucheney, E., Buis, S., Launay, M. et al. (2015). Accuracy, robustness and behavior of the STICS soil–crop model for plant, water and nitrogen outputs: Evaluation over a wide range of agro-environmental conditions in France. Environmental Modelling & Software, 64, 177–190. doi:10.1016/j.envsoft.2014.11.024
  • 17.Powlson, D.S., Smith, P., Smith, J.U. (eds.) (1996). Evaluation of Soil Organic Matter Models Using Existing Long-Term Datasets. NATO ASI Series I: Global Environmental Change, vol. 38. Springer, Berlin. doi:10.1007/978-3-642-61094-3
  • 18.Smith, P., Smith, J.U., Powlson, D.S. et al. (1997). A comparison of the performance of nine soil organic matter models using datasets from seven long-term experiments. Geoderma, 81(1–2), 153–225. doi:10.1016/s0016-7061(97)00087-6
  • 19.Kennedy, M.C., O'Hagan, A. (2001). Bayesian Calibration of Computer Models. Journal of the Royal Statistical Society Series B: Statistical Methodology, 63(3), 425–464. doi:10.1111/1467-9868.00294
  • 20.IPCC (2019). 2019 Refinement to the 2006 IPCC Guidelines for National Greenhouse Gas Inventories. Volume 4 (AFOLU), Chapter 2. IPCC, Switzerland. ipcc.ch
  • 21.Verra (2024). VM0042 Methodology for Improved Agricultural Land Management, v2.2. Verified Carbon Standard. Verra, Washington DC. verra.org
  • 22.Verra (2025). VMD0053 Model Calibration, Validation and Uncertainty Guidance for Biogeochemical Modeling for Agricultural Land Management Projects, v2.1. VCS Module, 25 March 2025. Verra, Washington DC. verra.org

Share this article

LinkedInEmail