10 กรกฎาคม 2026

ตัวแทนของอะไร? เมื่อตัวอย่างใหม่ตกอยู่นอกโดเมนของแบบจำลอง

ภาพรวม

“เก็บตัวอย่างให้เป็นตัวแทน” แฝงงานสองอย่างที่ต่างกัน: ตัวอย่างนั้นสะท้อนพื้นที่ที่ต้องการอธิบายหรือไม่ และตำแหน่งใหม่อยู่ภายในเงื่อนไขที่แบบจำลองซึ่งสอบเทียบไว้เคยพบเห็นจริงหรือไม่ คำถามที่สอง คือโดเมนการนำไปใช้ได้ (applicability domain) เป็นคำถามที่โครงการติดตามตรวจวัดส่วนใหญ่มองข้าม บทความนี้ว่าด้วยวิธีทดสอบว่าชุดสอบเทียบของคุณครอบคลุมทั้งภูมิภาคใหม่หรือไม่ วิธีให้คะแนนจุดเดี่ยวด้วยบันไดของวิธีการที่ตีพิมพ์แล้วพร้อมสูตรและเกณฑ์ของแต่ละขั้น สิ่งที่ควรแนบไปกับการทำนายที่ก้ำกึ่งแทนการพูดลอย ๆ และจำนวนตัวอย่างในพื้นที่ที่น้อยจนน่าประหลาดใจซึ่งพอจะขยายโดเมนได้ พร้อมทั้งสิ่งที่ VM0042 ของ Verra กำหนดไว้แล้ว และสิ่งที่ EU CRCF ไม่ได้กำหนด พร้อมเครื่องมือโต้ตอบสามชิ้นให้คุณปรับค่าด้วยตนเอง

หัวข้อ

ความเป็นตัวแทน // โดเมนการนำไปใช้ได้ // การเก็บตัวอย่าง // MRV

ผู้เขียน

Dr. Thomas Fungenzi

Share

LinkedInEmail

โครงการจัดหาโกโก้แห่งหนึ่งสร้างค่าฐาน (baseline) ของคาร์บอนอินทรีย์ในดินสำหรับแหล่งต้นทางแห่งแรก ทีมงานเก็บตัวอย่างทั่วพื้นที่จัดหา (supply shed) ปรับแบบจำลองที่ทำนายสต๊อกคาร์บอนจากตัวแปรร่วม (covariate) ด้านดินและภูมิทัศน์ แล้วตรวจสอบความถูกต้องด้วยการตรวจสอบไขว้ (cross-validation) ได้ค่า R² เท่ากับ 0.78 ดีพอที่จะรายงาน หนึ่งปีต่อมาโครงการขยายไปยังแหล่งต้นทางแห่งที่สองในอีกประเทศหนึ่ง และนำแบบจำลองเดิมกลับมาใช้ประเมินค่าฐานใหม่ เพราะการสร้างแบบจำลองขึ้นใหม่ต้องใช้การออกภาคสนามที่งบประมาณไม่มีให้ ผู้ทวนสอบถามเพียงคำถามเดียว: มีหลักฐานอะไรว่าแหล่งต้นทางแห่งที่สองอยู่ภายในพิสัยของเงื่อนไขที่ใช้สอบเทียบแบบจำลอง? ทีมงานชี้ไปที่ค่า 0.78 แต่ตัวเลขนั้นบอกเพียงว่าแบบจำลองทำนายได้ดีเพียงใดภายในเงื่อนไขของแหล่งต้นทางแห่งแรก มันไม่ได้บอกอะไรเกี่ยวกับแห่งที่สองเลย ห้องประชุมเงียบลง

นี่คือปัญหาความเป็นตัวแทนที่ทีมติดตามตรวจวัดพบบ่อยที่สุดแต่เรียกชื่อได้ชัดเจนน้อยที่สุด แท้จริงแล้วมันไม่ได้เกี่ยวกับตัวอย่าง แต่เกี่ยวกับความสัมพันธ์ระหว่างสามสิ่ง: จุดที่คุณวัด จุดที่คุณต้องการตัวเลขในตอนนี้ และเสี้ยวของโลกที่แบบจำลองเคยพบเห็นจริง

สองคำถามที่ซ่อนอยู่ในคำเดียว

คำว่าความเป็นตัวแทนถูกใช้กับข้ออ้างสองแบบที่แตกต่างกัน และการนำมาปนกันคือจุดเริ่มต้นของปัญหา ข้ออ้างแรกเกี่ยวกับ ตัวอย่างและประชากร: ตัวอย่างสะท้อนพื้นที่ที่คุณต้องการอธิบาย ค่าเฉลี่ยที่คำนวณจากตัวอย่างจึงเป็นตัวประมาณที่ยุติธรรมของค่าเฉลี่ยที่แท้จริง นี่คือขอบเขตของการออกแบบการเก็บตัวอย่าง และเป็นความหมายที่เราอธิบายไว้ใน แคมเปญเก็บตัวอย่างคาร์บอนในดินของคุณควรมีขนาดเท่าใด? และ สัญญาณกับสัญญาณรบกวน

ข้ออ้างที่สองเกี่ยวกับ จุดใหม่และแบบจำลอง การติดตามตรวจวัดในปัจจุบันส่วนใหญ่ไม่ได้หยุดอยู่ที่ค่าเฉลี่ยของตัวอย่าง แต่ปรับแบบจำลอง ไม่ว่าจะเป็นสมการอัลโลเมตริก แผนที่คาร์บอนในดิน การสอบเทียบสเปกตรัม แบบจำลองเชิงกระบวนการอย่าง RothC หรือค่าการปล่อยตั้งต้น (default emission factor) แล้วนำไปใช้กับตำแหน่งที่ไม่ได้วัดอะไรเลย การทำนาย ณ ตำแหน่งใหม่น่าเชื่อถือได้เพียงเท่าที่แบบจำลองเคยมีประสบการณ์กับเงื่อนไขแบบตำแหน่งนั้น เมื่ออยู่นอกพิสัยของเงื่อนไขในข้อมูลฝึก แบบจำลองกำลังคาดคะเนนอกช่วง (extrapolate) และความคลาดเคลื่อนของมันไม่มีขอบเขตและไม่อาจรู้ได้จากสถิติความพอดี (fit statistics)

สองข้อนี้สอดคล้องกับโหมดการอนุมานคลาสสิกสองแบบ การอนุมานฐานการออกแบบ (design-based inference) ได้ความสมเหตุสมผลจากวิธีเลือกตัวอย่าง และตอบคำถามตัวอย่างสู่ประชากร ส่วนการอนุมานฐานแบบจำลอง (model-based inference) ได้ความสมเหตุสมผลจากการที่แบบจำลองถูกต้อง ณ จุดที่นำไปใช้ และตอบคำถามจุดใหม่สู่แบบจำลอง 78 ตัวอย่างหนึ่งอาจเป็นตัวอย่างเชิงความน่าจะเป็นตามตำราของประชากรของตนเอง แต่ก็ยังให้การทำนายที่ตกไปไกลนอกประสบการณ์ของแบบจำลองที่หยิบยืมมา คำถามทั้งสองเป็นอิสระต่อกัน และข้อที่สองคือข้อที่ทำให้ทั้งห้องเงียบงัน

นิยามของโดเมนการนำไปใช้ได้

แนวคิดที่กำกับคำถามที่สองมีชื่อเรียกอยู่แล้ว หยิบยืมมาจากสาขาที่เรียนรู้บทเรียนนี้ตั้งแต่เนิ่นๆ ในวิชาเคมี แบบจำลองเชิงปริมาณโครงสร้าง-ฤทธิ์ (quantitative structure-activity model) ทำนายสมบัติของโมเลกุลจากโครงสร้างของมัน และหน่วยงานกำกับดูแลสังเกตว่าแบบจำลองเหล่านี้ให้การทำนายที่มั่นใจแต่ผิดพลาดสำหรับโมเลกุลที่ไม่เหมือนสิ่งใดในชุดฝึก คำตอบคือการนิยาม โดเมนการนำไปใช้ได้: บริเวณของปริภูมิอินพุตที่แบบจำลองให้การทำนายที่เชื่อถือได้ พร้อมกฎที่ชัดเจนในการตัดสินว่ากรณีใหม่ตกอยู่ภายในหรือไม่ 12

การติดตามตรวจวัดสิ่งแวดล้อมใช้แนวคิดเดียวกัน แต่มักไม่มีชื่อเรียก สมการอัลโลเมตริกทุกสมการปรับพอดีในพิสัยของเส้นผ่านศูนย์กลางต้นไม้ช่วงหนึ่ง 11 และการนำไปใช้เกินพิสัยนั้นคือการคาดคะเนนอกช่วง จึงเป็นเหตุผลว่าทำไมกฎเชิงปฏิบัติคือการพล็อตการกระจายเส้นผ่านศูนย์กลางในบัญชีสำรวจของคุณเทียบกับพิสัยที่ปรับพอดีของสมการ ดังที่เราอธิบายไว้ใน คำนวณปริมาณคาร์บอนในต้นไม้อย่างไร? พิสัยของเส้นผ่านศูนย์กลางคือโดเมนการนำไปใช้ได้ในหนึ่งมิติ แบบจำลองดินสมัยใหม่พึ่งพาตัวแปรร่วมหลายตัวพร้อมกัน คือปัจจัย SCORPAN ที่การทำแผนที่ดินเชิงดิจิทัลจัดระบบไว้ 9 และข้อมูลฝึกครอบครองกลุ่มเมฆในปริภูมิมิติสูงนั้น โดเมนการนำไปใช้ได้คือบริเวณของปริภูมินั้นที่กลุ่มเมฆครอบคลุมจริง และทั้งคำถามก็กลายเป็นเรื่องเชิงเรขาคณิต: จุดใหม่อยู่ภายในกลุ่มเมฆ หรืออยู่ในมุมหนึ่งที่แบบจำลองไม่เคยไปเยือน?

ชุดสอบเทียบของคุณครอบคลุมภูมิภาคใหม่หรือไม่?

ทุกอย่างที่ผ่านมาพิจารณาทีละจุด ซึ่งเป็นคำถามที่ถูกต้องเมื่อคุณกำลังจะรายงานตัวเลขของฟาร์มแห่งเดียว แต่เป็นคำถามที่ผิดเมื่อโครงการถามว่าแบบจำลองที่สร้างในแหล่งต้นทางแห่งหนึ่งจะนำกลับมาใช้กับแหล่งต้นทางแห่งที่สองได้ทั้งแห่งหรือไม่ นั่นคือคำถามเกี่ยวกับการแจกแจงสองชุด และมันมีการทดสอบตรงๆ ที่ใช้เวลาเพียงบ่ายเดียว

ติดป้ายให้ตัวอย่างสอบเทียบทุกตัวเป็น 0 และตำแหน่งทุกแห่งในพื้นที่เป้าหมายเป็น 1 ทิ้งค่าคาร์บอนในดินไป เก็บไว้เพียงตัวแปรร่วม จากนั้นฝึกตัวจำแนก (classifier) ให้แยกสองป้ายนี้ออกจากกัน แล้วตรวจสอบไขว้ หากตัวจำแนกทำได้ไม่ดีไปกว่าการเดาสุ่ม ชุดข้อมูลทั้งสองก็แยกแยะไม่ได้ในเชิงสถิติบนตัวแปรที่แบบจำลองใช้ และข้อมูลสอบเทียบของคุณก็เป็นตัวอย่างที่สมเหตุสมผลของเงื่อนไขในพื้นที่เป้าหมาย แต่ถ้ามันแยกได้ง่าย คุณก็มีการเลื่อนของตัวแปรร่วม (covariate shift) และตอนนี้คุณมีตัวเลขของมันแทนที่จะมีเพียงข้อโต้แย้ง นี่คือการทดสอบสองตัวอย่างด้วยตัวจำแนก (classifier two-sample test) และทฤษฎีที่อนุญาตให้อ่านระยะห่างระหว่างโดเมนจากความแม่นยำของตัวจำแนกนั้นเก่าแก่กว่าการนำมาใช้ในที่นี้ 2223

ตัวจำแนกให้สามสิ่งที่ค่า R² พาดหัวให้ไม่ได้ ความแม่นยำของมัน ซึ่งอ่านเป็นพื้นที่ใต้เส้นโค้ง ROC คือตัวเลขสรุป ความสำคัญของตัวแปรบอกว่าตัวแปรร่วมตัวไหนที่ขับความไม่เข้ากันนี้ ซึ่งเป็นสิ่งที่คุณจะลงมือแก้ได้จริง และความน่าจะเป็นที่ปรับพอดีแล้วให้อัตราส่วนความหนาแน่น (density ratio) ระหว่างประชากรสองกลุ่ม ซึ่งเป็นปริมาณที่ให้นิยามเชิงรูปนัยแก่การเลื่อนของตัวแปรร่วม 24 และจะกลับมาปรากฏอีกครั้งเมื่อเราไปถึงเรื่องความไม่แน่นอน

อัตราส่วนความหนาแน่น // และขนาดตัวอย่างที่เหลือให้คุณ
w(x) = p(x) / (1 − p(x)) × ncal / ntarget
ESS = (Σ wi)² / Σ wi²

บรรทัดที่สองคือบรรทัดที่ควรวางไว้ตรงหน้าลูกค้า การถ่วงน้ำหนักชุดสอบเทียบใหม่ให้เอนไปหาประชากรเป้าหมายใหม่เป็นแนวปฏิบัติมาตรฐาน 25 แต่น้ำหนักจะกระจุกงานทั้งหมดไว้ในตัวอย่างเพียงหยิบมือที่หดเล็กลงเรื่อยๆ และขนาดตัวอย่างประสิทธิผล (effective sample size) ของ Kish วัดว่าเหลืออยู่น้อยเพียงใด 26 ชุดสอบเทียบ 200 ตัวอย่างที่ถ่วงน้ำหนักใหม่แล้วเหลือประสิทธิผลเพียง 14 ตัวอย่างสำหรับภูมิภาคใหม่ ได้ตอบคำถามนั้นไปเรียบร้อยแล้ว ตัวเลขนี้โต้แย้งได้ยากกว่าสถิติความพอดีใดๆ เพราะมันคือการนับข้อมูลที่ทำงานอยู่จริง

เลื่อนแถบด้านล่างแล้วดูตัวเลขทั้งสามขยับไปพร้อมกัน มีพฤติกรรมสองอย่างที่ควรจงใจกระตุ้นให้เกิด ดันพื้นที่เป้าหมายให้ห่างจากชุดสอบเทียบ แล้วตัวจำแนกจะแยกทั้งสองออกจากกัน ขนาดตัวอย่างประสิทธิผลจะทรุดลง และสัดส่วนของพื้นที่เป้าหมายที่อยู่ในโดเมนจะลดลง เมื่อพื้นที่ใต้เส้นโค้งขึ้นถึง 0.94 ตัวอย่างสอบเทียบเจ็ดสิบตัวอย่างจะมีค่าเทียบเท่าสิบห้าตัวอย่างเชิงประสิทธิผล จากนั้นตั้งค่าการเลื่อนกลับเป็นศูนย์ แล้วขยายพื้นที่เป้าหมายให้กว้างขึ้นแทน ตัวจำแนกจะตกกลับมาที่ 0.50 ราวกับประกาศว่าชุดข้อมูลทั้งสองเหมือนกันทุกประการ ทั้งที่พื้นที่เป้าหมายไม่ถึงครึ่งด้วยซ้ำที่ยังอยู่ในโดเมน

กรณีที่สองนั้นคือข้อจำกัดที่ซื่อตรงของวิธีนี้ และมันสำคัญ ตัวจำแนกเชิงเส้นแยกด้วยค่าเฉลี่ย จึงมองไม่เห็นพื้นที่เป้าหมายที่มีจุดศูนย์กลางเดียวกับชุดสอบเทียบแต่เพียงแผ่กว้างกว่า ซึ่งเป็นสิ่งที่พื้นที่จัดหาทำพอดีเมื่อมันขยายเข้าไปในภูมิประเทศที่ผันแปรมากขึ้น จงใช้ตัวเรียนรู้ที่ยืดหยุ่นแทนการถดถอยโลจิสติก และอย่าอ่านค่าตัวจำแนกเพียงลำพัง: ให้รายงานควบคู่กับสัดส่วนของพื้นที่เป้าหมายที่ตกอยู่ในโดเมน ตัวเลขหนึ่งจับการเลื่อนของตำแหน่ง อีกตัวจับการเลื่อนของการกระจาย และโครงการหนึ่งอาจเจอได้ทั้งสองแบบ

สำหรับแผนการติดตามตรวจวัด สัดส่วนนั้นคือประโยคที่ควรเขียนลงไป ไม่ใช่ “แบบจำลองนำไปใช้ได้” แต่เป็น “62% ของพื้นที่จัดหาแห่งใหม่ตกอยู่ในโดเมนสอบเทียบ ส่วนที่เหลือกระจุกอยู่ทางเหนือซึ่งมีฝนชุก และนี่คือสิ่งที่เราทำกับมัน”

จะบอกได้อย่างไรว่าจุดใหม่อยู่ในโดเมน

ความเป็นสมาชิกของโดเมนวัดได้ และวิธีการต่างๆ ประกอบกันเป็นบันได ไม่ใช่เมนูให้เลือก แต่ละขั้นแก้จุดบอดเฉพาะอย่างของขั้นที่อยู่ต่ำกว่า คำถามที่มีประโยชน์จึงไม่ใช่ว่าวิธีไหนดีที่สุด แต่คือคุณยอมแบกจุดบอดข้อไหนไหว

ทีละตัวแปร สำหรับตัวแปรร่วมแต่ละตัว จุดใหม่ตกอยู่ระหว่างค่าต่ำสุดกับค่าสูงสุดของข้อมูลฝึกหรือไม่? วิธีนี้จับการคาดคะเนนอกช่วงที่หยาบที่สุดได้ภายในห้านาที เวอร์ชันที่ตีพิมพ์แล้วของการตรวจแบบนี้ คือพื้นผิวความคล้ายคลึงเชิงสิ่งแวดล้อมหลายตัวแปร (multivariate environmental similarity surface, MESS) ให้คะแนนตำแหน่งหนึ่งตั้งแต่ 0 ถึง 100 ตามความลึกที่ตัวแปรสุดขั้วที่สุดของตำแหน่งนั้นอยู่ภายในการแจกแจงอ้างอิง และกลายเป็นค่าลบทันทีที่ตัวแปรใดออกนอกพิสัยอ้างอิง โดยขนาดของค่าบอกระยะที่ออกนอกช่วงเป็นเปอร์เซ็นต์ของพิสัยตัวแปรนั้น 17 คะแนน 100 หมายความว่าจุดนั้นอยู่ที่ค่ามัธยฐานของข้อมูลอ้างอิงในทุกตัวแปร

จุดอ่อนของมันเป็นเรื่องเชิงโครงสร้าง: มันหยิบค่าต่ำสุดข้ามตัวแปร จึงเป็นวิธีหลายตัวแปรเพียงเล็กน้อยเท่านั้น จุดหนึ่งอาจอยู่ในพิสัยของทุกตัวแปรอย่างสบายๆ แต่ยังเป็นการผสมผสานที่เป็นไปไม่ได้ซึ่งแบบจำลองไม่เคยพบเห็น เช่น ปริมาณฝนของพื้นที่ชื้นรวมกับปริมาณดินเหนียวของพื้นที่แห้ง การตรวจรายตัวแปรมากแค่ไหนก็ไม่พบสิ่งนั้น

การผสมผสานแบบใหม่ วิธีตรวจจับการคาดคะเนนอกช่วง (extrapolation detection, ExDet) แยกความแปลกใหม่ออกเป็นสองชนิดอย่างชัดเจน 16 ดัชนีตัวแรกรวมระยะที่แต่ละตัวแปรออกนอกพิสัยอ้างอิง แสดงเป็นเศษส่วนของพิสัยนั้น และมีค่าเป็นศูนย์เมื่อทุกตัวแปรอยู่ในพิสัย ดัชนีตัวที่สองหารระยะทาง Mahalanobis ของจุดนั้นจากจุดศูนย์ถ่วงอ้างอิง ด้วยระยะทางแบบเดียวกันที่มากที่สุดในบรรดาข้อมูลอ้างอิงเอง ค่าที่เกิน 1 หมายความว่าจุดนั้นอยู่ห่างจากศูนย์กลางของกลุ่มเมฆข้อมูลฝึกมากกว่าจุดฝึกใดๆ เคยอยู่ นั่นคือการผสมผสานแบบใหม่ ซึ่งการตรวจพิสัยแบบใดก็มองไม่เห็น

การตรวจจับการคาดคะเนนอกช่วง // ความแปลกใหม่ของพิสัยและของการผสมผสาน
NT1 = Σj min( xj − minj , maxj − xj , 0 ) / ( maxj − minj )
NT2 = D²(x, μref) / maxi∈ref D²(xi, μref)

ระยะทางถึงกลุ่มเมฆข้อมูลฝึก ใต้ทั้งสองวิธีคือระยะทาง Mahalanobis ซึ่งวัดระยะทางในหน่วยของการกระจายและสหสัมพันธ์ของข้อมูลฝึกเอง การก้าวไปตามทิศทางที่ข้อมูลฝึกแทบไม่เคยสำรวจจึงนับหนักกว่าการก้าวไปตามทิศทางที่ข้อมูลครอบคลุมไว้ดี การแจกแจงอ้างอิงของมันคือไคสแควร์ (chi-squared) ที่มีองศาอิสระเท่ากับจำนวนตัวแปรร่วม ซึ่งให้เกณฑ์ที่จับต้องได้แทนความรู้สึก: ทำเครื่องหมายทุกอย่างที่เกินเปอร์เซ็นไทล์ที่ 95 สำหรับแบบจำลองเชิงเส้น แนวคิดเดียวกันปรากฏในรูปของ leverage คือเส้นทแยงมุมของ hat matrix พร้อมเส้นเตือนที่ใช้กันมานานที่สามเท่าของ leverage เฉลี่ย และการพล็อต leverage เทียบกับเศษเหลือมาตรฐาน (standardised residual) คือเครื่องมือวินิจฉัยที่หน่วยงานกำกับดูแลในสาขาซึ่งตั้งชื่อโดเมนการนำไปใช้ได้ ใช้กันอยู่จริง 1210

ระยะทาง Mahalanobis // leverage // และเกณฑ์ของทั้งสอง
D²(x) = (x − μ)ᵀ Σ−1 (x − μ)    ทำเครื่องหมายถ้า D² > χ²p, 0.95
h(x) = xᵀ (XᵀX)−1 x    ทำเครื่องหมายถ้า h > 3p / n

มีข้อควรระวังสองข้อที่ตัดสินว่าวิธีนี้ใช้ได้จริงหรือไม่ เมทริกซ์ความแปรปรวนร่วมต้องประมาณค่าอย่างทนทาน (robust) เพราะจุดฝึกที่ผิดปกติเพียงหยิบมือเดียวก็ทำให้มันพองตัว และเมทริกซ์ที่พองแล้วจะประกาศว่าทุกอย่างอยู่ในโดเมน อีกทั้งมันหาอินเวอร์สได้แย่เมื่อตัวแปรร่วมมีภาวะร่วมเส้นตรง (collinearity) หรือมีจำนวนมาก ซึ่งตัวแปรร่วมด้านดินเป็นเช่นนั้นเสมอ จึงควรทำงานในปริภูมิขององค์ประกอบหลักที่เก็บไว้ หรือใช้ตัวประมาณแบบหด (shrinkage estimator) ในกรณีที่ตัวแปรปนกันทั้งแบบต่อเนื่องและแบบจัดกลุ่ม ระยะทาง Gower และระยะทางถึงเพื่อนบ้านใกล้สุดอย่างง่ายคือทางเลือกนอนพาราเมตริกที่ทนทาน

พื้นที่ที่นำไปใช้ได้ สำหรับแผนที่ เมื่อแบบจำลองสร้างแผนที่เต็มพื้นที่ คำถามเป็นเรื่องเชิงพื้นที่: พิกเซลใดที่นำแบบจำลองไปใช้ได้? วิธีพื้นที่ที่นำไปใช้ได้ตอบคำถามนี้ได้ตรงพอดี 3 มันปรับตัวแปรร่วมให้เป็นมาตรฐาน ถ่วงน้ำหนักแต่ละตัวตามความสำคัญในแบบจำลองที่ปรับพอดีแล้ว วัดระยะทางจากแต่ละพิกเซลถึงจุดฝึกที่ใกล้ที่สุดในปริภูมิถ่วงน้ำหนักนั้น แล้วหารด้วยค่าเฉลี่ยของระยะทางระหว่างคู่ทั้งหมดในข้อมูลฝึก พิกเซลที่เกินเกณฑ์ซึ่งได้มาจากความไม่คล้ายภายในข้อมูลฝึกเองถือว่าอยู่นอกพื้นที่ที่นำไปใช้ได้ และความคลาดเคลื่อนที่แบบจำลองรายงานไว้ไม่มีผลตรงนั้น แผนที่ระดับภูมิภาคอาจดูสมบูรณ์และน่าเชื่อถือ ทั้งที่ส่วนใหญ่ของมัน เมื่อวัดด้วยวิธีนี้ อยู่นอกโดเมน 4

ดัชนีความไม่คล้าย // และเกณฑ์ที่ข้อมูลฝึกเป็นผู้กำหนด
DI(k) = mini d(k, i) / d̄    บนตัวแปรร่วมที่ปรับมาตรฐานและถ่วงน้ำหนักตามความสำคัญแล้ว
เกณฑ์ = ค่า DI สูงสุดที่ไม่ใช่ค่าผิดปกติ ในข้อมูลฝึกที่ผ่านการตรวจสอบไขว้

เกณฑ์นั้นควรระบุให้แม่นยำ เพราะมันถูกอ้างผิดกันแพร่หลาย มันคือค่าสูงสุดของดัชนีความไม่คล้ายของจุดฝึกเอง หลังตัดค่าผิดปกติออกแล้ว นิพจน์หนวดบน (upper whisker) ที่คุ้นเคยกัน คือเปอร์เซ็นไทล์ที่ 75 บวก 1.5 เท่าของพิสัยระหว่างควอไทล์ เป็นกฎสำหรับตัดสินว่าค่าใดนับเป็นค่าผิดปกติ ไม่ใช่ตัวเกณฑ์เอง ส่วนพรีปรินต์ที่เผยแพร่กันฟรีระบุกฎอีกแบบหนึ่ง คือควอนไทล์ .95 ซึ่งถูกแก้ไปแล้วระหว่างการทบทวนโดยผู้ทรงคุณวุฒิ ฉบับที่ตีพิมพ์คือฉบับที่ควรนำไปใช้

มีข้อมูลรองรับมากแค่ไหน ไม่ใช่แค่ใกล้แค่ไหน ดัชนีความไม่คล้ายมองเพียงจุดฝึกที่ใกล้ที่สุดจุดเดียว จึงแยกไม่ออกระหว่างตำแหน่งที่ค้ำไว้ด้วยตัวอย่างเดียวโดดๆ กับตำแหน่งที่มีตัวอย่างสองร้อยตัวหนุนอยู่ การนับว่ามีจุดฝึกกี่จุดตกอยู่ในระยะเกณฑ์จากตำแหน่งหนึ่งช่วยปิดช่องว่างนั้น และจำนวนที่นับได้สัมพันธ์กับสมรรถนะจริงของแบบจำลองตรงนั้น 15 มันเป็นมาตรวัดหลังการฝึกที่ไม่มีต้นทุนเพิ่มเมื่อคำนวณระยะทางเสร็จแล้ว และเป็นความต่างระหว่าง “อยู่ในโดเมน” กับ “อยู่ในโดเมน และมีข้อมูลรองรับดี”

การสอบเทียบสเปกตรัมมีเวอร์ชันของตัวเอง หากทำนายคาร์บอนในดินจากสเปกตรัมช่วงกลางอินฟราเรด (mid-infrared) แทนตัวแปรร่วม การวิเคราะห์องค์ประกอบหลัก (principal component analysis) ของชุดสอบเทียบจะนิยามปริภูมิที่มันรู้จัก และต้องใช้สถิติสองตัวเป็นคู่ ไม่ใช่ทีละตัว Hotelling's T² วัดว่าสเปกตรัมใหม่อยู่ห่างจากศูนย์กลางภายในปริภูมินั้นเพียงใด ส่วน Q-residual วัดว่ามันอยู่ห่างออกนอกปริภูมินั้นเพียงใด ในทิศทางที่การสอบเทียบไม่เคยสร้างแบบจำลองไว้ ตัวอย่างหนึ่งอาจผ่านสถิติตัวใดตัวหนึ่งเพียงลำพัง แต่ยังเป็นตัวอย่างที่การสอบเทียบไม่เคยถูกฝึกให้อ่าน

การตรวจสอบจับได้มองไม่เห็น
พิสัยรายตัวแปร // MESSตัวแปรใดก็ตามที่ออกนอกพิสัยที่สอบเทียบไว้การผสมผสานแบบใหม่ของตัวแปรที่อยู่ในพิสัย
ExDet NT1 + NT2ความแปลกใหม่ของพิสัยและของการผสมผสาน แยกจากกันทิศทางใดในปริภูมิตัวแปรร่วมที่ไม่มีข้อมูลรองรับ
Mahalanobis // leverageระยะทางจากกลุ่มเมฆ ในหน่วยการกระจายของมันเองช่องว่างเฉพาะที่ภายในกรอบรวม
พื้นที่ที่นำไปใช้ได้ระยะทางรายพิกเซล ถ่วงน้ำหนักตามความสำคัญของตัวแปรร่วมมีจุดฝึกกี่จุดที่ให้การรองรับ
ความหนาแน่นของจุดข้อมูลเฉพาะที่การรองรับที่บางเบาภายในบริเวณที่ดูเหมือนครอบคลุมแล้วความสัมพันธ์เองเปลี่ยนไปหรือไม่
Hotelling's T² + Qสเปกตรัมที่ต่างจากชุดสอบเทียบ ทั้งภายในและภายนอกปริภูมิของมันไม่มี หากอ่านทั้งสองค่าร่วมกัน

กับดักการตรวจสอบความถูกต้อง: เหตุใดค่า R² ที่ดีจึงโกหกได้

มีวิธีเฉพาะอย่างหนึ่งที่ทำให้เรื่องนี้ผิดพลาดในทางที่ประจบผู้ปฏิบัติงาน เมื่อแบบจำลองถูกตรวจสอบด้วยการตรวจสอบไขว้แบบสุ่มทั่วไป จุดที่กันไว้ (held-out) จะกระจายอยู่ท่ามกลางจุดฝึก หากข้อมูลมีสหสัมพันธ์อัตโนมัติเชิงพื้นที่ ซึ่งข้อมูลดินและพืชพรรณเกือบจะมีเสมอ ทุกจุดที่กันไว้ก็มีเพื่อนบ้านใกล้เคียงอยู่ในชุดฝึก แบบจำลองจึงถูกทดสอบเกือบทั้งหมดภายในโดเมนของตัวเอง บนจุดที่ง่าย การตรวจสอบที่จัดโครงสร้างเชิงพื้นที่ ซึ่งกันบล็อกของพื้นที่ไว้ทั้งบล็อก เผยให้เห็นซ้ำแล้วซ้ำเล่าว่าแบบจำลองที่มีคะแนนตรวจสอบไขว้แบบสุ่มยอดเยี่ยมกลับทำนายได้ย่ำแย่เมื่อต้องเอื้อมไกลออกไป 56 แผนที่ระดับภูมิภาคอาจไม่มีความเอนเอียงโดยเฉลี่ยตลอดขอบเขตของมัน แต่ยังผิดพลาดที่ทุกโครงการรายจุดภายในนั้น

การตอบสนองอย่างซื่อตรงไม่ใช่แค่การสลับจากการตรวจสอบไขว้แบบสุ่มไปเป็นแบบเชิงพื้นที่แล้วเดินหน้าต่อ เพราะการออกแบบการตรวจสอบที่ถูกต้องก็เป็นที่ถกเถียงกันเอง: การกันบล็อกเชิงพื้นที่อาจมองในแง่ร้ายเกินไปหากมันกันบริเวณที่แบบจำลองจะไม่มีวันถูกขอให้ทำนายออกไป และทางเลือกที่ปกป้องได้ที่สุด เมื่องบประมาณเอื้ออำนวย คือตัวอย่างตรวจสอบแยกต่างหากที่สุ่มด้วยการเก็บตัวอย่างเชิงความน่าจะเป็นจากพื้นที่เป้าหมาย ซึ่งประเมินความแม่นยำของแผนที่ได้โดยไม่ต้องพึ่งพาแบบจำลองเลย 78 ประเด็นที่รอดพ้นการถกเถียงนั้นง่ายกว่า: ตัวเลขความแม่นยำมีความหมายก็ต่อเมื่อมาพร้อมคำบอกว่าวัดที่ใด ทั้งในปริภูมิตัวแปรร่วมและปริภูมิภูมิศาสตร์ และสถานที่ที่คุณต้องการการทำนายในตอนนี้เหมือนกับที่นั่นหรือไม่

ตอนนี้มีคำตอบที่คมกว่าการเลือกข้าง แทนที่จะกันบล็อกพื้นที่ตามอำเภอใจ ให้จับคู่การตรวจสอบเข้ากับการทำนาย: กันจุดออกไปให้การแจกแจงของระยะทางจากจุดทดสอบถึงข้อมูลฝึก คล้ายกับการแจกแจงของระยะทางจากสถานที่ที่คุณจะทำนายจริงถึงข้อมูลฝึก 13 การตรวจสอบไขว้จึงวัดระยะเอื้อมที่แบบจำลองจะถูกขอให้ทำจริง ไม่ถูกประจบด้วยเพื่อนบ้านใกล้ๆ และไม่ถูกลงโทษเพราะบริเวณที่ไม่มีใครถามถึง สูตรดั้งเดิมกันออกทีละจุดและขยายขนาดไม่ได้ ส่วนเวอร์ชัน k-fold ลดชุดข้อมูลแบบกระจุกสี่พันจุดจากหลายวันเหลือราวหนึ่งนาที 14 ซึ่งสำคัญ เพราะเหตุผลที่ทีมงานมักถอยกลับไปใช้การตรวจสอบไขว้แบบสุ่ม คือทางเลือกที่ซื่อตรงนั้นเกินกำลังการคำนวณ ส่วนตัวอย่างแบบกระจุกก็ต้องการความระมัดระวังของตัวเอง 39

“ขยายความไม่แน่นอน” ควรหมายความว่าอย่างไรกันแน่

คำแนะนำให้ขยายแถบความคลาดเคลื่อนสำหรับจุดที่ก้ำกึ่งนั้นให้ง่ายแต่ทำตามยาก ขยายเท่าไร? มีคำตอบที่เข้มงวดอยู่ และข้อจำกัดของมันก็ให้บทเรียนไม่แพ้สิ่งที่มันรับประกัน

การทำนายเชิงคอนฟอร์มัลแบบแบ่งข้อมูล (split conformal prediction) สร้างช่วงจากเศษเหลือของข้อมูลที่กันไว้ แทนที่จะสร้างจากข้อสมมติใดๆ เกี่ยวกับรูปร่างของความคลาดเคลื่อน 18 ปรับแบบจำลองบนข้อมูลส่วนหนึ่ง คำนวณเศษเหลือสัมบูรณ์บนชุดสอบเทียบที่กันไว้ แล้วเลือกสถิติอันดับตัวหนึ่งของเศษเหลือเหล่านั้นเป็นครึ่งความกว้างของช่วง ช่วงที่ได้จะครอบคลุมค่าจริงอย่างน้อย 1 − α ของเวลาทั้งหมด ในตัวอย่างขนาดจำกัด โดยไม่ต้องมีข้อสมมติเรื่องการแจกแจงใดๆ ทั้งสิ้น

Split conformal // ช่วงและขนาดชุดสอบเทียบที่ต้องใช้
Ĉ(x) = μ̂(x) ± q    โดย q = ค่า |yi − μ̂(xi)| ที่เล็กเป็นอันดับที่ ⌈(n+1)(1−α)⌉
n ≥ ⌈1/α⌉ − 1    ดังนั้นช่วง 95% ต้องใช้จุดสอบเทียบอย่างน้อย 19 จุด

บรรทัดที่สองไม่ใช่รายละเอียดปลีกย่อยทางเทคนิค หากมีจุดสอบเทียบน้อยกว่านั้น วิธีนี้จะคืนช่วงที่กว้างเป็นอนันต์ ซึ่งเป็นวิธีบอกอย่างซื่อตรงว่าข้อมูลรองรับข้ออ้างที่ถูกเรียกร้องจากมันไม่ได้ วิธีที่ปฏิเสธจะตอบเมื่อมันตอบไม่ได้ มีค่าต่อโครงการติดตามตรวจวัดมากกว่าวิธีที่ให้ตัวเลขออกมาเสมอ

ครึ่งความกว้างคงที่ตลอดทั้งโครงการมักไม่ใช่สิ่งที่คุณต้องการ และวิธีแก้ก็เป็นมาตรฐาน: ให้คะแนนความสอดคล้องเทียบกับควอนไทล์ที่ปรับพอดี แทนค่าเฉลี่ยที่ปรับพอดี แล้วช่วงจะปรับตัวตามความไม่แน่นอนของแบบจำลอง ณ แต่ละตำแหน่ง โดยยังคงการรับประกันความครอบคลุมไว้ 20 พื้นที่ที่มีเงื่อนไขซึ่งเก็บตัวอย่างไว้ดีจะได้ช่วงแคบ พื้นที่ที่ยุ่งยากจะได้ช่วงกว้าง และไม่มีใครต้องเลือกตัวคูณขยายด้วยมือ

นี่คือข้อติดขัด และมันคือหัวข้อทั้งหมดของบทความนี้ การรับประกันนั้นเป็นจริงก็ต่อเมื่อจุดสอบเทียบกับจุดใหม่สับเปลี่ยนกันได้ (exchangeable) ซึ่งเป็นสิ่งที่การย้ายไปยังภูมิภาคใหม่ทำลายลงพอดี การทำนายเชิงคอนฟอร์มัลไม่ใช่ทางหนีจากปัญหาโดเมน หากนำไปใช้อย่างไร้เดียงสาข้ามพรมแดนของโดเมน มันจะให้ช่วงที่ดูเข้มงวดแต่ไม่ได้เข้มงวดจริง

สิ่งที่กู้มันไว้คือปริมาณที่เราสร้างไว้แล้ว ถ้าคุณรู้อัตราส่วนความหนาแน่นระหว่างประชากรเป้าหมายกับประชากรสอบเทียบ คุณถ่วงน้ำหนักเศษเหลือของการสอบเทียบแต่ละตัวด้วยค่านั้น แล้วกู้การรับประกันคืนมาภายใต้การเลื่อนของตัวแปรร่วมได้ 19 กลไกนี้งดงาม: จุดใหม่มีน้ำหนักของตัวเองร่วมอยู่ในควอนไทล์ด้วย เมื่อมันเคลื่อนเข้าไปในอาณาเขตที่ข้อมูลสอบเทียบแทบไม่ครอบคลุม มวลความน่าจะเป็นจะไปกองอยู่ที่อนันต์มากขึ้น และช่วงก็กว้างขึ้นเอง จนกลายเป็นไร้ขอบเขตเมื่อน้ำหนักนั้นเกิน α ตัวจำแนกจากหัวข้อเรื่องความครอบคลุมคือสิ่งที่ให้อัตราส่วนนี้ นั่นคือเหตุผลว่าทำไมสองหัวข้อนี้จึงอยู่ด้วยกัน มีข้อควรระวังที่ซื่อตรงหนึ่งข้อ: การรับประกันจะแม่นตรงก็ต่อเมื่อรู้อัตราส่วนที่แท้จริง แต่ในทางปฏิบัติมันเป็นค่าประมาณ จึงควรถือว่าความครอบคลุมเป็นค่าโดยประมาณที่เสื่อมลงตามคุณภาพของค่าประมาณนั้น

มีขีดจำกัดที่แข็งกว่านั้นซึ่งควรรู้ก่อนที่ใครจะไปสัญญาไว้ ความครอบคลุมแบบมีเงื่อนไขบนค่าตัวแปรร่วมที่แน่นอนของพื้นที่หนึ่งนั้นทำไม่ได้อย่างมีความหมายสำหรับตัวแปรร่วมแบบต่อเนื่อง กระบวนการใดที่อ้างว่าทำได้ย่อมต้องคืนช่วงที่กว้างเป็นอนันต์ 21 การประนีประนอมที่ใช้ได้จริงคือการรับประกันความครอบคลุมภายในชั้นภูมิที่คุณประกาศไว้ล่วงหน้า แบ่งตามภูมิภาค เนื้อดิน หรือการใช้ที่ดิน โดยแต่ละชั้นมีชุดสอบเทียบของตัวเอง นี่คือรูปแบบที่เหมาะกับ MRV และมันมีผลในทางปฏิบัติตามมา: ภูมิภาคที่เก็บตัวอย่างไว้บางจะได้การรับประกันแบบหยาบหรือไม่ได้เลย ซึ่งนั่นคือข้อมูล ไม่ใช่ข้อบกพร่อง

กฎการตัดสินใจที่คุณปกป้องได้

เมื่อประกอบเข้าด้วยกัน การทดสอบโดเมนเป็นเวิร์กโฟลว์สั้นๆ ที่ทำซ้ำได้และพอดีในหนึ่งหน้าของแผนการติดตามตรวจวัด นิยามโดเมนสอบเทียบ (การแจกแจงหลายตัวแปรของตัวแปรร่วมในข้อมูลฝึก) ระบุตำแหน่งของแต่ละจุดใหม่เทียบกับโดเมนนั้น: ตรวจพิสัยรายตัวแปรก่อน แล้วจึงใช้มาตรวัดระยะทาง จำแนกจุดนั้นเป็นอยู่ในโดเมน ก้ำกึ่ง หรืออยู่นอกโดเมน เทียบกับเกณฑ์ที่กำหนดไว้ล่วงหน้า จากนั้นดำเนินการตามชั้นที่จำแนก: จุดที่อยู่ในโดเมนได้ค่าทำนายไปตามที่เป็น จุดก้ำกึ่งได้ค่าทำนายพร้อมความไม่แน่นอนที่ขยายอย่างชัดเจนและมีการทำเครื่องหมาย ส่วนจุดที่อยู่นอกโดเมนไม่ได้ตัวเลขที่หยิบยืมมาเลย แต่จะกระตุ้นให้เก็บตัวอย่างอ้างอิงในพื้นที่และประเมินค่าใหม่

คุณค่าของการเขียนสิ่งนี้ลงไว้คือมันเปลี่ยนการโต้แย้ง (“เราคิดว่าภูมิภาคใหม่คล้ายกันมากพอ”) ให้กลายเป็นหลักฐาน (“นี่คือจุดที่แต่ละจุดใหม่ตกอยู่ และนี่คือกฎที่เราใช้”) นั่นคือความต่างระหว่างข้ออ้างที่ผู้ทวนสอบยอมรับกับข้ออ้างที่ผู้ทวนสอบตั้งคำถาม

ตัวอย่างประกอบ: หนึ่งแบบจำลอง สองภูมิภาค

แบบจำลองคาร์บอนในดินถูกสอบเทียบบนฟาร์มกลางแดดจัดและร่มเงาบางในภูมิภาคจัดหาแห่งหนึ่ง การจัดหาขยายไปยังภูมิภาคที่สองซึ่งเป็นวนเกษตรร่มเงาที่ตั้งตัวแล้ว ตัวแปรร่วมของแบบจำลองห้าตัว ตรวจเทียบกับพื้นที่ตัวแทนของภูมิภาคใหม่:

ตัวแปรร่วมพิสัยสอบเทียบ (A)จุดใหม่ (B)อยู่ในพิสัย?
ดินเหนียว (%)12–3441ไม่ (สูงกว่า)
ปริมาณฝนเฉลี่ยรายปี (mm)900–15001850ไม่ (สูงกว่า)
อุณหภูมิเฉลี่ยรายปี (°C)23–2725ใช่
ความสูงจากระดับน้ำทะเล (m)40–320180ใช่
การปกคลุมของเรือนยอดร่มเงา (%)0–1555ไม่ (สูงกว่า)

ตัวแปรร่วมสามในห้าตัวตกอยู่นอกพิสัยที่สอบเทียบไว้ และสองตัวที่สำคัญที่สุดต่อคาร์บอน คือปริมาณฝนและร่มเงา ก็อยู่ในนั้นด้วย ระยะทาง Mahalanobis หรือดัชนีพื้นที่ที่นำไปใช้ได้จะจัดให้พื้นที่นี้อยู่ไกลเลยกลุ่มเมฆข้อมูลฝึกไปมาก คำตัดสินชัดเจนไม่กำกวม: แบบจำลองอยู่นอกโดเมนที่นี่ และการนำไปใช้จะเป็นการรายงานตัวเลขที่ไม่มีอะไรรองรับ นี่คือข้อค้นพบเดียวกันในระดับย่อส่วน ที่การประเมินอิสระได้ข้อสรุปในระดับทวีป ซึ่งความสัมพันธ์ของคาร์บอนในดินที่สอบเทียบบนระบบพืชแถวเขตอบอุ่นไม่สามารถถ่ายโอนไปยังระบบไม้ยืนต้นร่มเงาได้โดยไม่ประเมินค่าใหม่ในพื้นที่ เราพูดถึงการเลือกแบบจำลองและการสอบเทียบใหม่ในพื้นที่ใน สร้างแบบจำลองการเปลี่ยนแปลงคาร์บอนในดินตามเวลาอย่างไร?

เมื่อคำตอบคือ “อยู่นอก”: ขยายโดเมนแบบประหยัด

“กระตุ้นให้เก็บตัวอย่างในพื้นที่” คือจุดที่การอธิบายเรื่องนี้ส่วนใหญ่หยุดลง และเป็นจุดที่ผู้จัดการโครงการต้องการความช่วยเหลือมากที่สุด ข่าวที่มีประโยชน์คือการขยายโดเมนถูกกว่าการสร้างโดเมนขึ้นใหม่มาก และตัวเลขก็เล็กจนน่าประหลาดใจ

เลือกจุดใหม่เพื่อครอบคลุมปริภูมิ ไม่ใช่เพื่อเลียนแบบประชากร การสุ่มตัวอย่างแบบละตินไฮเปอร์คิวบ์มีเงื่อนไข (conditioned Latin hypercube sampling) ซึ่งเป็นค่าตั้งต้นในการทำแผนที่ดินเชิงดิจิทัล เลือกพื้นที่ให้ตัวอย่างสร้างการแจกแจงขอบ (marginal distribution) ของตัวแปรร่วมและสหสัมพันธ์ระหว่างกันขึ้นมาใหม่ 29 ส่วนการสุ่มตัวอย่างแบบครอบคลุม (coverage sampling) จะจัดกลุ่มพื้นที่เป้าหมายในปริภูมิตัวแปรร่วม แล้วเก็บตัวอย่างใกล้ศูนย์กลางของแต่ละกลุ่ม เป็นการแผ่ทั่วปริภูมิร่วมแทนการจับคู่ที่ขอบ 30 สำหรับการสอบเทียบแบบจำลอง การแผ่ทั่วมักเป็นสิ่งที่คุณต้องการ และงานเปรียบเทียบชิ้นหนึ่งแนะนำให้กระจายตัวอย่างไปทั่วปริภูมิลักษณะเด่น (feature space) ของตัวแปรร่วมที่สำคัญที่สุด 31

จงต้านทานใครก็ตามที่ขายผู้ชนะเบ็ดเสร็จระหว่างสองวิธีนี้ หลักฐานปนกันจริงๆ: การสุ่มแบบครอบคลุมชนะโดยเฉลี่ยในงานเปรียบเทียบบางชิ้น ละตินไฮเปอร์คิวบ์ชนะที่ขนาดตัวอย่างเล็กในบางชิ้น และในงานส่วนใหญ่ ขนาดตัวอย่างสำคัญกว่าการเลือกวิธี การเปรียบเทียบที่อาศัยการสุ่มจริงเพียงครั้งเดียวต่อการออกแบบหนึ่งแบบแทบไม่ให้ข้อมูลอะไร เพราะการแจกแจงของผลลัพธ์ซ้อนทับกันอย่างมาก

บ่อยครั้งคุณไม่จำเป็นต้องสร้างแบบจำลองขึ้นใหม่เลย สเปกโทรสโกปีดิน (soil spectroscopy) เรียนรู้เรื่องนี้ก่อนใคร คลังข้อมูลขนาดใหญ่ที่ใช้ไม่ได้ผลในพื้นที่หนึ่งซ่อมได้ด้วยการเติมตัวอย่างในพื้นที่เข้าไปเพียงหยิบมือ วิธีนี้เรียกว่าการเสริมตัวอย่างท้องถิ่น (spiking) ตัวเลขจากงานวิจัยต่างๆ สอดคล้องกันและมีค่าน้อย: ตัวอย่างในพื้นที่ราวสิบห้าตัวอย่างลดความเอนเอียงของการทำนายลงอย่างมาก 32 สิบสองตัวอย่างยกสมรรถนะของแบบจำลองระดับภูมิภาคจากค่า R² 0.07 ถึง 0.36 ขึ้นเป็น 0.69 ถึง 0.86 33 และตัวอย่างในพื้นที่สิบสองถึงยี่สิบตัวอย่างรวมกับคลังข้อมูลขนาดใหญ่ให้ผลเทียบเท่าการสอบเทียบเฉพาะพื้นที่ที่สร้างจากตัวอย่างมากถึงสามร้อยตัวอย่าง 34 ตัวอย่างที่เลือกมาดีสิบถึงสามสิบตัวอย่างคือช่วงที่ใช้งานได้จริง

ความประหยัดแบบเดียวกันปรากฏในอัลโลเมตรี การใช้สมการที่ตีพิมพ์แล้วเป็นค่าก่อนหน้า (prior) แทนการเริ่มจากศูนย์ ทำให้ต้นไม้หกต้นประมาณค่าพารามิเตอร์ได้ดีเท่าสี่สิบถึงหกสิบต้นในวิธีคลาสสิก 35 นี่คือการรวมกลุ่มบางส่วน (partial pooling) ที่กำลังทำงาน แบบจำลองที่หยิบยืมมาให้รูปทรง ข้อมูลในพื้นที่ดึงมันเข้าหาความจริงในพื้นที่ และองค์ประกอบความแปรปรวนระหว่างพื้นที่เองก็เป็นมาตรวัดว่าความสัมพันธ์นั้นถ่ายโอนได้เพียงใดตั้งแต่แรก

ถ้ามีงบพอแค่จะทดสอบ ก็จงทดสอบความเอนเอียง ตัวอย่างในพื้นที่จำนวนน้อยที่ไม่พอจะปรับแบบจำลองใหม่ ยังตอบได้ว่าแบบจำลองที่หยิบยืมมาผิดอย่างเป็นระบบที่นี่หรือไม่ นั่นคือการเปรียบเทียบสองตัวอย่าง และใช้สูตรกำลังการทดสอบเดียวกันกับการออกแบบเพื่อตรวจจับการเปลี่ยนแปลงใดๆ ซึ่งเราอธิบายไว้ใน แคมเปญเก็บตัวอย่างคาร์บอนในดินของคุณควรมีขนาดเท่าใด? การแทนความเอนเอียงที่คุณใส่ใจลงไปแทนผลต่างต่ำสุดที่ตรวจจับได้ จะให้จำนวนตัวอย่างในพื้นที่ที่ต้องใช้เพื่อจับมันให้ได้

มีข้อค้นพบหนึ่งที่ขัดสามัญสำนึกและควรมีที่ทางในทุกการตัดสินใจเรื่องการถ่ายโอน เมื่อย้ายฟังก์ชันถ่ายโอนคุณสมบัติดิน (pedotransfer function) ไปยังภูมิภาคใหม่ ฟังก์ชันที่สร้างจากทรายและดินเหนียวเท่านั้นทำได้ดีกว่าเวอร์ชันที่ใช้ตัวแปรร่วมสิบเอ็ดตัว 38 ตัวทำนายที่มากขึ้นหมายถึงปริภูมิที่มีมิติสูงขึ้น กลุ่มเมฆข้อมูลฝึกที่เบาบางลง และหนทางที่พื้นที่ใหม่จะตกอยู่นอกกลุ่มเมฆนั้นมากขึ้น ความประหยัดตัวแปรไม่ใช่แค่รสนิยมด้านความงาม แต่เป็นยุทธศาสตร์เรื่องโดเมน ต้นทุนของการทำเรื่องนี้ผิดมีบันทึกไว้ชัดเจน: สมการรวมเขตร้อน (pantropical equation) ประเมินชีวมวลสูงเกินจริงราว 40% ที่พื้นที่แห่งหนึ่งในแอฟริกากลาง 36 และสมการที่สร้างจากตัวอย่างจำนวนน้อยมีความเอนเอียงระดับพื้นที่เฉลี่ยราว +70% โดยมีพิสัยตั้งแต่ −4% ถึง +193% 37

การเก็บตัวอย่างซ้ำ และโดเมนที่ขยับ

มีวิธีที่สองซึ่งเงียบกว่าที่ความเป็นตัวแทนล้มเหลว และมันปรากฏขึ้นพอดีเมื่อโครงการทำทุกอย่างอื่นถูกต้อง การติดตามตรวจวัดสร้างขึ้นบนการเก็บตัวอย่างซ้ำ: กลับไปเยือนเครือข่ายเดิมเมื่อเวลาผ่านไป เปรียบเทียบ และรายงานการเปลี่ยนแปลง ข้อสมมติที่ไม่ได้พูดออกมาคือเครือข่ายยังคงเป็นตัวแทนของระบบที่มันติดตาม แต่ระบบเคลื่อนไหว การจัดการเปลี่ยนไป โครงการร่มเงาเติบโตเต็มที่ ภัยแล้งปรับรูปแบบความชื้นในดินใหม่ การใช้ที่ดินขยับตัวที่ขอบของพื้นที่จัดหา แบบจำลองที่สอบเทียบครั้งเดียวกับระบบเดิมอาจเลื่อนออกนอกโดเมนเมื่อเทียบกับระบบที่มีอยู่ในตอนนี้ โดยไม่มีใครตรวจซ้ำ นักสถิติเรียกสิ่งนี้ว่าการเลื่อนของตัวแปรร่วม (covariate shift) หรือการเลื่อนของมโนทัศน์ (concept drift) ในภาคสนามมันดูเหมือนค่าฐานที่ค่อยๆ เลิกอธิบายปัจจุบันอย่างเงียบๆ

การเลื่อนนี้ทดสอบได้ด้วยเครื่องมือที่แนะนำไปแล้ว ให้รันตัวจำแนกโดเมนระหว่างรอบการติดตามตรวจวัด แทนที่จะรันระหว่างภูมิภาค: ติดป้ายตัวแปรร่วมของรอบที่หนึ่งเป็น 0 และของรอบที่สองเป็น 1 แล้วดูว่าตัวจำแนกบอกความต่างระหว่างปีได้หรือไม่ ถ้าบอกได้ แสดงว่าระบบขยับไปแล้วเมื่อเทียบกับแบบจำลอง และความสำคัญของตัวแปรจะบอกว่าอะไรที่ขยับ วิธีนี้ไม่มีต้นทุนเพิ่มนอกจากตัวแปรร่วมที่คุณถืออยู่แล้ว และมันเปลี่ยนคำเตือนให้กลายเป็นการตรวจสอบตามกำหนดการ

เหตุใดผู้ทวนสอบจึงเริ่มถาม

ข้อความที่ว่าการติดตามตรวจวัดสิ่งแวดล้อมใช้แนวคิดนี้โดยไม่เรียกชื่อ ต้องการการแก้ไขหนึ่งข้อ และเป็นการแก้ไขที่มีประโยชน์ VM0042 ของ Verra เรียกชื่อมัน หมวดนิยามของระเบียบวิธีนี้กำหนดให้โดเมนโครงการ (project domain) คือชุดของเงื่อนไข ซึ่งรวมถึงชนิดพืช เนื้อดิน และภูมิอากาศ ที่การนำแบบจำลองไปใช้ได้ผ่านการตรวจสอบความถูกต้องแล้ว 40 โดเมนการนำไปใช้ได้ในที่นี้จึงไม่ใช่แนวคิดนามธรรมที่หยิบยืมมาจากวิชาเคมี แต่เป็นคำที่มีนิยามอยู่ในระเบียบวิธีซึ่งโครงการคาร์บอนในดินจำนวนมากใช้เป็นฐานในการเขียน

โมดูลคู่กันของมันเปลี่ยนนิยามนั้นให้เป็นการทดสอบที่ตรวจสอบได้ ทุกเขตภูมิอากาศหรือทุกภูมิภาคเกษตรที่นิยามไว้ในระดับประเทศซึ่งโครงการประกาศไว้ ต้องปรากฏอยู่ในชุดข้อมูลตรวจสอบความถูกต้อง ชั้นเนื้อดินสามชั้นที่คาดว่าจะเป็นชั้นเด่นในพื้นที่โครงการต้องรวมอยู่ด้วย และข้อมูลต้องกินช่วงปริมาณดินเหนียว 15 จุดเปอร์เซ็นต์ โมดูลระบุวัตถุประสงค์ไว้ตรงไปตรงมา คือเพื่อยืนยันว่าแบบจำลองไม่ได้ถูกสอบเทียบจนแนบแน่นเกินไปกับเงื่อนไขชุดเดียว แล้วถูกนำไปใช้ที่อื่น มีข้อจำกัดสองข้อที่ควรระบุให้ถูกต้อง: ข้อกำหนดนี้ผูกกับการหาปริมาณแบบวัดร่วมกับแบบจำลอง ไม่ใช่การให้เครดิตจากการวัดเพียงอย่างเดียว และมันไม่ได้กำหนดจำนวนพื้นที่ขั้นต่ำไว้ วินัยที่ต้องการคือความครอบคลุม ไม่ใช่ขนาดตัวอย่าง

ส่วนที่เหลือของภูมิทัศน์กฎเกณฑ์นั้นอ่อนกว่า และไม่ควรกล่าวเกินจริง IPCC ถือว่าเรื่องนี้เป็นแนวปฏิบัติที่ดีในระดับประเทศ โดยแนะนำให้สอบเทียบและทดสอบแบบจำลอง Tier 3 กับการวัดที่สะท้อนความผันแปรของภูมิอากาศ ดิน และการใช้ที่ดินซึ่งจะนำแบบจำลองไปใช้ ส่วนระเบียบว่าด้วยการกำจัดคาร์บอนของสหภาพยุโรป แม้จะมีการอ้างตรงกันข้ามอยู่บ่อยครั้ง กลับไม่ได้กำหนดข้อบังคับเรื่องการตรวจสอบความถูกต้องของแบบจำลองไว้เลย หน้าที่เรื่องความเป็นตัวแทนของระเบียบนี้ผูกอยู่กับค่าฐาน และสาระสำคัญถูกเลื่อนไปอยู่ในกฎหมายลำดับรอง (delegated act) ที่ยังไม่ออก ใครก็ตามที่อ้างระเบียบนี้เพื่อการนี้ ยังไม่ได้อ่านมัน

นี่ไม่ใช่เพียงความประณีตเชิงระเบียบวิธีอีกต่อไป กรอบการบัญชีที่กำกับข้ออ้างด้านคาร์บอนกำลังบรรจบกันที่ข้อเรียกร้องให้ระบุปริมาณและเปิดเผยความไม่แน่นอน และการทำนายที่นำไปใช้นอกโดเมนของแบบจำลองคือความไม่แน่นอนที่ถูกซ่อนไว้แทนที่จะถูกระบุปริมาณ แนวทาง GHG Protocol Land Sector and Removals ซึ่งมีผลบังคับใช้ตั้งแต่วันที่ 1 มกราคม 2027 ขอให้บริษัทสอบเทียบวิธีที่อิงแบบจำลองและการสำรวจระยะไกลด้วยข้อมูลเชิงประจักษ์ที่เฉพาะเจาะจงกับพื้นที่และการจัดการที่กำลังวิเคราะห์ และเมื่อเป็นการอ้างการกักเก็บ ข้อแนะนำนี้จะกลายเป็นข้อกำหนด พร้อมการเก็บตัวอย่างซ้ำอย่างน้อยทุกห้าปี IPCC 2019 Refinement ผลักดันไปสู่ค่าระดับสูงขึ้นที่เหมาะสมกับพื้นที่แทนค่าตั้งต้นที่หยิบยืมมา ก็เพราะว่าค่าตั้งต้นอยู่นอกโดเมนสำหรับหลายสถานที่ที่มันถูกนำไปใช้ 12 ผู้ทวนสอบเริ่มขอการตรวจสอบที่จัดโครงสร้างเชิงพื้นที่หรือการตรวจสอบอิสระแทนค่า R² ที่เป็นพาดหัว และขอหลักฐานว่าแบบจำลองที่นำกลับมาใช้เหมาะกับพื้นที่ที่กำลังถูกนำไปใช้ซ้ำ ทีมที่จะผ่านคำถามเหล่านี้คือทีมที่ทดสอบความเป็นสมาชิกของโดเมนก่อนถูกถาม และแสดงงานที่ทำได้

ประเด็นสำคัญ

  1. ความเป็นตัวแทนมีคำถามแยกกันสองข้อ: ตัวอย่างเป็นตัวแทนของประชากรหรือไม่ (การออกแบบการเก็บตัวอย่าง) และจุดใหม่อยู่ในโดเมนที่สอบเทียบของแบบจำลองหรือไม่ (การนำไปใช้ได้) ข้อที่สองคือข้อที่โครงการส่วนใหญ่มองข้าม

  2. ตัวอย่างหนึ่งอาจเป็นตัวแทนของประชากรของตนเองได้อย่างสมบูรณ์แบบแต่ยังตกอยู่นอกโดเมนการนำไปใช้ได้ของแบบจำลองที่หยิบยืมมา ทั้งสองเป็นอิสระต่อกัน

  3. โดเมนการนำไปใช้ได้คือบริเวณของปริภูมิตัวแปรร่วมที่ข้อมูลฝึกครอบคลุมจริง พิสัยเส้นผ่านศูนย์กลางของสมการอัลโลเมตริกคือแนวคิดนี้ในหนึ่งมิติ ส่วนโดเมนของแผนที่คาร์บอนในดินคือแนวคิดเดียวกันในหลายมิติ

  4. สำหรับทั้งภูมิภาคแทนที่จะเป็นจุดเดียว ให้ฝึกตัวจำแนกเพื่อแยกตัวอย่างสอบเทียบออกจากตำแหน่งเป้าหมายโดยใช้ตัวแปรร่วมเพียงอย่างเดียว ค่า AUC ใกล้ 0.5 หมายความว่าชุดข้อมูลทั้งสองแยกแยะไม่ได้ ส่วนขนาดตัวอย่างประสิทธิผลของน้ำหนักที่ได้จะบอกว่ามีตัวอย่างสอบเทียบกี่ตัวอย่างที่ทำงานอยู่จริง

  5. จงอ่านค่าตัวจำแนกนั้นควบคู่กับสัดส่วนของพื้นที่เป้าหมายที่อยู่ในโดเมน ตัวจำแนกเชิงเส้นแยกด้วยค่าเฉลี่ย จึงมองไม่เห็นพื้นที่เป้าหมายที่มีจุดศูนย์กลางเดียวกับชุดสอบเทียบแต่เพียงแผ่กว้างกว่า

  6. ความเป็นสมาชิกของโดเมนเป็นบันได แต่ละขั้นแก้จุดบอดของขั้นที่อยู่ต่ำกว่า: พิสัยรายตัวแปรและ MESS จากนั้น ExDet ที่แยกความแปลกใหม่ของพิสัยออกจากการผสมผสานแบบใหม่ จากนั้นระยะทาง Mahalanobis เทียบกับเกณฑ์ไคสแควร์ จากนั้นพื้นที่ที่นำไปใช้ได้สำหรับแผนที่ และสุดท้ายความหนาแน่นของจุดข้อมูลเฉพาะที่ซึ่งบอกว่ามีข้อมูลรองรับมากแค่ไหน

  7. เกณฑ์ของพื้นที่ที่นำไปใช้ได้คือค่าสูงสุดของดัชนีความไม่คล้ายในข้อมูลฝึกเอง หลังตัดค่าผิดปกติออกแล้ว นิพจน์หนวดบนคือกฎสำหรับหาค่าผิดปกติ ไม่ใช่ตัวเกณฑ์ และพรีปรินต์ที่เผยแพร่กันฟรีระบุกฎคนละแบบกับบทความฉบับที่ตีพิมพ์

  8. คะแนนตรวจสอบไขว้แบบสุ่มที่สูงอาจเป็นสิ่งลวงตาจากสหสัมพันธ์อัตโนมัติเชิงพื้นที่ (spatial autocorrelation) จงจับคู่การตรวจสอบเข้ากับการทำนายด้วยการจับคู่ระยะทางเพื่อนบ้านใกล้สุด (nearest-neighbour distance matching) หรือใช้ตัวอย่างเชิงความน่าจะเป็นอิสระ และรายงานเสมอว่าวัดความแม่นยำที่ใด

  9. “ขยายความไม่แน่นอน” มีรูปแบบที่เข้มงวดอยู่: การทำนายเชิงคอนฟอร์มัลให้ช่วงที่ไม่ต้องพึ่งการแจกแจง แต่เฉพาะภายใต้เงื่อนไขการสับเปลี่ยนกันได้ ซึ่งภูมิภาคใหม่ทำลายลง การถ่วงน้ำหนักด้วยอัตราส่วนความหนาแน่นกู้การรับประกันคืนมาได้ ส่วนแถบความคลาดเคลื่อนของแบบจำลองเองช่วยไม่ได้: quantile regression forest จะแคบลงที่ขอบของพิสัยข้อมูลฝึก ไม่ใช่กว้างขึ้น

  10. การขยายโดเมนมีต้นทุนต่ำ ตัวอย่างในพื้นที่ที่เลือกมาดีสิบถึงสามสิบตัวอย่างซ่อมการสอบเทียบสเปกตรัมที่หยิบยืมมาได้ ต้นไม้หกต้นพร้อมค่าก่อนหน้าที่ให้ข้อมูลเทียบเท่าสี่สิบถึงหกสิบต้นที่ไม่มีค่าก่อนหน้า และตัวแปรร่วมที่น้อยกว่ามักถ่ายโอนได้ดีกว่า เพราะกลุ่มเมฆมิติสูงที่เบาบางกว่าย่อมตกออกนอกได้ง่ายกว่า

  11. VM0042 ของ Verra นิยามโดเมนโครงการไว้แล้วว่าคือเงื่อนไขที่การนำแบบจำลองไปใช้ผ่านการตรวจสอบความถูกต้อง และโมดูลคู่กันทำให้ความครอบคลุมของเขตภูมิอากาศ เนื้อดิน และช่วงดินเหนียว 15 จุด ตรวจสอบได้ ส่วนระเบียบว่าด้วยการกำจัดคาร์บอนของสหภาพยุโรป ตรงข้ามกับที่มักอ้างกัน ไม่ได้กำหนดอะไรทำนองนั้นเลย

เอกสารอ้างอิง

  • 1.Netzeva, T.I. et al. (2005). Current status of methods for defining the applicability domain of (quantitative) structure-activity relationships. ATLA Alternatives to Laboratory Animals, 33(2), 155–173. doi:10.1177/026119290503300209
  • 2.Jaworska, J., Nikolova-Jeliazkova, N., Aldenberg, T. (2005). QSAR applicability domain estimation by projection of the training set in descriptor space, a review. ATLA, 33(5), 445–459. doi:10.1177/026119290503300508
  • 3.Meyer, H., Pebesma, E. (2021). Predicting into unknown space? Estimating the area of applicability of spatial prediction models. Methods in Ecology and Evolution, 12(9), 1620–1633. doi:10.1111/2041-210X.13650
  • 4.Meyer, H., Pebesma, E. (2022). Machine learning-based global maps of ecological variables and the challenge of assessing them. Nature Communications, 13, 2208. doi:10.1038/s41467-022-29838-9
  • 5.Ploton, P. et al. (2020). Spatial validation reveals poor predictive performance of large-scale ecological mapping models. Nature Communications, 11, 4540. doi:10.1038/s41467-020-18321-y
  • 6.Roberts, D.R. et al. (2017). Cross-validation strategies for data with temporal, spatial, hierarchical, or phylogenetic structure. Ecography, 40(8), 913–929. doi:10.1111/ecog.02881
  • 7.Wadoux, A.M.J-C., Heuvelink, G.B.M., de Bruin, S., Brus, D.J. (2021). Spatial cross-validation is not the right way to evaluate map accuracy. Ecological Modelling, 457, 109692. doi:10.1016/j.ecolmodel.2021.109692
  • 8.Brus, D.J., Kempen, B., Heuvelink, G.B.M. (2011). Sampling for validation of digital soil maps. European Journal of Soil Science, 62(3), 394–407. doi:10.1111/j.1365-2389.2011.01364.x
  • 9.McBratney, A.B., Mendonça Santos, M.L., Minasny, B. (2003). On digital soil mapping. Geoderma, 117(1–2), 3–52. doi:10.1016/S0016-7061(03)00223-4
  • 10.Sheridan, R.P. et al. (2004). Similarity to molecules in the training set is a good discriminator for prediction accuracy in QSAR. Journal of Chemical Information and Computer Sciences, 44(6), 1912–1928. doi:10.1021/ci049782w
  • 11.Chave, J. et al. (2014). Improved allometric models to estimate the aboveground biomass of tropical trees. Global Change Biology, 20(10), 3177–3190. doi:10.1111/gcb.12629
  • 12.IPCC (2019). 2019 Refinement to the 2006 IPCC Guidelines for National Greenhouse Gas Inventories. Intergovernmental Panel on Climate Change. ipcc.ch
  • 13.Milà, C., Mateu, J., Pebesma, E., Meyer, H. (2022). Nearest neighbour distance matching Leave-One-Out Cross-Validation for map validation. Methods in Ecology and Evolution, 13(6), 1304–1316. doi:10.1111/2041-210X.13851
  • 14.Linnenbrink, J., Milà, C., Ludwig, M., Meyer, H. (2024). kNNDM CV: k-fold nearest-neighbour distance matching cross-validation for map accuracy estimation. Geoscientific Model Development, 17(15), 5897–5912. doi:10.5194/gmd-17-5897-2024
  • 15.Schumacher, F.L., Knoth, C., Ludwig, M., Meyer, H. (2025). Estimation of local training data point densities to support the assessment of spatial prediction uncertainty. Geoscientific Model Development, 18(24), 10185–10202. doi:10.5194/gmd-18-10185-2025
  • 16.Mesgaran, M.B., Cousens, R.D., Webber, B.L. (2014). Here be dragons: a tool for quantifying novelty due to covariate range and correlation change when projecting species distribution models. Diversity and Distributions, 20(10), 1147–1159. doi:10.1111/ddi.12209
  • 17.Elith, J., Kearney, M., Phillips, S. (2010). The art of modelling range-shifting species. Methods in Ecology and Evolution, 1(4), 330–342. doi:10.1111/j.2041-210X.2010.00036.x
  • 18.Lei, J., G'Sell, M., Rinaldo, A., Tibshirani, R.J., Wasserman, L. (2018). Distribution-free predictive inference for regression. Journal of the American Statistical Association, 113(523), 1094–1111. doi:10.1080/01621459.2017.1307116
  • 19.Tibshirani, R.J., Foygel Barber, R., Candès, E.J., Ramdas, A. (2019). Conformal prediction under covariate shift. Advances in Neural Information Processing Systems 32. arXiv:1904.06019
  • 20.Romano, Y., Patterson, E., Candès, E.J. (2019). Conformalized quantile regression. Advances in Neural Information Processing Systems 32. arXiv:1905.03222
  • 21.Vovk, V. (2012). Conditional validity of inductive conformal predictors. Proceedings of the Asian Conference on Machine Learning, PMLR 25, 475–490. proceedings.mlr.press
  • 22.Lopez-Paz, D., Oquab, M. (2017). Revisiting classifier two-sample tests. International Conference on Learning Representations. arXiv:1610.06545
  • 23.Ben-David, S., Blitzer, J., Crammer, K., Kulesza, A., Pereira, F., Vaughan, J.W. (2010). A theory of learning from different domains. Machine Learning, 79(1–2), 151–175. doi:10.1007/s10994-009-5152-4
  • 24.Shimodaira, H. (2000). Improving predictive inference under covariate shift by weighting the log-likelihood function. Journal of Statistical Planning and Inference, 90(2), 227–244. doi:10.1016/S0378-3758(00)00115-4
  • 25.Sugiyama, M., Suzuki, T., Nakajima, S., Kashima, H., von Bünau, P., Kawanabe, M. (2008). Direct importance estimation for covariate shift adaptation. Annals of the Institute of Statistical Mathematics, 60(4), 699–746. doi:10.1007/s10463-008-0197-x
  • 26.Kish, L. (1965). Survey Sampling. John Wiley & Sons, New York. The effective sample size used here is the algebraic restatement of Kish's unequal-weighting design effect.
  • 27.Dega, S., Dietrich, P., Schrön, M., Paasche, H. (2023). Probabilistic prediction by means of the propagation of response variable uncertainty through a Monte Carlo approach in regression random forest. Frontiers in Environmental Science, 11, 1009191. doi:10.3389/fenvs.2023.1009191
  • 28.Hateffard, F., Steinbuch, L., Heuvelink, G.B.M. (2024). Evaluating the extrapolation potential of random forest digital soil mapping. Geoderma, 441, 116740. doi:10.1016/j.geoderma.2023.116740
  • 29.Minasny, B., McBratney, A.B. (2006). A conditioned Latin hypercube method for sampling in the presence of ancillary information. Computers & Geosciences, 32(9), 1378–1388. doi:10.1016/j.cageo.2005.12.009
  • 30.Ma, T., Brus, D.J., Zhu, A.-X., Zhang, L., Scholten, T. (2020). Comparison of conditioned Latin hypercube and feature space coverage sampling for predicting soil classes using simulation from soil maps. Geoderma, 370, 114366. doi:10.1016/j.geoderma.2020.114366
  • 31.Wadoux, A.M.J-C., Brus, D.J., Heuvelink, G.B.M. (2019). Sampling design optimization for soil mapping with a random forest. Geoderma, 355, 113913. doi:10.1016/j.geoderma.2019.113913
  • 32.Seidel, M. et al. (2019). Strategies for the efficient estimation of soil organic carbon at the field scale with vis-NIR spectroscopy: Spectral libraries and spiking vs. local calibrations. Geoderma, 354, 113856. doi:10.1016/j.geoderma.2019.07.014
  • 33.Guy, A.L., Siciliano, S.D., Lamb, E.G. (2015). Spiking regional vis-NIR calibration models with local samples to predict soil organic carbon in two High Arctic polar deserts using a vis-NIR probe. Canadian Journal of Soil Science, 95(3), 237–249. doi:10.4141/cjss-2015-004
  • 34.Lobsey, C.R., Viscarra Rossel, R.A., Roudier, P., Hedley, C.B. (2017). rs-local data-mines information from spectral libraries to improve local calibrations. European Journal of Soil Science, 68(6), 840–852. doi:10.1111/ejss.12490
  • 35.Zapata-Cuartas, M., Sierra, C.A., Alleman, L. (2012). Probability distribution of allometric coefficients and Bayesian estimation of aboveground tree biomass. Forest Ecology and Management, 277, 173–179. doi:10.1016/j.foreco.2012.04.030
  • 36.Ngomanda, A. et al. (2014). Site-specific versus pantropical allometric equations: Which option to estimate the biomass of a moist central African forest?. Forest Ecology and Management, 312, 1–9. doi:10.1016/j.foreco.2013.10.029
  • 37.Duncanson, L., Rourke, O., Dubayah, R. (2015). Small sample sizes yield biased allometric equations in temperate forests. Scientific Reports, 5, 17153. doi:10.1038/srep17153
  • 38.Schoch, J., Nussbaum, M., Walthert, L., Carminati, A., Lehmann, P. (2025). Transferability of pedotransfer functions for estimating soil hydraulic properties: An analysis of controlling factors for forest soils in Switzerland. Geoderma, 460, 117397. doi:10.1016/j.geoderma.2025.117397
  • 39.de Bruin, S., Brus, D.J., Heuvelink, G.B.M., van Ebbenhorst Tengbergen, T., Wadoux, A.M.J.-C. (2022). Dealing with clustered samples for assessing map accuracy by cross-validation. Ecological Informatics, 69, 101665. doi:10.1016/j.ecoinf.2022.101665
  • 40.Verra (2025). VM0042 Methodology for Improved Agricultural Land Management, v2.2, and VMD0053 Model Calibration, Validation and Uncertainty Guidance for Biogeochemical Modeling, v2.1. Verified Carbon Standard. verra.org
  • 41.Meinshausen, N. (2006). Quantile regression forests. Journal of Machine Learning Research, 7(35), 983–999. jmlr.org

Share this article

LinkedInEmail