สถิติแบบไม่ใช้พารามิเตอร์
สถิติแบบไม่ใช้พารามิเตอร์เป็นประเภทของการวิเคราะห์ทางสถิติที่ตั้งสมมติฐานน้อยที่สุดเกี่ยวกับการกระจาย พื้นฐาน ของข้อมูลที่กำลังศึกษา โดยทั่วไปแบบจำลองเหล่านี้จะมีมิติอนันต์ แทนที่จะเป็นมิติจำกัด เช่นเดียวกับสถิติแบบใช้พารามิเตอร์ [ 1 ] สถิติแบบไม่ใช้พารามิเตอร์สามารถใช้สำหรับสถิติเชิงพรรณนาหรือการอนุมานทางสถิติการทดสอบแบบไม่ใช้พารามิเตอร์มักใช้เมื่อสมมติฐานของการทดสอบแบบใช้พารามิเตอร์ถูกละเมิดอย่างชัดเจน[ 2 ]
คำจำกัดความ
คำว่า "สถิติแบบไม่ใช้พารามิเตอร์" ได้รับการนิยามอย่างไม่แม่นยำในสองลักษณะดังต่อไปนี้:
ความหมายแรกของคำว่า"ไม่พาราเมตริก"เกี่ยวข้องกับเทคนิคที่ไม่ต้องอาศัยข้อมูลที่อยู่ในตระกูลการแจกแจงความน่าจะเป็นแบบพาราเมตริกใดๆ ซึ่งรวมถึงเทคนิคต่างๆ ดังต่อไปนี้:
- วิธีการที่ไม่ขึ้นกับการกระจายตัวของข้อมูล ซึ่งไม่ขึ้นอยู่กับสมมติฐานว่าข้อมูลนั้นได้มาจากตระกูลการกระจายความน่าจะเป็น แบบพาราเมตริก ที่ กำหนดไว้
- สถิติถูกนิยามว่าเป็นฟังก์ชันของตัวอย่าง โดยไม่ขึ้นอยู่กับพารามิเตอร์ ใด ๆ
ตัวอย่างหนึ่งคือสถิติเรียงลำดับซึ่งอิงตามการจัดอันดับตามลำดับของข้อมูลสังเกตการณ์
การอภิปรายต่อไปนี้นำมาจากทฤษฎีสถิติขั้นสูงของ Kendall [ 3 ]
สมมติฐานทางสถิติเกี่ยวข้องกับพฤติกรรมของตัวแปรสุ่มที่สังเกตได้... ตัวอย่างเช่น สมมติฐาน (ก) ที่ว่าการแจกแจงแบบปกติมีค่าเฉลี่ยและความแปรปรวนที่ระบุไว้ เป็นสมมติฐานทางสถิติ เช่นเดียวกับสมมติฐาน (ข) ที่ว่าการแจกแจงนั้นมีค่าเฉลี่ยที่กำหนดแต่ความแปรปรวนไม่ระบุ เช่นเดียวกับสมมติฐาน (ค) ที่ว่าการแจกแจงนั้นมีรูปแบบปกติโดยที่ทั้งค่าเฉลี่ยและความแปรปรวนไม่ระบุ และสุดท้าย สมมติฐาน (ง) ที่ว่าการแจกแจงต่อเนื่องสองแบบที่ไม่ระบุนั้นเหมือนกัน ก็เป็นสมมติฐานทางสถิติเช่นกัน
จะสังเกตได้ว่าในตัวอย่าง (a) และ (b) การกระจายตัวของข้อมูลที่สังเกตได้นั้นถือว่าเป็นรูปแบบหนึ่ง (แบบปกติ) และสมมติฐานนั้นเกี่ยวข้องกับค่าของพารามิเตอร์หนึ่งตัวหรือทั้งสองตัวเท่านั้น สมมติฐานเช่นนี้ ด้วยเหตุผลที่ชัดเจน จึงเรียกว่าสมมติฐานแบบพาราเมตริก
สมมติฐาน (c) มีลักษณะที่แตกต่างออกไป เนื่องจากไม่มีการระบุค่าพารามิเตอร์ใดๆ ในข้อความของสมมติฐาน เราอาจเรียกสมมติฐานดังกล่าวว่า สมมติฐานแบบไม่ใช้พารามิเตอร์ (nonparametric ) ได้อย่างเหมาะสม สมมติฐาน (d) ก็เป็นสมมติฐานแบบไม่ใช้พารามิเตอร์เช่นกัน แต่ยิ่งไปกว่านั้น ยังไม่ได้ระบุรูปแบบพื้นฐานของการแจกแจง และอาจเรียกได้ว่า สมมติฐานแบบไม่ขึ้นกับการแจกแจง ( distribution-free ) ได้อย่างเหมาะสม แม้จะมีความแตกต่างเหล่านี้ แต่ในเอกสารทางสถิติโดยทั่วไปมักใช้คำว่า "ไม่ใช้พารามิเตอร์" กับวิธีการทดสอบที่เราเพิ่งเรียกว่า "ไม่ขึ้นกับการแจกแจง" ซึ่งทำให้สูญเสียการจำแนกประเภทที่มีประโยชน์ไป
ความหมายที่สองของคำว่า"ไม่ใช้พารามิเตอร์"เกี่ยวข้องกับเทคนิคที่ไม่ถือว่าโครงสร้างของแบบจำลองนั้นคงที่ โดยทั่วไปแล้ว แบบจำลองจะมีขนาดใหญ่ขึ้นเพื่อรองรับความซับซ้อนของข้อมูล ในเทคนิคเหล่านี้ ตัวแปรแต่ละตัว มัก จะถือว่าอยู่ในกลุ่มการแจกแจงแบบพารามิเตอร์ และมีการตั้งสมมติฐานเกี่ยวกับประเภทของความสัมพันธ์ระหว่างตัวแปรด้วย เทคนิคเหล่านี้ได้แก่:
- การถดถอยแบบไม่ใช้พารามิเตอร์คือการสร้างแบบจำลองที่พิจารณาโครงสร้างความสัมพันธ์ระหว่างตัวแปรโดยไม่ใช้พารามิเตอร์ แต่กระนั้นก็อาจมีการตั้งสมมติฐานแบบพารามิเตอร์เกี่ยวกับการกระจายของค่าความคลาดเคลื่อนของแบบจำลองได้
- แบบจำลองเบย์เซียนแบบลำดับชั้นที่ไม่ใช้พารามิเตอร์เช่น แบบจำลองที่อิงตามกระบวนการ Dirichletซึ่งอนุญาตให้จำนวนตัวแปรแฝงเพิ่มขึ้นได้ตามความจำเป็นเพื่อให้เหมาะสมกับข้อมูล แต่ตัวแปรแต่ละตัวยังคงเป็นไปตามการแจกแจงแบบพารามิเตอร์ และแม้แต่กระบวนการที่ควบคุมอัตราการเติบโตของตัวแปรแฝงก็ยังเป็นไปตามการแจกแจงแบบพารามิเตอร์
การใช้งานและวัตถุประสงค์
วิธีการทางสถิติแบบไม่พาราเมตริกถูกนำมาใช้กันอย่างแพร่หลายในการศึกษาประชากรที่มีลำดับ (เช่น บทวิจารณ์ภาพยนตร์ที่ได้รับคะแนนหนึ่งถึงห้าดาว) การใช้วิธีการทางสถิติแบบไม่พาราเมตริกอาจมีความจำเป็นเมื่อข้อมูลมีลำดับแต่ไม่มี การตีความเชิง ตัวเลข ที่ชัดเจน เช่น เมื่อประเมินความชอบในแง่ของระดับการวัดวิธีการทางสถิติแบบไม่พาราเมตริกจะให้ผลลัพธ์เป็นข้อมูลเชิงลำดับ
เนื่องจากวิธีการแบบไม่ใช้พารามิเตอร์นั้นตั้งสมมติฐานน้อยกว่า จึงสามารถนำไปใช้ได้ทั่วไปมากกว่าวิธีการแบบใช้พารามิเตอร์ โดยเฉพาะอย่างยิ่ง สามารถนำไปใช้ในสถานการณ์ที่ทราบข้อมูลเกี่ยวกับแอปพลิเคชันนั้นๆ น้อย นอกจากนี้ เนื่องจากอาศัยสมมติฐานน้อยกว่า วิธีการแบบไม่ใช้พารามิเตอร์จึงมีความแข็งแกร่งกว่า
วิธีการแบบไม่พาราเมตริกบางครั้งถูกมองว่าใช้งานง่ายกว่าและมีความเสถียรกว่าวิธีการแบบพาราเมตริก แม้ว่าข้อสมมติฐานของวิธีการแบบพาราเมตริกจะถูกต้องก็ตาม เนื่องจากวิธีการแบบไม่พาราเมตริกมีลักษณะทั่วไปมากกว่า ทำให้มีโอกาสน้อยที่จะถูกนำไปใช้ผิดหรือเข้าใจผิด วิธีการแบบไม่พาราเมตริกจึงถือเป็นทางเลือกที่รอบคอบ เพราะจะยังคงใช้งานได้แม้ว่าข้อสมมติฐานจะไม่เป็นไปตามที่กำหนด ในขณะที่วิธีการแบบพาราเมตริกอาจให้ผลลัพธ์ที่ผิดพลาดได้เมื่อข้อสมมติฐานถูกละเมิด
ข้อดีของการทดสอบแบบไม่ใช้พารามิเตอร์คือสามารถนำไป ใช้ได้ในวงกว้างกว่าและมีความแข็งแกร่ง กว่า แต่ ก็มีข้อเสียเช่นกัน กล่าวคือ ในกรณีที่เงื่อนไขของการทดสอบแบบใช้พารามิเตอร์เป็นไปตามที่กำหนด การทดสอบแบบไม่ใช้พารามิเตอร์จะมีกำลังทางสถิติ น้อยกว่า กล่าวอีกนัยหนึ่งคือ อาจต้องใช้ขนาดตัวอย่างที่ใหญ่ขึ้นเพื่อให้ได้ข้อสรุปที่มีระดับความมั่นใจเท่ากัน
แบบจำลองที่ไม่ใช้พารามิเตอร์
แบบจำลองที่ไม่ใช้พารามิเตอร์แตกต่างจาก แบบจำลอง ที่ใช้พารามิเตอร์ตรงที่โครงสร้างของแบบจำลองไม่ได้ถูกกำหนดไว้ล่วงหน้าแต่จะถูกกำหนดจากข้อมูล คำว่า"ไม่ใช้พารามิเตอร์"ไม่ได้หมายความว่าแบบจำลองเหล่านั้นไม่มีพารามิเตอร์เลย แต่หมายความว่าจำนวนและลักษณะของพารามิเตอร์นั้นมีความยืดหยุ่นและไม่ตายตัว
- ฮิสโตแกรม : การประมาณค่าแบบไม่ใช้พารามิเตอร์อย่างง่ายของความน่าจะเป็น
- การประมาณความหนาแน่นเคอร์เนล : วิธีการประมาณการแจกแจงความน่าจะเป็น ซึ่งมักอาศัยการหาค่าเฉลี่ยเฉพาะที่
- การปรับเส้นโค้งให้เรียบ : วิธีการถดถอยโดยใช้เส้นโค้งสปลายน์
- การวิเคราะห์การห่อหุ้มข้อมูล (Data Envelopment Analysis: DEA) : ให้ค่าสัมประสิทธิ์ประสิทธิภาพที่คล้ายคลึงกับที่ได้จากการวิเคราะห์หลายตัวแปรโดยไม่ต้องตั้งสมมติฐานเกี่ยวกับลักษณะการกระจายตัวของ ข้อมูล
- k-nearest neighbors (kNN) : จำแนกตัวอย่างที่ไม่เคยเห็นมาก่อนโดยอาศัยจุด k จุดในชุดข้อมูลฝึกฝนที่อยู่ใกล้ที่สุดกับตัวอย่างนั้น
- เครื่องเรียนรู้แบบเวกเตอร์สนับสนุน (โดยใช้เคอร์เนลแบบเกาส์เซียน): ตัวจำแนกแบบไม่ใช้พารามิเตอร์ที่มีขอบเขตขนาดใหญ่
- วิธีโมเมนต์ : ตัวประมาณค่าสำหรับค่าเดียว เช่นค่าเฉลี่ยหรือความแปรปรวนของการแจกแจง
การทดสอบแบบไม่ใช้พารามิเตอร์
วิธีการทางสถิติเชิงอนุมานแบบไม่ใช้พารามิเตอร์ (หรือแบบไม่ขึ้นกับการกระจายตัว ) คือกระบวนการทางคณิตศาสตร์สำหรับการทดสอบสมมติฐานทางสถิติ ซึ่งแตกต่างจากสถิติแบบใช้พารามิเตอร์ตรงที่ไม่ตั้งสมมติฐานใดๆ เกี่ยวกับการกระจายความน่าจะเป็นของตัวแปรที่กำลังประเมิน การทดสอบที่ใช้บ่อยที่สุด ได้แก่
- การวิเคราะห์ความคล้ายคลึงกัน
- การทดสอบแอนเดอร์สัน-ดาร์ลิง : ใช้ทดสอบว่าตัวอย่างที่สุ่มมานั้นมาจากกลุ่มตัวอย่างที่กำหนดหรือไม่
- วิธีการบูตสแตรปทางสถิติ : ประมาณค่าความแม่นยำ/การกระจายตัวอย่างของสถิติ
- การทดสอบไคสแควร์
- Cochran's Q : ใช้ทดสอบว่า การรักษา kวิธีในการออกแบบการทดลองแบบบล็อกสุ่มที่มีผลลัพธ์ 0/1 นั้นให้ผลลัพธ์ที่เหมือนกัน หรือไม่
- ค่าสัมประสิทธิ์แคปปาของโคเฮน : ใช้วัดความสอดคล้องระหว่างผู้ประเมินสำหรับรายการประเภทจัดกลุ่ม
- การวิเคราะห์ความแปรปรวนแบบสองทางของฟรีดแมน (การวัดซ้ำ)โดยใช้ลำดับ: ทดสอบว่า การรักษา k แบบในการออกแบบบล็อกแบบสุ่มมีผลลัพธ์ที่เหมือนกัน หรือไม่
- ความน่าจะเป็นเชิงประจักษ์
- วิธีการ Kaplan–Meier : ประมาณฟังก์ชันการอยู่รอดจากข้อมูลอายุขัย โดยจำลองการตัดข้อมูล (censoring)
- ค่าเทาของเคนดัลล์ (Kendall's tau) : ใช้วัดความสัมพันธ์ทางสถิติระหว่างตัวแปรสองตัว
- ค่า Kendall's W : ค่าที่ใช้วัดความสอดคล้องระหว่างผู้ประเมินหลายคน ซึ่งมีค่าอยู่ระหว่าง 0 ถึง 1
- การทดสอบ Kolmogorov–Smirnov : ใช้ทดสอบว่าตัวอย่างที่ได้มานั้นมาจากการแจกแจงที่กำหนดหรือไม่ หรือว่าตัวอย่างสองตัวอย่างมาจากการแจกแจงเดียวกันหรือไม่
- การวิเคราะห์ความแปรปรวนแบบทางเดียวของ Kruskal–Wallisโดยใช้ลำดับ: ทดสอบว่าตัวอย่างอิสระมากกว่า 2 ตัวอย่างถูกสุ่มมาจาก1การแจกแจงเดียวกัน หรือไม่
- การทดสอบของ Kuiper : ใช้ทดสอบว่าตัวอย่างที่สุ่มมานั้นมาจากชุดข้อมูลที่กำหนดหรือไม่ โดยมีความไวต่อการเปลี่ยนแปลงตามวัฏจักร เช่น วันในสัปดาห์
- การทดสอบ Logrank : เปรียบเทียบการกระจายการอยู่รอดของตัวอย่างสองกลุ่มที่มีการกระจายแบบเบ้ขวาและถูกตัดตอน
- การทดสอบ Mann–Whitney Uหรือ Wilcoxon rank sum: ใช้ทดสอบว่าตัวอย่างสองตัวอย่างมาจาก1การแจกแจงเดียวกันหรือไม่ เมื่อเปรียบเทียบกับสมมติฐานทางเลือกที่กำหนดให้
- การทดสอบของ McNemar : ใช้ทดสอบว่า ในตารางความสัมพันธ์ 2 × 2 ที่มีลักษณะแบบสองค่าและคู่ตัวอย่างที่จับคู่กัน ความถี่ขอบของแถวและคอลัมน์เท่ากันหรือไม่
- การทดสอบค่ามัธยฐาน : ใช้ทดสอบว่าตัวอย่างสองตัวอย่างมาจากแหล่งกระจายที่มีค่ามัธยฐานเท่ากันหรือไม่
- การทดสอบการเรียงสับเปลี่ยนของพิตแมน : การทดสอบความสำคัญทางสถิติที่ให้ ค่า p ที่แน่นอน โดยการตรวจสอบการเรียงลำดับป้ายกำกับที่เป็นไปได้ทั้งหมด
- ผลิตภัณฑ์จัดอันดับ : ตรวจจับยีนที่มีการแสดงออกแตกต่างกันในการทดลองไมโครอาร์เรย์ที่ทำซ้ำ
- การทดสอบ Siegel–Tukey : การทดสอบเพื่อหาความแตกต่างของขนาดระหว่างสองกลุ่ม
- การทดสอบเครื่องหมาย : ทดสอบว่าตัวอย่างคู่ที่จับคู่กันนั้นมาจากกลุ่มตัวอย่างที่มีค่ามัธยฐานเท่ากันหรือไม่
- สัมประสิทธิ์สหสัมพันธ์ลำดับของสเปียร์แมน : วัดความสัมพันธ์ทางสถิติระหว่างตัวแปรสองตัวโดยใช้ฟังก์ชันโมโนโทนิก
- การทดสอบอันดับกำลังสอง : ใช้ทดสอบความเท่าเทียมกันของความแปรปรวนในสองตัวอย่างขึ้นไป
- การทดสอบ Tukey–Duckworth : ใช้ทดสอบความเท่าเทียมกันของสองการแจกแจงโดยใช้ลำดับ
- การทดสอบ Wald–Wolfowitz runs test : ทดสอบว่าองค์ประกอบในลำดับนั้นเป็นอิสระต่อกัน/สุ่มหรือไม่
- การทดสอบ Wilcoxon signed-rank : ใช้ทดสอบว่าตัวอย่างคู่ที่จับคู่กันนั้นมาจากประชากรที่มีค่าเฉลี่ยลำดับที่แตกต่างกันหรือไม่
- การระบุความพอดีเชิงเส้นสากล: วิธีการที่ไม่ขึ้นกับข้อมูล ค่าผิดปกติ และแบบจำลองการกระจายสัญญาณรบกวน และปราศจากการเติมข้อมูลที่หายไปหรือถูกลบ[ 4 ]
สถิติทางคณิตศาสตร์
ในสถิติเชิงคณิตศาสตร์แบบจำลองที่ไม่ใช้พารามิเตอร์ หมายถึงแบบจำลองที่ไม่ต้องอาศัยสมมติฐานเชิงพารามิเตอร์เกี่ยวกับลักษณะการกระจายของข้อมูลที่ไม่ทราบค่า (ใน ปัญหา การประมาณความหนาแน่น ) หรือฟังก์ชันการถดถอย (ใน ปัญหา การถดถอย ) ในขณะที่เป้าหมายของแบบจำลองเชิงพารามิเตอร์ใดๆ คือการประมาณค่าพารามิเตอร์จำนวนจำกัดแบบจำลองที่ไม่ใช่พาราเมตริกมีเป้าหมายเพื่อประมาณการกระจายข้อมูล/ฟังก์ชันการถดถอยโดยตรง[ 5 ] [ 6 ]
อย่างไรก็ตาม สำหรับการวิเคราะห์ทางคณิตศาสตร์ วิธีการแบบพาราเมตริกและแบบไม่พาราเมตริกนั้นสามารถนำมาประยุกต์ใช้ได้ในบริบทเดียวกัน กล่าวคือ สมมติว่าฟังก์ชันที่จะประมาณค่า (การกระจายข้อมูลหรือฟังก์ชันการถดถอย) เป็นส่วนหนึ่งของเซตของฟังก์ชันที่กำหนดโดยชุดพารามิเตอร์เราจึงค้นหาฟังก์ชัน (ที่วัดได้)ซึ่งประมาณค่าพารามิเตอร์ "ที่แท้จริง" โดยอิงจากจุดข้อมูลความแตกต่างที่สำคัญระหว่างวิธีการแบบพาราเมตริกและแบบไม่พาราเมตริกคือ ในกรณีแรกนั้น...สำหรับบางคนในขณะที่ในกรณีหลังโดยทั่วไปแล้ว คือเซตของฟังก์ชันเป้าหมายที่เป็นไปได้ เช่น เซตของฟังก์ชันต่อเนื่องหรือ เซตของ ฟังก์ชันที่หาอนุพันธ์ได้
คำถามที่เกี่ยวข้องในสาขานี้เกี่ยวกับการสร้างตัวประมาณค่าที่สมเหตุสมผลความสอดคล้องอัตราการบรรจบกันและความเหมาะสมที่สุด และการประมาณค่าแบบปรับตัวได้[ 6 ]
ความสม่ำเสมอ
เช่นเดียวกับในสถิติเชิงพาราเมตริกคุณสมบัติที่พึงประสงค์สำหรับตัวประมาณค่าคือนั่นคือการลู่เข้าสู่ฟังก์ชันเป้าหมายเนื่องจากขนาดตัวอย่างเมื่อค่าเข้าใกล้อนันต์ นั่นคือ ข้อผิดพลาดในการประมาณค่าจะลู่เข้าสู่ศูนย์ โดยปกติแล้ว การประมาณค่าจะวัดในแง่ของ-ระยะห่างปกติระหว่างและเนื่องจากตัวประมาณค่าเป็นฟังก์ชันของข้อมูลที่สุ่มเลือกมาเนื่องจากค่าประมาณเป็นตัวแปรสุ่มเช่นกัน ดังนั้นเราจึงแยกแยะโหมดการลู่เข้าที่แตกต่างกันสองแบบ:
ความสอดคล้องที่อ่อนแอ:.
ความสม่ำเสมอที่แข็งแกร่ง:แทบจะแน่นอน
ถ้าตัวประมาณค่ามีความสอดคล้องกันสำหรับค่ากำลังสองที่สามารถอินทิเกรตได้ ทั้งหมดจากนั้นจึงเรียกว่า มีความสอดคล้อง กันโดยทั่วไป[ 5 ]
ตัวประมาณค่าแบบไม่ใช้พารามิเตอร์ทั่วไปจำนวนมากมีความสอดคล้องกันในระดับอ่อน เช่นตัวประมาณค่า Nadarya-Watson , kNNsและ ตัว ประมาณค่าพหุนามเฉพาะที่ บางตัว [ 5 ]
อัตราการบรรจบกันที่เหมาะสมที่สุดของมินิแม็กซ์
หัวข้อสำคัญในการวิเคราะห์ทางสถิติของตัวประมาณค่าแบบไม่ใช้พารามิเตอร์ คือ ความเร็วในการลู่เข้าสู่ฟังก์ชันเป้าหมายที่แท้จริง and whether the speed is optimal, i.e., the convergence is as fast as possible. The most common way to measure the speed of convergence of an estimator is the minimax convergence rate, which considers the expected loss of the estimator in the worst case scenario. Under certain assumptions on the smoothness of , one can show that there is a minimal convergence rates that no estimator can undercut, and so any estimator achieving this minimal rate is called optimal.
Mathematically speaking, the target function is assumed to belong to some class of functions , called the hypothesis class, inducing a distribution on , and the approximation quality of an estimator is measured by some function . The minimax convergence rate of is a sequence of real numbers for which it holdswhere indicates that the random variables , which draw the data points, have distribution .
A universal lower bound on estimation for a hypothesis class is a sequence for which it holdswhere the infima are taken over all possible estimators (that is, measurable functions) based on observations.
The detailed analysis of nonparametric estimators then separates into the estimation of probability densities and regressions functions.
Density estimation
The setting of density estimation typically involves a normed space of functions , a subset of density functions and independent random variables distributed according to the measure with density , which generates the data.
Minimax lower bounds are known for different pairs of function classes and comparison metrics . Common choices for are:
- : The space of -times differentiable functions with the highest derivative being -Hölder-smooth.
- : The space of Sobolev-smooth functions with square-integrable weak derivatives.
- : The space of Besov-smooth functions.
In fact, the Hölder spaces and the Sobolev spaces are special cases of some Besov spaces, namely for and .[7] Thus, it often suffices to derive lower bounds under Besov-smoothness assumptions.
Common choices for are:[6]
- : The pointwise squared error (MSE).
- : The Mean Integrated Square Error (MISE).
- : The supremum-norm-distance.
- : The Kullback-Leibler divergence of the distributions induced by and .
- : The total variation distance of the distributions induced by and .
- : The Wasserstein- distance of the distributions induced by and .
By Scheffé's theorem, the total variation distance is equivalent to the -distance of and .
| Smoothness class | ||||
|---|---|---|---|---|
| [8] | [9] | [8] | ||
| [10] | - | - | - |
The lower bound of the MISE is sometimes compared to the Cramér–Rao bound from parametric statistics, which is a lower bound for the mean-squared error of regular unbiased estimators of a parameter : where is the Fisher information of the parametric model and is some constant. The nonparametric rate is thus slower than the parametric rate , especially in large dimensions, and approaches the parametric rate as the smoothness of the density tends to infinity.
Kernel density estimators, for instance, achieve the lower bound w.r.t. the MISE under a Sobolev hypothesis class under an appropriate bandwidth choice and is thus minimax optimal.[6] More recently, also score-based generative models have been shown to achieve minimax convergence rates in total variation and in Wasserstein-1 distance for -smooth distributions, , that are bounded away from zero from below.[11]
Regression
In the regression setting, the data arises in pairs . Assuming that the data is independent and identically distributed, and , one can always writewith being the regression function to be estimated and a noise variable fulfilling and . Typically, the independent variables are assumed to have values in the unit cube and to be either determinsitic points on a grid (deterministic design) or uniformly distributed (random design). Thus, .
The above setting applies to binary classification as well. In that case, the observations take only two values, say 0 and 1, such that and given an estimator of , the classifiers are assumed to have the form , that is, they classify a point as 1 if the estimated probability of is greater than (and 0 otherwise). Indeed, many classification methods are of that form, for example logistic regression, linear discriminant analysis, quadratic discriminant analysis, and k-nearest-neighbors, and support vector machines.
Then, for the statistical analysis, the hypothesis class is of the form for some normed space of functions and expectations are taken with respect to the joint distribution of and (or just if the are deterministic).
In nonparametric regression, common choices for are:
- : The space of -times differentiable functions with the highest derivative being -Hölder-smooth.
- : The space of Sobolev-smooth functions with อนุพันธ์อ่อนที่สามารถหาปริพันธ์ได้
ตัวเลือกทั่วไปสำหรับเป็น:
- : ค่าความคลาดเคลื่อนกำลังสองแบบจุดต่อจุด (MSE)
- : เดอะ-บรรทัดฐานที่ -th
- ระยะทางบรรทัดฐานสูงสุด
ภายใต้สมมติฐานทางเทคนิคบางประการ ขอบเขตล่างต่อไปนี้เป็นที่ทราบกันดี
| ระดับความเรียบเนียน | |||
|---|---|---|---|
| [ 6 ] (การออกแบบที่กำหนด) | [ 6 ] [ 12 ] | [ 6 ] [ 12 ] | |
| - | [ 12 ] | [ 12 ] |
ตัวประมาณพหุนามเฉพาะที่บางตัวมีค่าเหมาะสมที่สุดแบบมินิแม็กซ์เมื่อเทียบกับภายใต้สำหรับค่าตามอำเภอใจเมื่อแบนด์วิดท์อยู่ในระดับที่เหมาะสม[ 6 ] kNNsยังเหมาะสมที่สุดในแง่ของค่า MSE ภายใต้และเกี่ยวกับภายใต้เมื่อจำนวนเพื่อนบ้านที่พิจารณามีขนาดตามลำดับและตามลำดับ[ 5 ]
ความสามารถในการปรับตัว
โดยทั่วไปแล้ว การเลือกค่าพารามิเตอร์ของแบบจำลอง (เช่น แบนด์วิดท์สำหรับวิธีการเคอร์เนล หรือจำนวนเพื่อนบ้านสำหรับ kNN) ที่จำเป็นเพื่อให้ได้อัตราการล convergence ที่เหมาะสมที่สุดนั้น มักขึ้นอยู่กับพารามิเตอร์ความเรียบของฟังก์ชันเป้าหมายที่ไม่ทราบค่า ซึ่งหมายความว่า ในทางปฏิบัติ หากไม่มีการประมาณค่าพารามิเตอร์ที่เหมาะสม วิธีการที่กล่าวมาข้างต้นก็จะไม่ใช่วิธีที่ดีที่สุด
แต่สิ่งที่น่าสนใจคือวิธีการที่บรรลุอัตราการล convergence ที่เหมาะสมที่สุดแบบ minimax ไม่เพียงแต่สำหรับพารามิเตอร์ความเรียบเฉพาะตัวหนึ่งเท่านั้น แต่ยังรวมถึงค่าต่างๆ ด้วย ให้คลาสสมมติฐานมีรูปแบบดังนี้(ตัวอย่างเช่นหรือ) และปล่อยให้อัตราการบรรจบกันที่เหมาะสมในจากนั้นจึงเป็นตระกูลของตัวประมาณค่าเรียกว่าปรับตัวได้ในความหมายของมินิแม็กซ์หากมีค่าคงที่อยู่ขึ้นอยู่กับเพียงอย่างเดียวโดยที่[ 6 ]กล่าวอีกนัยหนึ่ง จำเป็นต้องใช้ตัวประมาณค่าแบบปรับตัวได้เพื่อให้ได้อัตราการล convergence แบบ minimax ในทุกกลุ่มสมมติฐานแต่โดยไม่พิจารณาพารามิเตอร์ที่ไม่ทราบค่าเป็นข้อโต้แย้ง ตัวประมาณค่าแบบปรับตัวมักจะเกิดขึ้นจากการใช้ตัวประมาณค่าที่เหมาะสมที่สุดแบบมินิแม็กซ์สำหรับกลุ่มของคลาสสมมติฐาน และโดยการประมาณค่าไฮเปอร์พารามิเตอร์ผ่านกระบวนการระดับสูงกว่า เช่น การประมาณความเสี่ยงที่ไม่เอนเอียงหรือ การตรวจ สอบแบบไขว้[ 5 ] [ 6 ]
ประวัติศาสตร์
สถิติแบบไม่ใช้พารามิเตอร์ในยุคแรกๆ ได้แก่ค่ามัธยฐาน (ศตวรรษที่ 13 หรือก่อนหน้านั้น ใช้ในการประมาณค่าโดยเอ็ดเวิร์ด ไรท์ในปี 1599 ดูค่ามัธยฐาน § ประวัติ ) และการทดสอบเครื่องหมายโดยจอห์น อาร์บัทนอต (1710) ในการวิเคราะห์อัตราส่วนเพศของมนุษย์เมื่อแรกเกิด (ดูการทดสอบเครื่องหมาย § ประวัติ ) [ 13 ] [ 14 ]
ดูเพิ่มเติม
หมายเหตุ
- ↑ "สถิติแบบไม่ใช้พารามิเตอร์ทั้งหมด" Springer Texts in Statistics . 2006. doi : 10.1007/0-387-30623-4 . ISBN 978-0-387-25145-5.
- ↑ Pearce, J; Derrick, B (2019). "การทดสอบเบื้องต้น: ปีศาจแห่งสถิติ?" . Reinvention: An International Journal of Undergraduate Research . 12 (2). doi : 10.31273/reinvention.v12i2.339 .
- ↑ Stuart A., Ord JK, Arnold S. (1999), Kendall's Advanced Theory of Statistics: Volume 2A—Classical Inference and the Linear Model , ฉบับที่หก, §20.2–20.3 ( Arnold ).
- ↑ Adikaram, KKLB; Hussein, MA; Effenberger, M.; Becker, T. (16 พฤศจิกายน 2015). "การระบุความพอดีเชิงเส้นสากล: วิธีการที่ไม่ขึ้นอยู่กับข้อมูล ค่าผิดปกติ และแบบจำลองการกระจายสัญญาณรบกวน และปราศจากการเติมข้อมูลที่ขาดหายหรือถูกลบ" PLOS ONE . 10 (11) e0141486. Bibcode : 2015PLoSO..1041486A . doi : 10.1371/journal.pone.0141486 . ISSN 1932-6203 . PMC 4646355 . PMID 26571035 .
- 1 2 3 4 5กอร์ฟี, ลาสซโล; โคห์เลอร์, ไมเคิล; คริซิซัก, อดัม; เดิน, แฮร์โร (2002) ทฤษฎีการถดถอยแบบไม่อิงพารามิเตอร์แบบไม่มีการกระจาย นิวยอร์ก: สปริงเกอร์-แวร์แลกไอเอสบีเอ็น 0-387-95441-4.
- 1 2 3 4 5 6 7 8 9 10 Tsybakov, Alexandre (2009). บทนำสู่การประมาณค่าแบบไม่ใช้พารามิเตอร์ Springer. ISBN 978-0-387-79051-0.
- ↑ทรีเบล, ฮันส์ (1983) ทฤษฎีปริภูมิฟังก์ชัน . เอกสารทางคณิตศาสตร์ บีร์ฮอเซอร์ แวร์แล็ก. ไอเอสบีเอ็น 9783764313814.
- 1 2 Yang, Yuhong; Barron, Andrew (1999). "การกำหนดอัตราการบรรจบกันแบบมินิแม็กซ์ตามทฤษฎีสารสนเทศ" . Annals of Statistics . 27 (5): 1564– 1599.
- ↑ Niles-Weed, Jonathan; Berthet, Quentin (2022). "การประมาณค่ามินิแม็กซ์ของความหนาแน่นเรียบในระยะทาง Wasserstein" . Annals of Statistics . 50 (3): 1519– 1540.
- ↑ Boyd, David W.; Steele, J. Michael (1978). "ขอบเขตล่างสำหรับอัตราการประมาณความหนาแน่นแบบไม่ใช้พารามิเตอร์" Annals of Statistics . 6 (4): 932– 934.
- ↑ Oko, Kazusato; Akiyama, Shunta; Suzuki, Taiji (2023). "แบบจำลองการแพร่กระจายคือตัวประมาณการการกระจายแบบมินิแม็กซ์ที่เหมาะสมที่สุด" . รายงานการประชุมนานาชาติว่าด้วยการเรียนรู้ของเครื่องจักร ครั้งที่ 40 . 202 : 26517– 26582.
- 1 2 3 4 Nemirovski, Arkadi (2000). หัวข้อในสถิติ แบบไม่ใช้พารามิเตอร์หน้า5–31
- ↑ Conover, WJ (1999), "บทที่ 3.4: การทดสอบเครื่องหมาย", สถิติเชิงปฏิบัติแบบไม่ใช้พารามิเตอร์ ( ฉบับที่สาม), Wiley, หน้า157–176 , ISBN 0-471-16068-7
- ↑ Sprent, P. (1989), วิธีการทางสถิติแบบไม่พาราเมตริกประยุกต์ ( ฉบับที่สอง), Chapman & Hall, ISBN 0-412-44980-3
เอกสารอ้างอิงทั่วไป
- Bagdonavicius, V., Kruopis, J., Nikulin, MS (2011). "การทดสอบแบบไม่ใช้พารามิเตอร์สำหรับข้อมูลที่สมบูรณ์", ISTE & WILEY: ลอนดอนและโฮโบเคน. ISBN 978-1-84821-269-5.
- Corder, GW; Foreman, DI (2014). สถิติแบบไม่ใช้พารามิเตอร์: วิธีการทีละขั้นตอน . Wiley. ISBN 978-1-118-84031-3.
- Gibbons, Jean Dickinson ; Chakraborti, Subhabrata (2003). การอนุมานทางสถิติแบบไม่ใช้พารามิเตอร์ฉบับที่ 4 สำนักพิมพ์ CRC ISBN 0-8247-4052-1.
- Hettmansperger, TP; McKean, JW (1998). วิธีการทางสถิติแบบไม่ใช้พารามิเตอร์ที่ทนทาน . ห้องสมุดสถิติของ Kendall. เล่มที่ 5. ลอนดอน: Edward Arnold . ISBN 0-340-54937-8MR 1604954 และ ISBNด้วย 0-471-19479-4.
- Hollander M., Wolfe DA, Chicken E. (2014). วิธีการทางสถิติแบบไม่ใช้พารามิเตอร์ , John Wiley & Sons.
- เชสกิน, เดวิด เจ. (2003) คู่มือวิธีการทางสถิติแบบพาราเมตริกและไม่พาราเมตริกสำนักพิมพ์ซีอาร์ซีISBN 1-58488-440-1
- วาสเซอร์แมน, แลร์รี (2007). สถิติแบบไม่ใช้พารามิเตอร์ทั้งหมด , สปริงเกอร์. ISBN 0-387-25145-6.