กลับไปหน้าบทความ

อ่าน 2 นาที

การเลือกคุณลักษณะที่มีความซ้ำซ้อนน้อยที่สุด

อัลกอริธึมการเรียนรู้ของเครื่อง

การเลือกคุณลักษณะที่มีความซ้ำซ้อนน้อยที่สุดเป็นอัลกอริธึมที่ใช้บ่อยในวิธีการระบุลักษณะของยีนและฟีโนไทป์ ได้อย่างแม่นยำ และลดความเกี่ยวข้องลง...

การเลือกคุณลักษณะที่มีความซ้ำซ้อนน้อยที่สุด

การเลือกคุณลักษณะที่มีความซ้ำซ้อนน้อยที่สุดเป็นอัลกอริธึมที่ใช้บ่อยในวิธีการระบุลักษณะของยีนและฟีโนไทป์ ได้อย่างแม่นยำ และลดความเกี่ยวข้องลง และมักจะอธิบายโดยการจับคู่กับการเลือกคุณลักษณะที่เกี่ยวข้องในชื่อMinimum Redundancy Maximum Relevance (mRMR) วิธีนี้ได้รับการเสนอครั้งแรกในปี 2546 โดย Hanchuan Peng และ Chris Ding [ 1 ]ตามด้วยการกำหนดสูตรทางทฤษฎีโดยอิงจากข้อมูลร่วมกัน พร้อมกับคำจำกัดความแรกของข้อมูลร่วมกันแบบหลายตัวแปร ซึ่งตีพิมพ์ใน IEEE Trans. Pattern Analysis and Machine Intelligence ในปี 2548 [ 2 ]

การเลือกคุณลักษณะซึ่งเป็นหนึ่งในปัญหาพื้นฐานของการรู้จำรูปแบบและการเรียนรู้ของเครื่องจักรคือการระบุชุดย่อยของข้อมูลที่เกี่ยวข้องกับพารามิเตอร์ที่ใช้ และโดยปกติเรียกว่าความเกี่ยวข้องสูงสุด (Maximum Relevanceหรือ mRMR) ชุดย่อยเหล่านี้มักมีข้อมูลที่เกี่ยวข้องแต่ซ้ำซ้อน และ mRMR พยายามแก้ไขปัญหานี้โดยการลบชุดย่อยที่ซ้ำซ้อนเหล่านั้นออก mRMR มีการใช้งานที่หลากหลายในหลายด้าน เช่นการวินิจฉัยโรคมะเร็งและการรู้จำเสียงพูด

สามารถเลือกคุณลักษณะได้หลายวิธี วิธีหนึ่งคือการเลือกคุณลักษณะที่มีความสัมพันธ์ strongest กับ ตัวแปรการ จำแนกประเภทซึ่งเรียกว่าการเลือกตามความเกี่ยวข้องสูงสุด (maximum-relevance selection) นอกจากนี้ยัง สามารถใช้ อัลกอริธึมแบบฮิวริสติก ได้หลาย วิธี เช่น การเลือกแบบลำดับไปข้างหน้า การเลือกแบบย้อนกลับ หรือการเลือกแบบลอยตัว

ในทางกลับกัน สามารถเลือกคุณลักษณะที่อยู่ห่างไกลกันมากได้ แต่ยังคงมีความสัมพันธ์ "สูง" กับตัวแปรการจำแนกประเภท วิธีการนี้เรียกว่า การเลือกแบบความซ้ำซ้อนน้อยที่สุด ความเกี่ยวข้องสูงสุด (Minimum Redundancy Maximum Relevance : mRMR) ซึ่งพบว่ามีประสิทธิภาพมากกว่าการเลือกแบบความเกี่ยวข้องสูงสุด (Maximum Relevance Selection)

ในกรณีพิเศษ "ความสัมพันธ์" สามารถแทนที่ด้วยความสัมพันธ์เชิงสถิติระหว่างตัวแปรได้ข้อมูลร่วม (Mutual information)สามารถใช้ในการวัดปริมาณความสัมพันธ์ได้ ในกรณีนี้ แสดงให้เห็นว่า mRMR เป็นค่าประมาณของการเพิ่มความสัมพันธ์ให้สูงสุดระหว่างการแจกแจงร่วมของคุณลักษณะที่เลือกและตัวแปรการจำแนกประเภท

การศึกษาวิจัยได้ลองใช้มาตรการต่างๆ สำหรับความซ้ำซ้อนและมาตรการความเกี่ยวข้อง การศึกษาวิจัยล่าสุดได้เปรียบเทียบมาตรการหลายอย่างในบริบทของภาพทางการแพทย์[ 3 ]

  • Peng, HC, Long, F. และ Ding, C. " การเลือกคุณลักษณะโดยอาศัยข้อมูลร่วมกัน: เกณฑ์การพึ่งพาสูงสุด ความเกี่ยวข้องสูงสุด และความซ้ำซ้อนต่ำสุด ," IEEE Transactions on Pattern Analysis and Machine Intelligence, Vol. 27, No. 8, pp.  1226–1238, 2005.
  • Chris Ding และ Hanchuan Peng, " การเลือกคุณลักษณะที่มีความซ้ำซ้อนน้อยที่สุดจากข้อมูลการแสดงออกของยีนไมโครอาร์เรย์ " การประชุม IEEE Computer Society Bioinformatics ครั้งที่ 2 (CSB 2003), 11–14 สิงหาคม 2546, สแตนฟอร์ด, แคลิฟอร์เนีย, สหรัฐอเมริกา หน้า 523–529
  • เพ็งแล็บ เอ็มอาร์เอ็มอาร์
ดึงข้อมูลมาจาก " https://en.wikipedia.org/w/index.php?title=Minimum_redundancy_feature_selection&oldid=1288241730 "

สรุปเนื้อหา

ข้อมูลสำคัญจากบทความ

ข้อมูลสำคัญเกี่ยวกับ การเลือกคุณลักษณะที่มีความซ้ำซ้อนน้อยที่สุด

การเลือกคุณลักษณะที่มีความซ้ำซ้อนน้อยที่สุดเป็นอัลกอริธึมที่ใช้บ่อยในวิธีการระบุลักษณะของยีนและฟีโนไทป์ ได้อย่างแม่นยำ และลดความเกี่ยวข้องลง...

ลิงก์ภายนอก

Peng, HC, Long, F. และ Ding, C. " การเลือกคุณลักษณะโดยอาศัยข้อมูลร่วมกัน: เกณฑ์การพึ่งพาสูงสุด ความเกี่ยวข้องสูงสุด และความซ้ำซ้อนต่ำสุด ," IEEE Transactions on Pattern Analysis and Machine Intelligence, Vol. 27, No. 8, pp. 1226–1238, 2005.