การเลือกคุณลักษณะที่มีความซ้ำซ้อนน้อยที่สุด
การเลือกคุณลักษณะที่มีความซ้ำซ้อนน้อยที่สุดเป็นอัลกอริธึมที่ใช้บ่อยในวิธีการระบุลักษณะของยีนและฟีโนไทป์ ได้อย่างแม่นยำ และลดความเกี่ยวข้องลง และมักจะอธิบายโดยการจับคู่กับการเลือกคุณลักษณะที่เกี่ยวข้องในชื่อMinimum Redundancy Maximum Relevance (mRMR) วิธีนี้ได้รับการเสนอครั้งแรกในปี 2546 โดย Hanchuan Peng และ Chris Ding [ 1 ]ตามด้วยการกำหนดสูตรทางทฤษฎีโดยอิงจากข้อมูลร่วมกัน พร้อมกับคำจำกัดความแรกของข้อมูลร่วมกันแบบหลายตัวแปร ซึ่งตีพิมพ์ใน IEEE Trans. Pattern Analysis and Machine Intelligence ในปี 2548 [ 2 ]
การเลือกคุณลักษณะซึ่งเป็นหนึ่งในปัญหาพื้นฐานของการรู้จำรูปแบบและการเรียนรู้ของเครื่องจักรคือการระบุชุดย่อยของข้อมูลที่เกี่ยวข้องกับพารามิเตอร์ที่ใช้ และโดยปกติเรียกว่าความเกี่ยวข้องสูงสุด (Maximum Relevanceหรือ mRMR) ชุดย่อยเหล่านี้มักมีข้อมูลที่เกี่ยวข้องแต่ซ้ำซ้อน และ mRMR พยายามแก้ไขปัญหานี้โดยการลบชุดย่อยที่ซ้ำซ้อนเหล่านั้นออก mRMR มีการใช้งานที่หลากหลายในหลายด้าน เช่นการวินิจฉัยโรคมะเร็งและการรู้จำเสียงพูด
สามารถเลือกคุณลักษณะได้หลายวิธี วิธีหนึ่งคือการเลือกคุณลักษณะที่มีความสัมพันธ์ strongest กับ ตัวแปรการ จำแนกประเภทซึ่งเรียกว่าการเลือกตามความเกี่ยวข้องสูงสุด (maximum-relevance selection) นอกจากนี้ยัง สามารถใช้ อัลกอริธึมแบบฮิวริสติก ได้หลาย วิธี เช่น การเลือกแบบลำดับไปข้างหน้า การเลือกแบบย้อนกลับ หรือการเลือกแบบลอยตัว
ในทางกลับกัน สามารถเลือกคุณลักษณะที่อยู่ห่างไกลกันมากได้ แต่ยังคงมีความสัมพันธ์ "สูง" กับตัวแปรการจำแนกประเภท วิธีการนี้เรียกว่า การเลือกแบบความซ้ำซ้อนน้อยที่สุด ความเกี่ยวข้องสูงสุด (Minimum Redundancy Maximum Relevance : mRMR) ซึ่งพบว่ามีประสิทธิภาพมากกว่าการเลือกแบบความเกี่ยวข้องสูงสุด (Maximum Relevance Selection)
ในกรณีพิเศษ "ความสัมพันธ์" สามารถแทนที่ด้วยความสัมพันธ์เชิงสถิติระหว่างตัวแปรได้ข้อมูลร่วม (Mutual information)สามารถใช้ในการวัดปริมาณความสัมพันธ์ได้ ในกรณีนี้ แสดงให้เห็นว่า mRMR เป็นค่าประมาณของการเพิ่มความสัมพันธ์ให้สูงสุดระหว่างการแจกแจงร่วมของคุณลักษณะที่เลือกและตัวแปรการจำแนกประเภท
การศึกษาวิจัยได้ลองใช้มาตรการต่างๆ สำหรับความซ้ำซ้อนและมาตรการความเกี่ยวข้อง การศึกษาวิจัยล่าสุดได้เปรียบเทียบมาตรการหลายอย่างในบริบทของภาพทางการแพทย์[ 3 ]
ลิงก์ภายนอก
- Peng, HC, Long, F. และ Ding, C. " การเลือกคุณลักษณะโดยอาศัยข้อมูลร่วมกัน: เกณฑ์การพึ่งพาสูงสุด ความเกี่ยวข้องสูงสุด และความซ้ำซ้อนต่ำสุด ," IEEE Transactions on Pattern Analysis and Machine Intelligence, Vol. 27, No. 8, pp. 1226–1238, 2005.
- Chris Ding และ Hanchuan Peng, " การเลือกคุณลักษณะที่มีความซ้ำซ้อนน้อยที่สุดจากข้อมูลการแสดงออกของยีนไมโครอาร์เรย์ " การประชุม IEEE Computer Society Bioinformatics ครั้งที่ 2 (CSB 2003), 11–14 สิงหาคม 2546, สแตนฟอร์ด, แคลิฟอร์เนีย, สหรัฐอเมริกา หน้า 523–529
- เพ็งแล็บ เอ็มอาร์เอ็มอาร์