การขุดข้อมูลเชิงวิวัฒนาการ
การขุดข้อมูลเชิงวิวัฒนาการหรือการขุดข้อมูลเชิงพันธุกรรมเป็นคำรวมสำหรับการขุดข้อมูล ใดๆ ที่ใช้อัลกอริทึมเชิงวิวัฒนาการแม้ว่าจะสามารถใช้สำหรับการขุดข้อมูลจากลำดับดีเอ็นเอได้[ 1 ]แต่ก็ไม่ได้จำกัดเฉพาะบริบททางชีววิทยา และสามารถใช้ในสถานการณ์การทำนายตามการจำแนกประเภทใดๆ ซึ่งช่วย "ทำนายค่า ... ของคุณลักษณะเป้าหมายที่ผู้ใช้ระบุโดยอิงจากค่าของคุณลักษณะอื่นๆ" [ 2 ]ตัวอย่างเช่น สถาบันการธนาคารอาจต้องการทำนายว่าเครดิต ของลูกค้า จะ "ดี" หรือ "แย่" โดยพิจารณาจากอายุ รายได้ และเงินออมในปัจจุบัน[ 2 ]อัลกอริทึมเชิงวิวัฒนาการสำหรับการขุดข้อมูลทำงานโดยการสร้างชุดของ กฎ แบบสุ่มเพื่อตรวจสอบกับชุดข้อมูล การ ฝึก อบรม [ 3 ]กฎที่เหมาะสมกับข้อมูลมากที่สุดจะถูกเลือกและกลายพันธุ์[ 3 ]กระบวนการนี้จะทำซ้ำหลายครั้ง และในที่สุด กฎจะเกิดขึ้นที่เข้าใกล้ความคล้ายคลึงกับข้อมูลการฝึกอบรม 100% [ 2 ]จากนั้นกฎนี้จะถูกตรวจสอบกับชุดข้อมูลทดสอบ ซึ่งก่อนหน้านี้มองไม่เห็นสำหรับอัลกอริทึมเชิงพันธุกรรม[ 2 ]
กระบวนการ
การเตรียมข้อมูล
ก่อนที่ฐานข้อมูลจะสามารถขุดหาข้อมูลโดยใช้อัลกอริธึมเชิงวิวัฒนาการได้ ฐานข้อมูลจะต้องได้รับการทำความสะอาดก่อน[ 2 ]ซึ่งหมายความว่าข้อมูลที่ไม่สมบูรณ์ มีสัญญาณรบกวน หรือไม่สอดคล้องกันจะต้องได้รับการแก้ไข จำเป็นอย่างยิ่งที่จะต้องทำเช่นนี้ก่อนที่จะเริ่มการขุด เนื่องจากจะช่วยให้อัลกอริธึมสร้างผลลัพธ์ที่แม่นยำยิ่งขึ้น[ 3 ]
หากข้อมูลมาจากฐานข้อมูลมากกว่าหนึ่งแห่ง สามารถบูรณาการหรือรวมเข้าด้วยกันได้ ณ จุดนี้[ 3 ]เมื่อต้องจัดการกับชุดข้อมูลขนาดใหญ่ อาจเป็นประโยชน์ที่จะลดปริมาณข้อมูลที่ต้องจัดการลงด้วย[ 3 ]วิธีการลดข้อมูลที่ใช้กันทั่วไปวิธีหนึ่งคือการ สุ่มตัวอย่างข้อมูล ที่เป็นมาตรฐานจากฐานข้อมูล ส่งผลให้ได้ผลลัพธ์ที่เร็วขึ้นมาก แต่ยังคงเทียบเท่าทางสถิติ[ 3 ]
ณ จุดนี้ ข้อมูลจะถูกแบ่งออกเป็นสองส่วนที่เท่ากันแต่แยกจากกันโดยสิ้นเชิง คือ ชุดข้อมูลทดสอบและชุดข้อมูลฝึกฝน[ 2 ]ชุดข้อมูลฝึกฝนจะถูกใช้เพื่อพัฒนากฎให้ตรงกับชุดข้อมูลฝึกฝนอย่างใกล้ชิด[ 2 ]จากนั้นชุดข้อมูลทดสอบจะยืนยันหรือปฏิเสธกฎเหล่านี้[ 2 ]
การขุดข้อมูล
อัลกอริทึมเชิงวิวัฒนาการทำงานโดยพยายามเลียนแบบวิวัฒนาการ ตาม ธรรมชาติ[ 3 ]ขั้นแรก ชุด "กฎ" แบบสุ่มจะถูกตั้งไว้บนชุดข้อมูลฝึกฝน ซึ่งพยายามสรุปข้อมูลให้เป็นสูตร[ 3 ]กฎเหล่านี้จะถูกตรวจสอบ และกฎที่เหมาะสมกับข้อมูลมากที่สุดจะถูกเก็บไว้ ส่วนกฎที่ไม่เหมาะสมกับข้อมูลจะถูกทิ้งไป[ 3 ]จากนั้นกฎที่ถูกเก็บไว้จะถูกกลายพันธุ์และคูณเพื่อสร้างกฎใหม่[ 3 ]
กระบวนการนี้จะทำซ้ำตามความจำเป็นเพื่อสร้างกฎที่ตรงกับชุดข้อมูลให้ใกล้เคียงที่สุด[ 3 ]เมื่อได้กฎนี้แล้ว จะทำการตรวจสอบกับชุดข้อมูลทดสอบ[ 2 ]หากกฎยังคงตรงกับข้อมูล แสดงว่ากฎนั้นถูกต้องและจะถูกเก็บไว้[ 2 ]หากไม่ตรงกับข้อมูล กฎนั้นจะถูกทิ้งและกระบวนการจะเริ่มต้นใหม่โดยการเลือกกฎแบบสุ่มอีกครั้ง[ 2 ]