การออกแบบคุณลักษณะ
วิศวกรรมคุณลักษณะเป็นขั้นตอนการประมวลผลล่วงหน้าในการเรียนรู้ของเครื่องแบบมีผู้กำกับดูแลและการสร้างแบบจำลองทางสถิติ[ 1 ]ซึ่งแปลงข้อมูลดิบให้เป็นชุดข้อมูลป้อนเข้าที่มีประสิทธิภาพมากขึ้น ข้อมูลป้อนเข้าแต่ละรายการประกอบด้วยคุณลักษณะหลายอย่างที่เรียกว่าคุณลักษณะการให้ข้อมูลที่เกี่ยวข้องแก่แบบจำลอง วิศวกรรมคุณลักษณะช่วยเพิ่มความแม่นยำในการทำนายและความสามารถในการตัดสินใจอย่างมีนัยสำคัญ[ 2 ] [ 3 ] [ 4 ]
นอกเหนือจากการเรียนรู้ของเครื่องแล้ว หลักการของการสร้างคุณลักษณะยังถูกนำไปใช้ในสาขาวิทยาศาสตร์ต่างๆ รวมถึงฟิสิกส์ ตัวอย่างเช่น นักฟิสิกส์สร้างตัวเลขไร้มิติเช่นเลขเรย์โนลด์ในพลศาสตร์ของไหลเลขนัสเซลต์ในการถ่ายเทความร้อนและเลขอาร์คิมิดีสในการตกตะกอนพวกเขายังพัฒนาการประมาณค่าเบื้องต้นของคำตอบ เช่น คำตอบเชิงวิเคราะห์สำหรับความแข็งแรงของวัสดุในกลศาสตร์[ 5 ]
การจัดกลุ่ม
หนึ่งในการประยุกต์ใช้ของการสร้างคุณลักษณะคือการจัดกลุ่มวัตถุคุณลักษณะหรือวัตถุตัวอย่างในชุดข้อมูล โดยเฉพาะอย่างยิ่ง การสร้างคุณลักษณะโดยอาศัยการแยกส่วนเมทริกซ์ถูกนำมาใช้อย่างกว้างขวางสำหรับการจัดกลุ่มข้อมูลภายใต้ข้อจำกัดที่ไม่เป็นลบของสัมประสิทธิ์คุณลักษณะ ซึ่งรวมถึงการแยกส่วนเมทริกซ์ที่ไม่เป็นลบ (NMF) [ 6 ]การแยกส่วนเมทริกซ์ที่ไม่เป็นลบแบบสามส่วน (NMTF) [ 7 ]การแยกส่วน/การแยกส่วนเทนเซอร์ที่ไม่เป็นลบ (NTF/NTD) [ 8 ]เป็นต้น ข้อจำกัดที่ไม่เป็นลบของสัมประสิทธิ์ของเวกเตอร์คุณลักษณะที่ได้จากอัลกอริทึมที่กล่าวมาข้างต้นทำให้เกิดการแสดงแทนแบบส่วนย่อย และเมทริกซ์ปัจจัยที่แตกต่างกันจะแสดงคุณสมบัติการจัดกลุ่มตามธรรมชาติ มีการรายงานการขยายวิธีการสร้างคุณลักษณะที่กล่าวมาข้างต้นหลายอย่างในวรรณกรรม รวมถึงการแยกส่วนที่ถูกจำกัดด้วยความตั้งฉากสำหรับการจัดกลุ่มแบบยาก และการเรียนรู้แบบแมนิโฟล ด์ เพื่อเอาชนะปัญหาที่เกิดขึ้นกับอัลกอริทึมเหล่านี้
อัลกอริทึมการสร้างคุณลักษณะประเภทอื่น ๆ ได้แก่ การใช้โครงสร้างที่ซ่อนอยู่ร่วมกันในชุดข้อมูลที่เกี่ยวข้องกันหลายชุดเพื่อให้ได้รูปแบบการจัดกลุ่มที่เป็นเอกฉันท์ (ทั่วไป) ตัวอย่างเช่นการจำแนกประเภทหลายมุมมองตามการแยกเมทริกซ์ที่เป็นเอกฉันท์ (MCMD) [ 2 ]ซึ่งขุดรูปแบบการจัดกลุ่มทั่วไปในชุดข้อมูลหลายชุด MCMD ได้รับการออกแบบมาเพื่อส่งออกป้ายกำกับคลาสสองประเภท (การจัดกลุ่มแบบแปรผันตามมาตราส่วนและการจัดกลุ่มแบบไม่แปรผันตามมาตราส่วน) และ:
- มีความทนทานต่อข้อมูลที่ขาดหายไป ในเชิงการคำนวณ
- สามารถระบุค่าผิดปกติโดยพิจารณาจากรูปร่างและขนาดได้
- และสามารถจัดการกับข้อมูลที่มีมิติสูงได้อย่างมีประสิทธิภาพ
การแยกส่วนเมทริกซ์และเทนเซอร์ที่เชื่อมโยงกันเป็นที่นิยมในวิศวกรรมคุณลักษณะหลายมุมมอง[ 9 ]
การสร้างแบบจำลองเชิงพยากรณ์
วิศวกรรมคุณลักษณะในการเรียนรู้ของเครื่องและการสร้างแบบจำลองทางสถิติเกี่ยวข้องกับการเลือก การสร้าง การแปลง และการสกัดคุณลักษณะของข้อมูล องค์ประกอบสำคัญ ได้แก่ การสร้างคุณลักษณะจากข้อมูลที่มีอยู่ การแปลงและการเติมคุณลักษณะที่ขาดหายไปหรือไม่ถูกต้อง การลดมิติของข้อมูลด้วยวิธีการต่างๆ เช่นการวิเคราะห์ส่วนประกอบหลัก (PCA) การวิเคราะห์ส่วนประกอบอิสระ (ICA) และการวิเคราะห์การจำแนกเชิงเส้น (LDA) และการเลือกคุณลักษณะที่เกี่ยวข้องมากที่สุดสำหรับการฝึกแบบจำลองโดยพิจารณาจากคะแนนความสำคัญและเมทริกซ์สหสัมพันธ์[ 10 ]
คุณลักษณะต่างๆ มีความสำคัญแตกต่างกันไป[ 11 ]แม้แต่คุณลักษณะที่ค่อนข้างไม่สำคัญก็อาจมีส่วนช่วยในแบบจำลองได้การเลือกคุณลักษณะสามารถลดจำนวนคุณลักษณะเพื่อป้องกันไม่ให้แบบจำลองมีความเฉพาะเจาะจงกับชุดข้อมูลการฝึกอบรมมากเกินไป (โอเวอร์ฟิตติ้ง) [ 12 ]
ปรากฏการณ์ "การระเบิดของฟีเจอร์" เกิดขึ้นเมื่อจำนวนฟีเจอร์ที่ระบุมีมากเกินไปจนไม่สามารถประมาณค่าหรือปรับโมเดลให้เหมาะสมได้อย่างมีประสิทธิภาพ สาเหตุทั่วไป ได้แก่:
- เทมเพลตฟีเจอร์ - การนำเทมเพลตฟีเจอร์มาใช้แทนการเขียนโค้ดฟีเจอร์ใหม่
- การรวมกันของคุณลักษณะ - การรวมกันที่ไม่สามารถแสดงได้ด้วยระบบเชิงเส้น
การระเบิดของฟีเจอร์สามารถจำกัดได้ด้วยเทคนิค ต่างๆเช่นการทำให้เป็นระเบียบวิธีเคอร์เนลและการเลือกฟีเจอร์[ 13 ]
ระบบอัตโนมัติ
การสร้างคุณลักษณะอัตโนมัติเป็นหัวข้อวิจัยที่มีมาตั้งแต่ทศวรรษ 1990 [ 14 ]ซอฟต์แวร์การเรียนรู้ของเครื่องที่รวมการสร้างคุณลักษณะอัตโนมัติมีวางจำหน่ายในเชิงพาณิชย์ตั้งแต่ปี 2016 [ 15 ]วรรณกรรมทางวิชาการที่เกี่ยวข้องสามารถแบ่งออกได้เป็นสองประเภทคร่าวๆ ดังนี้:
- การเรียนรู้ต้นไม้ตัดสินใจแบบหลายความสัมพันธ์ (MRDTL) ใช้อัลกอริธึมแบบมีผู้กำกับดูแลซึ่งคล้ายกับต้นไม้ตัดสินใจ
- การสังเคราะห์คุณลักษณะเชิงลึกใช้วิธีการที่ง่ายกว่า
การเรียนรู้แผนผังการตัดสินใจแบบหลายความสัมพันธ์ (MRDTL)
การเรียนรู้ต้นไม้ตัดสินใจแบบหลายความสัมพันธ์ (MRDTL) ขยายวิธีการต้นไม้ตัดสินใจแบบดั้งเดิมไปยังฐานข้อมูลเชิงสัมพันธ์โดยจัดการความสัมพันธ์ของข้อมูลที่ซับซ้อนข้ามตารางต่างๆ โดยใช้กราฟการเลือกเป็นโหนดการตัดสินใจ อย่างสร้างสรรค์ ซึ่งได้รับการปรับปรุงอย่างเป็นระบบจนกว่าจะถึงเกณฑ์การยุติที่เฉพาะเจาะจง[ 14 ]
การศึกษา MRDTL ส่วนใหญ่ใช้ฐานข้อมูลเชิงสัมพันธ์เป็นพื้นฐานในการใช้งาน ซึ่งส่งผลให้มีการดำเนินการซ้ำซ้อนจำนวนมาก ความซ้ำซ้อนเหล่านี้สามารถลดลงได้โดยใช้เทคนิคต่างๆ เช่น การแพร่กระจายรหัสทูเพิล[ 16 ] [ 17 ]
การใช้งานแบบโอเพนซอร์ส
มีไลบรารีและเครื่องมือโอเพนซอร์สจำนวนมากที่ช่วยสร้างคุณลักษณะอัตโนมัติบนข้อมูลเชิงสัมพันธ์และอนุกรมเวลา:
- featuretoolsเป็น ไลบรารี Pythonสำหรับแปลงข้อมูลอนุกรมเวลาและข้อมูลเชิงสัมพันธ์เป็นเมทริกซ์คุณลักษณะสำหรับการเรียนรู้ของเครื่อง[ 18 ] [ 19 ] [ 20 ]
- MCMD:อัลกอริทึมการสร้างคุณลักษณะแบบโอเพนซอร์สสำหรับการจัดกลุ่มร่วมกันของชุดข้อมูลหลายชุด[ 21 ] [ 2 ]
- OneBMหรือ One-Button Machine ผสมผสานการแปลงคุณลักษณะและการเลือกคุณลักษณะบนข้อมูลเชิงสัมพันธ์ด้วยเทคนิคการเลือกคุณลักษณะ[ 22 ]
OneBM ช่วยให้นักวิทยาศาสตร์ข้อมูลลดเวลาในการสำรวจข้อมูล ทำให้พวกเขาสามารถลองผิดลองถูกกับแนวคิดต่างๆ ได้มากมายในเวลาอันสั้น ในทางกลับกัน ยังช่วยให้ผู้ที่ไม่เชี่ยวชาญด้านวิทยาศาสตร์ข้อมูลสามารถดึงคุณค่าจากข้อมูลของตนได้อย่างรวดเร็วด้วยความพยายาม เวลา และต้นทุนเพียงเล็กน้อย[ 22 ]
- getML communityเป็นเครื่องมือโอเพนซอร์สสำหรับการสร้างฟีเจอร์อัตโนมัติบนข้อมูลอนุกรมเวลาและข้อมูลเชิงสัมพันธ์[ 23 ] [ 24 ]มันถูกนำไปใช้ในC / C++ด้วยอินเทอร์เฟซ Python [ 24 ]ได้รับการพิสูจน์แล้วว่าเร็วกว่า tsflex, tsfresh, tsfel, featuretools หรือ kats อย่างน้อย 60 เท่า[ 24 ]
- tsfreshเป็นไลบรารี Python สำหรับการสกัดคุณลักษณะบนข้อมูลอนุกรมเวลา[ 25 ]โดยจะประเมินคุณภาพของคุณลักษณะโดยใช้การทดสอบสมมติฐาน[ 26 ]
- tsflexเป็นไลบรารี Python แบบโอเพนซอร์สสำหรับแยกคุณลักษณะจากข้อมูลอนุกรมเวลา[ 27 ]แม้ว่าจะเขียนด้วย Python ทั้งหมด 100% แต่ก็แสดงให้เห็นว่าเร็วกว่าและประหยัดหน่วยความจำมากกว่า tsfresh, seglearn หรือ tsfel [ 28 ]
- seglearnเป็นส่วนขยายสำหรับข้อมูลอนุกรมเวลาแบบลำดับหลายตัวแปรของ ไลบรารี scikit-learn Python [ 29 ]
- tsfelเป็นแพ็กเกจ Python สำหรับการสกัดคุณลักษณะบนข้อมูลอนุกรมเวลา[ 30 ]
- katsเป็นชุดเครื่องมือ Python สำหรับวิเคราะห์ข้อมูลอนุกรมเวลา[ 31 ]
การสังเคราะห์คุณลักษณะเชิงลึก
อัลกอริทึมการสังเคราะห์คุณลักษณะเชิงลึก (DFS) เอาชนะทีมมนุษย์ 615 ทีมจากทั้งหมด 906 ทีมในการแข่งขัน[ 32 ] [ 33 ]
ร้านค้าเด่น
ฟีเจอร์สโตร์คือที่ที่ฟีเจอร์ต่างๆ ถูกจัดเก็บและจัดระเบียบเพื่อวัตถุประสงค์เฉพาะในการนำไปใช้ฝึกโมเดล (โดยนักวิทยาศาสตร์ข้อมูล) หรือทำการทำนาย (โดยแอปพลิเคชันที่มีโมเดลที่ฝึกฝนแล้ว) เป็นศูนย์กลางที่คุณสามารถสร้างหรืออัปเดตกลุ่มฟีเจอร์ที่สร้างจากแหล่งข้อมูลต่างๆ หลายแหล่ง หรือสร้างและอัปเดตชุดข้อมูลใหม่จากกลุ่มฟีเจอร์เหล่านั้นเพื่อฝึกโมเดลหรือใช้ในแอปพลิเคชันที่ไม่ต้องการคำนวณฟีเจอร์ แต่เพียงแค่เรียกใช้เมื่อต้องการเพื่อทำการทำนาย[ 34 ]
ฟีเจอร์สโตร์ประกอบด้วยความสามารถในการจัดเก็บโค้ดที่ใช้ในการสร้างฟีเจอร์ นำโค้ดไปใช้กับข้อมูลดิบ และให้บริการฟีเจอร์เหล่านั้นแก่โมเดลเมื่อมีการร้องขอ ความสามารถที่มีประโยชน์ ได้แก่ การกำหนดเวอร์ชันของฟีเจอร์และนโยบายที่ควบคุมสถานการณ์ที่สามารถใช้ฟีเจอร์ได้[ 35 ]
Feature store อาจเป็นซอฟต์แวร์แบบสแตนด์อโลนหรือถูกสร้างขึ้นในแพลตฟอร์มการเรียนรู้ของเครื่องก็ได้
ทางเลือกอื่นๆ
การสร้างคุณลักษณะอาจเป็นกระบวนการที่ใช้เวลานานและมีโอกาสเกิดข้อผิดพลาดสูง เนื่องจากต้องอาศัยความเชี่ยวชาญเฉพาะด้านและมักเกี่ยวข้องกับการลองผิดลองถูก[ 36 ] [ 37 ]อัลกอริทึมการเรียนรู้เชิงลึกอาจถูกนำมาใช้เพื่อประมวลผลชุดข้อมูลดิบขนาดใหญ่โดยไม่ต้องพึ่งพาการสร้างคุณลักษณะ[ 38 ]อย่างไรก็ตาม อัลกอริทึมการเรียนรู้เชิงลึกยังคงต้องการการประมวลผลล่วงหน้าและการทำความสะอาดข้อมูลอินพุตอย่างระมัดระวัง[ 39 ]นอกจากนี้ การเลือกสถาปัตยกรรม พารามิเตอร์ และอัลกอริทึมการเพิ่มประสิทธิภาพที่เหมาะสมสำหรับโครงข่ายประสาทเทียมเชิงลึกอาจเป็นกระบวนการที่ท้าทายและต้องทำซ้ำหลายครั้ง[ 40 ]
ดูเพิ่มเติม
อ่านเพิ่มเติม
- Boehmke B, Greenwell B (2019). "การออกแบบคุณลักษณะและเป้าหมาย" ในหนังสือHands-On Machine Learning with R.สำนักพิมพ์ Chapman & Hall. หน้า41–75 . ISBN 978-1-138-49568-5.
- Zheng A, Casari A (2018). การสร้างคุณลักษณะสำหรับแมชชีนเลิร์นนิง: หลักการและเทคนิคสำหรับนักวิทยาศาสตร์ข้อมูล . O'Reilly. ISBN 978-1-4919-5324-2.
- Zumel N, Mount (2020). "วิศวกรรมข้อมูลและการจัดรูปแบบข้อมูล" วิทยาศาสตร์ข้อมูลเชิงปฏิบัติด้วย R ( ฉบับที่ 2). Manning. หน้า113–160 . ISBN 978-1-61729-587-4.
- Abououf, M., Singh, S., Mizouni, R., Otrok, H. (2024), "การสร้างคุณลักษณะและแนวทางการเรียนรู้เชิงลึกสำหรับการตรวจจับเหตุการณ์ในอินเทอร์เน็ตของสิ่งต่างๆ ทางการแพทย์ (MIoT)", Internet of Things , 26 101191, Elsevier BV, doi : 10.1016/j.iot.2024.101191
- Chicco D, Oneto L, Tavazzi E (ธันวาคม 2022). "เคล็ดลับ 11 ข้อสำหรับการทำความสะอาดข้อมูลและการสร้างคุณลักษณะ" . PLOS Computational Biology . 18 (12) e1010718. Bibcode : 2022PLSCB..18E0718C . doi : 10.1371/journal.pcbi.1010718 . PMC 9754225 . PMID 36520712 . S2CID 254733288 .