ที-คอฟฟี่
T-Coffee ( Tree-based Consistency Objective Function for Alignment Evaluation ) เป็น ซอฟต์แวร์ การจัดเรียงลำดับหลายลำดับโดยใช้วิธีการแบบก้าวหน้า[ 1 ]มันสร้างไลบรารีของการจัดเรียงแบบคู่เพื่อเป็นแนวทางในการจัดเรียงลำดับหลายลำดับ นอกจากนี้ยังสามารถรวมการจัดเรียงลำดับหลายลำดับที่ได้รับก่อนหน้านี้ และในเวอร์ชันล่าสุดสามารถใช้ข้อมูลโครงสร้างจาก ไฟล์ Protein Data Bank (PDB) (3D-Coffee) ได้อีกด้วย มันมีคุณสมบัติขั้นสูงในการประเมินคุณภาพของการจัดเรียงและมีความสามารถในการระบุการเกิดขึ้นของโมทีฟ (Mocca) โดยค่าเริ่มต้นจะสร้างการจัดเรียงในรูปแบบ aln ( Clustal ) แต่ยังสามารถสร้างรูปแบบ PIR, MSF และFASTA ได้อีกด้วย รูปแบบอินพุตที่ใช้กันทั่วไปส่วนใหญ่ได้รับการสนับสนุน ( FASTA , Protein Information Resource (PIR))
อัลกอริทึม
อัลกอริทึม T-Coffee ประกอบด้วยคุณสมบัติหลักสองประการ ประการแรกคือ การใช้แหล่งข้อมูลที่หลากหลาย สามารถให้วิธีการที่ง่ายและยืดหยุ่นในการสร้างการจัดเรียงหลายรายการ T-Coffee สามารถคำนวณการจัดเรียงหลายรายการโดยใช้ไลบรารีที่สร้างขึ้นโดยใช้การผสมผสานของการจัดเรียงแบบคู่ในระดับท้องถิ่นและระดับโลก[ 1 ]
วิธีที่สองคือ "วิธีการเพิ่มประสิทธิภาพ" ซึ่งใช้ในการค้นหาการจัดเรียงหลายรายการที่เหมาะสมที่สุดกับการจัดเรียงแบบคู่ในไลบรารีอินพุตโดยใช้กลยุทธ์แบบก้าวหน้าซึ่งสามารถเปรียบเทียบได้กับวิธีที่ใช้ในClustal W วิธีการเพิ่มประสิทธิภาพมีข้อดีคือรวดเร็วและแข็งแกร่ง ข้อมูลในไลบรารีจะถูกนำมาใช้เพื่อดำเนินการจัดเรียงแบบก้าวหน้าและอำนวยความสะดวกในการพิจารณาการจัดเรียงระหว่างคู่ทั้งหมดในขณะที่ดำเนินการในแต่ละขั้นตอนของการจัดเรียงหลายรายการแบบก้าวหน้า[ 1 ]
การสร้างคลังข้อมูลหลักของการจัดเรียงลำดับ
ห้องสมุดประกอบด้วยชุดการจัดเรียงแบบคู่ระหว่างลำดับทั้งหมดที่จะจัดเรียง การจัดเรียงไม่จำเป็นต้องสอดคล้องกัน ภายในห้องสมุดมีข้อมูลเกี่ยวกับแต่ละลำดับN(N-1)/2โดยที่ N คือจำนวนลำดับ มีการใช้แหล่งข้อมูลการจัดเรียงสองแหล่งสำหรับแต่ละคู่ของลำดับ แหล่งหนึ่งจัดอยู่ในประเภทท้องถิ่น และอีกแหล่งหนึ่งจัดอยู่ในประเภททั่วโลก[ 1 ]
การจัดเรียงทั่วโลกสร้างขึ้นโดยใช้Clustal W บนลำดับทีละสองลำดับ และใช้ sed เพื่อให้ได้การจัดเรียงแบบเต็มความยาวหนึ่งรายการระหว่างลำดับแต่ละคู่ การจัดเรียงเฉพาะที่คือการจัดเรียงเฉพาะที่ที่มีคะแนนสูงสุดสิบอันดับแรกที่ไม่ทับซ้อนกันซึ่งรวบรวมโดยใช้โปรแกรม Lalign ของแพ็คเกจFASTA [ 1 ]
แต่ละการจัดเรียงจะถูกแสดงในไลบรารีเป็นรายการของการจับคู่สารตกค้างแบบคู่ โดยแต่ละคู่ถือเป็นข้อจำกัด อย่างไรก็ตาม ข้อจำกัดบางอย่างมีความสำคัญมากกว่าข้อจำกัดอื่นๆ ความสำคัญของข้อจำกัดแต่ละข้อขึ้นอยู่กับว่าข้อจำกัดใดมีแนวโน้มที่จะถูกต้องมากกว่า ในขณะที่คำนวณการจัดเรียงหลายรายการ ลำดับความสำคัญจะถูกกำหนดให้กับคู่สารตกค้างที่น่าเชื่อถือที่สุดโดยใช้แผนการถ่วงน้ำหนัก[ 1 ]
การรวมไลบรารีต่างๆ เข้าด้วยกัน
การผสมผสานข้อมูลการจัดเรียงในระดับท้องถิ่นและระดับโลกอย่างมีประสิทธิภาพเป็นปัจจัยสำคัญของ T-Coffee โดยการใช้ ไลบรารีหลัก Clustal W และ Lalign สามารถทำได้ด้วยกระบวนการบวก คู่ที่ซ้ำกันระหว่างไลบรารีทั้งสองจะถูกรวมเข้าเป็นรายการเดียวโดยมีน้ำหนักเท่ากับผลรวมทั้งหมดของทั้งสองคู่ มิฉะนั้นจะสร้างรายการใหม่สำหรับคู่นั้น คู่ที่มีน้ำหนักเป็นศูนย์จะไม่ถูกแสดง[ 1 ]สำหรับแต่ละคู่ของสารตกค้างที่จัดเรียงในไลบรารี สามารถกำหนดน้ำหนักที่สอดคล้องกับระดับการจัดเรียงสารตกค้างเหล่านั้นได้ เรียกว่าการขยายไลบรารี
การเปรียบเทียบกับซอฟต์แวร์การจัดแนวอื่นๆ
แม้ว่ารูปแบบเอาต์พุตเริ่มต้นจะเป็นรูปแบบคล้าย Clustal แต่ก็แตกต่างจากเอาต์พุตของ ClustalW/X มากพอสมควร ทำให้โปรแกรมหลายโปรแกรมที่รองรับรูปแบบ Clustal ไม่สามารถอ่านได้ โชคดีที่ ClustalX สามารถนำเข้าเอาต์พุตของ T-Coffee ได้ ดังนั้นวิธีแก้ไขที่ง่ายที่สุดสำหรับปัญหานี้มักจะเป็นการนำเข้าเอาต์พุตของ T-Coffee ลงใน ClustalX แล้วส่งออกอีกครั้ง อีกวิธีหนึ่งคือการขอรูปแบบเอาต์พุต ClustalW ที่เข้มงวดด้วยตัวเลือก " -output=clustalw_aln"
คุณสมบัติที่สำคัญอย่างหนึ่งของ T-Coffee คือความสามารถในการผสมผสานวิธีการและประเภทข้อมูลที่แตกต่างกัน ในเวอร์ชันล่าสุด T-Coffee สามารถใช้ในการรวมลำดับและโครงสร้างของโปรตีน ลำดับและโครงสร้างของ RNA ได้ นอกจากนี้ยังสามารถเรียกใช้และรวมผลลัพธ์จากโปรแกรมจัดเรียงลำดับและโครงสร้างที่ใช้กันทั่วไปได้อีกด้วย
T-Coffee มาพร้อมกับยูทิลิตี้การจัดรูปแบบลำดับที่ซับซ้อนชื่อ seq_reformat มีเอกสารประกอบอย่างละเอียดให้ศึกษาได้ทางออนไลน์
การเปลี่ยนแปลง
- M-Coffee: โหมดพิเศษของ T-Coffee ที่ทำให้สามารถรวมเอาผลลัพธ์จากแพ็กเกจการจัดเรียงลำดับหลายลำดับที่ใช้กันทั่วไป (Muscle, ClustalW, Mafft, ProbCons เป็นต้น) เข้าด้วยกันได้ การจัดเรียงที่ได้จะดีขึ้นเล็กน้อยเมื่อเทียบกับการจัดเรียงแบบแยกแต่ละแพ็กเกจ แต่ที่สำคัญที่สุดคือโปรแกรมจะระบุบริเวณการจัดเรียงที่แพ็กเกจต่างๆ เห็นพ้องกัน บริเวณที่มีความเห็นพ้องกันสูงมักจะจัดเรียงได้ดี[ 2 ]
- Expresso และ 3D-Coffee: โหมดพิเศษของ T-Coffee เหล่านี้ทำให้สามารถรวมลำดับและโครงสร้างเข้าด้วยกันในการจัดเรียงลำดับได้ การจัดเรียงลำดับตามโครงสร้างสามารถทำได้โดยใช้โปรแกรมจัดเรียงลำดับโครงสร้างทั่วไป เช่น TMalign, Mustang และ sap [ 3 ] [ 4 ] [ 5 ] [ 6 ]
- R-Coffee: โหมดพิเศษของ T-Coffee ที่ทำให้สามารถจัดเรียงลำดับ RNA โดยใช้ข้อมูลโครงสร้างทุติยภูมิได้[ 7 ] [ 8 ]
- PSI-Coffee: จัดเรียงโปรตีนที่มีความสัมพันธ์ห่างไกลกันโดยใช้การขยายความเหมือนกัน (ช้าแต่แม่นยำ) [ 9 ] [ 10 ]
- TM-Coffee: จัดเรียงโปรตีนทรานส์เมมเบรนโดยใช้การขยายความเหมือนกัน[ 11 ]
- Pro-Coffee: จัดเรียงบริเวณโปรโมเตอร์ที่เหมือนกัน[ 12 ]
- แม่นยำ: ผสมผสานโหมดที่แม่นยำที่สุดสำหรับ DNA, RNA และโปรตีนโดยอัตโนมัติ (การทดลอง) [ 13 ]
การประเมิน
คะแนนความสอดคล้องแบบส่งต่อ (TCS) เป็นเวอร์ชันขยายของแผนการให้คะแนน T-Coffee [ 14 ]โดยใช้ไลบรารี T-Coffee ของการจัดเรียงแบบคู่เพื่อประเมิน MSA ของบุคคลที่สามใดๆ การฉายภาพแบบคู่สามารถสร้างได้โดยใช้วิธีการที่รวดเร็วหรือช้า ซึ่งช่วยให้สามารถแลกเปลี่ยนระหว่างความเร็วและความแม่นยำได้ TCS ได้รับการพิสูจน์แล้วว่านำไปสู่การประมาณความแม่นยำของโครงสร้างที่ดีขึ้นอย่างมีนัยสำคัญและต้นไม้วิวัฒนาการ ที่แม่นยำยิ่งขึ้น เมื่อเทียบกับ Heads-or-Tails, GUIDANCE, Gblocks และ trimAl [ 15 ]
ดูเพิ่มเติม
ลิงก์ภายนอก
- เว็บไซต์อย่างเป็นทางการ
- เซิร์ฟเวอร์จัดตำแหน่งกาแฟ T-Coffee
- หน้าดาวน์โหลด T-Coffee
- เอกสารทางเทคนิค
- บทช่วยสอน
- รายชื่อเครื่องมือจัดฟันจากผู้ผลิตรายอื่นที่ได้รับการสนับสนุนจาก T-Coffee
- เอกสารต้นฉบับของ T-coffee