กลับไปหน้าบทความ

อ่าน 5 นาที

ไม่มีชื่อบทความ

ฐานข้อมูลลำดับนิวคลีโอไทด์ GenBank เป็น ฐาน ข้อมูล แบบเปิด ที่รวบรวมลำดับ นิวคลีโอไทด์ และ คำแปล โปรตีน ที่เข้าถึงได้โดยสาธารณะ พร้อมคำ อธิบายประกอบ GenBank เป็นส่วนหนึ่งของ...

เจนแบงก์

ฐานข้อมูลลำดับนิวคลีโอไทด์ GenBank เป็น ฐาน ข้อมูลแบบเปิด ที่รวบรวมลำดับ นิวคลีโอไทด์และ คำแปล โปรตีนที่เข้าถึงได้โดยสาธารณะ พร้อมคำ อธิบายประกอบ GenBank เป็นส่วนหนึ่งของความร่วมมือฐานข้อมูลลำดับนิวคลีโอไทด์ระหว่างประเทศ (INSDC) และจัดทำและดูแลรักษาโดยศูนย์ข้อมูลเทคโนโลยีชีวภาพแห่งชาติ (NCBI) ซึ่งเป็นส่วนหนึ่งของห้องสมุดการแพทย์แห่งชาติสหรัฐอเมริกา (NLM) ซึ่งเป็นส่วนหนึ่งของสถาบันสุขภาพแห่งชาติ (NIH)

ณ การเผยแพร่ GenBank เวอร์ชัน 271.0 (เมษายน 2026) ฐานข้อมูลประกอบด้วยเบส 53.90 ล้านล้านเบสและระเบียนลำดับ 6.27 พันล้านรายการ รวมถึงรายการ GenBank 261,460,182 รายการที่มีข้อมูลลำดับเบส 7,289,942,983,522 คู่[ 2 ]ฐานข้อมูลนี้ประกอบด้วยลำดับจากสายพันธุ์ที่ได้รับการอธิบายอย่างเป็นทางการมากกว่า 581,000 สายพันธุ์[ 3 ] ฐานข้อมูลนี้ก่อตั้งขึ้นในปี 1982 โดยWalter Goadและห้องปฏิบัติการแห่งชาติ Los Alamosและได้กลายเป็นแหล่งข้อมูลสำคัญสำหรับการวิจัยทางชีววิทยา GenBank สร้างขึ้นจากการส่งข้อมูลโดยตรงจากห้องปฏิบัติการแต่ละแห่ง รวมถึงการส่งข้อมูลจำนวนมากจากโครงการจัดลำดับขนาดใหญ่[ 3 ]

การส่งผลงาน

GenBank รับการส่งลำดับนิวคลีโอไทด์จากห้องปฏิบัติการแต่ละแห่งและโครงการจัดลำดับขนาดใหญ่ การส่งโดยตรงทำได้โดยใช้พอร์ทัลการส่งข้อมูลของ NCBI [ 4 ]ซึ่งมีขั้นตอนการทำงานที่แนะนำสำหรับการส่งข้อมูล หรือส่งผ่านโปรแกรมโดยใช้เครื่องมือต่างๆ เช่นtable2asnระบบการส่งข้อมูล BankIt เดิมกำลังถูกยกเลิกและแทนที่ด้วยพอร์ทัลการส่งข้อมูล[ 5 ]

เมื่อได้รับข้อมูลแล้ว เจ้าหน้าที่ GenBank จะตรวจสอบข้อมูลเพื่อความครบถ้วน ความสมบูรณ์ บริบททางชีววิทยา และความสอดคล้อง กำหนดหมายเลขการเข้าถึงและทำการตรวจสอบคุณภาพก่อนเผยแพร่สู่ฐานข้อมูลสาธารณะ ลำดับดีเอ็นเอที่ส่งเข้ามาสามารถเข้าถึงได้ผ่านEntrezและสามารถดาวน์โหลดได้ผ่านFTP

GenBank รองรับประเภทการส่งข้อมูลที่หลากหลาย รวมถึงการประกอบจีโนมแบบช็อตกันทั้งหมด (WGS) การประกอบทรานสคริปโตมแบบช็อตกัน (TSA) การศึกษาโลคัสเป้าหมาย (TLS) และลำดับจีโนมที่มีปริมาณมาก (HTGS) บันทึกคำอธิบายประกอบจากบุคคลที่สาม (TPA) อนุญาตให้เผยแพร่คำอธิบายประกอบตามลำดับที่มีอยู่แล้วใน GenBank ข้อมูลลำดับดิบที่สร้างโดยเทคโนโลยีการจัดลำดับรุ่นใหม่จะถูกฝากไว้ในคลังข้อมูลลำดับ (SRA) แทนที่จะฝากไว้ใน GenBank เอง[ 6 ]

ประวัติศาสตร์

Walter Goadจากกลุ่มชีววิทยาเชิงทฤษฎีและชีวฟิสิกส์ที่ห้องปฏิบัติการแห่งชาติลอสอะลาโมส (LANL) และเพื่อนร่วมงานได้ก่อตั้งฐานข้อมูลลำดับลอสอะลาโมสขึ้นในปี 1979 ซึ่งนำไปสู่การสร้างฐานข้อมูลสาธารณะ GenBank ในปี 1982 [ 7 ]ได้รับทุนสนับสนุนจากสถาบันสุขภาพแห่งชาติมูลนิธิวิทยาศาสตร์แห่งชาติกระทรวงพลังงานและกระทรวงกลาโหม LANL ร่วมมือกับบริษัทBolt, Beranek, and Newman ในการสร้าง GenBank และภายในสิ้นปี 1983 มีการรวบรวมลำดับมากกว่า 2,000 ลำดับ คำอธิบายเบื้องต้นของฐานข้อมูลได้รับการตีพิมพ์ในปี 1985 เมื่อ GenBank มีเบสมากกว่าห้าล้านเบสในรายการลำดับประมาณ 6,000 รายการ[ 8 ]

ในช่วงปลายทศวรรษ 1980 และต้นทศวรรษ 1990 ความรับผิดชอบของ GenBank ได้เปลี่ยนจาก Los Alamos National Laboratory ไปยังNational Center for Biotechnology Information (NCBI) ที่จัดตั้งขึ้นใหม่ ณUnited States National Library of Medicine (NLM) ซึ่งเป็นส่วนหนึ่งของNational Institutes of Health (NIH) เอกสารการเผยแพร่ GenBank ในปัจจุบันจากช่วงเวลานี้สะท้อนให้เห็นถึงการเปลี่ยนแปลงจากการมีส่วนร่วมร่วมกันของเจ้าหน้าที่ฐานข้อมูลที่ตั้งอยู่ใน LANL และทีมจัดทำดัชนีที่ตั้งอยู่ใน NLM ไปสู่การจัดการโดย NCBI อย่างเต็มรูปแบบ ซึ่งบ่งชี้ถึงการถ่ายโอนการดูแลจัดการข้อมูลและความรับผิดชอบในการดำเนินงานเป็นระยะ[ 9 ]

GenBank และ EMBL: ลำดับนิวคลีโอไทด์ ปี 1986/1987 เล่มที่ I ถึง VII
ซีดีรอมของ GenBank เวอร์ชัน 100

การเจริญเติบโต

การเติบโตของจำนวนคู่เบสใน GenBank ตั้งแต่ปี 1982 ถึง 2018 ในมาตราส่วนกึ่งลอการิทึม

GenBank เติบโตขึ้นอย่างมากนับตั้งแต่เริ่มก่อตั้ง การวิเคราะห์ในช่วงแรกและบันทึกการเผยแพร่ได้อธิบายการเติบโตนี้ว่ามีจำนวนเบสเพิ่มขึ้นเป็นสองเท่าทุกๆ 18 เดือน แม้ว่าอัตราการเติบโตจะแตกต่างกันไปตามกาลเวลาเนื่องจากการเปลี่ยนแปลงของเทคโนโลยีการจัดลำดับและแนวทางการส่งข้อมูล[ 2 ]

ณ การเผยแพร่ GenBank เวอร์ชัน 271.0 (เมษายน 2026) ฐานข้อมูลประกอบด้วยเบสมากกว่า 53.9 ล้านล้านเบสและบันทึกลำดับ 6.27 พันล้านรายการ ซึ่งสะท้อนให้เห็นถึงการมีส่วนร่วมขนาดใหญ่อย่างต่อเนื่องจากโครงการจัดลำดับแบบความเร็วสูง[ 2 ]

แม้ว่าสถิติการเผยแพร่ของ GenBank จะสรุปการแบ่งส่วนแบบดั้งเดิมของ GenBank แต่ชุดลำดับขนาดใหญ่ที่มุ่งเน้นปริมาณจำนวนมากหลายชุดจะถูกติดตามแยกต่างหาก บันทึก Whole Genome Shotgun (WGS), Transcriptome Shotgun Assembly (TSA) และ Targeted Locus Study (TLS) จะถูกประมวลผลโดย GenBank แต่ไม่ได้เผยแพร่เป็นส่วนหนึ่งของไฟล์การเผยแพร่ GenBank ปกติ แต่จะมีการเผยแพร่อย่างต่อเนื่องผ่านพื้นที่ FTP แยกต่างหากสำหรับแต่ละโครงการ[ 2 ]

สำหรับเวอร์ชัน 271.0 ข้อมูลลำดับส่วนใหญ่จะอยู่ในระเบียน WGS แทนที่จะเป็นรายการ GenBank แบบดั้งเดิม

ชุดลำดับที่เกี่ยวข้องกับ GenBank หลักในเวอร์ชัน 271.0 [ 2 ]
ของสะสมรายการฐาน
รายการ GenBank แบบดั้งเดิม261,460,1827.289942983522 × 10 ^ 12
การถอดรหัสจีโนมทั้งหมดแบบช็อตกัน (Whole Genome Shotgun หรือ WGS)4,756,526,4854.5628511953497 × 10 ^ 13
การประกอบทรานสคริปโตมแบบช็อตกัน (TSA)1,058,643,3738.98651493967 × 10 ^ 11
การศึกษาตำแหน่งเป้าหมาย (TLS)191,365,0907.9162820303 × 10 ^ 10
ทั้งหมด6,267,995,1305.3896269141289 × 10 ^ 13

ตารางต่อไปนี้แสดงรายการสิ่งมีชีวิต 20 ชนิดที่มีจำนวนเบสมากที่สุดในกลุ่ม GenBank แบบดั้งเดิมสำหรับการเผยแพร่เวอร์ชัน 271.0 โดยไม่รวม WGS, TSA, TLS, เมตาจีโนมิกส์, ไมโตคอนเดรียล, คลอโรพลาสต์, โครงสร้างสังเคราะห์ และหมวดหมู่อื่นๆ อีกหลายหมวดหมู่ที่กำหนดไว้ในบันทึกการเผยแพร่[ 2 ]

สิ่งมีชีวิต 20 อันดับแรกใน GenBank (รุ่น 271.0) [ 2 ]
สิ่งมีชีวิตรายการฐานรหัสจำแนกทางอนุกรมวิธานของ NCBI [ a ]
ข้าวสาลีสามัญ ( Triticum aestivum )1,948,7524.05961950617 × 10 ^ 114565
ไวรัสโคโรนาสายพันธุ์ 2 ที่ก่อให้เกิดโรคทางเดินหายใจเฉียบพลันรุนแรง (SARS-CoV-2)9,204,1782.73571729605 × 10 ^ 112697049
ข้าวโอ๊ต ( Avena sativa )30,5552.73192060156 × 10 ^ 114497
ข้าวบาร์เลย์ ( Hordeum vulgare )113,6432.59319130177 × 10 ^ 114513
ฮอร์เดียม บัลโบซัม7532.12675690135 × 10 ^ 114514
ข้าวบาร์เลย์เพาะปลูก ( Hordeum vulgare subsp. vulgare )1,347,1041.25991654054 × 10 ^ 11112509
ต้นมิสเซิลโท ( Viscum album )1649.3011095388 × 10 ^ 103973
ข้าวบาร์เลย์ป่า ( Hordeum vulgare subsp. spontaneum )29,9789.2980378923 × 10 ^ 104512
หนูบ้าน ( Mus musculus )10,118,6774.6333339697 × 10 ^ 1010090
มนุษย์ ( โฮโมเซเปียนส์ )28,773,4993.8432937493 × 10 ^ 109606
เอสเชอริเชีย โคลี195,5533.771187484 × 10 ^ 10562
มะเขือยาว ( Solanum melongena )4,7113.7408102376 × 10 ^ 104111
ผักกาดหอมธาเลียนา ( Arabidopsis thaliana )2,643,0743.3455227111 × 10 ^ 103702
วัว ( Bos taurus )2,246,0813.3006519943 × 10 ^ 109913
เคล็บซิเอลลา นิวโมเนีย43,5952.6206281917 × 10 ^ 10573
ข้าวโพด ( Zea mays )4,224,7262.4918520894 × 10 ^ 104577
ถั่วปากอ้า ( Vicia faba )28,7832.3037489636 × 10 ^ 103906
นิวท์ฝ่ามือ ( Lissotriton helveticus )5072.2852582653 × 10 ^ 108293
นิวท์หงอนเหนือ ( Triturus cristatus )1,6342.2052877731 × 10 ^ 108297
ข้าวโอ๊ตป่า ( Avena sterilis )2482.1843250305 × 10 ^ 104499

ข้อจำกัด

การวิเคราะห์ GenBank และบริการอื่นๆ สำหรับการระบุโมเลกุลของเชื้อที่แยกได้จากการเพาะเชื้อในเลือดทางคลินิกโดยใช้ลำดับ16S rRNA [ 10 ]แสดงให้เห็นว่าการวิเคราะห์ดังกล่าวมีความแม่นยำมากขึ้นเมื่อรวม GenBank เข้ากับบริการอื่นๆ เช่นEzTaxon -e [ 11 ] และ ฐานข้อมูลBIBI [ 12 ]

GenBank อาจมีลำดับที่ถูกกำหนดให้กับสายพันธุ์ใดสายพันธุ์หนึ่งอย่างไม่ถูกต้อง เนื่องจากการระบุสิ่งมีชีวิตในเบื้องต้นนั้นผิดพลาด การศึกษาล่าสุดแสดงให้เห็นว่า 75% ของลำดับไมโทคอนเดรียลไซโตโครมซีออกซิเดสซับยูนิต Iถูกกำหนดให้กับปลาNemipterus mesoprion อย่างไม่ถูกต้อง อันเนื่อง มาจากการใช้ลำดับของบุคคลที่ระบุผิดพลาดในตอนแรกอย่างต่อเนื่อง[ 13 ]ผู้เขียนได้ให้คำแนะนำเกี่ยวกับวิธีการหลีกเลี่ยงการเผยแพร่ลำดับที่มีชื่อวิทยาศาสตร์ไม่ถูกต้องในที่สาธารณะต่อไป

เอกสารต้นฉบับที่ตีพิมพ์จำนวนมากได้ระบุลำดับที่ผิดพลาดใน GenBank [ 14 ] [ 15 ] [ 16 ]สิ่งเหล่านี้ไม่เพียงแต่เป็นการกำหนดชนิดที่ไม่ถูกต้อง (ซึ่งอาจมีสาเหตุที่แตกต่างกัน) แต่ยังรวมถึงไคเมราและบันทึกการเข้าถึงที่มีข้อผิดพลาดในการจัดลำดับ เอกสารต้นฉบับล่าสุดเกี่ยวกับคุณภาพของ บันทึก Cytochrome b ทั้งหมด ของนกยังแสดงให้เห็นเพิ่มเติมว่า 45% ของบันทึกที่ผิดพลาดที่ระบุนั้นขาดตัวอย่างอ้างอิงที่ป้องกันการประเมินการระบุชนิดใหม่[ 17 ]

ปัญหาอีกประการหนึ่งคือบันทึกลำดับมักถูกส่งเป็นลำดับที่ไม่ระบุชื่อสายพันธุ์ (เช่น " Pelomedusa sp. A CK-2014") เนื่องจากสายพันธุ์นั้นไม่เป็นที่รู้จักหรือถูกระงับไว้เพื่อวัตถุประสงค์ในการตีพิมพ์ อย่างไรก็ตาม แม้หลังจากที่ระบุสายพันธุ์หรือตีพิมพ์แล้ว บันทึกลำดับเหล่านี้ก็ยังไม่ได้รับการอัปเดต จึงอาจทำให้เกิดความสับสนอย่างต่อเนื่อง[ 18 ]

ดูเพิ่มเติม

หมายเหตุ

  1. หรือรู้จักกันในชื่อ NCBI TaxID
  • หน้าแรกของ GenBank
  • ตัวอย่างบันทึกข้อมูลใน GenBank (ฮีโมโกลบินเบต้า)
  • โปรแกรมยูทิลิตี้ Entrez (E-utilities)
  • GenBank, RefSeq, TPA และ UniProt: ชื่อเหล่านี้มีความหมายอย่างไรบ้าง?

สรุปเนื้อหา

ข้อมูลสำคัญจากบทความ

ข้อมูลสำคัญเกี่ยวกับ ไม่มีชื่อบทความ

ฐานข้อมูลลำดับนิวคลีโอไทด์ GenBank เป็น ฐาน ข้อมูล แบบเปิด ที่รวบรวมลำดับ นิวคลีโอไทด์ และ คำแปล โปรตีน ที่เข้าถึงได้โดยสาธารณะ พร้อมคำ อธิบายประกอบ GenBank เป็นส่วนหนึ่งของ...

การส่งผลงาน

GenBank รับการส่งลำดับนิวคลีโอไทด์จากห้องปฏิบัติการแต่ละแห่งและโครงการจัดลำดับขนาดใหญ่ การส่งโดยตรงทำได้โดยใช้พอร์ทัลการส่งข้อมูลของ NCBI [ 4 ] ซึ่งมีขั้นตอนการทำงานที่แนะนำสำหรับการส่งข้อมูล หรือส่งผ่านโปรแกรมโดยใช้เครื่องมือต่างๆ...

ประวัติศาสตร์

Walter Goad จากกลุ่มชีววิทยาเชิงทฤษฎีและชีวฟิสิกส์ที่ ห้องปฏิบัติการแห่งชาติลอสอะลาโมส (LANL) และเพื่อนร่วมงานได้ก่อตั้งฐานข้อมูลลำดับลอสอะลาโมสขึ้นในปี 1979 ซึ่งนำไปสู่การสร้างฐานข้อมูลสาธารณะ GenBank ในปี 1982 [ 7 ] ได้รับทุนสนับสนุนจาก สถาบันสุขภาพแห่งชาติ...

การเจริญเติบโต

GenBank เติบโตขึ้นอย่างมากนับตั้งแต่เริ่มก่อตั้ง การวิเคราะห์ในช่วงแรกและบันทึกการเผยแพร่ได้อธิบายการเติบโตนี้ว่ามีจำนวนเบสเพิ่มขึ้นเป็นสองเท่าทุกๆ 18 เดือน...