เจนแบงก์
ฐานข้อมูลลำดับนิวคลีโอไทด์ GenBank เป็น ฐาน ข้อมูลแบบเปิด ที่รวบรวมลำดับ นิวคลีโอไทด์และ คำแปล โปรตีนที่เข้าถึงได้โดยสาธารณะ พร้อมคำ อธิบายประกอบ GenBank เป็นส่วนหนึ่งของความร่วมมือฐานข้อมูลลำดับนิวคลีโอไทด์ระหว่างประเทศ (INSDC) และจัดทำและดูแลรักษาโดยศูนย์ข้อมูลเทคโนโลยีชีวภาพแห่งชาติ (NCBI) ซึ่งเป็นส่วนหนึ่งของห้องสมุดการแพทย์แห่งชาติสหรัฐอเมริกา (NLM) ซึ่งเป็นส่วนหนึ่งของสถาบันสุขภาพแห่งชาติ (NIH)
ณ การเผยแพร่ GenBank เวอร์ชัน 271.0 (เมษายน 2026) ฐานข้อมูลประกอบด้วยเบส 53.90 ล้านล้านเบสและระเบียนลำดับ 6.27 พันล้านรายการ รวมถึงรายการ GenBank 261,460,182 รายการที่มีข้อมูลลำดับเบส 7,289,942,983,522 คู่[ 2 ]ฐานข้อมูลนี้ประกอบด้วยลำดับจากสายพันธุ์ที่ได้รับการอธิบายอย่างเป็นทางการมากกว่า 581,000 สายพันธุ์[ 3 ] ฐานข้อมูลนี้ก่อตั้งขึ้นในปี 1982 โดยWalter Goadและห้องปฏิบัติการแห่งชาติ Los Alamosและได้กลายเป็นแหล่งข้อมูลสำคัญสำหรับการวิจัยทางชีววิทยา GenBank สร้างขึ้นจากการส่งข้อมูลโดยตรงจากห้องปฏิบัติการแต่ละแห่ง รวมถึงการส่งข้อมูลจำนวนมากจากโครงการจัดลำดับขนาดใหญ่[ 3 ]
การส่งผลงาน
GenBank รับการส่งลำดับนิวคลีโอไทด์จากห้องปฏิบัติการแต่ละแห่งและโครงการจัดลำดับขนาดใหญ่ การส่งโดยตรงทำได้โดยใช้พอร์ทัลการส่งข้อมูลของ NCBI [ 4 ]ซึ่งมีขั้นตอนการทำงานที่แนะนำสำหรับการส่งข้อมูล หรือส่งผ่านโปรแกรมโดยใช้เครื่องมือต่างๆ เช่นtable2asnระบบการส่งข้อมูล BankIt เดิมกำลังถูกยกเลิกและแทนที่ด้วยพอร์ทัลการส่งข้อมูล[ 5 ]
เมื่อได้รับข้อมูลแล้ว เจ้าหน้าที่ GenBank จะตรวจสอบข้อมูลเพื่อความครบถ้วน ความสมบูรณ์ บริบททางชีววิทยา และความสอดคล้อง กำหนดหมายเลขการเข้าถึงและทำการตรวจสอบคุณภาพก่อนเผยแพร่สู่ฐานข้อมูลสาธารณะ ลำดับดีเอ็นเอที่ส่งเข้ามาสามารถเข้าถึงได้ผ่านEntrezและสามารถดาวน์โหลดได้ผ่านFTP
GenBank รองรับประเภทการส่งข้อมูลที่หลากหลาย รวมถึงการประกอบจีโนมแบบช็อตกันทั้งหมด (WGS) การประกอบทรานสคริปโตมแบบช็อตกัน (TSA) การศึกษาโลคัสเป้าหมาย (TLS) และลำดับจีโนมที่มีปริมาณมาก (HTGS) บันทึกคำอธิบายประกอบจากบุคคลที่สาม (TPA) อนุญาตให้เผยแพร่คำอธิบายประกอบตามลำดับที่มีอยู่แล้วใน GenBank ข้อมูลลำดับดิบที่สร้างโดยเทคโนโลยีการจัดลำดับรุ่นใหม่จะถูกฝากไว้ในคลังข้อมูลลำดับ (SRA) แทนที่จะฝากไว้ใน GenBank เอง[ 6 ]
ประวัติศาสตร์
Walter Goadจากกลุ่มชีววิทยาเชิงทฤษฎีและชีวฟิสิกส์ที่ห้องปฏิบัติการแห่งชาติลอสอะลาโมส (LANL) และเพื่อนร่วมงานได้ก่อตั้งฐานข้อมูลลำดับลอสอะลาโมสขึ้นในปี 1979 ซึ่งนำไปสู่การสร้างฐานข้อมูลสาธารณะ GenBank ในปี 1982 [ 7 ]ได้รับทุนสนับสนุนจากสถาบันสุขภาพแห่งชาติมูลนิธิวิทยาศาสตร์แห่งชาติกระทรวงพลังงานและกระทรวงกลาโหม LANL ร่วมมือกับบริษัทBolt, Beranek, and Newman ในการสร้าง GenBank และภายในสิ้นปี 1983 มีการรวบรวมลำดับมากกว่า 2,000 ลำดับ คำอธิบายเบื้องต้นของฐานข้อมูลได้รับการตีพิมพ์ในปี 1985 เมื่อ GenBank มีเบสมากกว่าห้าล้านเบสในรายการลำดับประมาณ 6,000 รายการ[ 8 ]
ในช่วงปลายทศวรรษ 1980 และต้นทศวรรษ 1990 ความรับผิดชอบของ GenBank ได้เปลี่ยนจาก Los Alamos National Laboratory ไปยังNational Center for Biotechnology Information (NCBI) ที่จัดตั้งขึ้นใหม่ ณUnited States National Library of Medicine (NLM) ซึ่งเป็นส่วนหนึ่งของNational Institutes of Health (NIH) เอกสารการเผยแพร่ GenBank ในปัจจุบันจากช่วงเวลานี้สะท้อนให้เห็นถึงการเปลี่ยนแปลงจากการมีส่วนร่วมร่วมกันของเจ้าหน้าที่ฐานข้อมูลที่ตั้งอยู่ใน LANL และทีมจัดทำดัชนีที่ตั้งอยู่ใน NLM ไปสู่การจัดการโดย NCBI อย่างเต็มรูปแบบ ซึ่งบ่งชี้ถึงการถ่ายโอนการดูแลจัดการข้อมูลและความรับผิดชอบในการดำเนินงานเป็นระยะ[ 9 ]


การเจริญเติบโต

GenBank เติบโตขึ้นอย่างมากนับตั้งแต่เริ่มก่อตั้ง การวิเคราะห์ในช่วงแรกและบันทึกการเผยแพร่ได้อธิบายการเติบโตนี้ว่ามีจำนวนเบสเพิ่มขึ้นเป็นสองเท่าทุกๆ 18 เดือน แม้ว่าอัตราการเติบโตจะแตกต่างกันไปตามกาลเวลาเนื่องจากการเปลี่ยนแปลงของเทคโนโลยีการจัดลำดับและแนวทางการส่งข้อมูล[ 2 ]
ณ การเผยแพร่ GenBank เวอร์ชัน 271.0 (เมษายน 2026) ฐานข้อมูลประกอบด้วยเบสมากกว่า 53.9 ล้านล้านเบสและบันทึกลำดับ 6.27 พันล้านรายการ ซึ่งสะท้อนให้เห็นถึงการมีส่วนร่วมขนาดใหญ่อย่างต่อเนื่องจากโครงการจัดลำดับแบบความเร็วสูง[ 2 ]
แม้ว่าสถิติการเผยแพร่ของ GenBank จะสรุปการแบ่งส่วนแบบดั้งเดิมของ GenBank แต่ชุดลำดับขนาดใหญ่ที่มุ่งเน้นปริมาณจำนวนมากหลายชุดจะถูกติดตามแยกต่างหาก บันทึก Whole Genome Shotgun (WGS), Transcriptome Shotgun Assembly (TSA) และ Targeted Locus Study (TLS) จะถูกประมวลผลโดย GenBank แต่ไม่ได้เผยแพร่เป็นส่วนหนึ่งของไฟล์การเผยแพร่ GenBank ปกติ แต่จะมีการเผยแพร่อย่างต่อเนื่องผ่านพื้นที่ FTP แยกต่างหากสำหรับแต่ละโครงการ[ 2 ]
สำหรับเวอร์ชัน 271.0 ข้อมูลลำดับส่วนใหญ่จะอยู่ในระเบียน WGS แทนที่จะเป็นรายการ GenBank แบบดั้งเดิม
| ของสะสม | รายการ | ฐาน |
|---|---|---|
| รายการ GenBank แบบดั้งเดิม | 261,460,182 | 7.289942983522 × 10 |
| การถอดรหัสจีโนมทั้งหมดแบบช็อตกัน (Whole Genome Shotgun หรือ WGS) | 4,756,526,485 | 4.5628511953497 × 10 |
| การประกอบทรานสคริปโตมแบบช็อตกัน (TSA) | 1,058,643,373 | 8.98651493967 × 10 |
| การศึกษาตำแหน่งเป้าหมาย (TLS) | 191,365,090 | 7.9162820303 × 10 |
| ทั้งหมด | 6,267,995,130 | 5.3896269141289 × 10 |
ตารางต่อไปนี้แสดงรายการสิ่งมีชีวิต 20 ชนิดที่มีจำนวนเบสมากที่สุดในกลุ่ม GenBank แบบดั้งเดิมสำหรับการเผยแพร่เวอร์ชัน 271.0 โดยไม่รวม WGS, TSA, TLS, เมตาจีโนมิกส์, ไมโตคอนเดรียล, คลอโรพลาสต์, โครงสร้างสังเคราะห์ และหมวดหมู่อื่นๆ อีกหลายหมวดหมู่ที่กำหนดไว้ในบันทึกการเผยแพร่[ 2 ]
| สิ่งมีชีวิต | รายการ | ฐาน | รหัสจำแนกทางอนุกรมวิธานของ NCBI [ a ] |
|---|---|---|---|
| ข้าวสาลีสามัญ ( Triticum aestivum ) | 1,948,752 | 4.05961950617 × 10 | 4565 |
| ไวรัสโคโรนาสายพันธุ์ 2 ที่ก่อให้เกิดโรคทางเดินหายใจเฉียบพลันรุนแรง (SARS-CoV-2) | 9,204,178 | 2.73571729605 × 10 | 2697049 |
| ข้าวโอ๊ต ( Avena sativa ) | 30,555 | 2.73192060156 × 10 | 4497 |
| ข้าวบาร์เลย์ ( Hordeum vulgare ) | 113,643 | 2.59319130177 × 10 | 4513 |
| ฮอร์เดียม บัลโบซัม | 753 | 2.12675690135 × 10 | 4514 |
| ข้าวบาร์เลย์เพาะปลูก ( Hordeum vulgare subsp. vulgare ) | 1,347,104 | 1.25991654054 × 10 | 112509 |
| ต้นมิสเซิลโท ( Viscum album ) | 164 | 9.3011095388 × 10 | 3973 |
| ข้าวบาร์เลย์ป่า ( Hordeum vulgare subsp. spontaneum ) | 29,978 | 9.2980378923 × 10 | 4512 |
| หนูบ้าน ( Mus musculus ) | 10,118,677 | 4.6333339697 × 10 | 10090 |
| มนุษย์ ( โฮโมเซเปียนส์ ) | 28,773,499 | 3.8432937493 × 10 | 9606 |
| เอสเชอริเชีย โคลี | 195,553 | 3.771187484 × 10 | 562 |
| มะเขือยาว ( Solanum melongena ) | 4,711 | 3.7408102376 × 10 | 4111 |
| ผักกาดหอมธาเลียนา ( Arabidopsis thaliana ) | 2,643,074 | 3.3455227111 × 10 | 3702 |
| วัว ( Bos taurus ) | 2,246,081 | 3.3006519943 × 10 | 9913 |
| เคล็บซิเอลลา นิวโมเนีย | 43,595 | 2.6206281917 × 10 | 573 |
| ข้าวโพด ( Zea mays ) | 4,224,726 | 2.4918520894 × 10 | 4577 |
| ถั่วปากอ้า ( Vicia faba ) | 28,783 | 2.3037489636 × 10 | 3906 |
| นิวท์ฝ่ามือ ( Lissotriton helveticus ) | 507 | 2.2852582653 × 10 | 8293 |
| นิวท์หงอนเหนือ ( Triturus cristatus ) | 1,634 | 2.2052877731 × 10 | 8297 |
| ข้าวโอ๊ตป่า ( Avena sterilis ) | 248 | 2.1843250305 × 10 | 4499 |
ข้อจำกัด
การวิเคราะห์ GenBank และบริการอื่นๆ สำหรับการระบุโมเลกุลของเชื้อที่แยกได้จากการเพาะเชื้อในเลือดทางคลินิกโดยใช้ลำดับ16S rRNA [ 10 ]แสดงให้เห็นว่าการวิเคราะห์ดังกล่าวมีความแม่นยำมากขึ้นเมื่อรวม GenBank เข้ากับบริการอื่นๆ เช่นEzTaxon -e [ 11 ] และ ฐานข้อมูลBIBI [ 12 ]
GenBank อาจมีลำดับที่ถูกกำหนดให้กับสายพันธุ์ใดสายพันธุ์หนึ่งอย่างไม่ถูกต้อง เนื่องจากการระบุสิ่งมีชีวิตในเบื้องต้นนั้นผิดพลาด การศึกษาล่าสุดแสดงให้เห็นว่า 75% ของลำดับไมโทคอนเดรียลไซโตโครมซีออกซิเดสซับยูนิต Iถูกกำหนดให้กับปลาNemipterus mesoprion อย่างไม่ถูกต้อง อันเนื่อง มาจากการใช้ลำดับของบุคคลที่ระบุผิดพลาดในตอนแรกอย่างต่อเนื่อง[ 13 ]ผู้เขียนได้ให้คำแนะนำเกี่ยวกับวิธีการหลีกเลี่ยงการเผยแพร่ลำดับที่มีชื่อวิทยาศาสตร์ไม่ถูกต้องในที่สาธารณะต่อไป
เอกสารต้นฉบับที่ตีพิมพ์จำนวนมากได้ระบุลำดับที่ผิดพลาดใน GenBank [ 14 ] [ 15 ] [ 16 ]สิ่งเหล่านี้ไม่เพียงแต่เป็นการกำหนดชนิดที่ไม่ถูกต้อง (ซึ่งอาจมีสาเหตุที่แตกต่างกัน) แต่ยังรวมถึงไคเมราและบันทึกการเข้าถึงที่มีข้อผิดพลาดในการจัดลำดับ เอกสารต้นฉบับล่าสุดเกี่ยวกับคุณภาพของ บันทึก Cytochrome b ทั้งหมด ของนกยังแสดงให้เห็นเพิ่มเติมว่า 45% ของบันทึกที่ผิดพลาดที่ระบุนั้นขาดตัวอย่างอ้างอิงที่ป้องกันการประเมินการระบุชนิดใหม่[ 17 ]
ปัญหาอีกประการหนึ่งคือบันทึกลำดับมักถูกส่งเป็นลำดับที่ไม่ระบุชื่อสายพันธุ์ (เช่น " Pelomedusa sp. A CK-2014") เนื่องจากสายพันธุ์นั้นไม่เป็นที่รู้จักหรือถูกระงับไว้เพื่อวัตถุประสงค์ในการตีพิมพ์ อย่างไรก็ตาม แม้หลังจากที่ระบุสายพันธุ์หรือตีพิมพ์แล้ว บันทึกลำดับเหล่านี้ก็ยังไม่ได้รับการอัปเดต จึงอาจทำให้เกิดความสับสนอย่างต่อเนื่อง[ 18 ]
ดูเพิ่มเติม
- ความร่วมมือฐานข้อมูลลำดับนิวคลีโอไทด์ระหว่างประเทศ (INSDC)
- หอจดหมายเหตุนิวคลีโอไทด์แห่งยุโรป (ENA)
- ธนาคารข้อมูลดีเอ็นเอแห่งประเทศญี่ปุ่น (DDBJ)
- RefSeq — ลำดับอ้างอิงที่คัดสรรแล้วซึ่งได้มาจาก GenBank
- UniProt — ฐานข้อมูลลำดับและคำอธิบายประกอบโปรตีน
- การวิเคราะห์ลำดับ
- ข้อมูลวิทยาศาสตร์แบบเปิด
หมายเหตุ
- ↑หรือรู้จักกันในชื่อ NCBI TaxID
บทความนี้ได้นำเนื้อหาที่เป็นสาธารณสมบัติจากNCBI Handbook มา ใช้(ศูนย์ข้อมูลเทคโนโลยีชีวภาพแห่งชาติ )
ลิงก์ภายนอก
- หน้าแรกของ GenBank
- ตัวอย่างบันทึกข้อมูลใน GenBank (ฮีโมโกลบินเบต้า)
- โปรแกรมยูทิลิตี้ Entrez (E-utilities)
- GenBank, RefSeq, TPA และ UniProt: ชื่อเหล่านี้มีความหมายอย่างไรบ้าง?