10/09/2026
"เมื่อวิธีวิเคราะห์เดิมไม่อาจสรุปได้ว่าความแปรผันในจีโนม(genomic variant) ก่อโรคหรือไม่ การใช้แบบจำลอง AI อ่านร่องรอยวิวัฒนาการจึงเป็นแนวทางใหม่ในการหาคำตอบ"
ในห้องตรวจทางพันธุศาสตร์ สถานการณ์ที่แพทย์และผู้ป่วยต้องเผชิญอยู่บ่อยครั้งคือความสับสนเมื่อได้รับรายงานผลการถอดรหัสพันธุกรรม (Whole Genome Sequencing) เมื่อผู้ป่วยรายหนึ่งเข้ารับการตรวจเพื่อหาสาเหตุของโรคหายากที่อธิบายไม่ได้ ผลตรวจมักไม่ได้ชี้ชัดไปที่ยีนก่อโรคเพียงตัวเดียว แต่กลับแสดงให้เห็นความแปรผันทางพันธุกรรม (genetic variant) จำนวนมหาศาล ซึ่งหลายตำแหน่งถูกระบุว่าเป็น "ความแปรผันที่ยังไม่ทราบความสำคัญแน่ชัด" (Variants of Unknown Significance) ความท้าทายในปัจจุบันจึงไม่ได้อยู่ที่ความสามารถในการอ่านตัวอักษร A, C, G และ T ทั้ง 3,000 ล้านคู่เบสอีกต่อไป แต่อยู่ที่การแยกแยะว่าตัวอักษรใดที่เปลี่ยนแปลงไปแล้วส่งผลต่อการทำงานของเซลล์อย่างแท้จริง และตัวอักษรใดเป็นเพียงความแตกต่างตามธรรมชาติที่พบได้ทั่วไปและไม่ก่อให้เกิดอันตราย
ปัญหานี้ยิ่งทวีความซับซ้อนเมื่อความแปรผันนั้นซ่อนอยู่ใน DNA ส่วนที่ไม่สร้างโปรตีนโดยตรง จีโนมมนุษย์มีบริเวณที่เป็นรหัสสร้างโปรตีนเพียงร้อยละ 1–2 เท่านั้น ส่วนที่เหลือประกอบด้วยลำดับที่ยังไม่ทราบหน้าที่แน่ชัด ร่องรอยจากอดีตทางวิวัฒนาการ และองค์ประกอบควบคุมยีน (regulatory element) ที่ทำหน้าที่กำหนดว่ายีนใดจะทำงาน ในเซลล์ชนิดใด และในปริมาณเท่าใด การเปลี่ยนแปลงเพียงหนึ่งนิวคลีโอไทด์ในบริเวณควบคุมบางแห่งอาจรบกวนการเปิดปิดยีนได้ แม้จะไม่ได้เปลี่ยนโครงสร้างของโปรตีนเลยก็ตาม
เทคโนโลยีการถอดรหัสพันธุกรรมทำให้เราค้นพบความแปรผันเหล่านี้ได้รวดเร็ว แต่การทดสอบหน้าที่ของทุกตำแหน่งในห้องปฏิบัติการ ไม่ว่าจะเป็นในระดับเซลล์หรือสัตว์ทดลอง ยังเป็นไปไม่ได้ในทางปฏิบัติ นักวิทยาศาสตร์จึงต้องการเครื่องมือคำนวณเพื่อจัดลำดับความสำคัญว่า ตำแหน่งใดควรได้รับการตรวจสอบต่อ แม้การคำนวณจะไม่สามารถทดแทนการทดลองทางคลินิกได้ แต่ก็ช่วยลดพื้นที่การค้นหาจากตัวเลือกนับล้านให้เหลือเพียงชุดข้อมูลที่มีความเป็นไปได้ทางชีววิทยามากขึ้น
➖➖➖➖➖➖➖➖➖➖➖➖
ข้อจำกัดของเทคโนโลยีเดิมและการมาถึงของโมเดลภาษาจีโนม
➖➖➖➖➖➖➖➖➖➖➖➖
การเปรียบเทียบ DNA ระหว่างมนุษย์ด้วยกันเองเพื่อหาความผิดปกติมักไม่เพียงพอ เนื่องจากมนุษย์มีความใกล้ชิดทางพันธุกรรมสูง ตำแหน่งสำคัญบางแห่งจึงแทบไม่มีความแตกต่างให้เห็น นักวิทยาศาสตร์จึงอาศัยหลักการทางวิวัฒนาการที่ว่า หากการเปลี่ยนแปลงของ DNA ทำให้สิ่งมีชีวิตอยู่รอดหรือสืบพันธุ์ได้น้อยลง ความเปลี่ยนแปลงนั้นจะถูกส่งต่อไปยังรุ่นลูกหลานน้อยลง และค่อย ๆ หายไปจากประชากรผ่านการคัดเลือกโดยธรรมชาติ (natural selection) ดังนั้น ตำแหน่งที่ยังคงลำดับเดิมข้ามสปีชีส์เป็นเวลาหลายล้านปีจึงมีแนวโน้มที่จะมีหน้าที่สำคัญ
แบบจำลองวิวัฒนาการดั้งเดิม เช่น PhyloP และ PhastCons ทำหน้าที่ประเมินความอนุรักษ์ (conservation) ของลำดับพันธุกรรมเหล่านี้มานานหลายทศวรรษ แต่วิธีการเหล่านี้มักพิจารณาข้อมูลทีละตำแหน่งแยกจากกัน ทำให้ขาดการมองเห็นภาพรวมของบริบทแวดล้อม ต่อมาจึงมีการพัฒนาโมเดลภาษาจีโนม (genomic language model) ซึ่งเรียนรู้รูปแบบของ DNA ด้วยหลักการคล้ายคลึงกับ AI ที่ประมวลผลภาษาของมนุษย์ โดยให้โมเดลทายตัวอักษรทางพันธุกรรมที่ถูกปิดไว้จากบริบทแวดล้อมโดยรอบ
อย่างไรก็ตาม โมเดลภาษาจีโนมแบบลำดับเดี่ยว (single-sequence models) ที่มีอยู่ในปัจจุบัน เช่น Nucleotide Transformer หรือ Evo 2 ซึ่งมีขนาดพารามิเตอร์หลายพันล้านตัว ต้องอาศัยทรัพยากรการประมวลผล หน่วยความจำ และพลังงานมหาศาลในการเรียนรู้จากข้อมูลดิบ (ตัวอย่างเช่น Nucleotide Transformer ใช้หน่วยประมวลผล NVIDIA A100 จำนวน 128 ตัวฝึกประมวลผลนานนับเดือน ส่วน Evo 2 ใช้ H100 มากกว่า 2,000 ตัวเป็นเวลาหลายเดือน) แต่ในบางงานกลับยังคงให้ผลลัพธ์ที่ด้อยกว่าแบบจำลองวิวัฒนาการดั้งเดิม โดยเฉพาะเมื่อต้องประเมินความแปรผันในจีโนมของสิ่งมีชีวิตซับซ้อนและในบริเวณควบคุมที่อยู่ไกลจากยีน คำถามสำคัญจึงเปลี่ยนจากการเพิ่มขนาดข้อมูลหรือชิปประมวลผล ไปสู่การหาวิธีป้อนความรู้ทางชีววิทยาที่เหมาะสมให้กับโมเดลตั้งแต่กระบวนการเริ่มต้น
➖➖➖➖➖➖➖➖➖➖➖➖
การผสานแผนผังวิวัฒนาการเข้ากับการเรียนรู้ของ AI
➖➖➖➖➖➖➖➖➖➖➖➖
เพื่อแก้ปัญหานี้ ทีมนักวิจัยจาก University of California, Berkeley ได้พัฒนาสถาปัตยกรรมใหม่ที่ชื่อว่า GPN-Star (Genomic Pretrained Network with Species Tree and Alignment Representations) ซึ่งผสมผสานข้อมูลสองส่วนเข้าด้วยกัน ได้แก่ การจัดเรียงจีโนมทั้งจีโนมของหลายสปีชีส์ (whole-genome alignment หรือ WGA) และแผนผังความสัมพันธ์ทางวิวัฒนาการของสปีชีส์เหล่านั้น (species tree)
กระบวนการทำงานเริ่มต้นจากการแบ่งข้อมูล WGA ออกเป็นลำดับเป้าหมายและลำดับจากสปีชีส์อื่นๆ ตัวอักษรบางตำแหน่งในลำดับเป้าหมายจะถูกซ่อนไว้ โมเดลจะใช้กระบวนการที่เรียกว่า in-species self-attention เพื่ออ่านบริบทภายในลำดับเดียวกัน จากนั้นใช้ phylogeny-informed cross-attention เพื่อดึงข้อมูลจากสปีชีส์อื่น โดยกลไกนี้จะให้น้ำหนักความสำคัญของสปีชีส์ต่างๆ ตามระยะห่างบนแผนผังวิวัฒนาการ สปีชีส์ที่ใกล้ชิดกันจะถูกจัดกลุ่มเพื่อสร้างตัวแทนข้อมูลระดับกลุ่ม (clade-level embeddings) ทำให้โมเดลเข้าใจความสัมพันธ์เชิงวิวัฒนาการอย่างเป็นระบบ
นอกจากนี้ สิ่งที่ GPN-Star ทำแตกต่างออกไปคือการปรับแก้ค่าอัตราการกลายพันธุ์พื้นหลัง (background mutation rate) ลำดับ DNA ที่พบในธรรมชาติเป็นผลลัพธ์ที่ผสมผสานกันระหว่างการเกิดการกลายพันธุ์และแรงคัดเลือกทางธรรมชาติ หากไม่แยกสองปัจจัยนี้ออกจากกัน ตำแหน่งที่กลายพันธุ์ยากตามสมบัติทางเคมีอาจถูกตีความผิดว่าได้รับการอนุรักษ์ไว้เพราะมีความสำคัญ ทีมวิจัยจึงปรับเทียบผลการทำนายด้วยข้อมูลตำแหน่งที่เป็นกลางซึ่งมีความเชื่อมั่นสูง เพื่อให้คะแนนที่ได้สะท้อนข้อจำกัดที่เกิดจากการคัดเลือกทางธรรมชาติได้อย่างชัดเจนยิ่งขึ้น
ผลลัพธ์คือกลไกที่มองจีโนมคล้ายกับชุดคำสั่งที่มีระบบจัดเก็บซับซ้อน DNA ไม่ได้วางเป็นเส้นยาวอยู่ในนิวเคลียสอย่างอิสระ แต่มีการจัดพื้นที่ โค้งงอพับตัว และทำงานร่วมกัน โมเดลสามารถเรียนรู้ความสัมพันธ์ระหว่างนิวคลีโอไทด์ที่อยู่ห่างกัน (nucleotide dependency) ซึ่งเป็นจุดเด่นสำคัญที่ทำให้ GPN-Star ชนะโมเดลวิวัฒนาการแบบดั้งเดิมที่พิจารณาข้อมูลทีละตำแหน่งแยกจากกัน เปรียบเสมือน AI ที่เข้าใจ "ไวยากรณ์" ของประโยค ว่าประธานกับกริยาต้องสอดคล้องกันแม้จะมีคำขยายมาคั่นกลาง ในจีโนมก็เช่นกัน บริเวณที่โปรตีนเข้าจับ (TFBS) ต้องสอดคล้องกับจุดเริ่มต้นการถอดรหัสยีน ซึ่งช่วยให้เข้าใจกลไกได้ลึกซึ้งกว่าการดูเพียงความคงเดิมของตัวอักษรตำแหน่งใดตำแหน่งหนึ่ง
➖➖➖➖➖➖➖➖➖➖➖➖
เลนส์ที่มองไกลที่สุด อาจไม่ได้ให้ภาพที่ชัดเจนที่สุดเสมอไป
➖➖➖➖➖➖➖➖➖➖➖➖
หนึ่งในข้อค้นพบที่น่าสนใจจากการศึกษานี้คือ ระยะเวลาทางวิวัฒนาการที่นำมาใช้ฝึกโมเดลมีผลอย่างมากต่อชนิดของความแปรผันที่โมเดลสามารถประเมินได้ดีที่สุด ซึ่งเป็นผลลัพธ์ที่ทำให้เห็นกลไกอีกด้านหนึ่ง ขัดกับสมมติฐานทั่วไปที่มักเชื่อว่า ยิ่งเปรียบเทียบข้อมูลย้อนหลังไปไกลเท่าไหร่ก็ยิ่งได้ข้อมูลที่ครอบคลุมและน่าเชื่อถือมากขึ้นเท่านั้น
นักวิจัยได้สร้างโมเดล GPN-Star ขึ้นมาสามรุ่นบนพื้นฐานของ WGA สามระดับ โดยยึดจีโนมมนุษย์เป็นแกน ได้แก่ สัตว์มีกระดูกสันหลัง (ย้อนกลับไปราว 600 ล้านปี) สัตว์เลี้ยงลูกด้วยนม (ราว 100 ล้านปี) และไพรเมต (ราว 65 ล้านปี) ผลการทดสอบพบว่า แต่ละรุ่นมีความถนัดแตกต่างกันอย่างชัดเจนตามลักษณะทางชีววิทยา
สำหรับการประเมินความแปรผันชนิด missense (การเปลี่ยนแปลงที่ทำให้กรดอะมิโนในโปรตีนเปลี่ยนไป) ในฐานข้อมูล ClinVar ซึ่งประกอบด้วยตัวแปรก่อโรค 20,973 ตำแหน่งเทียบกับตัวแปรไม่ก่อโรค 26,238 ตำแหน่ง โมเดลรุ่นสัตว์มีกระดูกสันหลังให้ค่าความแม่นยำ (ประเมินจากพื้นที่ใต้กราฟ AUPRC) สูงที่สุด โดยมีประสิทธิภาพเทียบเท่าโมเดลภาษาโปรตีนอย่าง ESM-1b และดีกว่าแบบจำลองจีโนมขนาดใหญ่อื่นๆ นอกจากนี้ในตัวแปรมะเร็งจากฐานข้อมูล COSMIC (ตัวแปรมะเร็ง 181 ตำแหน่ง เทียบกับตัวแปรทั่วไป 14,426 ตำแหน่ง) รุ่นสัตว์มีกระดูกสันหลังก็ยังทำผลงานได้ดีที่สุด เนื่องจากหน้าที่พื้นฐานของโปรตีนส่วนใหญ่ได้รับการอนุรักษ์ข้ามสปีชีส์มาอย่างยาวนาน เมื่อนำไปทดสอบกับข้อมูล Deep Mutational Scanning ซึ่งเป็นการทดลองเปลี่ยนกรดอะมิโนจำนวนมากในโปรตีนจริง 31 ชุดจาก ProteinGym รุ่นสัตว์มีกระดูกสันหลังก็ทำได้ดีกว่าโมเดลประเมินทั่วจีโนมอื่นๆ แม้จะยังตามหลังโมเดลที่ออกแบบมาสำหรับวิเคราะห์โปรตีนโดยเฉพาะก็ตาม
แต่เมื่อเข้าสู่บริเวณที่ไม่สร้างโปรตีน (non-coding regions) ภาพลัพธ์กลับเปลี่ยนไปอย่างสิ้นเชิง GPN-Star รุ่นสัตว์เลี้ยงลูกด้วยนมทำผลงานได้ดีที่สุดในการจำแนกตัวแปรก่อโรคจากฐานข้อมูล OMIM (ตัวแปรก่อโรค 338 ตำแหน่ง เทียบกับตัวแปรทั่วไป 2,968 ตำแหน่ง) และ HGMD (ตัวแปรก่อโรค 745 ตำแหน่ง เทียบกับ 6,601 ตำแหน่ง) โดยเอาชนะโมเดลที่พยากรณ์การทำงานจากลำดับ (sequence-to-function models) อย่าง Enformer, Borzoi และ AlphaGenome ได้อย่างชัดเจน ความได้เปรียบนี้เห็นชัดเจนที่สุดในบริเวณองค์ประกอบควบคุมที่อยู่ห่างไกล (distal enhancer) นอกจากนี้ ในบริเวณ promoter ซึ่งเกี่ยวข้องกับการเริ่มถอดรหัสยีน รุ่นสัตว์เลี้ยงลูกด้วยนมก็ยังทำได้ดีกว่าโมเดลที่สร้างมาเฉพาะ promoter ในชุดทดสอบของ OMIM (ตัวแปรก่อโรค 225 ตำแหน่ง เทียบกับ 1,918 ตำแหน่ง)
มากไปกว่านั้น ในการวิเคราะห์ข้อมูลความสัมพันธ์ทั่วจีโนม (GWAS) เพื่อหาตัวแปรที่มีความเป็นไปได้สูงที่จะเป็นสาเหตุของลักษณะซับซ้อน (complex traits) โมเดลรุ่นไพรเมตกลับแสดงประสิทธิภาพสูงสุดในการดึงสัญญาณพันธุกรรมที่ถ่ายทอดได้ (heritability enrichment) โดยเฉพาะในลักษณะที่มีความเกี่ยวพันกับยีนจำนวนมาก (highly polygenic traits) เช่น โรคจิตเภท ซึ่งมีค่าความเป็นพหุยีนเชิงประสิทธิผลสูงถึง 13,069 ตรงข้ามกับลักษณะอย่างระดับ LDL cholesterol ที่มีค่าพหุยีนเพียง 89 ซึ่งโมเดลที่มองวิวัฒนาการไกลกว่าจะทำได้ดีกว่า ผลลัพธ์นี้สะท้อนให้เห็นว่าองค์ประกอบควบคุมยีนบางอย่างเพิ่งมีวิวัฒนาการในช่วงเวลาที่ใกล้เคียงกับมนุษย์ การใช้เลนส์วิวัฒนาการที่กว้างเกินไปอาจทำให้เรามองไม่เห็นข้อจำกัดที่เพิ่งเกิดขึ้นเหล่านี้
➖➖➖➖➖➖➖➖➖➖➖➖
จากความรู้ทางวิวัฒนาการสู่การประยุกต์ใช้ในระบบสุขภาพ
➖➖➖➖➖➖➖➖➖➖➖➖
ข้อค้นพบเหล่านี้เปิดโอกาสให้เกิดแนวทางใหม่ในการศึกษาโรค โดยเฉพาะการประเมินความเสี่ยงและการวินิจฉัยโรคทางพันธุกรรม ในปัจจุบัน การศึกษาความสัมพันธ์ของตัวแปรหายาก (Rare Variant Association Testing หรือ RVAT) เป็นงานที่ท้าทายมากทางสถิติ เนื่องจากตัวแปรที่มีผลกระทบรุนแรงมักพบได้ยากในประชากร เมื่อนักวิจัยนำคะแนนจาก GPN-Star ไปผนวกรวมกับเครื่องมือวิเคราะห์ทางสถิติอย่าง DeepRVAT ผลลัพธ์แสดงให้เห็นว่าระบบสามารถค้นพบยีนที่สัมพันธ์กับลักษณะต่างๆ ได้เพิ่มขึ้น (จากเฉลี่ย 383 ยีน เป็น 402 ยีน) และมีอัตราการยืนยันซ้ำในประชากรกลุ่มใหญ่ที่สูงขึ้น (จากเฉลี่ย 338 ยีน เป็น 353 ยีน)
นอกจากนี้ งานวิจัยยังมีการทดลองที่แสดงให้เห็นถึงสัญญาณความผิดปกติที่จำเพาะต่อเนื้อเยื่อ (Tissue-specific signals) เมื่อนำคะแนน GPN-Star ไปวิเคราะห์ร่วมกับยีนที่ทำงานเฉพาะเนื้อเยื่อ พบว่าโมเดลที่วิเคราะห์ "เนื้อเยื่อสมอง" สามารถพยากรณ์ความเสี่ยงโรคจิตเภท (Schizophrenia) ได้แม่นยำที่สุด ในขณะที่โมเดลของ "เนื้อเยื่อเลือด/ภูมิคุ้มกัน" ก็พยากรณ์โรคลูปัส (Lupus) ได้ดีที่สุด ข้อมูลนี้ช่วยให้เห็นภาพชัดเจนว่า AI ตัวนี้ไม่ได้บอกแค่ว่ายีนผิดปกติไหม แต่มันช่วยชี้เป้าไปถึงระบบอวัยวะที่เกี่ยวข้องได้ด้วย
สิ่งนี้มีความหมายอย่างเป็นรูปธรรมต่อระบบสุขภาพ ตัวชี้วัดทางชีวภาพ (biomarker) หรือคะแนนความเสี่ยงที่วิเคราะห์ด้วย AI อาจทำหน้าที่คล้ายสัญญาณเตือนที่ช่วยให้แพทย์และนักวิจัยเลือกได้ว่าควรส่งตรวจยืนยันหน้าที่ของยีนใดในห้องปฏิบัติการเป็นลำดับแรก ซึ่งอาจช่วยลดระยะเวลาในการค้นหาสาเหตุของโรคหายาก ลดต้นทุนในการทดลองที่ไม่จำเป็น และเพิ่มความแม่นยำในการคัดกรองตัวแปรที่พบใหม่
ยิ่งไปกว่านั้น กรอบการทำงานของ GPN-Star ไม่ได้จำกัดอยู่แค่มนุษย์ นักวิจัยได้นำสถาปัตยกรรมนี้ไปฝึกกับข้อมูลการจัดเรียงจีโนมและแผนผังสปีชีส์ของสิ่งมีชีวิตต้นแบบอีก 5 ชนิด ได้แก่ หนู (Mus musculus), ไก่ (Gallus gallus), แมลงหวี่ (Drosophila melanogaster), หนอนตัวกลม (Caenorhabditis elegans) และพืช (Arabidopsis thaliana) โดยพบว่าคะแนนที่ได้สามารถแยกแยะความแปรผันที่หายากออกจากความแปรผันทั่วไปได้ดีกว่าวิธีดั้งเดิมอย่าง PhyloP และ PhastCons ในทั้งห้าชนิด และยังทำได้ดีกว่าในการจำแนกตัวแปรก่อโรคหรือตัวแปรอันตรายในฐานข้อมูลเฉพาะของหนู แมลงหวี่ และหนอนตัวกลม ซึ่งอาจเป็นประโยชน์ต่องานวิจัยด้านสัตวแพทย์ การเกษตร และการพัฒนายาในอนาคต
➖➖➖➖➖➖➖➖➖➖➖➖
ข้อจำกัดและโจทย์ที่รอคอยการค้นพบ
➖➖➖➖➖➖➖➖➖➖➖➖
แม้ GPN-Star จะแสดงประสิทธิภาพที่น่าสนใจ แต่เทคโนโลยีนี้ยังมีข้อจำกัดที่ต้องพิจารณา ประการแรก การพึ่งพาข้อมูล WGA ทำให้โมเดลถูกจำกัดด้วยรูปแบบการจัดเรียงสาย DNA ที่กำหนดไว้แล้ว หากขยายหน้าต่างบริบทกว้างขึ้น ตำแหน่งที่ดูเหมือนอยู่ติดกันในโปรแกรมอาจไม่ได้อยู่ติดกันจริงในจีโนมของสปีชีส์อื่น ทำให้โมเดลไม่เหมาะสำหรับการประเมินความแปรผันเชิงโครงสร้างขนาดใหญ่ (structural variants) หรือการแทรกและขาดหายของลำดับ DNA (indels) ประการที่สอง โมเดลนี้ประเมินข้อจำกัดที่เกิดจากวิวัฒนาการข้ามสปีชีส์ จึงยังไม่มีความละเอียดพอที่จะศึกษาการปรับตัวที่เพิ่งเกิดขึ้นภายในประชากรมนุษย์ด้วยกันเอง ซึ่งต้องอาศัยข้อมูลจีโนมประชากรมนุษย์และมนุษย์โบราณ
ข้อสำคัญที่สุดคือ ผลลัพธ์จากโมเดลคำนวณยังไม่ใช่คำวินิจฉัยทางการแพทย์ การประเมินความเสี่ยงโดย AI ช่วยชี้เป้าหมายที่น่าสนใจและจัดลำดับความสำคัญ แต่ประโยชน์ที่พิสูจน์แล้วในผู้ป่วยจริงยังคงต้องอาศัยการทดลองหน้าที่ในเซลล์ (functional assays) ข้อมูลทางคลินิกอื่นๆ เช่น การถ่ายทอดในครอบครัว และการพิจารณาจากแพทย์ผู้เชี่ยวชาญร่วมด้วยเสมอ
เพื่อเป็นการผลักดันวงการวิทยาศาสตร์ให้ก้าวหน้าไปพร้อมกัน ทีมวิจัยได้เปิดกว้างให้ข้อมูลเหล่านี้เป็น "เครื่องมือที่เข้าถึงได้" โดยไม่ได้เก็บ AI ตัวนี้ไว้ใช้เอง แต่ได้เผยแพร่ซอร์สโค้ด โมเดลที่ฝึกแล้ว และคะแนนล่วงหน้าที่คำนวณไว้สำหรับทุกตำแหน่งในจีโนมมนุษย์ให้ดาวน์โหลดไปใช้งานได้ฟรี การเปิดกว้างนี้จะช่วยเร่งความเร็วในการวิจัยทั่วโลก และเปิดโอกาสให้นักวิทยาศาสตร์คนอื่นๆ นำไปต่อยอดได้
การศึกษาชิ้นนี้เชื่อมโยงข้อค้นพบจากวิวัฒนาการนับร้อยล้านปีเข้ากับความพยายามในการถอดรหัสโรคของผู้ป่วยในปัจจุบัน แต่ความท้าทายต่อไปคือ เราจะสามารถพัฒนาระบบที่ผสานข้อมูลความทรงจำทางวิวัฒนาการนี้ เข้ากับข้อมูลการแสดงออกของยีนที่ตอบสนองต่อสิ่งแวดล้อมแบบเรียลไทม์ได้อย่างไร เพื่อสร้างเครื่องมือทางพันธุศาสตร์ที่สามารถทำนายผลลัพธ์ทางสุขภาพได้อย่างแม่นยำและสมบูรณ์ยิ่งขึ้นในอนาคต
➖➖➖➖➖➖➖➖➖➖➖➖
รายการอ้างอิง
➖➖➖➖➖➖➖➖➖➖➖➖
1. Ye C, Benegas G, Albors C, et al. Predicting genome-wide functional constraints with GPN-Star. Nature. 2026. https://doi.org/10.1038/s41586-026-11005-5
2. UC Berkeley. New AI model for DNA learns from evolution to unlock secrets of the human genome. News release, 9 September 2026.
3. GPN source code and models. https://github.com/songlab-cal/gpn
4. Precomputed GPN-Star predictions. https://huggingface.co/collections/songlab/gpn-star-68c0c055acc2ee51d5c4f129