Vi presenterar Evo 2, en prediktiv och generativ genomisk AI för livets alla områden

by Albert
Evo 2 modellerar DNA-sekvensen och möjliggör tillämpningar inom hela den centrala dogmen, som spänner över molekylära och cellulära skalor. Kredit: bioRxiv (2025). DOI: 10.1101/2025.02.18.638918

Forskare vid Arc Institute, Stanford University och NVIDIA har utvecklat Evo 2, en avancerad AI-modell som kan förutsäga genetiska variationer och generera genomiska sekvenser inom livets alla områden.

Tester visar att Evo 2 korrekt förutspår de funktionella effekterna av mutationer i prokaryota och eukaryota genom. Den har också framgångsrikt annoterat den ullhåriga mammutens genom från råa genomiska sekvenser utan en direkt träningsreferens, vilket visar på en förmåga att generalisera funktion från enbart sekvensen.

Dagens genomiska modeller har svårt att förutsäga mutationers funktionella effekter i olika biologiska system, särskilt när det gäller eukaryota genom. Maskininlärningsmetoder har visat viss framgång när det gäller modellering av proteinsekvenser och prokaryota genom. Komplexiteten i eukaryot DNA, med dess långdistansinteraktioner och regulatoriska element, utgör en större utmaning.

Evo 2 utvecklades för att hantera dessa begränsningar genom att införliva ett storskaligt träningsdataset som spänner över bakterier, arkéer, eukaryoter och bakteriofager, med fokus på breda genomiska mönster över arter snarare än att tränas för en enda specifik funktion.

I studien ”Genome Modeling and Design Across All Domains of Life with Evo 2”, som publicerats som ett bioRxiv-förtryck, beskriver teamet hur en modell som tränats på 9,3 biljoner DNA-baspar möjliggör förutsägelser och design på genomnivå.

Evo 2 tränades på 9,3 biljoner nukleotider (A, T, C eller G), vilket gör den till en av de största biologiska modeller som någonsin utvecklats. Modellen kan analysera och generera upp till 1 miljon nukleotider åt gången, vilket gör att den kan fånga långväga mönster och relationer inom DNA-sekvenser.

Under träningen lärde sig Evo 2 genom att förutsäga nästa baspar i en sekvens, på samma sätt som språkmodeller förutsäger nästa ord i en mening. Detta tillvägagångssätt gör det möjligt för Evo 2 att identifiera komplexa genomiska strukturer och exakt modellera den funktionella effekten av genetiska variationer inom livets alla områden.

Träningsdatasetet, OpenGenome2, var noggrant sammanställt för att utesluta genomiska sekvenser från virus som infekterar eukaryota värdar för att minska potentiellt missbruk.

En tvåfasig träningsstrategi användes, som började med en förträningsfas som prioriterade funktionella genetiska element och en mellanträningsfas som utökade kontextens längd för att fånga bredare genomiska mönster.

Evo 2 använder StripedHyena 2, en ny arkitektur som kombinerar inputberoende faltningsoperatorer med uppmärksamhetsmekanismer, optimerad för att effektivt hantera långa DNA-sekvenser i stor skala. Modellen tränades med hjälp av 1.024 GPU:er på 40 miljarder parameternivå, vilket ger högre effektivitet jämfört med traditionella transformatormodeller.

Resultaten visade att Evo 2 på ett korrekt sätt förutspår de funktionella effekterna av mutationer i prokaryota och eukaryota genom utan behov av uppgiftsspecifik finjustering. Modellen visade sig vara känslig för mutationer i startkodoner, skarvplatser och bevarade genomiska regioner, och prestandan överensstämde med kända biologiska begränsningar.

Specialiserade modeller som AlphaMissense och GPN-MSA presterade något bättre för kodande singelnukleotidvarianter, medan Evo 2 uppvisade överlägsen noggrannhet för indels och icke-kodande varianter. Inbäddningsbaserade klassificerare som tränats på Evo 2-representationer uppnådde topprestanda vid klassificering av BRCA1-varianter för bröstcancer.

Tolkningsanalys avslöjade att Evo 2 autonomt lär sig viktiga biologiska strukturer, inklusive bindningsställen för transkriptionsfaktorer, exon-introngränser och proteinstrukturella motiv.

Sparse autoencoder-tekniker identifierade latenta funktioner som motsvarar mobila genetiska element, profager och CRISPR-associerade sekvenser. Evo 2:s förmåga att generalisera demonstrerades genom att framgångsrikt annotera den ullhåriga mammutens genom, en art som inte fanns med i dess träningsdata.

Generering av sekvenser i genomskala testades också, och Evo 2 lyckades skapa kompletta mitokondriegenom, bakteriegenom och sekvenser i jästkromosomskala. De genererade sekvenserna uppvisade realistiska strukturella och evolutionära egenskaper, inklusive korrekta syntenymönster, proteinkodande regioner och regulatoriska element.

När Evo 2 uppmanades med mitokondriella genomsekvenser producerade Evo 2 DNA med rätt antal kodande gener, tRNA och rRNA.

Utöver sekvensgenerering tillämpades Evo 2 i en inferenstidsstyrd designuppgift för att konstruera DNA-sekvenser med programmerbar kromatintillgänglighet. Genom att integrera modeller för kromatintillgänglighet som Enformer och Borzoi genererade Evo 2 sekvenser med specifika regulatoriska egenskaper, inklusive förmågan att koda Morse-meddelanden inom epigenetiska strukturer.

Evo 2 utgör ett betydande framsteg inom genomisk AI genom att kombinera prediktiv precision med generativ förmåga på genomomfattande skalor. Genom att göra Evo 2:s träningskod, modellparametrar och OpenGenome2-datasetet öppet tillgängliga hoppas forskarna kunna påskynda genomforskningen.

Framtida tillämpningar av Evo 2 kan omfatta storskaliga populationsgenetiska studier, syntetisk biologi och avancerad epigenomisk design.

För mer information: Garyk Brixi et al, Genome modeling and design across all domains of life with Evo 2, bioRxiv (2025). DOI: 10.1101/2025.02.18.638918

Related Articles

Leave a Comment