Ученые из Калифорнийского университета в Беркли разработали модель искусственного интеллекта, способную выявлять наиболее важные генетические варианты в геноме человека, в том числе изменения, связанные с наследственными заболеваниями. Модель получила название GPN-Star и при этом требует значительно меньше вычислительных ресурсов для обучения, чем многие существующие системы. Результаты исследования опубликованы в журнале Nature.

Полный геном человека содержит около 3 млрд пар оснований ДНК, однако ученые до сих пор не понимают функции значительной части этого кода. Лишь примерно 1–2% ДНК непосредственно кодирует белки. Остальная часть включает в том числе регуляторные участки, управляющие активностью генов, а также последовательности, биологическая функция которых пока остается неизвестной.

Именно в некодирующих областях могут находиться генетические варианты, влияющие на такие признаки и заболевания, как рак, болезни сердца и некоторые расстройства нервной системы. Однако определить значение каждого из миллионов вариантов экспериментально практически невозможно.

GPN-Star должна помочь ученым решить эту задачу. Модель относится к так называемым языковым моделям генома: подобно чат-ботам, которые анализируют закономерности человеческой речи, они изучают последовательности ДНК и пытаются распознать их своеобразную «грамматику».

ДНК представляет собой последовательность всего четырех букв — A, C, G и T, соответствующих четырем азотистым основаниям. Для человека отдельная последовательность сама по себе не всегда позволяет понять, является ли конкретный участок функционально важным. Однако сравнение геномов разных видов помогает выявить области, которые сохранялись на протяжении эволюции, и изменения, которые могли иметь биологическое значение.

Именно такой подход использовали авторы GPN-Star. Вместо того чтобы обучать модель на отдельных, несопоставленных геномах, они использовали полногеномные выравнивания — данные, в которых геномы разных видов уже сопоставлены друг с другом. Это позволяет модели сосредоточиться на участках ДНК, сохранившихся в ходе эволюции, и одновременно отсеивать значительную часть генетического «шума».

В результате GPN-Star можно обучить всего за несколько дней, а в некоторых случаях — за несколько часов, используя лишь несколько процессоров. Для сравнения, значительно более крупная модель Evo 2 обучалась на геномах более 100 тысяч видов и потребовала около 2 тысяч мощных процессоров NVIDIA и нескольких месяцев работы.

Исследователи также обнаружили, что выбор видов, с которыми сравнивают человеческий геном, влияет на то, какие генетические варианты модель лучше распознает. Системы, обученные на данных, охватывающих более длительные эволюционные периоды, лучше определяли влияние редких изменений в белок-кодирующих участках. Эти участки меняются медленно и поэтому хорошо сохраняются у разных видов.

Модели, обученные на более близких к человеку эволюционных группах, напротив, лучше справлялись с оценкой вариантов, связанных со сложными признаками, включая генетическую предрасположенность к шизофрении. Такие признаки могут зависеть от тысяч генетических изменений, причем многие из них расположены именно в некодирующих областях ДНК.

Авторы уже опубликовали созданные моделью прогнозы для всего генома. Они могут помочь биологам определить, какие генетические варианты и регуляторные элементы стоит исследовать в первую очередь.

По словам исследователей, задача модели не в том, чтобы заменить лабораторные эксперименты. Напротив, ее прогнозы должны помочь ученым выбрать из огромного количества возможных вариантов те, проверка которых потенциально принесет наибольшую пользу для понимания заболеваний и механизмов наследования.

Создатели GPN-Star надеются, что благодаря относительно небольшим требованиям к вычислительным ресурсам другие исследовательские группы смогут легко адаптировать и совершенствовать модель. Это, по их мнению, позволит ускорить изучение генома человека и других видов.