4DNews

AI

ИИ Google просчитал заранее каждую возможную опечатку в геноме человека

4 минуты чтения

ИИ Google просчитал заранее каждую возможную опечатку в геноме человека

Ребёнку с тяжёлой эпилепсией расшифровывают геном, ищут поломку — и не находят. Все гены, кодирующие белки, выглядят обычно. На этом месте поиск часто и останавливается, потому что дальше начинается территория, где генетики читать почти не умеют.

Территория эта огромная: белки кодируют около двух процентов нашей ДНК. Остальное долго звалось мусором, а теперь известно, что там сидят переключатели, которые решают, где и насколько громко работает ген. Поломка переключателя болезнь вызвать может, а вот доказать это по одной букве замены — задача, на которой всё и вставало.

Команда Google DeepMind подошла к ней грубой силой: просчитала последствия каждой возможной однобуквенной замены во всём человеческом геноме. Заранее, все девять миллиардов.

Модель сравнивает геном с самим собой

Внутри работает AlphaGenome — модель, описанная в Nature в начале этого года. Она читает кусок ДНК длиной до миллиона букв и предсказывает по нему молекулярные последствия: где откроется хроматин, куда сядут белки-регуляторы, как пройдёт сплайсинг, сколько РНК получится с гена.

Дальше приём простой. Модели дают исходную последовательность, потом ту же самую с одной изменённой буквой, и смотрят, чем предсказания отличаются. Разница и есть оценка того, насколько замена вмешивается в работу участка.

Такой расчёт для одного варианта занимает секунду. Помноженный на весь геном, он дал массив размером около петабайта — раз в тридцать больше, чем вся база предсказанных структур белков AlphaFold. Плюс более ста миллионов вставок и выпадений букв, встречающихся в больших биобанках.

Схема сравнения REF и ALT последовательностей, из разницы предсказаний вырастает столбик AVI
Схема сравнения REF и ALT последовательностей, из разницы предсказаний вырастает столбик AVI

Балл говорит о молекуле, а не о диагнозе

Все эти предсказания свели в одно число — AVI. Оно отвечает на вопрос, насколько сильно замена бьёт по молекулярной машинерии, и раскладывается на понятные слагаемые: доступность хроматина, сплайсинг, эволюционная консервативность.

Важно, чем это число не является. Оно не говорит «вариант патогенный». Оно говорит «здесь предсказан сильный молекулярный эффект» — а дальше решает человек с клиническими данными.

На каталоге ClinVar выиграли почти везде

Качество меряли на ClinVar, каталоге вариантов, которые эксперты уже разметили как опасные или безвредные. Задача была отделить одни от других, особенно в некодирующих участках, где прежние инструменты работали слабо.

AVI обошёл прежних лидеров в интронах, в синонимичных заменах и в нетранслируемых концах генов, причём в некоторых категориях с большим отрывом. Обошёл и CADD — рабочую лошадку генетиков, построенную на полутора сотнях признаков.

Не везде: в одном классе вариантов, 5’-концевых, конкурирующая модель осталась немного впереди. В статье это написано прямо, что для работы от большой компании приятная редкость.

Столбики качества по четырём классам вариантов, AVI против CADD и конкурента, один класс отмечен как проигранный
Столбики качества по четырём классам вариантов, AVI против CADD и конкурента, один класс отмечен как проигранный

Найденный вариант сидел глубоко в интроне

Практику проверили на консорциуме GREGoR, который занимается нерешёнными генетическими случаями. Тот самый ребёнок с эпилептической энцефалопатией: модель подсветила вариант в гене DNM1, спрятанный глубоко внутри интрона. Механизм оказался в сплайсинге — замена создавала ложную точку сборки, и белок собирался неправильным. Предсказание подтвердили экспериментом.

Второй пример из популяционной генетики. Команда из Эксетера взяла данные пятидесяти четырёх тысяч участников UK Biobank и уровни двух тысяч белков в их крови. Фильтрация по новому баллу подняла число найденных связей с редкими некодирующими вариантами примерно на четверть. В одном участке список подозреваемых сжался с пятисот с лишним вариантов до четырёх.

Клинике это пока не отдают, и сказано это прямо

Здесь нужна трезвость. Работа про Atlas не проходила рецензирование: это технический отчёт DeepMind, выложенный вместе с блогом. Рецензию прошла базовая модель, и вышла она в Nature.

Сами авторы пишут, что AlphaGenome не валидирована и не одобрена ни для какого клинического применения, а предсказания нельзя использовать для медицинских решений. Ограничений хватает и чисто технических. Модель обучена только на геномах человека и мыши. Материнскую и отцовскую копии гена она не различает. А регуляторные элементы, удалённые больше чем на сотню тысяч букв, ей даются хуже всего.

Доступ к Atlas бесплатный для некоммерческих исследований, через портал и открытый программный интерфейс.

Так что случай из первого абзаца теперь распутывается иначе. Раньше некодирующая часть генома была местом, где поиск заканчивался. Теперь у генетика есть готовая карта с подсветкой подозрительных мест — не ответ, а короткий список для проверки в лаборатории. Сами авторы называют свой результат отправной точкой, а не финишем.

Это обзор научной работы, а не медицинская рекомендация. Интерпретацию любых генетических находок определяет врач-генетик.

Каждый день коротко о науке, технологиях, здоровье и психологии — всегда со ссылкой на первоисточник.

Читать в Telegram