ИИ Google просчитал заранее каждую возможную опечатку в геноме человека
Ребёнку с тяжёлой эпилепсией расшифровывают геном, ищут поломку — и не находят. Все гены, кодирующие белки, выглядят обычно. На этом месте поиск часто и останавливается, потому что дальше начинается территория, где генетики читать почти не умеют.
Территория эта огромная: белки кодируют около двух процентов нашей ДНК. Остальное долго звалось мусором, а теперь известно, что там сидят переключатели, которые решают, где и насколько громко работает ген. Поломка переключателя болезнь вызвать может, а вот доказать это по одной букве замены — задача, на которой всё и вставало.
Команда Google DeepMind подошла к ней грубой силой: просчитала последствия каждой возможной однобуквенной замены во всём человеческом геноме. Заранее, все девять миллиардов.
Модель сравнивает геном с самим собой
Внутри работает AlphaGenome — модель, описанная в Nature в начале этого года. Она читает кусок ДНК длиной до миллиона букв и предсказывает по нему молекулярные последствия: где откроется хроматин, куда сядут белки-регуляторы, как пройдёт сплайсинг, сколько РНК получится с гена.
Дальше приём простой. Модели дают исходную последовательность, потом ту же самую с одной изменённой буквой, и смотрят, чем предсказания отличаются. Разница и есть оценка того, насколько замена вмешивается в работу участка.
Такой расчёт для одного варианта занимает секунду. Помноженный на весь геном, он дал массив размером около петабайта — раз в тридцать больше, чем вся база предсказанных структур белков AlphaFold. Плюс более ста миллионов вставок и выпадений букв, встречающихся в больших биобанках.

Балл говорит о молекуле, а не о диагнозе
Все эти предсказания свели в одно число — AVI. Оно отвечает на вопрос, насколько сильно замена бьёт по молекулярной машинерии, и раскладывается на понятные слагаемые: доступность хроматина, сплайсинг, эволюционная консервативность.
Важно, чем это число не является. Оно не говорит «вариант патогенный». Оно говорит «здесь предсказан сильный молекулярный эффект» — а дальше решает человек с клиническими данными.
На каталоге ClinVar выиграли почти везде
Качество меряли на ClinVar, каталоге вариантов, которые эксперты уже разметили как опасные или безвредные. Задача была отделить одни от других, особенно в некодирующих участках, где прежние инструменты работали слабо.
AVI обошёл прежних лидеров в интронах, в синонимичных заменах и в нетранслируемых концах генов, причём в некоторых категориях с большим отрывом. Обошёл и CADD — рабочую лошадку генетиков, построенную на полутора сотнях признаков.
Не везде: в одном классе вариантов, 5’-концевых, конкурирующая модель осталась немного впереди. В статье это написано прямо, что для работы от большой компании приятная редкость.

Найденный вариант сидел глубоко в интроне
Практику проверили на консорциуме GREGoR, который занимается нерешёнными генетическими случаями. Тот самый ребёнок с эпилептической энцефалопатией: модель подсветила вариант в гене DNM1, спрятанный глубоко внутри интрона. Механизм оказался в сплайсинге — замена создавала ложную точку сборки, и белок собирался неправильным. Предсказание подтвердили экспериментом.
Второй пример из популяционной генетики. Команда из Эксетера взяла данные пятидесяти четырёх тысяч участников UK Biobank и уровни двух тысяч белков в их крови. Фильтрация по новому баллу подняла число найденных связей с редкими некодирующими вариантами примерно на четверть. В одном участке список подозреваемых сжался с пятисот с лишним вариантов до четырёх.
Клинике это пока не отдают, и сказано это прямо
Здесь нужна трезвость. Работа про Atlas не проходила рецензирование: это технический отчёт DeepMind, выложенный вместе с блогом. Рецензию прошла базовая модель, и вышла она в Nature.
Сами авторы пишут, что AlphaGenome не валидирована и не одобрена ни для какого клинического применения, а предсказания нельзя использовать для медицинских решений. Ограничений хватает и чисто технических. Модель обучена только на геномах человека и мыши. Материнскую и отцовскую копии гена она не различает. А регуляторные элементы, удалённые больше чем на сотню тысяч букв, ей даются хуже всего.
Доступ к Atlas бесплатный для некоммерческих исследований, через портал и открытый программный интерфейс.
Так что случай из первого абзаца теперь распутывается иначе. Раньше некодирующая часть генома была местом, где поиск заканчивался. Теперь у генетика есть готовая карта с подсветкой подозрительных мест — не ответ, а короткий список для проверки в лаборатории. Сами авторы называют свой результат отправной точкой, а не финишем.
Это обзор научной работы, а не медицинская рекомендация. Интерпретацию любых генетических находок определяет врач-генетик.
Каждый день коротко о науке, технологиях, здоровье и психологии — всегда со ссылкой на первоисточник.
Читать в Telegram

