Глава Radical Numerics призвал развивать геномные модели быстрее ради биозащиты
Эрик Нгуен: защита в биобезопасности сейчас проигрывает. Его стартап показал модели слабые молекулы РНК по возрастанию качества — и она сама продолжила ряд, выдав более удачные, чем видела.
Биобезопасность стала гонкой вооружений, и защита в ней сейчас проигрывает, заявил глава и соучредитель стартапа Radical Numerics Эрик Нгуен в подкасте Latent Space. Ответ, по его мнению, — не притормозить разработку геномных моделей, а развивать их быстрее: те же модели, что усиливают биологические возможности, нужны и стороне защиты.
Radical Numerics строит геномные языковые модели для широкого круга биологических задач, а не только для конструирования ДНК. Нгуен — доктор философии Стэнфорда по биоинженерии и ИИ, он участвовал в создании моделей Evo и Evo 2 в Arc Institute1. Главный научный сотрудник по ИИ Майкл Поли, президент Стефано Массароли и технический директор Армин Томас ранее работали в Liquid AI2; Массароли до этого был постдоком у Йошуа Бенджио.
Геномная языковая модель учится не на тексте, а на последовательностях ДНК. Алфавит там всего из четырёх букв, зато сами последовательности очень длинные. Поэтому такие модели стали возможны только после появления архитектур с длинным контекстом — примерно три года назад, задолго до того, как крупные лаборатории начали выпускать модели с контекстом больше миллиона токенов.
Нгуен описывает и аналог цепочки рассуждений3 на языке ДНК. Команда взяла большой набор аптамеров4 с оценками их качества, спрятала самые удачные образцы и показала модели только слабые, выстроив их по возрастанию оценки. Затем модель попросили продолжить этот ряд самостоятельно.
«И оказалось, что она смогла воспроизвести некоторые из тех более высоких оценок, которые мы ей ещё не показывали», — рассказал Нгуен. По его словам, смысл эксперимента был в том, дойдёт ли модель сама до лучшего результата, на какой способна.
Модели компании, по словам Нгуена, уже неплохо работают с РНК и белками. Причина в том, что РНК и белки записаны в самой ДНК: в последовательности чётко размечены гены, из которых получаются РНК, а часть генов кодирует белки. Обучаясь только на ДНК, модель осваивает сразу несколько «языков» — ещё до обучения на других типах данных: трёхмерной структуре белков, эпигенетике и естественном языке.
В Стэнфорде Нгуен долго не мог заинтересовать биологов геномными моделями: они не верили, что подход заработает, не понимали, как проверять вывод модели, и не видели применений сверх того, что уже умели сами. Позже другая группа из Arc Institute и Стэнфорда с помощью Evo и Evo 2 составила с нуля полные геномы бактериофагов — вирусов, которые поражают бактерии. По этим последовательностям в лаборатории собрали вирусы, и они оказались работающими.