Google DeepMind научилась метить созданные ИИ белки скрытым водяным знаком
Метка прячется в выборе аминокислот и читается на самой синтезированной молекуле; в лабораторных опытах помеченные белки связывались с мишенями не хуже обычных.
Google DeepMind встроила скрытую метку в белки, спроектированные ИИ: она читается на самой синтезированной молекуле, а не только в цифровом файле. Работа вышла 30 сентября в Nature.
Почему это важно: заказы на синтез ДНК производители сверяют с базами известных опасных последовательностей. Модели могут придумать последовательность, не похожую ни на одну из них, и такую заявку приходится разбирать вручную, чтобы убедиться, что это не рукотворная угроза, — а это тормозит исследования.
Повод: SynthID Bio переносит в биологию SynthID, систему водяных знаков Google для текста, картинок и видео. По прочности связывания и доле удачных дизайнов помеченные белки не уступили непомеченным — это первые помеченные и при этом работающие белки-связыватели, утверждает DeepMind.
Как это работает: методов два, плюс проверка по ключу:
- Для последовательностей метку прячут в выборе аминокислот: её встроили в ProteinMPNN — программу, которая подбирает последовательность под заданную форму белка.
- Для трёхмерных структур дообучили часть AlphaFold 3, и метка сидит в весах модели: предсказанные координаты атомов несут её, кто бы модель ни запускал.
- Читается метка только по секретному ключу; в структурах, по данным DeepMind, она обнаруживается почти всегда.
Детали: связыватели — небольшие белки, которые прицельно цепляются к одной мишени; помеченные сделали к трём мишеням:
- VEGF-A — сигнальный белок, который запускает рост новых кровеносных сосудов.
- Рецептор-связывающий домен шиповидного белка SARS-CoV-2 — участок, которым вирус узнаёт клетку.
- PD-L1 — «стоп-сигнал» для иммунных клеток, его выставляют многие опухоли, чтобы уйти от атаки.
Что говорят: «SynthID Bio — важный элемент пазла в отслеживании происхождения спроектированных молекул», — сказала Сара Картер, специалист по политике биобезопасности из Science Policy Consulting, читавшая работу до публикации. Джеймс Дигганс, вице-президент по политике и биобезопасности Twist Bioscience, которая синтезирует ДНК по заказу, назвал водяные знаки «многообещающим пополнением набора инструментов биобезопасности»: они помогут сосредоточить силы на заказах, которые действительно требуют разбора.
Но: от намеренного удаления метка пока не защищена, и защиту от такого удаления DeepMind называет главной задачей на будущее. В Nature авторы пишут, что это доказательство принципа: чтобы метод заработал в биобезопасности, нужны отраслевые стандарты и общие договорённости.
Если шире: защиту тут строят слоями, и разные ИИ-компании закрывают разные слои. Anthropic 17 сентября пошла с другого конца: сняла часть биологических фильтров для проверенных лабораторий и фармкомпаний, пообещав проверять их запросы задним числом.
Что дальше: вместе с лабораторией Брайана Хи в Стэнфорде и Arc Institute1 метку встроили в геномную модель Evo 22 и пометили геном спроектированного самой Evo 2 бактериофага — вируса, который заражает бактерии. Первые опыты в культурах бактерий показали, что помеченные фаги остаются жизнеспособными, подробности обещают в отдельной статье.
Код метода и данные лабораторных проверок DeepMind открыла, веса раздаёт исследователям. «Биобезопасность — одна из самых срочных задач эпохи ИИ», — написал глава Google DeepMind Демис Хассабис в соцсети X.