Claude Science научился предсказывать структуру белков с помощью моделей NVIDIA BioNeMo
NVIDIA и Anthropic подключили инструменты BioNeMo к Claude Science. Теперь агент сам разворачивает модели сворачивания белков OpenFold3 и Boltz-2 и сравнивает их прогнозы. В примере NVIDIA точность прогноза контакта двух белков держится на выравнивании последовательностей.
Агент в Claude Science теперь может сам запускать модели NVIDIA, которые предсказывают трёхмерную структуру белков. NVIDIA и Anthropic вместе подключили набор BioNeMo Agent Toolkit к Claude Science — научной рабочей среде Anthropic. В наборе собраны модели и библиотеки NVIDIA для биологии, химии, геномики и разработки лекарств. Каждая оформлена как навык, который агент вызывает сам: ему не нужно разбираться, какую модель выбрать и как составить к ней запрос.
По внутренним тестам NVIDIA, с этими навыками агент правильно решает все задачи вместо 60%. Токенов он при этом тратит примерно вдвое меньше. Работать можно на своей машине с видеокартой L40S или H100 либо удалённо: через SSH, вычислительный кластер или облако Modal. Место на диске понадобится серьёзное — около 700 ГБ. Почти 490 ГБ из них занимает база белковых последовательностей для выравнивания.
Как это работает, NVIDIA показала на паре белков грибка, который вызывает паракокцидиоидомикоз: белке ядерной поры Seh1 и его предполагаемом партнёре C1HCX1. Агент взял последовательности из UniProt и нашёл родственные белки у других видов. Затем он предсказал структуру Seh1 отдельно и в паре с партнёром, причём двумя независимыми моделями — OpenFold3 и Boltz-2.
Главный вывод касается выравнивания. С ним обе модели уверенно предсказывают место контакта двух белков: оценка iPTM составила 0,85 у OpenFold3 и 0,82 у Boltz-2. Без выравнивания она падает до 0,14 и 0,19. Если запустить модели с большим числом попыток, картина не меняется: дополнительные вычисления не заменяют эволюционных данных.
Обе модели сошлись и в деталях. Партнёр не перестраивает Seh1, а достраивает его незамкнутую кольцевую структуру. Обе модели вставили один и тот же участок C1HCX1 в одно и то же место. Это повторяет наблюдение из недавней статьи о расширении базы AlphaFold.
NVIDIA оговаривается, что связь этих белков пока не проверена в лаборатории. Совпадение двух моделей даёт правдоподобную гипотезу, а не доказательство. Ценность подхода авторы видят в том, что такие гипотезы можно строить воспроизводимо, а последнее слово остаётся за экспериментом.