ИИтак

← Назад

Grok 4.6 лучше других отсеял замаскированные опасные задачи по биологии, но пропустил 40%

По тестам LatchBio, Grok 4.6 отказал в 59,2% опасных биологических задач и выполнил 64,8% обычных. Больше 50% по обоим показателям не набрала ни одна другая модель.

Grok 4.6 от SpaceXAI точнее других передовых моделей распознаёт опасные биологические задачи, спрятанные под видом обычной науки. Такой вывод сделала компания LatchBio на своём наборе тестов, а SpaceXAI пересказала результаты в блоге.

В главном тесте, BioSecBench-Refusal, обычные задачи из научных статей смешаны с 46 провокационными задачами. Опасность в них спрятана в приложенных данных, файлах с ложными названиями или в зашифрованном содержимом. Тест проверяет, понимает ли модель цель задачи. Модель, которая пугается слов «патоген» или «токсин», заблокирует обычную работу и пропустит замаскированную угрозу.

Grok 4.6 отказал в 59,2% опасных задач и выполнил 64,8% обычных. Больше 50% по обоим показателям не набрала ни одна другая проверенная модель. Сводная оценка LatchBio учитывает оба показателя. Модель проверяли в нескольких обвязках, и Grok 4.6 занял в рейтинге три первых места со средним результатом 62,1%. Обратная сторона лучшего результата: примерно две из пяти замаскированных опасных задач модель всё-таки взялась выполнять.

Во втором тесте, BioSecBench-Surveillance, модель должна вести геномный надзор за патогенами, как это делают службы здравоохранения: разбирать «грязные» данные секвенирования, пользоваться инструментами и принимать научные решения. Здесь Grok 4.6 справился с 53,5% задач. Это ниже, чем у Claude Opus 5, но выше, чем у GPT-5.6 Sol.

В журналах проверки видно, как модель изучает содержимое задачи и окружение, прежде чем решить. Часто она замечает, что заявленная цель расходится с данными, и отказывает. На безобидных задачах модель рассуждает так же, но приходит к выводу, что задача безопасна. SpaceXAI описывает свою защиту как многослойную. Модель учат отказывать, отдельные фильтры отсекают вредные запросы ещё до модели, а после запуска компания следит за подозрительным поведением отдельных сессий и пользователей.

SpaceXAI подчёркивает, что лишние отказы не менее опасны, чем помощь злоумышленникам. Если модель отказывается от обычной работы, врачам и исследователям труднее вовремя заметить вспышку болезни. Компания называет анализ LatchBio независимым. Кто заказал проверку и платил ли за неё кто-то, в материале не говорится.

← Все новости