Thinking Machines рассказала, как проверяла открытые модели Inkling перед выпуском
Thinking Machines считает, что Inkling и Inkling-Small не добавляют заметного риска по сравнению с уже доступными открытыми моделями. Более мощные модели компания предлагает открывать поэтапно.
Thinking Machines считает, что её открытые языковые модели Inkling и Inkling-Small не опаснее тех, что уже можно скачать. Лаборатория Миры Мурати рассказала, как пришла к этому выводу. Заодно она описала порядок, по которому собирается открывать более мощные модели.
Проверка шла в три этапа. Сначала компания прогнала собственные тесты: знания и умения в химическом, биологическом, радиологическом и ядерном оружии (CBRN) и во взломе систем, прямые вредные запросы, работу агента с инструментами. Отдельный тест проверял вредные запросы на 17 языках, в том числе с картинками и звуком. По всем направлениям модели оказались на уровне других открытых моделей.
Затем модели до выпуска получили четыре внешние организации. Одна искала нарушения правил поведения модели. Handshake AI проверяла разговоры с уязвимыми людьми: о суициде, самоповреждении, расстройствах пищевого поведения. FAR.AI занималась оружием и кибератаками, Apollo Research — попытками модели хитрить, саботировать работу и замечать, что её тестируют. Ни одна из проверок не нашла ничего, что заметно добавило бы реальных рисков.
Третий этап — худший сценарий. Открытую модель можно дообучить, и она перестанет отказываться, поэтому отказы компания за надёжную защиту не считает. Она сама обучила «услужливые» версии, которые выполняют любые просьбы. Даже они не дали новой помощи в задачах про оружие и кибератаки.
На будущее Thinking Machines предлагает открывать модели поэтапно. Сначала доступ через API для ограниченного круга. Затем дообучение через сервис Tinker, где веса остаются у компании, а использование можно отслеживать и отключить. Потом проверенные специалисты по защите и исследователи получают модель раньше других, а все остальные — доступ под наблюдением. Веса открывают только в конце, и то если данные это подтверждают. Лаборатория также изучает, можно ли убрать опасные знания ещё на этапе обучения, отфильтровав документы. Пока это открытый исследовательский вопрос.
Компания признаёт, что это общая схема, а не готовый стандарт. Критерии перехода между этапами и условия остановки она обещает описать позже. Вскоре также запустятся гранты на исследования безопасности с использованием Tinker.