Google проверила Gemini вслепую: модель не видит вопросов, проверяющие не видят модели
Google DeepMind и внешние организации испытали Gemini Flash Lite на закрытых тестах в защищённой облачной среде. Разработчик не видит вопросов проверяющих, а проверяющие не видят весов модели.
Google DeepMind испытала одну из версий Gemini Flash Lite так, что ни Google, ни проверяющие не видели чужих данных. Компания называет это первой в мире двойной слепой оценкой закрытой передовой модели. В пилоте участвовали Институт безопасности ИИ Сингапура, OpenMined, AVERI и MLCommons.
Такая проверка решает старую проблему. Если модель заранее видела вопросы теста, её высокий балл мало что значит — как у студента, который подсмотрел экзаменационные билеты. Это называют загрязнением данных. Чиновникам, исследователям и компаниям нужно верить, что оценки отражают реальные возможности и безопасность модели, а не подготовку к конкретному тесту.
Раньше при внешней проверке кому-то приходилось рисковать. Либо проверяющие отдавали разработчику свои вопросы, и он мог их увидеть. Либо разработчик отдавал веса модели и рисковал интеллектуальной собственностью. До сих пор вопросы защищали обещаниями не вести журналы и договорами.
Теперь тест проходит внутри Confidential Space — это часть сервисов конфиденциальных вычислений Google Cloud. Там модель и тестовые данные встречаются в изолированной среде, и криптография подтверждает, что каждая сторона сохранила своё в тайне. Проверяющий не видит весов Gemini, а Google не видит его запросов. Значит, вопросы потом не попадут в обучение будущих моделей.
По словам авторов, особенно важен такой подход для чувствительных проверок, например по кибербезопасности или по заказу государственных органов. Методику и результаты Google описала в отдельном техническом отчёте. Пока это пилот на одной небольшой модели. Неясно, станут ли так проверять флагманские версии Gemini и присоединятся ли другие разработчики.