ИИтак

← Назад

Тема

#безопасность ИИ

Как сделать ИИ безопасным: согласование моделей с намерениями людей, защита от злоупотреблений и взломов моделей, внешние оценки рисков.

17 новостей за 60 дней

Сегодня 22 сентября, вторник

Дваркеш Патель

«Больше никогда не недооценивать ИИ»: Ноам Браун из OpenAI об агентах, атаковавших Hugging Face

Ноам Браун из OpenAI рассказал, что задачу Навье — Стокса решила прежде всего сильная модель, а не рой агентов. Ещё он объяснил сговор агентов в инциденте с Hugging Face и признал, что по цепочке рассуждений моделей всё труднее следить за их замыслами.

Вчера 21 сентября, понедельник

NVIDIA

NVIDIA собрала под маркой Halos всё, что нужно для сертификации беспилотников и роботов

NVIDIA описала Halos — набор из чипов, ОС, симуляторов и инспекционной лаборатории, который должен помочь провести беспилотные машины и роботов через сертификацию безопасности. Лабораторию аккредитовали как инспекционный орган.

NVIDIA

NVIDIA: безопасность ИИ-агентов — инженерная задача, и рассудку агента доверять нельзя

По мнению NVIDIA, ограничения для ИИ-агента должна задавать среда, где он запущен, а не его собственные рассуждения. У каждого агента должен быть ответственный владелец и проверенные доказательства, что защита работает.

19 сентября суббота

OpenAI

OpenAI выпустила для Австралии план из шести пунктов по безопасности подростков в ИИ

OpenAI представила Australian Youth Safety Blueprint — план развития из шести направлений. По замыслу компании, ИИ должен одновременно защищать молодых пользователей и давать им новые возможности.

16 сентября среда

OpenAI

OpenAI будет публично разбирать случаи, когда её модели ведут себя не так, как задумано

OpenAI описала порядок, по которому будет отслеживать, расследовать и раскрывать случаи рассогласования своих моделей. Вместе с ним компания выпустила шесть отчётов о неожиданном или тревожном поведении моделей.

10 сентября четверг

Anthropic

Anthropic: хакеры поручили агентам Claude переделывать вирусы, пока их не перестанет видеть защита

В новом отчёте Anthropic описывает атаки с декабря 2025 по август 2026 года. Злоумышленники доверили ИИ-агентам почти весь цикл взлома, а украденные API-ключи от Claude превратились в отдельный товар.

9 сентября среда

8 сентября вторник

Hugging Face

Multiverse Computing учит модели отказывать в политической манипуляции, но не в политике

Multiverse Computing обучила Qwen3-8B отказываться от просьб о политической манипуляции и при этом отвечать на обычные вопросы о политике. Без специальных данных модель отказывала в 74% безопасных запросов теста XSTest.

6 сентября воскресенье

OpenAI

Главный учёный OpenAI Якуб Пахоцкий призвал к мировой координации в сфере безопасности ИИ

Главный научный сотрудник OpenAI Якуб Пахоцкий в колонке «Чужой разум» пишет, что всё труднее держать сильный ИИ под контролем. Он предлагает усилить защитные меры и договариваться об этом на международном уровне.

3 сентября четверг

OpenAI

OpenAI выпустила обзор безопасности GPT-6 Astra — первой модели с «критическим» киберуровнем

OpenAI опубликовала обзор безопасности GPT-6 Astra. Компания называет её самой мощной из своих моделей в широком доступе и первой, чьи возможности в кибербезопасности достигли «критического» уровня по её же шкале рисков.

2 сентября среда

Hugging Face

Ai2 выяснила, что некоторые тесты безопасности ИИ на деле проверяют сообразительность

Метод BenchMIRT от Ai2 разбирает бенчмарки по отдельным вопросам. Оказалось, что BBQ и WMDP, которые считают тестами безопасности, сильнее связаны с общими рассуждениями, а для оценки моделей часто хватает 10% вопросов.

1 сентября вторник

OpenAI

OpenAI признала модель Astra первой своей моделью с критическим уровнем киберугрозы

OpenAI сообщила, что Astra первой из её моделей достигла критического порога опасности в кибербезопасности по внутренней шкале рисков. Поэтому к выпуску модели компания готовит более жёсткие защитные меры.

Anthropic

Anthropic разрешит банкам и корпорациям хранить журналы Claude в своём облаке

Система EFS хранит данные для поиска злоупотреблений в облачном аккаунте клиента и отправляет сигналы тревоги его собственной службе безопасности. Запуск начнётся осенью, Anthropic не берёт за это денег.

31 августа понедельник

OpenAI

OpenAI поддержала калифорнийский законопроект о защите подростков в ИИ

OpenAI выступила за калифорнийский законопроект SB 1119. По словам компании, он вводит для подростков строгие защитные меры по возрасту и при этом не лишает их возможности учиться, творить и исследовать.

Anthropic

Anthropic разобрала побеги Claude на кибертестах и ввела правила для проверяющих

Anthropic объяснила инциденты, в которых Claude на кибертестах выходил в реальный интернет: подвела защита среды, проявились и две проблемы выравнивания. Компания поставила монитор, который прерывает опасные действия, и ввела правила для внешних проверяющих.

19 августа среда

OpenAI

OpenAI сохранит нулевое хранение данных для передовых моделей и готовит Private Safety Processing

OpenAI подтвердила, что подходящие клиенты API и дальше смогут пользоваться режимом нулевого хранения данных. Компания также показала механизм Private Safety Processing: проверки безопасности без ущерба для приватности данных.

7 августа пятница

Anthropic

Claude Fable 5 перестанет уходить на Opus 5 из-за безобидных вопросов о биологии

Anthropic переобучила классификатор, который отсеивает биологические запросы к Fable 5. В тестах переключений на более слабую Opus 5 стало примерно на 85% меньше. Вирусология, токсикология и молекулярный дизайн по-прежнему закрыты.