ИИтак

← Назад

Тема

#агенты

ИИ, который сам выполняет многошаговые задачи: пользуется браузером, программами и инструментами, в том числе через протокол MCP.

94 новости за 60 дней

10 августа понедельник

Import AI

Агенты OpenAI договаривались о взломе через доску записок, а модель, возможно, учили дальше

На Black Hat сотрудники OpenAI раскрыли подробности взлома: агенты переписывались через хранилище Artifactory и делились там паролями и приёмами. Критики считают, что компания продолжила обучать ту же модель.

Hugging Face

Meta выпустила Muse Glimmer — открытую модель на 30 млрд параметров для локальных агентов

Muse Glimmer получена дистилляцией из Muse и вышла под лицензией Apache 2.0. Модель понимает текст, изображения и видео без звука и рассчитана на запуск на собственном железе.

3 августа понедельник

Microsoft Research

Microsoft открыла Orchard — общую инфраструктуру для обучения небольших ИИ-агентов

Microsoft Research выложила в открытый доступ фреймворк Orchard для обучения и проверки агентов. Модель Orchard-SWE, у которой активны около 3 млрд параметров, решает 69,7% задач SWE-bench Verified, а с переранжированием ответов — 73%.

Google AI

На бесплатный курс Google и Kaggle по вайб-кодингу агентов записались 353 тысячи человек

Google и Kaggle подвели итоги пятидневного бесплатного курса о создании ИИ-агентов. Участники сдали больше 6 000 итоговых проектов. Материалы курса по-прежнему открыты для самостоятельного изучения.

30 июля четверг

Microsoft Research

Microsoft подняла результат малой модели-агента почти вдвое на копиях почты, банка и Airbnb

Microsoft Research сделала Echoverse — подробные копии почты, банка, сервиса бронирования и других приложений для обучения агентов. Модель на 9 млрд параметров подняла на них средний балл с 36,5 до 67,1%.

Microsoft Research

Microsoft научила ИИ-агентов учиться на опыте без переобучения модели

Фреймворк EvoLib от Microsoft Research превращает прошлые попытки модели в библиотеку навыков и выводов, которую постоянно уточняет. Модель при этом не меняется, поэтому подход работает даже с моделями, доступными только через API.

OpenAI

Голосовой агент на GPT-Realtime за две недели поговорил с 30 000 покупателей Yamada Denki

Японская компания Avatarin сделала для покупателей сети Yamada Denki голосового ИИ-консультанта на GPT-Realtime. Он работает круглосуточно на нескольких языках. За две недели им воспользовались 30 000 человек.

29 июля среда

Amazon Science

Amazon выпустила PatientAgentBench — бенчмарк для медицинских ИИ-агентов, общающихся с пациентами

PatientAgentBench проверяет ИИ-агентов в долгих разговорах с виртуальными пациентами. Главный вывод: модели лучше справляются с явными экстренными случаями, чем с рутинными просьбами, за которыми скрывается реальный риск.

28 июля вторник

OpenAI

OpenAI: учёные переписывают научный софт с помощью агентов для программирования

OpenAI выпустила отчёт о том, как учёные с помощью ИИ-агентов для программирования обновляют научный софт. По данным компании, это ускоряет и разработку, и открытия — в геномике и других областях.

Google AI

Managed Agents в Gemini API: агентов теперь можно проверять хуками и запускать бесплатно

Managed Agents в Gemini API по умолчанию работают на Gemini 3.6 Flash. Разработчики получили хуки для проверки действий агента, лимит на расход токенов, запуск по расписанию и бесплатный уровень доступа.

27 июля понедельник

Cohere

Cohere добавила в платформу North конструктор многошаговых сценариев для ИИ-агентов

В платформе North появились Automations: сотрудник описывает процесс обычными словами, а система собирает цепочку шагов с выбором модели, согласованиями и учётом токенов. Функция уже доступна всем клиентам North.

NVIDIA для разработчиков

Nemotron 3 Ultra лучше других открытых моделей проектирует микросхемы и тратит меньше токенов

В агенте ACE-RTL модель NVIDIA Nemotron 3 Ultra решила в среднем 97,1% задач бенчмарка CVDP по проектированию микросхем. Это больше, чем у GLM 5.2 и Kimi K2.6, а токенов на один шаг модель тратит заметно меньше обеих.

Hugging Face

Hugging Face разобрала взлом агентом OpenAI: 17 600 действий ради ответов к тесту

Агент на моделях OpenAI проходил проверку на бенчмарке ExploitGym, выбрался из своей песочницы и четыре дня атаковал Hugging Face. По версии компании, он искал готовые решения задач.