ИИтак

← Назад

Тема

#бенчмарки

Тесты и рейтинги, по которым сравнивают модели: SWE-bench, ARC-AGI, LMArena и другие.

12 новостей за 60 дней

Сегодня 22 сентября, вторник

Логан Килпатрик

Логан Килпатрик советует стартапам тратить больше четверти времени на бенчмарки

Логан Килпатрик из Google советует компаниям, которые строят продукты на ИИ, тратить больше 25% времени на свои бенчмарки и убеждать лаборатории обращать на них внимание.

Вчера 21 сентября, понедельник

Яндекс

Яндекс рассказал, как обучал открытую модель Alice AI Foundation, и выложил свои бенчмарки

Яндекс официально представил базовую модель Alice AI Foundation на 80 млрд параметров. Вместе с ней компания открыла два бенчмарка для проверки знаний на русском. Модель служит полигоном для будущей рассуждающей модели Алисы AI.

16 сентября среда

NVIDIA

Vera Rubin NVL72 в MLPerf: до 3,7 раза быстрее GB300 на Qwen3-VL и в 2,5 раза на DeepSeek-R1

NVIDIA раскрыла подробности первых результатов Vera Rubin NVL72 в тесте MLPerf Inference v6.1. На Qwen3-VL стойка до 3,7 раза производительнее GB300 NVL72, на DeepSeek-R1 — до 2,5 раза. Четыре стойки GB300 масштабируются с эффективностью 99%.

11 сентября пятница

Саймон Уиллисон

Hugging Face попросила ИИ-агентов искать уязвимости в бенчмарке, а не в её системах

В файл security.txt Hugging Face добавили обращение к ИИ-агентам. Тем, кому поручили искать уязвимости, там советуют набирать очки в открытом бенчмарке CyberGym, а не взламывать платформу.

4 сентября пятница

Latent Space

GPT-6 Astra после запуска: сбои с доступом, спор о бенчмарках и рассуждения, которые труднее проверить

Независимые тестировщики оценили GPT-6 Astra сдержаннее, чем OpenAI. Задача может стоить на 75% дороже, чем у предшественника, а специалисты по безопасности тревожатся: рассуждения модели стало труднее отслеживать.

2 сентября среда

Hugging Face

Ai2 выяснила, что некоторые тесты безопасности ИИ на деле проверяют сообразительность

Метод BenchMIRT от Ai2 разбирает бенчмарки по отдельным вопросам. Оказалось, что BBQ и WMDP, которые считают тестами безопасности, сильнее связаны с общими рассуждениями, а для оценки моделей часто хватает 10% вопросов.

28 августа пятница

Hugging Face

В рейтинге распознавания речи появились хинди и индийский английский, а с ними — данные о каждом дикторе

Hugging Face и Voice Arena добавили в Open ASR Leaderboard наборы Monsoon: почти 4 900 дикторов из сотен индийских районов, для каждого записано 12 характеристик. Хинди — первый язык из Индии в многоязычном разделе рейтинга.

21 августа пятница

Amazon Science

Бенчмарк Amazon SOP-Bench: ИИ-агентам мешают лишние инструменты, а новые модели не всегда лучше

Amazon выложила в открытый доступ SOP-Bench — более 2 000 задач по настоящим рабочим регламентам из 12 отраслей. Тесты 11 передовых моделей показали: новые модели не всегда сильнее старых, а лишние инструменты вдвое снижают успех.

Hugging Face

Модели распознавания речи узнают бенчмарк по звуку и пишут «ожидаемый» ответ

Авторы Open ASR Leaderboard проверили 11 открытых моделей распознавания речи. Лучшие по оценкам модели повторяют ошибки эталонных расшифровок VoxPopuli и LibriSpeech и даже «слышат» числа, вырезанные из записи.

12 августа среда

Microsoft Research

Бенчмарк MindTopo: ИИ видит узел на картинке, но теряет его, когда распутывает

Microsoft Research и соавторы выпустили MindTopo — бенчмарк на понимание связности, замкнутости, порядка и узлов. Мультимодальные модели узнают такие связи на статичной картинке заметно лучше, чем сохраняют их, пока действуют.

29 июля среда

Amazon Science

Amazon выпустила PatientAgentBench — бенчмарк для медицинских ИИ-агентов, общающихся с пациентами

PatientAgentBench проверяет ИИ-агентов в долгих разговорах с виртуальными пациентами. Главный вывод: модели лучше справляются с явными экстренными случаями, чем с рутинными просьбами, за которыми скрывается реальный риск.