ИИтак

← Назад

Независимые оценщики поставили Gemini 4 Argon вровень с GPT-6 Astra

В сторонних рейтингах новая модель Google заняла первые места или сравнялась с GPT-6 Astra, но тратит на задачу в 2,3 раза больше токенов.

Первые независимые проверки показали, что Gemini 4 Argon, новая модель Google DeepMind, догнала GPT-6 Astra от OpenAI: в рейтингах Vals1 и Text Arena она первая, в индексе Artificial Analysis2 — вровень с Astra.

Argon — первая с февраля модель Google крупнее быстрых Flash-версий. Попробовать её пока могут только участники закрытой программы, поэтому сторонние замеры — первая проверка заявлений Google.

Google представила Argon 30 сентября как модель для программирования, интеллектуального труда в компаниях и киберзащиты. По подсчёту компании, модель обошла GPT-6 Astra и Claude Opus 5.5 в 13 из 19 опубликованных тестов. Первыми доступ получили госпользователи и проверенные специалисты по киберзащите из программы Fairwind.

результаты опубликовали три независимых оценщика:

  • В сводном индексе Vals у Argon первое место с 68,9%, а одна задача обходится в среднем в 15,68 доллара.
  • В Intelligence Index от Artificial Analysis у модели 53 балла — столько же, сколько у GPT-6 Astra, и на балл больше, чем у GPT-6.1 Sol.
  • В Text Arena, где модели сравнивают голосованием пользователей, Argon первая с 1525 очками, а в рейтинге веб-разработки Code Arena — восьмая.

по замеру Vals, Argon безупречно собрала 30 приложений в тесте Vibe Code Bench — у Claude Opus 5 таких 25, у Astra 24. Но в Terminal Bench 4, где агент работает в командной строке, Artificial Analysis насчитала у неё 57% — меньше, чем у Claude Sonnet 5.5, Opus 5.5 и Astra.

по расчёту Artificial Analysis, дешевле Astra модель выходит за счёт цены, а не экономии токенов:

  • По стартовой цене со скидкой 50% задача из индекса стоит 1,99 доллара, у GPT-6 Astra — 3,26 доллара; когда скидка закончится, Google не сообщила.
  • По обычной цене — 4 доллара за миллион входных токенов и 20 долларов за миллион выходных — та же задача стоила бы 3,98 доллара.
  • На одну задачу Argon в среднем выдаёт 62 тыс. токенов, а Astra — 27 тыс.

Argon куда реже выдумывает: в тесте на знания AA-Omniscience она даёт неверный ответ вместо отказа в 15% случаев, когда не знает правильного, а Astra — в 51%. Но и правильных ответов у Argon меньше — 50% против 63% у Astra.

к заявлениям Google есть оговорки:

  • Google называет лимит ответа в миллион токенов, а Vals указывает для модели максимум в 262 тыс. токенов.
  • Artificial Analysis дошла до миллиона только через новую функцию API Long Decode Continuation: она ставит длинный ответ на паузу и продолжает его в следующих запросах.
  • В юридическом тесте Harvey у Argon 19,6% — меньше 25,42%, указанных для модели Meta* Muse Spark 1.2.
  • Комментаторы в соцсети X заподозрили, что модель натаскали на данных о предпочтениях людей, чтобы поднять её результаты в тестах. Они же оспорили часть цифр Google, в том числе 77,9% в DeepSWE.

разработчикам, компаниям и обычным пользователям Google обещает открыть модель «как можно скорее», когда доработает ограничители. Дату компания не назвала.

Модель Gemini 4 Argon от Google сначала получат специалисты по киберзащите

← Все новости