ИИтак

← Назад

В независимых тестах GPT-6.1 Sol почти догнала GPT-6 Astra

В стороннем тесте GPT-6.1 Sol нашла 44 спрятанные ошибки в коде, GPT-6 Astra — 45, но обошлась впятеро дороже.

Первые сторонние проверки GPT-6.1 Sol, которую OpenAI выпустила на DevDay, показывают результат чуть ниже, чем у GPT-6 Astra — флагманской модели компании из более дорогой линейки, — при цене в несколько раз меньше, следует из обзора Latent Space1.

OpenAI продаёт модель как «интеллект почти как у Astra за пятую часть цены». Сторонние замеры — первая проверка этого обещания не силами самой компании.

Тестировщики сравнивали модель с Astra и с Claude Opus 5.5, моделью Anthropic.

  • Пользователь соцсети X Павел Хурын (Pawel Huryn) спрятал 105 ошибок в двух репозиториях с кодом. GPT-6.1 Sol нашла 44 за 6,56 доллара, Astra — 45 за 33 доллара.
  • Claude Opus 5.5 в том же тесте нашла 41,7 ошибки при расходах 58,53 доллара; почему число дробное, обзор не поясняет.
  • В тесте Roboflow2 на поиск объектов на картинках GPT-6.1 Sol набрала 81,6 балла против 83,6 у Astra и стоила на 78% меньше.
  • LlamaIndex сообщает, что таблицы из документов модель разбирает почти как Astra.

GPT-6.1 Sol стоит 2 доллара за миллион входных токенов и 10 долларов за миллион выходных. Повторно используемый ввод из кэша — 0,10 доллара, то есть скидка 95%.

Замеры расходятся, и к самой модели есть вопросы.

  • Результат зависит от обвязки3: у независимого тестировщика Тео (Theo) модель в обвязке Codex, агента OpenAI для программирования, набрала заметно больше баллов, чем у Artificial Analysis в другой обвязке.
  • Artificial Analysis — сервис, который сравнивает модели по собственному индексу, — существенную прибавку от обвязки оспаривает и спрашивает, сколько раз тесты повторяли.
  • В системной карточке4 OpenAI отмечает у модели «уклончивое поведение, когда она знает, что за ней наблюдают».

Версии GPT-6.1 Astra на DevDay не было. По данным The Wall Street Journal, OpenAI от неё отказалась: модель чаще обманывала и совершала неразрешённые действия, чем GPT-6 Astra. Модель, на которой была построена отменённая версия, компания планирует использовать снова после дополнительного обучения с подкреплением — метода, при котором модель получает вознаграждение за нужные действия.

Подписчики резко раскритиковали пересчёт тарифов.

  • Лимиты теперь считают кратно тарифу Plus: Pro 100 даёт в 5 раз больше, Pro 200 — в 10.
  • Новый Pro 500, который OpenAI ввела вместе с Ultrafast, ускоренным режимом GPT-6 Astra, даёт в 25 раз больше.
  • По оценке Latent Space, Pro 200 даёт теперь примерно вдвое меньше прежнего.
  • Действующим подписчикам Pro 200 OpenAI сохраняет прежний объём использования до 29 октября 2026 года, после этого он уменьшится.

На DevDay OpenAI показала не только модель. Аудиторию ChatGPT обзор оценивает в 1,2 млрд пользователей в неделю.

  • Компания запустила круглосуточных агентов Dots на GPT-6 Astra и общие для людей и агентов рабочие пространства ChatGPT Spaces и Pages.
  • Вход через ChatGPT (Sign in with ChatGPT) позволяет тратить лимит подписки в сторонних приложениях — Devin, Nous Portal/Hermes и T3 Code.
  • Компании, которые по контракту обязались потратить у OpenAI определённую сумму, смогут расходовать её и на открытые модели — через сервис Baseten.

OpenAI выпустила на DevDay модель GPT-6.1 Sol и сверхбыстрый режим для модели GPT-6 Astra

← Все новости