В независимых тестах GPT-6.1 Sol почти догнала GPT-6 Astra
В стороннем тесте GPT-6.1 Sol нашла 44 спрятанные ошибки в коде, GPT-6 Astra — 45, но обошлась впятеро дороже.
Первые сторонние проверки GPT-6.1 Sol, которую OpenAI выпустила на DevDay, показывают результат чуть ниже, чем у GPT-6 Astra — флагманской модели компании из более дорогой линейки, — при цене в несколько раз меньше, следует из обзора Latent Space1.
Почему это важно: OpenAI продаёт модель как «интеллект почти как у Astra за пятую часть цены». Сторонние замеры — первая проверка этого обещания не силами самой компании.
Детали: Тестировщики сравнивали модель с Astra и с Claude Opus 5.5, моделью Anthropic.
- Пользователь соцсети X Павел Хурын (Pawel Huryn) спрятал 105 ошибок в двух репозиториях с кодом. GPT-6.1 Sol нашла 44 за 6,56 доллара, Astra — 45 за 33 доллара.
- Claude Opus 5.5 в том же тесте нашла 41,7 ошибки при расходах 58,53 доллара; почему число дробное, обзор не поясняет.
- В тесте Roboflow2 на поиск объектов на картинках GPT-6.1 Sol набрала 81,6 балла против 83,6 у Astra и стоила на 78% меньше.
- LlamaIndex сообщает, что таблицы из документов модель разбирает почти как Astra.
В цифрах: GPT-6.1 Sol стоит 2 доллара за миллион входных токенов и 10 долларов за миллион выходных. Повторно используемый ввод из кэша — 0,10 доллара, то есть скидка 95%.
Но: Замеры расходятся, и к самой модели есть вопросы.
- Результат зависит от обвязки3: у независимого тестировщика Тео (Theo) модель в обвязке Codex, агента OpenAI для программирования, набрала заметно больше баллов, чем у Artificial Analysis в другой обвязке.
- Artificial Analysis — сервис, который сравнивает модели по собственному индексу, — существенную прибавку от обвязки оспаривает и спрашивает, сколько раз тесты повторяли.
- В системной карточке4 OpenAI отмечает у модели «уклончивое поведение, когда она знает, что за ней наблюдают».
Интрига: Версии GPT-6.1 Astra на DevDay не было. По данным The Wall Street Journal, OpenAI от неё отказалась: модель чаще обманывала и совершала неразрешённые действия, чем GPT-6 Astra. Модель, на которой была построена отменённая версия, компания планирует использовать снова после дополнительного обучения с подкреплением — метода, при котором модель получает вознаграждение за нужные действия.
Другая сторона: Подписчики резко раскритиковали пересчёт тарифов.
- Лимиты теперь считают кратно тарифу Plus: Pro 100 даёт в 5 раз больше, Pro 200 — в 10.
- Новый Pro 500, который OpenAI ввела вместе с Ultrafast, ускоренным режимом GPT-6 Astra, даёт в 25 раз больше.
- По оценке Latent Space, Pro 200 даёт теперь примерно вдвое меньше прежнего.
- Действующим подписчикам Pro 200 OpenAI сохраняет прежний объём использования до 29 октября 2026 года, после этого он уменьшится.
Если шире: На DevDay OpenAI показала не только модель. Аудиторию ChatGPT обзор оценивает в 1,2 млрд пользователей в неделю.
- Компания запустила круглосуточных агентов Dots на GPT-6 Astra и общие для людей и агентов рабочие пространства ChatGPT Spaces и Pages.
- Вход через ChatGPT (Sign in with ChatGPT) позволяет тратить лимит подписки в сторонних приложениях — Devin, Nous Portal/Hermes и T3 Code.
- Компании, которые по контракту обязались потратить у OpenAI определённую сумму, смогут расходовать её и на открытые модели — через сервис Baseten.
Подробнее: OpenAI выпустила на DevDay модель GPT-6.1 Sol и сверхбыстрый режим для модели GPT-6 Astra