ИИтак

← Назад

Сотрудник Inception свёл в гид 106 списков о моделях, которые не пишут текст, а выбирают ответ

Гид по моделям, которые не пишут текст, а выбирают ответ: они экономят, когда заменяют лишние вызовы больших моделей, но легко поддаются подложенным «доказательствам».

Стефан Уэбб, инженер Inception1 по работе с разработчиками, объединил в один гид 106 списков инструментов, которые сообщество собрало вокруг Jev и похожих на неё моделей. Такие модели не пишут текст, а выбирают ответ. В гиде 18 330 уникальных ссылок, 5 410 из них встречаются минимум в трёх списках.

за несколько недель вокруг Jev появились десятки совместимых моделей и серверов. Гид собирает в одном месте сведения о том, где они экономят время и деньги, а где ошибаются, и для каждой цифры указывает, кто её получил: разработчик, авторы инструмента или независимые проверяющие.

TypeSafe выпустила Jev в сентябре и назвала такие модели моделями «Системы 12». Разработчик передаёт такой модели «состояние» (текст или JSON) и сразу несколько вопросов. Одним вызовом модель возвращает выбор из вариантов, оценку по шкале или вероятность ответа «да». Свою модель такого типа, Mercury Decide, Inception выпустила 30 сентября и в раннем доступе раздаёт бесплатно на OpenRouter — сервисе, через который обращаются к моделям разных компаний.

Inception предложила гид в соцсети X как ответ на вопрос, что строить на Mercury Decide, и написала, что главное применение — агенты для программирования. По гиду, там такие модели чаще всего отвечают за сжатие контекста3, выбор модели и уровня рассуждений4 под задачу, проверку вызовов инструментов перед запуском и проверку, правда ли работа закончена.

облачные модели с тем же интерфейсом — Mercury Decide, Liquid d1 и Solar Decide от Upstage, открытые — Laya, Kev и Decider; в списке значится и предварительная версия OpenAI Decisions API на модели Luna. Общий интерфейс позволяет заменить одну модель другой в коде, но не переносит точность: порог уверенности 0,8, подобранный на одной модели, на другой ничего не значит.

ускорение в сотни раз реально только против цепочек вызовов обычных языковых моделей.

  • На запуске Jev обещали ответы в 193,6 раза быстрее и в 444,6 раза дешевле, но это лучший случай против самого медленного соперника.
  • В среднем по восьми сравнениям выигрыш скромнее: в 97,8 раза по скорости и в 149,2 раза по цене.
  • Один вопрос Jev обрабатывает лишь в 1,5–3 раза быстрее маленькой чат-модели, а выигрыш дают пачки вопросов: задержка почти не растёт до 25 вопросов в одном вызове.

точность сильнее всего зависит от того, как задан вопрос.

  • Когда один вопрос разбили на несколько простых вопросов «да или нет», результат в одной задаче вырос с 48% до 98%, в распознавании фишинга — с 62,6% до 95%.
  • Когда из вариантов ответа убрали «другое или неизвестно», балл модели на одном бенчмарке упал с 0,95 до нуля, поэтому гид советует всегда оставлять такой вариант.
  • Счёт, арифметика, даты и многошаговые рассуждения у таких моделей слабы, поэтому гид советует задавать по вопросу на каждый пункт, а считать обычным кодом.

схема, где уверенные ответы принимают, а остальные отдают большой модели, в нескольких исследованиях давала точность передовых моделей примерно за четверть цены. Но там, где Jev уверенно ошибается, примерно в 96% случаев ошибается и большая модель. Поэтому такая схема скорее экономит деньги, чем повышает точность.

такие модели не защищают от атак: строгий формат ответа не даёт подменить формат, но не мешает подменить решение. Текст, замаскированный под доказательство, — поддельные одобрения или «примечания редактора» — менял верные ответы Jev на неверные в 61% случаев в тесте JevOut, у открытых аналогов Jev — в 65–73%.

Почти все цифры гида получены самими авторами инструментов на небольших выборках за первые недели; результаты около трёх десятков препринтов на arXiv пока никто не воспроизвёл.

← Все новости