llama.cpp научился запускать модели, которые выбирают ответ из вариантов
В открытый движок llama.cpp встроили поддержку моделей, которые, как Jev стартапа TypeSafe, не пишут текст, а выбирают ответ. Такие модели, например Kev-4B, работают на самом устройстве.
Движок llama.cpp1 получил встроенную поддержку моделей, которые не пишут текст, а выбирают ответ из заданных вариантов, написал в соцсети X глава Hugging Face Клеман Деланг.
Почему это важно: формат таких моделей появился вместе с Jev стартапа TypeSafe — платной моделью, которая работает на серверах компании. В llama.cpp такие модели запускаются на самом устройстве — по словам Деланга, «бесплатно, быстро, приватно».
Детали: Деланг показал, как это сделать одной командой в терминале: она скачивает с Hugging Face модель Kev-4B и запускает её как сервис. Сервис принимает запросы в том же формате, что и Jev. Kev-4B 24 сентября выложил разработчик Джаред Палмер — это надстройка над открытой моделью Qwen3.5-4B.
Но: по замерам самого Палмера, на вопросах теста на общие знания MMLU-Pro Kev-4B верно отвечает в 57% случаев, а Jev — в 84%. Зато в задачах для разработчиков Kev-4B впереди: 74% против 71%.
1 октября похожие открытые модели выложила Cloudflare, а 30 сентября Inception выпустила Mercury Decide с тем же API, что у Jev.