ИИтак

← Назад

Модель · Qwen

Qwen Turbo

Устаревшая бюджетная модель Qwen для быстрых чатов и разбора длинных текстов, её сменила линейка Flash

вышла 1 ноября 2024

Характеристики

Вышла
1 ноября 2024
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
1 млн токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 16 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$0,05 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$0,20 за миллион токенов
Понимает
текст
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
закрытые
Знания до
апрель 2024
Идентификатор в API
qwen-turbo

Что это за модель

Qwen Turbo — быстрая и дешёвая модель Alibaba, доступная только через облачный API. Её главным отличием с самого начала была работа с очень длинным текстом. В анонсе Qwen2.5-Turbo команда расширила контекстное окно, то есть объём текста, который модель держит в голове за один раз, со 128 тысяч до миллиона токенов. По подсчёту лаборатории, это около десяти романов, 150 часов расшифровок речи или 30 тысяч строк кода.

Чтобы такой объём не обрабатывался слишком долго, в модели применили разреженное внимание: она смотрит не на все части текста сразу, а на самые важные. По данным Qwen, время до первого слова ответа на документе в миллион токенов сократилось с 4,9 минуты до 68 секунд. В тесте Passkey Retrieval, где нужно найти спрятанную в огромном тексте строку, модель, по замерам лаборатории, нашла её во всех случаях. В бенчмарке RULER она набрала 93,1 балла против 91,6 у GPT-4. На коротких задачах Qwen сравнивала её с GPT-4o-mini и называла результаты сопоставимыми.

Позже под этим же названием стали выходить новые версии на основе Qwen3. Они получили смешанный режим: модель может рассуждать перед ответом, но по умолчанию этот режим выключен. Модель берут для объёмной рутины: чат-ботов, извлечения данных из документов, разбора длинных файлов и кода, когда важнее цена и скорость, чем глубина ответа.

Сама лаборатория признавала, что на длинных текстах модель работает менее стабильно, чем на коротких. Сейчас Alibaba заменяет Turbo на Qwen Flash, и в свежем списке моделей Model Studio её уже нет. Для новых проектов разумнее смотреть на модели Flash из линеек Qwen3.6–Qwen3.8.

Источники: Анонс Qwen2.5-Turbo с контекстом в миллион токенов, Документация Model Studio о режиме рассуждений, Список моделей Alibaba Cloud Model Studio

Другие модели семейства

Новости о модели

  1. 01

    Alibaba выпустила Qwen3.8-Omni-Flash — модель, которая смотрит видео, слушает звук и работает с инструментами

    Qwen · X

  2. 02

    Открытую видеомодель MiniMax H3 сообщество ускорило и запустило на домашних видеокартах

    MiniMax · X

все 2 новости о Qwen Turbo →

Данные: models.dev (MIT).