ИИтак

← Назад

Модель · Qwen

Qwen Flash

Бюджетная модель Qwen на базе Qwen3 для быстрых чатов и простых задач; устарела, её сменили Flash-версии линейки Qwen3.6 и Qwen3.8

вышла 28 июля 2025

Характеристики

Вышла
28 июля 2025
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
1 млн токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 32 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$0,05 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$0,40 за миллион токенов
Понимает
текст
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
закрытые
Знания до
апрель 2024
Идентификатор в API
qwen-flash

Что это за модель

Qwen Flash — недорогая текстовая модель Alibaba из линейки Qwen, доступная через облачную платформу Alibaba Cloud Model Studio. Она построена на Qwen3. Компания описывает её как модель с низкой ценой и малой задержкой, то есть временем до ответа, для простых задач, где нужен быстрый ответ. Текущая версия модели совпадает со снимком qwen-flash-2025-07-28.

Главная особенность — два режима работы в одной модели. В режиме рассуждений она сначала выстраивает цепочку промежуточных шагов и только потом отвечает. В обычном режиме отвечает сразу. Переключать режимы можно прямо по ходу разговора. По словам Alibaba, модель хорошо справляется со сложными рассуждениями, а по сравнению с прежними версиями точнее выполняет инструкции и лучше понимает текст.

Модель берут там, где запросов много, а каждый должен стоить копейки: чат-боты, извлечение данных из документов, разбор длинных текстов. Длинный контекст позволяет загрузить в один запрос целую книгу или большую подборку документов. Но цена растёт вместе с длиной запроса: у Alibaba три ценовые ступени, и запрос длиннее 256 тысяч токенов обходится заметно дороже короткого. Снизить расходы можно через кэш повторяющихся запросов и пакетную обработку, когда запросы копятся и выполняются не сразу.

Дообучить модель под свои задачи нельзя ни в одном регионе. Сейчас модель уже устарела: у Alibaba вышли Qwen3.6 Flash и Qwen3.8 Flash, и в общем списке моделей Model Studio из Flash-версий теперь указана только Qwen3.8 Flash.

Источники: Документация Qwen Flash в Alibaba Cloud Model Studio, Список моделей Alibaba Cloud Model Studio

Другие модели семейства

Новости о модели

  1. 01

    Xiaomi перелила навыки MiMo-V2.6 в Qwen3.5-9B и выложила заготовку для обучения агентов

    MiMo · HF

  2. 02

    «Интеллект растёт экспоненциально»: Маск о малых открытых моделях, обошедших лидеров 2025 года

    Илон Маск

  3. 03

    Яндекс рассказал, как обучал открытую модель Alice AI Foundation, и выложил свои бенчмарки

    Яндекс

  4. 04

    Alibaba выпустила Qwen3.8-LiveTranslate — модель для синхронного перевода речи и видео

    Qwen · X

  5. 05

    Яндекс выложил открытую базовую модель AliceAI-Foundation на 80 млрд параметров

    Яндекс · HF

  6. 06

    Alibaba выпустила Qwen3.8-Omni-Flash — модель, которая смотрит видео, слушает звук и работает с инструментами

    Qwen · X

все 11 новостей о Qwen Flash →

Данные: models.dev (MIT).