ИИтак

← Назад

Модель · Moonshot AI

Kimi K2.6

Открытая модель Moonshot AI для программирования и агентов, флагман весны 2026 года, которую позже сменила Kimi K3

вышла 21 апреля

Рейтинг Epoch AIСводная оценка общих возможностей модели: статистическая модель выводит её из результатов на многих бенчмарках с учётом их сложностиШкала условная (Claude 3.5 Sonnet = 130, GPT-5 = 150); интервал — 90-процентный диапазон оценки, и модели с перекрывающимися интервалами надёжно не различаются.Подробнее на английском ↗

42 место из 266
индекс 151, вероятный разброс 149–153 · весь рейтинг →

БенчмаркРезультатОбычно — доля заданий теста, которые модель решила. У некоторых тестов свой счёт; как он устроен, сказано в пояснении к названию тестаУсилиеНасколько долго модель рассуждала перед ответом, когда её проверяли: низкое, среднее, высокое, очень высокое, максимальное. Чем выше усилие, тем обычно выше результат — и тем дольше и дороже ответ. Показан лучший результат и усилие, на котором он получен
DTBenchВопросы с выбором ответа по теории принятия решений в задачах вроде парадокса Ньюкома, где твой выбор говорит о выборе похожих на тебяСлучайный выбор даёт около 40%, так что это нижняя планка, а не ноль.Подробнее на английском ↗ 84,9%
LMCAНасколько оценки моделью доводов в философии, теории решений и безопасности ИИ совпадают с оценками экспертовБалл — корреляция с оценками экспертов, умноженная на 100; практический потолок около 85, а не 100.Подробнее на английском ↗ 43,8%
Mystery Game Puzzles100 позиций из головоломочного варианта известной игры, название которой скрыто: нужно найти единственный лучший ходПодробнее на английском ↗ 9,7%
EBR-benchУчится ли модель на опыте: она раз за разом играет в малоизвестную карточную настольную игру Earthborne Rangers и ведёт заметкиБалл — доля из 21 игровой цели в лучшей из двух итоговых партий после тренировочных; сам по себе он не показывает, выросла ли модель.Подробнее на английском ↗ 2,4%
OSWorld 2.0Долгие задачи на настоящем компьютере в десктопных и веб-приложениях; у человека уходит около 1,6 часа на задачуЗадача оценивается по многим взвешенным контрольным точкам, поэтому засчитывается и частичное выполнение.Подробнее на английском ↗ 4,6%
FrontierMath-Tier-4-v2-PrivateЗакрытый набор самых трудных задач FrontierMath: исследовательская математика, на которую у специалистов уходят часы и дниПодробнее на английском ↗ 25,6%
FrontierMath-Tiers-1-3-v2-PrivateСотни новых задач исследовательской математики от профессиональных математиков; эксперту на задачу нужны часы или дниПодробнее на английском ↗ 57,2%
ExploitBenchНаписание эксплойтов для 41 реальной уязвимости движка V8 — от вызова сбоя до выполнения произвольного кодаВзлом разбит на 16 ступеней, и засчитываются промежуточные, так что балл не равен доле полностью взломанных уязвимостей.Подробнее на английском ↗ 18,4%
ProofBench100 закрытых задач по математике уровня старших курсов и аспирантуры: модель пишет доказательство на Lean 4, его проверяет программаПодробнее на английском ↗ 16,0%
APEX-Agents480 многошаговых рабочих задач из инвестбанкинга, консалтинга и корпоративного права: агент работает с файлами, почтой, таблицамиЗадача засчитывается, только если выполнены все пункты экспертного списка критериев; проверяет их другая модель.Подробнее на английском ↗ 18,9%
Chess Puzzles100 новых шахматных задач, позиция дана текстом: нужно найти единственный лучший ход по оценке движка StockfishПодробнее на английском ↗ 22,1%
SimpleQA Verified1000 коротких вопросов на факты, на которые модель отвечает по памяти, без поиска в интернетеБалл — F1: учитываются и доля верных ответов, и точность там, где модель решилась ответить, так что честное «не знаю» лучше ошибки.Подробнее на английском ↗ 34,9%
WeirdMLНеобычные задачи по машинному обучению: модель пишет код, который на выданных данных обучает классификатор, например для распознавания фигурБалл — средняя точность обученных моделью классификаторов, а не доля решённых задач.Подробнее на английском ↗ 55,9%
OTIS Mock AIME 2024-202545 олимпиадных задач по математике из пробных экзаменов AIME школы OTIS; ответ — целое число от 0 до 999Подробнее на английском ↗ 96,1%
SWE-Bench verifiedНастоящие задачи из GitHub по проектам на Python: модель правит код, а тесты проверяют, решена ли проблемаПо оценке Epoch, в 5–10% задач есть ошибки, поэтому 100% недостижимы; Epoch считает результат по 484 задачам из 500.Подробнее на английском ↗ 76,7%
GPQA diamond198 вопросов с выбором ответа по физике, химии и биологии уровня аспирантуры — такие, что ответ не найти поискомСлучайный выбор даёт 25%, а специалисты с учёной степенью в своей области набирают около 70%.Подробнее на английском ↗ 87,7%

Характеристики

Вышла
21 апреля
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
262 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 262 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$0,95 за миллион токенов
Вход из кэшаЦена входа для повторяющегося начала запроса, которое лаборатория уже сохранила у себя. В длинной переписке и у агентов это большая часть входа — и в разы дешевле
$0,16 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$4 за миллион токенов
Понимает
текст, изображения, видео
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
открытые
Знания до
январь 2025
Идентификатор в API
kimi-k2.6

Что это за модель

Kimi K2.6 — модель китайской компании Moonshot AI с открытыми весами, рассчитанная прежде всего на программирование и работу агентов, то есть программ, которые сами выполняют многошаговые задачи с помощью инструментов. Она построена по схеме «смесь экспертов» (mixture of experts): всего в ней около триллиона параметров, но на каждый токен работают только 32 миллиарда. Из 384 экспертов, небольших подсетей, для каждого токена выбираются восемь. Картинки и видео модель понимает через встроенный визуальный модуль MoonViT на 400 миллионов параметров. У неё два режима: с рассуждениями перед ответом и быстрый, без них.

По сравнению с Kimi K2.5 лаборатория делает упор на долгую самостоятельную работу. По её замерам, результат в Terminal-Bench 2.0 вырос с 50,8% до 66,7%, в SWE-Bench Pro — с 50,7% до 58,6%. Режим «роя агентов» (Agent Swarm), где задача дробится на параллельные подзадачи, теперь рассчитан на 300 подчинённых агентов и 4000 согласованных шагов против 100 агентов и 1500 шагов у K2.5. Ещё одна новая функция сохраняет рассуждения модели между репликами диалога. Компания заявляет, что это помогает агентам для программирования.

Модель берут для долгих задач по программированию и агентных сценариев. В анонсе описаны запуски по 12–13 часов с тысячами вызовов инструментов, например переработка кода финансового движка. Ещё один пример — агент, который пять дней сам следил за системой и реагировал на сбои. Лаборатория также говорит, что модель собирает по короткому запросу готовые веб-интерфейсы и простые приложения, включая вход пользователя и работу с базой данных.

Веса выложены под изменённой лицензией MIT, запускать модель можно через vLLM, SGLang и KTransformers. Видео на входе пока работает только через официальный API Moonshot AI, а не в собственных развёртываниях. Позже у лаборатории вышли Kimi K2.7 Code, специально для программирования, и Kimi K3, так что K2.6 уже не самая новая модель линейки.

Источники: Анонс Kimi K2.6 в блоге Kimi, Карточка модели на Hugging Face

Того же уровня по индексу Epoch

Другие модели семейства

Новости о модели

  1. 01

    Nemotron 3 Ultra лучше других открытых моделей проектирует микросхемы и тратит меньше токенов

    NVIDIA для разработчиков

все 1 новость о Kimi K2.6 →

Данные: models.dev (MIT) и Epoch AI (CC BY 4.0).