ИИтак

← Назад

Модель · Moonshot AI

Kimi K2.7 Code

Открытая модель Moonshot AI для программирования и агентных задач в больших репозиториях, тратит на рассуждения меньше, чем K2.6

вышла 12 июня

Рейтинг Epoch AIСводная оценка общих возможностей модели: статистическая модель выводит её из результатов на многих бенчмарках с учётом их сложностиШкала условная (Claude 3.5 Sonnet = 130, GPT-5 = 150); интервал — 90-процентный диапазон оценки, и модели с перекрывающимися интервалами надёжно не различаются.Подробнее на английском ↗

46 место из 266
индекс 150, вероятный разброс 149–152 · весь рейтинг →

БенчмаркРезультатОбычно — доля заданий теста, которые модель решила. У некоторых тестов свой счёт; как он устроен, сказано в пояснении к названию тестаУсилиеНасколько долго модель рассуждала перед ответом, когда её проверяли: низкое, среднее, высокое, очень высокое, максимальное. Чем выше усилие, тем обычно выше результат — и тем дольше и дороже ответ. Показан лучший результат и усилие, на котором он получен
Surface Evolver Bench16 задач: описать для физической программы Surface Evolver форму жидкости под действием поверхностного натяжения, гравитации и ограниченийЗасчитывается частичное выполнение: отдельные баллы за корректный файл, успешный прогон симуляции и совпадение объёма, площади и энергии с эталоном.Подробнее на английском ↗ 48,8%
FrontierMath-Tier-4-v2-PrivateЗакрытый набор самых трудных задач FrontierMath: исследовательская математика, на которую у специалистов уходят часы и дниПодробнее на английском ↗ 12,2%
FrontierMath-Tiers-1-3-v2-PrivateСотни новых задач исследовательской математики от профессиональных математиков; эксперту на задачу нужны часы или дниПодробнее на английском ↗ 54,0%
FrontierCodeМодель исправляет проблему в открытом проекте, а правку оценивают по тому, приняли бы её сопровождающие проектаБалл выставляют по критериям сопровождающих и усредняют по пяти запускам; если нарушен хотя бы один обязательный критерий, за задачу ставят ноль.Подробнее на английском ↗ 30,1%
DeepSWE113 долгих задач по программированию в 91 открытом проекте на пяти языках; задачи написаны с нуля и не публиковалисьEpoch нашла, что примерно в 20% задач проверка отклоняет верные решения, поэтому реальный потолок заметно ниже 100%.Подробнее на английском ↗ 30,5%
APEX-Agents480 многошаговых рабочих задач из инвестбанкинга, консалтинга и корпоративного права: агент работает с файлами, почтой, таблицамиЗадача засчитывается, только если выполнены все пункты экспертного списка критериев; проверяет их другая модель.Подробнее на английском ↗ 27,6%
Chess Puzzles100 новых шахматных задач, позиция дана текстом: нужно найти единственный лучший ход по оценке движка StockfishПодробнее на английском ↗ 16,9%
SimpleQA Verified1000 коротких вопросов на факты, на которые модель отвечает по памяти, без поиска в интернетеБалл — F1: учитываются и доля верных ответов, и точность там, где модель решилась ответить, так что честное «не знаю» лучше ошибки.Подробнее на английском ↗ 36,5%
WeirdMLНеобычные задачи по машинному обучению: модель пишет код, который на выданных данных обучает классификатор, например для распознавания фигурБалл — средняя точность обученных моделью классификаторов, а не доля решённых задач.Подробнее на английском ↗ 54,1%
OTIS Mock AIME 2024-202545 олимпиадных задач по математике из пробных экзаменов AIME школы OTIS; ответ — целое число от 0 до 999Подробнее на английском ↗ 95,6%
SimpleBenchВопросы с подвохом на здравый смысл: пространство, время, поведение людей. 213 вопросов, у каждого шесть вариантов ответаЛюди в проверке авторов набрали около 84%, а балл модели — средняя точность по пяти прогонам.Подробнее на английском ↗ 49,5%
GPQA diamond198 вопросов с выбором ответа по физике, химии и биологии уровня аспирантуры — такие, что ответ не найти поискомСлучайный выбор даёт 25%, а специалисты с учёной степенью в своей области набирают около 70%.Подробнее на английском ↗ 83,8%

Характеристики

Вышла
12 июня
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
262 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 262 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$0,95 за миллион токенов
Вход из кэшаЦена входа для повторяющегося начала запроса, которое лаборатория уже сохранила у себя. В длинной переписке и у агентов это большая часть входа — и в разы дешевле
$0,19 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$4 за миллион токенов
Понимает
текст, изображения, видео
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
открытые
Знания до
январь 2025
Идентификатор в API
kimi-k2.7-code

Что это за модель

Kimi K2.7 Code — версия линейки Kimi K2, которую Moonshot AI обучила специально для программирования. Она построена как смесь экспертов (mixture of experts): внутри много узких подсетей, и на каждый токен включаются лишь некоторые из них. Всего у модели около триллиона параметров, но при каждом шаге работает 32 миллиарда. Для картинок и видео в модель встроен отдельный кодировщик изображений MoonViT.

По сравнению с K2.6 компания делала ставку на долгие задачи в реальных проектах, а не на отдельные задачки. По замерам Moonshot, на её собственном тесте Kimi Code Bench v2 модель набирает 62,0 балла против 50,9 у K2.6, а на Program Bench — 53,6 против 48,3. В агентных тестах тоже заметен рост: в MCP Atlas у неё 76,0 против 69,4. При этом лаборатория заявляет, что модель в среднем тратит на рассуждения примерно на 30% меньше токенов. Отсюда и слова в описании про «меньше лишних раздумий»: ответы приходят быстрее, а запросы к API обходятся дешевле. Moonshot сама приводит сравнение, где модель уступает GPT-5.5 и Claude Opus 4.8 на тех же тестах.

Модель нужна для работы, где агент долго действует сам: переписывает код по всему репозиторию, добавляет функцию, которая затрагивает много файлов, или долго ищет ошибку. На длинной дистанции ему нужно не терять инструкции. Moonshot предлагает её через своё API и консольный инструмент Kimi Code CLI. Веса выложены на Hugging Face, модель можно запустить у себя на движках vLLM, SGLang или KTransformers.

Модель всегда рассуждает перед ответом, режима без рассуждений у неё нет. Цепочка рассуждений сохраняется между репликами диалога. Для обычных задач, не связанных с кодом, лаборатория советует брать K2.6. Веса распространяются по изменённой лицензии MIT.

Источники: Анонс Kimi K2.7 Code, Карточка модели на Hugging Face

Того же уровня по индексу Epoch

Другие модели семейства

Данные: models.dev (MIT) и Epoch AI (CC BY 4.0).