ИИтак

← Назад

Meta выпустила Muse Glimmer — открытую модель на 30 млрд параметров для локальных агентов

Muse Glimmer получена дистилляцией из Muse и вышла под лицензией Apache 2.0. Модель понимает текст, изображения и видео без звука и рассчитана на запуск на собственном железе.

Изображение: Hugging Face

Meta выпустила Muse Glimmer — открытую мультимодальную модель, которую можно запускать на собственном оборудовании. В ней 30 млрд параметров. Модель получена дистилляцией из большой Muse и распространяется под лицензией Apache 2.0, которая разрешает и коммерческое использование. Meta рассчитывает на задачи, где важна приватность: программирование, разбор документов, личные ассистенты и агенты вроде OpenClaw или Hermes.

Muse Glimmer понимает текст, изображения и видео, но звук из видео не воспринимает. Ролик она разбирает по кадрам: берёт два кадра в секунду, но не больше 96 на весь клип. Модель умеет находить объекты на картинке и вызывать внешние инструменты по тому, что на ней изображено. Например, она может узнать город на фото и запросить для него прогноз погоды.

Модель плотная: при каждом ответе работают все её параметры. Около 2 млрд из них занимает визуальный кодировщик — по словам Hugging Face, заметно больше, чем у похожих моделей. Языковая часть экономит память: механизм внимания устроен так, что кэш модели при генерации в 16 раз меньше обычного. Отдельно к модели прилагается необязательный модуль DFlash. Он заранее предлагает продолжение текста и ускоряет ответы ценой дополнительной памяти. Лучше всего это работает на структурированном тексте вроде кода.

Hugging Face добавила поддержку модели в популярные инструменты в день выхода: свою библиотеку Transformers, llama.cpp для запуска на своём компьютере, vLLM и облачный сервис Inference Endpoints. Для llama.cpp Meta выложила готовые сжатые версии модели, свои обещает и Unsloth. Дообучать модель можно библиотекой TRL.

Самая наглядная часть анонса — демонстрации, где модель обслуживает сама себя. Подключённая к сервисам Hugging Face, Muse Glimmer находит или создаёт собственную сжатую версию и запускает её локально. Она может и развернуть себя в облаке, а на видеокарте H100 — перебирать настройки собственного сервера и оставлять только те, что ускоряют работу и не портят ответы. «Самое крутое в этой модели — что это личный ассистент локального масштаба, который умеет программировать», — пишут авторы из Hugging Face.

← Все новости