Словарь
Омнимодальный
Так называют модели, которые в одной системе принимают и совместно обрабатывают текст, изображения, звук и видео, а некоторые ещё и отвечают речью (omni-modal). Этим они отличаются от более распространённых мультимодальных моделей, которые обычно ограничиваются текстом и картинками. Омнимодальная модель может, например, связать сказанное в ролике с тем, что видно в кадре.