ИИтак

← Назад

Словарь

Визуальный трансформер

Визуальный трансформер (Vision Transformer, ViT) — нейросетевая архитектура, которая разбивает изображение на участки-патчи, превращает их в последовательность токенов и обрабатывает механизмом внимания, сопоставляя все участки друг с другом. В отличие от свёрточных сетей, опирающихся на локальные окрестности пикселей, ViT с первых слоёв учитывает связи по всей сцене.

← Весь словарь