Теория категорий помогла ИИ точнее рисовать визуальные метафоры
Метод PRISM считает, сколько связей метафоры сохранилось на картинке, и правит запрос; люди чаще выбирали доработанные изображения, но те становились перегруженнее.
Исследователи представили PRISM — метод, который считает, сколько смысловых связей метафоры сохранилось на сгенерированной картинке, и по этой оценке переписывает запрос, пока изображение не станет точнее. Препринт четырёх авторов вышел на arXiv 1 октября.
Почему это важно: генераторы картинок рисуют буквально и теряют переносный смысл. PRISM показывает, какие именно связи метафоры пропали, и эту оценку считают по формуле, а не спрашивают у модели-судьи или у людей.
Расклад: визуальная метафора показывает одно понятие через другое — как реклама, карикатура или плакат социальной кампании. По подсчёту авторов, без доработки меньше 10% картинок трёх генераторов узнаваемо показывали и то, что сравнивают, и то, с чем сравнивают; лучший результат, 9,4%, у GPT Image 1.5.
Как это работает: оценку строят по формальному описанию аналогий из теории категорий1:
- Модель Claude Sonnet 4.6 смотрит на картинку, выделяет два понятия метафоры и записывает в каждом предметы и связи между ними.
- Предметы заменяют ролями вроде «действующее лицо» или «результат», чтобы сравнивать устройство связей, а не совпадение слов.
- Связи двух понятий сопоставляют по смыслу, а оценка растёт, если совпавшие связи выстраиваются в цепочку.
Детали: картинку рисует GPT Image 1.5, а Claude Sonnet 4.6 получает оценку и список связей, которых на изображении нет, и переписывает запрос; кругов — до десяти. В одном из примеров к тающему льду после доработки добавились заводские трубы, и связь между промышленными выбросами и потерей льда стала видна.
В цифрах: оценку сначала проверили на текстах, потом на картинках:
- В тесте AnaloBench, где к истории нужно выбрать аналогичную из четырёх, одна лишь оценка PRISM указала верную в 82,5% случаев, а GPT-4.1 Mini, которую спросили напрямую, — в 88,5%.
- Без замены предметов ролями точность упала до 24%, то есть до уровня случайного угадывания.
- Восемьдесят участников опроса сравнивали картинки до и после доработки и выбрали доработанную в 57,65% случаев.
- Модели-судьи Claude Opus 4.8 и GPT-5.2 по шкале до 10 оценивали верность метафоре, точность аналогии и то, насколько естественно соединены два понятия. Общий балл PRISM — 7,87 против 6,83 у исходных картинок GPT Image 1.5.
Но: у метода есть слабые места, и авторы описывают их сами:
- Доработка чаще добавляет на картинку новые предметы, чем убирает лишние, и изображения становятся перегруженными.
- Генератор может просто подписать понятия текстом: модель, которая разбирает картинку, читает надписи, и оценка растёт, хотя изображение понятнее не стало.
- С GPT-6 Astra в роли разбирающей и правящей модели прирост тоже был, но меньше; авторы предполагают, что исходные оценки в этом прогоне и так были выше.
Между строк: оценивать метафоры трудно и людям. Двое участников, смотревших одну метафору, почти не сходились в баллах, хотя в том, стала ли картинка лучше, совпадали примерно в трёх случаях из четырёх; авторы видят в этом довод в пользу оценки, которую считают по формуле.
Интрига: формулу оценки и алгоритм сопоставления связей авторы, по их словам, составили с помощью генеративного ИИ, а затем проверили на вручную подобранных примерах.
Набор данных авторы выложили на Zenodo2: 125 метафор из рекламы, карикатур, социальных кампаний и мемов, записанных текстом с разметкой, и все картинки, сгенерированные в экспериментах. Сами исходные изображения из-за авторских прав не выкладывали — только ссылки на них.