ИИтак

← Назад

Словарь

SWE-Together

Бенчмарк для ИИ-агентов, которые пишут код. Он собран из записей реальных многоходовых сессий, в которых пользователь по ходу работы уточняет цели, добавляет требования и поправляет агента. Диалог воспроизводит симулятор пользователя на основе языковой модели. Оценивается и правильность итогового кода в репозитории, и то, сколько раз человеку пришлось вмешаться. В отличие от бенчмарков, где задачу дают целиком сразу, SWE-Together проверяет агента как напарника.

← Весь словарь