Словарь
SWE-Bench Pro
Бенчмарк компании Scale AI для оценки ИИ-агентов в программировании. Модель должна решать задачи из реальных репозиториев — исправлять ошибки или добавлять функции, — а решение проверяют тестами. Задачи длиннее и сложнее, чем в SWE-bench Verified, а часть взята из закрытых коммерческих кодовых баз, чтобы снизить риск загрязнения данных.