ИИтак

← Назад

Словарь

SWE-Bench Pro

Бенчмарк компании Scale AI для оценки ИИ-агентов в программировании. Модель должна решать задачи из реальных репозиториев — исправлять ошибки или добавлять функции, — а решение проверяют тестами. Задачи длиннее и сложнее, чем в SWE-bench Verified, а часть взята из закрытых коммерческих кодовых баз, чтобы снизить риск загрязнения данных.

← Весь словарь