ИИтак

← Назад

Словарь

SWE-bench

Бенчмарк, который проверяет, как языковые модели и агенты справляются с реальной разработкой. Задачи взяты из настоящих обращений (issues) и пул-реквестов в популярных открытых проектах на Python с GitHub. Модель получает код проекта и описание проблемы и должна исправить код так, чтобы прошли тесты. Бенчмарк создали исследователи Принстонского университета; на его основе появились отдельные варианты, например SWE-bench Verified и SWE-bench Multilingual.

← Весь словарь