Словарь
ProgramBench
Бенчмарк, который проверяет, может ли ИИ-агент с нуля написать целую программу. Агент получает только готовый исполняемый файл и документацию. Он должен сам выбрать язык и архитектуру и написать код, который ведёт себя так же, как оригинал: от небольших утилит командной строки до FFmpeg и SQLite. Поведение проверяют автоматическими тестами; задача считается решённой, только если программа проходит их все. Бенчмарк создали авторы SWE-bench и их соавторы.