ИИтак

← Назад

Словарь

FrontierSWE

Бенчмарк компании Proximal для ИИ-агентов, которые пишут код. Он состоит из очень долгих открытых технических задач, на каждую агент тратит многие часы. Задачи трёх типов: реализовать крупную систему, ускорить существующий код и провести исследование в машинном обучении. В отличие от бенчмарков с ответом «решено — не решено», результат оценивается по шкале от нуля до единицы.

← Весь словарь