ИИтак

← Назад

Словарь

Terminal-Bench-Science

Открытый бенчмарк, который проверяет, может ли ИИ-агент выполнить реальные вычислительные исследовательские задачи из естественных наук, математики и инженерии. Задачи пишут действующие учёные. Агент решает их в изолированном терминале, а результат проверяют автоматические тесты автора задачи. В отличие от Terminal-Bench, задачи здесь научные и гораздо длиннее. Проект развивают Стэнфордский университет, Laude Institute и команда Terminal-Bench.

← Весь словарь