Открытая среда Dr. Claw ставит ИИ-агента для кода под контроль учёного
Dr. Claw отдаёт работу агентам вроде Claude Code и Codex, оставляет решения учёному и записывает каждый шаг. В пробной проверке агент в Dr. Claw соблюл больше правил добротного исследования, чем тот же агент без среды.
Тринадцать исследователей из университетов США и Канады описали Dr. Claw — открытую среду, где агент для программирования ведёт научный проект по этапам, а решения принимает человек.
Почему это важно: Авторы сознательно не делают ещё одного автономного «ИИ-учёного». Свой подход они называют «вайб-исследованием» по аналогии с вайб-кодингом1: учёный обычными словами ставит цели, ИИ их выполняет, а направление работы и приёмка результата остаются за человеком.
Предыстория: Код Dr. Claw открыт на GitHub под лицензией AGPL-3.0 с февраля 2026 года, у проекта больше 1 100 звёзд. Статья с описанием и первой проверкой вышла на arXiv 31 августа. Её приняли на конференцию EMNLP 20262 в раздел демонстраций систем.
Общая картина: Агенты вроде Claude Code и Gemini CLI уже читают и пишут файлы и выдерживают долгие сессии. Но исследование с ними расползается по чатам, редакторам кода, терминалам и программам для текста, а причины решений обычно нигде не записаны.
Как это работает: Dr. Claw — обвязка3 вокруг агента, а не замена ему. Исполнителем может быть Claude Code, Gemini CLI, Codex или любая модель через OpenRouter4.
- Проект идёт по пяти этапам: обзор литературы, поиск идеи, эксперимент, статья и продвижение готовой работы.
- В библиотеке больше 100 навыков — готовых инструкций для агента, от поиска идей до академического письма.
- Файлы, решения человека и точки восстановления хранятся на диске, поэтому после сбоя работу можно продолжить с того же места.
Детали: Авторы дали одно и то же задание Dr. Claw и агенту Codex без обвязки, оба работали на модели GPT-5.4. Задачи были медицинские, например отличить меланому от родинки по снимкам кожи. Полноту работы мерили по списку из 21 правила добротного исследования: воспроизводимый код, перекрёстная проверка, статистика, ссылки, раздел об ограничениях.
В цифрах: Перевес Dr. Claw дали в основном правила научной аккуратности.
- По трём задачам вместе Dr. Claw выполнил 95,2% правил, агент без обвязки — 87,3%; две задачи выиграл Dr. Claw, третья закончилась вничью.
- Агент без обвязки ни в одной задаче не сослался на настоящую научную литературу, а с Dr. Claw ссылки появились в двух задачах из трёх.
- Раздел об ограничениях и анализ по подгруппам агент без обвязки сделал в одной задаче из трёх, с Dr. Claw — во всех трёх.
Но: Авторы сами называют проверку небольшой пробной демонстрацией: каждую задачу прогнали один раз. Разница в 7,9 процентного пункта статистически незначима — её 95-процентный доверительный интервал захватывает ноль.
Отдельно авторы показали, как среда справляется со сбоем: в задаче с меланомой они нарочно увели агента по неверному пути. Dr. Claw остановился на ошибке, а не стал молча исправлять её сам. Затем исправление внесли на месте: среда добавила исправленные файлы, не потеряв ни одного из пяти уже созданных.