ИИ-агент готовит таблицы для модели Google TabFM и снижает её ошибки
ИИ-агент по названиям столбцов пишет код подготовки данных для TabFM, модели для прогнозов по таблицам, и связка обходит в тестах агентов, которые обучают модели с нуля.

Исследователи, среди которых создатели табличной модели Google TabFM, дали ей в помощь ИИ-агента, который пишет код подготовки данных, и пять вариантов такой связки заняли первые пять мест в бенчмарке TabArena1.
Почему это важно: Табличные модели предсказывают значения по заполненным строкам — уйдёт ли клиент, сколько стоит дом, — но видят только числа. Столбец «систолическое давление» для них ничем не отличается от безымянного X_17. Агент понимает названия столбцов и закрывает этот пробел, не переобучая модель.
Повод: Препринт о системе TabFM-Auto вышел 29 сентября. Саму TabFM Google Research представила в июне: она делает прогноз по таблице за один проход и без обучения под задачу.
Как это работает: модель на 400 млн параметров остаётся неизменной, меняется только код вокруг неё.
- Агент читает названия столбцов и описание задачи и правит четыре функции на Python: очистку данных, новые признаки, отбор строк для модели и поправку её ответов.
- Каждый вариант проверяется на части обучающих данных, и агент оставляет только правки, которые снижают ошибку.
- На один набор данных уходит до 96 проверок или до шести часов на одном ускорителе H100.
Детали: авторы разобрали код, который агенты написали сами.
- Для данных о шуме крыла агент добавил число Струхаля, формулу из аэродинамики, и ошибка прогноза упала на 14,6–17,3%.
- В медицинских записях он разложил коды диагнозов МКБ-9 по 19 группам систем органов и вычислил среднее артериальное давление из систолического и диастолического.
- Там, где ноль в столбце означал «не измерено», агент заменял его пометкой о пропуске.
В цифрах: проверяли трёх агентов для программирования — Claude Code, Codex и Antigravity — с моделями Claude Opus 5 и Gemini 3.8 Flash.
- Лучшая пара, Codex с Opus 5, подняла TabFM с 1785 до 2013 пунктов рейтинга Эло2 на 51 наборе данных TabArena.
- Ансамбль AutoGluon3 1.5 после четырёх часов настройки набрал 1668 пунктов.
- Отдельно авторы дали агенту Antigravity с Gemini 3.8 Flash те же шесть часов на набор данных и разрешили обучать любые модели без TabFM: он получил 1469 пунктов, а в связке с TabFM — 1980.
- Пять полных прогонов обошлись примерно в 17,6 тыс. долларов платы за доступ к языковым моделям.
Если шире: найденный код пригодился и чужим моделям. Без нового поиска он прибавил TabPFN-3, TabICLv2 и EXAONE-Tabular от 69 до 143 пунктов. В восьми табличных соревнованиях MLE-Bench4 две связки заняли первое и второе места, обойдя 12 сторонних агентов. В задаче о вулканах основная таблица содержала только номера записей, и агент сам написал обработку сейсмических сигналов — ошибка вышла в 9,4 раза ниже, чем у лучшего стороннего агента.
Но: авторы называют ограничения сами.
- На таблицах с обезличенными столбцами ошибка снижается на 2,3–3,0%, а там, где названия говорят о физических, медицинских или экономических величинах, — на 7,3–8,2%.
- В TabArena каждый набор данных делят на обучающую и тестовую части по-разному 9 или 30 раз, а агент искал код только на обучающей части первого деления. В остальных делениях часть этих строк попадает в тест: агент их уже видел, и результат может быть завышен. На тесте первого деления, строк которого агент не видел, связка тоже первая, с 1951 пунктом.
- Поиск нужно повторять для каждой новой таблицы.
Что дальше: авторы предлагают собрать найденные операции в библиотеку, чтобы на новых таблицах агент начинал не с нуля, и учесть такие формулы при обучении будущих табличных моделей.
29 сентября NVIDIA выпустила свою открытую модель того же класса — Kumo Tabular.