Железнодорожная настолка подтянула модель в финансах — но только ту, что играла как агент
Good Start Labs обучила 30-миллиардную модель игре 1830. Финансовые задачи она стала решать лучше только тогда, когда играла как агент с инструментами, а не отвечала на вопрос одним ходом.
Стартап Good Start Labs обучил модель на 30 млрд параметров играть в железнодорожную настольную игру 1830. После этого одна из версий стала лучше справляться с финансовой аналитикой. Всё решило то, как игру подали модели. Об этом глава компании Алекс Даффи (Alex Duffy) рассказал изданию Latent Space.
В игре 1830 есть свой фондовый рынок: игроки покупают акции железнодорожных компаний и строят транспортную сеть. Стартап составил задания, похожие на работу аналитика. Модель ищет в базе данных записи сыгранных партий, переносит их в Excel, пишет формулы и считает ответ. Сравнили два способа обучения. В первом модели показывают позицию и просят назвать следующий ход. Во втором она работает как агент в терминале: сама изучает среду, пользуется инструментами, планирует и меняет стратегию по ходу дела. Играть лучше стали обе версии, но результат на бенчмарке Finance Agent вырос только у второй.
«То, как устроена обвязка, полностью меняет то, чему модель может научиться», — говорит Даффи. По его словам, модель, которая смотрит на картинки, выучит другое, чем модель, читающая текст или получающая всё в виде кода на Python. Идея компании появилась в 2025 году, когда Даффи ещё работал в Every и транслировал на Twitch партии передовых моделей в «Дипломатию». Тогда o3 от OpenAI выигрывала, заранее планируя предательство, а Claude Opus 4 отказывалась лгать и проигрывала. Позже Даффи писал, что дообучение на «Дипломатии» улучшило модель в поддержке клиентов.
Good Start Labs отделилась от Every в прошлом октябре и привлекла 3,6 млн долларов, среди инвесторов — General Catalyst и Inovia. Основные клиенты — передовые лаборатории. Стартап продаёт им записи того, как агенты играют: что видели, что решили и чем это кончилось. Ещё он продаёт данные из игр отдельных издателей, где агенты играют вживую, и полные игровые среды для обучения. По словам Даффи, данные обезличивают.
Новые модели вроде GPT-6 Astra и Claude Fable 5.1 играют лучше, но обвязка от этого важна не меньше, считает Даффи. «Astra, скорее всего, может посчитать в уме, но лучше, чтобы она использовала код — тогда результату можно доверять», — говорит он. Сам Даффи признаёт, что пока неясно, насколько широко и надёжно игровые навыки переносятся на реальную работу. Доказательств у компании два: финансовые задачи после 1830 и поддержка клиентов после «Дипломатии».