Анима Анандкумар: для физики трансформеры не годятся, всех мощностей мира не хватит
Профессор Калтеха Анима Анандкумар объяснила в подкасте Latent Space, почему для погоды и термоядерного синтеза нужны нейронные операторы, а не большие трансформеры. Главные причины — мало данных и огромная длина контекста.
Языковые модели выросли на триллионах токенов, но с физическим миром этот рецепт не работает. Так считает Анима Анандкумар — профессор Калтеха и сооснователь компании Accelerated Understanding. Об этом она рассказала в интервью подкасту Latent Space.
Проблемы две. Во-первых, данных мало: открытые наборы по погоде, течениям жидкостей или плазме насчитывают десятки или сотни тысяч примеров. Во-вторых, физике нужно высокое разрешение, и контекст разрастается до гигантских размеров. «Если в каждом измерении хотя бы несколько сотен точек сетки, а промышленный масштаб с этого и начинается, речь идёт о контексте от сотен миллиардов до триллиона. Всех вычислительных мощностей мира не хватит», — говорит Анандкумар.
Её ответ — нейронные операторы1. Такая модель учит не значения в клетках сетки, а функцию, которая описывает систему сразу на многих масштабах. В неё можно заложить знания о физике. Например, Земля — шар, поэтому глобальную погоду удобнее описывать в сферических функциях2, а не на плоской сетке. На сетке прогноз быстро «разваливается», а в естественном для задачи базисе остаётся устойчивым на месяцы вперёд, а не на дни. На этой идее построена модель FourCastNet 33.
Когда команда начинала работу над первой FourCastNet, специалисты по погоде сомневались: погода хаотична, а физические симуляции десятилетиями считают на суперкомпьютерах. Меньше чем за год модель догнала лучшие физические симуляции. Теперь короткий прогноз можно считать на обычных игровых видеокартах.
По словам Анандкумар, физический мир прощает больше, чем кажется. В термоядерном синтезе нескольких тысяч примеров хватает, чтобы предсказывать срывы плазмы, и в миллион раз быстрее традиционной симуляции. Её цель — «фундаментальная модель для физики», которая охватит много явлений и будет как моделировать, так и проектировать. «Всё, что работает в глубоком обучении, давайте возьмём, но сделаем чуть более строгим», — формулирует она подход.
В разговоре упоминается и TorchLean. Этот фреймворк позволяет писать нейросети в стиле PyTorch внутри системы доказательств Lean4 и формально проверять их свойства. Такие гарантии понадобятся, например, если нейросеть встроят в систему управления термоядерным реактором. Кроме того, Анандкумар недавно вошла в Научно-консультативный совет ООН.