Словарь
vLLM
Библиотека и сервер с открытым кодом для быстрого инференса больших языковых моделей. Благодаря механизму PagedAttention и пакетной обработке эффективно использует память видеокарт и обслуживает множество параллельных запросов; часто служит точкой отсчёта при сравнении скорости движков.