Словарь
Inference Endpoints
Платный управляемый сервис Hugging Face, который разворачивает выбранную модель на выделенных облачных серверах с автоматическим масштабированием и открывает к ней доступ через API. Инфраструктуру, движки инференса вроде vLLM или SGLang и мониторинг настраивает сам сервис. В отличие от Hugging Face Inference Providers, модель работает на отдельных мощностях, выделенных под конкретного клиента.