Open Infra
FreeInference · GPU fleet & SGLang queue
connecting
auto every 20m

CPU

util % load1

Host RAM

used GB

GPU SM

util %

GPU memory

VRAM % mem util

GPU power

watts

GPU temp

°C

GPU clocks

SM MHz

SGLang SM

replica GPU %

SGLang requests

running queued

KV tokens

used

Prefill tokens/s

tok/s

Waiting tokens

uncached

GPU fleet

SGLang servers