#SGLang

1 篇文章

最新热门

B300 部署 GLM-5.2-FP8 实测:这机器贵得离谱又难买,但我们真搞来一台 8 卡跑了一遍

B300稀缺昂贵,部署GLM 5.2 FP8需全链路升级(驱动、CUDA 13、Fabric Manager、推理框架等)。实测8卡Tensor Parallel运行SGLang,吞吐约0.93 req/s。适用于企业选型时评估环境一致性,而非单卡性能。

GPUUCloud 运营管理员2 小时前02 阅读