#FP8
共 3 篇文章
B300 部署 GLM-5.2-FP8 实测:这机器贵得离谱又难买,但我们真搞来一台 8 卡跑了一遍
B300稀缺昂贵,部署GLM 5.2 FP8需全链路升级(驱动、CUDA 13、Fabric Manager、推理框架等)。实测8卡Tensor Parallel运行SGLang,吞吐约0.93 req/s。适用于企业选型时评估环境一致性,而非单卡性能。

DeepSeek-V3.1提到的UE8M0 FP8是个啥?
DeepSeek-V3.1采用UE8M0 FP8权重精度,这是MXFP8微缩放格式,使用E8M0缩放因子提升大模型训练推理效率,并针对下一代国产芯片设计。该技术已在DeepSeek模型中得到验证,适合国产芯片的AI训练与推理场景。
