vllm.models.deepseek_v32.nvidia ¶
Modules:
-
glm52_low_latency_gemm–GLM-5.2 decode GEMM selection for unquantized BF16 on SM103.
-
model– -
mtp–
vllm.models.deepseek_v32.nvidia ¶Modules:
glm52_low_latency_gemm – GLM-5.2 decode GEMM selection for unquantized BF16 on SM103.
model – mtp –