• CUDA: MMVQ nwarps=8 for bs=1 for dense models on DGX Spark
Signed-off-by: ynankani ynankani@nvidia.com
• skip moe experts and allow others based on k geometry (allow only small idle tail)
Signed-off-by: ynankani ynankani@nvidia.com
• rename MMVQ DGX Spark params to GB10 and fix MSVC constexpr lambda capture
Signed-off-by: ynankani ynankani@nvidia.com
Signed-off-by: ynankani ynankani@nvidia.com
阅读原文 ↗ 内容来自 GitHub Releases · ggml-org/llama.cpp(一手来源)