>>109446068
>>(07/31) DeepseekV4 MTP + DSpark support merged: https://github.com/ggml-org/llama.cpp/pull/25784
Will this run on RTX 3090 and 512gb of RAM?
CUDA_VISIBLE_DEVICES=0 ./build/bin/llama-server \
-m /mnt/llms/models/bullerwins/DeepSeek-V4-Flash-0731-GGUF/DeepSeek-V4-Flash-0731-MXFP4_MOE-BF16.gguf \
-md /mnt/llms/models/bullerwins/DeepseekV4-Flash-20260731-DSpark.gguf \
--host 0.0.0.0 \
--port 5000 \
--alias "deepseek-v4-flash-0731" \
--spec-type draft-dspark \
--spec-draft-n-max 5 \
-c 1048576 \
-ngl 99 \
--fit off