.\llama.cpp\build\bin\llama-server.exe ^
-m .\models\3.8flashenxt\Q3.8FN_IQ3_M.gguf ^
--mmproj .\models\3.8flashenxt\mmproj_Q3.8FN_F16.gguf ^
--no-mmproj-offload ^
--n-gpu-layers all ^
-ncmoe 44 ^
--override-tensor "per_layer_token_embd\.weight=CPU" ^
--load-mode mmap ^
--ctx-size 131072 ^
--batch-size 2048 ^
--ubatch-size 512 ^
--threads 16 ^
--threads-batch 16 ^
--flash-attn on ^
--cache-type-k q4_0 ^
--cache-type-v q4_0 ^
--parallel 1 ^
--jinja ^
--temp 0.7 ^
--top-p 0.8 ^
--top-k 20 ^
--min-p 0 ^
--presence-penalty 1.5 ^
--host 127.0.0.1 ^
--port 8080 ^
--metrics ^
--tools all
pause
4070 super, ddr4-3600 dual channel 64G, cpu 8c16t zen 3
i am getting around 13 for tg and 25 for pp
what should i try