Is this just how it is with llama.cpp and moes?
2 3090's + CPU:
| prompt eval time = 10650.97 ms / 791 tokens ( 13.47 ms per token, 74.27 tokens per second)
| eval time = 15413.20 ms / 258 tokens ( 59.97 ms per token, 16.67 tokens per second)
| total time = 26064.17 ms / 1049 tokens
1 3090 + CPU:
| prompt eval time = 6642.53 ms / 791 tokens ( 8.40 ms per token, 119.08 tokens per second)
| eval time = 3344.22 ms / 57 tokens ( 59.72 ms per token, 16.75 tokens per second)
| total time = 9986.75 ms / 848 tokens
Model: MiMo-V2.6-Flash-RL@MXFP4
Both 3090s PCIe@4.0x16
More gpus = slower pp?