>>109382926
running MiniMax-M3 (a 160G MoE) in ik_llama.cpp with RAM artificially locked to 32G and mmap enabled
it's faster with *no* gpu:
32G
prompt eval time = 24442.51 ms / 193 tokens ( 126.65 ms per token, 7.90 tokens per second)
eval time = 20232.94 ms / 32 tokens ( 632.28 ms per token, 1.58 tokens per second)
total time = 44675.45 ms / 225 tokens
64G
prompt eval time = 1036.66 ms / 1 tokens ( 1036.66 ms per token, 0.96 tokens per second)
eval time = 8301.22 ms / 32 tokens ( 259.41 ms per token, 3.85 tokens per second)
total time = 9337.89 ms / 33 tokens
96G
prompt eval time = 525.19 ms / 1 tokens ( 525.19 ms per token, 1.90 tokens per second)
eval time = 5856.87 ms / 32 tokens ( 183.03 ms per token, 5.46 tokens per second)
total time = 6382.06 ms / 33 tokens
The good thing is, being IO bound, the CPU doesn't get hot.
And I'm guessing the computationally expensive IKT quants aren't a bottleneck.