>>109829856
>yes it is prefill speed and it is dropping off like a fucking rock
I just tried it, v4-flash mxfp4 with ik_llama (because that's what I have), DDR5 with no gpu.
prompt eval time = 326.29 ms / 5 tokens ( 65.26 ms per token, 15.32 tokens per second)
eval time = 20639.86 ms / 203 tokens ( 101.67 ms per token, 9.84 tokens per second)
total time = 20966.15 ms / 208 tokens
prompt eval time = 10281.01 ms / 1624 tokens ( 6.33 ms per token, 157.96 tokens per second)
eval time = 147758.93 ms / 1347 tokens ( 109.69 ms per token, 9.12 tokens per second)
total time = 158039.94 ms / 2971 tokens
prompt eval time = 10101.76 ms / 1482 tokens ( 6.82 ms per token, 146.71 tokens per second)
eval time = 116788.49 ms / 1072 tokens ( 108.94 ms per token, 9.18 tokens per second)
total time = 126890.26 ms / 2554 tokens
prompt eval time = 12377.69 ms / 1887 tokens ( 6.56 ms per token, 152.45 tokens per second)
eval time = 171295.39 ms / 1566 tokens ( 109.38 ms per token, 9.14 tokens per second)
total time = 183673.08 ms / 3453 tokens
Idk, the prompe processing isn't really slowing down. It's too slow and rage inducing though so I dont' want to test any more.
Also looks like some retardation around chopping off the previous reasoning and invalidating part of the cache, but that's probably my fault.
If it's just Deepseek they fucked up, run a different moe?
Good luck...