I tried Strata today on my Ryzen 9 7945HX 128GB DDR5 + 4090D 48GB + 3090 rig, asking it to write a simple "vertical writing" program for English:
[strata] thinking: 15876 of max 130946 tokens, 120.5 tok/s, 132 s
[strata] answering: 16012 of max 130946 tokens, 120.7 tok/s, 133 s
[strata] answering: 16165 of max 130946 tokens, 120.9 tok/s, 134 s
[strata] answering: 16303 of max 130946 tokens, 121.0 tok/s, 135 s
[strata] answering: 16474 of max 130946 tokens, 121.4 tok/s, 136 s
[strata] answering: 16650 of max 130946 tokens, 121.8 tok/s, 137 s
[strata] answering: 16828 of max 130946 tokens, 122.2 tok/s, 138 s
[strata] done: 16854 tokens in 138 s (122.2 tok/s) (stop, cancel=False), expert cache 99.7% hit
Works a lot faster than llama.cpp, but I'm still using gemma 4 31B q8 as my "little baka agent" though.