>>109475663
128k:
32k:
llama_init_from_model: KV self size = 1376.00 MiB, K-only (f16): 1376.00 MiB; independent V-cache: not used
64k:
llama_init_from_model: KV self size = 2752.00 MiB, K-only (f16): 2752.00 MiB; independent V-cache: not used
128k:
llama_init_from_model: KV self size = 5536.25 MiB, K-only (f16): 5536.25 MiB; independent V-cache: not used
Also got this little fucker:
ensure_dsv4_cache_tensors: DSV4 cache: CSA K= 677.25 MiB (f16), HCA K= 25.00 MiB (f16), LID K= 169.31 MiB (f16), states= 11.64 MiB, total= 883.20 MiB, streams=1