>>109966989
Here's what I am currently getting with llama.cpp:
49.39.242.732 I slot print_timing: id 2 | task 4959 | n_gen = 1647, tg = 2.47 t/s, tg_3s = 2.16 t/s
49.42.540.237 I slot print_timing: id 2 | task 4959 | n_gen = 1654, tg = 2.47 t/s, tg_3s = 2.12 t/s
49.45.584.941 I slot print_timing: id 2 | task 4959 | n_gen = 1660, tg = 2.46 t/s, tg_3s = 1.97 t/s
49.48.973.491 I slot print_timing: id 2 | task 4959 | n_gen = 1666, tg = 2.46 t/s, tg_3s = 1.77 t/s
49.52.350.596 I slot print_timing: id 2 | task 4959 | n_gen = 1673, tg = 2.46 t/s, tg_3s = 2.07 t/s
49.54.239.735 I slot print_timing: id 2 | task 4959 | prompt eval time = 191410.77 ms / 3224 tokens ( 59.37 ms per token, 16.84 tokens per second)
49.54.239.742 I slot print_timing: id 2 | task 4959 | eval time = 681872.21 ms / 1677 tokens ( 406.84 ms per token, 2.46 tokens per second)
49.54.239.743 I slot print_timing: id 2 | task 4959 | total time = 873282.99 ms / 4901 tokens
49.54.239.744 I slot print_timing: id 2 | task 4959 | graphs reused = 6522
49.54.245.826 I slot release: id 2 | task 4959 | stop processing: n_tokens = 69077, truncated = 0