b10798: prompt processing, n_tokens = 49985, progress = 1.00, t = 153.87 s / 324.85 tokens per second
b10781: prompt processing, n_tokens = 49985, progress = 1.00, t = 141.61 s / 352.97 tokens per second
prompt processing, n_tokens = 49985, progress = 1.00, t = 132.14 s / 378.27 tokens per second
b10780: prompt processing, n_tokens = 49985, progress = 1.00, t = 75.82 s / 659.26 tokens per second
prompt processing, n_tokens = 49985, progress = 1.00, t = 75.33 s / 663.57 tokens per second
b10754: prompt processing, n_tokens = 49985, progress = 1.00, t = 75.86 s / 658.91 tokens per second
Name and Version
❯ llama-server --version
version: 0.3.0-dev (build 10781, commit unknown)
built with GNU 16.2.1 for Linux x86_64
Operating systems
Linux
Which llama.cpp modules do you know to be affected?
llama-server
Command line
Problem description & steps to reproduce
Versions b10781 and later has greatly reduced prompt processing speeds at depth compared to the previous release. Reverting to release b10780 restores performance.
First Bad Commit
Appears to be caused by commit
c7bda03, #28190Relevant log output
Logs