I patched llama.cpp to gain 20% prompt processing TPS. Help me make a PR
A developer patched llama.cpp to improve prompt processing throughput by 20% when using Multi-Token Prediction (MTP) on GPU, recovering performance lost to MTP overhead. The proof-of-concept processes only the output row…