llama.cpp: MTP macht Qwen3-Next und DeepSeek V3.2 lokal schneller

llama.cpp kann jetzt die Multi-Token-Prediction-(MTP-)Schichten von Qwen3-Next und DeepSeek V3.2 nutzen. Die am 3. August veröffentlichten Builds b10237 und b10238 machen damit eine im Modell vorhandene Decoding-Optimierung im …