llama.cpp erweitert seinen SYCL-Pfad für Intel-GPUs um einen parallelisierten Kernel für nicht-kontiguierliche Concat-Operationen. Der neue Release b10256 misst auf einer Arc Pro B70 beim Prefill eines quantisierten Qwen3.6-27B-Modells 1.006 statt 920 Token pro Sekunde. Das entspricht 9,4 Prozent – aber nur für einen genau dokumentierten Stack und Benchmark.
Was im Kernel anders läuft
Der bisherige SYCL-Kernel startete für diesen Concat-Pfad eine einspurige Workgroup mit (1, 1, 1). b10256 ersetzt sie durch (1, 1, SYCL_CONCAT_BLOCK_SIZE). Praktisch: Iterationen, die zuvor nacheinander in einer einzelnen Lane liefen, können innerhalb der Workgroup breiter auf die Hardware verteilt werden.
Das betrifft ausdrücklich nur nicht-kontiguierliche Concat-Operationen. Es ist weder ein neues Modellformat noch eine pauschale Beschleunigung für alle llama.cpp-Workloads. Genau diese Einschränkung ist für lokale Inference-Setups wichtiger als die Prozentzahl in der Release-Notiz.
Der Benchmark: präzise, aber nicht universell
Die Maintainer dokumentieren llama-bench auf einer Intel Arc Pro B70 mit Qwen3.6-27B-UD-Q4_K_XL, aktivierter Flash Attention, Q8_0-KV-Cache und pp2048. Der gemessene Prefill-Durchsatz steigt von 920 auf 1.006 Token/s.
| Messgröße | Vorher | b10256 |
|---|---|---|
| Prefill bei pp2048 | 920 Token/s | 1.006 Token/s |
| Relative Änderung | +9,4 % | |
| Getesteter Pfad | SYCL, nicht-kontiguierlicher Concat-Kernel | |
Das ist ein hilfreicher Betreiber-Benchmark, kein SLA und kein Beleg für einen gleich großen Gewinn beim Decoding, auf anderen Arc-Generationen oder mit anderen Modellgraphen.
Was Teams jetzt tun sollten
- Build aktualisieren und getrennt messen: Prefill/TTFT sowie Decode-Tokenrate nicht zu einer Kennzahl vermischen.
- Den eigenen Graphen prüfen: Der Gewinn setzt voraus, dass der betroffene nicht-kontiguierliche Concat-Pfad im tatsächlichen Modell- und Kontext-Setup häufig läuft.
- Mit Produktionskontext testen: Quantisierung, Flash Attention, KV-Cache-Typ und Promptlänge sind Teil des Resultats – der Referenzwert ist keine Übertragbarkeitsgarantie.
Für Betreiber lokaler Qwen-Deployments auf Intel Arc ist b10256 deshalb ein sinnvoller, risikoarmer Aktualisierungskandidat. Die richtige Lesart lautet nicht „llama.cpp ist 9,4 Prozent schneller“, sondern: Ein zuvor unnötig schmaler SYCL-Kernel wurde verbreitert – und zeigt unter einer klar benannten Arc-Pro-B70-Konfiguration einen messbaren Prefill-Gewinn.
Quellen: llama.cpp Release b10256 (4. August 2026, 06:39 UTC); PR #25852: SYCL parallelize the non-contiguous concat kernel.

Leave a Reply