llama.cpp b10256: Intel-Arc-SYCL-Prefill gewinnt 9,4 Prozent – im engen Benchmark

Abstrakte Signalwege zeigen die breitere Parallelisierung eines SYCL-Concat-Pfads für Intel Arc

llama.cpp erweitert seinen SYCL-Pfad für Intel-GPUs um einen parallelisierten Kernel für nicht-kontiguierliche Concat-Operationen. Der neue Release b10256 misst auf einer Arc Pro B70 beim Prefill eines quantisierten Qwen3.6-27B-Modells 1.006 statt 920 Token pro Sekunde. Das entspricht 9,4 Prozent – aber nur für einen genau dokumentierten Stack und Benchmark.

Was im Kernel anders läuft

Der bisherige SYCL-Kernel startete für diesen Concat-Pfad eine einspurige Workgroup mit (1, 1, 1). b10256 ersetzt sie durch (1, 1, SYCL_CONCAT_BLOCK_SIZE). Praktisch: Iterationen, die zuvor nacheinander in einer einzelnen Lane liefen, können innerhalb der Workgroup breiter auf die Hardware verteilt werden.

Das betrifft ausdrücklich nur nicht-kontiguierliche Concat-Operationen. Es ist weder ein neues Modellformat noch eine pauschale Beschleunigung für alle llama.cpp-Workloads. Genau diese Einschränkung ist für lokale Inference-Setups wichtiger als die Prozentzahl in der Release-Notiz.

Der Benchmark: präzise, aber nicht universell

Die Maintainer dokumentieren llama-bench auf einer Intel Arc Pro B70 mit Qwen3.6-27B-UD-Q4_K_XL, aktivierter Flash Attention, Q8_0-KV-Cache und pp2048. Der gemessene Prefill-Durchsatz steigt von 920 auf 1.006 Token/s.

Messgröße Vorher b10256
Prefill bei pp2048 920 Token/s 1.006 Token/s
Relative Änderung +9,4 %
Getesteter Pfad SYCL, nicht-kontiguierlicher Concat-Kernel

Das ist ein hilfreicher Betreiber-Benchmark, kein SLA und kein Beleg für einen gleich großen Gewinn beim Decoding, auf anderen Arc-Generationen oder mit anderen Modellgraphen.

Was Teams jetzt tun sollten

  • Build aktualisieren und getrennt messen: Prefill/TTFT sowie Decode-Tokenrate nicht zu einer Kennzahl vermischen.
  • Den eigenen Graphen prüfen: Der Gewinn setzt voraus, dass der betroffene nicht-kontiguierliche Concat-Pfad im tatsächlichen Modell- und Kontext-Setup häufig läuft.
  • Mit Produktionskontext testen: Quantisierung, Flash Attention, KV-Cache-Typ und Promptlänge sind Teil des Resultats – der Referenzwert ist keine Übertragbarkeitsgarantie.

Für Betreiber lokaler Qwen-Deployments auf Intel Arc ist b10256 deshalb ein sinnvoller, risikoarmer Aktualisierungskandidat. Die richtige Lesart lautet nicht „llama.cpp ist 9,4 Prozent schneller“, sondern: Ein zuvor unnötig schmaler SYCL-Kernel wurde verbreitert – und zeigt unter einer klar benannten Arc-Pro-B70-Konfiguration einen messbaren Prefill-Gewinn.

Quellen: llama.cpp Release b10256 (4. August 2026, 06:39 UTC); PR #25852: SYCL parallelize the non-contiguous concat kernel.

Comments

Leave a Reply

Your email address will not be published. Required fields are marked *