Kurz gesagt: Ollama 0.32.6 korrigiert die Semantik seines OpenAI-kompatiblen Streaming-Endpunkts. Für Teams, die lokale Modelle hinter bestehenden OpenAI-Clients betreiben, ist das keine kosmetische Anpassung: Chunk-Reihenfolge, Abschlussgrund und Usage-Daten werden berechenbarer. Gleichzeitig entfernt der Release die experimentelle Bildgenerierung vorübergehend.
Die Version wurde am 4. August 2026 um 18:49 UTC veröffentlicht. Sie betrifft sowohl den API-Adapter als auch die lokale Apple-Silicon-Runtime.
Vier Stream-Ereignisse statt impliziter Interpretation
Der Endpoint /v1/chat/completions folgt nun laut Release dem OpenAI-Wire-Format genauer: Die Rolle erscheint nur im ersten Chunk; finish_reason wird in einem eigenen Chunk geliefert; Usage kommt separat, wenn der Client stream_options.include_usage setzt. Bei einer abgeschnittenen Antwort lautet der Abschlussgrund zudem korrekt length statt tool_calls.
Das ist vor allem für Adapter, Telemetrie und Tool-Loop-Steuerung relevant. Wer aus einem unerwarteten tool_calls-Abschluss ableitet, dass noch ein Werkzeugaufruf aussteht, konnte einen gekürzten Modell-Output bislang falsch behandeln.
# Usage bei Streaming explizit anfordern
payload = {
"model": "qwen3.5",
"stream": True,
"stream_options": {"include_usage": True}
}
# Robust konsumieren: role → content deltas → finish_reason → usage
Apple-GPUs: Qwen3.5 nutzt den MTP-Head automatisch
Im MLX-Engine aktiviert Ollama für Qwen3.5 automatisch den MTP-Head des Modells für Speculative Decoding. Der Beschleunigungspfad wird damit nicht mehr als manuelle Sonderkonfiguration behandelt. Konkrete Geschwindigkeitswerte nennt der Release nicht; Teams sollten Prompt-Länge, Quantisierung und Hardware im eigenen Setup messen.
Ein Feature fällt weg
Die experimentelle Bildgenerierung wurde temporär entfernt. Wer sie benötigt, soll laut Ollama auf 0.32.5 bleiben. Ein Upgrade auf 0.32.6 ist damit eine Abwägung zwischen stabilerer Chat-Completions-Kompatibilität und diesem weggefallenen Experimentalpfad.
Upgrade-Check für den Betrieb
- Streaming-Parser testen: Rolle, Inhalt, Abschluss und Usage nicht im selben Chunk voraussetzen.
- Abschlusslogik prüfen:
lengthals gekürzte Ausgabe behandeln, nicht als Tool-Auftrag. - Usage bewusst aktivieren: Token-Telemetrie bei Streams nur mit
include_usageerwarten. - Image-Generation-Abhängigkeiten inventarisieren: Solche Installationen vorerst auf 0.32.5 pinnen.
Einordnung: Der wertvollste Teil dieses Releases ist Protokolldisziplin. OpenAI-Kompatibilität entscheidet sich in produktiven Integrationen nicht am Namen eines Endpoints, sondern an den kleinen Zustandsübergängen, die SDKs, Proxies und Agenten-Loops tatsächlich konsumieren.
Quelle
- Ollama v0.32.6 Release Notes (veröffentlicht am 4. August 2026, 18:49 UTC)

Leave a Reply