Ollama 0.32.6: OpenAI-kompatibles Streaming wird zum Betriebsdetail

Technische Grafik zum OpenAI-kompatiblen Streaming in Ollama 0.32.6: Rolle, Delta, Abschluss und Usage als getrennte Ereignisse

Kurz gesagt: Ollama 0.32.6 korrigiert die Semantik seines OpenAI-kompatiblen Streaming-Endpunkts. Für Teams, die lokale Modelle hinter bestehenden OpenAI-Clients betreiben, ist das keine kosmetische Anpassung: Chunk-Reihenfolge, Abschlussgrund und Usage-Daten werden berechenbarer. Gleichzeitig entfernt der Release die experimentelle Bildgenerierung vorübergehend.

Die Version wurde am 4. August 2026 um 18:49 UTC veröffentlicht. Sie betrifft sowohl den API-Adapter als auch die lokale Apple-Silicon-Runtime.

Vier Stream-Ereignisse statt impliziter Interpretation

Der Endpoint /v1/chat/completions folgt nun laut Release dem OpenAI-Wire-Format genauer: Die Rolle erscheint nur im ersten Chunk; finish_reason wird in einem eigenen Chunk geliefert; Usage kommt separat, wenn der Client stream_options.include_usage setzt. Bei einer abgeschnittenen Antwort lautet der Abschlussgrund zudem korrekt length statt tool_calls.

Das ist vor allem für Adapter, Telemetrie und Tool-Loop-Steuerung relevant. Wer aus einem unerwarteten tool_calls-Abschluss ableitet, dass noch ein Werkzeugaufruf aussteht, konnte einen gekürzten Modell-Output bislang falsch behandeln.

# Usage bei Streaming explizit anfordern
payload = {
  "model": "qwen3.5",
  "stream": True,
  "stream_options": {"include_usage": True}
}
# Robust konsumieren: role → content deltas → finish_reason → usage

Apple-GPUs: Qwen3.5 nutzt den MTP-Head automatisch

Im MLX-Engine aktiviert Ollama für Qwen3.5 automatisch den MTP-Head des Modells für Speculative Decoding. Der Beschleunigungspfad wird damit nicht mehr als manuelle Sonderkonfiguration behandelt. Konkrete Geschwindigkeitswerte nennt der Release nicht; Teams sollten Prompt-Länge, Quantisierung und Hardware im eigenen Setup messen.

Ein Feature fällt weg

Die experimentelle Bildgenerierung wurde temporär entfernt. Wer sie benötigt, soll laut Ollama auf 0.32.5 bleiben. Ein Upgrade auf 0.32.6 ist damit eine Abwägung zwischen stabilerer Chat-Completions-Kompatibilität und diesem weggefallenen Experimentalpfad.

Upgrade-Check für den Betrieb

  • Streaming-Parser testen: Rolle, Inhalt, Abschluss und Usage nicht im selben Chunk voraussetzen.
  • Abschlusslogik prüfen: length als gekürzte Ausgabe behandeln, nicht als Tool-Auftrag.
  • Usage bewusst aktivieren: Token-Telemetrie bei Streams nur mit include_usage erwarten.
  • Image-Generation-Abhängigkeiten inventarisieren: Solche Installationen vorerst auf 0.32.5 pinnen.

Einordnung: Der wertvollste Teil dieses Releases ist Protokolldisziplin. OpenAI-Kompatibilität entscheidet sich in produktiven Integrationen nicht am Namen eines Endpoints, sondern an den kleinen Zustandsübergängen, die SDKs, Proxies und Agenten-Loops tatsächlich konsumieren.

Quelle

Comments

Leave a Reply

Your email address will not be published. Required fields are marked *