LLM Operations
-
Liquid AI LFM2.5-Encoder: Warum Long-Context-NLP auf CPU wieder eine Architekturentscheidung ist
Artikel lesen →: Liquid AI LFM2.5-Encoder: Warum Long-Context-NLP auf CPU wieder eine Architekturentscheidung istLiquid AI veröffentlicht zwei Long-Context-Encoder für CPU-Betrieb. Warum spezialisierte Modelle die LLM-Kostenarchitektur bei Klassifikation und Triage verändern können.
Verfasst von
-
MCP Python SDK 2.0: Warum ein Dependency-Update jetzt zum Protokoll-Migrationsprojekt wird
Artikel lesen →: MCP Python SDK 2.0: Warum ein Dependency-Update jetzt zum Protokoll-Migrationsprojekt wirdMCP Python SDK 2.0 ist stabil. Weil pip nun automatisch 2.x installiert, wird ein Dependency-Update für viele MCP-Server zur planbaren Migration.
Verfasst von
-
Ollama 0.32.4: Warum Quantisierung jetzt zur Apple-Silicon-Betriebsfrage wird
Artikel lesen →: Ollama 0.32.4: Warum Quantisierung jetzt zur Apple-Silicon-Betriebsfrage wirdOllama 0.32.4 räumt gleich an drei Stellen auf, die für lokale Inferenz auf Apple Silicon relevant sind: Die Runtime unterstützt Laguna über die MLX-Engine, erstellt Output-Heads für Speculative-Decoding-Drafts …
Verfasst von
-
SGLang 0.5.16: Spekulatives Decoding wird dynamischer – das Upgrade ist trotzdem kein Selbstläufer
Artikel lesen →: SGLang 0.5.16: Spekulatives Decoding wird dynamischer – das Upgrade ist trotzdem kein SelbstläuferSGLang 0.5.16 bringt confidence-gesteuertes speculative decoding. Für Betreiber zählen mindestens genauso die entfernten Quantisierungspfade, neue Defaults und umbenannte Flags.
Verfasst von
-
NVIDIA ModelExpress: Warum GPU-zu-GPU-Weight-Transfer LLM-Scale-outs beschleunigen soll
Artikel lesen →: NVIDIA ModelExpress: Warum GPU-zu-GPU-Weight-Transfer LLM-Scale-outs beschleunigen sollNVIDIA will mit ModelExpress einen Engpass adressieren, der beim Betrieb sehr großer Sprachmodelle schnell teurer wird als ein einzelner Request: das wiederholte Laden identischer Gewichte. Statt jede neue …
Verfasst von
-
vLLM 0.26.0: KV-Cache-Tiering wird zur Betriebsfrage für LLM-Inferenz
Artikel lesen →: vLLM 0.26.0: KV-Cache-Tiering wird zur Betriebsfrage für LLM-InferenzvLLM 0.26.0 macht aus dem KV-Cache eine explizite Betriebsarchitektur. Das am 25. Juli veröffentlichte Release erweitert Offloading und sekundäre Storage-Tiers bis hin zu einem Object Store mit Workload …
Verfasst von
-
Ollama 0.32.3: Windows on ARM erhält CUDA, Tool-Calls werden robuster
Artikel lesen →: Ollama 0.32.3: Windows on ARM erhält CUDA, Tool-Calls werden robusterOllama 0.32.3 erweitert die lokale LLM-Runtime an drei Stellen, die im Betrieb zählen: CUDA läuft nun auf Windows ARM64, GLM-Tool-Calls gehen am Generierungsende nicht mehr verloren, und Downloads …
Verfasst von
-
GitHub macht MCP stateless: Was das für Remote-Toolserver ändert
Artikel lesen →: GitHub macht MCP stateless: Was das für Remote-Toolserver ändertGitHub stellt seinen MCP-Server bereits auf den nächsten, zustandsfreien Protokollkern um. Der praktische Punkt dahinter: Remote-Toolserver können ohne Session-Speicher im Request-Pfad laufen – und Logging sowie Secret Scanning …
Verfasst von
-
Gemini 3.6 Flash: Warum der Tokenpreis bei KI-Agenten in die Irre führt
Artikel lesen →: Gemini 3.6 Flash: Warum der Tokenpreis bei KI-Agenten in die Irre führtDer Tokenpreis sagt wenig über echte Agentenkosten. Gemini 3.6 Flash zeigt, warum Teams Tool-Calls, Retries und Kosten pro erfolgreichem Task messen sollten.
Verfasst von
-
Solar Open 2: Was 15B aktive Parameter für Self-Hosted Agenten bedeuten
Artikel lesen →: Solar Open 2: Was 15B aktive Parameter für Self-Hosted Agenten bedeutenUpstage veröffentlicht Solar Open 2 mit 250B Gesamt- und 15B aktiven MoE-Parametern. Entscheidend für Teams: die praktische Self-Hosting-Prüfung.
Verfasst von









