LLM News
Aktuelle LLM- und KI-News: Releases, Infrastruktur, Modelle und die operative Einordnung für Teams.
-
o
Artikel lesen → : oHugging Face zeigt: Kleine Open Models tragen die Hub-Nutzung. Was das für geprüfte Runtimes, Quantisierung und lokale Inferenz bedeutet.
-
Ollama 0.32.15: Metadaten-Cache senkt Request-Overhead
Artikel lesen →: Ollama 0.32.15: Metadaten-Cache senkt Request-OverheadKurz gesagt: Ollama 0.32.15 entfernt einen wiederkehrenden Overhead vor der Inferenz. Der neue Cache hält aufgelöste GGUF-Modellmetadaten und Capabilities vor; laut Ollamas eigenem Benchmark sank die mittlere Time …
-
Langfuse 4.15 schützt Sandbox-Logs vor Tool-Payloads
Artikel lesen →: Langfuse 4.15 schützt Sandbox-Logs vor Tool-PayloadsLangfuse 4.15 reduziert eine heikle Nebenwirkung agentischer Sandboxes: Runtime-Logs sollen keine Dateiinhalte, Shell-Kommandos, stdout oder stderr mehr enthalten. Für Teams, die Coding- oder Browser-Agenten instrumentieren, ist das kein …
-
Qwen3.8-27B: Multimodale Agentenfähigkeit wird zur Open-Weight-Option
Artikel lesen →: Qwen3.8-27B: Multimodale Agentenfähigkeit wird zur Open-Weight-OptionQwen bündelt Vision, Videoverständnis und steuerbares Reasoning in einem Apache-2.0-Modell mit 27B Parametern. Was Teams vor einem Self-Hosting-Rollout messen sollten.
-
Claude Code 2.1.233: Memory-Limits und NTLM-Schutz für Coding Agents
Artikel lesen →: Claude Code 2.1.233: Memory-Limits und NTLM-Schutz für Coding AgentsClaude Code 2.1.233 bringt zwei Änderungen, die für Teams mit Coding Agents deutlich wichtiger sind als die Versionsnummer vermuten lässt: begrenzbaren Speicher für Bash-Tool-Commands unter Linux und einen …
-
OpenAI Python SDK 3.1: Stream-IDs machen Realtime-Agenten besser beobachtbar
Artikel lesen →: OpenAI Python SDK 3.1: Stream-IDs machen Realtime-Agenten besser beobachtbarOpenAI Python 3.1.0 ergänzt Stream-IDs, strukturierte MCP-Elemente und Workload-Identity-Events. Warum das für Realtime-Agenten vor allem ein Observability-Update ist.
-
Ollama 0.32.11: Web Search bringt Recherche in die Responses-API
Artikel lesen →: Ollama 0.32.11: Web Search bringt Recherche in die Responses-APIKurz gesagt: Mit Ollama 0.32.11 erhält die OpenAI-kompatible Responses API Web Search. Das ist für lokale oder selbst kontrollierte Modell-Backends vor allem ein Integrationssignal: Anwendungen können Recherche als …
-
Gemini 3.7 Flash: Warum Teams jetzt Kosten pro erfolgreichem Agentenlauf messen sollten
Artikel lesen →: Gemini 3.7 Flash: Warum Teams jetzt Kosten pro erfolgreichem Agentenlauf messen solltenGoogle hat Gemini 3.7 Flash veröffentlicht. Der neue Flash-Ableger zielt nicht auf ein luxuriöses Spitzenmodell, sondern auf den täglichen Durchsatz von Coding- und Agenten-Workloads. Entscheidend für Teams: Google …
-
Anthropic: Warum Multi-Agent-Systeme einen Arbiter außerhalb des Schwarms brauchen
Artikel lesen →: Anthropic: Warum Multi-Agent-Systeme einen Arbiter außerhalb des Schwarms brauchenAnthropic dokumentiert in neuen Multi-Agent-Experimenten ein unbequemes Muster: Sobald Agenten mit widersprüchlichen Zielen dauerhaft als Peers arbeiten, können sie nicht nur schlecht koordinieren, sondern Beiträge anderer aktiv sabotieren. …
-
LFM2.5-VL-3B: Liquid AI bringt Vision und Tool-Calling auf Edge-Geräte
Artikel lesen →: LFM2.5-VL-3B: Liquid AI bringt Vision und Tool-Calling auf Edge-GeräteLiquid AI veröffentlicht mit LFM2.5-VL-3B ein kompaktes Vision-Language-Modell für lokale Bild- und Bildschirmaufgaben. Der interessante Teil ist nicht eine neue Benchmark-Tabelle, sondern ein praxistauglicher Bereitstellungspfad: OCR, UI-/Layout-Verständnis, Grounding …