Artikel
-
NVIDIA Switchyard v0.2.0: Multi-LLM-Routing wird zum Gateway-Betrieb
Artikel lesen →: NVIDIA Switchyard v0.2.0: Multi-LLM-Routing wird zum Gateway-BetriebNVIDIA Switchyard v0.2.0 bringt einen nativen Rust-Server für OpenAI- und Anthropic-kompatibles Multi-LLM-Routing — inklusive Telemetrie, aber mit klaren Pre-Alpha-Grenzen.
-
Needle 2: Ein 14-MB-Modell macht Tool Calls zu Edge-Inferenz
Artikel lesen →: Needle 2: Ein 14-MB-Modell macht Tool Calls zu Edge-InferenzNeedle 2 verdichtet eine sehr konkrete Agentenaufgabe auf 14 MB: Das neue, offen lizenzierte Modell von Cactus Compute soll Tool Calls, Geräteaktionen und strukturierte Extraktion direkt auf kleinen …
-
LiteLLM 1.96.0: Wer MCP-Tools aufrufen darf, wird Gateway-Policy
Artikel lesen →: LiteLLM 1.96.0: Wer MCP-Tools aufrufen darf, wird Gateway-PolicyLiteLLM 1.96.0 zieht eine schärfere Grenze um MCP-Toolaufrufe: Das Gateway kann Berechtigungen pro Nutzer durchsetzen und Tool-Ergebnisse erst nach dem Call gegen Guardrails prüfen. Für Teams mit MCP …
-
Langfuse 4.7.0: Tool-Freigaben werden zum Audit Trail für Agenten
Artikel lesen →: Langfuse 4.7.0: Tool-Freigaben werden zum Audit Trail für AgentenLangfuse 4.7.0 erweitert die Agenten-Telemetrie um Tool-Freigaben und schließt zugleich zwei Sicherheitslücken, die für Self-Hosted-Installationen relevant sind. Das am 11. August veröffentlichte Release ist damit weniger ein kosmetisches …
-
vLLM 0.27.0: Fault Tolerance und Hybrid-P/D machen Inference-Flotten belastbarer
Artikel lesen →: vLLM 0.27.0: Fault Tolerance und Hybrid-P/D machen Inference-Flotten belastbarervLLM 0.27.0 bringt Fault Tolerance für verteilte MoE-Deployments, neue Prefill/Decode-Pfade und ein Breaking Runtime-Upgrade. Was Betreiber jetzt prüfen sollten.
-
llama.cpp bringt Granite-Switch lokal: LoRA-Adapter pro Token umschalten
Artikel lesen →: llama.cpp bringt Granite-Switch lokal: LoRA-Adapter pro Token umschaltenllama.cpp kann jetzt einen Modelltyp laden, bei dem ein einzelnes Steuer-Token einen eingebetteten LoRA-Adapter auswählt. Das klingt nach einem Detail im Modellformat. Für lokale Inference ist es aber …
-
Meta Muse Glimmer: Lokale multimodale Agenten bekommen einen offenen 30B-Stack
Artikel lesen →: Meta Muse Glimmer: Lokale multimodale Agenten bekommen einen offenen 30B-StackMeta hat mit Muse Glimmer ein offen lizenziertes multimodales 30B-Modell veröffentlicht, das lokale Agenten nicht nur als Demo, sondern als vollständigen Laufzeit-Stack adressiert: Bild-Input, Tool-Aufrufe, 131k Kontext, Quantisierung …
-
OpenAI verschärft Sicherheitskontrollen für Astra nach Cyber-Evaluierung
Artikel lesen →: OpenAI verschärft Sicherheitskontrollen für Astra nach Cyber-EvaluierungOpenAI hat die Arbeit an Teilen seines noch unveröffentlichten Modells „Astra“ pausiert, weil die vorläufige Cyber-Evaluierung eine kritische Fähigkeitsstufe nicht sicher ausschließen konnte. Wichtig ist die Formulierung: Das …
-
Anthropic ergänzt Managed Agents um Sitzungsbudgets und Standort-Pinning
Artikel lesen →: Anthropic ergänzt Managed Agents um Sitzungsbudgets und Standort-PinningAnthropic hat in seinen offiziellen SDKs Unterstützung für Sitzungsbudgets, festgelegte Inferenzstandorte und das automatische Laden von Skills aus GitHub ergänzt. Das ist kein neues Claude-Modell, aber ein bemerkenswerter …
-
GitHub Copilot Code Review: Review-Tiefe wird zur organisationsweiten Policy
Artikel lesen →: GitHub Copilot Code Review: Review-Tiefe wird zur organisationsweiten PolicyGitHub Copilot Code Review bekommt eine organisationsweite Stellschraube für Review-Tiefe. Mit dem GA-Release von Lite und Balanced kann ein Team den Standard für seine Repositories festlegen und ihn …