Artikel
-
llama.cpp: GLM-5.2 nutzt seinen MTP-Head für lokales Speculative Decoding
Artikel lesen →: llama.cpp: GLM-5.2 nutzt seinen MTP-Head für lokales Speculative Decodingllama.cpp kann den in GLM-5.2 vorhandenen NextN-/MTP-Head jetzt als integrierten Draft-Decoder einsetzen. Das ist für lokale Inferenz interessanter als ein gewöhnlicher Release-Note-Eintrag: Statt ein zweites, kleineres Modell für …
-
Grok 4.5 in GitHub Copilot: 500K Kontext macht Evaluierung und Kostenkontrolle zur Betriebsfrage
Artikel lesen →: Grok 4.5 in GitHub Copilot: 500K Kontext macht Evaluierung und Kostenkontrolle zur BetriebsfrageGitHub rollt Grok 4.5 in Copilot aus – doch die operative Neuigkeit ist nicht allein das große Kontextfenster. Für Copilot Business und Enterprise ist das Modell standardmäßig gesperrt. …
-
Gemini API: Managed Agents bekommen Hooks, Budgets und Zeitpläne
Artikel lesen →: Gemini API: Managed Agents bekommen Hooks, Budgets und ZeitpläneGoogle erweitert Managed Agents in der Gemini API um drei Funktionen, die für produktive Agenten wichtiger sind als ein weiterer Modellwechsel: Hooks an der Tool-Grenze, Kostenbudgets und zeitgesteuerte …
-
Claude findet Schwächen in PQC-Signaturen: Die Kostenkurve der Kryptanalyse verschiebt sich
Artikel lesen →: Claude findet Schwächen in PQC-Signaturen: Die Kostenkurve der Kryptanalyse verschiebt sichAnthropic meldet neue Angriffe auf HAWK und reduziertes AES. Produktionssysteme sind nicht betroffen – relevant ist die neue Kostenkurve KI-gestützter Kryptanalyse.
-
LiteLLM 1.94.0: Team-Keys erzwingen jetzt persönliche Budgets
Artikel lesen →: LiteLLM 1.94.0: Team-Keys erzwingen jetzt persönliche BudgetsLiteLLM 1.94.0 erzwingt persönliche max_budget-Limits auch bei Team-Keys und schließt einen Debug-Log-Pfad für Virtual Keys. Was Gateway-Teams jetzt testen sollten.
-
Liquid AI LFM2.5-Encoder: Warum Long-Context-NLP auf CPU wieder eine Architekturentscheidung ist
Artikel lesen →: Liquid AI LFM2.5-Encoder: Warum Long-Context-NLP auf CPU wieder eine Architekturentscheidung istLiquid AI veröffentlicht zwei Long-Context-Encoder für CPU-Betrieb. Warum spezialisierte Modelle die LLM-Kostenarchitektur bei Klassifikation und Triage verändern können.
-
MCP Python SDK 2.0: Warum ein Dependency-Update jetzt zum Protokoll-Migrationsprojekt wird
Artikel lesen →: MCP Python SDK 2.0: Warum ein Dependency-Update jetzt zum Protokoll-Migrationsprojekt wirdMCP Python SDK 2.0 ist stabil. Weil pip nun automatisch 2.x installiert, wird ein Dependency-Update für viele MCP-Server zur planbaren Migration.
-
NVIDIA Cosmos-H-Dreams: Warum 160 fps generative Simulation für Operationsrobotik verändert
Artikel lesen →: NVIDIA Cosmos-H-Dreams: Warum 160 fps generative Simulation für Operationsrobotik verändertNVIDIA stellt mit Cosmos-H-Dreams eine Forschungsplattform für generative Echtzeit-Simulationen in der chirurgischen Robotik vor. Der interessante Teil ist nicht ein weiterer medizinischer Assistent, sondern der Inferenzpfad: Ein aus …
-
Open WebUI 0.11.0: Sub-Agents machen die lokale LLM-Oberfläche zur Agenten-Runtime
Artikel lesen →: Open WebUI 0.11.0: Sub-Agents machen die lokale LLM-Oberfläche zur Agenten-RuntimeOpen WebUI 0.11.0 führt steuerbare Sub-Agents ein. Warum das für Self-Hosted-Teams eine neue Betriebs- und Sicherheitsfläche schafft.
-
MAI-Cyber-1 Flash: Warum agentische Security jetzt an Freigabegrenzen scheitert
Artikel lesen →: MAI-Cyber-1 Flash: Warum agentische Security jetzt an Freigabegrenzen scheitertMicrosoft kombiniert mit MAI-Cyber-1 Flash ein eigenes Security-Modell und eine agentische Sicherheitsplattform. Entscheidend ist nicht, ob ein Agent einen Finding zusammenfassen kann, sondern welche Rechte er im Ernstfall …