Artikel
-
NVIDIA NOOA: Warum Agenten als Python-Objekte statt Workflow-Graphen zählen
Artikel lesen →: NVIDIA NOOA: Warum Agenten als Python-Objekte statt Workflow-Graphen zählenNVIDIA Labs hat mit NOOA eine Open-Source-Research-Preview für Agenten veröffentlicht, die einen ungewohnten Schwerpunkt setzt: Der Agent ist ein Python-Objekt. Das ist kein Ersatz für jedes Orchestrierungsframework – …
-
NVIDIA Nemotron 3 Ultra: Was agentisches RTL-Coding für Verifikationsteams verändert
Artikel lesen →: NVIDIA Nemotron 3 Ultra: Was agentisches RTL-Coding für Verifikationsteams verändertNVIDIA meldet 97,1 % Pass Rate für ACE-RTL mit Nemotron 3 Ultra. Relevant ist weniger der Benchmarkwert als die geschlossene Verifikationsschleife aus Generieren, Testen und Reflexion.
-
Ollama 0.32.4: Warum Quantisierung jetzt zur Apple-Silicon-Betriebsfrage wird
Artikel lesen →: Ollama 0.32.4: Warum Quantisierung jetzt zur Apple-Silicon-Betriebsfrage wirdOllama 0.32.4 räumt gleich an drei Stellen auf, die für lokale Inferenz auf Apple Silicon relevant sind: Die Runtime unterstützt Laguna über die MLX-Engine, erstellt Output-Heads für Speculative-Decoding-Drafts …
-
SGLang 0.5.16: Spekulatives Decoding wird dynamischer – das Upgrade ist trotzdem kein Selbstläufer
Artikel lesen →: SGLang 0.5.16: Spekulatives Decoding wird dynamischer – das Upgrade ist trotzdem kein SelbstläuferSGLang 0.5.16 bringt confidence-gesteuertes speculative decoding. Für Betreiber zählen mindestens genauso die entfernten Quantisierungspfade, neue Defaults und umbenannte Flags.
-
NVIDIA ModelExpress: Warum GPU-zu-GPU-Weight-Transfer LLM-Scale-outs beschleunigen soll
Artikel lesen →: NVIDIA ModelExpress: Warum GPU-zu-GPU-Weight-Transfer LLM-Scale-outs beschleunigen sollNVIDIA will mit ModelExpress einen Engpass adressieren, der beim Betrieb sehr großer Sprachmodelle schnell teurer wird als ein einzelner Request: das wiederholte Laden identischer Gewichte. Statt jede neue …
-
vLLM 0.26.0: KV-Cache-Tiering wird zur Betriebsfrage für LLM-Inferenz
Artikel lesen →: vLLM 0.26.0: KV-Cache-Tiering wird zur Betriebsfrage für LLM-InferenzvLLM 0.26.0 macht aus dem KV-Cache eine explizite Betriebsarchitektur. Das am 25. Juli veröffentlichte Release erweitert Offloading und sekundäre Storage-Tiers bis hin zu einem Object Store mit Workload …
-
Qwen Code 0.21.0: Warum persistente Agents und Secret-Grenzen für MCP-Workspaces zählen
Artikel lesen →: Qwen Code 0.21.0: Warum persistente Agents und Secret-Grenzen für MCP-Workspaces zählenQwen Code 0.21.0 verschiebt den Schwerpunkt eines Coding-Agenten vom einzelnen CLI-Lauf zur dauerhaften Laufzeit: Abgeschlossene Background-Agents bleiben erhalten, ihre Liste kann wiederhergestellt werden, und der Server kann MCP-Verbindungen …
-
Claude Opus 5: Was 1 Million Token Kontext und neue API-Fallbacks für Agenten ändern
Artikel lesen →: Claude Opus 5: Was 1 Million Token Kontext und neue API-Fallbacks für Agenten ändernClaude Opus 5 ist seit dem 24. Juli verfügbar – und die wichtigere Nachricht für Teams ist nicht allein das neue Flaggschiff: Anthropic koppelt den Modellwechsel an zwei …
-
Langfuse v4 RC: Zwei Sicherheitsfixes, die Self-Hosted-Teams sofort prüfen sollten
Artikel lesen →: Langfuse v4 RC: Zwei Sicherheitsfixes, die Self-Hosted-Teams sofort prüfen solltenLangfuse v4.0.0-rc.2 beseitigt zwei Fehler, die bei selbst betriebenen LLM-Observability-Stacks direkt an die Credential-Grenze gehen: Public-API-Payloads konnten vor Validierung oder Verschlüsselung in JSON-Debug-Logs landen; außerdem konnten bei einem …
-
Ollama 0.32.3: Windows on ARM erhält CUDA, Tool-Calls werden robuster
Artikel lesen →: Ollama 0.32.3: Windows on ARM erhält CUDA, Tool-Calls werden robusterOllama 0.32.3 erweitert die lokale LLM-Runtime an drei Stellen, die im Betrieb zählen: CUDA läuft nun auf Windows ARM64, GLM-Tool-Calls gehen am Generierungsende nicht mehr verloren, und Downloads …