Artikel
-
Cloudflare Agents: Agent-Traces werden zur Betriebsansicht statt zum Log-Dump
Artikel lesen →: Cloudflare Agents: Agent-Traces werden zur Betriebsansicht statt zum Log-DumpCloudflare baut Agent-Observability als eigene Betriebsansicht aus. Eine neue Agents-Ansicht im Dashboard bündelt beobachtete Agenten, Traces, Runs, Sessions, Instanzen und gemeldete Token-Nutzung. Der entscheidende Unterschied zu einem gewöhnlichen …
-
llama.cpp b10256: Intel-Arc-SYCL-Prefill gewinnt 9,4 Prozent – im engen Benchmark
Artikel lesen →: llama.cpp b10256: Intel-Arc-SYCL-Prefill gewinnt 9,4 Prozent – im engen Benchmarkllama.cpp erweitert seinen SYCL-Pfad für Intel-GPUs um einen parallelisierten Kernel für nicht-kontiguierliche Concat-Operationen. Der neue Release b10256 misst auf einer Arc Pro B70 beim Prefill eines quantisierten Qwen3.6-27B-Modells …
-
URL-Routing im AI-Gateway: Warum Provider-Keys nicht mitdürfen
Artikel lesen →: URL-Routing im AI-Gateway: Warum Provider-Keys nicht mitdürfenLiteLLM 1.95.0 behebt ein sicherheitsrelevantes Routing-Problem: Bei URL-basierten Modelldestinationen und Fallbacks sollen Provider-Credentials nicht mehr potenziell an ein Ziel weitergereicht werden, das über eine URL konfiguriert ist. Die …
-
Cloudflare Computer: Warum Agenten einen Workspace statt eines Containers brauchen
Artikel lesen →: Cloudflare Computer: Warum Agenten einen Workspace statt eines Containers brauchenCloudflare stellt mit @cloudflare/computer eine Agenten-Runtime vor, die Workspace und Compute trennt: Isolates als Default, Container als Werkzeug.
-
Langfuse 4.3.0: Semantic Roots werden zur API-Dimension
Artikel lesen →: Langfuse 4.3.0: Semantic Roots werden zur API-DimensionLangfuse 4.3.0 macht eine zusätzliche Struktur aus der Trace-Auswertung für Integrationen nutzbar: Die v2-API exponiert jetzt semantic roots in den Metrics. Das ist kein neues Modell-Feature, aber ein …
-
llama.cpp: MTP macht Qwen3-Next und DeepSeek V3.2 lokal schneller
Artikel lesen →: llama.cpp: MTP macht Qwen3-Next und DeepSeek V3.2 lokal schnellerllama.cpp kann jetzt die Multi-Token-Prediction-(MTP-)Schichten von Qwen3-Next und DeepSeek V3.2 nutzen. Die am 3. August veröffentlichten Builds b10237 und b10238 machen damit eine im Modell vorhandene Decoding-Optimierung im …
-
llama.cpp b10227: Qwen3-Tool-Calls robuster parsen
Artikel lesen →: llama.cpp b10227: Qwen3-Tool-Calls robuster parsenllama.cpp b10227 schärft den Qwen3-Chat-Parser für einen unangenehmen Edge Case: Ein Modell kann nach einem <think>-Block einen Tool-Aufruf ausgeben – teils ohne erwarteten <tool_call>-Wrapper. Der neue spezialisierte Parser …
-
Pydantic AI 2.22: Gemini-Tool-Calls werden standardmäßig validiert
Artikel lesen →: Pydantic AI 2.22: Gemini-Tool-Calls werden standardmäßig validiertPydantic AI 2.22 setzt bei unterstützten Gemini-Modellen auf validierte Tool-Aufrufe. Warum das nur eine von vier nötigen Kontrollschichten für Agenten ist.
-
OpenAI: Content-Provenance-Prüfung wird zum API-Schritt
Artikel lesen →: OpenAI: Content-Provenance-Prüfung wird zum API-SchrittOpenAI ergänzt einen API-Check für Content-Provenance. Für Upload-Pipelines ist das ein prüfbarer Kontrollpunkt – aber kein universeller KI-Detektor.
-
DeepSeek V4-Flash-0731: Agenten-Upgrade ohne API-Migration
Artikel lesen →: DeepSeek V4-Flash-0731: Agenten-Upgrade ohne API-MigrationDeepSeek hat V4-Flash-0731 veröffentlicht und den bestehenden API-Namen deepseek-v4-flash auf den neuen Stand gehoben. Für Teams ist das bemerkenswert weniger wegen eines weiteren Modellnamens als wegen der Betriebslogik: …