Artikel
-
NVIDIAs Attention-Checkliste: Bei 128K Kontext werden 85 Prozent Prefill zur Architekturfrage
Artikel lesen →: NVIDIAs Attention-Checkliste: Bei 128K Kontext werden 85 Prozent Prefill zur ArchitekturfrageNVIDIA macht eine nüchterne, aber wichtige Ansage für Long-Context-Inferenz: Bei DeepSeek-R1 stieg im eigenen Prefill-Profil der Anteil von Attention von 18 % bei 4K auf 85 % bei 128K Kontext. …
-
Microsoft Echoverse: Der Test für Computer-Use-Agenten heißt Zustand
Artikel lesen →: Microsoft Echoverse: Der Test für Computer-Use-Agenten heißt ZustandMicrosoft veröffentlicht mit Echoverse offene, zustandsbehaftete Trainingswelten. Für Computer-Use-Agenten wird damit der nachweisbare Endzustand wichtiger als die Klickspur.
-
llama.cpp: MoE-Inferenz auf ZenDNN wird weniger fragmentiert – SYCL schließt zwei Lücken
Artikel lesen →: llama.cpp: MoE-Inferenz auf ZenDNN wird weniger fragmentiert – SYCL schließt zwei Lückenllama.cpp hat in seinen Releases b10203 bis b10205 drei kleine, aber für lokale Inferenz relevante Runtime-Änderungen ausgeliefert: ZenDNN führt die Matrixmultiplikation aktiver MoE-Experten künftig gebündelt aus; der SYCL-Backend-Pfad …
-
Langfuse 4.2: Große Agenten-Traces aus dem Ingestion-Pfad auslagern
Artikel lesen →: Langfuse 4.2: Große Agenten-Traces aus dem Ingestion-Pfad auslagernLangfuse 4.2 löst kein Datenvolumen-Problem pauschal, aber es entschärft einen besonders unangenehmen Ingestion-Fall: Übergroße Eingabe-, Ausgabe- und einzelne Metadatenfelder können im neuen direkten Event-Pfad in Media ausgelagert werden. …
-
GPT-5.6: Neue Preise und Fast Mode machen Modellrouting zur FinOps-Aufgabe
Artikel lesen →: GPT-5.6: Neue Preise und Fast Mode machen Modellrouting zur FinOps-AufgabeOpenAI hat Priority Processing am 30. Juli in „Fast mode“ umbenannt und die GPT-5.6-Preisstaffeln sichtbar nach Modell und Verarbeitungsmodus gegliedert. Für API-Teams ist das ein kleines, aber konkretes …
-
Claude in Cyber-Evals: Drei Vorfälle machen Netzwerkisolation zur Prüfpflicht
Artikel lesen →: Claude in Cyber-Evals: Drei Vorfälle machen Netzwerkisolation zur PrüfpflichtAnthropic hat drei reale Sicherheitsvorfälle aus Cybersecurity-Evaluierungen von Claude offengelegt. Der kritische Fehler lag nicht in einer neuen, geheimen Angriffstechnik, sondern in einer falsch isolierten Testumgebung: Modelle konnten …
-
Gemini Robotics ER 2: Warum Fortschrittserkennung den Robotik-Stack API-fähig macht
Artikel lesen →: Gemini Robotics ER 2: Warum Fortschrittserkennung den Robotik-Stack API-fähig machtGoogle DeepMind macht Gemini Robotics ER 2 über die Gemini API und Google AI Studio verfügbar. Der relevante Schritt für Entwickler ist nicht die nächste Greif-Demo, sondern ein …
-
GPT-5.6 Sol: Wann 1,05 Millionen Token Kontext Retrieval wirklich ersetzen
Artikel lesen →: GPT-5.6 Sol: Wann 1,05 Millionen Token Kontext Retrieval wirklich ersetzenOpenAI positioniert GPT-5.6 Sol nicht nur als neues Spitzenmodell, sondern als API-Modell für Arbeitsläufe, in denen Kontext selbst zum Architekturbaustein wird. Das veröffentlichte Kontextfenster von 1.050.000 Token verschiebt …
-
OmegaUse-OfficeVal: Büro-Agenten werden an Ergebnisqualität und Kosten gemessen
Artikel lesen →: OmegaUse-OfficeVal: Büro-Agenten werden an Ergebnisqualität und Kosten gemessenDer neue OmegaUse-OfficeVal-Benchmark bewertet KI-Agenten für Office-Workflows nach nutzbaren Ergebnisartefakten, menschlicher Arbeitszeit und Preis-Proxys – nicht nur nach Task Completion.
-
Langfuse v4: Warum das Observability-Upgrade ein Migrationsprojekt ist
Artikel lesen →: Langfuse v4: Warum das Observability-Upgrade ein Migrationsprojekt istLangfuse v4 ist kein kosmetisches Observability-Release. Die heute veröffentlichte Major-Version ersetzt bei Self-Hosted-Installationen den Kern des Lese- und Ingestion-Modells. Neue Suche, Alerts und schnellere APIs sind attraktiv; der …