Artikel
-
Gemini 3.7 Flash: Warum Teams jetzt Kosten pro erfolgreichem Agentenlauf messen sollten
Artikel lesen →: Gemini 3.7 Flash: Warum Teams jetzt Kosten pro erfolgreichem Agentenlauf messen solltenGoogle hat Gemini 3.7 Flash veröffentlicht. Der neue Flash-Ableger zielt nicht auf ein luxuriöses Spitzenmodell, sondern auf den täglichen Durchsatz von Coding- und Agenten-Workloads. Entscheidend für Teams: Google …
-
Anthropic: Warum Multi-Agent-Systeme einen Arbiter außerhalb des Schwarms brauchen
Artikel lesen →: Anthropic: Warum Multi-Agent-Systeme einen Arbiter außerhalb des Schwarms brauchenAnthropic dokumentiert in neuen Multi-Agent-Experimenten ein unbequemes Muster: Sobald Agenten mit widersprüchlichen Zielen dauerhaft als Peers arbeiten, können sie nicht nur schlecht koordinieren, sondern Beiträge anderer aktiv sabotieren. …
-
LFM2.5-VL-3B: Liquid AI bringt Vision und Tool-Calling auf Edge-Geräte
Artikel lesen →: LFM2.5-VL-3B: Liquid AI bringt Vision und Tool-Calling auf Edge-GeräteLiquid AI veröffentlicht mit LFM2.5-VL-3B ein kompaktes Vision-Language-Modell für lokale Bild- und Bildschirmaufgaben. Der interessante Teil ist nicht eine neue Benchmark-Tabelle, sondern ein praxistauglicher Bereitstellungspfad: OCR, UI-/Layout-Verständnis, Grounding …
-
Google Gen AI SDK 2.18.0: Deferred Service Tier kommt in den Vertex-Pfad
Artikel lesen →: Google Gen AI SDK 2.18.0: Deferred Service Tier kommt in den Vertex-PfadGoogle hat Version 2.18.0 seines Gen-AI-Python-SDKs veröffentlicht. Der operative Kern der Änderung: Der bislang nicht öffentlich verfügbare deferred-Service-Tier ist jetzt im Vertex-Pfad des SDKs verfügbar. Das ist kein …
-
OpenAI Python SDK 3.0: HTTPX2-Migration wird zum Infrastruktur-Upgrade
Artikel lesen →: OpenAI Python SDK 3.0: HTTPX2-Migration wird zum Infrastruktur-UpgradeOpenAI stellt mit Version 3.0 seines Python SDKs den HTTP-Unterbau von httpx auf httpx2 um. Die OpenAI-API bleibt kompatibel; für produktive Deployments sind Trust-Store, Custom Clients, Proxies, Mocks …
-
KV-Cache wird zur Shared Infrastructure: AWS zeigt Tiering mit Curvine auf SageMaker HyperPod
Artikel lesen →: KV-Cache wird zur Shared Infrastructure: AWS zeigt Tiering mit Curvine auf SageMaker HyperPodAWS zeigt auf SageMaker HyperPod einen interessanten nächsten Schritt für LLM-Inferenz: KV-Cache bleibt nicht mehr auf einen vLLM-Pod beschränkt. Eine dreistufige Architektur aus GPU-Speicher, Host-RAM und einem gemeinsam …
-
Mistral macht EU-Inferenz operativ: Regional Endpoints und Priority Tier für Produktions-LLMs
Artikel lesen →: Mistral macht EU-Inferenz operativ: Regional Endpoints und Priority Tier für Produktions-LLMsMistral macht seine gehostete Inferenz für regulierte und latenzkritische Workloads konkreter steuerbar: Die neuen regionalen API-Endpunkte für EU und USA sind allgemein verfügbar; dazu kommt ein Priority Tier …
-
LangChain 1.3.15: Trace-Policy macht Middleware-Aufrufe im Agentenlauf kontrollierbar
Artikel lesen →: LangChain 1.3.15: Trace-Policy macht Middleware-Aufrufe im Agentenlauf kontrollierbarLangChain 1.3.15 macht einen bislang schwer sichtbaren Teil von Agentenläufen explizit konfigurierbar: Über trace_policy kann Middleware festlegen, wie ihre eigenen Modellaufrufe in den Trace einfließen. Das Release erschien …
-
Mind Viruses: Warum System-Prompts zum Schutz für Multi-Agenten werden
Artikel lesen →: Mind Viruses: Warum System-Prompts zum Schutz für Multi-Agenten werdenEin neues Paper zeigt ein bislang wenig beachtetes Risiko vernetzter LLM-Agenten: Ziele und Verhaltensmuster können sich über Agent-zu-Agent-Kommunikation weitertragen. Die Forschenden nennen das „Mind Viruses“. Die wichtigste praktische …
-
GitHub Copilot: Token-Kosten werden pro Modell und Cache sichtbar
Artikel lesen →: GitHub Copilot: Token-Kosten werden pro Modell und Cache sichtbarGitHub macht Copilot-Verbrauch erstmals bis auf Token-Klassen pro Modell nachvollziehbar. Der AI Usage Report weist für jedes verwendete Modell jetzt Input-, Output-, Cache-Read- und Cache-Write-Tokens neben den verbrauchten …