Artikel
-
Local vs Cloud Check (Teil 2): Kosten, Latenz und der reale Break-even
Artikel lesen →: Local vs Cloud Check (Teil 2): Kosten, Latenz und der reale Break-evenSerien-Navigation · Local vs Cloud Check Teil 1 · Teil 2 · Teil 3 Serie: Local vs Cloud Check (Teil 2 von 3) Teil 2 vertieft Kosten-, Latenz- …
-
Serie MCP im Enterprise (Teil 1): Vom Agenten-Hype zur Infrastruktur
Artikel lesen →: Serie MCP im Enterprise (Teil 1): Vom Agenten-Hype zur InfrastrukturSerien-Navigation · MCP im Enterprise Teil 1 (aktuell) · Teil 2 (in Arbeit) · Teil 3 (in Arbeit) Zur Serienübersicht → Serie: MCP im Enterprise-Betrieb (Teil 1 von …
-
Microsoft veröffentlicht Agent Governance Toolkit für autonome AI-Agenten
Artikel lesen →: Microsoft veröffentlicht Agent Governance Toolkit für autonome AI-AgentenAutonome Agenten können heute nicht nur chatten, sondern reale Aktionen auslösen: Tools aufrufen, Workflows starten, Infrastruktur anfassen. Genau dort liegt das Risiko – und genau dort setzt Microsofts …
-
MLPerf Inference v6.0 zeigt, wo Inference-Stacks jetzt wirklich gewinnen
Artikel lesen →: MLPerf Inference v6.0 zeigt, wo Inference-Stacks jetzt wirklich gewinnenInference-Benchmarks sind nicht sexy — aber sie entscheiden gerade, welche AI-Stacks in Produktion bestehen. Mit MLPerf Inference v6.0 hat MLCommons diese Woche die bislang größte Überarbeitung der Suite …
-
Gemma 4 macht Local-First plötzlich enterprise-tauglich
Artikel lesen →: Gemma 4 macht Local-First plötzlich enterprise-tauglichGoogle hat mit Gemma 4 ein Update veröffentlicht, das für Teams mit Local-/Edge-Fokus mehr ist als nur ein Modell-Refresh. Der eigentliche Hebel ist die Kombination aus zwei Dingen: …
-
Inference wird zum Betriebssystem: Dynamo, 1M-Context-Shift, Runtime-Routing
Artikel lesen →: Inference wird zum Betriebssystem: Dynamo, 1M-Context-Shift, Runtime-RoutingDie letzten Tage zeigen ein klares Muster: Der LLM-Markt liefert weniger „Big Bang“-Modelle, dafür deutlich mehr produktionsnahe Infrastruktur und Runtime-Änderungen. Für Teams heißt das: weniger Hype-Slides, mehr Betriebsdisziplin. …
-
Serie LLM Ops Stack (Teil 1): Basis für produktiven Betrieb
Artikel lesen →: Serie LLM Ops Stack (Teil 1): Basis für produktiven BetriebStand: April 2026 In den letzten Monaten habe ich viel damit gearbeitet, lokale LLMs von „läuft auf meinem Rechner“ auf „läuft stabil im Alltag“ zu bringen. Der Unterschied…
-
Homelab Setup: Docker + Monitoring in 60 Minuten
Artikel lesen →: Homelab Setup: Docker + Monitoring in 60 MinutenDocker und Monitoring in unter einer Stunde ist realistisch, wenn das Setup klar bleibt. Der Artikel zeigt ein schlankes Homelab-Grundgerüst mit Fokus auf Wartbarkeit statt Tool-Overkill.
-
Lokale LLMs: Start ohne Cloud-Kosten
Artikel lesen →: Lokale LLMs: Start ohne Cloud-KostenLokale LLMs ohne Cloudkosten sind absolut machbar – wenn man sauber plant. In diesem Beitrag zeige ich einen pragmatischen Einstieg: Modellwahl, Hardware-Faustregeln und die ersten Benchmarks, die wirklich…
-
LiteLLM Routing für Einsteiger: Kosten und Fallbacks sauber steuern
Artikel lesen →: LiteLLM Routing für Einsteiger: Kosten und Fallbacks sauber steuernLiteLLM Routing: Kosten und Fallbacks sauber steuern Wenn die API-Kosten plötzlich explodieren oder der Service streikt, liegt das Problem selten am Prompt, sondern am Routing. LiteLLM löst genau…