LLM News
Aktuelle LLM- und KI-News: Releases, Infrastruktur, Modelle und die operative Einordnung für Teams.
-
Liquid AI LFM2.5-Encoder: Warum Long-Context-NLP auf CPU wieder eine Architekturentscheidung ist
Artikel lesen →: Liquid AI LFM2.5-Encoder: Warum Long-Context-NLP auf CPU wieder eine Architekturentscheidung istLiquid AI veröffentlicht zwei Long-Context-Encoder für CPU-Betrieb. Warum spezialisierte Modelle die LLM-Kostenarchitektur bei Klassifikation und Triage verändern können.
Verfasst von
-
MCP Python SDK 2.0: Warum ein Dependency-Update jetzt zum Protokoll-Migrationsprojekt wird
Artikel lesen →: MCP Python SDK 2.0: Warum ein Dependency-Update jetzt zum Protokoll-Migrationsprojekt wirdMCP Python SDK 2.0 ist stabil. Weil pip nun automatisch 2.x installiert, wird ein Dependency-Update für viele MCP-Server zur planbaren Migration.
Verfasst von
-
NVIDIA Cosmos-H-Dreams: Warum 160 fps generative Simulation für Operationsrobotik verändert
Artikel lesen →: NVIDIA Cosmos-H-Dreams: Warum 160 fps generative Simulation für Operationsrobotik verändertNVIDIA stellt mit Cosmos-H-Dreams eine Forschungsplattform für generative Echtzeit-Simulationen in der chirurgischen Robotik vor. Der interessante Teil ist nicht ein weiterer medizinischer Assistent, sondern der Inferenzpfad: Ein aus …
Verfasst von
-
Open WebUI 0.11.0: Sub-Agents machen die lokale LLM-Oberfläche zur Agenten-Runtime
Artikel lesen →: Open WebUI 0.11.0: Sub-Agents machen die lokale LLM-Oberfläche zur Agenten-RuntimeOpen WebUI 0.11.0 führt steuerbare Sub-Agents ein. Warum das für Self-Hosted-Teams eine neue Betriebs- und Sicherheitsfläche schafft.
Verfasst von
-
MAI-Cyber-1 Flash: Warum agentische Security jetzt an Freigabegrenzen scheitert
Artikel lesen →: MAI-Cyber-1 Flash: Warum agentische Security jetzt an Freigabegrenzen scheitertMicrosoft kombiniert mit MAI-Cyber-1 Flash ein eigenes Security-Modell und eine agentische Sicherheitsplattform. Entscheidend ist nicht, ob ein Agent einen Finding zusammenfassen kann, sondern welche Rechte er im Ernstfall …
Verfasst von
-
NVIDIA NOOA: Warum Agenten als Python-Objekte statt Workflow-Graphen zählen
Artikel lesen →: NVIDIA NOOA: Warum Agenten als Python-Objekte statt Workflow-Graphen zählenNVIDIA Labs hat mit NOOA eine Open-Source-Research-Preview für Agenten veröffentlicht, die einen ungewohnten Schwerpunkt setzt: Der Agent ist ein Python-Objekt. Das ist kein Ersatz für jedes Orchestrierungsframework – …
Verfasst von
-
NVIDIA Nemotron 3 Ultra: Was agentisches RTL-Coding für Verifikationsteams verändert
Artikel lesen →: NVIDIA Nemotron 3 Ultra: Was agentisches RTL-Coding für Verifikationsteams verändertNVIDIA meldet 97,1 % Pass Rate für ACE-RTL mit Nemotron 3 Ultra. Relevant ist weniger der Benchmarkwert als die geschlossene Verifikationsschleife aus Generieren, Testen und Reflexion.
Verfasst von
-
Ollama 0.32.4: Warum Quantisierung jetzt zur Apple-Silicon-Betriebsfrage wird
Artikel lesen →: Ollama 0.32.4: Warum Quantisierung jetzt zur Apple-Silicon-Betriebsfrage wirdOllama 0.32.4 räumt gleich an drei Stellen auf, die für lokale Inferenz auf Apple Silicon relevant sind: Die Runtime unterstützt Laguna über die MLX-Engine, erstellt Output-Heads für Speculative-Decoding-Drafts …
Verfasst von
-
SGLang 0.5.16: Spekulatives Decoding wird dynamischer – das Upgrade ist trotzdem kein Selbstläufer
Artikel lesen →: SGLang 0.5.16: Spekulatives Decoding wird dynamischer – das Upgrade ist trotzdem kein SelbstläuferSGLang 0.5.16 bringt confidence-gesteuertes speculative decoding. Für Betreiber zählen mindestens genauso die entfernten Quantisierungspfade, neue Defaults und umbenannte Flags.
Verfasst von
-
NVIDIA ModelExpress: Warum GPU-zu-GPU-Weight-Transfer LLM-Scale-outs beschleunigen soll
Artikel lesen →: NVIDIA ModelExpress: Warum GPU-zu-GPU-Weight-Transfer LLM-Scale-outs beschleunigen sollNVIDIA will mit ModelExpress einen Engpass adressieren, der beim Betrieb sehr großer Sprachmodelle schnell teurer wird als ein einzelner Request: das wiederholte Laden identischer Gewichte. Statt jede neue …
Verfasst von









