Da sich KI von Chatbots zu autonomen Agenten weiterentwickelt, erfüllen offene Modelle die Marktanforderungen nach vollständiger Kontrolle darüber, wo KI ausgeführt wird sowie wie sie bereitgestellt und weiterentwickelt wird.
Heute erweitert NVIDIA seine Nemotron 3-Modellfamilie um Nemotron 3.5 Lightning, das höchsteffiziente Modell seiner Klasse für langlaufende, agentische KI-Workloads. Diese Veröffentlichung folgt auf Nemotron 3 Nano und unterstreicht das Engagement von NVIDIA, offene Modelle kontinuierlich hinsichtlich Genauigkeit und Geschwindigkeit zu verbessern.
Entwickelt für spezialisierte Aufgaben innerhalb größerer Multi-Agenten-Systeme, unterstützt Nemotron 3.5 Lightning, ein 30 Milliarden Parameter umfassendes Mixture-of-Experts-Modell, die Entwicklung intelligenterer und effizienterer agentischer Anwendungen.
Darüber hinaus veröffentlicht NVIDIA NeMo Switchyard, eine Open-Source-Bibliothek für intelligentes Routing innerhalb verbreiteter Agenten-Tools. Unternehmen können sie nutzen, um einen Router für ihre spezifischen Anforderungen zu erstellen.NeMo Switchyard kann jede Anfrage intelligent an das leistungsfähigste und am besten geeignete Modell für die jeweilige Aufgabe weiterleiten, ohne dass Entwickler ihre Anwendungen neu schreiben müssen.
Gemeinsam bieten Nemotron 3.5 Lightning und NeMo Switchyard eine größere Kontrolle darüber, wie KI bereitgestellt wird, wo sie ausgeführt wird und wie effizient sie arbeitet – über PCs, Workstations, Rechenzentren und die Cloud hinweg.

Abbildung 1: Nemotron 3.5 Lightning bietet Intelligenz auf Frontier-Niveau in einem kompakten, anpassbaren offenen Modell, das für agentische Workflows mit hohem Volumen entwickelt wurde.
Always-On-Agenten benötigen ein System von Modellen
Moderne agentische Systeme – Always-On-Agenten – arbeiten zunehmend als Systeme von Modellen bzw. Modell-Ensembles, in denen unterschiedliche Modelle auf verschiedene Aufgaben spezialisiert sind.
Offene NVIDIA Nemotron-Modelle sind für diese Architektur konzipiert. Ein Frontier-Reasoning-Modell wie Nemotron 3 Ultra oder GPT-5.6 kann einen Workflow planen und orchestrieren, während kleinere spezialisierte Modelle wie Nemotron 3.5 Lightning gezielte Aufgaben ausführen können, etwa Code-Reviews, Tool-Nutzung, die Überwachung von Sicherheitswarnungen und die Beantwortung von Abrechnungsfragen.
Unterstützung spezialisierter Aufgaben mit hohem Volumen durch Nemotron 3.5 Lightning
NVIDIA Nemotron 3.5 Lightning ist ein vollständig anpassbares offenes Modell, das für Aufgaben mit hohem Volumen entwickelt wurde und stets verfügbare Agenten unterstützt. Es wurde mit Beiträgen der Nemotron Coalition entwickelt, deren Mitglieder Evaluierungsmethoden, Inferenzsoftware und Datensätze bereitstellten, um das Modell weiterzuentwickeln.
Das Modell liefert eine bis zu 4x höhere Ausgabegeschwindigkeit, was zu einem 30 % schnelleren Abschluss agentischer Aufgaben im Vergleich zu anderen Modellen seiner Klasse führt. Und da es offen und anpassbar ist, kann Nemotron 3.5 Lightning mit NVIDIA NeMo einfach auf den eigenen Daten, Tools und Workflows einer Organisation nach trainiert werden, um die Genauigkeit bei spezialisierten Aufgaben zu erhöhen.

Abbildung 2: PinchBench-Benchmarks zeigen, dass Nemotron 3.5 Lightning im Vergleich zu anderen Modellen seiner Klasse einen schnelleren Abschluss agentischer Aufgaben bei Genauigkeit auf Frontier-Niveau ermöglicht.
Führende KI-Unternehmen aus verschiedenen Branchen passen Nemotron 3.5 Lightning an ihre Workloads an, darunter CrowdStrike für Cybersicherheit, Harvey mit Trajectory für Rechtsdienstleistungen und CodeRabbit mit Baseten für Code-Reviews, und tragen so dazu bei, die Genauigkeit bei domänenspezifischen agentischen Aufgaben zu verbessern. Darüber hinaus trägt Lila Sciences dazu bei, die Reasoning-Fähigkeiten für agentenbasierte Aufgaben in den Natur- und Biowissenschaften zu verbessern, und Fastino Labs hat das Modell angepasst und erzielt führende Genauigkeitswerte für Workloads in der Softwareentwicklung sowie im Finanz- und Gesundheitswesen.

Abbildung 3: Unternehmen haben Nemotron 3.5 Lightning angepasst, um für ihre spezialisierte Aufgabe in ihren agentenbasierten Workflows führende Genauigkeit zu erreichen.
Nemotron 3.5 Lightning gibt Organisationen zudem die Kontrolle über Datenschutz und Bereitstellung. Es kann auf lokalen KI-Systemen ausgeführt werden – darunter NVIDIA RTX PCs, NVIDIA DGX Spark, NVIDIA DGX Station und NVIDIA Jetson –, damit Anwender bestehende Infrastrukturinvestitionen optimal nutzen können, oder über Edge AI-Geräte, NVIDIA RTX PRO Workstations, Rechenzentren und Cloud-Umgebungen für Unternehmensanwendungen skalieren. Außerdem kann Nemotron 3.5 Lightning für hochvolumige, spezialisierte Aufgaben, die schnelle Antworten erfordern, lokal oder im örtlichen Datencenter ausgeführt werden.
Zudem gilt, wie bei jeder Nemotron-Einführung: NVIDIA veröffentlicht so viele Trainingsdaten und Techniken, wie es die Lizenzierung zulässt, was Nachvollziehbarkeit, Auditierung und das Training anderer Modelle ermöglicht. Neben Lightning veröffentlicht NVIDIA Nemotron-RL-Agentic-Terminal-Pivot, einen agentischen Reinforcement-Learning-Datensatz, der für das Post-Training im Hinblick auf Coding-Agent-Fähigkeiten verwendet wurde.
Effizientere KI-Anwendungen durch Model Routing
Manche Modelle eignen sich besser für die Code-Erstellung, andere für Reasoning, andere für leichtgewichtige Aufgaben, und einige sind für die lokale Ausführung optimiert, um mehr Datenschutz und Effizienz zu bieten. Wenn Kunden sich auf ein einzelnes Standardmodell verlassen, geben sie entweder zu viel aus oder büßen Qualität ein; verwalten sie das Routing manuell, entsteht ein Integrationsaufwand, der eine Bereitstellung verlangsamen kann.
NVIDIA NeMo Switchyard ist eine Open-Source-Bibliothek für Modell-Routing für KI-Agenten. Die Technologie leitet Prompts für jeden Schritt eines Agenten-Workflows an das leistungsfähigste und effizienteste Modell weiter – automatisch und basierend auf spezifischen Anforderungen. Entwickler von Agenten-Anwendungen können den Router mit verschiedenen Routing-Algorithmen anpassen oder modifizieren, um ihn auf ihre Prioritäten wie Qualität, Latenz und Kosten abzustimmen. In einem System aus Modellen können Unternehmen leistungsstarke KI-Agenten mit verbesserter Tokenomics erstellen.
Interne Benchmarks zeigen, dass NeMo Switchyard eine Genauigkeit auf Frontier-Niveau beibehält und dabei die Kosten für die Aufgabenerledigung auf nahezu ein Drittel gegenüber Opus 4.8 allein senkt.

Abbildung 4: Interne Benchmarks von NVIDIA zeigen, dass NeMo Switchyard eine Genauigkeit auf Frontier-Niveau beibehält und dabei die Kosten für die Aufgabenerledigung auf nahezu ein Drittel gegenüber Opus 4.8 allein senkt.
NVIDIA arbeitet mit Partnern im gesamten KI-Ökosystem zusammen, um intelligentes Modell-Routing in die Tools und Plattformen zu bringen, die Entwickler bereits nutzen.
- Boomi: Evaluierte Switchyard über fünf Routing-Funktionen hinweg und erzielte dabei eine Domain-Routing-Genauigkeit von 100%, leitete 59% des Traffics an ein 5x schnelleres fein abgestimmtes Modell und reduzierte die Latenz in späteren Turns um 21%.
- Cadence: Steigerte die Effizienz um 9,9% durch die Nutzung des ChipStack KI Super Agent für einen Anwendungsfall der formalen Verifikation.
- Classmethod: Betreibt opencode und Fireworks-Workloads intern mit NeMo Switchyard, wobei erste Tests eine Kostenreduzierung um 27% bei gleichbleibender Qualität zeigen.
- Cognition: Hat den gestuften Router NVIDIA NeMo Switchyard für die interne Nutzung bei NVIDIA in Devin Desktop integriert und erreicht damit eine nahezu Frontier-nahe Leistung bei FrontierCode Main bei einer Reduzierung der durchschnittlichen Kosten um 28% gegenüber dem Routing aller Anfragen an ein einzelnes zugrunde liegendes Frontier-Modell.
- Kong: Stellt Routing mit NeMo Switchyard nativ über Kong KI Gateway bereit.
- LangChain: Erzielte mit NeMo Switchyard bei 145 mehrstufigen Deep Agents-Aufgaben um 74% geringere Kosten, indem nur 7% der Aufrufe an ein Frontier-Modell weitergeleitet wurden – bei einem Genauigkeitsverlust von 6%.
- LiteLLM: Integriert Routing in die eigene Proxy-Schicht, sodass Entwickler diese Vorteile ohne Änderungen an ihrem bestehenden Stack nutzen können.
- Nous Research: Hat NeMo Switchyard in Hermes integriert, um Entwicklern ein einfach zu konfigurierendes Routing-System zur Verbesserung der Agenteneffizienz bereitzustellen.
- Ramp: Nutzte NeMo Switchyard, um die Leistung eines Frontier-Modells zu erreichen und dabei bei Ramp SWE-Bench die Kosten um 58% sowie die Laufzeit um 33% zu senken.
- Siemens: Führt Benchmarks zur Effizienzsteigerung des eigenen Fuse EDA KI Agent.
Nemotron 3.5 Lightning ist auf Hugging Face, ModelScope, OpenRouter und build.nvidia.com als NVIDIA NIM-Microservice sowie über ein breites Ökosystem aus NVIDIA Cloud Partnern, Post-Training-Plattformen, Inferenzplattformen und Cloud-Service-Providern verfügbar. NeMo Switchyard ist auf GitHub verfügbar und wird in Kürze auf Partnerplattformen bereitstehen.
