NVIDIA heeft Cosmos 3 Edge uitgebracht, een open wereld-model met 4 miljard parameters dat is gebouwd om AI-redeneren op datacenterniveau rechtstreeks naar robots en edge-apparaten te brengen die actief zijn in fabrieken, magazijnen, ziekenhuizen en daarbuiten. Het model, nu beschikbaar op Hugging Face, is ontworpen om robots en vision-AI-agenten te helpen hun omgeving te begrijpen, in realtime te redeneren en fysieke acties te genereren — allemaal zonder dat de berekening terug naar de cloud hoeft te worden gestuurd.
Summary
Belangrijkste punten
- Cosmos 3 Edge is een open wereld-model met 4 miljard parameters voor robotica en vision-AI op edge-apparaten, uitgebracht door NVIDIA op Hugging Face.
- Het levert realtime robotbesturing op 15 Hz, waarbij 32 acties per inferentie worden gegenereerd op NVIDIA Jetson Thor.
- Het model combineert twee transformer-torens — autoregressief en diffusie — die multimodale attentielagen delen voor uniforme redenering en actiegeneratie.
- Het staat #1 op VANTAGE-Bench voor vision-analyse onder modellen met 4 miljard parameters en loopt voorop in robotbeleid-leren.
- Een speciaal beleidsmodel, Cosmos 3 Edge Policy (DROID), is beschikbaar voor pick-and-place-taken met robots, met fine-tuning ondersteund op H100- of NVIDIA DGX-clusters.
NVIDIA lanceert Cosmos 3 Edge voor robotica en Vision-AI aan de Edge
De kernuitdaging voor machines die aan de edge worden ingezet, is altijd dezelfde geweest: beperkte geheugenruimte, beperkte rekenkracht, maar reële eisen uit de fysieke wereld die niet vertragen. Cosmos 3 Edge is NVIDIA’s antwoord op die kloof. Volgens NVIDIA developer advocate Pranjali Joshi is het model geoptimaliseerd voor geheugenefficiënte, high-throughput-inferentie op een breed scala aan NVIDIA edge-hardware — waaronder de nieuw aangekondigde NVIDIA Jetson T2000 en T3000-modules, NVIDIA Jetson Thor, NVIDIA RTX PRO GPU’s, NVIDIA DGX en NVIDIA GeForce RTX GPU’s.
Die brede hardwarecompatibiliteit is belangrijk. De meeste edge-AI-implementaties worden niet beperkt door ambitie, maar door wat de lokale hardware daadwerkelijk kan draaien. Een model dat zich uitstrekt van compacte Jetson-modules tot volledige DGX-systemen geeft ontwikkelaars één raamwerk om over een breed implementatiespectrum mee te werken.
Realtime prestatiewaarden die ertoe doen
De prestatiecijfers die NVIDIA noemt, zijn opmerkelijk. Op NVIDIA Jetson Thor genereert Cosmos 3 Edge 32 acties per inferentie terwijl realtime robotbesturing op 15 Hz behouden blijft. Voor robotica-toepassingen, waar het verschil tussen vloeiende beweging en schokkerig falen vaak neerkomt op inferentielatentie, is 15 Hz halen op een edge-module een betekenisvolle drempel. Onder modellen met 4 miljard parameters staat het op de eerste plaats op VANTAGE-Bench voor vision-analyse en claimt het state-of-the-art-prestaties voor robotbeleid-leren.
Innovatieve modelarchitectuur: twee transformer-torens, één gedeelde representatie
Wat Cosmos 3 Edge onderscheidt van een standaard vision-language-model is de dual-tower-transformerarchitectuur. Het model combineert een autoregressieve toren en een diffusietoren, die elk verschillende modaliteiten verwerken maar multimodale attentielagen delen die informatie op elkaar afstemmen over taal-, video-, audio- en actiedata heen.
De autoregressieve toren verwerkt visie- en teksttokens voor begrip en redenering. De diffusietoren verwerkt visie-, audio- en actietokens voor voorspelling, generatie en wat NVIDIA neurale simulatie noemt. De twee torens behouden afzonderlijke normalisatielagen en multilayer-perceptrons, maar de gedeelde attentielagen zijn waar de integratie plaatsvindt — waardoor het model wordt gedwongen een enkel coherent beeld van een scène op te bouwen voordat wordt besloten wat de volgende stap is.
Gedeelde geometrische vectorrepresentatie voor fysieke acties
Een van de technisch meest onderscheidende kenmerken is hoe het model fysieke acties afhandelt over verschillende robotbelichamingen heen. Een robotarm beweegt anders dan een voertuig op wielen of een camerarig, en de meeste modellen behandelen dit als afzonderlijke problemen. Cosmos 3 Edge projecteert ze allemaal in een gedeelde, compacte geometrische vectorrepresentatie — waarbij acties worden gecodeerd op een manier die ruimtelijke relaties en stuurinputs consistent vastlegt over verschillende belichamingstypen.
Dit ontwerp creëert een directe verbinding tussen visuele veranderingen op pixelniveau en fysieke beweging. Gegenereerde video houdt op slechts een visuele voorspelling te zijn en wordt een representatie van hoe verwacht wordt dat de wereld verandert als reactie op een specifieke actie. Voor ontwikkelaars die trainingspijplijnen bouwen, betekent dat synthetische data die is verankerd in beweging, oorzaak en controle — niet alleen in visuele verschijning.
Toepassingen en uitbreidingen: beleidsmodellen en ontwikkelaarstools
Naast het basismodel brengt NVIDIA Cosmos 3 Edge Policy (DROID) uit — een robotmanipulatiebeleid dat post-getraind is op de DROID-dataset en gericht is op pick-and-place-taken. Het wordt geleverd met post-trainingsscripts, zodat ontwikkelaars een concreet startpunt hebben om het model aan te passen aan hun eigen manipulatie-workflows.
Post-training, maatwerk en ontwikkelaarsresources
Ontwikkelaars die verder willen gaan, kunnen Cosmos 3 Edge fine-tunen op een kleine cluster H100 GPU’s of een NVIDIA DGX Station. NVIDIA brengt ook referentie-post-getrainde checkpoints en trainingsrecepten uit naast de basis modelgewichten, waaronder een Cosmos 3 Super 4-Step Distillation-checkpoint dat diffusie-inferentie terugbrengt van 35–50 denoising-stappen naar slechts 4, wat tot 25× snellere inferentie oplevert voor taken voor beeld- en videogeneratie zonder in te leveren op outputkwaliteit.
De bredere ecosysteemstrategie hier is het vermelden waard. Door open gewichten, trainingsscripts en referentiecheckpoints samen uit te brengen, positioneert NVIDIA Cosmos 3 Edge niet alleen als een op zichzelf staand model, maar als een fundament voor domein-aangepaste wereldmodellen. Ontwikkelaars kunnen het post-trainen met gespecialiseerde data, distilleren voor snelheid of het direct inzetten — allemaal binnen hetzelfde open raamwerk dat beschikbaar is op Hugging Face.
Leiderschap in benchmarks en wat er hierna komt
NVIDIA’s VANTAGE-Bench-ranking plaatst Cosmos 3 Edge bovenaan in zijn gewichtsklasse voor vision-analyse, en de claim rond robotbeleid-leren voegt concurrentiekracht toe in een domein waar de meeste edge-modellen óf prioriteit geven aan visueel begrip óf aan controle — maar niet beide tegelijk.
Vooruitkijkend heeft NVIDIA plannen uiteengezet om Cosmos 3 verder te ontwikkelen voor wat het Physical AI noemt, met aankomende verbeteringen op het gebied van interactieve wereldgeneratie, simulatie van rijsituaties en bredere robotica-beleiden. De roadmap omvat ook het optimaliseren van Cosmos 3-checkpoints met open inferentieraamwerken zoals vLLM, snellere post-training op een breder scala aan hardware en extra ontwikkelaarstools.
De richting wijst op iets breders dan een enkele modelrelease. Naarmate edge-hardware capabeler wordt en robotica-implementaties op industriële schaal toenemen, zal de vraag naar compacte, inzetbare wereldmodellen alleen maar toenemen. Een model dat redeneert over oorzaak en gevolg, fysieke consequenties simuleert en controleacties genereert — allemaal aan de edge, op 15 Hz — begint minder op een onderzoeksdoorbraak te lijken en meer op productie-infrastructuur.
FAQ
Wat is NVIDIA Cosmos 3 Edge?
Cosmos 3 Edge is een open wereld-model met 4 miljard parameters dat door NVIDIA is uitgebracht en waarmee robots en vision-AI-agenten hun omgeving kunnen begrijpen, redeneren en fysieke acties in realtime kunnen genereren op edge-apparaten.
Welke hardware ondersteunt Cosmos 3 Edge voor inferentie?
Het model ondersteunt geheugenefficiënte, high-throughput-inferentie op een breed scala aan NVIDIA edge-hardware, waaronder NVIDIA Jetson T2000-, T3000- en Thor-modules, NVIDIA RTX PRO GPU’s, NVIDIA DGX en NVIDIA GeForce RTX GPU’s.
Hoe bereikt Cosmos 3 Edge realtime robotbesturing?
Op NVIDIA Jetson Thor genereert het model 32 acties per inferentie en behoudt het robotbesturing op 15 Hz, waardoor realtime redeneren en fysieke controle mogelijk worden zonder afhankelijk te zijn van cloudcomputing.
Kunnen ontwikkelaars Cosmos 3 Edge aanpassen aan hun eigen use-cases?
Ja. Ontwikkelaars kunnen het model fine-tunen met behulp van een kleine cluster H100 GPU’s of een NVIDIA DGX Station, en NVIDIA biedt referentie-post-getrainde checkpoints en trainingsrecepten om te helpen het model aan te passen aan aangepaste workloads en gespecialiseerde toepassingen.
{“@context”:”https://schema.org”,”@type”:”FAQPage”,”mainEntity”:[{“@type”:”Question”,”name”:”Wat is NVIDIA Cosmos 3 Edge?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”Cosmos 3 Edge is een open wereld-model met 4 miljard parameters dat door NVIDIA is uitgebracht en waarmee robots en vision-AI-agenten hun omgeving kunnen begrijpen, redeneren en fysieke acties in realtime kunnen genereren op edge-apparaten.”}},{“@type”:”Question”,”name”:”Welke hardware ondersteunt Cosmos 3 Edge voor inferentie?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”Het model ondersteunt geheugenefficiënte, high-throughput-inferentie op een breed scala aan NVIDIA edge-hardware, waaronder NVIDIA Jetson T2000-, T3000- en Thor-modules, NVIDIA RTX PRO GPU’s, NVIDIA DGX en NVIDIA GeForce RTX GPU’s.”}},{“@type”:”Question”,”name”:”Hoe bereikt Cosmos 3 Edge realtime robotbesturing?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”Op NVIDIA Jetson Thor genereert het model 32 acties per inferentie en behoudt het robotbesturing op 15 Hz, waardoor realtime redeneren en fysieke controle mogelijk worden zonder afhankelijk te zijn van cloudcomputing.”}},{“@type”:”Question”,”name”:”Kunnen ontwikkelaars Cosmos 3 Edge aanpassen aan hun eigen use-cases?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”Ja. Ontwikkelaars kunnen het model fine-tunen met behulp van een kleine cluster H100 GPU’s of een NVIDIA DGX Station, en NVIDIA biedt referentie-post-getrainde checkpoints en trainingsrecepten om te helpen het model aan te passen aan aangepaste workloads en gespecialiseerde toepassingen.”}}]}
Artikel geproduceerd met behulp van kunstmatige intelligentie en beoordeeld door de redactie.

