OpenAI heeft de eerste benchmarkresultaten gepubliceerd van zijn eigen AI-accelerator Jalapeño. De chip is ontworpen voor inferentie – het uitvoeren van getrainde AI-modellen – en haalt volgens OpenAI tot 1,9 keer meer AI-werk per watt dan de Nvidia-systemen waarmee hij is vergeleken. Ook de responstijd ligt volgens de tests aanzienlijk lager.

Wie AI-modellen wil trainen en gebruiken, heeft steeds meer rekenkracht nodig. Vooral het uitvoeren van modellen – inferentie – vormt een groeiende belasting voor datacenters. Iedere vraag aan een AI-model vereist immers rekenwerk, geheugen en datatransport. Naarmate AI-systemen meer worden gebruikt voor agenten die meerdere stappen achter elkaar uitvoeren, wordt niet alleen de hoeveelheid rekenwerk belangrijker, maar ook de energieconsumptie en latency.
OpenAI probeert daarom een groter deel van de hardwarestack zelf te ontwerpen. Het bedrijf presenteerde in juni 2026 samen met Broadcom zijn eerste eigen inferentiechip: Jalapeño. Nu heeft OpenAI de eerste concrete benchmarkresultaten vrijgegeven.
Tot 1,9 keer meer werk per watt
OpenAI testte Jalapeño met drie open-weight modellen: GPT-OSS 120B, DeepSeek R1 670B en Kimi K2.5 1T. De tests werden uitgevoerd met InferenceX, een publieke benchmark van SemiAnalysis die de prestaties van systemen voor het uitvoeren van AI-modellen meet.
Over de drie modellen rapporteert OpenAI 1,5 tot 1,9 keer meer AI-werk per watt bij maximale throughput dan de gebruikte vergelijkingssystemen. Tegelijkertijd lag de end-to-end latency volgens OpenAI 1,7 tot 3,6 keer lager.
De beste verhouding tussen prestaties en energiegebruik werd gemeten bij GPT-OSS 120B. Daar kwam Jalapeño uit op ongeveer 85.448 gemengde tokens per seconde per kilowatt, tegenover 44.960 voor het vergelijkingssysteem. Dat komt neer op ongeveer 1,9 keer zoveel throughput per kilowatt. Bij DeepSeek R1 bedroeg de verhouding ongeveer 1,7 keer en bij het grotere Kimi K2.5 ongeveer 1,5 keer.
Geen klassieke benchmark voor één chip
De cijfers moeten wel zorgvuldig worden geïnterpreteerd. OpenAI vergelijkt niet simpelweg twee chips door dezelfde berekening op één chip van beide fabrikanten uit te voeren. De benchmark kijkt naar de prestaties van complete AI-inferentiesystemen en normaliseert daarbij onder meer voor het opgegeven chipvermogen.
Jalapeño heeft een nominale vermogensrating van 700 watt. Tijdens de door OpenAI beschreven workloads bleef het gemeten duurzame vermogen op of onder ongeveer 550 watt. De Nvidia-systemen in de vergelijking hadden een hoger opgegeven pakketvermogen; afhankelijk van de benchmark ging het om een GB200- of GB300-systeem. Dat maakt de claim van 1,9 keer meer werk per watt relevant, maar niet hetzelfde als zeggen dat Jalapeño als losse chip 1,9 keer efficiënter is dan iedere Nvidia-chip.
Lagere latency
Naast energie-efficiëntie richt OpenAI zich nadrukkelijk op latency. Dat is vooral belangrijk voor interactieve AI-toepassingen. Een gebruiker die een antwoord van een chatbot verwacht, merkt immers direct wanneer de eerste tokens langzaam verschijnen.
Bij DeepSeek R1 rapporteert OpenAI een ongeveer 3,6 keer lagere end-to-end latency dan het vergelijkingssysteem: circa 1,65 tegenover 5,99 seconden. Bij Kimi K2.5 is de gemeten latency ongeveer 3,4 keer lager. Voor GPT-OSS 120B bedraagt de verbetering circa 1,7 keer.
Voor AI-agenten kan een verbetering in latency extra waardevol zijn. Zo’n agent voert vaak meerdere modelaanroepen na elkaar uit. Vertragingen bij iedere stap kunnen zich daardoor gedurende een volledige taak opstapelen.
Architectuur draait om minder datatransport
De belangrijkste ontwerpkeuze van Jalapeño is volgens OpenAI niet alleen meer rekenkracht, maar vooral een betere balans tussen rekenunits, geheugen en netwerkcapaciteit.
Bij grote AI-modellen is het verplaatsen van data tussen verschillende onderdelen van een computersysteem een belangrijke bron van energieverbruik en vertraging. Jalapeño is daarom ontworpen als een sterk geïntegreerd systeem waarin het netwerk een fundamenteel onderdeel van de architectuur vormt.
Volgens OpenAI maakt dat het mogelijk om workloads binnen één verbonden systeem te houden en datatransport te beperken. Daardoor moet de chip niet alleen theoretisch veel rekenwerk kunnen uitvoeren, maar die rekenkracht ook daadwerkelijk efficiënt kunnen benutten.
Specifiek ontworpen voor inferentie
Jalapeño is nadrukkelijk geen chip voor het trainen van AI-modellen. De accelerator is bedoeld voor inferentie: het uitvoeren van een reeds getraind model wanneer een gebruiker een verzoek indient.
Dat onderscheid is belangrijk. OpenAI blijft voor het trainen van zijn modellen afhankelijk van andere hardware, waaronder Nvidia-systemen. De onderneming zegt bovendien niet van plan te zijn om Jalapeño als commerciële chip aan andere bedrijven te verkopen. De chip moet vooral de eigen infrastructuur efficiënter maken.
AI hielp de chip ontwerpen
OpenAI gebruikte zijn eigen AI-modellen ook tijdens het ontwerpen van Jalapeño. Volgens het bedrijf kon het ontwerpteam dankzij AI in ongeveer negen maanden van het eerste ontwerp naar tape-out gaan. AI werd onder meer ingezet bij het verkennen van chipimplementaties, verificatie en het optimaliseren van rekencircuits. Ook bij het programmeren van de chip speelde AI een rol. OpenAI gebruikte Codex in combinatie met GPT-Astra om drie modellen die oorspronkelijk niet voor Jalapeño waren gepland geschikt te maken voor de accelerator.
De vergelijking heeft grenzen
De resultaten vormen geen bewijs dat Jalapeño Nvidia in de hele AI-markt voorbijstreeft. De metingen zijn uitgevoerd met drie specifieke modellen, specifieke configuraties en een beperkt aantal vergelijkingssystemen.
Ook vergelijkt OpenAI met bestaande Nvidia-systemen uit de Blackwell-generatie. De benchmark zegt daarmee vooral iets over de prestaties van Jalapeño tegenover de systemen die in deze test zijn opgenomen. Het is geen algemene uitspraak over alle Nvidia-hardware of over toekomstige generaties. Bovendien zijn de cijfers afkomstig van OpenAI zelf.
Eerste stap van een eigen hardwareplatform
OpenAI presenteert Jalapeño als het begin van een meerjarige hardwareontwikkeling. Het bedrijf werkt samen met onder meer Broadcom en Celestica aan de implementatie, systeemintegratie, netwerken en productie.
Volgens OpenAI wordt Jalapeño later dit jaar in kleine volumes ingezet. Vanaf 2027 moet de productie worden opgeschaald. Het bedrijf benadrukt tegelijkertijd dat het zijn volledige hardwarestrategie niet op één type accelerator baseert en Nvidia als belangrijke partner blijft gebruiken.
Op zoek naar technisch talent?
Breng uw vacature onder de aandacht van technisch professionals via EngineersOnline.






