OpenAI:s Jalapeño kör AI-modeller snabbare med mindre energi
De första testerna visar högre genomströmning per watt och lägre latens, men chipet når bara små volymer i år.
OpenAI har publicerat de första uppmätta resultaten för Jalapeño, bolagets egen accelerator för AI-inferens. I bolagets tester på den publika benchmarksviten InferenceX levererade systemet 1,5–1,9 gånger mer modellarbete per watt vid högsta genomströmning och 1,7–3,6 gånger lägre total svarslatens än jämförelsesystemen.
Testerna körde tre öppna modeller med olika belastning: GPT-OSS 120B, DeepSeek R1 670B och Kimi K2.5 med en biljon parametrar. På DeepSeek R1 uppger OpenAI exempelvis 1,7 gånger högre topprestanda per kilowatt och 3,6 gånger lägre latens än ett Nvidia GB300-system.

Byggd för agenternas väntetid
Jalapeño är konstruerad för hela förloppet från prompt till sista token. OpenAI försöker hålla modellens KV-cache lokal och aktivera rätt blandning av beräkning, minne och nätverk för varje fas, i stället för att flytta data mellan specialiserade system. Det är särskilt relevant för agenter, där väntetiden läggs på för varje verktygsanrop och varje nytt resonemangssteg.
Bolaget använde också AI i utvecklingen. Enligt OpenAI:s tekniska redogörelse hjälpte tidigare modeller till med chipdesignen, medan Codex med GPT-Astra optimerade programvaran för tre öppna modellfamiljer på två månader. På utvalda attention- och mixture-of-experts-block blev de AI-genererade implementationerna 1,5–1,8 gånger snabbare än tidigare expertkod. Det resultatet gäller enskilda block, inte hela modellen.
Försprånget är ännu ett labbresultat
InferenceX är en öppen och reproducerbar testmetod, men själva Jalapeño-körningarna är fortfarande OpenAI:s. Chipet säljs inte externt och kan därför inte testas fritt av oberoende laboratorier. TechCrunch noterar dessutom att jämförelsen görs mot dagens Nvidia Blackwell-system och att Jalapeño väntas nå mycket små volymer först i slutet av 2026.
För användare i Norden är konsekvensen indirekt: chipet ska köras i OpenAI:s egen infrastruktur, inte i lokala datorer eller som en hyrbar molninstans. Nästa verifierbara hållpunkt blir därför produktionstrafik och större utrullning under 2027, när lägre latens och energianvändning kan mätas utanför ett förberett benchmarkscenario.
OpenAI:s första mätningar visar att Jalapeño kan ge både högre genomströmning per watt och lägre latens än de jämförda Nvidia-systemen. Resultaten gäller tre öppna stora språkmodeller på den publika benchmarksviten InferenceX.
Snabbare inferens märks extra tydligt i agenter som måste göra många steg i följd. Om resultaten håller i produktion kan samma energibudget ge fler och mer responsiva agentkörningar.
Det intressanta är att OpenAI angriper agenternas väntetid som ett sammanhängande systemproblem, från chip och minne till nätverk och kod. Men Jalapeño är fortfarande ett slutet chip med bolagets egna mätningar; först produktionstrafik kan visa om försprånget överlever verkliga arbetslaster.




