AI PROCESORI

OpenAI tvrdi da Jalapeño nadmašuje Nvidiju

Prvi objavljeni rezultati OpenAI-jeva čipa za izvođenje AI modela pokazuju veću energetsku učinkovitost i kraće vrijeme odziva od uspoređivanih Nvidijinih sustava. Jalapeño je razvijen s Broadcommo, a njegova deklarirana snaga iznosi 700 vata. Uvođenje je planirano do kraja godine, uz nastavak nabave Nvidijinih procesora.

OpenAI tvrdi da Jalapeño nadmašuje Nvidiju
Depositphotos

OpenAI je objavio rezultate testiranja Jalapeña, vlastitog čipa za inferenciju, odnosno izvođenje već uvježbanih modela umjetne inteligencije, razvijenog u suradnji s Broadcomom. Tvrtka tvrdi da je čip brži i energetski učinkovitiji od Nvidijina GB300, temeljenog na arhitekturi Blackwell Ultra. Deklarirana snaga Jalapeñova kućišta iznosi 700 vata, nasuprot 1 400 vata kod uspoređivanog Nvidijina rješenja, što upućuje na znatnu razliku u energetskim zahtjevima i prije usporedbe samih performansi.

U javno dostupnom testu InferenceX, koji je razvio SemiAnalysis, Jalapeño je uspoređen s konkurentskim sustavima na trima velikim modelima: GPT-OSS 120B, DeepSeek R1 670B i Kimi K2.5 1T. Pri najvećoj propusnosti ostvario je od 1,5 do 1,9 puta više AI obrade po vatu, uz od 1,7 do 3,6 puta kraće ukupno vrijeme odziva. Kod izrazito interaktivnih opterećenja, kakva se pojavljuju pri radu AI agenata, prednost je dosegnula 4,1 puta veće performanse. Na modelu Kimi K2.5, s bilijun parametara, zabilježeno je 1,5 puta više performansi po vatu i 3,4 puta kraće vrijeme odziva.

OpenAI je rezultate normalizirao prema objavljenim nazivnim vrijednostima snage svakog čipa. Iako je Jalapeño deklariran na 700 vata, izmjerena potrošnja tijekom testiranja nije prelazila 550 vata. Arhitektura je prilagođena dvjema fazama inferencije: računalno zahtjevnoj početnoj obradi ulaznog upita, poznatoj kao prefill, te generiranju odgovora, odnosno fazi decode, koja snažnije ovisi o memorijskoj propusnosti. Zadržavanjem stanja modela i podataka predmemorije lokalno, unutar jednog povezanog sustava, smanjena su komunikacijska kašnjenja koja nastaju pri prijenosu podataka između čipova.

U razvoju silicija sudjelovala je i sama umjetna inteligencija. OpenAI je vlastite modele koristio pri projektiranju Jalapeña, skraćujući put od početnog koncepta do predaje dovršenog dizajna u proizvodnju na devet mjeseci. Inženjeri su se služili i alatom Codex za optimizaciju modela s otvoreno dostupnim težinama, a kod izrađen uz pomoć umjetne inteligencije izvršavao se do 1,8 puta brže od inačica koje su napisali ljudi. OpenAI planira početi uvoditi Jalapeño do kraja godine, u sklopu razvojnog plana koji obuhvaća više generacija čipova. Tvrtka istodobno ne odustaje od Nvidije i nastavit će kupovati njezine procesore kako bi zadovoljila potražnju. Jalapeño nije uspoređen s novijim Nvidijinim čipovima Vera Rubin. Razvojem procesora namijenjenog upravo inferenciji OpenAI gradi i vlastiti put prema većim računalnim kapacitetima.

Jalapeño je prvi put predstavljen 24. lipnja 2026., dok su sada objavljena mjerenja korak dalje od tadašnjih početnih najava arhitekture. Već pri predstavljanju naglašeno je da čip treba podržavati sadašnje i buduće velike jezične modele različitih proizvođača, a ne samo OpenAI-jeve modele. Inženjerski uzorci tada su u laboratoriju izvršavali AI opterećenja pri ciljanim proizvodnim frekvencijama i potrošnji, među njima i GPT-5.3-Codex-Spark. Širi okvir suradnje s Broadcomom objavljen je 13. listopada 2025. i obuhvaća plan razvoja deset gigavata vlastitih AI akceleratora, zajedno s mrežnim sustavima za njihovo povezivanje. Prema tada objavljenom planu uvođenje bi počelo u drugoj polovici 2026., a završilo do kraja 2029., pa je riječ o višegodišnjoj izgradnji računalnih kapaciteta. Projekt obuhvaća procesor, mrežu, memorijski sustav i softver za raspoređivanje poslova, pa se objavljeni rezultati odnose na usklađenost cijele računalne platforme.

U testiranju se razlikuju ukupna količina obavljenog rada i brzina odgovora koju dobiva pojedinačni korisnik, jer veći broj istodobnih zahtjeva može povećati propusnost uz dulje čekanje. Posebno se prati razmak između uzastopno generiranih tokena, odnosno dijelova teksta od kojih model sastavlja odgovor. Kod agenata taj razmak utječe na niz povezanih koraka, pa se kašnjenja mogu zbrajati tijekom izvršavanja zadatka. U laboratorijskom ispitivanju modela DeepSeek R1 pri jednom istodobnom korisniku zabilježeno je više od 700 tokena u sekundi po korisniku.

Objavljena usporedba obuhvaćala je i konfiguracije u kojima su konkurentski sustavi primjenjivali predviđanje više tokena unaprijed, dok Jalapeño nije koristio tu optimizaciju. Njegova memorijska propusnost iznosi 15,4 terabajta u sekundi, što izravno podupire fazu generiranja odgovora koja zahtijeva intenzivan pristup memoriji. Softversko sučelje omogućuje izričito određivanje lokalnih tenzora, komunikacije i sinkronizacije, kako bi se rad preciznije rasporedio po računalnim resursima. Takva struktura ujedno daje alatima za programiranje jasniji opis onoga što mogu optimizirati, uključujući položaj podataka i redoslijed izvršavanja. Brojke o snazi čipa pritom nisu isto što i ukupna potrošnja podatkovnog centra, koja uključuje i mrežnu opremu, hlađenje i druge prateće sustave.