OpenAI melaporkan Jalapeño menghasilkan 1.5–1.9× lebih banyak kerja AI per watt dan latensi hujung ke hujung 1.7–3.6× lebih rendah berbanding sistem Nvidia GB200 dan GB300 yang diuji pada Ogos 2026. Ujian menggunakan GPT OSS 120B, DeepSeek R1 670B dan Kimi K2.5 1T melalui penanda aras InferenceX SemiAnalysis, dengan...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did OpenAI’s custom Jalapeño inference chip achieve in its August 2026 benchmarks against Nvidia’s GB200 and GB300 systems, which model. Article summary: OpenAI’s August 2026 results position Jalapeño as a potentially much more efficient, lower-latency option for high-volume LLM serving than the specific Nvidia GB200 and GB300 configurations tested—not as a general replac. Topic tags: general, news, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
OpenAI akhirnya menerbitkan keputusan terperinci pertama untuk Jalapeño, cip silikon tersuainya bagi menjalankan model bahasa besar. Dakwaan utamanya agak khusus: dalam ujian tertentu, Jalapeño mungkin memberikan lebih banyak kerja AI bagi setiap watt dan menghasilkan respons dengan lebih pantas berbanding sistem Nvidia GB200 dan GB300 yang dijadikan perbandingan.
Pada penanda aras awam InferenceX oleh SemiAnalysis, OpenAI melaporkan Jalapeño menghasilkan 1.5–1.9× lebih banyak kerja AI per watt dan latensi hujung ke hujung 1.7–3.6× lebih rendah merentasi tiga model sumber terbuka dengan pemberat model tersedia untuk umum.
Namun, keputusan ini tidak sama dengan bukti bahawa Jalapeño ialah pengganti GPU yang lebih pantas atau lebih murah untuk semua kegunaan. Skop ujiannya terhad, cip ini hanya direka untuk inferens, dan angka utama datang daripada ujian OpenAI sendiri menggunakan silikon kejuruteraan. 14
OpenAI membandingkan Jalapeño dengan sistem Nvidia GB200 dan GB300 menggunakan InferenceX, penanda aras yang cuba mengukur keseluruhan proses melayan satu permintaan AI. Angka kecekapan tenaga dinormalisasikan berdasarkan penarafan kuasa pemecut yang diterbitkan.
Dalam keputusan yang dilaporkan, Jalapeño mencapai:
Jurang latensi terbesar dalam keputusan yang dibekalkan muncul pada DeepSeek R1 670B. Jalapeño menyiapkan permintaan dalam 1.65 saat, berbanding 5.99 saat pada sistem berasaskan GB300. 1112
Angka ini ialah keputusan perbandingan penanda aras, bukannya janji bahawa masa respons ChatGPT akan turun pada kadar sama atau harga API akan terus menjadi lebih murah. Prestasi sebenar bergantung pada model, perisian penyajian, pengelompokan permintaan, rangkaian, panjang konteks, panjang output serta sasaran latensi atau daya pemprosesan.
Ujian melibatkan tiga model sumber terbuka yang tersedia kepada umum:
| Model | Sistem Nvidia yang dibandingkan | Keputusan Jalapeño yang dilaporkan |
|---|---|---|
| GPT-OSS 120B | GB200 | Kira-kira 1.9× lebih banyak kerja per watt; latensi 1.03 saat berbanding 1.80 saat |
| DeepSeek R1 670B | GB300 | Kira-kira 1.7× lebih banyak kerja per watt; latensi 1.65 saat berbanding 5.99 saat |
| Kimi K2.5 1T | GB300 | Kira-kira 1.5× lebih banyak kerja per watt; latensi 1.56 saat berbanding 5.31 saat |
Angka di atas datang daripada ringkasan keputusan yang dilaporkan, bukan ujian penuh yang diulang secara bebas oleh pihak luar. 61112
Beban kerja itu secara nominalnya ialah satu pusingan, dengan 8,000 token input dan 1,000 token output. Tetapan sebegini membantu menghasilkan perbandingan terkawal, tetapi tidak mewakili semua jenis trafik AI sebenar. Ia belum menjawab persoalan tentang perbualan berbilang pusingan, panggilan alat, aliran kerja ejen AI, respons dengan panjang berubah-ubah, tingkah laku apabila permintaan dikumpulkan, atau pertanyaan dengan konteks yang sangat panjang. 813
Ujian juga bergantung pada gabungan perkakasan dan perisian tertentu. Perubahan pada penyusun kod, kernel, kuantisasi, penjadualan, seni bina model atau timbunan masa jalan Nvidia boleh mengubah saiz jurang tersebut.
Jalapeño ialah litar bersepadu khusus aplikasi, atau ASIC, yang dibangunkan bersama OpenAI dan Broadcom untuk inferens model bahasa besar. Berbeza daripada GPU serba guna, ia dioptimumkan untuk menjalankan model yang telah dilatih dan menghasilkan jawapan. 15
Spesifikasi sistem yang dilaporkan termasuk:
Pada peringkat cip, versi B0 yang dilaporkan menggunakan die pengiraan bersaiz retikel yang dihasilkan melalui proses N3P TSMC, dengan penarafan 13.4 PFLOPS pengiraan MXFP4. 18
Reka bentuknya menekankan keseluruhan sistem, bukannya pemecut yang berdiri sendiri. Memori, sambungan antara cip, rangkaian dan komunikasi berskala rak semuanya penting apabila model yang sangat besar perlu diagihkan merentasi banyak cip. 1819
OpenAI dan Broadcom dilaporkan bergerak daripada konsep kepada peringkat tape-out dalam kira-kira sembilan bulan, tempoh yang sangat singkat bagi cip berprestasi tinggi. 720
Kejuruteraan berbantukan AI menjadi sebahagian daripada proses reka bentuk. Namun, ini tidak bermakna model AI mereka bentuk dan menghasilkan pemproses itu secara autonomi. Proses pembangunan masih melibatkan pasukan manusia dalam seni bina dan kejuruteraan, kerja pelaksanaan semikonduktor oleh Broadcom, rakan kongsi pembuatan serta penyepaduan sistem. 713
Kesimpulan yang lebih munasabah ialah OpenAI menggunakan pengetahuan khususnya tentang beban kerja model bahasa besar, termasuk alat AI dalam aliran kerja kejuruteraan, untuk mereka bentuk bersama perkakasan dan perisian yang menyasarkan tugas penyajian tertentu. Pengkhususan ini boleh meningkatkan kecekapan, tetapi pada masa yang sama menjadikan cip itu kurang fleksibel berbanding GPU boleh atur cara.
Jalapeño dibina untuk menjalankan model yang telah dilatih, bukan untuk melatih model baharu. Oleh itu, OpenAI masih memerlukan pemecut boleh atur cara — khususnya GPU — bagi melatih model hadapan baharu, menjalankan penyelidikan, bereksperimen dan mengendalikan beban kerja yang tidak sesuai dengan reka bentuk inferens tetap. 813
Perbezaan ini mengehadkan maksud dakwaan bahawa Jalapeño “menewaskan Nvidia”. Jalapeño mungkin mengatasi konfigurasi Nvidia yang diuji pada metrik inferens tertentu, sedangkan perkakasan Nvidia masih penting dalam bahagian lain infrastruktur pengkomputeran OpenAI.
ASIC khusus boleh menjadi sangat baik untuk tugasan yang boleh dijangka dan dilakukan pada skala besar, tanpa menggantikan platform lebih luas yang diperlukan untuk latihan serta perubahan model yang pantas.
Keputusan tersebut wajar dibaca sebagai “lebih baik dalam ujian yang dilaporkan ini”, bukannya “sistem AI terbaik secara keseluruhan”. Beberapa batasan penting perlu diambil kira:
Tiada asas daripada keputusan ini untuk mendakwa pengurangan kos sejagat sebanyak 50%, harga API yang pasti lebih rendah atau penggantian Nvidia dalam masa terdekat. Bukti yang dibekalkan hanya menyokong dakwaan prestasi dan kecekapan dalam syarat yang dinyatakan, bukan kesimpulan komersial yang lebih luas.
OpenAI merancang untuk mula menggunakan Jalapeño dalam infrastrukturnya sendiri menjelang akhir 2026, manakala pengeluaran volum dan peluasan penggunaan dijangka berlaku pada 2027. Pelan jangka panjangnya melibatkan pusat data berskala gigawatt bersama Microsoft dan rakan infrastruktur lain, merentasi beberapa generasi cip. 16
Cip ini disasarkan terutamanya untuk keperluan dalaman OpenAI, bukan untuk dijual sebagai pemproses kepada pelanggan luar. Ini bermakna syarikat lain tidak sepatutnya menjangka boleh membeli perkakasan Jalapeño atau menyewa instans awan awam berasaskan Jalapeño berdasarkan pengumuman tersebut. 16
Dengan mengekalkan perkakasan itu untuk kegunaan sendiri, OpenAI boleh mengoptimumkannya untuk model, kernel dan sistem penyajian miliknya. Ia juga tidak perlu memikul tuntutan sokongan perisian, persaingan pelanggan, jualan dan pembinaan ekosistem yang biasanya hadir apabila sesebuah syarikat menjadi pembekal semikonduktor komersial. Rasional strategik ini ialah tafsiran, manakala perkara yang disahkan ialah rancangan penggunaan dalaman, bukan jualan cip kepada pihak luar. 16
Jalapeño lebih tepat difahami sebagai satu komponen dalam portfolio pengkomputeran menyeluruh OpenAI. Strategi syarikat itu menggabungkan kapasiti awan daripada Microsoft dan rakan lain, GPU kelas Nvidia untuk beban kerja yang fleksibel serta berintensifkan latihan, dan silikon tersuai untuk inferens yang stabil dan boleh dijangka. OpenAI menyenaraikan Microsoft, Nvidia, AWS, AMD, Broadcom, Cerebras, CoreWeave, Oracle, SB Energy dan SoftBank dalam portfolio pengkomputerannya.
Pendekatan ini mencerminkan perubahan lebih luas dalam industri. Google membangunkan TPU, Amazon menawarkan Trainium dan Inferentia, Microsoft mempunyai Maia, AMD bersaing melalui GPU AI serba guna, manakala Nvidia terus membekalkan sistem AI yang boleh diprogramkan secara meluas. Anthropic juga sedang meneroka infrastruktur yang semakin disesuaikan melalui hubungan awannya, walaupun bukti penanda aras yang dibekalkan tidak memberikan perbandingan prestasi langsung dengan sistem Anthropic.
Kesan strategik terdekatnya lebih rumit daripada naratif penggantian GPU. Jalapeño boleh memberikan OpenAI lebih kawalan terhadap kos inferens, latensi, bekalan dan hala tuju perkakasannya. Nvidia pula kekal penting untuk latihan serta penyelidikan yang memerlukan fleksibiliti, sementara cip tersuai OpenAI menyediakan pilihan khusus bagi beban kerja penyajian yang berjumlah besar dan coraknya lebih mudah dijangka. 813
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
OpenAI melaporkan Jalapeño menghasilkan 1.5–1.9× lebih banyak kerja AI per watt dan latensi hujung ke hujung 1.7–3.6× lebih rendah berbanding sistem Nvidia GB200 dan GB300 yang diuji pada Ogos 2026.
OpenAI melaporkan Jalapeño menghasilkan 1.5–1.9× lebih banyak kerja AI per watt dan latensi hujung ke hujung 1.7–3.6× lebih rendah berbanding sistem Nvidia GB200 dan GB300 yang diuji pada Ogos 2026. Ujian menggunakan GPT OSS 120B, DeepSeek R1 670B dan Kimi K2.5 1T melalui penanda aras InferenceX SemiAnalysis, dengan beban kerja satu pusingan yang melibatkan 8,000 token input dan 1,000 token output.
Jalapeño ialah ASIC 700 watt yang dibangunkan bersama Broadcom khusus untuk inferens.