Nvidia berkata metrik utama kilang AI kini ialah token ejen yang disahkan bagi setiap megawatt, bukan prestasi puncak cip sahaja. Ujian Lambda pada kluster HGX B200 melaporkan peningkatan 24% dalam pemprosesan token dan 23% dalam prestasi setiap watt di bawah bajet kuasa yang sama.
Diterbitkan olehDisunting dengan GPT-5.6 TerraImej dijana dengan GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Nvidia present on the opening day of its AI Infra Summit about transforming AI factories from systems optimized primarily for raw p. Article summary: Nvidia’s opening-day message was that an AI factory should be measured not only by peak compute, but by validated agentic tokens produced per megawatt—requiring integrated design across silicon, systems, networking, soft. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Bekalan elektrik kini menjadi salah satu had utama untuk membina infrastruktur AI — bukan sekadar jumlah GPU yang boleh dimuatkan dalam satu rak pelayan. Itulah mesej utama Nvidia pada hari pembukaan AI Infra Summit 2026 di Santa Clara: kilang AI perlu dinilai berdasarkan token ejen bagi setiap megawatt, iaitu berapa banyak kerja inferens yang benar-benar berguna dapat dihasilkan dalam had kuasa sedia ada. 2
3
Ian Buck, naib presiden pengkomputeran hyperscale dan prestasi tinggi Nvidia, membentangkan pendekatan ini. Hujah Nvidia melangkaui kelajuan GPU: untuk kekal produktif apabila kuasa elektrik menjadi kekangan, kilang AI perlu menyelaraskan pengkomputeran, rangkaian, perisian inferens, penyejukan, kawalan kuasa dan operasi grid. 1
2
3
Keputusan paling konkrit datang daripada penyedia awan AI, Lambda, yang menjalankan pengesahan pertama dalam persekitaran penggunaan sebenar bagi Nvidia DSX MaxLPS pada pelayan GPU HGX B200. Menurut Nvidia, DSX MaxLPS memantau penggunaan kuasa GPU dan tahap rak, kemudian mengagihkan semula lebihan kapasiti kuasa antara nod. 2
3
Dalam kluster lima rak dengan 19 nod, Lambda menjalankan 19 nod menggunakan bajet kuasa yang lazimnya hanya menampung 16 nod pada kuasa penuh. Nvidia melaporkan pemprosesan token kluster meningkat 24%, daripada kira-kira 4 juta kepada 5 juta token sesaat, manakala prestasi setiap watt meningkat 23%. 2
3
Nilai keputusan ini terletak pada operasi pusat data. Kapasiti sesebuah tapak sering dihadkan oleh jumlah kuasa yang benar-benar boleh dibekalkan. Jika profil penggunaan kuasa beban kerja berubah-ubah, perisian yang menggunakan lebihan kapasiti tersebut boleh meningkatkan output tanpa perlu menaik taraf sambungan elektrik atau memperbesar bajet kuasa kemudahan.
Nvidia turut menggariskan potensi bagi penggunaan Vera Rubin NVL72 pada masa depan. Syarikat itu berkata DSX MaxLPS boleh membolehkan sehingga 40% lebih kapasiti GPU dalam had kuasa tapak yang sama, serta sehingga 35% lebih pemprosesan token, bergantung pada keadaan penggunaan. 2
3
Namun, angka ini perlu dibaca berbeza daripada keputusan Lambda. Pengukuran Lambda ialah keputusan penggunaan yang dilaporkan pada sistem berasaskan Blackwell, manakala angka Vera Rubin ialah unjuran Nvidia bagi platform masa hadapan. 2
3
Tema kedua Nvidia ialah fleksibiliti. Tidak semua tugasan pengkomputeran mempunyai tahap keutamaan yang sama; kilang AI sepatutnya boleh bertindak balas kepada isyarat grid tanpa menghentikan semua kerja.
Di kilang AI Eos milik Nvidia, platform Conductor daripada Emerald AI bekerjasama dengan Silicon Valley Power dalam program beban fleksibel berskala komersial. Nvidia melaporkan sistem itu memberi respons kepada lebih 200 isyarat permintaan daripada utiliti. Dalam satu demonstrasi, penggunaan kuasa kemudahan diturunkan daripada 4 MW kepada 3 MW dalam masa kurang satu minit, dengan kerja pengkomputeran fleksibel diturunkan keutamaan sementara inferens yang lebih penting diteruskan. 2
3
Nvidia meletakkan program itu sebagai contoh awal kepada keupayaan yang dirancang untuk DSX Flex. Syarikat tersebut menerangkan DSX Flex sebagai kaedah untuk menerima isyarat pengurangan beban, respons permintaan dan harga tenaga, kemudian menggunakan keutamaan beban kerja supaya tugasan yang boleh ditangguhkan boleh dihentikan seketika dan disambung semula, sementara perkhidmatan kritikal kekal berjalan. Demonstrasi Eos sendiri ialah bukti awal berskala komersial, bukannya pemasangan DSX Flex. 2
3
Bagi pengendali pusat data, perbezaan ini penting. Latihan model, pemprosesan kelompok dan tugasan luar talian tidak semestinya memerlukan respons sepantas inferens produksi. Menjadikan sebahagian beban pengkomputeran lebih fleksibel berpotensi membolehkan pusat data menyertai program grid sambil melindungi beban kerja bernilai tinggi.
Pengumuman di sidang kemuncak itu memposisikan Nvidia bukan hanya sebagai pembekal komponen, tetapi sebagai penyedia platform kilang AI. Susunan yang dicadangkannya merangkumi pengkomputeran Vera Rubin, rangkaian skala-naik NVLink, perisian inferens Dynamo, rangkaian Ethernet dan SuperNIC, komponen infrastruktur BlueField, pengoptimuman kuasa peringkat rak serta operasi beban kerja yang peka kepada grid. 2
Groq 3 LPX juga menjadi sebahagian daripada strategi ini. Nvidia menggambarkannya sebagai pemecut inferens interaktif untuk Vera Rubin, direka bagi keperluan kependaman rendah dan konteks besar sistem AI ejen. 1
12 Bukti yang dibekalkan menyokong peranan tersebut, tetapi tidak mengesahkan secara bebas dakwaan lebih khusus tentang jadual pelancaran, perbandingan pemprosesan setiap megawatt sebanyak 35 kali, atau prestasi pada model melebihi dua trilion parameter.
Mesej infrastruktur ini muncul ketika perniagaan pusat data Nvidia terus berkembang. Bagi suku kedua tahun fiskal 2027 yang berakhir pada 26 Julai 2026, Nvidia melaporkan hasil AS$96.2 bilion, naik 106% berbanding setahun sebelumnya. Hasil perniagaan Pusat Data pula berjumlah AS$89.0 bilion. 17 Syarikat itu mengunjurkan hasil suku ketiga sebanyak AS$108 bilion, dengan julat tambah atau tolak 2%.
28
30
Skala kewangan tersebut membantu menerangkan mengapa Nvidia memberi tumpuan kepada operasi pada tahap kilang. Apabila pelanggan memasang lebih banyak kapasiti AI, persoalan praktikal bukan lagi hanya GPU mana yang paling laju. Ia juga melibatkan cara mendapatkan bekalan elektrik, meningkatkan output dalam had kuasa tetap, dan memastikan perkhidmatan inferens terus tersedia ketika berlaku tekanan terhadap bekalan atau operasi.
Nvidia tidak mengatakan prestasi mentah pemecut sudah tidak penting. Sebaliknya, syarikat itu berhujah bahawa prestasi puncak sahaja tidak lagi mencukupi untuk ekonomi kilang AI.
Ukuran yang diketengahkan — token ejen yang disahkan bagi setiap megawatt — menghubungkan prestasi perkakasan dengan kekangan sebenar pengendali: kuasa tapak, kejadian pada grid, keutamaan beban kerja dan ketersediaan sistem. Peningkatan 24% yang dilaporkan Lambda memberikan satu petunjuk awal daripada persekitaran penggunaan sebenar; dakwaan lebih luas Nvidia untuk Vera Rubin dan DSX masih merupakan hala tuju yang perlu dibuktikan dalam operasi pelanggan. 2
3
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Nvidia berkata metrik utama kilang AI kini ialah token ejen yang disahkan bagi setiap megawatt, bukan prestasi puncak cip sahaja.
Nvidia berkata metrik utama kilang AI kini ialah token ejen yang disahkan bagi setiap megawatt, bukan prestasi puncak cip sahaja. Ujian Lambda pada kluster HGX B200 melaporkan peningkatan 24% dalam pemprosesan token dan 23% dalam prestasi setiap watt di bawah bajet kuasa yang sama.
Nvidia turut menonjolkan pengurusan beban responsif grid; unjuran untuk Vera Rubin masih merupakan unjuran, bukannya keputusan penggunaan pelanggan.