Jumlah token ialah petunjuk berguna untuk mengukur permintaan, tetapi ia tidak menggambarkan beban kerja yang seragam. Token untuk sembang mudah atau tugasan kos rendah boleh dihasilkan menggunakan perkakasan lebih murah. Sebaliknya, jawapan daripada model lebih berkuasa, proses penaakulan yang panjang atau panggilan alat berulang memerlukan lebih banyak pengkomputeran—dan lazimnya lebih bernilai kepada pelanggan.
Sebab itu, peningkatan jumlah token keseluruhan boleh menyembunyikan kekurangan yang lebih serius dalam kapasiti inferens premium. Pasaran mungkin menghasilkan lebih banyak token secara agregat, tetapi pada masa yang sama mengalami kekurangan perkakasan yang diperlukan untuk memberikan hasil yang boleh dipercayai bagi tugasan kompleks.
Tumpuan pelaburan terhadap kapasiti menghasilkan token berkualiti tinggi dan sistem yang menggabungkan pelbagai jenis perkakasan mencerminkan perbezaan ini.
Purata panggilan token AI harian di China melebihi 140 trilion pada Mac 2026, berbanding kira-kira 100 bilion pada awal 2024—peningkatan lebih daripada 1,000 kali ganda menurut angka yang dilaporkan daripada Pentadbiran Data Nasional China.
Lonjakan itu menunjukkan perubahan dalam cara AI digunakan. Model tidak lagi terhad kepada eksperimen atau arahan terpencil, sebaliknya semakin terbina dalam pembantu digital, perisian perusahaan dan ejen yang menjalankan aliran kerja sebenar. Akibatnya, inferens menjadi pemacu utama penggunaan kuasa pengkomputeran, bukan sekadar langkah susulan selepas latihan model.
Menambah pemproses berprestasi tinggi bukan mudah. Akses kepada produk Nvidia canggih terhad oleh kawalan eksport, bekalan yang terbatas dan kos tinggi untuk menggantikan ekosistem perkakasan. Pembangun AI China juga menanggung kos peralihan yang besar kerana model, alat dan aliran kerja sedia ada banyak bergantung pada platform perisian yang telah mapan.
Pengoptimuman perisian tidak boleh menghasilkan cip baharu, tetapi ia boleh meningkatkan jumlah kerja berguna yang diperoleh daripada setiap pemproses yang tersedia. Antara pendekatan praktikal ialah:
Langkah-langkah ini menjadi jambatan antara permintaan yang semakin meningkat dengan bekalan yang terhad. Namun, ia bukan pengganti penuh kepada perkakasan termaju, terutama bagi tugasan yang sensitif terhadap kualiti dan masih bergantung pada kumpulan pemproses yang lebih kecil.
Masalah kekurangan kapasiti menjadi lebih sukar kerana harga inferens berada di bawah tekanan. Penganalisis Jefferies menganggarkan kos model China secara purata kira-kira satu per enam daripada harga setiap token yang ditawarkan syarikat utama Amerika Syarikat.
Harga rendah boleh mempercepatkan penggunaan, tetapi pada masa yang sama mengehadkan hasil yang boleh digunakan untuk membiayai kapasiti pengkomputeran premium. Pembantu pengekodan dan produk berasaskan ejen pula boleh menggunakan jauh lebih banyak sumber berbanding sembang biasa.
Syarikat AI China akhirnya berdepan gabungan masalah yang rumit: permintaan berkembang pantas, pelanggan menjangkakan akses murah dan kapasiti inferens paling berkuasa sukar diperluas atau digantikan.
Tekanan itu sudah mula kelihatan pada ketersediaan perkhidmatan. Satu laporan pasaran menyebut pembangun model utama dan penyedia awan China mengehadkan kelajuan perkhidmatan, mencatu akses atau menaikkan harga apabila permintaan melebihi sumber pengkomputeran yang tersedia—terutamanya bagi pembantu pengekodan yang memerlukan banyak sumber.
Cabaran infrastruktur AI China bukan semata-mata kekurangan cip. Ia ialah kekurangan gabungan yang tepat antara pemproses canggih, perisian serasi dan kapasiti inferens bernilai tinggi yang boleh ditawarkan pada kos berpatutan.
Perkakasan domestik boleh mengambil alih bahagian kerja yang lebih besar apabila perisian bertambah baik dan sistem direka mengikut kekuatannya. Namun, bukti semasa menunjukkan strategi peralihan: mengoptimumkan setiap lapisan inferens, menggunakan cip domestik apabila sesuai dan menyimpan kapasiti Nvidia yang terhad untuk tugasan paling sukar.
Pendekatan itu boleh memanjangkan hayat sumber sedia ada. Tetapi jika penggunaan AI berasaskan ejen terus berkembang, China akhirnya perlu menambah bukan sahaja bekalan perkakasan, malah ekosistem perisian yang membolehkan pelbagai jenis pemproses digunakan secara praktikal dan cekap.