Laporan Gartner pada Ogos 2026 memperincikan ramalan perbelanjaan untuk infrastruktur awan yang dioptimumkan AI seperti berikut:
Sebagai perbandingan, pada tahun-tahun awal ledakan AI generatif, latihan mendominasi perbelanjaan infrastruktur. Kini, dinamik itu telah berbalik sepenuhnya .
Pertumbuhan ini tidak terhad kepada inferens. Jumlah perbelanjaan IaaS yang dioptimumkan AI diramal mencecah AS$42.3 bilion pada 2026, peningkatan 96.4% daripada AS$21.5 bilion pada 2025. Pada 2027, pasaran dijangka berkembang lagi kepada AS$66.1 bilion, peningkatan sebanyak 56.5% .
Keseluruhan perbelanjaan IaaS global (termasuk beban kerja bukan AI) diramal mencecah AS$287.3 bilion pada 2026 (naik 29.3% daripada AS$222.2 bilion pada 2025) dan AS$359.9 bilion pada 2027 .
Menurut Gartner, dua kuasa mendorong perbelanjaan inferens melepasi latihan:
Penganalisis Gartner, Hardeep Singh, menyatakan: "Peralihan ini mempercepatkan corak penggunaan awan dan mewujudkan permintaan berterusan untuk infrastruktur yang dioptimumkan AI" .
Corak ini disahkan oleh penganalisis lain. Deloitte's Tech Trends 2026 menganggarkan inferens sudah merangkumi dua pertiga daripada semua pengkomputeran AI pada 2026 . Ramalan bebas The Futurum Group menunjukkan inferens terurus mencecah AS$23.1 bilion pada 2025 (58.6% daripada perbelanjaan infrastruktur), dengan inferens mengatasi latihan pada 2025 .
Angka perbelanjaan Gartner berada dalam gambaran yang lebih besar:
Walaupun kos menurun dengan cepat — Deloitte menyatakan harga API awan inferens telah jatuh hampir 80% tahun ke tahun — perbelanjaan keseluruhan meletup ke atas kerana penggunaan berkembang lebih cepat daripada kos unit menurun .
Gartner juga mengeluarkan penemuan amaran: sekurang-kurangnya 50% inisiatif GenAI akan melebihi bajet yang dirancang menjelang 2028 disebabkan pilihan seni bina yang lemah dan kekurangan kepakaran operasi .
Inferens adalah punca utama. Tidak seperti latihan — perbelanjaan awal yang besar — kos inferens berulang setiap kali pengguna atau aplikasi memanggil model. Gartner menjangka inferens menyumbang sekurang-kurangnya 70% daripada kos seumur hidup model .
Gartner mengesyorkan tindakan strategik berikut:
"Pembalikan Inferens" bukan sekadar statistik perbelanjaan; ia mewakili penyusunan semula asas keutamaan infrastruktur AI. Era membina model yang semakin besar sebagai pemacu kos utama sedang memberi laluan kepada era menjalankan model tersebut pada skala dalam pengeluaran. Bagi penyedia awan, ini bermaksud permintaan berterusan untuk kapasiti GPU dan ASIC. Bagi perusahaan, ini bermaksud perancangan infrastruktur kini mesti memberi tumpuan kepada kos operasi AI, bukan hanya pelaburan awal dalam latihan model.
Seperti yang dinyatakan oleh laporan Gartner, peralihan daripada pembangunan kepada penggunaan telah tiba, dan item baris belanjawan tidak akan kelihatan sama lagi.