Copilot amat terdedah kepada pertukaran ini kerana model perniagaannya bergantung pada keupayaan mengendalikan jumlah permintaan inferens yang besar pada kos yang boleh dijangka. Cip yang lebih cekap boleh membantu ekonomi tersebut—tetapi hanya selepas cip berkenaan disambungkan kepada kelompok pengkomputeran yang berfungsi.
Maia 200 Microsoft direka khususnya untuk inferens, iaitu peringkat apabila model yang telah dilatih menghasilkan jawapan. Microsoft mendakwa cip itu menawarkan prestasi FP4 dan FP8 yang lebih tinggi berbanding pemecut AWS dan Google yang setanding. Namun, perbandingan tersebut ialah dakwaan pengeluar, bukannya penanda aras bebas dari hujung ke hujung.
Laporan lain meletakkan kelebihan kos operasi Maia 200 pada sekitar 30% hingga 40% berbanding perkakasan Nvidia terkemuka untuk beban kerja Microsoft dan OpenAI. Angka itu kekal sebagai anggaran yang dilaporkan, bukan jaminan bagi setiap model, susunan perisian atau tahap penggunaan.
Logik strategiknya jelas: jika Maia berfungsi seperti yang dijangka pada skala produksi, Microsoft boleh mengurangkan pergantungan kepada Nvidia bagi beban kerja inferens tertentu dan memperbaiki struktur kos perkhidmatan seperti Copilot serta Azure OpenAI. Tetapi cip tersuai tidak menghapuskan keperluan fizikal di sekelilingnya. Maia masih memerlukan memori jalur lebar tinggi, pembungkusan cip, rangkaian, rak, penyejukan dan bekalan elektrik yang mencukupi.
Ringkasnya, Maia boleh memperbaiki ekonomi sebuah pusat data yang sedang beroperasi. Ia tidak boleh menghidupkan pusat data yang belum siap atau belum mendapat bekalan kuasa.
Reuters melaporkan bahawa Microsoft merancang memperkenalkan Maia 300 seawal musim luruh ini dan sedang berbincang dengan TSMC mengenai kapasiti pembuatan untuk lebih 300,000 cip yang disasarkan dihantar pada 2027. Laporan itu turut menyebut cita-cita jangka panjang melebihi satu juta unit.
Angka tersebut wajar dilihat sebagai rancangan yang masih dalam rundingan, bukannya penghantaran yang telah disahkan. Microsoft mempertikaikan angka yang dilaporkan itu. Selain mendapatkan kapasiti daripada kilang TSMC, Microsoft masih perlu memperoleh memori dan komponen lain, menyepadukan sistem serta memasangnya di kemudahan yang mempunyai bekalan kuasa.
Jika peningkatan pengeluaran itu benar-benar berlaku, Maia 300 boleh mengubah usaha cip tersuai Microsoft daripada program dalaman yang agak terhad kepada sumber kapasiti inferens alternatif yang penting. Kejayaannya bergantung pada penyelarasan masa: pembuatan, penyepaduan sistem dan kesiapsiagaan pusat data mesti tiba hampir serentak.
AWS mempunyai jejak pemecut tersuai yang lebih matang. Amazon berkata 1.4 juta cip Trainium merentasi tiga generasi telah digunakan, dengan lebih satu juta cip Trainium2 digunakan oleh Claude milik Anthropic, menurut TechCrunch. AWS juga mengendalikan Inferentia sebagai rangkaian berasingan yang berfokus pada inferens, memberikannya pengalaman dalam kedua-dua beban kerja latihan dan penyampaian model.
Program TPU Google pula mempunyai sejarah pengeluaran yang lebih panjang. Seni bina Ironwood miliknya dilaporkan boleh diskalakan kepada pod yang mengandungi 9,216 cip. Laporan lain menyebut Anthropic boleh mendapat akses kepada sehingga satu juta TPU Google, tetapi angka itu ialah komitmen kapasiti dan tidak sepatutnya dianggap sebagai perbandingan muktamad dengan jumlah cip yang telah dipasang.
Tiada kedudukan awam yang benar-benar setara untuk membandingkan jumlah keseluruhan cip AI Microsoft dengan AWS dan Google. Setiap syarikat mengira generasi cip, beban kerja, model pemilikan serta ukuran “dipasang”, “digunakan” atau “dijanjikan” dengan cara berbeza.
Kesimpulan yang lebih selamat adalah lebih terhad: AWS dan Google kelihatan mendahului dari segi penggunaan cip tersuai yang matang serta pengalaman operasi, manakala Microsoft sedang cuba mengejar melalui Maia.
Microsoft bukan satu-satunya syarikat yang berdepan masalah ini. Satu laporan yang diringkaskan Ars Technica mendapati kira-kira 40% projek pusat data di Amerika Syarikat yang dirancang untuk 2026 berisiko mengalami kelewatan, susulan kekurangan tenaga kerja, bekalan elektrik dan bahan binaan serta cabaran mendapatkan permit.
Memori juga menjadi kekangan. Laporan industri mengunjurkan pusat data mungkin menggunakan lebih 70% pengeluaran memori berprestasi tinggi pada 2026, sementara ketua eksekutif Synopsys berkata krisis semikonduktor boleh berterusan hingga 2027. Keadaan ini boleh meningkatkan kos dan memanjangkan tempoh menunggu bagi industri lain, walaupun kesannya berbeza mengikut jenis memori, pembekal dan kontrak.
Situasi tersebut boleh membesarkan jurang antara kapasiti AI yang dirancang dengan kapasiti AI yang benar-benar boleh digunakan. Syarikat yang sudah memiliki tapak berkuasa, komitmen utiliti lebih awal, rantaian bekalan yang matang dan kelompok operasi yang besar boleh terus menambah beban kerja, sementara kemudahan baharu menunggu transformer, sistem penyejukan, pekerja mahir atau sambungan grid.
Kelewatan pusat data tidak membatalkan strategi AI Microsoft, tetapi strategi itu sangat bergantung pada urutan pelaksanaan. Microsoft boleh membeli cip pemecut, mereka bentuk cip Maia dan menandatangani perjanjian pembuatan; tiada satu pun langkah itu secara automatik menghasilkan kapasiti pengkomputeran yang boleh ditawarkan kepada pelanggan.
Risiko jangka pendeknya ialah pertumbuhan kapasiti Azure yang lebih perlahan dan kos inferens marginal yang lebih tinggi untuk produk seperti Copilot serta Azure OpenAI. Risiko persaingannya pula ialah AWS dan Google menggunakan cip tersuai yang sudah digunakan pada skala besar untuk menawarkan harga, ketersediaan dan pengalaman pembangun yang lebih baik sebelum gelombang kemudahan serta cip Maia seterusnya Microsoft beroperasi.
Maia 200 mungkin mengurangkan kos selepas Microsoft dapat memasangnya pada skala besar. Maia 300 pula boleh mempelbagaikan bekalan pada 2027 jika rancangan pembuatan yang dilaporkan itu menjadi kenyataan. Buat masa ini, cabaran utama infrastruktur AI Microsoft mudah disebut tetapi sukar diselesaikan: menukar cip yang telah dibeli dan rancangan yang besar kepada kapasiti yang mempunyai kuasa serta bersedia untuk produksi.