Kos yang diramalkan Gartner merujuk kepada kos inferens bagi setiap aliran kerja yang selesai, bukannya semata-mata harga token yang dipaparkan pada halaman penetapan harga. Kos inferens merangkumi pengiraan berulang yang diperlukan untuk menghasilkan keputusan akhir.
Sistem berasaskan ejen menambah kerja pada beberapa peringkat:
Apabila konteks terkumpul, panggilan seterusnya juga mungkin membawa lebih banyak maklumat daripada langkah sebelumnya. Model penaakulan yang lebih berkeupayaan pula boleh menggunakan lebih banyak token dan kuasa pengiraan ketika melalui pelbagai keputusan.
Laporan mengenai analisis Gartner menyatakan bahawa ejen boleh memerlukan antara lima hingga 30 kali lebih banyak token berbanding chatbot untuk tugasan yang setara, walaupun jumlah sebenar bergantung pada reka bentuk aliran kerja dan konfigurasi model.
Kesannya berganda: sesebuah aliran kerja boleh menggunakan lebih banyak panggilan, konteks yang lebih panjang dan model yang lebih mahal pada masa yang sama. Maka, kos sebenar bukan sekadar kadar token, tetapi gabungan harga token, jumlah token, pilihan model dan struktur aliran kerja.
Model Tokenomics Gartner melihat kerja AI sebagai beberapa tahap senario yang semakin mencabar, bukannya menganggap setiap “permintaan” sebagai unit kerja yang sama. Gambaran umum yang tersedia kepada umum adalah seperti berikut:
Bahan yang diterbitkan menyokong arah tangga kos ini serta ambang utama: menghalakan tugasan kepada model penaakulan berasaskan ejen boleh meningkatkan kos inferens sekurang-kurangnya lima kali ganda berbanding chatbot asas, dan kos itu boleh meningkat lagi apabila tugasan menjadi lebih kompleks. Namun, laporan yang tersedia tidak memberikan angka pengganda yang boleh dipercayai bagi setiap kategori—pelaksanaan asas, perancangan, pembelajaran dan penaakulan lanjutan. Angka sedemikian tidak wajar dipersembahkan sebagai penanda aras Gartner yang telah disahkan secara terbuka.
Tidak. Paradoks ini bukan bermaksud kecekapan perkakasan, seni bina model atau ekonomi token tidak lagi bertambah baik. Sebaliknya, peningkatan kecekapan boleh merangsang permintaan terhadap sistem yang lebih berkuasa.
Apabila model termaju menjadi lebih murah untuk digunakan, organisasi boleh membina aplikasi yang sebelum ini dianggap terlalu mahal. Mereka juga mungkin memberikan lebih banyak autonomi kepada ejen, membenarkan penggunaan lebih banyak alat, konteks yang lebih panjang dan lebih banyak peluang untuk membuat penaakulan.
Semua penambahan itu meningkatkan jumlah inferens bagi setiap tugasan yang selesai. Dalam kerangka Gartner, keupayaan dan penggunaan boleh berkembang lebih pantas daripada penurunan kos seunit.
Perbezaan ini penting ketika merancang produk AI. Harga token yang lebih rendah memang boleh memperbaiki ekonomi beban kerja yang kekal sama. Namun, ia tidak menjamin kos yang lebih rendah bagi setiap hasil perniagaan apabila beban kerja itu sendiri berubah.
Padankan keupayaan model dengan tahap kesukaran tugasan. Hantar kerja yang bersifat deterministik, pencarian maklumat, pengelasan dan berisiko rendah kepada model yang lebih kecil atau murah. Simpan model penaakulan termaju untuk langkah tertentu yang terbukti mendapat manfaat daripada keupayaan tambahannya. Gartner turut menyarankan pengasingan tahap inferens, had token dan pemantauan.
Tetapkan had pada pemboleh ubah yang boleh menyebabkan ejen melebihi bajet, termasuk:
Penyimpanan hasil yang stabil, pemangkasan atau ringkasan sejarah, output alat yang berstruktur dan penyerahan kes luar biasa kepada manusia boleh mengurangkan panggilan tidak perlu tanpa menghapuskan autonomi pada bahagian aliran kerja yang benar-benar bernilai.
Kos setiap token dan kos setiap panggilan ejen ialah ukuran yang tidak lengkap. Pasukan juga perlu menjejaki kos bagi setiap hasil perniagaan yang selesai—seperti kes yang diselesaikan, tuntutan yang diluluskan, prospek yang layak atau tugasan kejuruteraan yang disiapkan—bersama kualiti, kependaman, kadar kegagalan dan campur tangan manusia.
Projek perintis yang munasabah perlu menetapkan proses asas dan ambang kualiti sasaran sebelum menilai sama ada ejen menghasilkan nilai yang mencukupi untuk dikembangkan.
Pengebilan berdasarkan penggunaan boleh mendedahkan organisasi kepada kos tidak dijangka apabila aliran kerja menjadi rekursif, panjang atau terlalu autonomi. Had bajet, kuota bagi setiap aliran kerja, telemetri kos masa nyata, amaran serta mekanisme chargeback atau showback boleh menjadikan penggunaan lebih telus sebelum sistem diperluas ke skala pengeluaran.
Ekonomi model tidak kekal sama. Aliran kerja yang pada hari ini memerlukan model termaju berpremium mungkin kelak boleh dikendalikan oleh model yang lebih murah, model terlaras halus atau model dipadatkan. Dalam sesetengah keadaan, automasi deterministik juga mungkin memadai.
Oleh itu, nilai semula gabungan model dan aliran kerja secara berkala. Jangan anggap seni bina hari ini akan kekal paling menjimatkan.
Gartner meramalkan lebih 40% inisiatif AI berasaskan ejen akan dibatalkan menjelang akhir 2027 akibat kos yang meningkat, nilai perniagaan yang tidak jelas atau kawalan risiko yang tidak mencukupi. Ramalan itu ialah amaran supaya organisasi tidak memperluas autonomi sebelum ekonomi dan tadbir urusnya difahami—bukan dakwaan bahawa setiap pelaksanaan ejen pasti gagal.
Pelaksanaan yang dioptimumkan masih boleh menghasilkan pulangan pelaburan apabila ia mempercepatkan atau menggantikan proses yang bernilai dan berulang. Ujian paling penting ialah sama ada nilai tambahan daripada penaakulan, penyelarasan dan autonomi melebihi kos tambahan inferens serta operasi.
Anggap harga token dan jumlah kos ejen boleh bergerak dalam arah yang bertentangan. Token hanyalah satu komponen bajet. Organisasi perlu memodelkan keseluruhan aliran kerja, menggunakan konfigurasi paling rendah yang masih memenuhi sasaran kualiti, menetapkan had operasi dan menambah autonomi hanya selepas bukti pengeluaran menunjukkan peningkatan pada hasil perniagaan yang jelas.