“Selama bertahun-tahun, perisian diukur melalui penggunaan: jumlah lesen, pengguna aktif dan pembaharuan. AI berbeza—ia perlu diukur berdasarkan kerja yang diselesaikan,” kata Friar dalam satu hantaran di LinkedIn .
Inti pati kerangka itu ialah harga token yang rendah tidak semestinya membawa kepada kos hasil kerja yang paling rendah. Model yang lebih murah tetapi kerap melakukan kesilapan boleh menyebabkan kos keseluruhan lebih tinggi berbanding model premium yang berjaya menyiapkan tugasan dengan sekali percubaan .
Friar mencadangkan agar syarikat menggantikan metrik penggunaan yang umum dengan empat soalan yang lebih konkrit dan boleh diaudit .
Syarikat perlu mengukur hasil kerja sebenar, bukan hanya jumlah pertanyaan atau arahan yang dihantar kepada AI. Contohnya termasuk jumlah isu pelanggan yang berjaya diselesaikan, perubahan kod yang dihantar atau kontrak yang selesai disemak .
Dengan pendekatan ini, fokus beralih daripada metrik aktiviti—berapa banyak AI digunakan—kepada metrik kesan: apa yang berjaya disiapkan.
“Token mencipta nilai apabila ia berubah menjadi kerja yang boleh digunakan oleh manusia,” tulis Friar .
Pengiraan perlu merangkumi keseluruhan kos bagi tugasan yang memenuhi piawaian kualiti. Ini termasuk kos inferens AI, percubaan semula, semakan manusia, pembetulan dan kerja semula .
Maka, harga setiap token hanyalah sebahagian kecil daripada gambaran sebenar. Kos tersembunyi akibat jawapan yang salah atau perlu diperbaiki boleh mengubah kiraan ROI dengan ketara.
Syarikat juga perlu mengukur kebolehpercayaan—iaitu kadar output yang “sedia digunakan” berbanding output yang memerlukan pembetulan atau perlu dirujuk kepada manusia .
Semakin sedikit campur tangan manusia diperlukan, semakin rendah kos keseluruhan dan semakin tinggi tahap kepercayaan terhadap sistem. Dalam erti kata lain, keupayaan AI tidak boleh dinilai hanya berdasarkan kecanggihannya; konsistensi dan ketepatan juga penting.
Soalan terakhir menilai sama ada AI mampu menyiapkan lebih banyak kerja berkualiti dari semasa ke semasa tanpa pertumbuhan kos yang melampau . Konsep ini turut dikaitkan dengan pulangan atas pengkomputeran (return on compute, atau ROC), istilah yang dipinjam daripada bidang semikonduktor dan kewangan pusat data.
Ukuran ini membantu syarikat menentukan sama ada pelaburan AI menghasilkan pulangan yang semakin meningkat apabila diperluas, atau sebaliknya mengalami pulangan marginal yang semakin berkurangan.
Kerangka ini direka supaya boleh diaudit menggunakan alat dan sistem sedia ada . Secara asasnya, pasukan perlu:
Pendekatan ini melihat AI sebagai aset produktif, bukannya sekadar lesen perisian. Ia juga memberi CFO dan pemimpin teknologi kaedah yang lebih tersusun untuk menjawab soalan yang sering dikemukakan dalam bilik mesyuarat: bagaimanakah syarikat boleh memperoleh lebih banyak nilai daripada perbelanjaan AI?
Cadangan Friar muncul ketika perbelanjaan perusahaan untuk AI meningkat dengan pantas. OpenAI sebelum ini melaporkan hasil bulanan sebanyak AS$1 bilion dan lebih 500 juta lesen perusahaan terjual . Namun begitu, banyak organisasi masih belum mempunyai kaedah yang jelas untuk mengukur ROI, lalu wujud jurang antara keupayaan AI dengan nilai yang benar-benar berjaya ditangkap oleh syarikat .
Friar sebelum ini menggambarkan jurang tersebut sebagai “lebihan keupayaan” (capability overhang)—iaitu perbezaan antara apa yang mampu dilakukan oleh AI dengan apa yang berjaya dimanfaatkan oleh organisasi untuk menghasilkan nilai perniagaan .
Dengan menggabungkan data kos, kualiti dan hasil kerja yang boleh disemak, kerangka “kecerdasan berguna bagi setiap dolar” cuba mengalihkan keputusan pelaburan AI daripada bergantung pada keyakinan semata-mata kepada penilaian berasaskan bukti.