| Saiz permintaan | Input | Input dicache | Output |
|---|---|---|---|
| Kurang daripada 200,000 token input | AS$2 | AS$0.50 | AS$6 |
| 200,000 token atau lebih | AS$4 | AS$1 | AS$12 |
Perkara paling penting untuk perancangan kos ialah kadar konteks panjang terpakai apabila permintaan memasuki julat 200,000 token. Pasukan yang membina ejen dan kerap menghantar keseluruhan repositori kod, dokumen besar atau sejarah perbualan perlu membuat anggaran berdasarkan ambang ini—bukan hanya menggunakan harga utama AS$2 untuk input dan AS$6 untuk output.
Pengecaman atau caching boleh mengurangkan bahagian input dalam bil, tetapi ia tidak menghapuskan keperluan untuk mengawal pertumbuhan konteks. Reka bentuk produksi yang baik patut mengukur saiz arahan, kadar penggunaan semula cache, panjang output dan peningkatan kualiti yang diperoleh daripada konteks tambahan sebelum menetapkan bajet konteks yang besar.
xAI melaporkan bahawa Grok 4.6 mencapai skor 70.8% di CursorBench 3.2 apabila menggunakan tetapan “extra high thinking”, berbanding 70.5% yang dilaporkan untuk Fable 5 Max. xAI turut mendakwa kos bagi setiap tugasan yang berjaya diselesaikan adalah kira-kira satu per enam daripada kos pesaing tersebut.
Dakwaan itu sememangnya menarik, tetapi perbezaannya hanya 0.3 mata peratusan dan datang daripada perbandingan penanda aras yang dilaporkan vendor. Ia wajar dianggap sebagai isyarat untuk ujian lanjut, bukannya bukti bahawa Grok 4.6 pasti mengatasi model lain pada repositori kod, alat, sasaran kependaman atau keperluan kebolehpercayaan organisasi tertentu.
Gambaran daripada penilaian lain juga memerlukan sedikit berhati-hati. Perbandingan yang diterbitkan di tempat lain melaporkan skor berbeza mengikut penanda aras dan konfigurasi, termasuk keputusan 69.9% untuk CursorBench dalam satu jadual perbandingan. Keputusan boleh berubah berdasarkan arahan, rangka penilaian, tetapan model dan tarikh ujian. Oleh itu, pembeli patut mengulangi perbandingan menggunakan tugasan yang benar-benar mewakili operasi mereka.
Selain API xAI, Grok 4.6 diedarkan melalui pelbagai saluran pembangun dan awan, termasuk Cursor, GitHub Copilot, Amazon Bedrock, OpenRouter, Vercel dan Cloudflare. Amazon mengumumkan ketersediaan di Bedrock pada 19 Ogos, seminggu selepas pelancaran awal model itu.
Vertex AI menyediakan jenis akses yang berbeza. Bagi pelanggan Google Cloud, kelebihannya bukan sekadar mendapatkan satu lagi endpoint API. Mereka boleh menilai model dalam persekitaran kawalan awan dan proses perolehan yang sudah dikenali—termasuk pengurusan eksperimen, kebenaran akses dan perbelanjaan. Ini boleh mengurangkan halangan untuk mencuba model baharu.
Namun, laluan melalui platform terurus tidak menghapuskan kerja pemilihan model. Pasukan masih perlu menyemak ketersediaan rantau, kuota, pengendalian data, jangkaan tahap perkhidmatan, tingkah laku panggilan alat, pemantauan serta cara sistem bertindak apabila berlaku kegagalan. Grok 4.6 juga masih berada pada peringkat Preview di platform Google, jadi penggunaan awal lebih wajar dianggap sebagai penilaian terkawal dan bukannya tanda bahawa perkhidmatan itu sudah stabil untuk semua sistem produksi.
Penilaian praktikal boleh memberi tumpuan kepada empat bidang:
Pelancaran Grok 4.6 di Vertex AI lebih penting dari sudut pengedaran berbanding satu angka penanda aras. Model ini menggabungkan tetingkap konteks besar dan ciri berorientasikan ejen dengan harga utama yang menggalakkan percubaan. Pengedarannya yang pantas merentas API, persekitaran pembangunan bersepadu, platform hos dan pasaran awan pula mengurangkan usaha untuk mula mengujinya.
Bagi pembeli perusahaan, kesimpulannya bersyarat. Grok 4.6 kini lebih mudah dinilai dalam ekosistem Google Cloud, tetapi nilainya akan bergantung pada keputusan ujian beban kerja sebenar, ekonomi permintaan konteks panjang dan kesesuaian ciri Preview dengan keperluan tadbir urus syarikat. Kelebihan 0.3 mata dalam penanda aras itu patut disiasat—bukan diterima sebagai kelebihan kekal.