| Aspek | Perubahan yang tercatat di sumber publik | Artinya untuk keputusan upgrade |
|---|---|---|
| Rilis dan ketersediaan | LLM Stats mencantumkan tanggal rilis Opus 4.7 pada 16 April 2026; halaman Anthropic menunjukkan developer dapat memakai claude-opus-4-7 melalui Claude API. | Model ini sudah bisa direncanakan untuk pengujian teknis, bukan sekadar pengumuman. |
| Harga | LLM Stats menyebut Opus 4.7 sebagai direct upgrade dari Opus 4.6 dengan harga tetap US$5 per 1 juta token input dan US$25 per 1 juta token output. | Biaya per token tidak naik, tetapi tagihan akhir tetap bergantung pada panjang output, retry, dan desain workflow. |
| Coding dan software engineering | Anthropic menyoroti peningkatan untuk advanced software engineering, terutama tugas yang sulit; LLM Stats mencatat SWE-bench Verified 87,6%, naik 6,8 poin persentase dari 4.6. | Paling menarik untuk tim yang memakai Claude sebagai coding agent, reviewer kode, atau asisten perbaikan bug. |
| Agent jangka panjang | LLM Stats menyebut adanya peningkatan self-verification untuk long-running agentic work; Anthropic juga menyebut long-running tasks sebagai area peningkatan. | |
| Vision | Anthropic menyatakan vision 4.7 lebih baik dan dapat menangani gambar beresolusi lebih tinggi; LLM Stats merangkum dukungan resolusi gambar sekitar 3,3× lebih tinggi. | |
| Kontrol baru | Ringkasan pihak ketiga menyebut xhigh effort dan fitur Task Budgets yang lebih relevan untuk agent serta coding. |
Data benchmark publik memberi sinyal yang cukup konsisten: Opus 4.7 diarahkan untuk menangani coding yang lebih sulit, workflow agentic, dan vision. LLM Stats menyebut Opus 4.7 mencapai 87,6% di SWE-bench Verified, naik 6,8 poin persentase dibanding Opus 4.6, dan menang atas 4.6 pada 12 dari 14 benchmark yang dilaporkan.
Namun, angka seperti ini tetap perlu dibaca dengan kacamata kritis. LLM Stats sendiri mengingatkan bahwa benchmark tersebut merupakan self-reported benchmark dari Anthropic. Verdent AI juga mencatat bahwa contoh Notion dan Rakuten yang dikutip dalam peluncuran Anthropic adalah konteks internal mitra atau benchmark proprietary, bukan evaluasi publik terkontrol yang bisa langsung digeneralisasi ke semua penggunaan.
Jadi, benchmark mendukung kesimpulan bahwa Opus 4.7 kemungkinan lebih kuat untuk coding sulit, agent jangka panjang, dan vision resolusi tinggi. Tetapi benchmark belum cukup untuk menyimpulkan bahwa setiap prompt, format output, atau workflow produksi yang berjalan baik di Opus 4.6 pasti otomatis membaik di 4.7.
Dari rangkuman LLM Stats, Opus 4.7 memakai harga yang sama dengan Opus 4.6 di kelas Opus: US$5 per 1 juta token input dan US$25 per 1 juta token output. Ini membuat uji coba relatif lebih mudah dibenarkan karena Anda tidak perlu langsung menerima kenaikan harga per token.
Tetapi untuk penggunaan produksi, angka token price bukan satu-satunya biaya. Model yang lebih kuat bisa saja menghasilkan jawaban lebih panjang, memakai effort lebih tinggi, atau memicu pola tool calling yang berbeda. Sebaliknya, kalau 4.7 mengurangi retry, human correction, atau error pada tool, biaya per tugas justru bisa turun.
Cara paling sehat adalah menghitung biaya untuk menyelesaikan satu tugas, bukan hanya biaya per 1 juta token. Untuk tim engineering, metrik seperti waktu review manusia, jumlah patch yang benar, keberhasilan test, tool error, retry, dan latency sering kali lebih penting daripada harga token mentah.
Beberapa kelompok pengguna punya alasan kuat untuk segera memasukkan Opus 4.7 ke eksperimen A/B:
Jika penggunaan utama Anda adalah chat umum, ringkasan dokumen sederhana, terjemahan, brainstorming, atau copywriting ringan, tidak ada alasan kuat untuk migrasi penuh hanya karena nomor versi lebih baru. Bukti publik yang tersedia lebih banyak membahas coding, agent, dan vision; untuk tugas konten harian, belum ada dasar yang cukup kuat untuk menjanjikan peningkatan yang sama besar.
Anda juga sebaiknya berhati-hati jika prompt produksi sudah lama disetel khusus untuk Opus 4.6. Model baru bisa mengubah gaya jawaban, kepatuhan format, panjang output, atau jenis kesalahan yang muncul. Dalam kasus seperti ini, upgrade sebaiknya dilakukan bertahap, bukan sekali pindah semua.
Daripada langsung mengganti semua pemanggilan Opus 4.6 dengan 4.7, jalankan pengujian dengan data kerja nyata:
xhigh effort. xhigh disebut sebagai kontrol baru yang terkait Opus 4.7, tetapi belum tentu cocok untuk semua tugas; bandingkan terpisah dari setting normal.Untuk pengguna engineering, agent, dan vision, Claude Opus 4.7 adalah kandidat upgrade prioritas tinggi. Peningkatan yang dilaporkan memang berada di area tersebut, dan harga per token yang sama membuat uji coba lebih masuk akal.
Untuk pengguna chat umum, ringkasan, dan pembuatan konten ringan, jangan upgrade hanya karena versi baru. Opus 4.7 mungkin tetap lebih baik dalam beberapa kasus, tetapi bukti publik belum cukup untuk menjamin migrasi penuh akan selalu memberi hasil lebih baik daripada Opus 4.6.
Kesimpulan praktisnya: perlakukan Opus 4.7 sebagai upgrade yang perlu diuji serius, bukan pengganti otomatis. Jalankan A/B test dengan tugas nyata, ukur kualitas, format, biaya, dan latency, lalu putuskan apakah layak dipakai penuh.
| Relevan jika workflow 4.6 sering melenceng di tengah proses, lupa langkah, atau tidak stabil saat memakai tool. |
| Potensial terasa untuk screenshot UI, diagram, tabel, dokumen scan, atau input visual yang padat detail. |
| Berguna untuk developer API dan pembuat agent; pengguna chat biasa mungkin tidak perlu mengutak-atiknya. |