Namun, klaim “vision lebih kuat” tidak otomatis berarti semua pekerjaan visual ikut melonjak. Membaca screenshot, menafsirkan chart, dan mengulas mockup UI adalah tugas yang berbeda. Masing-masing punya jebakan sendiri: teks kecil, angka sumbu grafik, legenda, kepadatan informasi, hierarchy visual, spacing, atau konsistensi komponen.
Masalahnya, data publik yang tersedia saat ini masih lebih banyak berupa klaim resmi dan sinyal dari pengguna awal, bukan benchmark terbuka yang rapi, berulang, dan membandingkan performa per jenis tugas.
Bukti paling langsung datang dari Anthropic. Dalam pengumuman Opus 4.7, perusahaan itu menyatakan model baru ini memiliki “substantially better vision” dan mendukung gambar dengan resolusi lebih tinggi. Halaman produk Anthropic juga memosisikan Opus 4.7 sebagai model yang lebih kuat untuk coding, vision, dan tugas multi-langkah yang kompleks, serta menyebut alur kerja enterprise seperti spreadsheets, slides, dan docs.
Artinya, untuk pemahaman gambar secara umum, ada dasar yang cukup kuat untuk mengatakan Opus 4.7 meningkat. Tetapi karena sumber utamanya masih materi dari vendor, keputusan produksi tetap sebaiknya dibarengi pengujian memakai materi nyata dari tim Anda.
Tugas membaca screenshot sering bergantung pada detail kecil: label tombol, teks error, kolom tabel, menu pengaturan, grafik padat, atau angka di dashboard. Karena Anthropic menyebut Opus 4.7 dapat menangani gambar beresolusi lebih tinggi, ini merupakan sinyal positif untuk tugas seperti membaca screenshot antarmuka, dokumen, halaman pengaturan, atau dashboard.
Namun, dukungan resolusi lebih tinggi bukanlah benchmark khusus screenshot. Jadi, kesimpulan yang lebih tepat adalah: Opus 4.7 layak diuji ulang untuk pekerjaan berbasis screenshot, tetapi data publik belum cukup untuk membuktikan tingkat akurasinya sudah naik besar pada kategori ini.
Anthropic mengutip Solve Intelligence, salah satu pelanggan uji awal, yang menyebut adanya peningkatan nyata dalam multimodal understanding Opus 4.7, termasuk untuk chemical structures dan complex technical diagrams.
Ini lebih spesifik dibanding klaim umum “vision lebih baik”. Untuk tim yang sering bekerja dengan diagram teknik, diagram proses, gambar ilmiah, atau struktur kimia, sinyal ini cukup menarik.
Tetap saja, ini masih berupa masukan pelanggan awal, bukan benchmark independen yang bisa diulang publik. Selain itu, complex technical diagrams tidak otomatis sama dengan semua chart bisnis, dashboard analitik, atau review mockup desain.
Anthropic juga menyebut Opus 4.7 dapat menghasilkan interfaces, slides, dan docs dengan kualitas lebih tinggi dalam pekerjaan profesional. Halaman produknya turut menyebut workflow seperti spreadsheets, slides, dan docs.
Ini relevan untuk pekerjaan desain dan dokumen, tetapi perlu dibaca hati-hati. Kemampuan menghasilkan interface atau slide yang lebih baik tidak sama dengan bukti bahwa model tersebut sudah lebih akurat dalam menganalisis mockup, menemukan masalah spacing, menilai visual hierarchy, atau mendiagnosis inkonsistensi desain.
| Jenis tugas | Bukti publik saat ini | Penilaian paling aman |
|---|---|---|
| Analisis gambar umum | Anthropic menyebut Opus 4.7 memiliki vision yang lebih baik; halaman produk juga menempatkan vision sebagai kemampuan inti. | Ada bukti peningkatan, cukup kredibel untuk level umum. |
| Diagram teknis, chemical structures, complex technical diagrams | Pelanggan uji awal menyebut multimodal understanding membaik untuk chemical structures dan complex technical diagrams. | Sinyalnya kuat, tetapi belum setara benchmark independen publik. |
| Screenshot antarmuka atau dokumen | Anthropic menyebut Opus 4.7 mendukung gambar beresolusi lebih tinggi. | Layak dites ulang; belum ada benchmark khusus screenshot yang mengunci besaran peningkatannya. |
| Grafik dan dashboard chart | Bukti resmi masih bersifat umum: vision, spreadsheets, slides, docs, dan workflow profesional. | Belum cukup untuk menyimpulkan interpretasi chart naik besar. |
| Mockup desain atau UI review | Anthropic menyebut kualitas output interfaces, slides, dan docs lebih baik. | Ada sinyal yang relevan untuk desain, tetapi belum membuktikan analisis mockup jauh lebih akurat. |
Ada artikel teknis pihak ketiga yang menyebut benchmark visual acuity naik dari 54,5% menjadi 98,5%. Angka itu terlihat impresif, tetapi tidak sebaiknya langsung dipakai sebagai bukti bahwa screenshot, grafik, dan mockup desain semuanya membaik secara besar-besaran.
Alasannya sederhana. Pertama, angka itu bukan dari pengumuman resmi Anthropic. Kedua, satu metrik visual acuity belum tentu langsung memetakan kemampuan membaca teks kecil di screenshot, memahami nilai dalam chart, menilai hierarchy UI, atau menemukan masalah desain. Angka tersebut boleh dijadikan referensi tambahan, tetapi jangan dijadikan satu-satunya dasar untuk mengganti model.
Untuk tim produk, desain, data, atau engineering, cara paling praktis bukan menebak dari pengumuman peluncuran, melainkan membuat blind A/B test kecil dengan materi kerja sendiri.
Langkah yang bisa dipakai:
Materi yang sebaiknya diprioritaskan:
Jika pertanyaannya “apakah kemampuan vision Claude Opus 4.7 meningkat secara umum?”, jawabannya: ya, ada bukti publik yang mendukung. Anthropic secara eksplisit menyebut vision yang lebih baik, dan halaman produknya juga menempatkan vision sebagai salah satu kemampuan penting Opus 4.7.
Jika pertanyaannya lebih sempit—“apakah analisis screenshot, grafik, dan mockup desain sudah terbukti jauh lebih baik?”—jawabannya perlu lebih hati-hati: sinyalnya positif, tetapi belum ada benchmark publik yang cukup lengkap dan terpisah per tugas untuk memastikan besaran peningkatannya.
Jadi, sebelum mengganti model di workflow penting, jalankan blind A/B test dengan screenshot, chart, dan desain Anda sendiri. Di situlah peningkatan yang benar-benar berguna akan terlihat: bukan di klaim umum, tetapi di pekerjaan yang Anda lakukan setiap hari.