Anthropic menyebut Claude Opus 4.7 sebagai model Claude pertama yang mendukung gambar beresolusi tinggi. Batas maksimum gambar naik dari 1.568 px/1,15 MP menjadi 2.576 px/3,75 MP. Dalam pengumumannya, Anthropic juga menekankan bahwa kemampuan vision Opus 4.7 lebih baik dan menyebut adanya peningkatan pada multimodal understanding.
Bagi pengguna yang bekerja dengan dokumen, artinya model punya peluang lebih besar untuk melihat detail yang sebelumnya mudah hilang: huruf kecil, label grafik, anotasi, garis tabel, nama kolom, pesan error di UI, atau posisi elemen dalam halaman.
Tetapi “lebih jeli melihat” tidak sama dengan “selalu benar menyalin angka” atau “sudah pasti andal mengekstrak tabel kompleks”. Untuk pekerjaan yang menuntut presisi tinggi, hasilnya tetap perlu diuji dan diaudit.
Peningkatan paling konkret adalah dukungan gambar beresolusi lebih tinggi: dari 1.568 px/1,15 MP menjadi 2.576 px/3,75 MP.
Dalam praktik dokumen, banyak kegagalan bukan terjadi karena model tidak memahami instruksi, melainkan karena informasi visualnya terlalu kecil atau terlalu rapat. Contohnya:
Dengan input yang lebih detail, model memiliki lebih banyak informasi visual untuk dianalisis. Ini tidak menjamin jawabannya selalu tepat, tetapi memberi modal yang lebih baik untuk tugas yang bergantung pada detail halaman.
Dokumentasi Anthropic mengaitkan dukungan gambar resolusi tinggi dengan computer use, screenshot, artifact, dan document understanding workflows. Dengan kata lain, peningkatan ini bukan hanya relevan untuk foto biasa, tetapi juga untuk jenis input yang sering muncul dalam pekerjaan: tangkapan layar aplikasi, halaman dokumen, tampilan laporan, dan materi visual campuran teks-gambar.
| Skenario | Manfaat yang mungkin terasa | Catatan penting |
|---|---|---|
| Screenshot UI | Lebih mudah membaca tombol, field, pesan error, dan area layar; dukungan resolusi tinggi memang dikaitkan dengan screenshot workflows. | Untuk otomasi yang menekan tombol atau memakai koordinat, hasil posisi tetap perlu diverifikasi. |
| PDF hasil scan atau screenshot dokumen | Lebih terbantu untuk teks kecil, layout padat, label grafik, dan relasi antarbagian halaman; Anthropic menyebut document understanding workflows. | Ini peningkatan visual, bukan benchmark khusus PDF. |
| Laporan dengan grafik dan tabel | Lebih cocok untuk konten campuran teks, gambar, dan grafik; Anthropic menyebut peningkatan multimodal understanding. | Ekstraksi angka dan tabel tetap perlu pemeriksaan manusia, terutama untuk dokumen penting. |
| Diagram teknis | Lebih berguna untuk membaca komponen, label, dan hubungan antararea; Anthropic menyebut peningkatan vision. | Diagram kompleks sering lebih baik ditanya per bagian, bukan sekaligus. |
Dokumentasi Opus 4.7 juga menyebut peningkatan pada low-level visual perception, termasuk pointing, measuring, dan counting. Kedengarannya sederhana, tetapi justru inilah fondasi banyak tugas dokumen dan screenshot.
Dalam laporan bisnis atau teknis, pertanyaannya sering bukan sekadar “ringkas isi dokumen ini”. Pengguna bisa bertanya: angka di grafik kanan atas itu berapa, baris mana yang memiliki tanda anomali, atau berapa titik keputusan dalam flowchart. Pertanyaan semacam ini sangat bergantung pada persepsi visual dan lokalisasi, bukan hanya kemampuan bahasa.
Anthropic juga menyebut peningkatan image localization pada Claude Opus 4.7, termasuk bounding-box localization dan detection pada gambar natural. Untuk dokumen dan screenshot, ini relevan ketika pengguna ingin model menemukan area tertentu: misalnya kotak tabel, posisi grafik, tombol, kolom, atau pesan error.
Ada satu detail teknis yang penting untuk workflow otomasi: koordinat pada Opus 4.7 dipetakan 1:1 dengan piksel sebenarnya, sehingga tidak perlu konversi skala tambahan.
Jika Anda membangun proses yang meminta model menunjukkan koordinat tombol, membingkai area tabel, atau meneruskan posisi elemen ke sistem otomasi, perubahan ini dapat membuat alur kerja lebih langsung.
Jika PDF pada dasarnya adalah hasil scan, gambar halaman, atau Anda mengubah halaman dokumen menjadi screenshot sebelum dikirim ke model, peningkatan resolusi gambar dan document understanding workflows kemungkinan paling relevan.
Tugas yang masuk akal untuk diuji antara lain:
Untuk laporan yang berisi grafik, screenshot tabel, diagram teknis, atau layout kompleks, kombinasi resolusi lebih tinggi, persepsi visual tingkat dasar, dan lokalisasi gambar bisa memberi nilai tambah. Anthropic juga menyebut peningkatan vision dan multimodal understanding dalam pengumumannya.
Namun, jika kebutuhan utama Anda adalah mengubah tabel kompleks menjadi data terstruktur yang stabil, sebaiknya tetap lakukan pengujian dengan sampel sendiri. Materi resmi yang tersedia tidak memberikan benchmark publik khusus untuk ekstraksi tabel, sehingga peningkatan visual tidak boleh langsung disamakan dengan jaminan ekstraksi tabel yang sepenuhnya andal.
Jika dokumen adalah PDF teks yang rapi dan tugasnya hanya ringkasan atau tanya jawab berbasis isi, peningkatan resolusi visual belum tentu menjadi faktor utama. Sorotan resmi Opus 4.7 adalah gambar resolusi tinggi, lokalisasi visual, dan pemahaman multimodal—bukan pengumuman tentang mesin baru khusus parsing teks PDF.
Anthropic mengingatkan bahwa gambar beresolusi tinggi memakai lebih banyak token. Jika tugas tidak membutuhkan detail visual setinggi itu, Anthropic menyarankan downsample untuk mengendalikan biaya.
Dalam penggunaan nyata, pendekatannya bisa seperti ini:
Pertanyaan yang lebih berguna bukan “apakah Opus 4.7 bisa membaca PDF?”, melainkan “bagian mana dari workflow dokumen saya yang terbantu oleh peningkatan visual ini?”
Rencana uji yang praktis:
Claude Opus 4.7 lebih menarik untuk screenshot, dokumen hasil scan, PDF berbasis gambar, laporan dengan grafik, diagram teknis, dan layout yang padat. Alasannya: Anthropic mengonfirmasi dukungan gambar resolusi tinggi, peningkatan persepsi visual tingkat dasar, image localization, dan koordinat piksel 1:1. Anthropic juga menekankan peningkatan vision dan multimodal understanding pada Opus 4.7.
Namun, bukti resmi yang tersedia paling kuat mendukung kesimpulan bahwa kemampuan membaca visualnya meningkat. Itu belum sama dengan bukti publik bahwa parsing PDF atau ekstraksi tabel mengalami lompatan besar yang terukur. Untuk ringkasan PDF teks biasa, audit laporan yang sensitif, atau ekstraksi tabel presisi tinggi, langkah paling aman tetap melakukan A/B test memakai dokumen, screenshot, dan laporan milik sendiri sebelum memasukkannya ke proses produksi.