Sebagian karyawan Google menilai hasil benchmark Gemini 4 Argon belum selalu tercermin dalam tugas coding praktis, termasuk pengembangan front end. Pendapat internal soal persaingan dengan Anthropic dan OpenAI beragam.
Diterbitkan olehDiedit dengan GPT-6 LunaGambar dibuat dengan GPT Image 2
Jawaban penelitian

Create a landscape editorial hero image for this Studio Global article: Why are some Google employees questioning the forthcoming Gemini 4 model’s real-world coding ability despite strong benchmark scores, how do. Article summary: Some employees say Gemini 4 Argon’s strong benchmark scores do not match their experience using it for actual coding work, particularly certain tasks and front-end design. That is a reported internal assessment, not a se. Topic tags: general, general web, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
Gemini 4 Argon mendapat dua penilaian yang berbeda. Google menyoroti hasilnya yang kuat di sejumlah benchmark, sementara sebagian karyawan dilaporkan merasa model itu belum selalu andal saat digunakan untuk pekerjaan coding sehari-hari. Perbedaan ini patut dicermati, tetapi laporan yang tersedia menunjukkan beragam pandangan internal—bukan kesimpulan bersama bahwa Gemini 4 kalah dari para pesaingnya. 11
Google menyatakan Gemini 4 mencatat hasil terdepan di beberapa benchmark, termasuk mengungguli model Astra dari OpenAI dalam salah satu tes kemampuan keamanan. Namun, sejumlah karyawan yang mengetahui evaluasi internal dilaporkan mendapat pengalaman berbeda saat mencoba tugas coding praktis, termasuk pengembangan front-end. 11
14
Kritik tersebut tidak serta-merta membatalkan hasil benchmark. Sebaliknya, hasil benchmark juga tidak menjawab seluruh pertanyaan tentang kinerja model dalam pekerjaan rekayasa perangkat lunak sehari-hari. Keduanya menggambarkan hal yang berbeda: skor pada evaluasi tertentu dan kegunaan atau konsistensi model saat mengerjakan tugas-tugas spesifik.
Google menyebut tidak tepat jika Gemini 4 digambarkan berkinerja buruk dalam coding, sembari menunjuk hasil benchmark-nya. Sementara itu, laporan tentang pandangan karyawan menunjukkan bahwa pendapat mereka tidak seragam. Sebagian menilai model Anthropic, Fable, dan Astra dari OpenAI berkembang lebih cepat; sebagian lainnya menganggap Gemini 4 telah menyamai model-model terdepan. 11
12
13
Karena itu, kritik internal maupun pembelaan Google lewat hasil benchmark belum bisa dianggap sebagai penilaian akhir atas kemampuan Gemini 4.
Menurut sejumlah laporan, Google semula berencana merilis Gemini 3.5 Pro pada Juni 2026, tetapi membatalkan versi tersebut dan beralih ke Gemini 4. Riwayat ini menambah konteks pada pertanyaan mengenai laju pengembangan dan peluncuran model Google. Namun, hal itu sendiri tidak menjelaskan dugaan kelemahan Gemini 4 dalam coding ataupun membuktikan bahwa model tersebut lebih rendah dari pesaingnya. 6
13
Setelah laporan tersebut muncul, saham Alphabet melepas kenaikan sebelumnya yang sempat melampaui 2%, lalu mengakhiri sesi perdagangan Rabu dengan kenaikan sekitar 0,5%. Pergerakan itu menunjukkan bahwa kabar tersebut bertepatan dengan perubahan sentimen pasar. Namun, perubahan harga saham bukan bukti bahwa kekhawatiran karyawan benar atau bahwa kekhawatiran itu menjadi penyebab tunggal pergerakan tersebut. 1
14
Pertanyaan yang lebih luas bagi investor adalah apakah Google mampu bersaing dengan OpenAI dan Anthropic dalam mengembangkan model AI unggulan. Laporan tersebut menempatkan Gemini 4 dalam persaingan itu, tetapi tidak merinci dampaknya terhadap produk Google tertentu. Dampak yang lebih luas masih menjadi pertanyaan, bukan hasil yang telah terbukti. 10
Studio Global AI
Halaman ini berisi jawaban yang didukung sumber yang dapat Anda lanjutkan di dalam Studio Global.
Sebagian karyawan Google menilai hasil benchmark Gemini 4 Argon belum selalu tercermin dalam tugas coding praktis, termasuk pengembangan front end.
Sebagian karyawan Google menilai hasil benchmark Gemini 4 Argon belum selalu tercermin dalam tugas coding praktis, termasuk pengembangan front end. Pendapat internal soal persaingan dengan Anthropic dan OpenAI beragam. Google membantah anggapan bahwa Gemini 4 tertinggal dalam coding.