Bloomberg melaporkan Gemini 4 mendapat keputusan baik dalam penanda aras industri, tetapi menghadapi kesukaran dengan sesetengah tugasan pengekodan ketika diuji oleh pekerja. Laporan terdahulu Bloomberg menyebut kebimbangan pekerja Google terhadap persaingan daripada Anthropic dan OpenAI, serta kelewatan Gemini 3.5...
Diterbitkan olehDisunting dengan GPT-6 LunaImej dijana dengan GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Bloomberg report about the gap between Gemini 4’s strong benchmark scores and its performance on real-world coding tasks, why does. Article summary: Bloomberg reported that Gemini 4 scores well on standard AI benchmarks, but some employees testing it say it struggles with certain coding tasks in actual use. That gap matters because Google is preparing to launch a fla. Topic tags: general, news, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts wi
Bloomberg melaporkan bahawa Gemini 4 mendapat keputusan baik dalam penanda aras AI yang lazim digunakan, tetapi kurang menyerlah apabila pekerja mengujinya pada tugasan sebenar, termasuk beberapa kerja pengekodan. Laporan itu mencerminkan keraguan dalaman menjelang pelancaran model tersebut, bukannya penilaian muktamad terhadap semua kebolehannya. Google mempertikaikan kritikan itu. Pada hari yang sama, satu laporan lain menyebut Google telah memperkenalkan Gemini 4 Argon, namun belum menetapkan tarikh ketersediaan umum. 7
5
10
Individu yang mempunyai akses langsung kepada pembangunan Gemini 4 memberitahu Bloomberg bahawa model itu mendapat markah baik dalam penanda aras industri, tetapi menghadapi kesukaran dengan sesetengah tugasan pengekodan dalam penggunaan praktikal. Mereka bercakap tanpa nama, maka laporan tersebut lebih tepat difahami sebagai maklum balas pekerja—bukan penilaian bebas yang diterbitkan terhadap model itu. 7
Perbezaan ini penting: keputusan penanda aras dan pengalaman menggunakan model untuk tugasan tertentu ialah dua jenis bukti yang berbeza. Laporan Bloomberg menunjukkan bahawa keputusan ujian yang baik belum menghapuskan semua kebimbangan dalaman tentang keupayaan Gemini 4 dalam pengekodan. Namun, ia tidak membuktikan bahawa model itu lemah dalam semua kegunaan sebenar. 7
Isu ini penting kerana Google sedang bersaing untuk membangunkan alatan pengekodan berasaskan AI. Bloomberg sebelum ini melaporkan kebimbangan dalam syarikat bahawa pesaing sedang bergerak lebih pantas. Pada April, laporan itu menyebut pemimpin Google bimbang syarikat berisiko ketinggalan, khususnya ketika Anthropic menawarkan alatan pengekodan yang menurut sumber lebih berkesan dan popular dalam kalangan perniagaan. 4
Laporan berasingan pada Julai pula menyebut Gemini 3.5 Pro ketinggalan beberapa bulan daripada jadual asal ketika Google berusaha meningkatkan keupayaannya, terutamanya dalam pengekodan. Pekerja yang dipetik dalam laporan itu bimbang model daripada Anthropic dan OpenAI mengatasi keupayaan Gemini. 1 Reuters turut melaporkan bahawa Gemini 3.5 Pro dirancang untuk membantu Google mengejar pesaing dalam alatan pengekodan AI dan tugasan AI ejen.
2
Laporan terdahulu itu memberi konteks kepada persaingan, tetapi berkaitan Gemini 3.5 Pro dan kebimbangan lebih luas—bukan bukti bahawa Gemini 4 mempunyai kelemahan yang sama atau Google sudah kalah dalam persaingan. Prestasi pengekodan yang lebih baik boleh menjadi penting untuk alatan pengekodan dan tugasan AI ejen Google. Namun, sumber yang tersedia tidak menunjukkan kesan khusus isu yang dilaporkan terhadap produk atau pelanggan Gemini 4. 2
4
7
Laporan yang tersedia menyokong kesimpulan bahawa Gemini 3.5 Pro mengalami kelewatan sementara Google berusaha meningkatkan keupayaannya, khususnya dalam pengekodan. Laporan itu tidak membuktikan bahawa Google membatalkan model tersebut. 1
2
Perbezaan ini penting: kelewatan bukan bukti bahawa sesuatu model dibatalkan. Begitu juga, laporan mengenai Gemini 3.5 Pro tidak mengesahkan prestasi Gemini 4, yang melibatkan set kebimbangan pekerja yang berasingan. 1
7
Menurut laporan Bloomberg yang dipetik oleh ZeroHedge, Google menyifatkan dakwaan bahawa Gemini 4 menunjukkan prestasi lemah dalam pengekodan sebagai “tidak tepat”. Jawapan itu bercanggah dengan maklum balas pekerja tanpa nama. Sumber yang tersedia tidak merangkumi ujian awam bebas yang dapat memutuskan pertikaian tersebut. 5
7
Konteks masa juga perlu diambil kira: ketika Bloomberg melaporkan keraguan dalaman menjelang pelancaran Gemini 4, satu laporan pada hari yang sama menyebut Google telah memperkenalkan Gemini 4 Argon, tetapi belum mengumumkan bila model itu akan tersedia kepada orang ramai secara umum. 7
10
Selepas laporan itu diterbitkan, saham Alphabet mengurangkan sebahagian kenaikannya. Menurut laporan yang memetik Investing.com, saham itu beralih daripada kenaikan lebih 2% kepada kira-kira 0.5% menjelang penutupan pasaran. Ini bermakna kenaikannya mengecil—bukan jatuh di bawah paras penutupan hari sebelumnya. 9
Laporan itu menimbulkan persoalan penting untuk Google: adakah prestasi Gemini 4 yang baik dalam penanda aras turut diterjemahkan kepada tugasan pengekodan yang diuji oleh pekerja? Bukti yang ada terdiri daripada maklum balas dalaman tanpa nama dan penafian Google, bukannya penilaian awam yang menyeluruh. Kelewatan Gemini 3.5 Pro memberi konteks tentang persaingan, tetapi tidak membuktikan model itu dibatalkan atau Gemini 4 ketinggalan secara keseluruhan berbanding pesaingnya. 1
5
7
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Bloomberg melaporkan Gemini 4 mendapat keputusan baik dalam penanda aras industri, tetapi menghadapi kesukaran dengan sesetengah tugasan pengekodan ketika diuji oleh pekerja.
Bloomberg melaporkan Gemini 4 mendapat keputusan baik dalam penanda aras industri, tetapi menghadapi kesukaran dengan sesetengah tugasan pengekodan ketika diuji oleh pekerja. Laporan terdahulu Bloomberg menyebut kebimbangan pekerja Google terhadap persaingan daripada Anthropic dan OpenAI, serta kelewatan Gemini 3.5 Pro untuk penambahbaikan pengekodan.
Selepas laporan itu, saham Alphabet mengurangkan kenaikan daripada lebih 2% kepada kira kira 0.5% menjelang penutupan pasaran, tetapi masih mencatat kenaikan pada hari tersebut.