Một số nhân viên cho biết Gemini 4 Argon không phải lúc nào cũng thể hiện tốt như điểm benchmark khi xử lý công việc lập trình thực tế, trong đó có phát triển giao diện. Đánh giá nội bộ về Gemini 4 và các đối thủ Anthropic Fable, OpenAI Astra còn trái chiều; Google bác bỏ nhận định rằng mô hình yếu ở khâu lập trình.
Đăng bởiBiên tập bằng GPT-6 LunaHình ảnh được tạo bằng GPT Image 2
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: Why are some Google employees questioning the forthcoming Gemini 4 model’s real-world coding ability despite strong benchmark scores, how do. Article summary: Some employees say Gemini 4 Argon’s strong benchmark scores do not match their experience using it for actual coding work, particularly certain tasks and front-end design. That is a reported internal assessment, not a se. Topic tags: general, general web, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
Gemini 4 Argon đang nhận được hai cách đánh giá khác nhau: Google nhấn mạnh kết quả nổi bật ở các bài kiểm tra chuẩn, trong khi một số nhân viên được cho là thấy mô hình kém ổn định hơn khi dùng vào công việc lập trình thực tế. Khoảng cách giữa hai nhận định đáng chú ý, nhưng các thông tin hiện có phản ánh ý kiến nội bộ trái chiều, chứ không phải kết luận chung rằng Gemini 4 thua đối thủ. 11
Google cho biết Gemini 4 đạt kết quả cao ở một số bài benchmark, trong đó có bài kiểm tra về năng lực bảo mật mà mô hình vượt OpenAI Astra. Tuy vậy, một số nhân viên am hiểu các đánh giá nội bộ được cho là có trải nghiệm khác khi dùng mô hình cho những tác vụ lập trình cụ thể, bao gồm phát triển giao diện người dùng. 11
14
Hai điều này không nhất thiết mâu thuẫn. Kết quả benchmark không tự động chứng minh mô hình sẽ hữu ích hoặc ổn định trong mọi công việc kỹ thuật hằng ngày; ngược lại, trải nghiệm với một số tác vụ cũng không thể phủ nhận toàn bộ kết quả kiểm tra. Chúng cho thấy điểm số ở những bài đánh giá được chọn và hiệu quả khi áp dụng vào công việc cụ thể là hai khía cạnh cần phân biệt.
Google cho rằng sẽ không chính xác nếu nói Gemini 4 thể hiện kém trong lĩnh vực lập trình, đồng thời viện dẫn kết quả benchmark của mô hình. Trong khi đó, các ý kiến nhân viên được đưa tin không thống nhất: một số người cho rằng Anthropic Fable và OpenAI Astra đang tiến bộ nhanh hơn, còn những người khác nhận định Gemini 4 đã bắt kịp các mô hình hàng đầu. 11
12
13
Vì vậy, cả những lời phê bình nội bộ lẫn lập luận dựa trên benchmark của công ty đều chưa đủ để xem là kết luận toàn diện về năng lực Gemini 4.
Theo các thông tin được đưa tin, Google từng dự định phát hành Gemini 3.5 Pro vào tháng 6/2026 nhưng sau đó từ bỏ phiên bản này và chuyển sang Gemini 4. Chi tiết đó bổ sung bối cảnh cho câu hỏi về tiến độ phát triển và ra mắt sản phẩm của Google, nhưng tự nó không giải thích những hạn chế lập trình được phản ánh về Gemini 4, cũng không chứng minh mô hình kém hơn đối thủ. 6
13
Sau khi thông tin được đưa tin, cổ phiếu Alphabet thu hẹp mức tăng trước đó hơn 2%, rồi kết phiên giao dịch hôm thứ Tư tăng khoảng 0,5%. Diễn biến này cho thấy tin tức xuất hiện cùng lúc với sự thay đổi trong tâm lý thị trường; riêng biến động giá không chứng minh các lo ngại của nhân viên là đúng, cũng không xác lập rằng những lo ngại đó đã gây ra mức thay đổi này. 1
14
Với nhà đầu tư, câu hỏi rộng hơn là liệu Google có thể cạnh tranh với OpenAI và Anthropic trong nhóm mô hình AI chủ lực hay không. Gemini 4 là một phần của cuộc đua đó, nhưng các thông tin được dẫn không xác định tác động cụ thể tới từng sản phẩm của Google. Mọi ảnh hưởng rộng hơn vẫn là câu hỏi cần theo dõi, chưa phải kết quả đã được chứng minh. 10
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Một số nhân viên cho biết Gemini 4 Argon không phải lúc nào cũng thể hiện tốt như điểm benchmark khi xử lý công việc lập trình thực tế, trong đó có phát triển giao diện.
Một số nhân viên cho biết Gemini 4 Argon không phải lúc nào cũng thể hiện tốt như điểm benchmark khi xử lý công việc lập trình thực tế, trong đó có phát triển giao diện. Đánh giá nội bộ về Gemini 4 và các đối thủ Anthropic Fable, OpenAI Astra còn trái chiều; Google bác bỏ nhận định rằng mô hình yếu ở khâu lập trình.
Alphabet từng thu hẹp mức tăng cổ phiếu từ hơn 2% xuống khoảng 0,5% trong phiên thứ Tư sau khi thông tin về những hoài nghi nội bộ được đưa tin.