Đây là chi tiết quan trọng khi lập ngân sách cho sản phẩm AI. Một hệ thống có vẻ rất rẻ trong những tháng đầu có thể trở nên đắt hơn đáng kể sau khi giá mới được áp dụng. Do đó, các nhóm phát triển nên tính chi phí dài hạn theo mức giá năm 2027 trước khi xây dựng kiến trúc phụ thuộc sâu vào Flash.
Dù vậy, giá mỗi token chỉ phản ánh một phần hóa đơn thực tế. Chi phí của một agent còn phụ thuộc vào độ dài ngữ cảnh, số lần gọi công cụ, lượt thử lại, lượng dữ liệu được lưu trong bộ nhớ đệm, mức độ suy luận và độ dài câu trả lời. Chi phí của một benchmark đơn lẻ không đồng nghĩa với giá vận hành trọn vẹn một quy trình trong môi trường production.
Theo dữ liệu được Artificial Analysis tổng hợp, Gemini 3.7 Flash đạt 56 điểm trên Intelligence Index. Con số này cao hơn Claude Sonnet 5 với 55 điểm, nhưng thấp hơn một chút so với GPT-5.6 Terra với 57 điểm trong phép so sánh được dẫn.
Về tốc độ, Flash đạt khoảng 340 token đầu ra mỗi giây. Mô hình có điểm thời gian trung bình cho mỗi tác vụ là 1,7 và được Artificial Analysis đánh giá là nhanh hơn khoảng 40% so với GPT-5.6 Terra ở mức suy luận tối đa.
Đây là số liệu đo hiệu suất mô hình hoặc nhà cung cấp, không phải cam kết rằng mọi ứng dụng đều cho trải nghiệm giống nhau. Độ trễ mạng, cách nhà cung cấp định tuyến, kích thước prompt, thời gian phản hồi của công cụ bên ngoài và thiết lập suy luận đều có thể làm thay đổi tốc độ từ đầu đến cuối.
Google cho biết Gemini 3.7 Flash cải thiện đáng kể so với Gemini 3.6 Flash trong kỹ thuật phần mềm, gỡ lỗi, xử lý issue, phát triển web và các quy trình agent. Một số kết quả được dẫn gồm:
Các con số này cho thấy Flash là một lựa chọn đáng chú ý cho lập trình và agent thao tác qua terminal, nhưng chưa phải người dẫn đầu ở mọi hạng mục. GPT-5.6 Terra vẫn cao hơn trong kết quả Terminal-Bench được trích dẫn. Lợi thế chính của Flash là tốc độ và mức giá mở đầu thấp hơn.
Ở mức suy luận cao, ARC Prize ghi nhận Gemini 3.7 Flash đạt:
Đây là những kết quả mạnh, nhất là khi xét đến chi phí được báo cáo cho từng tác vụ. Tuy nhiên, ARC-AGI chủ yếu là tín hiệu benchmark, không phải dự báo trực tiếp về độ tin cậy của một agent phần mềm. Agent thực tế có thể phải gọi mô hình nhiều lần, sử dụng công cụ bên ngoài, thử lại thao tác thất bại và xử lý ngữ cảnh lớn hơn nhiều so với một bài kiểm tra riêng lẻ.
Bảng trên không phải bảng xếp hạng chung cho toàn bộ thị trường. Các benchmark đến từ những phép đánh giá khác nhau và chưa tạo thành một thử nghiệm có kiểm soát duy nhất cho tất cả mô hình. Giá cũng có thể phản ánh các điều kiện khác nhau về hình thức lưu trữ, chiết khấu hoặc khả năng cung cấp.
Các số liệu cho thấy Google đang lựa chọn một hướng định vị có chủ đích. Gemini 3.7 Flash nằm gần nhóm dẫn đầu về năng lực theo Intelligence Index, nhưng không có điểm cao nhất: GPT-5.6 Terra nhỉnh hơn với 57 điểm và cũng dẫn trước trong kết quả Terminal-Bench được trích dẫn.
Thay vào đó, Google nhấn mạnh bài toán cân bằng giữa năng lực, độ trễ và chi phí. Một mô hình đủ thông minh để hỗ trợ lập trình tương tác, đủ nhanh để người dùng không phải chờ lâu và đủ rẻ để gọi nhiều lần có thể hữu ích hơn cho một nền tảng agent so với mô hình chậm, đắt nhưng chỉ thắng một benchmark hẹp.
Điều này đặc biệt quan trọng với trợ lý lập trình, hệ thống tự động xử lý issue, agent phát triển web và các quy trình liên tục đọc ngữ cảnh, gọi công cụ, kiểm tra kết quả rồi thử lại. Trong làn sóng ra mắt mô hình dồn dập vào tháng 8/2026, Qwen3.8-Max tạo thêm sức ép ở mảng agent và kỹ thuật phần mềm; GLM-5.3 và Nemotron 3.5 Lightning cạnh tranh về giá và hiệu suất; còn Claude Opus 5 cùng GPT-5.6 nhắm đến năng lực cao cấp hơn.
Gemini 3.7 Flash nên được nhìn nhận như một mẫu AI đa dụng có thông lượng cao, thay vì mô hình thông minh nhất tuyệt đối. Lập luận thuyết phục nhất dành cho Flash là sự kết hợp giữa Intelligence Index 56, tốc độ tạo khoảng 340 token/giây, kết quả tốt trong lập trình và agent terminal, cùng mức giá giới thiệu thấp bất thường.
Rủi ro lớn nhất với nhà phát triển hiện tại nằm ở bài toán tài chính hơn là kỹ thuật: giá 0,75/3,75 USD sẽ hết hiệu lực sau ngày 31/12/2026, trước khi mức 1,50/7,50 USD được áp dụng từ ngày hôm sau. Tuyên bố về tốc độ tăng trưởng của Google có thể đúng, nhưng khi chưa có số liệu sử dụng đi kèm, bằng chứng hiện nay mới chỉ cho thấy một chiến lược rõ ràng: biến suy luận nhanh, rẻ và có thể mở rộng thành lựa chọn mặc định cho các vòng lặp AI của nhà phát triển.