Tổng chi phí AI của Uber tương đối ổn định từ tháng 4, trong khi số yêu cầu AI agent hằng tuần tăng 9,4 lần so với tháng 2. Với cùng một mô hình AI, chi phí cho mỗi 1.000 yêu cầu giảm gần 34% so với đỉnh tháng 4; chi phí mỗi phiên giảm 52% so với mức cao nhất tháng 6.
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: How did Uber stabilize its AI spending after exceeding its 2026 AI budget in the first quarter, despite weekly AI-agent requests increasing. Article summary: Uber stabilized spending by treating AI usage as an engineering-cost optimization problem rather than simply limiting adoption. After exceeding its 2026 AI budget in the first quarter, it kept total AI spend roughly flat. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Uber từng sử dụng vượt mức ngân sách AI năm 2026, nhưng phản ứng của công ty không phải là đơn giản cắt quyền truy cập. Thay vào đó, Uber xem đây là một bài toán tối ưu chi phí kỹ thuật: giao từng tác vụ cho mô hình phù hợp, hạn chế ngữ cảnh quá dài, tái sử dụng prompt đã được lưu trong bộ nhớ đệm và cho kỹ sư thấy phiên làm việc của họ đang tốn bao nhiêu. 1
Cách vận hành này giúp tổng chi phí AI của Uber tương đối ổn định từ tháng 4, dù số yêu cầu AI agent hằng tuần tăng 9,4 lần so với tháng 2. Với cùng một mô hình AI, công ty cho biết chi phí xử lý 1.000 yêu cầu đã giảm gần 34% so với đỉnh tháng 4, còn chi phí mỗi phiên giảm 52% so với mức cao nhất vào tháng 6. 1
Chi phí giảm không phải vì nhân viên dùng AI ít đi. Ngược lại, AI agent hiện tham gia hơn 70% số lượt gửi thay đổi mã nguồn, các kỹ sư thực hiện hơn 30.000 tác vụ agent mỗi ngày và số nhân viên sử dụng công cụ AI đã tăng hơn 4 lần. 1
Việc lượng sử dụng tăng mạnh trong khi tổng chi phí tương đối đi ngang cho thấy chi phí trên mỗi đơn vị tác vụ đã giảm. Điều đó không có nghĩa các tác vụ trở nên miễn phí; Uber chỉ thay đổi cách token và năng lực mô hình được sử dụng.
Uber chuyển mỗi công việc đến mô hình có thể xử lý công việc đó với mức chi phí hợp lý nhất, thay vì mặc định dùng mô hình mạnh và đắt nhất. Những tác vụ đơn giản có thể được giao cho mô hình rẻ hơn, còn công việc phức tạp được cấp năng lực xử lý lớn hơn. Công ty cũng đang đánh giá các lựa chọn khác, trong đó có những mô hình công khai trọng số, cho từng trường hợp sử dụng cụ thể. 1
Cách làm này biến lựa chọn mô hình thành quyết định dựa trên đặc điểm công việc, thay vì một thiết lập áp dụng cho tất cả. Ở quy mô lớn, khoản tiết kiệm nhỏ trên mỗi yêu cầu thường lệ cũng có thể tạo khác biệt đáng kể trong chi phí bình quân của cả hệ thống.
Uber giới hạn mỗi phiên tương tác ở 400.000 token, ngay cả khi mô hình có thể hỗ trợ cửa sổ ngữ cảnh lên tới 1 triệu token. 1
Giới hạn này xử lý một trong những rủi ro chi phí lớn của coding agent: một phiên làm việc có thể tích lũy tệp mã nguồn, kết quả từ công cụ, hướng dẫn và lịch sử tương tác lặp lại. Nếu không có điểm dừng, một phiên thử nghiệm hoặc vận hành thiếu kiểm soát có thể liên tục xử lý lượng ngữ cảnh ngày càng lớn.
Giới hạn token không loại bỏ việc sử dụng agent. Nó tạo ra một mức trần dễ dự đoán cho những phiên tiêu thụ nhiều ngữ cảnh nhất và giúp đội ngũ kỹ thuật có thêm điểm kiểm soát chi phí.
Uber tăng thời gian lưu prompt trong bộ nhớ đệm từ 5 phút lên 1 giờ. Thay đổi này phù hợp hơn với cách kỹ sư làm việc, khi một phiên AI có thể tạm dừng lâu hơn 5 phút trước khi được tiếp tục. 1
Việc tái sử dụng bộ nhớ đệm trong thời gian dài hơn giúp tránh xử lý lại cùng một ngữ cảnh nhiều lần. Trong quy trình lập trình có agent, nơi cùng một kho mã hoặc bộ hướng dẫn có thể được gọi lại nhiều lần, cách này làm giảm việc xử lý token không cần thiết mà không phải thay đổi bản thân tác vụ.
Uber hiển thị chi phí đang phát sinh của một phiên AI theo thời gian thực ngay trong terminal của kỹ sư. 1
Điều này biến mức sử dụng thành một vòng phản hồi trực tiếp trong quy trình kỹ thuật. Thay vì chỉ phát hiện một quy trình tốn kém qua báo cáo tài chính sau đó, kỹ sư có thể thấy chi phí ngay trong lúc thử nghiệm và điều chỉnh phiên làm việc, mô hình hoặc lượng ngữ cảnh khi cần.
Biện pháp này cũng đưa ý thức về chi phí vào đúng nơi các quyết định về prompt, số lần thử lại, ngữ cảnh và lựa chọn mô hình được đưa ra.
Kinh nghiệm của Uber cho thấy kiểm soát chi phí AI trong doanh nghiệp không chỉ là bài toán lập ngân sách. Đây còn là bài toán thiết kế hệ thống.
Các cơ chế kiểm soát đáng chú ý gồm:
Những biện pháp này đặc biệt quan trọng với AI agent vì công việc của agent mang tính lặp. Một yêu cầu của người dùng có thể dẫn đến nhiều vòng lập kế hoạch, gọi công cụ, kiểm tra và sửa đổi, khiến tổng lượng token khó dự đoán hơn nhiều so với một lần tương tác đơn lẻ.
Vì vậy, kết quả của Uber nên được xem là một ví dụ về hiệu quả vận hành, không phải bằng chứng rằng việc mở rộng AI nhanh chóng sẽ không còn rủi ro tài chính. Công ty chỉ giữ được chi phí tương đối ổn định sau khi thay đổi kinh tế của từng yêu cầu và từng phiên làm việc. Với các doanh nghiệp khác, thông điệp khá rõ ràng: hãy mở rộng mức độ sử dụng AI song song với quản trị chi phí, đồng thời tích hợp khả năng đo lường ngay từ đầu vào chính những công cụ mà nhân viên sử dụng.
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Tổng chi phí AI của Uber tương đối ổn định từ tháng 4, trong khi số yêu cầu AI agent hằng tuần tăng 9,4 lần so với tháng 2.
Tổng chi phí AI của Uber tương đối ổn định từ tháng 4, trong khi số yêu cầu AI agent hằng tuần tăng 9,4 lần so với tháng 2. Với cùng một mô hình AI, chi phí cho mỗi 1.000 yêu cầu giảm gần 34% so với đỉnh tháng 4; chi phí mỗi phiên giảm 52% so với mức cao nhất tháng 6.
Uber cho thấy doanh nghiệp có thể mở rộng AI bền vững hơn bằng cách chọn mô hình theo từng loại tác vụ và tích hợp công cụ đo chi phí ngay trong quy trình làm việc.