Trong các bài kiểm tra công bố vào tháng 8/2026, OpenAI cho biết Jalapeño xử lý nhiều công việc AI hơn 1,5–1,9 lần trên mỗi watt và có độ trễ đầu cuối thấp hơn 1,7–3,6 lần so với các hệ thống Nvidia GB200, GB300 được... Benchmark InferenceX sử dụng ba mô hình mở có trọng số công khai: GPT OSS 120B, DeepSeek R1 670B...
Đăng bởiBiên tập bằng GPT-5.6 LunaHình ảnh được tạo bằng GPT Image 1.5
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What did OpenAI’s custom Jalapeño inference chip achieve in its August 2026 benchmarks against Nvidia’s GB200 and GB300 systems, which model. Article summary: OpenAI’s August 2026 results position Jalapeño as a potentially much more efficient, lower-latency option for high-volume LLM serving than the specific Nvidia GB200 and GB300 configurations tested—not as a general replac. Topic tags: general, news, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
OpenAI đang đưa ra một tuyên bố khá cụ thể về Jalapeño: chip tùy biến này có thể chạy các mô hình ngôn ngữ lớn với mức tiêu thụ điện thấp hơn và phản hồi nhanh hơn so với những hệ thống Nvidia GB200 và GB300 được chọn làm đối chứng. Trên benchmark InferenceX công khai của SemiAnalysis, OpenAI báo cáo Jalapeño xử lý nhiều công việc AI hơn 1,5–1,9 lần trên mỗi watt và đạt độ trễ đầu-cuối thấp hơn 1,7–3,6 lần trên ba mô hình mở.
Đây là kết quả đáng chú ý với một công ty phải phục vụ khối lượng truy vấn AI khổng lồ. Tuy nhiên, nó không đồng nghĩa Jalapeño đã chứng minh được mình là lựa chọn nhanh hơn hoặc rẻ hơn GPU trong mọi tình huống. Phạm vi thử nghiệm còn hẹp, chip chỉ được thiết kế cho suy luận, còn phần lớn số liệu do OpenAI tạo ra trên silicon kỹ thuật của chính mình. 14
OpenAI so sánh Jalapeño với các hệ thống Nvidia GB200 và GB300 trên InferenceX — bộ đo nhằm đánh giá toàn bộ quá trình phục vụ một yêu cầu AI, thay vì chỉ đo năng lực tính toán lý thuyết. Các chỉ số hiệu suất trên mỗi đơn vị điện năng được chuẩn hóa theo mức công suất công bố của từng bộ tăng tốc.
Trong các bài kiểm tra được báo cáo, Jalapeño đạt:
Khoảng cách độ trễ lớn nhất trong các số liệu được cung cấp xuất hiện ở DeepSeek R1 670B: Jalapeño hoàn tất một yêu cầu trong 1,65 giây, so với 5,99 giây trên hệ thống dùng GB300. 11
12
Dù vậy, đây là kết quả tương đối trong một bài benchmark, không phải lời hứa rằng ChatGPT sẽ luôn trả lời nhanh hơn đúng tỷ lệ đó hay giá API sẽ giảm tương ứng. Hiệu suất thực tế còn phụ thuộc vào mô hình, phần mềm phục vụ, cách gom nhiều yêu cầu, mạng, độ dài ngữ cảnh, độ dài câu trả lời và mục tiêu ưu tiên độ trễ hay thông lượng.
Benchmark bao phủ ba mô hình mở có trọng số công khai:
| Mô hình | Hệ thống Nvidia đối chiếu | Kết quả được báo cáo của Jalapeño |
|---|---|---|
| GPT-OSS 120B | GB200 | Khoảng 1,9 lần nhiều công việc hơn trên mỗi watt; độ trễ 1,03 giây so với 1,80 giây |
| DeepSeek R1 670B | GB300 | Khoảng 1,7 lần nhiều công việc hơn trên mỗi watt; độ trễ 1,65 giây so với 5,99 giây |
| Kimi K2.5 1T | GB300 | Khoảng 1,5 lần nhiều công việc hơn trên mỗi watt; độ trễ 1,56 giây so với 5,31 giây |
Các con số trên đến từ những bản tóm tắt kết quả được công bố, chứ chưa phải một bài kiểm tra toàn bộ bộ dữ liệu đã được bên độc lập tái tạo hoàn chỉnh. 6
11
12
Tải thử nghiệm về danh nghĩa là một lượt tương tác, gồm 8.000 token đầu vào và 1.000 token đầu ra. Cách thiết lập này giúp việc so sánh có kiểm soát, nhưng không đại diện cho mọi dạng lưu lượng AI trong thực tế. Nó chưa trả lời đầy đủ các câu hỏi về hội thoại nhiều lượt, gọi công cụ, quy trình tác vụ tự động, câu trả lời có độ dài thay đổi, khả năng gom lô hay yêu cầu có ngữ cảnh cực dài. 8
13
Benchmark cũng phản ánh một tổ hợp phần cứng và phần mềm cụ thể. Việc thay đổi trình biên dịch, kernel, phương pháp lượng tử hóa, bộ lập lịch, kiến trúc mô hình hoặc phần mềm vận hành của Nvidia có thể làm khoảng cách thay đổi đáng kể.
Jalapeño là ASIC — mạch tích hợp chuyên dụng — do OpenAI đồng phát triển với Broadcom cho tác vụ suy luận mô hình ngôn ngữ lớn. Khác với GPU đa dụng, nó được tối ưu cho việc chạy mô hình đã huấn luyện để tạo ra câu trả lời. 1
5
Các thông số hệ thống được báo cáo gồm:
Ở cấp chip, phiên bản B0 được báo cáo sử dụng một đế tính toán kích thước tối đa trong giới hạn reticle, sản xuất trên tiến trình N3P của TSMC, với năng lực 13,4 PFLOPS tính toán MXFP4. 18
Kiến trúc này cho thấy OpenAI đang tiếp cận bài toán theo hướng toàn hệ thống, chứ không chỉ tạo ra một bộ tăng tốc độc lập. Bộ nhớ, kết nối liên chip, mạng và giao tiếp ở quy mô rack đều quan trọng khi phục vụ các mô hình rất lớn — vốn thường phải phân bổ yêu cầu qua nhiều chip. 18
19
OpenAI và Broadcom được cho là đã đi từ ý tưởng đến tape-out — giai đoạn hoàn tất thiết kế để đưa chip vào sản xuất thử — trong khoảng chín tháng, một tiến độ đặc biệt ngắn đối với chip hiệu năng cao. 7
20
AI có tham gia hỗ trợ quy trình kỹ thuật, nhưng điều đó không có nghĩa một mô hình AI tự mình thiết kế và sản xuất bộ xử lý. Quá trình được báo cáo vẫn cần các nhóm kỹ sư và kiến trúc sư con người, công việc triển khai bán dẫn của Broadcom, đối tác sản xuất và khâu tích hợp hệ thống. 7
13
Cách diễn giải thận trọng hơn là OpenAI đã kết hợp hiểu biết về tải LLM với các công cụ AI trong quy trình kỹ thuật để đồng thiết kế phần cứng và phần mềm cho một mục tiêu phục vụ tương đối hẹp. Sự chuyên biệt này có thể cải thiện hiệu suất, nhưng cũng khiến Jalapeño kém linh hoạt hơn GPU lập trình được.
Jalapeño được xây dựng để chạy các mô hình đã huấn luyện, không phải để huấn luyện những mô hình tiên phong mới. Vì vậy, OpenAI vẫn cần các bộ tăng tốc có tính lập trình cao, đặc biệt là GPU, cho việc huấn luyện, nghiên cứu, thử nghiệm và những tác vụ không phù hợp với thiết kế suy luận cố định. 8
13
Đây là điểm giới hạn ý nghĩa của cụm từ “đánh bại Nvidia”. Jalapeño có thể vượt qua các cấu hình Nvidia được thử nghiệm ở một số chỉ số suy luận, trong khi phần cứng Nvidia vẫn giữ vai trò thiết yếu ở những phần khác trong hạ tầng tính toán của OpenAI. Một ASIC chuyên dụng có thể rất mạnh ở công việc ổn định, lặp lại với khối lượng lớn mà không thay thế được nền tảng rộng hơn dành cho huấn luyện và thay đổi mô hình nhanh chóng.
Các kết quả nên được hiểu là “tốt hơn trong những bài kiểm tra được báo cáo”, chứ chưa phải “hệ thống AI tốt nhất xét trên mọi phương diện”. Một số điểm cần đặc biệt lưu ý:
Vì vậy, chưa có cơ sở từ các kết quả này để khẳng định chi phí sẽ giảm phổ biến 50%, giá API chắc chắn thấp hơn hay Nvidia sẽ bị thay thế ngay lập tức. Bằng chứng hiện có chỉ ủng hộ các tuyên bố về hiệu suất và hiệu quả năng lượng trong những điều kiện cụ thể.
OpenAI dự kiến bắt đầu đưa Jalapeño vào hạ tầng của mình trước cuối năm 2026, với sản xuất số lượng lớn và mở rộng triển khai trong năm 2027. Về dài hạn, công ty hướng tới các trung tâm dữ liệu quy mô gigawatt cùng Microsoft và những đối tác hạ tầng khác, qua nhiều thế hệ chip. 1
6
Con chip này chủ yếu phục vụ nhu cầu nội bộ của OpenAI, thay vì được bán như một bộ xử lý thương mại. Do đó, các công ty bên ngoài không nên kỳ vọng có thể mua phần cứng Jalapeño hoặc thuê một phiên bản đám mây công khai chạy Jalapeño chỉ dựa trên những thông báo hiện tại. 1
6
Giữ phần cứng trong nội bộ cho phép OpenAI tối ưu chip theo các mô hình, kernel và hệ thống phục vụ của riêng mình. Cách làm này cũng giúp công ty tránh những nghĩa vụ đi kèm việc trở thành nhà cung cấp bán dẫn truyền thống, chẳng hạn hỗ trợ phần mềm cho khách hàng, xây dựng hệ sinh thái, bán hàng và xử lý cạnh tranh với chính khách hàng. Đây là phân tích chiến lược về mô hình triển khai; điều đã được xác nhận là kế hoạch sử dụng nội bộ, không phải bán chip ra bên ngoài. 1
6
Cách nhìn phù hợp nhất là xem Jalapeño như một phần trong danh mục tính toán toàn diện của OpenAI. Công ty đang kết hợp năng lực đám mây từ Microsoft và các đối tác khác, GPU kiểu Nvidia cho những tác vụ cần tính linh hoạt hoặc thiên về huấn luyện, cùng silicon tùy biến cho các tải suy luận ổn định — nơi việc chuyên biệt hóa có thể đem lại lợi ích. Danh mục tính toán do OpenAI mô tả còn bao gồm AWS, AMD, Broadcom, Cerebras, CoreWeave, Oracle, SB Energy và SoftBank.
Chiến lược này cũng phản ánh xu hướng rộng hơn trong ngành. Google phát triển TPU; Amazon có Trainium và Inferentia; Microsoft có Maia; AMD cạnh tranh bằng GPU AI đa dụng; còn Nvidia tiếp tục cung cấp các hệ thống có khả năng lập trình rộng. Anthropic cũng đang theo đuổi hạ tầng ngày càng tùy biến thông qua các quan hệ với nhà cung cấp đám mây, dù các bằng chứng benchmark hiện có không đưa ra so sánh hiệu suất trực tiếp với hệ thống của Anthropic.
Tác động chiến lược trước mắt vì thế phức tạp hơn câu chuyện “thay thế GPU”. Jalapeño có thể giúp OpenAI kiểm soát tốt hơn chi phí suy luận, độ trễ, nguồn cung và lộ trình phần cứng. Nvidia vẫn quan trọng với huấn luyện và các tác vụ nghiên cứu linh hoạt, trong khi chip tùy biến của OpenAI mang đến một lựa chọn chuyên dụng cho những yêu cầu phục vụ ổn định, khối lượng lớn vốn chiếm phần đáng kể trong nhu cầu hạ tầng của công ty. 8
13
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Trong các bài kiểm tra công bố vào tháng 8/2026, OpenAI cho biết Jalapeño xử lý nhiều công việc AI hơn 1,5–1,9 lần trên mỗi watt và có độ trễ đầu cuối thấp hơn 1,7–3,6 lần so với các hệ thống Nvidia GB200, GB300 được...
Trong các bài kiểm tra công bố vào tháng 8/2026, OpenAI cho biết Jalapeño xử lý nhiều công việc AI hơn 1,5–1,9 lần trên mỗi watt và có độ trễ đầu cuối thấp hơn 1,7–3,6 lần so với các hệ thống Nvidia GB200, GB300 được... Benchmark InferenceX sử dụng ba mô hình mở có trọng số công khai: GPT OSS 120B, DeepSeek R1 670B và Kimi K2.5 1T, trong điều kiện một lượt với khoảng 8.000 token đầu vào và 1.000 token đầu ra.
Jalapeño là ASIC 700 watt, chỉ dành cho suy luận và được OpenAI phát triển cùng Broadcom.
Trong các bài kiểm tra công bố vào tháng 8/2026, OpenAI cho biết Jalapeño xử lý nhiều công việc AI hơn 1,5–1,9 lần trên mỗi watt và có độ trễ đầu cuối thấp hơn 1,7–3,6 lần so với các hệ thống Nvidia GB200, GB300 được... Benchmark InferenceX sử dụng ba mô hình mở có trọng số công khai: GPT OSS 120B, DeepSeek R1 670B...
Đăng bởiBiên tập bằng GPT-5.6 LunaHình ảnh được tạo bằng GPT Image 1.5
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What did OpenAI’s custom Jalapeño inference chip achieve in its August 2026 benchmarks against Nvidia’s GB200 and GB300 systems, which model. Article summary: OpenAI’s August 2026 results position Jalapeño as a potentially much more efficient, lower-latency option for high-volume LLM serving than the specific Nvidia GB200 and GB300 configurations tested—not as a general replac. Topic tags: general, news, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
OpenAI đang đưa ra một tuyên bố khá cụ thể về Jalapeño: chip tùy biến này có thể chạy các mô hình ngôn ngữ lớn với mức tiêu thụ điện thấp hơn và phản hồi nhanh hơn so với những hệ thống Nvidia GB200 và GB300 được chọn làm đối chứng. Trên benchmark InferenceX công khai của SemiAnalysis, OpenAI báo cáo Jalapeño xử lý nhiều công việc AI hơn 1,5–1,9 lần trên mỗi watt và đạt độ trễ đầu-cuối thấp hơn 1,7–3,6 lần trên ba mô hình mở.
Đây là kết quả đáng chú ý với một công ty phải phục vụ khối lượng truy vấn AI khổng lồ. Tuy nhiên, nó không đồng nghĩa Jalapeño đã chứng minh được mình là lựa chọn nhanh hơn hoặc rẻ hơn GPU trong mọi tình huống. Phạm vi thử nghiệm còn hẹp, chip chỉ được thiết kế cho suy luận, còn phần lớn số liệu do OpenAI tạo ra trên silicon kỹ thuật của chính mình. 14
OpenAI so sánh Jalapeño với các hệ thống Nvidia GB200 và GB300 trên InferenceX — bộ đo nhằm đánh giá toàn bộ quá trình phục vụ một yêu cầu AI, thay vì chỉ đo năng lực tính toán lý thuyết. Các chỉ số hiệu suất trên mỗi đơn vị điện năng được chuẩn hóa theo mức công suất công bố của từng bộ tăng tốc.
Trong các bài kiểm tra được báo cáo, Jalapeño đạt:
Khoảng cách độ trễ lớn nhất trong các số liệu được cung cấp xuất hiện ở DeepSeek R1 670B: Jalapeño hoàn tất một yêu cầu trong 1,65 giây, so với 5,99 giây trên hệ thống dùng GB300. 11
12
Dù vậy, đây là kết quả tương đối trong một bài benchmark, không phải lời hứa rằng ChatGPT sẽ luôn trả lời nhanh hơn đúng tỷ lệ đó hay giá API sẽ giảm tương ứng. Hiệu suất thực tế còn phụ thuộc vào mô hình, phần mềm phục vụ, cách gom nhiều yêu cầu, mạng, độ dài ngữ cảnh, độ dài câu trả lời và mục tiêu ưu tiên độ trễ hay thông lượng.
Benchmark bao phủ ba mô hình mở có trọng số công khai:
| Mô hình | Hệ thống Nvidia đối chiếu | Kết quả được báo cáo của Jalapeño |
|---|---|---|
| GPT-OSS 120B | GB200 | Khoảng 1,9 lần nhiều công việc hơn trên mỗi watt; độ trễ 1,03 giây so với 1,80 giây |
| DeepSeek R1 670B | GB300 | Khoảng 1,7 lần nhiều công việc hơn trên mỗi watt; độ trễ 1,65 giây so với 5,99 giây |
| Kimi K2.5 1T | GB300 | Khoảng 1,5 lần nhiều công việc hơn trên mỗi watt; độ trễ 1,56 giây so với 5,31 giây |
Các con số trên đến từ những bản tóm tắt kết quả được công bố, chứ chưa phải một bài kiểm tra toàn bộ bộ dữ liệu đã được bên độc lập tái tạo hoàn chỉnh. 6
11
12
Tải thử nghiệm về danh nghĩa là một lượt tương tác, gồm 8.000 token đầu vào và 1.000 token đầu ra. Cách thiết lập này giúp việc so sánh có kiểm soát, nhưng không đại diện cho mọi dạng lưu lượng AI trong thực tế. Nó chưa trả lời đầy đủ các câu hỏi về hội thoại nhiều lượt, gọi công cụ, quy trình tác vụ tự động, câu trả lời có độ dài thay đổi, khả năng gom lô hay yêu cầu có ngữ cảnh cực dài. 8
13
Benchmark cũng phản ánh một tổ hợp phần cứng và phần mềm cụ thể. Việc thay đổi trình biên dịch, kernel, phương pháp lượng tử hóa, bộ lập lịch, kiến trúc mô hình hoặc phần mềm vận hành của Nvidia có thể làm khoảng cách thay đổi đáng kể.
Jalapeño là ASIC — mạch tích hợp chuyên dụng — do OpenAI đồng phát triển với Broadcom cho tác vụ suy luận mô hình ngôn ngữ lớn. Khác với GPU đa dụng, nó được tối ưu cho việc chạy mô hình đã huấn luyện để tạo ra câu trả lời. 1
5
Các thông số hệ thống được báo cáo gồm:
Ở cấp chip, phiên bản B0 được báo cáo sử dụng một đế tính toán kích thước tối đa trong giới hạn reticle, sản xuất trên tiến trình N3P của TSMC, với năng lực 13,4 PFLOPS tính toán MXFP4. 18
Kiến trúc này cho thấy OpenAI đang tiếp cận bài toán theo hướng toàn hệ thống, chứ không chỉ tạo ra một bộ tăng tốc độc lập. Bộ nhớ, kết nối liên chip, mạng và giao tiếp ở quy mô rack đều quan trọng khi phục vụ các mô hình rất lớn — vốn thường phải phân bổ yêu cầu qua nhiều chip. 18
19
OpenAI và Broadcom được cho là đã đi từ ý tưởng đến tape-out — giai đoạn hoàn tất thiết kế để đưa chip vào sản xuất thử — trong khoảng chín tháng, một tiến độ đặc biệt ngắn đối với chip hiệu năng cao. 7
20
AI có tham gia hỗ trợ quy trình kỹ thuật, nhưng điều đó không có nghĩa một mô hình AI tự mình thiết kế và sản xuất bộ xử lý. Quá trình được báo cáo vẫn cần các nhóm kỹ sư và kiến trúc sư con người, công việc triển khai bán dẫn của Broadcom, đối tác sản xuất và khâu tích hợp hệ thống. 7
13
Cách diễn giải thận trọng hơn là OpenAI đã kết hợp hiểu biết về tải LLM với các công cụ AI trong quy trình kỹ thuật để đồng thiết kế phần cứng và phần mềm cho một mục tiêu phục vụ tương đối hẹp. Sự chuyên biệt này có thể cải thiện hiệu suất, nhưng cũng khiến Jalapeño kém linh hoạt hơn GPU lập trình được.
Jalapeño được xây dựng để chạy các mô hình đã huấn luyện, không phải để huấn luyện những mô hình tiên phong mới. Vì vậy, OpenAI vẫn cần các bộ tăng tốc có tính lập trình cao, đặc biệt là GPU, cho việc huấn luyện, nghiên cứu, thử nghiệm và những tác vụ không phù hợp với thiết kế suy luận cố định. 8
13
Đây là điểm giới hạn ý nghĩa của cụm từ “đánh bại Nvidia”. Jalapeño có thể vượt qua các cấu hình Nvidia được thử nghiệm ở một số chỉ số suy luận, trong khi phần cứng Nvidia vẫn giữ vai trò thiết yếu ở những phần khác trong hạ tầng tính toán của OpenAI. Một ASIC chuyên dụng có thể rất mạnh ở công việc ổn định, lặp lại với khối lượng lớn mà không thay thế được nền tảng rộng hơn dành cho huấn luyện và thay đổi mô hình nhanh chóng.
Các kết quả nên được hiểu là “tốt hơn trong những bài kiểm tra được báo cáo”, chứ chưa phải “hệ thống AI tốt nhất xét trên mọi phương diện”. Một số điểm cần đặc biệt lưu ý:
Vì vậy, chưa có cơ sở từ các kết quả này để khẳng định chi phí sẽ giảm phổ biến 50%, giá API chắc chắn thấp hơn hay Nvidia sẽ bị thay thế ngay lập tức. Bằng chứng hiện có chỉ ủng hộ các tuyên bố về hiệu suất và hiệu quả năng lượng trong những điều kiện cụ thể.
OpenAI dự kiến bắt đầu đưa Jalapeño vào hạ tầng của mình trước cuối năm 2026, với sản xuất số lượng lớn và mở rộng triển khai trong năm 2027. Về dài hạn, công ty hướng tới các trung tâm dữ liệu quy mô gigawatt cùng Microsoft và những đối tác hạ tầng khác, qua nhiều thế hệ chip. 1
6
Con chip này chủ yếu phục vụ nhu cầu nội bộ của OpenAI, thay vì được bán như một bộ xử lý thương mại. Do đó, các công ty bên ngoài không nên kỳ vọng có thể mua phần cứng Jalapeño hoặc thuê một phiên bản đám mây công khai chạy Jalapeño chỉ dựa trên những thông báo hiện tại. 1
6
Giữ phần cứng trong nội bộ cho phép OpenAI tối ưu chip theo các mô hình, kernel và hệ thống phục vụ của riêng mình. Cách làm này cũng giúp công ty tránh những nghĩa vụ đi kèm việc trở thành nhà cung cấp bán dẫn truyền thống, chẳng hạn hỗ trợ phần mềm cho khách hàng, xây dựng hệ sinh thái, bán hàng và xử lý cạnh tranh với chính khách hàng. Đây là phân tích chiến lược về mô hình triển khai; điều đã được xác nhận là kế hoạch sử dụng nội bộ, không phải bán chip ra bên ngoài. 1
6
Cách nhìn phù hợp nhất là xem Jalapeño như một phần trong danh mục tính toán toàn diện của OpenAI. Công ty đang kết hợp năng lực đám mây từ Microsoft và các đối tác khác, GPU kiểu Nvidia cho những tác vụ cần tính linh hoạt hoặc thiên về huấn luyện, cùng silicon tùy biến cho các tải suy luận ổn định — nơi việc chuyên biệt hóa có thể đem lại lợi ích. Danh mục tính toán do OpenAI mô tả còn bao gồm AWS, AMD, Broadcom, Cerebras, CoreWeave, Oracle, SB Energy và SoftBank.
Chiến lược này cũng phản ánh xu hướng rộng hơn trong ngành. Google phát triển TPU; Amazon có Trainium và Inferentia; Microsoft có Maia; AMD cạnh tranh bằng GPU AI đa dụng; còn Nvidia tiếp tục cung cấp các hệ thống có khả năng lập trình rộng. Anthropic cũng đang theo đuổi hạ tầng ngày càng tùy biến thông qua các quan hệ với nhà cung cấp đám mây, dù các bằng chứng benchmark hiện có không đưa ra so sánh hiệu suất trực tiếp với hệ thống của Anthropic.
Tác động chiến lược trước mắt vì thế phức tạp hơn câu chuyện “thay thế GPU”. Jalapeño có thể giúp OpenAI kiểm soát tốt hơn chi phí suy luận, độ trễ, nguồn cung và lộ trình phần cứng. Nvidia vẫn quan trọng với huấn luyện và các tác vụ nghiên cứu linh hoạt, trong khi chip tùy biến của OpenAI mang đến một lựa chọn chuyên dụng cho những yêu cầu phục vụ ổn định, khối lượng lớn vốn chiếm phần đáng kể trong nhu cầu hạ tầng của công ty. 8
13
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Trong các bài kiểm tra công bố vào tháng 8/2026, OpenAI cho biết Jalapeño xử lý nhiều công việc AI hơn 1,5–1,9 lần trên mỗi watt và có độ trễ đầu cuối thấp hơn 1,7–3,6 lần so với các hệ thống Nvidia GB200, GB300 được...
Trong các bài kiểm tra công bố vào tháng 8/2026, OpenAI cho biết Jalapeño xử lý nhiều công việc AI hơn 1,5–1,9 lần trên mỗi watt và có độ trễ đầu cuối thấp hơn 1,7–3,6 lần so với các hệ thống Nvidia GB200, GB300 được... Benchmark InferenceX sử dụng ba mô hình mở có trọng số công khai: GPT OSS 120B, DeepSeek R1 670B và Kimi K2.5 1T, trong điều kiện một lượt với khoảng 8.000 token đầu vào và 1.000 token đầu ra.
Jalapeño là ASIC 700 watt, chỉ dành cho suy luận và được OpenAI phát triển cùng Broadcom.