Ra mắt ngày 24/8, Pipette đánh giá toàn bộ cấu hình AI chạy trên thiết bị thay vì chỉ đo riêng trọng số mô hình. Bộ benchmark hỗ trợ ứng dụng iOS và Android, nhiều định dạng lượng tử hóa, cùng các bản dựng llama.cpp trên macOS, iOS, Windows và Android.
Đăng bởiBiên tập bằng GPT-5.6 LunaHình ảnh được tạo bằng GPT Image 1.5
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open-source on-device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open-source benchmark suite for measuring an actual on-device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload. Released August 24 wi. Topic tags: general, general web, user generated, academic, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, wa
Pipette là bộ công cụ benchmark mã nguồn mở của Liquid AI, được phát triển cùng Artificial Analysis để đánh giá các mô hình AI ngay trên nơi chúng được sử dụng: điện thoại, máy tính xách tay, PC và những thiết bị biên khác. Pipette xem toàn bộ cấu hình triển khai, chứ không chỉ riêng mô hình, là đơn vị đo. Vì vậy, kết quả luôn gắn với mô hình, mức lượng tử hóa, runtime, thiết bị và khối lượng công việc cụ thể. 3
1
Nhiều bảng xếp hạng AI tập trung vào điểm năng lực hoặc đưa ra một con số duy nhất về tốc độ suy luận. Pipette được thiết kế để cho thấy toàn bộ hệ thống hoạt động ra sao trong một lần triển khai thực tế.
Ngay cả khi trọng số mô hình không thay đổi, việc chuyển sang một định dạng lượng tử hóa khác, runtime khác, backend khác hoặc thiết bị có mức áp lực bộ nhớ khác cũng có thể làm kết quả thay đổi đáng kể.
Đợt ra mắt ngày 24/8 đi kèm một bộ dữ liệu công khai gồm các kết quả đã được kiểm chứng trong phòng thí nghiệm, bao phủ hơn 1.000 cấu hình mô hình, lượng tử hóa, runtime, thiết bị và ngữ cảnh. Phiên bản ban đầu có hơn 30 mô hình, nhiều định dạng lượng tử hóa và các bản dựng llama.cpp cho macOS, iOS, Windows và Android. Dữ liệu hiệu năng được chuẩn hóa ở các độ dài ngữ cảnh từ 256 đến 8.192 token. 3
Các phép đo suy luận của Pipette được ghép với đánh giá năng lực của mô hình di động do Artificial Analysis thực hiện. Nhờ đó, bài đánh giá xem xét đồng thời hai câu hỏi: mô hình trả lời tốt đến đâu, và một cấu hình triển khai cụ thể chạy nhanh, tiết kiệm bộ nhớ đến mức nào. 33
Pipette có ứng dụng gốc cho iOS và Android, cho phép tải mô hình về điện thoại rồi chạy trực tiếp trên thiết bị. Phạm vi benchmark rộng hơn cũng bao gồm macOS và Windows thông qua các bản dựng runtime được hỗ trợ. Những thiết bị tham chiếu được nêu trong tài liệu ra mắt gồm iPhone 17 Pro, Galaxy S26 Ultra và MacBook Pro dùng chip M5 Max. 3
38
Người dùng phải tải mô hình về thiết bị trước khi kiểm tra. Do đó, Pipette đo suy luận cục bộ, không đo độ trễ của một API AI trên nền tảng đám mây. 41
50
Bảng xếp hạng có các mô hình thuộc dòng LFM2.5 của Liquid AI cùng nhiều mô hình bên thứ ba. Một số tên được liệt kê gồm Gemma, Nanbeige, Granite, Qwen và các biến thể nhỏ hoặc đã nén khác. 9
41
Benchmark hỗ trợ nhiều định dạng lượng tử hóa. Phần so sánh năng lực AI trên điện thoại tập trung vào những mô hình có kích thước dưới 8 GB sau khi lượng tử hóa 4-bit, phù hợp với các thiết bị có dung lượng bộ nhớ hạn chế. 3
41
Trong triển khai cục bộ, tài liệu Liquid AI phân biệt GGUF, định dạng thường dùng với llama.cpp trên các mục tiêu CPU và GPU, với MLX, định dạng phù hợp cho các thiết bị Apple Silicon. 47 Kích thước tệp của mô hình lượng tử hóa chỉ là một phần câu chuyện; runtime và backend phần cứng mới quyết định mô hình được xử lý thực tế như thế nào.
Bộ dữ liệu ra mắt báo cáo các cấu hình suy luận được chuẩn hóa ở độ dài ngữ cảnh từ 256 đến 8.192 token. 3 Trong khi đó, bài đánh giá năng lực mô hình di động riêng của Artificial Analysis sử dụng giới hạn ngữ cảnh 16K token.
33
Không nên nhầm các giới hạn này với cửa sổ ngữ cảnh tối đa mà mô hình quảng bá. Tài liệu mô hình của Liquid AI liệt kê ngữ cảnh 32K token cho nhiều mẫu LFM và 128K token cho LFM2.5-8B-A1B. Tuy nhiên, khả năng của mô hình không có nghĩa mọi bài kiểm tra trên điện thoại đều chạy ở độ dài tối đa đó. 47
Pipette kết hợp nhiều chiều hiệu năng trên thiết bị thay vì rút gọn kết quả thành tốc độ giải mã token. Năm chỉ số chính gồm tốc độ xử lý prompt hoặc prefill, thông lượng tạo văn bản hoặc decode, thời gian xuất hiện token đầu tiên, thời gian tạo xong toàn bộ phản hồi và mức sử dụng bộ nhớ. 1
3
14
Cách đo này quan trọng vì một cấu hình có thể tạo token rất nhanh nhưng khởi động chậm, chiếm quá nhiều bộ nhớ hoặc giảm tốc khi ngữ cảnh dài hơn. Thời gian phản hồi từ đầu đến cuối đặc biệt hữu ích để đánh giá trải nghiệm mà người dùng thực sự nhận được từ một trợ lý AI chạy cục bộ.
Ở phía chất lượng, Artificial Analysis đánh giá các năng lực như làm theo chỉ dẫn, sử dụng công cụ, suy luận và những khả năng liên quan khác trong bài kiểm tra mô hình di động. 33
Mỗi kết quả của Pipette được gắn với một cấu hình rõ ràng, đồng thời các quy trình tạo ra dữ liệu đã được kiểm chứng cũng được công bố. Dashboard tách bảng xếp hạng khỏi các kết quả chi tiết và dữ liệu gửi lên, cho phép người dùng kiểm tra từng dòng benchmark thay vì chỉ dựa vào một thứ hạng tổng quát. 1
Phương pháp này cũng ghi nhận các phụ thuộc của runtime. Chẳng hạn, Liquid AI cho biết những kết quả hiệu năng công khai hiện tại yêu cầu các bản dựng llama.cpp cụ thể, trong đó có b10216 và b10516. 2 Việc cố định phiên bản runtime giúp tránh trường hợp thay đổi phần mềm bị hiểu nhầm là cải thiện đến từ mô hình hoặc phần cứng.
Dù vậy, các biện pháp trên không thể loại bỏ mọi biến động. Hiện tượng giảm xung do nhiệt, trạng thái hệ điều hành, dung lượng bộ nhớ khả dụng, firmware, lựa chọn backend và giới hạn công suất duy trì đều có thể ảnh hưởng đến kết quả trên điện thoại. Một con số chỉ thực sự có ý nghĩa khi các biến số này tương đồng.
Các kết quả đầu tiên cho thấy vì sao Pipette công bố những cấu hình hoàn chỉnh thay vì đưa ra một bảng xếp hạng mô hình mang tính tuyệt đối.
Bài học quan trọng là chất lượng, tốc độ, độ trễ và mức dùng bộ nhớ có thể cho ra những câu trả lời khác nhau. Mô hình nhanh nhất chưa chắc thông minh nhất; mô hình đạt điểm năng lực cao nhất cũng chưa chắc là lựa chọn tốt nhất cho điện thoại.
Hạn chế đáng chú ý nhất của phiên bản di động ban đầu nằm ở sự khác biệt giữa hai ứng dụng. Bản iOS có thể sử dụng GPU thông qua hệ sinh thái Metal của Apple, trong đó có MLX. Bản Android lúc đầu chỉ hỗ trợ suy luận bằng CPU. 41
50
Vì vậy, một kết quả iPhone dùng MLX/Metal và một kết quả Android chạy bằng CPU không phải phép so sánh trực tiếp giữa toàn bộ phần cứng AI của hai điện thoại. Phép đo trên iOS có thể hưởng lợi từ tăng tốc GPU, còn kết quả Android phản ánh hiệu năng của đường xử lý CPU mà ứng dụng hiện tại cung cấp.
Kết quả Android vẫn hữu ích để hiểu suy luận cục bộ dựa trên CPU và trải nghiệm mà triển khai đó mang lại. Tuy nhiên, chưa thể dùng chúng để kết luận chip AI tổng thể của điện thoại này nhanh hơn điện thoại kia, cho đến khi các backend GPU hoặc NPU tương đương được kiểm tra với cùng khối lượng công việc.
Pipette xuất hiện đúng lúc các hãng chip đang quảng bá khả năng xử lý AI cục bộ và AI tác vụ nhanh hơn. Nền tảng Snapdragon 8 Elite Gen 5 của Qualcomm sử dụng CPU Oryon thế hệ thứ ba, đạt xung nhịp tối đa 4,74 GHz; Qualcomm tuyên bố nền tảng này tăng 20% hiệu năng CPU và cải thiện 35% hiệu suất năng lượng CPU. 24
Qualcomm cũng đã hé lộ một nền tảng Snapdragon cao cấp kế tiếp với CPU Oryon hướng tới mốc 5 GHz và kiến trúc FlexCache, cho phép các lõi CPU không đồng nhất dùng chung một vùng bộ nhớ đệm được phân bổ động. 23
Những thông số này cho thấy AI trên thiết bị đang trở thành một mặt trận cạnh tranh phần cứng. Nhưng chỉ nhìn vào xung nhịp là chưa đủ để dự đoán hiệu năng mô hình ngôn ngữ. Lượng tử hóa, băng thông bộ nhớ, cách bộ nhớ đệm hoạt động, cách triển khai runtime, việc sử dụng GPU hoặc NPU, nhiệt độ và giới hạn công suất duy trì đều có thể quan trọng không kém.
Đó là điểm mạnh trong cách tiếp cận dựa trên cấu hình của Pipette. Về lâu dài, giá trị lớn nhất của benchmark này sẽ là cho thấy một cải tiến được quảng bá ở cấp chip có thực sự chuyển thành AI cục bộ nhanh hơn, phản hồi nhạy hơn và tiết kiệm bộ nhớ hơn trong một workload có thể tái lập hay không.
Ở thời điểm hiện tại, cách hiểu thận trọng nhất là xem Pipette như một benchmark minh bạch về triển khai AI trên thiết bị, không phải bảng xếp hạng cuối cùng để phán định phần cứng iPhone hay Android bên nào nhanh hơn.
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Ra mắt ngày 24/8, Pipette đánh giá toàn bộ cấu hình AI chạy trên thiết bị thay vì chỉ đo riêng trọng số mô hình.
Ra mắt ngày 24/8, Pipette đánh giá toàn bộ cấu hình AI chạy trên thiết bị thay vì chỉ đo riêng trọng số mô hình. Bộ benchmark hỗ trợ ứng dụng iOS và Android, nhiều định dạng lượng tử hóa, cùng các bản dựng llama.cpp trên macOS, iOS, Windows và Android.
Dữ liệu ban đầu bao phủ hơn 1.000 cấu hình, hơn 30 mô hình và độ dài ngữ cảnh từ 256 đến 8.192 token.
Ra mắt ngày 24/8, Pipette đánh giá toàn bộ cấu hình AI chạy trên thiết bị thay vì chỉ đo riêng trọng số mô hình. Bộ benchmark hỗ trợ ứng dụng iOS và Android, nhiều định dạng lượng tử hóa, cùng các bản dựng llama.cpp trên macOS, iOS, Windows và Android.
Đăng bởiBiên tập bằng GPT-5.6 LunaHình ảnh được tạo bằng GPT Image 1.5
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open-source on-device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open-source benchmark suite for measuring an actual on-device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload. Released August 24 wi. Topic tags: general, general web, user generated, academic, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, wa
Pipette là bộ công cụ benchmark mã nguồn mở của Liquid AI, được phát triển cùng Artificial Analysis để đánh giá các mô hình AI ngay trên nơi chúng được sử dụng: điện thoại, máy tính xách tay, PC và những thiết bị biên khác. Pipette xem toàn bộ cấu hình triển khai, chứ không chỉ riêng mô hình, là đơn vị đo. Vì vậy, kết quả luôn gắn với mô hình, mức lượng tử hóa, runtime, thiết bị và khối lượng công việc cụ thể. 3
1
Nhiều bảng xếp hạng AI tập trung vào điểm năng lực hoặc đưa ra một con số duy nhất về tốc độ suy luận. Pipette được thiết kế để cho thấy toàn bộ hệ thống hoạt động ra sao trong một lần triển khai thực tế.
Ngay cả khi trọng số mô hình không thay đổi, việc chuyển sang một định dạng lượng tử hóa khác, runtime khác, backend khác hoặc thiết bị có mức áp lực bộ nhớ khác cũng có thể làm kết quả thay đổi đáng kể.
Đợt ra mắt ngày 24/8 đi kèm một bộ dữ liệu công khai gồm các kết quả đã được kiểm chứng trong phòng thí nghiệm, bao phủ hơn 1.000 cấu hình mô hình, lượng tử hóa, runtime, thiết bị và ngữ cảnh. Phiên bản ban đầu có hơn 30 mô hình, nhiều định dạng lượng tử hóa và các bản dựng llama.cpp cho macOS, iOS, Windows và Android. Dữ liệu hiệu năng được chuẩn hóa ở các độ dài ngữ cảnh từ 256 đến 8.192 token. 3
Các phép đo suy luận của Pipette được ghép với đánh giá năng lực của mô hình di động do Artificial Analysis thực hiện. Nhờ đó, bài đánh giá xem xét đồng thời hai câu hỏi: mô hình trả lời tốt đến đâu, và một cấu hình triển khai cụ thể chạy nhanh, tiết kiệm bộ nhớ đến mức nào. 33
Pipette có ứng dụng gốc cho iOS và Android, cho phép tải mô hình về điện thoại rồi chạy trực tiếp trên thiết bị. Phạm vi benchmark rộng hơn cũng bao gồm macOS và Windows thông qua các bản dựng runtime được hỗ trợ. Những thiết bị tham chiếu được nêu trong tài liệu ra mắt gồm iPhone 17 Pro, Galaxy S26 Ultra và MacBook Pro dùng chip M5 Max. 3
38
Người dùng phải tải mô hình về thiết bị trước khi kiểm tra. Do đó, Pipette đo suy luận cục bộ, không đo độ trễ của một API AI trên nền tảng đám mây. 41
50
Bảng xếp hạng có các mô hình thuộc dòng LFM2.5 của Liquid AI cùng nhiều mô hình bên thứ ba. Một số tên được liệt kê gồm Gemma, Nanbeige, Granite, Qwen và các biến thể nhỏ hoặc đã nén khác. 9
41
Benchmark hỗ trợ nhiều định dạng lượng tử hóa. Phần so sánh năng lực AI trên điện thoại tập trung vào những mô hình có kích thước dưới 8 GB sau khi lượng tử hóa 4-bit, phù hợp với các thiết bị có dung lượng bộ nhớ hạn chế. 3
41
Trong triển khai cục bộ, tài liệu Liquid AI phân biệt GGUF, định dạng thường dùng với llama.cpp trên các mục tiêu CPU và GPU, với MLX, định dạng phù hợp cho các thiết bị Apple Silicon. 47 Kích thước tệp của mô hình lượng tử hóa chỉ là một phần câu chuyện; runtime và backend phần cứng mới quyết định mô hình được xử lý thực tế như thế nào.
Bộ dữ liệu ra mắt báo cáo các cấu hình suy luận được chuẩn hóa ở độ dài ngữ cảnh từ 256 đến 8.192 token. 3 Trong khi đó, bài đánh giá năng lực mô hình di động riêng của Artificial Analysis sử dụng giới hạn ngữ cảnh 16K token.
33
Không nên nhầm các giới hạn này với cửa sổ ngữ cảnh tối đa mà mô hình quảng bá. Tài liệu mô hình của Liquid AI liệt kê ngữ cảnh 32K token cho nhiều mẫu LFM và 128K token cho LFM2.5-8B-A1B. Tuy nhiên, khả năng của mô hình không có nghĩa mọi bài kiểm tra trên điện thoại đều chạy ở độ dài tối đa đó. 47
Pipette kết hợp nhiều chiều hiệu năng trên thiết bị thay vì rút gọn kết quả thành tốc độ giải mã token. Năm chỉ số chính gồm tốc độ xử lý prompt hoặc prefill, thông lượng tạo văn bản hoặc decode, thời gian xuất hiện token đầu tiên, thời gian tạo xong toàn bộ phản hồi và mức sử dụng bộ nhớ. 1
3
14
Cách đo này quan trọng vì một cấu hình có thể tạo token rất nhanh nhưng khởi động chậm, chiếm quá nhiều bộ nhớ hoặc giảm tốc khi ngữ cảnh dài hơn. Thời gian phản hồi từ đầu đến cuối đặc biệt hữu ích để đánh giá trải nghiệm mà người dùng thực sự nhận được từ một trợ lý AI chạy cục bộ.
Ở phía chất lượng, Artificial Analysis đánh giá các năng lực như làm theo chỉ dẫn, sử dụng công cụ, suy luận và những khả năng liên quan khác trong bài kiểm tra mô hình di động. 33
Mỗi kết quả của Pipette được gắn với một cấu hình rõ ràng, đồng thời các quy trình tạo ra dữ liệu đã được kiểm chứng cũng được công bố. Dashboard tách bảng xếp hạng khỏi các kết quả chi tiết và dữ liệu gửi lên, cho phép người dùng kiểm tra từng dòng benchmark thay vì chỉ dựa vào một thứ hạng tổng quát. 1
Phương pháp này cũng ghi nhận các phụ thuộc của runtime. Chẳng hạn, Liquid AI cho biết những kết quả hiệu năng công khai hiện tại yêu cầu các bản dựng llama.cpp cụ thể, trong đó có b10216 và b10516. 2 Việc cố định phiên bản runtime giúp tránh trường hợp thay đổi phần mềm bị hiểu nhầm là cải thiện đến từ mô hình hoặc phần cứng.
Dù vậy, các biện pháp trên không thể loại bỏ mọi biến động. Hiện tượng giảm xung do nhiệt, trạng thái hệ điều hành, dung lượng bộ nhớ khả dụng, firmware, lựa chọn backend và giới hạn công suất duy trì đều có thể ảnh hưởng đến kết quả trên điện thoại. Một con số chỉ thực sự có ý nghĩa khi các biến số này tương đồng.
Các kết quả đầu tiên cho thấy vì sao Pipette công bố những cấu hình hoàn chỉnh thay vì đưa ra một bảng xếp hạng mô hình mang tính tuyệt đối.
Bài học quan trọng là chất lượng, tốc độ, độ trễ và mức dùng bộ nhớ có thể cho ra những câu trả lời khác nhau. Mô hình nhanh nhất chưa chắc thông minh nhất; mô hình đạt điểm năng lực cao nhất cũng chưa chắc là lựa chọn tốt nhất cho điện thoại.
Hạn chế đáng chú ý nhất của phiên bản di động ban đầu nằm ở sự khác biệt giữa hai ứng dụng. Bản iOS có thể sử dụng GPU thông qua hệ sinh thái Metal của Apple, trong đó có MLX. Bản Android lúc đầu chỉ hỗ trợ suy luận bằng CPU. 41
50
Vì vậy, một kết quả iPhone dùng MLX/Metal và một kết quả Android chạy bằng CPU không phải phép so sánh trực tiếp giữa toàn bộ phần cứng AI của hai điện thoại. Phép đo trên iOS có thể hưởng lợi từ tăng tốc GPU, còn kết quả Android phản ánh hiệu năng của đường xử lý CPU mà ứng dụng hiện tại cung cấp.
Kết quả Android vẫn hữu ích để hiểu suy luận cục bộ dựa trên CPU và trải nghiệm mà triển khai đó mang lại. Tuy nhiên, chưa thể dùng chúng để kết luận chip AI tổng thể của điện thoại này nhanh hơn điện thoại kia, cho đến khi các backend GPU hoặc NPU tương đương được kiểm tra với cùng khối lượng công việc.
Pipette xuất hiện đúng lúc các hãng chip đang quảng bá khả năng xử lý AI cục bộ và AI tác vụ nhanh hơn. Nền tảng Snapdragon 8 Elite Gen 5 của Qualcomm sử dụng CPU Oryon thế hệ thứ ba, đạt xung nhịp tối đa 4,74 GHz; Qualcomm tuyên bố nền tảng này tăng 20% hiệu năng CPU và cải thiện 35% hiệu suất năng lượng CPU. 24
Qualcomm cũng đã hé lộ một nền tảng Snapdragon cao cấp kế tiếp với CPU Oryon hướng tới mốc 5 GHz và kiến trúc FlexCache, cho phép các lõi CPU không đồng nhất dùng chung một vùng bộ nhớ đệm được phân bổ động. 23
Những thông số này cho thấy AI trên thiết bị đang trở thành một mặt trận cạnh tranh phần cứng. Nhưng chỉ nhìn vào xung nhịp là chưa đủ để dự đoán hiệu năng mô hình ngôn ngữ. Lượng tử hóa, băng thông bộ nhớ, cách bộ nhớ đệm hoạt động, cách triển khai runtime, việc sử dụng GPU hoặc NPU, nhiệt độ và giới hạn công suất duy trì đều có thể quan trọng không kém.
Đó là điểm mạnh trong cách tiếp cận dựa trên cấu hình của Pipette. Về lâu dài, giá trị lớn nhất của benchmark này sẽ là cho thấy một cải tiến được quảng bá ở cấp chip có thực sự chuyển thành AI cục bộ nhanh hơn, phản hồi nhạy hơn và tiết kiệm bộ nhớ hơn trong một workload có thể tái lập hay không.
Ở thời điểm hiện tại, cách hiểu thận trọng nhất là xem Pipette như một benchmark minh bạch về triển khai AI trên thiết bị, không phải bảng xếp hạng cuối cùng để phán định phần cứng iPhone hay Android bên nào nhanh hơn.
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Ra mắt ngày 24/8, Pipette đánh giá toàn bộ cấu hình AI chạy trên thiết bị thay vì chỉ đo riêng trọng số mô hình.
Ra mắt ngày 24/8, Pipette đánh giá toàn bộ cấu hình AI chạy trên thiết bị thay vì chỉ đo riêng trọng số mô hình. Bộ benchmark hỗ trợ ứng dụng iOS và Android, nhiều định dạng lượng tử hóa, cùng các bản dựng llama.cpp trên macOS, iOS, Windows và Android.
Dữ liệu ban đầu bao phủ hơn 1.000 cấu hình, hơn 30 mô hình và độ dài ngữ cảnh từ 256 đến 8.192 token.