BigSet không đơn thuần chỉ là một lần gọi mô hình ngôn ngữ lớn (LLM). Nó là một hệ thống đa tác tử, trong đó một tác tử điều phối (orchestrator) phân công nhiệm vụ cho các tác tử chuyên biệt (sub-agents).
Pipeline hoạt động như sau :
Hệ thống được xây dựng cho các công việc định kỳ. Người dùng có thể đặt lịch làm mới dữ liệu, từ 30 phút một lần đến hàng tuần. Các tác tử sẽ tự động chạy lại toàn bộ pipeline nghiên cứu và xác thực, đảm bảo bộ dữ liệu luôn cập nhật mà không cần can thiệp thủ công .
BigSet được phát hành dưới giấy phép AGPL-3.0, một giấy phép 'copyleft' mạnh . Đối với các nhóm sửa đổi phần mềm và cung cấp nó như một dịch vụ mạng, giấy phép này thường yêu cầu mã nguồn đã sửa đổi phải được công khai cho người dùng. Khuôn khổ pháp lý này khác biệt so với các giấy phép thông thoáng hơn hoặc các mô hình SaaS độc quyền.
Hệ thống được đóng gói để tự triển khai (self-hosting) qua Docker . Điều này có nghĩa là toàn bộ pipeline — các tương tác web qua trình duyệt, suy luận tác tử dựa trên LLM và logic trích xuất — đều chạy trên hạ tầng của riêng bạn. Đối với các ngành có yêu cầu tuân thủ nghiêm ngặt, mô hình triển khai này giúp tránh các rủi ro về quyền riêng tư dữ liệu khi phải định tuyến các truy vấn thông minh kinh doanh nhạy cảm qua một API hoặc nền tảng đám mây của bên thứ ba. Quá trình trích xuất dữ liệu do đó vẫn nằm trong một môi trường mà bạn kiểm soát quyền truy cập, mạng lưới và nhật ký.
Đối thủ cạnh tranh trực tiếp nhất là Exa Websets, một sản phẩm từ Exa.ai, cũng xây dựng các bộ sưu tập dữ liệu có cấu trúc từ web. Cả hai sản phẩm đều hướng tới việc biến web thành một cơ sở dữ liệu có thể truy vấn, nhưng cách tiếp cận kỹ thuật và định vị thị trường khác nhau .
'Ảo giác' là mối quan tâm hàng đầu đối với bất kỳ hệ thống nào tự động xây dựng bộ dữ liệu. Một bài đánh giá từ Trendshift về BigSet đưa ra so sánh khi cả BigSet và một đối thủ cạnh tranh cùng chạy một truy vấn và đối thủ đó trả về dữ liệu 'bịa' (). Đối thủ cạnh tranh không được nêu tên rõ ràng trong nguồn, nhưng được đặt trong bối cảnh so sánh với một đối thủ được tài trợ tốt.
Exa giải quyết vấn đề này một cách trực diện thông qua quy trình phát hiện ba bước được ghi chép lại, sử dụng khả năng tìm kiếm của chính nó: trích xuất các tuyên bố từ văn bản, tìm kiếm bằng chứng và xác minh các tuyên bố dựa trên bằng chứng thu được . Sản phẩm Websets của Exa cũng chạy các quy trình tác tử trên các ứng viên tìm kiếm để xác minh chúng khớp với truy vấn chính xác của người dùng trước khi thêm vào bộ dữ liệu cuối cùng .
Các nguồn tin về BigSet mô tả một giai đoạn xác minh chuyên dụng, nơi các tác tử phụ xác minh kết quả so với nguồn trước khi bảng được hoàn thiện . Kiến trúc cụ thể của tác tử xác minh này — liệu đó là một bước kiểm tra đơn giản hay một hệ thống đa bước phức tạp hơn — không được mô tả chi tiết. Tuy nhiên, mục đích của nó trong pipeline là rất rõ ràng: ngăn chặn các hàng dữ liệu không có nguồn trích dẫn lọt vào bộ dữ liệu xuất ra.
| Khía cạnh | BigSet | Exa Websets |
|---|---|---|
| Mô hình cốt lõi | Hệ thống đa tác tử: một tác tử điều phối lập kế hoạch schema và phân công các tác tử phụ duyệt web, trích xuất, xác minh dữ liệu trực tiếp. | Công cụ tìm kiếm dựa trên embeddings, chạy các quy trình tác tử xác minh trên các ứng viên tìm kiếm. |
| Giấy phép | AGPL-3.0 mã nguồn mở. | Độc quyền. |
| Triển khai | Tự triển khai qua Docker. | SaaS dạng đám mây; có gói Enterprise. |
| Tương tác Web | Các phiên trình duyệt thực: điều hướng, nhấp chuột và trích xuất như người dùng, xử lý các trang động và đăng nhập. | Chủ yếu dựa trên tìm kiếm; dùng neural embeddings để tìm trang và xác minh nội dung. |
| Giá cả | Mã nguồn mở, không có phí nền tảng cho tự triển khai. Người dùng tự quản lý chi phí tính toán và API mô hình. | Websets khởi điểm $49/tháng cho 8.000 credits; gói Enterprise tùy chỉnh. |
| Quyền riêng tư dữ liệu | Kiểm soát hoàn toàn — chạy trên hạ tầng riêng của bạn. | Xử lý dữ liệu diễn ra trên máy chủ của Exa. |
BigSet không chỉ là một công cụ mới; nó đại diện cho một sự thay đổi trong cách các pipeline dữ liệu có thể được xây dựng. Đối với một nhóm nhỏ hoặc một nhà phân tích bận rộn, việc nén một quy trình viết và gỡ lỗi scraper kéo dài hàng giờ thành một tương tác ngôn ngữ tự nhiên 2-5 phút là một sự tiết kiệm thời gian đáng kể .
Giấy phép AGPL-3.0 và triển khai Docker cũng định vị BigSet như một câu trả lời cho những lo ngại ngày càng tăng về quyền riêng tư dữ liệu và sự phụ thuộc vào một nhà cung cấp pipeline duy nhất. Bằng cách chạy hệ thống cục bộ, các công ty tránh phải gửi dữ liệu kinh doanh qua bên thứ ba và có quyền tự do sửa đổi pipeline khi nhu cầu của họ thay đổi.
TinyFish, đã huy động được 47 triệu đô la và có khách hàng như Google, DoorDash, và Amazon cho nền tảng hạ tầng rộng lớn hơn của mình, dường như đang sử dụng BigSet để thúc đẩy sự chấp nhận công nghệ tác tử web cốt lõi của mình, đồng thời cung cấp một công cụ miễn phí thực sự hữu ích cho cộng đồng .