BigSet bukan sekadar satu panggilan kepada model bahasa besar. Ia menggunakan beberapa ejen khusus yang menerima tugasan berbeza, dengan sebuah ejen penyelaras menguruskan keseluruhan aliran kerja.
Berdasarkan dokumentasi dan liputan pelancaran, prosesnya berjalan seperti berikut :
Kekuatan utama BigSet ialah kerja berulang. Pengguna boleh menetapkan kekerapan kemas kini daripada setiap 30 minit hingga setiap minggu. Ejen kemudiannya mengulangi proses penyelidikan dan pengesahan secara automatik supaya set data tidak cepat lapuk .
BigSet diterbitkan di bawah AGPL-3.0, iaitu lesen sumber terbuka dengan syarat copyleft yang kuat . Secara umum, jika sesebuah organisasi mengubah suai perisian itu dan menyediakannya sebagai perkhidmatan rangkaian, lesen ini boleh mewajibkan kod sumber yang diubah suai turut disediakan kepada pengguna.
Perisian ini juga dibungkus untuk penggunaan sendiri berasaskan Docker . Ini bermakna komponen seperti interaksi pelayar web, penaakulan ejen berasaskan model bahasa dan logik pengekstrakan boleh dijalankan pada infrastruktur organisasi sendiri.
Bagi pasukan yang mengendalikan risikan perniagaan sensitif, model ini memberi kawalan yang lebih langsung terhadap tempat data diproses. Organisasi boleh mengurus sendiri kebenaran akses, sambungan rangkaian dan log, berbanding menghantar setiap pertanyaan melalui platform awan pihak ketiga. Namun begitu, penggunaan sendiri tidak menghapuskan keperluan untuk mengurus kos pengkomputeran, model AI, keselamatan dan penyelenggaraan sistem.
Pesaing yang paling hampir dari segi fungsi ialah Exa Websets, produk Exa.ai yang turut membina koleksi data berstruktur daripada web. Kedua-duanya mahu menjadikan web lebih mudah ditukar kepada pangkalan data yang boleh dicari, tetapi pendekatan teknikal dan kedudukan pasaran mereka berbeza .
| Aspek | BigSet | Exa Websets |
|---|---|---|
| Model teras | Sistem multi-ejen: ejen penyelaras merancang struktur data, kemudian ejen lain melayari, mengekstrak dan mengesahkan data web secara langsung | Enjin carian berasaskan embeddings yang menjalankan aliran kerja ejen untuk mengesahkan calon hasil carian |
| Lesen | Sumber terbuka di bawah AGPL-3.0 | Proprietari |
| Penggunaan | Boleh dihoskan sendiri melalui Docker | Perkhidmatan SaaS berasaskan awan, dengan pelan perusahaan |
| Interaksi dengan web | Sesi pelayar sebenar boleh menavigasi, mengklik dan mengekstrak maklumat seperti pengguna, termasuk daripada laman dinamik | Lebih berorientasikan carian; embeddings digunakan untuk mencari halaman berkaitan sebelum kandungan disahkan |
| Harga | Tiada yuran platform bagi pemasangan sendiri, tetapi pengguna menanggung kos infrastruktur dan API model | Websets bermula pada AS$49 sebulan untuk 8,000 kredit; pelan perusahaan ditawarkan secara tersuai |
| Kedaulatan data | Organisasi mengekalkan kawalan terhadap infrastruktur sendiri | Pemprosesan data berlaku pada pelayan Exa |
Bagi mana-mana sistem yang membina set data secara autonomi, ketepatan setiap baris adalah isu utama. Liputan Trendshift menyebut satu perbandingan apabila BigSet dan pesaing yang dibiayai besar menjalankan pertanyaan yang sama, lalu sebahagian data pesaing didakwa mengandungi maklumat yang direka . Sumber itu tidak menamakan pesaing berkenaan secara jelas, jadi dakwaan tersebut wajar dibaca sebagai tuntutan perbandingan, bukan penanda aras bebas.
Exa pula mendokumentasikan aliran pengesanan halusinasi tiga langkah: mengekstrak dakwaan daripada teks, mencari bukti dan menyemak dakwaan berbanding bukti yang ditemui . Produk Websets Exa juga menggunakan aliran kerja berasaskan ejen untuk mengesahkan sama ada calon hasil carian benar-benar menepati pertanyaan pengguna sebelum dimasukkan ke dalam set akhir .
Sumber pelancaran BigSet menyatakan bahawa sistem itu mempunyai peringkat pengesahan yang menyemak dapatan dengan sumber asal . Namun, butiran seni bina—sama ada pemeriksaan satu langkah atau proses berbilang pusingan—belum diterangkan sepenuhnya dalam bahan yang tersedia. Yang jelas, matlamatnya adalah untuk menghalang baris tanpa sokongan sumber daripada masuk ke dalam set data yang dieksport.
BigSet mencerminkan perubahan dalam cara saluran paip data boleh dibina. Proses yang sebelum ini memerlukan berjam-jam untuk menulis, menguji dan membaiki pengikis web kini boleh dimulakan dengan arahan bahasa biasa, dan sesetengah liputan menganggarkan interaksi itu boleh dipendekkan kepada sekitar 2 hingga 5 minit .
Bagi penganalisis atau pasukan kecil, ini bermakna mereka tidak semestinya perlu memulakan projek dengan skrip tersuai atau proses ETL yang panjang. Mereka boleh menerangkan data yang diperlukan, membiarkan ejen menjalankan penyelidikan dan menerima jadual yang boleh digunakan sebagai titik permulaan.
Walau bagaimanapun, BigSet bukan bermakna pengawasan manusia sudah tidak diperlukan. Data daripada web boleh berubah, halaman boleh menyekat akses dan model AI masih boleh tersilap mentafsir maklumat. Untuk kegunaan keputusan penting, hasilnya tetap perlu disemak, terutama apabila sumber asal tidak seragam atau kriterianya terlalu umum.
Lesen AGPL-3.0 dan pilihan penggunaan sendiri melalui Docker pula meletakkan BigSet sebagai alternatif kepada platform data proprietari yang lebih tertutup. TinyFish dilaporkan telah mengumpulkan AS$47 juta dan mempunyai Google, DoorDash serta Amazon antara pelanggan platform infrastrukturnya yang lebih luas . Dengan membuka BigSet kepada komuniti, syarikat itu berpotensi memperkenalkan teknologi ejen webnya kepada lebih ramai pembangun sambil menawarkan alat yang boleh terus dicuba dan diubah suai.