BigSet은 단일 대규모 언어 모델(LLM) 호출이 아닙니다. 작업을 전문화된 서브 에이전트에게 위임하는 멀티 에이전트 시스템이며, 오케스트레이터가 전체 워크플로우를 관리합니다.
문서화된 파이프라인은 다음과 같이 작동합니다 :
이 시스템은 반복 작업을 위해 설계되었습니다. 사용자는 30분에서 주 단위로 새로고침 주기를 설정할 수 있으며, 에이전트는 해당 일정에 따라 전체 리서치 및 검증 파이프라인을 재실행하여 데이터가 수동 개입 없이 최신 상태를 유지하도록 합니다 .
BigSet은 강력한 카피레프트 라이선스인 AGPL-3.0으로 배포됩니다 . 소프트웨어를 수정하여 네트워크 서비스로 제공하는 팀은 일반적으로 수정된 소스 코드를 사용자에게 공개해야 합니다. 이 법적 프레임워크는 관대한 라이선스나 독점 SaaS 모델과 대조됩니다.
이 시스템은 Docker 기반 자체 호스팅을 위해 패키징되었습니다 . 이는 브라우저 기반 웹 상호작용, LLM 기반 에이전트 추론, 추출 로직을 포함한 전체 파이프라인이 사용자 자신의 인프라에서 실행된다는 것을 의미합니다. 엄격한 규제 준수 요구 사항이 있는 산업의 경우, 이 배포 모델은 민감한 비즈니스 인텔리전스 쿼리를 타사 클라우드 API나 플랫폼으로 라우팅하는 데이터 주권 위험을 피할 수 있습니다. 따라서 데이터 추출 프로세스는 사용자가 액세스, 네트워킹 및 로그를 관리하는 통제된 환경 내에서 유지됩니다.
가장 직접적인 경쟁 제품은 웹에서 구조화된 데이터 컬렉션을 구축하는 Exa.ai의 Exa Websets입니다. 두 제품 모두 웹을 쿼리 가능한 데이터베이스로 전환하는 것을 목표로 하지만, 기술적 접근 방식과 시장 포지셔닝이 다릅니다 .
환각은 데이터셋을 자율적으로 구축하는 모든 시스템의 중요한 문제입니다. BigSet을 다룬 Trendshift 기사에서는 BigSet과 경쟁사가 동일한 쿼리를 실행했을 때 경쟁사가 환각 데이터를 반환했다는 비교가 강조되었습니다 . 해당 경쟁사의 정체가 소스에 명시적으로 언급되지는 않았지만, 자금이 풍부한 경쟁사(Exa로 추정)와의 비교로 제시되었습니다.
Exa는 자체 검색 기능을 사용하여 텍스트에서 주장을 추출하고, 증거를 검색하며, 검색된 증거와 대조하여 주장을 확인하는 3단계 탐지 워크플로우를 문서화하여 환각 문제를 정면으로 다루고 있습니다 . Exa의 Websets는 또한 검색 후보에 대한 에이전틱 워크플로우를 실행하여 최종 세트에 추가되기 전에 사용자의 정확한 쿼리와 일치하는지 확인합니다 .
BigSet의 출시를 다룬 소스들은 전용 검증 단계를 설명하며, 서브 에이전트들이 테이블이 최종 확정되기 전에 해당 소스에 대한 결과를 검증한다고 밝혔습니다 . 이 검증 에이전트의 구체적인 아키텍처(단일 단계 검사인지, 더 복잡한 다중 패스 시스템인지)는 사용 가능한 자료에 자세히 설명되어 있지 않지만, 파이프라인에서의 목적은 명확합니다: 출처 인용이 없는 행이 내보내진 데이터셋에 포함되는 것을 방지하는 것입니다.
| 항목 | BigSet | Exa Websets |
|---|---|---|
| 핵심 모델 | 멀티 에이전트 시스템: 오케스트레이터가 스키마를 계획하고 서브 에이전트를 파견하여 실시간 웹 데이터를 브라우징, 추출, 검증합니다. | 임베딩 기반 검색 엔진으로, 검색 후보에 대해 에이전틱 워크플로우를 실행하여 쿼리와 일치하는지 확인합니다. |
| 라이선스 | AGPL-3.0 오픈소스. | 독점(Proprietary). |
| 배포 방식 | Docker를 통한 자체 호스팅. | 클라우드 기반 SaaS; 엔터프라이즈 플랜 별도. |
| 웹 상호작용 | 실제 브라우저 세션이 사람처럼 탐색, 클릭, 추출하며 동적 사이트와 로그인 처리. | 주로 검색 기반; 신경망 임베딩을 사용하여 관련 페이지를 찾은 후 콘텐츠 확인. |
| 가격 | 오픈소스이므로 자체 호스팅 인스턴스에 대한 플랫폼 사용료 없음. 사용자는 자체 컴퓨팅 및 모델 API 비용을 부담. | Websets 월 49달러부터 (8,000 크레딧); 엔터프라이즈 플랜은 맞춤 견적. |
| 데이터 주권 | 완전한 통제권 — 사용자 인프라에서 실행. | 데이터 처리는 Exa 서버에서 이루어짐. |
BigSet은 단순한 새로운 도구가 아니라 데이터 파이프라인이 구축될 수 있는 방식의 변화를 나타냅니다. 소규모 팀이나 바쁜 분석가에게 전통적으로 스크래퍼를 작성하고 디버깅하는 데 몇 시간이 걸리던 프로세스를 2~5분의 자연어 상호작용으로 압축하는 것은 상당한 시간 절약입니다 .
AGPL-3.0 라이선스와 Docker 기반 자체 호스팅은 BigSet을 데이터 프라이버시 및 파이프라인 종속(Lock-in)에 대한 우려가 커지는 상황에 대한 해결책으로 자리매김하게 합니다. 시스템을 로컬에서 실행함으로써 기업은 독점 비즈니스 데이터를 타사를 통해 라우팅하지 않아도 되며, 필요에 따라 파이프라인을 수정할 수 있는 자유를 얻습니다.
TinyFish는 4,700만 달러의 자금을 유치했으며 Google, DoorDash, Amazon을 더 넓은 인프라 플랫폼의 고객으로 확보하고 있습니다 . BigSet 출시를 통해 커뮤니티에 진정으로 유용한 무료 도구를 제공하면서 핵심 웹 에이전트 기술의 채택을 유도하려는 전략으로 보입니다.