Macrodata Labsはロボティクス向けの学習データインフラを構築するスタートアップ。物理世界のデータはテキストよりはるかに複雑で、重い動画ファイル、互換性のないセンサー形式、標準化されていないフォーマットが課題。 FineWebなどHugging Faceの大規模データセットを手がけたGuilherme Penedo氏とHynek Kydlíček氏が創業。第一弾製品はオープンソースのデータ処理フレームワーク「Refiner」。
研究の答え

Create a landscape editorial hero image for this Studio Global article: Search & fact-check with cited sources for What is Macrodata Labs, what data problem in robotics does it aim to solve, who founded it and fr. Article summary: Here are the fact-checked answers to each of your questions, sourced from the company's own materials and the available press coverage around its launch.. Topic tags: general, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbna
大規模言語モデル(LLM)の学習に使われるデータセットの多くを支えてきたチームが今、ロボティクスという新たなフロンティアに挑んでいる。Macrodata Labsは、ロボットが物理世界を理解するために必要な「データインフラ」を構築するスタートアップだ。
同社は2026年6月、ステルスモードから突如として姿を現し、同時に400万ドルのプレシードラウンドの調達と、ロボティクス学習データを処理するオープンソースフレームワーク 「Refiner」 のリリースを発表した。
Macrodata Labsが解こうとしているのは、ロボティクス分野における根本的なボトルネックだ。物理世界のデータはテキストデータとは比較にならないほど扱いにくい。動画ファイルは重く、センサーは異なるレートで動作し、フォーマットは頻繁に変わり、そもそも「良い学習データ」とは何かという業界の共通認識すらまだ確立されていない。
現在、ロボティクスチームがデータ処理に使えるようにするだけでも、もろいスクリプトを書くことに膨大な時間を費やしているのが実情だ。Macrodata Labsは、高品質なデータこそが物理AIの進歩に不可欠であり、ロボティクスの世界にも、テキストデータ用に存在したような「データの精製所(refinery)」が必要だと主張する。
これは、LLMの性能を飛躍的に向上させた大規模で高品質なウェブスケールデータセットの役割とまったく同じだ。そして今、そのデータ精製のノウハウを持つチームがロボティクス分野に同じアプローチを持ち込もうとしている。
Macrodata Labsを創業したのは Guilherme Penedo 氏と Hynek Kydlíček 氏だ。二人はHugging FaceでLLM学習用の大規模データセット「FineWeb」の開発に従事し、同データセットに関する論文の著者としても名を連ねている
。彼らのバックグラウンドは大規模データのキュレーションと精製であり、その専門性を今、ロボットのための物理世界データに適用している
。
Penedo氏はLinkedInへの投稿で次のように述べている。「Hugging Faceでのここ数年、Hynekと私はFineWebやFinePDFsを含む、最も広く使われているオープンなLLM事前学習データセットのいくつかに取り組んできました。その経験から、LLMの進歩が計算リソースとデータのスケーリングによってどのようにもたらされるのかを目の当たりにしました。私たちは今、ロボティクスでも同じような離陸が始まろうとしているのを感じています」。
Macrodata Labsの最初のプロダクトとなる Refiner は、ロボティクスデータ処理のためのオープンソースフレームワークだ。これは、乱雑なロボット動画やその他の物理世界データを、よりクリーンなロボティクス学習データに変換するためのツールキットと説明されている
。
Refinerは、現在ロボティクスチームが実際に使用しているフォーマット(LeRobot、HDF5(ALOHA、robomimic、LIBERO)、Zarr、MCAP、生動画、Hugging Faceデータセットなど)を読み取り、デモンストレーション、フレーム、軌跡(トラジェクトリ)、アノテーション(注釈)、センサーストリームを処理するためのツールを提供する。
ローカル環境での開発に対応しつつ、1つのコマンドでサーバーレスクラウド上に弾力的にスケールできる設計だ。同社はこれを、物理AIのための「データ製油所(data refinery)」と位置づけている
。
Macrodata Labsが調達した400万ドルのプレシードラウンドは、ロンドンに拠点を置くAI特化型ベンチャーキャピタル Air Street Capital がリードした。同ファンドはNathan Benaich氏によって設立され、AIファーストの企業に特化した投資を行っている
。
このラウンドには、Drysdale Ventures、OPRTRS CLUB、Kima Ventures、YG Ventures(Alex Yazdi氏)、>commit、Thomas Wolf氏(Hugging Face共同創業者)、そして主要なAI研究所やテクノロジー企業からのビジネスエンジェル陣も参加している。
なお、Air Street Capitalは2026年前半に3号ファンド(Fund III)として2億3200万ドルをクローズしており、そのポートフォリオにはSynthesia、Black Forest Labs、Wayve、Poolsideなど、AIファーストの企業が名を連ねている
。
Macrodata Labsのパブリックメッセージは、欧州特有のロボティクス戦略を明確に打ち出すというよりも、ロボティクス全体に必要なデータ基盤の構築に焦点を当てている。最も確実に言えるのは、同社がロンドン拠点のAI特化型VCであるAir Street Capitalの支援を受けているという事実だ
。この投資家の背景からは、欧州の資本がロボティクスデータインフラに積極的に関与していることがうかがえるが、同社自身が欧州のロボティクスにおける役割について正式な声明を発表したわけではない
。
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
Macrodata Labsはロボティクス向けの学習データインフラを構築するスタートアップ。物理世界のデータはテキストよりはるかに複雑で、重い動画ファイル、互換性のないセンサー形式、標準化されていないフォーマットが課題。
Macrodata Labsはロボティクス向けの学習データインフラを構築するスタートアップ。物理世界のデータはテキストよりはるかに複雑で、重い動画ファイル、互換性のないセンサー形式、標準化されていないフォーマットが課題。 FineWebなどHugging Faceの大規模データセットを手がけたGuilherme Penedo氏とHynek Kydlíček氏が創業。第一弾製品はオープンソースのデータ処理フレームワーク「Refiner」。
ロンドン拠点のAI特化VCであるAir Street Capitalがリードし、総額400万ドルを調達。Drysdale Ventures、Kima Ventures、Thomas Wolf氏(Hugging Face共同創業者)などが参加。