Muse Spark 1.3は、コーディングや複数段階のエージェント作業を狙う推論モデル。Metaは従来モデル比で約25%少ないトークンで性能を高めたと説明している。 Muse Voice Transcribeは、ストリーミング音声認識、20人超の話者分離、発話終了検知を1つのリアルタイムモデルに統合。70以上の言語で学習され、初期リリースでは25言語が検証済みとされる。
研究の答え

Create a landscape editorial hero image for this Studio Global article: What AI products did Meta release this week, what capabilities, pricing, availability, and performance claims distinguish Muse Spark 1.3 and. Article summary: Meta released two AI products this week: Muse Spark 1.3, an update to its general reasoning model focused on coding and agents, and Muse Voice Transcribe, a hosted real-time speech-recognition model. Together they show M. Topic tags: general, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
Metaが2026年9月、AIエージェント向けの推論モデル「Muse Spark 1.3」と、開発者向けのリアルタイム音声モデル「Muse Voice Transcribe」を相次いで投入した。
一方はコードを書き、ファイルを調べ、ツールを呼び出しながら複数段階の作業を進めるためのモデル。もう一方は、会話を聞きながら文字起こしを行い、誰が話しているかを分け、話し終わったタイミングまで判断するモデルだ。
単発のチャット応答ではなく、テキスト・コード・音声をまたいで継続的に動くAIシステムを目指すMetaの方向性が、2つの発表から見えてくる。
Muse Spark 1.3は、Metaの推論モデル「Muse Spark」シリーズのアップデートにあたる。Metaは、コーディングやエージェント型の作業で性能を高めながら、従来モデルより約25%少ないトークンで動作すると説明している。 11
トークン効率は、モデルが何度も推論し、ファイルを確認し、外部ツールを呼び出し、出力を修正するような長時間のタスクで特に重要になる。使用トークンが少なければ、長時間稼働する処理のコストを抑えられる可能性がある。ただし、今回提供されている情報だけでは、Metaが示すコーディング性能やエージェント性能のベンチマークを独立に検証することはできない。
Spark 1.3は「Muse Code」と「Meta Model API」を通じて展開されると報じられている。 12 料金は前モデルから据え置きで、コントリビューター層のユーザーにも提供されるとされるが、具体的な価格や詳細な提供スケジュールは示されていない。
Metaが描くのは、質問にその場で答えるだけのチャットボットではない。ユーザーのために継続的に仕事を進める、いわば常時稼働型のパーソナルエージェントの基盤としてSparkを位置付けようとしている。
この構想は、Google、Anthropic、OpenAIが展開するコーディングエージェントや企業向けワークフロー基盤と同じ競争領域に入る。ただし、現時点でSpark 1.3が競合を明確にリードしたと断定できる証拠はなく、確認できるのはMetaが掲げる方向性と同社の性能説明までだ。
Muse Voice Transcribeは、Meta Superintelligence Labsにとって初のリアルタイム音声知覚モデルだ。録音が終わってから処理する一般的な文字起こしとは異なり、音声を受け取りながら次の3つの処理を組み合わせる。
Metaは多言語対応も特徴として挙げており、会話の途中で言語が切り替わるコードスイッチングにも対応すると説明している。報道によれば、70以上の言語で学習され、初期リリースでは25言語が検証済みだ。 1
2
日本語も検証済み言語の例に含まれると報じられている。 6
Voice Transcribeは「Meta Model API」を通じて開発者に提供されるほか、MetaのデスクトップソフトウェアやMuse Codeの音声機能にも使われている。 3
7
10 一方、オープンウエイトモデルではなく、重みは公開されないホスト型・API専用のサービスだ。
9
報告されているAPI価格は、音声1,000分あたり3ドル。1時間あたりでは0.18ドルに相当する。 6
9 ライブ入力、会議の文字起こし、音声インターフェース、多言語の音声処理などを想定する開発者にとって、比較的導入しやすい価格帯を狙った設定といえる。
Artificial Analysisのストリーミング英語音声認識ベンチマークでは、Voice Transcribeの単語誤り率(WER)は約3.1%と報告された。同じ比較では、Cartesia Ink-2が3.4%、ElevenLabs Scribe v2 Real-timeが3.6%、OpenAI GPT Live Transcribeが3.9%、Gemini 3.5 Transcribe Liveが4.0%だった。 9
ただし、これらは特定の評価環境における結果だ。アクセント、言語、マイク、雑音、会話の重なり方などが変われば、結果も変わり得る。話者分離については、カテゴリー全体で誤り率の改善がなお難しく、特定のテストで優位に立ったことが、あらゆる実環境での優位性を意味するわけではない。 9
Voice Transcribeの重要な差別化要素は、文字起こし、話者分離、発話終了検知を1回のモデル呼び出しにまとめた点だ。複数の音声サービスを別々に組み合わせる構成と比べ、アプリの設計を簡素化できる可能性がある。
もっとも、実際の導入では遅延、認識の安定性、プライバシー設定、APIの利用制限、長時間運用時のコストを確認する必要がある。
2つの発表は、AI業界が「より賢いモデル」だけでなく、「自律的に仕事を進める仕組み」と「それを動かす入出力基盤」の両方を競っている時期に重なった。
Metaの特徴は、エージェントや音声APIを自社だけが提供していることではない。Muse Code、Meta Model API、デスクトップや消費者向け製品、将来的には音声操作を常時利用できるデバイスまで、複数の接点をつなごうとしている点にある。
Spark 1.3が「考えて行動する」層を担い、Voice Transcribeが「聞き続ける」層を担う構図だ。両者が組み合わされば、ユーザーの指示を待って一問一答するのではなく、周囲の音声を受け取り、作業を継続するエージェント像に近づく。
Metaは、FacebookとInstagramが子どもを依存させるよう設計されたという主張をめぐり、米国の48州・地域との和解で、今後10年間に最大180億ドルを支払い、10代の利用に対する制限や安全対策を強化することに合意した。支払額の一部は、競合プラットフォームが同等の取り組みを行うかどうかにも左右される。 17
18
19
20
22
25
和解金は時間をかけて支払われるため、これだけでMetaがAI製品のリリースを止めることを示すものではない。一方で、財務負担に加え、コンプライアンスや製品ガバナンスに関する義務は増える。
報道では、この和解はMetaが2026年に最大約1,450億ドルの設備投資を計画していることとも並べて論じられている。投資の多くはAIインフラに関連するとされる。 27
29
製品面で最も影響を受けやすいのは、消費者向けの常時稼働型、音声中心、あるいは若年層がアクセスできるエージェントだろう。年齢確認、保護者による管理、利用時間の制限、ログ管理、安全性テストなどが、提供開始の判断でより重視される可能性がある。
API専用の音声認識モデルであるVoice Transcribeは、10代向けサービスへの直接的な制限を受けにくいとみられる。しかし、Meta全体の信頼性、プライバシー、AIガバナンスに関する要求が高まれば、開発者向け製品も無関係ではいられない。
Muse Spark 1.3とMuse Voice Transcribeの組み合わせは、戦略としては一貫している。前者は推論とコーディングの層を強化し、後者は音声アプリケーションのためのリアルタイム入力層を提供する。
ただし、華やかな発表と長期的な普及は別問題だ。Metaには、Sparkが信頼できる長時間作業に使われること、Voice Transcribeがベンチマーク以外の現場でも安定して動くこと、そして両製品が巨額のインフラ投資と安全対策に見合う利用や戦略価値を生むことを示す必要がある。
今回の和解は法的な不確実性を一部取り除く一方、優先順位を誤った場合のコストを高める。現時点でのMetaはAI戦略を絞り込んだというより、行動するエージェントと継続的に聞くインターフェースの両方向へ、プラットフォームを広げている段階にある。
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
Muse Spark 1.3は、コーディングや複数段階のエージェント作業を狙う推論モデル。Metaは従来モデル比で約25%少ないトークンで性能を高めたと説明している。
Muse Spark 1.3は、コーディングや複数段階のエージェント作業を狙う推論モデル。Metaは従来モデル比で約25%少ないトークンで性能を高めたと説明している。 Muse Voice Transcribeは、ストリーミング音声認識、20人超の話者分離、発話終了検知を1つのリアルタイムモデルに統合。70以上の言語で学習され、初期リリースでは25言語が検証済みとされる。
Voice TranscribeのAPI価格は音声1,000分あたり3ドル(1時間あたり0.18ドル)。英語のストリーミング音声認識ベンチマークでは、約3.1%の単語誤り率が報告されている。