Muse Spark 1.3 är en uppdatering för kodning och agentbaserat arbete och uppges använda cirka 25 procent färre tokens än föregångaren. Muse Voice Transcribe kombinerar tal till text i realtid, talaridentifiering för fler än 20 personer och detektering av när en person slutat tala.
Research answer

Create a landscape editorial hero image for this Studio Global article: What AI products did Meta release this week, what capabilities, pricing, availability, and performance claims distinguish Muse Spark 1.3 and. Article summary: Meta released two AI products this week: Muse Spark 1.3, an update to its general reasoning model focused on coding and agents, and Muse Voice Transcribe, a hosted real-time speech-recognition model. Together they show M. Topic tags: general, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
Meta lanserar två AI-produkter med olika roller men samma övergripande riktning: AI som inte bara svarar på enstaka frågor, utan kan arbeta över tid och ta emot tal i realtid.
Muse Spark 1.3 riktar sig mot kodning och agentbaserade uppgifter. Muse Voice Transcribe är i stället en utvecklarinriktad ljudmodell som kan lyssna, skriva ut tal, skilja mellan talare och avgöra när det är dags för ett svar.
Meta uppger att Muse Spark 1.3 ger bättre resultat inom kodning och så kallat agentbaserat arbete, samtidigt som modellen använder omkring 25 procent färre tokens än föregångaren. 11
Det är särskilt relevant när en modell behöver arbeta igenom många steg, läsa filer, anropa verktyg eller ompröva sitt eget resultat. Lägre tokenförbrukning kan göra långa körningar billigare, även om det tillgängliga underlaget inte självständigt verifierar Metas kodnings- eller agentbenchmarkar.
Modellen rullas ut via Muse Code och Meta Model API, enligt rapporteringen. 12 Den uppges behålla föregångarens prissättning och vara tillgänglig för användare på bidragsnivå, men det tillhandahållna materialet anger varken det exakta priset eller en detaljerad tidsplan för åtkomsten.
Metas större ambition är att göra Spark till en grund för personliga AI-agenter som kan arbeta kontinuerligt, snarare än att bara reagera på isolerade instruktioner. Därmed hamnar bolaget i samma strategiska konkurrensfält som Google, Anthropic och OpenAI när det gäller kodningsagenter och företagsinriktade arbetsflöden. Underlaget stödjer däremot Metas uttalade riktning tydligare än påståenden om att Spark 1.3 redan skulle ha tagit ledningen.
Muse Voice Transcribe är Meta Superintelligence Labs första ljudmodell för tal i realtid. Den kombinerar tre funktioner som ofta hanteras i separata steg:
Meta beskriver modellen som flerspråkig och säger att den kan hantera kodväxling, alltså att talare byter språk mitt i ett samtal. Enligt rapporteringen har den tränats på fler än 70 språk, varav 25 var validerade inför den första lanseringen. 1
2
Muse Voice Transcribe finns via Meta Model API och används även i röstfunktioner i Metas datorprogram och i Muse Code. 3
7
10 Till skillnad från en modell med öppna vikter är den stängd och endast tillgänglig via API; Meta släpper inte modellvikterna.
9
Det rapporterade API-priset är 3 dollar per 1 000 ljudminuter, vilket motsvarar 0,18 dollar i timmen. 6
9 Det placerar modellen i ett relativt billigt segment för utvecklare som behöver direktskrivning, mötestranskribering, röstgränssnitt eller flerspråkig ljudbehandling.
I det engelska strömmande tal-till-text-testet från Artificial Analysis som nämns i rapporteringen uppnådde Voice Transcribe en ord-felfrekvens på cirka 3,1 procent. Samma jämförelse angav 3,4 procent för Cartesia Ink-2, 3,6 procent för ElevenLabs Scribe v2 Real-time, 3,9 procent för OpenAI GPT Live Transcribe och 4,0 procent för Gemini 3.5 Transcribe Live. 9
Resultaten bör dock läsas som utfall från en specifik benchmark, inte som en universell ranking för alla dialekter, språk, mikrofoner och verkliga miljöer. Det tillgängliga underlaget pekar också på att talaridentifiering fortfarande är en svår uppgift för hela branschen, även när en modell presterar bäst i vissa tester. 9
Den viktigaste tekniska skillnaden är arkitekturen: Meta presenterar transkribering, talarseparation och upptäckt av talvändor som funktioner i ett enda realtidsanrop. Det kan förenkla utvecklingen jämfört med att kombinera flera separata rösttjänster. I praktiken återstår det dock att utvärdera fördröjning, driftsäkerhet, integritetskontroller och produktionsbegränsningar.
Meta lanserar produkterna samtidigt som de stora AI-bolagen tävlar om både agentförmåga och infrastrukturen bakom den.
Metas särdrag är därför inte att bolaget ensamt har utvecklat en agent eller en talmodell. Den mer särskilda satsningen är att koppla samman flera distributionskanaler: Muse Code för utvecklare, Meta Model API för applikationer, dator- och konsumentprodukter för användning och på sikt även enheter som kan göra röstinteraktion mer kontinuerlig.
Meta har gått med på att betala upp till 18 miljarder dollar under det kommande decenniet och införa skärpta begränsningar och säkerhetsåtgärder för tonåringars användning av Facebook och Instagram. Uppgörelsen slöts med 48 amerikanska delstater och territorier efter anklagelser om att plattformarna skadat barn. 17
18
19
20
22
25
Uppgörelsen innebär inte i sig att Meta måste sluta lansera AI-produkter. Betalningarna sprids över tid, men avtalet medför nya ekonomiska, juridiska och produktrelaterade krav. Samtidigt har rapporteringen satt uppgörelsen i relation till Metas planerade investeringar på upp till omkring 145 miljarder dollar i kapitalutgifter under 2026, till stor del kopplade till AI-infrastruktur. 27
29
Den tydligaste produktkonsekvensen kan bli ökad granskning av konsumentinriktade system – särskilt långvariga, röststyrda eller ungdomstillgängliga agenter. Ålderskontroller, föräldrakontroller, användningsgränser, loggning och säkerhetstester kan få större betydelse för lanseringsbeslut. Ett API-baserat transkriberingsverktyg påverkas mer indirekt, men ingår fortfarande i Metas bredare ramverk för förtroende, integritet och styrning.
Muse Spark 1.3 och Muse Voice Transcribe hänger strategiskt ihop: den ena förbättrar resonemangs- och kodningslagret, medan den andra ger röstapplikationer ett realtidsbaserat inmatningslager. Men starka lanseringspåståenden är inte samma sak som långvarig användning.
Meta måste fortfarande visa att utvecklare vill använda Spark för tillförlitligt arbete över många steg, att Voice Transcribe håller utanför rubrikernas benchmarktester och att produkterna skapar tillräcklig användning eller strategiskt värde för att motivera bolagets omfattande investeringar i infrastruktur och säkerhet.
För tillfället visar lanseringarna framför allt att Meta breddar sin AI-plattform: mot agenter som kan agera och gränssnitt som kan lyssna kontinuerligt.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Muse Spark 1.3 är en uppdatering för kodning och agentbaserat arbete och uppges använda cirka 25 procent färre tokens än föregångaren.
Muse Spark 1.3 är en uppdatering för kodning och agentbaserat arbete och uppges använda cirka 25 procent färre tokens än föregångaren. Muse Voice Transcribe kombinerar tal till text i realtid, talaridentifiering för fler än 20 personer och detektering av när en person slutat tala.
Röstmodellen kostar 3 dollar per 1 000 ljudminuter, motsvarande 0,18 dollar i timmen, och är tillgänglig via Meta Model API.