Meta zegt dat Muse Spark 1.3 25% minder tokens gebruikt. Onafhankelijke tests zeggen dat je rekening steeg

Surya Pratap
By Surya Pratap

15 september 2026

12 min leestijd

AI en technologie
Een tweedelig schema. Links de twee kostenverhalen naast elkaar: Meta's eigen engineers melden ongeveer 20 procent minder tool calls en 25 procent minder tokens dan Muse Spark 1.2 op langlopende codeertaken, tegenover Artificial Analysis dat de kosten per taak ziet stijgen naar 55 cent omdat het verbruik van inputtokens toenam, waarbij de prijs per token is gemarkeerd als ongewijzigd op één dollar vijfentwintig per miljoen input en vier dollar vijfentwintig per miljoen output. Rechts dezelfde benchmarkreeks twee keer gescoord: de Xhigh-configuratie die je vandaag kunt kopen tegenover de max-reasoning-configuratie die nog in beperkte preview zit in afwachting van veiligheidstests, met een GDPval-Elo van 1.709 tegen 1.754, OSWorld 57,2 tegen 66,9 en JobBench 61,2 tegen 64,9, waarbij de tweede kolom is gemarkeerd als de kolom uit het lanceringsmateriaalTwee kostenverhalen, één factuurHover to explore
Minder tokens per call en meer context per call zijn niet dezelfde bewering. Slechts één ervan wordt gemeten op de rekening die je daadwerkelijk krijgt.

Meta bracht Muse Spark 1.3 uit op 2 september 2026, in Muse Code en de Meta Model API. De lancering heeft een efficiëntieverhaal en een benchmarkverhaal, en allebei zijn ze het dubbel lezen waard — niet omdat er een onwaar is, maar omdat geen van beide precies zegt wat een founder redelijkerwijs zou aannemen.

1. Wat er is uitgebracht

Muse Spark 1.3, zoals uitgebracht

Vandaag beschikbaar; de gewichten zijn gesloten

  • In Muse Code en de Meta Model API, nu al aanroepbaar in productie. Muse Code installeer je op macOS of Linux vanaf de commandoregel.
  • Contextvenster van 1M tokens.
  • Prijs per token ongewijzigd ten opzichte van 1.2 — $1,25 per miljoen input, $4,25 per miljoen output, $0,15 per miljoen gecachete input.
  • Een contributor-tier op $0,10 / $0,20, dat toestaat dat je data voor training wordt gebruikt.
  • Gesloten gewichten. Meta noemt een open-weights-uitgave van Muse Spark op zijn roadmap zonder versie, datum of licentie.

Twee daarvan zijn echt goed nieuws. Het venster van 1M is groot genoeg dat "past het erin" voor de meeste codebases niet langer de dagelijkse vraag is, en de prijs per token vlak houden bij een capaciteitsupgrade is een echte concessie in een markt die dat meestal niet doet.

2. De efficiëntieclaim, precies geformuleerd

Meta's kop is dat 1.3 ~20% minder tool calls en ~25% minder tokens gebruikt dan Muse Spark 1.2.

De precisie doet ertoe: die cijfers komen uit evaluaties door Meta-engineers op langlopende codeertaken. Dat is een interne vergelijking van de leverancier op een door de leverancier gekozen workload — niet verzonnen, niet geauditeerd, en niet per se de jouwe.

Letterlijk gelezen is het ook een smallere claim dan hij klinkt. Minder tool calls en minder tokens per eenheid van het werk dat zij hebben gemeten. Of jouw rekening daalt, hangt af van een grootheid die Meta niet rapporteerde: hoeveel context elk van die overgebleven calls meedraagt.

3. Waarom de rekening tóch kan stijgen

Artificial Analysis mat onafhankelijk $0,55 aan kosten per taak op de breed beschikbare configuratie — en rapporteerde dat de taakkosten ten opzichte van 1.2 stegen ondanks de ongewijzigde prijs per token, omdat het verbruik van inputtokens toenam.

Leg de twee bevindingen naast elkaar en ze spreken elkaar niet tegen. Ze beschrijven verschillende helften van dezelfde verandering.

Minder en grotere calls is volgens de ene maatstaf efficiëntiewinst en volgens de andere een kostenstijging. Een model dat per stap harder nadenkt, zet minder stappen en leest er bij elke stap meer bij.

Dit is dezelfde rekensom als de contextbelasting. Agentisch werk rekent af op wat het model leest, niet op hoe vaak het stopt om na te denken, en een harness die meer context per call laadt om minder calls te rechtvaardigen, kan in totaal meer verbruiken terwijl elk kopcijfer verbetert.

Het cijfer waar je om vraagt bij elke modelaankondiging

Prijs per token is een input, geen uitkomst. Het enige cijfer dat een overstapbeslissing beslecht, is de kosten per afgeronde taak op jouw workload: de hele run, inclusief herkansingen, mislukte pogingen en de context die elke call meedroeg. Meta rapporteerde efficiëntieratio's; Artificial Analysis rapporteerde kosten per taak. Wijzen die twee tegengesteld, dan is de tweede degene die bij de boekhouding aankomt.

4. Kijk onder welke configuratie de benchmark draaide

Dit is het deel dat de meeste berichtgeving platsloeg, en het verandert hoe je de scorekaart moet lezen.

Muse Spark 1.3 is in twee configuraties geëvalueerd. Eén kun je vandaag kopen. De andere niet.

Nu breed beschikbaar

Xhigh
GDPval-AA v2 1.709 Elo · OSWorld 2.0 57,2 · JobBench 61,2 · DeepSearchQA 89,4 · Terminal-Bench 2.1 89,2 · Artificial Analysis Intelligence Index 61 · $0,55 per taak · 235,2 outputtokens per seconde. Dit is de configuratie die je productieverkeer daadwerkelijk raakt.

Beperkte partnerpreview

Max
GDPval-AA v2 1.754 Elo · OSWorld 2.0 66,9 · JobBench 64,9 · Artificial Analysis Intelligence Index 62. Meta zegt dat deze variant "still completing additional safety testing" is en "shortly" komt. Er staat op dit moment geen API-provider voor genoteerd.

Het gat is niet cosmetisch. Op OSWorld 2.0 is het 9,7 punten — 57,2 tegen 66,9 — en de max-configuratie stond prominent in het lanceringsmateriaal terwijl je haar niet kunt kopen.

Niemand wordt hier precies misleid; de configuraties zijn gelabeld. Maar een founder die een vergelijkingstabel doorneemt, leest het hoogste getal in de Muse-kolom en vergelijkt dat met wat hij vandaag draait, en die vergelijking zit er zo'n tien punten naast op juist de benchmark die het meest lijkt op het bedienen van een computer.

Vuistregel: zoek bij elke modellancering de voetnoot die zegt onder welke configuratie elke kolom draaide, en schrap elke regel die je niet kunt kopen.

5. Het contributor-tier is een databeslissing, geen prijsbeslissing

De prijsregel die het meeste nadenken verdient, is degene die eruitziet als de beste deal.

Standaard is $1,25 / $4,25 per miljoen tokens. Het contributor-tier is $0,10 / $0,20 — ongeveer 12x goedkoper op input en 21x op output — in ruil voor toestemming om je data voor training te gebruiken.

Voor een zijproject zonder product is dat vrijwel gratis inferentie en een makkelijke ja. Voor alles wat klantdata draagt, is het een heel andere vraag, en het is in de eerste plaats geen kostenvraag:

Het is niet jouw data om weg te geven

Eén
Gaat er klantcontent door die calls, dan ben jij degene die de voorwaarden accepteert en is hij degene wiens data wordt bijgedragen. Controleer wat je eigen voorwaarden beloven over verwerking door derden en over training, voordat de korting de beslissing voor je neemt.

Het is moeilijk terug te draaien

Twee
Van tier wisselen stopt toekomstige bijdragen. Het draait geen model terug dat al getraind is op wat je hebt gestuurd. Behandel het tier als een eenrichtingsdeur voor alles wat er doorheen is gegaan.

Het komt bovendrijven bij due diligence

Drie
"Op welk tier zit je en wat stond dat toe" is een gewone vraag in een enterprise security review en bij een overname. De 12x besparing op een pre-revenue burn rate weegt licht tegen het later uitleggen van dat antwoord.

Niets daarvan maakt het tier verkeerd. Meta is ongewoon expliciet over de ruil, explicieter dan de meeste aanbiedingen voor goedkope inferentie. Het betekent alleen dat de beslissing hoort bij wie je dataverplichtingen bezit, niet bij wie de inferentierekening in de gaten houdt.

6. Waar 1.3 staat ten opzichte van de alternatieven

Drie stukjes context, alle drie met voorbehoud.

De doorvoer blijft achter. Met 235,2 outputtokens per seconde draait Muse Spark 1.3 ongeveer 30% trager dan Gemini 3.8 Flash. Bij interactief coderen voel je dat; bij nachtelijk batchwerk is het vrijwel irrelevant.

Gesloten gewichten, met een roadmap die geen plan is. Meta noemt een open-weights-uitgave van Muse Spark tussen "grotere modellen… en meer" — geen versie, geen datum, geen licentievoorwaarden. Hangt je architectuur ervan af dat je uiteindelijk zelf host, dan is die zin niets om op te bouwen. Vergelijk met de harnesses die in augustus open uitkwamen, waar de portabiliteit het product was in plaats van een toekomstige intentie.

De benchmarkspreiding is echt sterk waar hij sterk is. Terminal-Bench 2.1 op 89,2, DeepSearchQA op 89,4, langecontext-retrieval op 98,5 voor 256K–512K en 98,1 voor 512K–1M. Dat laatste paar zou ik het zwaarst wegen, want vrijwel vlakke retrievalkwaliteit over een venster van 1M is wat een groot context het betalen waard maakt in plaats van alleen groot.

Eén kanttekening bij de cijfers: gepubliceerde Terminal-Bench 2.1-waarden voor 1.3 verschillen licht per bron — 89,2 in de tabel van Artificial Analysis en 88,8 elders. Het is een afrondingsverschil zonder gevolg voor welke beslissing dan ook, maar waar bronnen van elkaar afwijken is de huisregel dat te zeggen.

7. De beslissingstest

Draai je vandaag een agentische codeerworkload, dan is dit een experiment van twee uur in plaats van een leesoefening.

Hoe ik de upgrade werkelijk zou beoordelen

De vergelijking moet per afgeronde taak zijn, niet per token

  • Kies tien echte taken uit je eigen backlog die een coding agent al probeert — geen benchmarkproblemen, en met minstens drie die nu falen.
  • Draai ze op wat je nu gebruikt en noteer totale inputtokens, totale outputtokens, doorlooptijd en of de taak echt is afgerond.
  • Draai diezelfde tien op Muse Spark 1.3 in Muse Code, ongewijzigde prompts, dezelfde harnessinstellingen.
  • Vergelijk de kosten per geslaagde taak. Een goedkopere mislukking is niet goedkoper. Dit is de vergelijking die noch de leverancier noch de onafhankelijke evaluator voor je kan uitvoeren, omdat ze van jouw codebase afhangt.
  • Beslis over het tier apart, en niet op prijs — die vraag hoort bij wie je verplichtingen rond klantdata bezit.

8. Wat ik er niet in zou lezen

Interne efficiëntiecijfers van een leverancier zijn niet onjuist, ze zijn smal. "Meta-engineers maten het op langlopende codeertaken" is een openbaar gemaakte methode en meer dan veel lanceringen geven. Het blijft hun workload en hun harness.

Eén onafhankelijke kostenmeting is ook niet het laatste woord. Artificial Analysis draait een vaste takenreeks; jouw repository is die reeks niet. De reden om de kosten-per-taakbenadering te vertrouwen is niet de specifieke $0,55 — het is dat de maatstaf de juiste is.

Een max-reasoning-configuratie in preview is normaal. Gefaseerd uitbrengen achter veiligheidstests is redelijke praktijk, en de ergernis hier is presentatie, geen ethiek: de cijfers stonden in materiaal gericht op mensen die ze nog niet kunnen krijgen.

Een versiesprong is geen migratie. 1.2 werkt nog, kost nog hetzelfde per token, en een productieagent overzetten naar een model dat op ander langlopend gedrag is afgestemd, verandert hoe je prompts zich gedragen op manieren die geen benchmark voorspelt.

De eerlijke samenvatting

Muse Spark 1.3 is een echte verbetering, uitgebracht tegen een ongewijzigde prijs per token, in een harness die mensen al draaien, met een venster van 1M waarvan de retrievalkwaliteit over het hele venster standhoudt. Dat is een goede release.

Hij komt ook met twee cijfers die tegengesteld wijzen — minder tokens per eenheid werk volgens de leverancier, hogere kosten per taak volgens een onafhankelijke partij — en met een scorekaart waarvan de helderste kolom een configuratie is die nog niemand kan kopen. Geen van beide is schandalig. Beide zijn gewoon, en beide bepalen precies of je inferentierekening in november overeenkomt met het plan dat je in september schreef.

Prijs per token vertelde je deze week niets. Kosten per afgeronde taak, op je eigen taken, wel.

Bronnen: Meta AI Research, "Introducing Muse Spark 1.3" · VentureBeat, "Meta says Muse Spark 1.3 has frontier performance — but its best results come from a model developers can't broadly use yet" · MarkTechPost, "Meta AI Released Muse Spark 1.3" · De efficiëntiecijfers van ~20%/~25% zijn van Meta zelf, uit evaluaties door Meta-engineers op langlopende codeertaken. Benchmarkscores, de $0,55 kosten per taak, de doorvoer van 235,2 tokens per seconde en de splitsing tussen Xhigh en max zijn zoals gerapporteerd door Artificial Analysis via VentureBeat; de max-configuratie zat ten tijde van de test in beperkte partnerpreview. Waar Terminal-Bench 2.1-cijfers per bron verschillen, staat dat in sectie 6. De lezing dat de twee kostenclaims verenigbaar zijn, en elke aanbeveling, zijn van mij. Voor de harness waarin dit model draait, zie de twee agent-harnesses die een dag na elkaar uitkwamen.

IdeaToMVP Academy

Want to build with AI — not just read about it?

4-week live cohort for founders. Learn to ship AI agents, scope MVPs, and automate your business — taught by the same team that writes these guides.

Explore the Academy →
Share this post :