Meta dice que Muse Spark 1.3 usa un 25% menos de tokens. Las pruebas independientes dicen que su factura subió

Surya Pratap
By Surya Pratap

15 de septiembre de 2026

12 min de lectura

IA y tecnología
Un diagrama en dos partes. A la izquierda, las dos versiones del coste enfrentadas: los propios ingenieros de Meta informan de alrededor de un 20 por ciento menos de llamadas a herramientas y un 25 por ciento menos de tokens que Muse Spark 1.2 en tareas de programación de largo recorrido, frente a Artificial Analysis, que mide un coste por tarea que sube hasta 55 centavos porque aumentó el consumo de tokens de entrada, con el precio por token señalado como invariable en 1,25 dólares por millón de entrada y 4,25 por millón de salida. A la derecha, la misma batería de pruebas puntuada dos veces: la configuración Xhigh que se puede comprar hoy frente a la configuración de razonamiento máximo todavía en vista previa limitada a la espera de pruebas de seguridad, con un Elo de GDPval de 1.709 frente a 1.754, OSWorld 57,2 frente a 66,9 y JobBench 61,2 frente a 64,9, señalando la segunda columna como la usada en los materiales de lanzamientoDos versiones del coste, una sola facturaHover to explore
Menos tokens por llamada y más contexto por llamada no son la misma afirmación. Solo una de ellas se mide en la factura que usted recibe.

Meta publicó Muse Spark 1.3 el 2 de septiembre de 2026, en Muse Code y en la Meta Model API. El lanzamiento trae una historia de eficiencia y una historia de benchmarks, y conviene leer las dos veces cada una: no porque alguna sea falsa, sino porque ninguna dice exactamente lo que un fundador supondría.

1. Qué se publicó

Muse Spark 1.3, tal como salió

Disponible hoy; los pesos están cerrados

  • En Muse Code y en la Meta Model API, invocable en producción desde ya. Muse Code se instala en macOS o Linux desde la línea de comandos.
  • Ventana de contexto de 1M de tokens.
  • Precio por token sin cambios respecto a 1.2: 1,25 dólares por millón de entrada, 4,25 por millón de salida y 0,15 por millón de entrada cacheada.
  • Un nivel contributor a 0,10 / 0,20 dólares, que permite que sus datos se usen para entrenar.
  • Pesos cerrados. Meta menciona una publicación de Muse Spark con pesos abiertos en su hoja de ruta, sin versión, sin fecha y sin licencia.

Dos de esas cosas son buenas noticias de verdad. La ventana de 1M es lo bastante grande como para que «¿cabrá?» deje de ser la pregunta diaria en la mayoría de las bases de código, y mantener plano el precio por token en una subida de capacidad es una concesión real en un mercado que en general no la hace.

2. La afirmación de eficiencia, dicha con precisión

El titular de Meta es que 1.3 usa ~20% menos llamadas a herramientas y ~25% menos tokens que Muse Spark 1.2.

La precisión importa: esas cifras salen de evaluaciones de ingenieros de Meta sobre tareas de programación de largo recorrido. Es una comparación interna del proveedor sobre una carga de trabajo elegida por el proveedor: ni inventada, ni auditada, ni necesariamente la suya.

Leída al pie de la letra es además una afirmación más estrecha de lo que parece. Menos llamadas y menos tokens por unidad del trabajo que midieron. Que su factura baje depende de una cantidad que Meta no reportó: cuánto contexto lleva cada una de esas llamadas restantes.

3. Por qué la factura puede subir igualmente

Artificial Analysis, midiendo de forma independiente, situó el coste por tarea en 0,55 dólares en la configuración ampliamente disponible, e informó de costes por tarea al alza respecto a 1.2 pese al precio por token invariable, porque aumentó el consumo de tokens de entrada.

Ponga los dos hallazgos uno al lado del otro y no se contradicen. Describen mitades distintas del mismo cambio.

Menos llamadas y más grandes es una victoria de eficiencia con una métrica y una subida de coste con la otra. Un modelo que piensa más por paso da menos pasos y lee más en cada uno.

Es la misma aritmética que el impuesto de contexto. El trabajo con agentes se factura por lo que el modelo lee, no por cuántas veces se detiene a pensar, y un harness que carga más contexto por llamada para justificar hacer menos llamadas puede consumir más en total mientras mejora cada cifra del titular.

La cifra que hay que pedir en cualquier anuncio de modelo

El precio por token es una entrada, no un resultado. La única cifra que zanja una decisión de cambio es el coste por tarea completada sobre su carga de trabajo: la ejecución entera, incluidos los reintentos, los intentos fallidos y el contexto que llevaba cada llamada. Meta reportó ratios de eficiencia; Artificial Analysis reportó coste por tarea. Cuando esas dos apuntan en sentidos opuestos, la segunda es la que llega a contabilidad.

4. Lea bajo qué configuración se corrió el benchmark

Esta es la parte que casi toda la cobertura aplanó, y cambia cómo debe leerse el marcador.

Muse Spark 1.3 se evaluó en dos configuraciones. Una se puede comprar hoy. La otra no.

Ampliamente disponible ya

Xhigh
GDPval-AA v2 1.709 Elo · OSWorld 2.0 57,2 · JobBench 61,2 · DeepSearchQA 89,4 · Terminal-Bench 2.1 89,2 · Artificial Analysis Intelligence Index 61 · 0,55 dólares por tarea · 235,2 tokens de salida por segundo. Es la configuración que va a tocar su tráfico de producción.

Vista previa limitada para socios

Max
GDPval-AA v2 1.754 Elo · OSWorld 2.0 66,9 · JobBench 64,9 · Artificial Analysis Intelligence Index 62. Meta dice que esta variante "still completing additional safety testing" y que llegará "shortly". Ahora mismo no figura ningún proveedor de API para ella.

La diferencia no es cosmética. En OSWorld 2.0 son 9,7 puntos —57,2 frente a 66,9— y la configuración máxima apareció de forma destacada en los materiales de lanzamiento pese a no poder comprarse.

Nadie engaña a nadie exactamente: las configuraciones están etiquetadas. Pero un fundador que hojea una tabla comparativa leerá la cifra más alta de la columna de Muse y la comparará con lo que tenga hoy en marcha, y esa comparación falla por unos diez puntos justo en el benchmark que más se parece a manejar un ordenador.

Regla práctica: en cualquier lanzamiento de modelo, busque la nota que dice bajo qué configuración se corrió cada columna y borre todas las filas que no pueda comprar.

5. El nivel contributor es una decisión de datos, no de precio

La línea de precios que más merece pensarse es la que parece la mejor oferta.

El estándar es 1,25 / 4,25 dólares por millón de tokens. El nivel contributor es de 0,10 / 0,20 —unas 12 veces más barato en entrada y 21 veces en salida— a cambio de permitir que sus datos se usen para entrenar.

Para un proyecto paralelo sin producto, eso es inferencia casi gratis y un sí fácil. Para cualquier cosa que lleve datos de clientes es otra pregunta distinta, y no es sobre todo una pregunta de coste:

Esos datos no son suyos para cederlos

Uno
Si por esas llamadas pasa contenido de clientes, quien acepta las condiciones es usted y aquel cuyos datos se ceden es el cliente. Revise qué prometen sus propias condiciones de servicio sobre tratamiento por terceros y entrenamiento antes de que el descuento tome la decisión por usted.

Es difícil de revertir

Dos
Cambiar de nivel detiene las cesiones futuras. No deshace un modelo que ya se entrenó con lo que usted envió. Trate el nivel como una puerta de un solo sentido para todo lo que la haya cruzado.

Aparecerá en la due diligence

Tres
«En qué nivel están y qué permitía» es una pregunta corriente en una revisión de seguridad empresarial y en una adquisición. El ahorro de 12x sobre una quema de caja sin ingresos es pequeño frente a tener que explicar después esa respuesta.

Nada de eso hace que el nivel esté mal. Meta es inusualmente explícita sobre el intercambio, más que la mayoría de las ofertas de inferencia con descuento. Solo significa que la decisión corresponde a quien sea dueño de sus compromisos sobre datos, no a quien vigila la factura de inferencia.

6. Dónde queda 1.3 frente a las alternativas

Tres apuntes de contexto, todos con matices.

El rendimiento va por detrás. Con 235,2 tokens de salida por segundo, Muse Spark 1.3 va alrededor de un 30% más lento que Gemini 3.8 Flash. En programación interactiva eso se nota; en trabajo por lotes nocturno es casi irrelevante.

Pesos cerrados, con una hoja de ruta que no es un plan. Meta menciona una publicación de Muse Spark con pesos abiertos entre «modelos más grandes… y más»: sin versión, sin fecha, sin condiciones de licencia. Si su arquitectura depende de acabar autoalojando, esa frase no es algo sobre lo que construir. Compare con los harnesses que salieron abiertos en agosto, donde la portabilidad era el producto y no una intención futura.

El abanico de benchmarks es realmente sólido donde lo es. Terminal-Bench 2.1 en 89,2, DeepSearchQA en 89,4, recuperación de contexto largo en 98,5 para 256K–512K y 98,1 para 512K–1M. Ese último par es el que yo más pesaría, porque una calidad de recuperación casi plana a lo largo de una ventana de 1M es lo que hace que un contexto grande merezca pagarse en lugar de ser solo grande.

Una salvedad sobre las cifras: los valores publicados de Terminal-Bench 2.1 para 1.3 varían ligeramente según la fuente: 89,2 en la tabla de Artificial Analysis y 88,8 en otros sitios. Es una diferencia de redondeo sin ninguna consecuencia para ninguna decisión, pero cuando las fuentes discrepan la norma de la casa es decirlo.

7. La prueba de decisión

Si hoy ejecuta una carga de trabajo de programación con agentes, esto es un experimento de dos horas más que un ejercicio de lectura.

Cómo evaluaría yo la actualización de verdad

La comparación tiene que ser por tarea completada, no por token

  • Elija diez tareas reales de su propio backlog que un agente de código ya intente, no problemas de benchmark, e incluya al menos tres que ahora fallen.
  • Ejecútelas con lo que usa hoy y registre tokens totales de entrada, tokens totales de salida, tiempo de reloj y si la tarea se completó de verdad.
  • Ejecute esas mismas diez en Muse Spark 1.3 dentro de Muse Code, con los prompts sin tocar y los mismos ajustes de harness.
  • Compare el coste por tarea exitosa. Un fallo más barato no es más barato. Esta es la comparación que ni el proveedor ni el evaluador independiente pueden hacer por usted, porque depende de su base de código.
  • Decida el nivel por separado, y no por precio: esa pregunta es de quien sea dueño de sus compromisos con los datos de clientes.

8. Qué no conviene sobreinterpretar

Las cifras de eficiencia internas del proveedor no son falsas, son estrechas. «Ingenieros de Meta lo midieron sobre tareas de programación de largo recorrido» es una metodología declarada y más de lo que dan muchos lanzamientos. Sigue siendo su carga de trabajo y su harness.

Una sola medición independiente de coste tampoco es la última palabra. Artificial Analysis ejecuta una batería fija de tareas; su repositorio no es esa batería. La razón para fiarse del enfoque de coste por tarea no son los 0,55 dólares concretos: es que la métrica es la correcta.

Una configuración de razonamiento máximo en vista previa es normal. Publicar por fases tras pruebas de seguridad es una práctica razonable, y la molestia aquí es de presentación y no ética: las cifras se mostraron en materiales dirigidos a gente que todavía no puede obtenerlas.

Un salto de versión no es una migración. 1.2 sigue funcionando, sigue costando lo mismo por token, y cambiar un agente en producción a un modelo ajustado sobre otro comportamiento de largo recorrido alterará cómo se comportan sus prompts de maneras que ningún benchmark predice.

El resumen honesto

Muse Spark 1.3 es una mejora real, publicada sin subir el precio por token, dentro de un harness que la gente ya ejecuta, y con una ventana de 1M cuya calidad de recuperación aguanta a lo largo de toda la ventana. Es un buen lanzamiento.

También llega con dos cifras que apuntan en sentidos opuestos —menos tokens por unidad de trabajo según el proveedor, mayor coste por tarea según un tercero independiente— y con un marcador cuya columna más brillante es una configuración que nadie puede comprar todavía. Ninguna de las dos cosas es un escándalo. Las dos son corrientes, y las dos son exactamente lo que decide si su factura de inferencia de noviembre coincide con el plan que escribió en septiembre.

El precio por token no le dijo nada esta semana. El coste por tarea completada, sobre sus propias tareas, sí lo habría hecho.

Fuentes: Meta AI Research, "Introducing Muse Spark 1.3" · VentureBeat, "Meta says Muse Spark 1.3 has frontier performance — but its best results come from a model developers can't broadly use yet" · MarkTechPost, "Meta AI Released Muse Spark 1.3" · Las cifras de eficiencia de ~20%/~25% son de Meta, a partir de evaluaciones de ingenieros de Meta sobre tareas de programación de largo recorrido. Las puntuaciones de benchmarks, el coste por tarea de 0,55 dólares, el rendimiento de 235,2 tokens por segundo y la separación entre Xhigh y máximo son los publicados por Artificial Analysis vía VentureBeat; la configuración máxima estaba en vista previa limitada para socios en el momento de las pruebas. Cuando las cifras de Terminal-Bench 2.1 difieren entre fuentes se indica en la sección 6. La lectura de las dos afirmaciones de coste como compatibles, y todas las recomendaciones, son mías. Para el harness dentro del que corre este modelo, vea los dos harnesses de agentes que salieron con un día de diferencia.

IdeaToMVP Academy

Want to build with AI — not just read about it?

4-week live cohort for founders. Learn to ship AI agents, scope MVPs, and automate your business — taught by the same team that writes these guides.

Explore the Academy →
Share this post :