Cada fichero que lee su agente se queda en la factura. Una refactorización costó 14,29 dólares

Surya Pratap
By Surya Pratap

2 de septiembre de 2026

11 min de lectura

IA y tecnología
El mecanismo del impuesto de contexto en palabras de Sonar —cada fichero que el agente lee se queda residente en el contexto de la conversación durante el resto de la ejecución— junto al coste mediano medido de tareas concretas de refactorización, desde un cambio en Java que baja de 14,29 a 9,38 dólares para el mayor ahorro del 34 % hasta un cambio en TypeScript que solo pasa de 9,45 a 8,89 dólares, el menor, con un 6 %El mecanismo y el contadorHover to explore
El ahorro depende del tipo de tarea y va del 6 % al 34 %. La cifra que conviene interiorizar es la que está a la izquierda de cada flecha: lo que cuesta de verdad ejecutar un solo commit de refactorización.

Sonar publicó esta semana una medición de costes más útil que el producto que vende.

El titular es que la navegación semántica de código abarata los agentes de programación. Es cierto, y el tamaño del efecto es modesto y depende de la tarea. La cifra que yo apuntaría es la línea base: una sola refactorización que preserva el comportamiento de una clase Java de código abierto costó 14,29 dólares de gasto en modelo.

No un sprint. No una funcionalidad. Un commit.

1. Qué se midió, y con cuánto cuidado

La metodología merece crédito antes que los hallazgos, porque es más estricta que la de casi cualquier benchmark de proveedor.

El montaje de Sonar

Seis commits de refactorización de proyectos reales de código abierto

  • Proyectos: Apache Commons Collections, SQLAlchemy, TanStack Query, AssertJ, QuartzNET.
  • Lenguajes: Java, Python, TypeScript, C#.
  • Agente de referencia: Claude Opus 4.8 con esfuerzo alto y subagentes activados.
  • Ejecuciones: diez por lado y por tarea.
  • El filtro: una ejecución cuenta solo si compila y pasan los tests correspondientes.

Esa última línea es la que hace que el resto merezca lectura. Una comparación de costes en la que el lado barato puede fallar no es una comparación de costes: es una medición de con qué rapidez se puede producir algo incorrecto. Filtrar por compilación y tests es la misma disciplina que Thinkingbox evaluando la base de datos y no la transcripción, y sigue siendo lo bastante rara como para nombrarla.

2. El mecanismo: residencia, no lecturas

Esta es la frase que explica todo el fenómeno, en palabras de Sonar:

Cada fichero que el agente lee para construir ese mapa se queda residente en el contexto de la conversación durante el resto de la ejecución.

Aquí es donde se equivocan casi todas las discusiones sobre coste. Lo caro no es leer el fichero. Es que el fichero, una vez leído, se arrastra en el contexto y se vuelve a facturar en cada turno posterior del bucle.

Lea ocho ficheros en el turno tres de una ejecución de cuarenta turnos y no habrá pagado ocho lecturas. Habrá pagado ocho ficheros × treinta y siete turnos.

Y la razón por la que los agentes leen ficheros enteros es estructural: la búsqueda de texto encuentra dónde aparece un símbolo, pero no puede responder «dónde se usa esto de verdad», así que el agente abre candidatos para averiguarlo. Lo que Sonar construyó es un grafo consultable del código (clases, métodos, campos, interfaces y sus relaciones) que responde directamente a trace-callers o get-type-hierarchy, de modo que entran menos ficheros en el contexto.

Por qué es la misma enfermedad que el catálogo de herramientas de MCP

En el artículo sobre la hoja de ruta de MCP el coste era el catálogo de herramientas: todas las herramientas, descripciones y esquemas de parámetros cargados en el contexto al iniciar la sesión, los necesitara o no la tarea, y pagados otra vez en la tarea siguiente. Aquí son ficheros de código fuente. Misma enfermedad, distinto portador: contenido cargado sin condiciones y luego facturado repetidamente. La cura también es la misma: hacer la carga condicional y dejar que el agente lo pida cuando lo necesite.

3. Lo que cuesta de verdad una tarea

Las cifras absolutas son la parte con la que los fundadores deberían quedarse, porque casi nadie ha medido las suyas.

Java · autotipado de BloomFilter

14,29 $ → 9,38 $
La tarea más cara del conjunto y el mayor ahorro, un −34 %. Un cambio que preserva el comportamiento repetido en todas las implementaciones de una abstracción compartida: la forma de trabajo donde domina la navegación.

C# · tipos de retorno de QuartzNET

10,20 $ → 8,11 $
−20 %. Medición solo por mediana. Fíjese en la base: diez dólares por cambiar tipos de retorno en un código.

TypeScript · contexto de mutación de TanStack

9,45 $ → 8,89 $
−6 %, la menor ganancia del estudio. Cara de ejecutar y apenas mejorada por una navegación mejor, porque la navegación no era lo que la encarecía.

Java · renombrado de paquete de BloomFilter

1,86 $ → 1,40 $
−25 %. Un recordatorio de que la dispersión entre tareas es de unas ocho veces, así que cualquier cifra por tarea —incluida esta— es una mala base para un presupuesto.

El movimiento de tokens siguió al dinero: tokens de entrada abajo un 11–31 %, tokens de salida abajo un 4–35 %.

4. «Hasta un 36 %» también significa «tan poco como un 6 %»

La cifra de marketing asociada a este trabajo es «hasta un 36 % más barato». El rango medido va aproximadamente del −6 % al −34 %, y los autores dicen claramente por qué:

El motor de navegación no ayudará en tareas donde la navegación no sea la restricción.

Van más allá y señalan que las ganancias aparecieron en «el mismo cambio pequeño, que preserva el comportamiento, repetido en todas las implementaciones de una abstracción compartida», y que «la ganancia está ligada al tipo de trabajo, así que no se promete en cada tarea».

Eso es inusualmente honesto para una investigación de proveedor, y merece reconocimiento antes que burla. Sonar vende la solución, así que descuente el marco, pero publicaron la tarea en la que su producto solo logró un 6 %, nombraron la condición bajo la cual no hace nada y revelaron que su grafo cede precisión en la resolución de tipos frente a un compilador a cambio de frescura. La mayoría de los benchmarks de proveedor no hace ninguna de las tres cosas.

5. Qué significa esto si usted lanza con agentes

El ahorro no es la lección. La lección es que el coste por tarea ya es una cifra real y probablemente usted no conoce la suya.

Coste por tarea completada

Medir
No tokens al mes. Coja cinco tareas que su equipo ejecute de verdad, registre el gasto en modelo de cada una desde el primer prompt hasta que pasen los tests, y anote la dispersión. Las tareas de Sonar fueron de 1,71 a 14,29 dólares: ocho veces de diferencia con el mismo montaje. La suya será mayor.

La residencia en contexto, no las lecturas

Vigilar
El coste lo genera lo que se queda en el contexto, no lo que se recupera. Los bucles largos que abren ficheros pronto y no los sueltan nunca son el patrón caro, y empeoran cuanto más larga es la ejecución: lo contrario de la intuición de que los turnos tardíos salen baratos.

La restricción que realmente tiene

Arreglar primero
Si la navegación no es lo que encarece sus tareas, una herramienta de navegación le comprará un 6 %. Mire adónde van sus tokens antes de comprar una solución: el mismo consejo vale para todas las herramientas de esta categoría, incluida esta.

Hay además una conexión directa con el hallazgo de McKinsey de ayer, según el cual el 32 % de las organizaciones se ha saltado una compra de software para construir con agentes de programación. Si una sola refactorización cuesta diez dólares de gasto en modelo, el caso de negocio de «ya lo construimos nosotros» necesita una partida que la mayoría de esas decisiones no tenía. Eso no las vuelve erróneas. Vuelve la aritmética menos evidente de lo que parece en una demo.

6. Qué no leería de más

Seis tareas son seis tareas. Refactorizaciones reales de proyectos reales, mucho mejor que sintéticas, pero una muestra de este tamaño sostiene una dirección y no una tasa. La afirmación honesta es «las refactorizaciones intensivas en navegación salieron bastante más baratas en estas seis», no «su factura baja un tercio».

La base es una configuración cara. Opus 4.8 con esfuerzo alto y subagentes activados está cerca de lo más alto de la curva de coste por diseño: es la elección correcta para medir un techo, y significa que estas cifras en dólares no son lo que produciría un modelo más barato en un código más pequeño.

El coste no es el único eje. Una configuración que lee menos ficheros es más barata y puede además estar peor informada. El filtro de compilación y tests protege de la versión más burda de eso, pero no le dice si el cambio era bueno, solo que compiló y que los tests correspondientes siguieron en verde.

El resumen honesto

Sonar midió lo que cuesta a un agente de programación completar un commit de refactorización real, con filtro de compilación y tests, y publicó el rango: de 1,71 a 14,29 dólares por tarea en una configuración de frontera con esfuerzo alto. La navegación semántica lo recortó entre un 6 % y un 34 % según si la navegación era la restricción vinculante.

El mecanismo merece llevárselo aunque nunca compre el producto: un fichero que lee su agente no se factura una vez, se factura en cada turno hasta que acaba la ejecución. Por eso los bucles largos de agentes se encarecen de una forma que parece desproporcionada al trabajo hecho, y es la misma forma que el problema del catálogo de herramientas de MCP.

Vaya y mida cinco tareas suyas de principio a fin. La cifra interesante no es el descuento que alguien le vende. Es la línea base que nunca ha mirado.

Fuentes: Sonar, «Cut your coding agent's cost with semantic code navigation» · Página de producto de Sonar Vortex · Documentación de contexto de Sonar Vortex · Los costes por tarea, las variaciones de tokens, la metodología y las salvedades citadas son los publicados por Sonar, que vende la herramienta medida; la lectura y las cautelas de la sección 6 son mías.

IdeaToMVP Academy

Want to build with AI — not just read about it?

4-week live cohort for founders. Learn to ship AI agents, scope MVPs, and automate your business — taught by the same team that writes these guides.

Explore the Academy →
Share this post :