empresagentica

Noticias

Leer sale barato. Decidir, no tanto

Spotify cuenta cómo redujo un 90 % los tokens de lectura de su asistente de programación delegando en un modelo más económico. Lo que ese modelo no vio explica dónde está el coste real.

AutorRubén Marqués
Publicado
Fecha del hecho
Lectura4 min
Leer la noticia
En esta lectura

Qué ha contado Spotify

El 3 de septiembre, Dimitri Mazmanov, responsable de producto en Spotify, publicó cómo redujo el consumo de tokens de su asistente de programación. Su punto de partida: la mayor parte de lo que hace el asistente no es pensar, es leer. Abrir cinco archivos para responder una pregunta sobre uno consume miles de tokens con casi nada de razonamiento. 1

La solución fue un desvío. Cuando el asistente necesita leer un archivo largo, más de 350 líneas, la lectura se delega a un modelo más económico, Gemini 2.5 Flash, que devuelve un resumen en puntos. El modelo principal sigue reservado para lo que exige criterio. En cuatro escenarios sobre un repositorio Java, el ahorro medio en esas lecturas rondó el 90 %. 1

El propio artículo marca los límites. Cada delegación tarda entre 10 y 30 segundos, así que no compensa para lecturas cortas. Las ediciones no se pueden delegar, porque el resumen pierde la referencia exacta de las líneas. Y no se publican costes antes y después en dinero, ni una medida de la calidad de los resúmenes. 1

La parte que el modelo barato no vio

Hay una frase del artículo que vale más que el porcentaje. Durante las pruebas, el modelo económico encontró patrones superficiales, pero pasó por alto un fallo sutil de concurrencia. El modelo principal lo detectó en segundos cuando tuvo el contexto adecuado. 1

Imagina un departamento de compras. Es un ejemplo inventado. Llegan cuarenta ofertas y alguien pide a un asistente que las lea y resuma. Eso es lectura: mucho texto, poco juicio, y un modelo barato lo hace bien. Después hay que decidir cuál incumple una cláusula de penalización redactada de forma rara. Eso es criterio. Si esa parte también va al modelo barato, el ahorro se cobra en una oferta mal aceptada.

La regla que se desprende no es «usa el barato» ni «usa el caro». Es separar la lectura de la decisión y pagar cada una con la herramienta que le corresponde.

Lo que cuesta el modelo y lo que cuesta la tarea

Las tarifas públicas explican por qué el desvío interesa. A 15 de septiembre, Google cobra 0,30 dólares por millón de tokens de entrada y 2,50 por millón de salida en Gemini 2.5 Flash. 2 Anthropic publica 2 y 10 dólares para Claude Sonnet 5, y 5 y 25 para Claude Opus 5. 3 Leer con el modelo económico puede salir entre siete y diecisiete veces más barato por token de entrada. Son precios de lista en dólares; cada empresa paga según su contrato y su volumen.

El precio por token es solo una parte de la cuenta. La tarea completa incluye las vueltas que hacen falta cuando la primera respuesta no sirve, el tiempo de una persona revisando y el coste de un error que nadie ve. Spotify reconoce que el escenario de escritura de código es difícil de medir en tokens y no publica cuánto tiempo dedicó a comprobar los resúmenes. 1

Por eso conviene desconfiar de un porcentaje de ahorro que viaja solo. Un 90 % menos de tokens en la lectura no es un 90 % menos de coste en el trabajo. Es una parte del recorrido, medida en un repositorio concreto, con cuatro pruebas.

Qué haría antes de cambiar de modelo

Separaría el trabajo en dos listas: lo que es leer, ordenar y resumir, y lo que es decidir, comparar condiciones o detectar lo que falta. Lo primero admite un modelo económico con una comprobación por muestreo. Lo segundo merece el modelo capaz y una persona que sepa qué buscar.

Mediría la tarea entera, no la respuesta. Con dos o tres encargos reales anonimizados, apuntaría el resultado aceptado, las vueltas que hicieron falta y los minutos de revisión. El comparador de coste real de esta web sirve para poner esos números en una misma fila y ver cuándo el barato deja de serlo.

Y anotaría lo que se escapó. El fallo de concurrencia de Spotify es el dato más útil del artículo, porque señala el sitio exacto donde un ahorro de tokens se convierte en un coste de negocio.

Fuentes

  1. 1Portal by Spotify cut my Claude Code token usage by 90%

    Spotify Engineering · 3 de septiembre de 2026

    Consultada 15 sept 2026
  2. 2Gemini API pricing (página actualizada el 11 de septiembre de 2026)

    Google · consultada el 15 de septiembre de 2026

    Consultada 15 sept 2026
  3. 3Claude pricing

    Anthropic · consultada el 15 de septiembre de 2026

    Consultada 15 sept 2026

Rubén Marqués

Tecnología, operaciones y experiencia de cliente.

Rubén en LinkedIn →