Spotify se ahorra el 90% de tokens eligiendo el modelo por tarea
Un ingeniero de Spotify cuenta cómo desvía las tareas tontas a un modelo barato y deja el caro para pensar. La idea sirve para cualquier empresa que ya pague IA por persona.

En esta lectura
El titular: 90% menos de tokens
Dimitri Mazmanov, product manager en Spotify, publicó el 3 de septiembre en el blog de ingeniería de la casa cómo recortó alrededor de un 90% del consumo de tokens de su Claude Code en escenarios de lectura masiva de archivos 1. No cambiando de herramienta. Enrutando.
Antes de seguir, la traducción a lenguaje llano: un token es el trocito de texto que el modelo cobra, al entrar y al salir. Leer un archivo de tres mil líneas para contestar una pregunta tonta cuesta tokens igual que resolver un problema difícil. Y el precio por token del modelo listo es varias veces el del modelo rápido.
Ahí está toda la idea. No es que Claude sea caro: es que se le estaba mandando hacer de fotocopiadora.
Cómo lo montaron
El montaje que describe el artículo tiene tres piezas, y ninguna es magia 1.
Un enganche —un hook— que se mete en medio antes de que la herramienta se ejecute. El suyo se llama check-file-size y bloquea cualquier lectura de un archivo de más de 350 líneas (el número es configurable), redirigiéndola a otro sitio.
Unos scripts que llaman a Portal, la plataforma interna de Spotify donde viven sus agentes. Dos son los importantes: bulk-reader, que se traga varios archivos grandes para contestar una pregunta concreta, y code-writer, que genera código repetitivo, tests y configuraciones siguiendo los patrones que ya existen en el repositorio. Según el artículo, ambos corren sobre Gemini 2.5 Flash, un modelo rápido y barato 1.
Y unas skills, que son archivos de texto que le explican al modelo cuándo tirar de esos scripts. Nada más.
El resultado es un reparto sencillo: lo que es leer, resumir y copiar patrones se va al modelo barato; lo que es razonar de verdad se queda en el caro. El artículo menciona además un plugin llamado shunt publicado en GitHub, en el repositorio spotify/portal-ai-plugins, que está bajo licencia Apache 2.0 2.
La letra pequeña que sí importa
El propio artículo pone el pero encima de la mesa, y eso se agradece: cada vez que delega una tarea a otro modelo, la cosa tarda entre diez y treinta segundos más, con un tope duro de treinta segundos por invocación 1. Es decir, ahorras dinero y pagas en espera.
Eso cambia cuándo merece la pena. Para una lectura de veinte archivos que antes te costaba una fortuna en tokens, treinta segundos son un chollo. Para una pregunta rápida, es un incordio. Montado sin pensar, esto acaba con gente esperando delante de una pantalla.
Y hay un detalle de contexto que explica por qué esto le importa a alguien que no es Spotify. El artículo cita una previsión de Gartner según la cual el gasto en IA para programar superará el salario medio de un desarrollador en 2028, y sitúa el consumo actual entre 200 y 500 dólares al mes por persona, con casos que pasan de 2.000 1. Son cifras suyas, no mías, y las previsiones a dos años ya sabemos lo que valen. Pero el orden de magnitud lo reconoce cualquiera que tenga el recibo delante.
Qué se lleva uno de aquí si no es Spotify
Montar un Portal interno no está al alcance de casi nadie, y tampoco hace falta. Lo que sí se puede copiar es el criterio, que cabe en una frase: no pagues el modelo caro por el trabajo tonto.
En una empresa normal ese trabajo tonto tiene nombres muy reconocibles. Transcribir. Extraer cuatro campos de un PDF. Clasificar correos por asunto. Convertir un formato a otro. Rellenar una plantilla. Nada de eso necesita el modelo más listo del mercado, y probablemente lo esté usando porque es el que alguien configuró el primer día y ahí se quedó.
La conversación útil con quien lleve vuestros sistemas no es «¿cuánto nos gastamos en IA?», sino «¿qué porcentaje de ese gasto es leer, copiar y rellenar?». Si la respuesta es la mitad, ahí hay una tarde de trabajo que se paga sola.
Y el segundo criterio, que en el artículo está implícito: la decisión de a qué modelo va cada cosa no debería tomarla la persona cada vez. La toma una regla, una sola vez, y ya. Lo que se deja al criterio de cada uno en el día a día, en el día a día se olvida.
Mi lectura
Este es de los pocos artículos de ahorro que me creo, porque viene con el pero puesto: dice cuánto ahorra y dice que cuesta hasta treinta segundos por delegación. Yo empezaría por medir antes de enrutar nada, porque es muy fácil optimizar la parte que no te duele. Lo que no me trago es la cifra de Gartner para 2028: una previsión a dos años en esto es un titular, no un plan.
Rubén Marqués
Para quién
- Si diriges una empresa que ya paga licencias de IA por persona: pide el desglose de en qué se va el consumo antes de negociar el precio; casi siempre hay un proceso que se come la mitad.
- Si llevas una gestoría o una asesoría: extraer datos de facturas y clasificar documentos es justo el trabajo que no necesita el modelo más caro.
- Si trabajas con documentación técnica en un taller o una ingeniería: separar «buscar en el manual» de «decidir qué hacemos» es el mismo reparto que hace Spotify, con otro nombre.
Guárdalo
Los enlaces de esta pieza, para que no tengas que buscarlos otra vez.
-
Portal by Spotify cut my Claude Code token usage by 90%
El artículo original, con el hook, los scripts y la advertencia sobre la latencia.
-
spotify/portal-ai-plugins
Repositorio de los plugins de Portal, donde vive shunt. Licencia Apache 2.0.
-
Skills de Claude Code (documentación)
Qué es una skill y cómo se escribe, por si quieres montar tu propio reparto de tareas.
¿Le sirve a alguien de tu equipo?
Compartir en LinkedInFuentes
- 1
- 2


