frikadas

La tiranía de los tokens: cuando usar inteligencia artificial deja de parecer ilimitado

Los tokens están pasando de ser un concepto técnico a convertirse en un recurso fundamental de la inteligencia artificial. Los agentes, los límites de uso y el crecimiento del consumo pueden cambiar por completo la economía de la IA. Etiquetas: inteligencia artificial, IA

Llevo tiempo utilizando inteligencia artificial prácticamente a diario y cada vez tengo más claro que hay una palabra que vamos a escuchar muchísimo durante los próximos años: tokens.

Al principio ni siquiera les prestas atención.

Abres ChatGPT, Claude, Gemini o cualquier otra herramienta, haces preguntas, generas código, analizas documentos y tienes la sensación de estar utilizando un recurso prácticamente ilimitado.

Pero empiezas a profundizar un poco más, a utilizar APIs, agentes de programación, automatizaciones o sistemas que trabajan durante horas y la cosa cambia.

De repente empiezas a mirar cuánto contexto estás enviando, cuánto consume un agente, cuándo se reinicia el límite de uso o por qué una tarea aparentemente sencilla ha utilizado una cantidad enorme de tokens.

Y ahí aparece lo que yo llamo la tiranía de los tokens.

Pero ¿qué es exactamente un token?

Simplificándolo mucho, un token es una pequeña unidad de información que procesa un modelo de inteligencia artificial.

Los modelos no leen exactamente como nosotros. Nuestro texto se divide en pequeños fragmentos y esos fragmentos son los tokens que el modelo procesa.

Cuando escribimos una pregunta consumimos tokens.

Cuando la IA responde, también.

Cuando añadimos un documento al contexto, más tokens.

Cuando un agente lee veinte archivos de un proyecto, analiza el código, ejecuta una herramienta, recibe el resultado y vuelve a pensar qué tiene que hacer después, seguimos sumando tokens.

Y este último punto es especialmente importante.

Porque hemos pasado muy rápidamente de utilizar la IA para hacer preguntas a utilizarla para hacer cosas.

Y hacer cosas consume muchísimo más.

El problema empieza con los agentes

Creo que este es el cambio que muchas veces no estamos teniendo en cuenta.

Un chatbot espera a que escribamos.

Un agente puede estar trabajando continuamente.

Le podemos pedir que analice un proyecto, investigue un problema, modifique código, ejecute pruebas, compruebe los resultados, corrija los errores y vuelva a empezar.

Cada uno de esos pasos implica nuevas llamadas al modelo.

Y cada llamada implica tokens.

Además, los agentes necesitan contexto. Tienen que saber qué han hecho anteriormente, qué herramientas tienen disponibles, cuáles han sido los resultados y qué objetivo están intentando conseguir.

Cuanto más autónomos queremos que sean, más información necesitan procesar.

Por eso tengo la sensación de que el verdadero problema de los tokens todavía no ha empezado.

Hasta ahora la mayoría hemos utilizado la inteligencia artificial de forma interactiva. En los próximos años tendremos decenas de procesos utilizando IA en segundo plano.

Y entonces el consumo puede dispararse.

De hecho, las empresas que están desplegando IA a gran escala ya están descubriendo algo aparentemente contradictorio: el precio unitario de los tokens puede bajar mientras la factura total sigue aumentando, simplemente porque cada vez consumimos muchos más.

Los límites no están ahí por casualidad

Cualquiera que utilice intensivamente herramientas de inteligencia artificial se ha encontrado alguna vez con los límites.

Has alcanzado el máximo disponible.

Espera unas horas.

Este modelo vuelve a estar disponible más tarde.

Has superado determinada ventana de utilización.

Al principio puede resultar frustrante, especialmente cuando estás trabajando y la IA forma ya parte de tu flujo de trabajo.

Pero hay una razón bastante evidente.

La inteligencia artificial cuesta dinero cada vez que la utilizamos.

Detrás de una respuesta hay infraestructura funcionando. Hay GPUs, memoria, electricidad, redes, centros de datos y una enorme infraestructura de software.

La sensación de que pagamos una suscripción y obtenemos inteligencia artificial ilimitada es, en buena medida, eso: una sensación.

En realidad siempre existen límites.

Algunos son visibles y otros no.

Ahora mismo estamos viviendo una situación bastante excepcional

Creo que hay otra cuestión que no solemos plantearnos demasiado.

Estamos en mitad de una guerra por conseguir usuarios.

Las grandes compañías necesitan que utilicemos sus herramientas, que nos acostumbremos a ellas y, sobre todo, que las integremos en nuestra forma de trabajar.

Eso hace que el mercado actual sea extremadamente competitivo.

Tenemos suscripciones con cantidades enormes de capacidad, niveles gratuitos, promociones y servicios que nos permiten utilizar modelos potentísimos por cantidades que hace pocos años habrían parecido ridículas.

Mi impresión es que una parte importante de este mercado está subvencionando el consumo para captar usuarios y ganar cuota de mercado.

Eso no significa necesariamente que cada token se esté vendiendo por debajo de su coste.

La economía de la inferencia es bastante más compleja.

Pero sí significa que probablemente sea un error asumir que las condiciones actuales van a durar para siempre.

Las empresas necesitan captar clientes ahora.

Después tendrán que ganar dinero con ellos.

La IA tendrá que encontrar su precio real

Esto ya lo hemos visto muchas veces en Internet.

Primero llega la fase de crecimiento.

Después llega la monetización.

Durante los primeros años lo importante es conseguir usuarios, generar dependencia del producto y convertirse en estándar.

Cuando el mercado madura, las prioridades cambian.

No creo que la inteligencia artificial vaya a ser diferente.

Seguramente seguirá existiendo IA muy barata e incluso gratuita. La tecnología también está mejorando muchísimo y cada generación de hardware y software permite hacer más con menos recursos.

Pero al mismo tiempo nosotros vamos a pedirle muchísimo más.

No querremos una IA a la que hacer diez preguntas.

Querremos cinco agentes trabajando durante horas.

Querremos una IA programando, otra investigando, otra revisando información y otra automatizando tareas.

El problema no será únicamente cuánto cuesta un token.

Será cuántos tokens queremos consumir.

Y ahí es donde creo que las suscripciones actuales pueden cambiar bastante.

No necesariamente porque las compañías decidan simplemente subir los precios, sino porque aparecerán más niveles de servicio, límites diferentes, capacidad adicional, consumo por uso y planes específicos para quienes utilicen agentes intensivamente.

La tarifa plana absoluta tiene difícil encaje cuando el coste de dos usuarios puede ser radicalmente distinto.

Y entonces empiezan a tener sentido alternativas como NaN builders

Precisamente por todo esto me parecen especialmente interesantes servicios como NaN builders.

No tanto porque exista un modelo concreto que sea mejor o peor, sino por el concepto.

Si vas a trabajar intensivamente con agentes, automatizaciones y diferentes modelos de IA, empieza a ser interesante disponer de plataformas que te permitan acceder a grandes cantidades de capacidad sin estar pensando continuamente en cada token consumido.

Puedes apuntarte al servicio de Nan Builders sin necesidad de lista de espera usando mi enlace. Además nos dan 5 € a cada uno : Suscripción Nan Builders

Y también empieza a ser interesante poder cambiar de modelo dependiendo del trabajo.

Porque hay otra cosa que estamos haciendo mal.

Estamos utilizando modelos demasiado grandes para demasiadas cosas

Tenemos cierta obsesión por utilizar siempre el modelo más potente.

Y no tiene demasiado sentido.

Para resolver un problema complejo de arquitectura de software quizá sí quiero utilizar el modelo más capaz que tenga disponible.

Pero para clasificar un texto, extraer unos campos, resumir una información o decidir qué herramienta tiene que utilizar un agente probablemente no lo necesite.

Esto será especialmente importante cuando empecemos a construir sistemas con múltiples agentes.

El agente que coordina todo puede necesitar mucha capacidad.

Los agentes que realizan tareas sencillas probablemente no.

Y algunos procesos incluso podrán ejecutarse con modelos locales.

La arquitectura inteligente será aquella que sea capaz de decidir dónde merece la pena gastar inteligencia.

El futuro probablemente sea multimodelo

Creo que dentro de unos años nos resultará extraño depender completamente de un único proveedor de inteligencia artificial.

Será parecido a lo que ocurre actualmente con otros servicios de infraestructura.

Utilizaremos un modelo para unas cosas y otro para otras.

Modelos comerciales para determinadas tareas.

Modelos abiertos para otras.

Servicios como NaN builders para disponer de grandes cantidades de capacidad.

Modelos locales cuando privacidad, coste o disponibilidad lo hagan interesante.

Y posiblemente algún sistema por encima de todos ellos que decida automáticamente qué modelo utilizar en cada momento.

Ahí es donde veo realmente el futuro.

No en buscar permanentemente cuál es el mejor modelo, sino en construir sistemas capaces de utilizar el modelo adecuado para cada trabajo.

Los tokens se están convirtiendo en un recurso de infraestructura

Hasta hace poco, cuando diseñábamos una aplicación nos preocupábamos por CPU, memoria, almacenamiento o ancho de banda.

Ahora tenemos que añadir otra cosa:

inteligencia.

Y esa inteligencia tiene un consumo.

Los tokens se están convirtiendo en la forma de medirlo.

Esto va a provocar que aparezca toda una disciplina alrededor de su optimización.

Reducir contexto innecesario.

Utilizar caché.

Evitar llamadas redundantes.

Elegir modelos más pequeños cuando sea posible.

Ejecutar determinados modelos en local.

Repartir tareas entre diferentes proveedores.

Y, sobre todo, medir si los tokens que estamos gastando realmente están aportando valor.

No es una cuestión menor. El crecimiento del uso de agentes ya está haciendo que algunas organizaciones tengan que tratar el consumo de IA como una partida que necesita control y planificación.

La paradoja: los tokens serán más baratos y gastaremos más

Esta es probablemente la parte más interesante de todo esto.

Estoy convencido de que generar un millón de tokens será cada vez más barato.

Los modelos serán más eficientes.

El hardware mejorará.

Aparecerán nuevos competidores.

Los modelos abiertos seguirán avanzando.

La competencia será brutal.

Pero eso no significa necesariamente que nuestra factura de inteligencia artificial vaya a bajar.

Puede ocurrir exactamente lo contrario.

Porque si algo se vuelve diez veces más barato pero empezamos a utilizarlo cien veces más, terminaremos gastando mucho más.

Y creo que eso es exactamente lo que puede suceder con la IA.

Hoy utilizamos millones de tokens.

Mañana nuestros agentes utilizarán miles de millones sin que nosotros ni siquiera estemos delante del ordenador.

La tiranía de los tokens

Por eso hablo de la tiranía de los tokens.

No porque los tokens sean algo malo.

Son simplemente la unidad que nos permite medir el consumo de una tecnología extraordinariamente potente.

El problema aparece cuando empezamos a depender de esa tecnología y descubrimos que cada acción tiene un coste.

Ahora mismo estamos viviendo posiblemente una de las mejores épocas para experimentar con inteligencia artificial.

Hay una competencia enorme, muchísimo capital intentando ganar mercado y una oferta de capacidad que hace apenas unos años habría parecido ciencia ficción.

Hay que aprovecharlo.

Pero también creo que debemos empezar a diseñar nuestros proyectos pensando en lo que vendrá después.

No depender de un único proveedor.

No utilizar siempre el modelo más caro o potente.

Poder mover nuestras cargas de trabajo.

Utilizar modelos locales cuando tenga sentido.

Y buscar plataformas que nos permitan consumir grandes cantidades de inteligencia artificial de una forma sostenible.

Porque durante estos primeros años todos hemos estado obsesionados con una pregunta:

¿Cuál es la mejor inteligencia artificial?

Creo que poco a poco empezaremos a hacernos otra:

¿Cuánta inteligencia artificial puedo permitirme utilizar?

Y cuando nuestros agentes estén consumiendo tokens las 24 horas del día, esa segunda pregunta puede terminar siendo bastante más importante que la primera.

Deja un comentario

Tu correo no se publicará. Los campos obligatorios están marcados con *. Los comentarios con enlaces se revisan antes de publicarse.