Elecciones 2026Vea quién creemos que merece su voto, según nuestros criteriosLa guía →
ESCRITO EN ESPAÑOL CLARO.
CLAY TRIBUNE.
Publicidad

Tokens demasiado baratos para contrarrestar: por qué el acceso pronto limitará la IA, no la capacidad de cálculo. )

Un desarrollador argumenta que el cuello de botella económico de la IA está cambiando de la capacidad computacional al acceso y las habilidades, no de los tokens.

Por mitch·5 min de lectura
A glowing neural network circuit board floats above a city skyline, symbolizing the shifting economics of artificial intelligence.

El precio de utilizar inteligencia de aprendizaje automático está disminuyendo en varios órdenes de magnitud al año, y no muestra signos de detenerse. El propio análisis del desarrollador predice que los LLM se integrarán en cada parte de la computación como infraestructura, no solo como un producto, dentro del próximo año o dos. Esperan que los LLM se ejecuten localmente con la calidad actual de vanguardia en hardware de consumo dentro de tres a seis años. Y creen que la calidad y el acceso serán el factor limitante para el uso de la IA 1, no la pura cantidad de tokens.

Ese último punto es crucial. El análisis está argumentando que el cuello de botella está cambiando de cuánto cómputo puede comprar a cuánta habilidad puede permitirse.

El Costo de un Token

Los LLM se cotizan por token. Un token es un fragmento de una palabra; se necesitan aproximadamente 1,5 tokens para representar una palabra completa. Cada token que un modelo lee cuesta dinero, y cada token que produce cuesta dinero. El proveedor del modelo —Anthropic o OpenAI— cobra una cantidad fija por cada uno.

Publicidad

Pero el análisis hace una distinción clave. El costo por token de los modelos de vanguardia no está disminuyendo de forma consistente. Los modelos más pequeños pueden costar menos por token, pero utilizan más tokens en general para la misma tarea porque tienen que pensar más o corregir sus borradores iniciales. Lo que importa es el costo de completar una tarea determinada, no el precio bruto de cada fragmento.

El gráfico a continuación muestra la «frontera de Pareto» de costo por tarea en la actualidad. El eje Y rastrea la calidad del modelo, según una serie de puntos de referencia. El eje X rastrea el costo de completar esos puntos de referencia. El gráfico está en una escala logarítmica, por lo que los números más grandes del eje Y y los números más pequeños del eje X son mejores.

En la parte superior derecha se encuentra Claude Fable-5.1, caro e inteligente. En el centro-izquierda se encuentra GPT-5.6 Luna, barato y menos inteligente. Los modelos por debajo de la línea punteada básicamente no vale la pena considerarlos.

Compare eso con el gráfico de 2025. El eje Y (inteligencia) se mantuvo más o menos igual, con menos disminución en el extremo barato. El eje X (costo) se volvió dos órdenes de magnitud más barato.

Hardware y Software Juntos

El análisis se basa en dos tendencias separadas que avanzan en la misma dirección. Primero, el hardware: las GPU se están volviendo exponencialmente más eficientes con cada generación. El gráfico a continuación muestra la eficiencia de la GPU, con el eje X rastreando el tiempo y el eje Y rastreando la eficiencia. Una línea recta en este gráfico logarítmico significa que la eficiencia se duplica aproximadamente una vez cada dos años, una tasa que, según el análisis, no se veía desde la Ley de Moore en la década de 1960.

Segundo, el software: los motores de inferencia están mejorando rápidamente. vLLM, un motor de inferencia de código abierto, experimentó un aumento del 40% en eficiencia en solo 15 meses, pasando de la versión 0.5.4 en septiembre de 2024 a la versión 0.11.1 en diciembre de 2025. NVIDIA mostró hasta un 50% de mejoras en eficiencia en su pila MLPerf, de la versión 2.0 a la 2.1. Intel mostró un aumento de rendimiento de 2.4x entre MLPerf 6.0 y 6.1.

El análisis señala que las cargas de trabajo de servicio se están volviendo más eficientes más rápido que la inferencia fuera de línea, y que el hardware permanece fijo mientras el software cambia.

Lo que Esto Significa para la IA

El análisis predice que la calidad y el acceso se convertirán en el factor limitante para el uso de la IA 1, no la pura cantidad de tokens. Esa es una afirmación notable, y se basa en la evidencia expuesta anteriormente: precios de tokens en descenso, hardware más eficiente y motores de inferencia más rápidos.

La posición del análisis es que el cuello de botella se está desplazando de la capacidad de cómputo a la habilidad humana. Las herramientas se están volviendo más baratas y rápidas, pero la capacidad de utilizarlas de manera efectiva no está creciendo al mismo ritmo.

El Orden del Cambio

La línea de tiempo del análisis se divide en tres etapas:

  1. El próximo año o dos: LLM integrados en cada parte de la computación como infraestructura, no solo como un producto.
  2. Los próximos tres a seis años: LLM ejecutándose localmente con la calidad actual de vanguardia en hardware de consumo.
  3. El cambio a la calidad y el acceso como factor limitante para el uso de la IA 1.

Cada etapa se presenta por separado, no como una cadena donde una sigue a la otra. El análisis predice que las mejoras en el hardware y el software seguirán llegando, y que la brecha de acceso podría crecer como resultado.

La evidencia del análisis es específica y cuantitativa. El gráfico de eficiencia de la GPU, las fechas de lanzamiento de vLLM, los números de MLPerf — todo apunta en la misma dirección. La afirmación del análisis es que el futuro de la IA no se trata de quién puede pagar la mayor capacidad de cómputo, sino de quién puede pagar el mejor acceso.

Es una predicción impactante. Si se confirma dependerá de los próximos años de lanzamientos y puntos de referencia.

Material de origen: “Tokens demasiado baratos para medir,” jyn.dev.

El Cuaderno

Recibe El Cuaderno.

Las mejores historias del día y cada veredicto nuevo, en español claro, en tu correo a las siete. Un correo al día, nada más.

Enviamos una nota para confirmar. Cada número trae un enlace para darte de baja con un clic.

Publicidad

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Como Afiliado de Amazon, Clay Tribune obtiene ingresos por las compras adscritas que cumplen los requisitos aplicables.