Elecciones 2026Vea quién creemos que merece su voto, según nuestros criteriosLa guía →
ESCRITO EN ESPAÑOL CLARO.
CLAY TRIBUNE.
Publicidad

El equipo pasó septiembre intentando programar en un único modelo — y fracasó. )

Un equipo pasó septiembre utilizando un único modelo eficiente para todo el trabajo, sin ceñirse al presupuesto y aprendiendo lecciones importantes.

Por mitch·6 min de lectura
A workstation glows with model charts and token counters, symbolizing a team's failed budget experiment.

Un pequeño equipo pasó septiembre intentando usar un único modelo para todo lo que hacían. Querían demostrar que podían hacer ingeniería en un único modelo abierto y eficiente, mes tras mes. Fracasaron. Usaron el doble de tokens de lo que habían planeado.

La historia, titulada «Un Mes Codificando con GLM 5.3 Flash», es una historia de advertencia sobre la elección de modelos, la infraestructura y los costos ocultos de la experimentación.

El Plan

El objetivo era simple: pasar todo septiembre con GLM 5.3 Flash, un modelo abierto y eficiente con una ventana de contexto amplia y soporte de visión. El equipo quería ver si podían mantener su trabajo ágil al mismo tiempo que se mantenían al día con lo que los proveedores estaban lanzando. Establecieron un presupuesto, rastrearon su uso a través de AgentsView, una de sus recomendaciones de ingeniería Agentic, y observaron los números de cerca.

Publicidad

«Resulta que no es así en la práctica».

Esa es la línea de apertura de la publicación, y resume todo el mes. El plan sonaba bien en papel. En la ejecución, no se mantuvo.

Lo que Salió Bien

La primera mitad del mes transcurrió sin problemas. El autor se mantuvo dentro del presupuesto, gastando aproximadamente $68, lo que equivale a unos 4kWh de consumo de energía y 365 gramos de emisiones de carbono. GLM 5.3 Flash funcionó bien en Wagtail, en sitios construidos con él, en tareas de UI, I+D de IA y redacción de documentación. Era polivalente, manejando tareas de codificación extendidas, capturas de pantalla y control de calidad visual. La disponibilidad del modelo en una amplia gama de proveedores permitió al autor ver los beneficios de la competencia sana.

La evaluación del autor sobre las fortalezas del modelo merece ser repetida:

  • Una ventana de contexto de 1M, por lo que es posible cualquier tarea de codificación extendida.
  • Soporte de visión, por lo que puede construir a partir de capturas de pantalla o control de calidad visual.
  • Disponible en una amplia gama de proveedores, por lo que ve los beneficios de la competencia sana.

Los Imprevistos

La segunda mitad del mes no salió como estaba planeado. El autor gastó 1B de tokens en otros modelos. Hubo tres razones principales para el excedente.

Codificación de Vibraciones

El servidor Wagtail MCP experimental del autor es un prototipo codificado con vibraciones. La codificación de vibraciones no es a lo que normalmente aspiran, pero para un prototipo funcionó. El problema fue que eligieron el modelo equivocado para el prototipo. Gastaron 450M de tokens, o $150, o 5kWh de consumo de energía, casi de la noche a la mañana.

El servidor MCP en sí funciona bien y ahora tienen una gran demostración de las capacidades. No es por nada. Pero el costo fue real. Podrían haber logrado resultados similares por probablemente 5 veces menos costo con no mucho más esfuerzo. La lección es directa: tengan cuidado con la selección de modelos y con los patrones de agentes. Presupuesten para esto y sean más cuidadosos.

Problemas de Infraestructura

El autor ha escrito extensamente sobre la comparación de proveedores de inferencia. Sus opciones funcionan la mayor parte del tiempo, pero son muy populares. No tienen la misma capacidad que los grandes laboratorios que acaparan todas las GPU. El autor señaló una degradación con el rendimiento de GLM 5.3 Flash en particular, probablemente debido a que está tan arriba en la frontera de Pareto de modelos relevantes para su trabajo.

Esto significó tener que cambiar a otros modelos similares: DeepSeek V4.1 Flash y Qwen 3.8 Flash. Cambiar es simple, pero aún así fue inesperado. El autor tuvo que alejarse de su modelo objetivo porque la infraestructura no podía seguir el ritmo de la demanda.

Costos de Experimentación

Más allá de la ingeniería diaria, el autor sintió que era esencial seguir experimentando con una amplia gama de modelos. Necesitaban datos en una amplia gama de modelos a medida que comenzaban a evaluar el rendimiento en las tareas de Wagtail. El punto de referencia es un adelanto, y muestra el valor de los datos concretos.

Es mucho más fácil guiar a las personas hacia opciones más ligeras con este tipo de información. El autor también está trabajando en un nuevo prototipo de CLI diseñado para funcionar bien con agentes. Tener esos datos ayuda a que esas opciones sean más viables.

El Costo del Fracaso

Solo el 50% del uso del mes se destinó al modelo objetivo. Esa es una falla técnica por cualquier medida. El autor gastó 1B de 2B de tokens, y alrededor de 35 kWh de consumo de energía en lugar de 10. El exceso fue significativo, y el autor lo sabe.

Pero la falla produjo algo valioso: lecciones aprendidas. El autor reflexionó sobre lo que salió mal y lo que necesitan hacer de manera diferente en octubre. La reflexión es el núcleo de la publicación, y vale la pena leerla cuidadosamente.

Lecciones de Septiembre

El autor identificó cuatro áreas clave de mejora:

  1. Medición e informes constantes y locales de uso. Observar no solo los tokens, sino también el consumo de energía y el gasto, e idealmente cómo todo esto conduce a resultados positivos concretos.
  2. Presupuestación para la experimentación, no solo para las tareas diarias. Tomar decisiones más concertadas sobre qué prototipos vale la pena construir y cómo.
  3. Mejor selección de instrucciones y técnicas de agentes múltiples. Utilizar agentes orquestador, explorador, implementador y revisor. Establecer objetivos acotados. No es ciencia de cohetes, pero ciertamente es una cosa más que aprender.
  4. Seguir impulsando técnicas y modelos más eficientes. Los modelos de difusión de decisiones al estilo Jev parecen muy prometedores si pueden ejecutarse de manera tan eficiente. Los modelos insignia más recientes también parecen un paso en la dirección correcta en ese frente.

El autor desea mantener el desafío en marcha, pero solo para el 50+% de la producción diaria normal, no para I+D. El trabajo de I+D requiere una gama más amplia de modelos para comparar y probar. El trabajo de producción puede apegarse a uno o dos modelos baratos de primera categoría.

Qué Probar a Continuación

El objetivo del autor para octubre es simple: la mayoría del trabajo de inferencia de IA debe realizarse con modelos tan eficientes, medidos en costo o consumo de energía en lugar de tokens sin sentido. Ese es el objetivo que se están marcando.

También están invitando a otros a unirse. La publicación concluye con una invitación a acercarse en Wagtail Space 2026 en noviembre para escuchar cómo todo eso resulta.

La publicación es un recordatorio de que la planificación y la medición no son suficientes. También hay que observar lo que sucede, y hay que estar listo para ajustar cuando los números dejan de coincidir con el plan. El autor hizo eso, y lo escribió con honestidad.

Vea el video en el que se basa la historia en wagtail.org.

El Cuaderno

Recibe El Cuaderno.

Las mejores historias del día y cada veredicto nuevo, en español claro, en tu correo a las siete. Un correo al día, nada más.

Enviamos una nota para confirmar. Cada número trae un enlace para darte de baja con un clic.

Publicidad

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Como Afiliado de Amazon, Clay Tribune obtiene ingresos por las compras adscritas que cumplen los requisitos aplicables.