Elecciones 2026Vea quién creemos que merece su voto, según nuestros criteriosLa guía →
ESCRITO EN ESPAÑOL CLARO.
CLAY TRIBUNE.
Publicidad

El caso de un director de laboratorio sobre por qué el futuro de la investigación de la IA pertenece a los pequeños laboratorios universitarios. )

Un profesor sostiene que los laboratorios pequeños pueden competir con las grandes empresas tecnológicas construyendo ecosistemas de IA en hardware de escritorio económico, en lugar de supercomputadoras.

Por mitch·6 min de lectura
A desktop computer with a glowing GPU sits amid open-source code on a monitor, symbolizing academic AI research.

El argumento de que los pequeños laboratorios universitarios, y no las empresas de tecnología más grandes, liderarán el futuro de la investigación de la IA proviene de una publicación de blog llamada «Frontier AI on Your Own Hardware». La publicación argumenta que las instituciones académicas se dirigen hacia un renacimiento al tomar un camino inesperado: construir sistemas que rivalizan con la frontera utilizando hardware barato y limitado.

El hombre a cargo del laboratorio cree que el artículo académico está muerto. Dice que los agentes ahora realizan proyectos de investigación en semanas o días que solían tomar un año de trabajo de ingeniería. Su punto central es que la dificultad ya no está en el trabajo en sí, sino en cómo se publica.

«Cuando cada proyecto individual se vuelve fácil, el trabajo a pedazos ya no es una buena investigación», escribe. «Un artículo aquí, un artículo allá, cada uno autocontenido, cada uno pidiendo al lector que cose los pedazos juntos ellos mismos — ese es un formato de un mundo donde cada pieza era costosa».

Publicidad

Argumenta que la unidad de investigación es ahora un sistema coherente, no el resultado único, y la respuesta de su laboratorio es publicar ecosistemas en lugar de artículos académicos. Es por eso que existe Open Source Week.

El Ecosistema como Unidad de Investigación

Quien dirige el laboratorio no está entregando todas las piezas antes de que comience la semana. En cambio, está mostrando solo suficiente del sistema para que sus operaciones sean claras. Lo que está en el centro del sistema es un arnés que maneja la difícil parte de la optimización de modelos por sí solo.

Apuntas el arnés a un repositorio — un framework de inferencia con kernels de CUDA — y le das la instrucción de optimizar esos kernels. Entonces te alejas. El agente trabaja en las partes lentas, sigue adelante hasta que regresas y finaliza todo el proceso sin ninguna retroalimentación humana en el medio.

Dice que el resultado va mucho más allá de lo que Claude Code o Codex pueden manejar. Muestra una versión de Mac y Metal de su sistema de inferencia, donde un comando permite que el agente se ejecute en los kernels. La respuesta fue una inferencia cuantificada de un modelo Qwen 3.6 35B-A3B, devolviendo hasta 450 tokens por segundo, con una salida de alta calidad a 1.5 bits por peso. Un modelo de media precisión requiere dieciséis bits para cada peso; a 1.5 bits, el mismo modelo se ejecuta en aproximadamente una décima parte de la memoria.

Modelos Que Caben en Tu Escritorio

El verdadero truco es que los modelos que antes estaban fuera de alcance ahora caben en el hardware que ya poseen las personas. El modelo local popular es Qwen 3.8, con 27 mil millones de parámetros. Su marco le permite ejecutar a su hermano mayor, Qwen 3.8 Flash Next, que tiene 125 mil millones de parámetros, en una sola GPU de 24 GB — la tarjeta en una máquina de escritorio normal.

Esa cifra es todo el argumento. Un modelo de 125 mil millones de parámetros que se ejecuta en una sola GPU de 24 GB es la comparación que resume el punto.

El director del laboratorio destaca DeepSeek V4.1, un modelo de 550B, y señala que se ejecuta en un NVIDIA DGX Spark, un AMD Strix o un MacBook con 128 GB de memoria. La compresión y el manejo de la longitud del contexto del sistema ocurren automáticamente, lo que mantiene la inferencia rápida incluso con contextos largos.

El Sistema de Investigación Autónoma

El aspecto de su proyecto que le parece más emocionante es el momento en que las piezas encajan. Combinó las herramientas de escalamiento con un enfoque de recuperación de información que, según dice, supera a los sistemas de investigación profundos de los laboratorios de vanguardia.

«Combinamos estas piezas y avanzamos más en la investigación autónoma, y en el camino construimos una nueva técnica de recuperación de información con una precisión que no he visto antes».

El director del laboratorio argumenta que la necesidad de conocimiento especializado es una cuestión de encuadre, no de hardware. Dos o tres GPU, o un MacBook, pueden ser suficientes. El resto es una cuestión de abstracción.

Por qué Ocurre el Renacimiento en la Academia

El director del laboratorio cree que el pesimismo con el que se encuentra constantemente — el miedo de que los estudiantes que se gradúan no encontrarán empleos, los estudiantes de doctorado que quieren dejar la investigación — está equivocado. Él cree que el futuro pertenece a quien tenga el ecosistema más coherente, no a quien tenga más GPU.

Argumenta que los recursos fijos provienen del hardware, mientras que el problema de la experiencia es un problema de diseño que se puede resolver al abstraer cada detalle técnico que el usuario no necesita pensar. La mayor parte del esfuerzo de su laboratorio se dedicó a ese trabajo, y es más visible en el arnés del agente.

El director del laboratorio está realizando una apuesta estratégica en la capacidad de los laboratorios pequeños para superar a los más grandes a través de un enfoque en la usabilidad. La demanda de experiencia es un problema de diseño, uno que se aborda eliminando cada detalle técnico que el usuario no necesita considerar. La mayor parte del esfuerzo de su laboratorio se ha dedicado a esta abstracción, y es más evidente en el arnés de agente.

Hechos Clave

  • Qwen 3.6 35B-A3B: funciona a 450 tokens por segundo a 1.5 bits por peso
  • Qwen 3.8 Flash Next: 125 mil millones de parámetros, funciona en una sola GPU de 24 GB
  • DeepSeek V4.1: modelo de 550B, funciona en NVIDIA DGX Spark, AMD Strix o MacBook con 128 GB de memoria
  • Arnés: optimiza los kernels de CUDA en un repositorio, no se necesita retroalimentación humana

Lo que el Laboratorio Construyó

  • Marcos de inferencia que ejecutan Qwen 3.6 35B 35B-A3B a 1.5 bits por peso
  • Un arnés de agente que optimiza los kernels de CUDA
  • Una técnica de recuperación de información con una precisión que no ha visto antes
  • Un sistema que supera a los sistemas de investigación profunda de vanguardia

En lugar de escribir su argumento, el director del laboratorio está presentando su caso a través de código. Las herramientas son de código abierto, y su punto es que una GPU estándar es todo lo que cualquiera necesita para ejecutar modelos que previamente requerían supercomputadoras. Está apostando a que esto altera la forma en que se lleva a cabo el futuro de la investigación de IA.

Responder a la pregunta de si tiene razón es una tarea difícil. Las demandas reales en el hardware están presentes, pero la cuestión abierta concierne a si el resto de la comunidad investigadora seguirá la línea de su laboratorio.

Material fuente: “Frontier AI on Your Own Hardware”, timdettmers.com.

El Cuaderno

Recibe El Cuaderno.

Las mejores historias del día y cada veredicto nuevo, en español claro, en tu correo a las siete. Un correo al día, nada más.

Enviamos una nota para confirmar. Cada número trae un enlace para darte de baja con un clic.

Publicidad

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Como Afiliado de Amazon, Clay Tribune obtiene ingresos por las compras adscritas que cumplen los requisitos aplicables.