Elecciones 2026Vea quién creemos que merece su voto, según nuestros criteriosLa guía →
ESCRITO EN ESPAÑOL CLARO.
CLAY TRIBUNE.
Publicidad

Reflection Unveils Beam, un modelo Open-Weight de 501B diseñado para codificación y razonamiento. )

Reflection's Beam empaqueta 501B parámetros con 23B activos, ofreciendo destreza en codificación, razonamiento y capacidades de agente a una fracción del cómputo de sus rivales. )

Por mitch·5 min de lectura
A glowing digital beam illuminates a row of server racks in a dim data center.

Una reflexión ha puesto en perspectiva el primer modelo de peso abierto de Beam, una creación con un total de 501 mil millones de parámetros, de los cuales 23 mil millones permanecen activos. Este diseño sirve para la codificación, el razonamiento y el trabajo de agentes, y está construido para operar mucho más eficientemente que los sistemas rivales.

El Diseño Detrás de Beam

El diseño detrás de Beam es un enfoque disperso de Mezcla de Expertos. Su entrenamiento involucró 23.8 billones de tokens extraídos de la web y conjuntos de datos con licencia propietarios, una escala que iguala o supera a los modelos base abiertos comparables de tamaño similar. Al mismo tiempo, Reflection construyó los algoritmos, la configuración de entrenamiento y la infraestructura necesarios para respaldar el aprendizaje por refuerzo (RL) de alta computación. Durante cuatro semanas de entrenamiento, una ejecución basada en aprendizaje por refuerzo generó más de 100 millones de ejecuciones utilizando 10.5K GPUs NVIDIA GB300. Ese trabajo produjo un rendimiento de peso abierto competitivo junto con una eficiencia de nivel de vanguardia para ejecutar inferencias.

Modelo Parámetros Enfoque
Beam 501B en total, 23B activos Codificación, cargas de trabajo de agentes
GLM 5.2 No se ha especificado Razonamiento
Qwen 3.8-Max ) No se ha especificado ) Tareas de agente )

Las pruebas y evaluaciones finales aún están en curso para Beam, aunque el acceso anticipado ya ha comenzado. Los pesos completos, el informe técnico, la tarjeta del modelo y los artefactos del desarrollador están programados para ser lanzados más adelante este mes. )

Publicidad

La ventaja de eficiencia )

En codificación y tareas de agente, Beam iguala a Qwen 3.8-Max, aunque modelos como Kimi K3 todavía mantienen una ventaja en pura capacidad. Cuando se prueba en tareas de razonamiento complejas, Beam rinde al mismo nivel que GLM-5.2 mientras requiere de 3 a 4 veces menos potencia de procesamiento para la inferencia. Los ahorros crecen aún más en comparación con modelos mucho más grandes, como aquellos en el rango de más de 2T de parámetros, incluyendo Qwen 3.8-Max. )

Los hallazgos significan que cada token lleva más inteligencia, lo que le da al modelo fuertes capacidades al tiempo que reduce los costos. )

El impulso del aprendizaje por refuerzo )

RL se convirtió en el eje de escalamiento central para Beam a través de la reflexión. La firma invirtió en ciencia, datos e infraestructura de RL, transformando más potencia computacional en mejores capacidades. Los rollouts más largos ayudan con el razonamiento en múltiples pasos, el uso de herramientas y la adaptación a la retroalimentación del entorno. )

Durante un período de cuatro semanas, la firma puso en servicio 10.5K GPUs NVIDIA GB300, que produjeron más de 100 millones de rollouts mientras mantenía la longitud del contexto en no más de 256K tokens. El proceso de entrenamiento y calificación se basó en aproximadamente 1.3 mil millones de sandboxes. Un millón de entornos de codificación, agente y STEM de alta calidad fueron extraídos de toda la industria para apoyar la operación. )

No hubo señal de un techo cuando la potencia computacional de RL aumentó en todo el conjunto de evaluación; en cambio, las capacidades seguían mejorando durante todo el proceso. )

Generalización más allá del entrenamiento )

El entrenamiento de RL para Beam tuvo como objetivo construir habilidades de razonamiento y capacidades de agente que pudieran aplicarse más allá de las tareas específicas utilizadas para entrenarlo. A través de una etapa enfocada en razonamiento, ingeniería de software y tareas de terminal, las habilidades de navegación aumentaron constantemente, a pesar de que la navegación en sí misma nunca apareció en la mezcla de RL. Se le dio a Beam permiso para navegar por la web, lo que le permitió buscar y pedir información a otros modelos de lenguaje grandes, así como usar las APIs de OCR para que pudiera leer documentos por sí mismo.

Se construyó una demostración para producir un panel en tiempo real del metro de Nueva York a partir de información pública. Un segundo esfuerzo produjo aplicaciones interactivas y preparó cuadernos de ajuste fino del modelo. Beam desarrolló un cuaderno de ajuste fino para el modelo Gemma-4 más nuevo y pequeño en una tarea de Text2SQL.

Lo que esto significa para los usuarios

El sistema combina la codificación en pares de Beam con capacidades de razonamiento y de agente altamente eficientes. En tareas de codificación y de agente, su rendimiento se equipara con modelos abiertos más grandes como GLM 5.2, y está cerrando la brecha con Qwen 3.8-Max.

La fortaleza del modelo radica en su rendimiento eficiente durante la inferencia, lo que le da a Beam su valor como caballo de batalla para la codificación y las cargas de trabajo de agente empresariales. A finales de este mes, la empresa ha prometido publicar todos sus detalles técnicos, con pesos, informe técnico, tarjeta de modelo y artefactos para desarrolladores incluidos. El acceso anticipado ya está disponible.

Beam es un paso importante hacia adelante para los modelos abiertos.

Vea el video en torno al cual se construye la historia en reflection.ai.

El Cuaderno

Recibe El Cuaderno.

Las mejores historias del día y cada veredicto nuevo, en español claro, en tu correo a las siete. Un correo al día, nada más.

Enviamos una nota para confirmar. Cada número trae un enlace para darte de baja con un clic.

Publicidad

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Como Afiliado de Amazon, Clay Tribune obtiene ingresos por las compras adscritas que cumplen los requisitos aplicables.