Eine Reflexion hat Beams erstes Open-Weight-Modell ins Blickfeld gebracht, eine Kreation mit insgesamt 501 Milliarden Parametern, von denen 23 Milliarden aktiv bleiben. Dieses Design dient der Programmierung, dem logischen Schlussfolgern und agentenbezogenen Aufgaben und ist darauf ausgelegt, deutlich effizienter als konkurrierende Systeme zu arbeiten.
Das Design hinter Beam
Das Design hinter Beam ist ein sparsamer Mixture-of-Experts-Ansatz. Sein Training umfasste 23,8 Billionen Token, die aus dem Internet und proprietären lizenzierten Datensätzen entnommen wurden, ein Umfang, der mit oder übersteigt vergleichbare Open-Base-Modelle ähnlicher Größe. Gleichzeitig hat Reflection die Algorithmen, Trainingsumgebungen und die Infrastruktur aufgebaut, die erforderlich sind, um High-Compute-Reinforcement-Learning (RL) zu unterstützen. Über vier Wochen hinweg erzeugte ein auf Reinforcement-Learning basierender Lauf mehr als 100 Millionen Rollouts unter Verwendung von 10.5K NVIDIA GB300 GPUs. Diese Arbeit lieferte eine konkurrenzfähige Open-Weight-Performance zusammen mit frontier-Level-Effizienz für die Ausführung von Inferenz.
| Modell | Parameter | Fokus |
|---|---|---|
| Beam | 501B insgesamt, 23B aktiv | Programmierung, agentenbezogene Arbeitslasten |
| GLM 5.2 | Nicht angegeben | Logisches Schlussfolgern |
| Qwen 3.8-Max) | Nicht angegeben) | Agentic tasks) |
Die abschließenden Tests und Evaluierungen laufen für Beam noch, obwohl der Early Access bereits begonnen hat. Die vollständigen Gewichte, der technische Bericht, die Model Card und die Entwickler-Artefakte sollen noch diesen Monat veröffentlicht werden.)
Der Effizienz-Vorteil)
Bei Coding- und Agentic-Tasks erreicht Beam Qwen 3.8-Max, obwohl Modelle wie Kimi K3 in reiner Leistungsfähigkeit noch einen Vorteil haben. Bei komplexen Reasoning-Aufgaben erreicht Beam das gleiche Niveau wie GLM-5.2, benötigt aber 3 bis 4-mal weniger Rechenleistung für die Inferenz. Die Einsparungen werden noch größer im Vergleich zu wesentlich größeren Modellen, wie beispielsweise solchen im 2T+-Parameterbereich, einschließlich Qwen 3.8-Max.)
Die Ergebnisse bedeuten, dass jeder Token mehr Intelligenz transportiert, was dem Modell starke Fähigkeiten verleiht und gleichzeitig die Kosten niedrig hält.)
Der Reinforcement-Learning-Schub)
RL wurde durch Reflection zum zentralen Skalierungsfaktor für Beam. Das Unternehmen investierte in RL-Wissenschaft, -Daten und -Infrastruktur und verwandelte mehr Rechenleistung in bessere Fähigkeiten. Längere Rollouts helfen bei mehrstufigem Reasoning, der Werkzeugnutzung und der Anpassung an Umwelt-Feedback.)
Über einen Zeitraum von vier Wochen setzte das Unternehmen 10.5K NVIDIA GB300 GPUs ein, die über 100 Millionen Rollouts produzierten, während die Kontextlänge auf nicht mehr als 256K Token begrenzt blieb. Der Trainings- und Grading-Prozess stützte sich auf etwa 1,3 Milliarden Sandboxes. Eine Million Coding-, Agentic- und STEM-Umgebungen von hoher Qualität wurden aus der gesamten Branche bezogen, um den Betrieb zu unterstützen.)
Es gab keine Anzeichen für eine Obergrenze, als die RL-Rechenleistung über die gesamte Evaluationssuite anstieg; stattdessen verbesserten sich die Fähigkeiten stetig.)
Generalisierung jenseits des Trainings)
Das RL-Training für Beam zielte darauf ab, Denk- und Agentfähigkeiten aufzubauen, die über die spezifischen Aufgaben hinaus angewendet werden können, für die es trainiert wurde. Durch eine Phase, die sich auf Denkprozesse, Softwareentwicklung und Terminalaufgaben konzentrierte, stiegen die Browserfähigkeiten stetig an, obwohl das Browsen selbst nie im RL-Mix auftauchte. Beam erhielt die Erlaubnis, das Internet zu nutzen, was es ermöglichte, Informationen abzurufen und andere große Sprachmodelle zu befragen sowie OCR-APIs aufzurufen, damit es Dokumente selbstständig lesen konnte.
Eine Demo wurde erstellt, um ein Dashboard der New Yorker U-Bahn in Echtzeit von öffentlichen Informationen zu erstellen. Ein zweiter Versuch erstellte interaktive Anwendungen und erstellte Model-Fine-Tuning-Notebooks. Beam selbst entwickelte ein Fine-Tuning-Notebook für das neueste und kleinste Gemma-4-Modell für eine Text2SQL-Aufgabe.
Was das für Nutzer bedeutet
Das System kombiniert Beam-Paar-Codierung mit hocheffizienter Denk- und Agentfähigkeiten. Bei Codierungs- und Agentaufgaben erreicht es eine Leistung, die mit größeren Open-Source-Modellen wie GLM 5.2 übereinstimmt, und schließt die Lücke zu Qwen 3.8-Max.
Die Stärke des Modells liegt in seiner effizienten Leistung während der Inferenz, was Beam seinen Wert als Arbeitstier für Unternehmenscodierungs- und Agentenworkloads verleiht. Später diesen Monat hat das Unternehmen versprochen, seine vollständigen technischen Details zu veröffentlichen, einschließlich Gewichten, technischem Bericht, Model Card und Entwickler-Artefakten. Der Early Access ist bereits verfügbar.
Beam ist ein bedeutender Fortschritt für Open-Source-Modelle.
Sehen Sie sich das Video an, auf dem die Geschichte basiert, unter reflection.ai.
Das Notizbuch abonnieren.
Die besten Geschichten des Tages und jedes neue Urteil, in klarem Deutsch, um sieben im Postfach. Eine Mail am Tag, nicht mehr.

