Das Argument, dass kleine Universitätslabore, nicht die größten Technologieunternehmen, die Zukunft der KI-Forschung vorantreiben werden, stammt aus einem Blogbeitrag mit dem Titel „Frontier AI on Your Own Hardware“. Der Beitrag argumentiert, dass akademische Institutionen auf dem Weg zu einer Renaissance sind, indem sie einen unerwarteten Weg einschlagen: den Aufbau von Systemen, die die Grenzen mit kostengünstiger, begrenzter Hardware nutzen.
Der Leiter des Labors glaubt, dass das Paper überholt ist. Er sagt, dass Agenten jetzt in Wochen oder Tagen Forschungsprojekte abschließen, die früher ein Jahr an Ingenieurarbeit erforderten. Sein zentraler Punkt ist, dass die Schwierigkeit nicht mehr in der Arbeit selbst liegt, sondern darin, wie sie veröffentlicht wird.
„Wenn jedes einzelne Projekt zu einfacher, stücklicher Arbeit wird, hört gute Forschung auf, darin zu bestehen,“ schreibt er. „Ein Paper hier, ein Paper da, jedes für sich stehend, jedes einzelne, das den Leser auffordert, die Teile selbst zusammenzufügen – das ist ein Format aus einer Welt, in der jedes Teil teuer war.“
Er argumentiert, dass die Einheit der Forschung nun ein kohärentes System und nicht das einzelne Ergebnis ist, und sein Labors Antwort ist, Ökosysteme anstelle von Papers zu veröffentlichen. Dafür steht Open Source Week.
Das Ökosystem als Einheit der Forschung
Der Leiter des Labors übergibt nicht alle Teile vor Beginn der Woche. Stattdessen zeigt er nur so viel vom System, dass seine Funktionsweise klar wird. Im Zentrum des Systems steht ein Harness, der den schwierigen Teil der Modellsoptimierung selbstständig übernimmt.
Man weist den Harness auf ein Repository – ein Inferenz-Framework mit CUDA-Kernen – und weist ihn an, diese Kerne zu optimieren. Dann geht man weg. Der Agent arbeitet an den langsamen Teilen, arbeitet weiter, bis man zurückkehrt, und schließt den gesamten Prozess ab, ohne menschliches Feedback dazwischen.
Er sagt, das Ergebnis gehe weit über das hinaus, was Claude Code oder Codex bewältigen kann. Er zeigt eine Mac- und Metal-Version seines Inferenzsystems, bei dem ein Befehl es dem Agenten ermöglicht, auf den Kernen zu laufen. Die Antwort war eine quantisierte Inferenz eines Qwen 3.6 35B-A3B-Modells, das bis zu 450 Token pro Sekunde zurückliefert, mit hochwertiger Ausgabe bei 1,5 Bit pro Gewicht. Ein Halbpräzisionsmodell benötigt sechzehn Bit für jedes Gewicht; bei 1,5 Bit läuft dasselbe Modell in etwa einem Zehntel des Speichers.
Modelle, die auf Ihren Schreibtisch passen
Das eigentliche Trick besteht darin, dass Modelle, die einst unerreichbar waren, nun auf der Hardware laufen, die Leute bereits besitzen. Das populäre lokale Modell ist Qwen 3.8, mit 27 Milliarden Parametern. Sein Framework ermöglicht es, das größere Pendant, Qwen 3.8 Flash Next, mit 125 Milliarden Parametern, auf einer einzelnen 24-GB-GPU auszuführen – der Karte in einem normalen Desktop-Rechner.
Diese Zahl ist das ganze Argument. Ein 125-Milliarden-Parameter-Modell, das auf einer einzelnen 24-GB-GPU läuft, ist der Vergleich, der die Aussage zusammenfasst.
Der Laborleiter hebt DeepSeek V4.1 hervor, ein 550B-Modell, und weist darauf hin, dass es auf einer NVIDIA DGX Spark, einer AMD Strix oder einem MacBook mit 128 GB Speicher läuft. Die Kompression und das Handling der Kontextlänge erfolgen automatisch, was eine schnelle Inferenz auch bei langen Kontexten gewährleistet.
Das autonome Forschungssystem
Der Aspekt seines Projekts, der ihn am meisten begeistert, ist der Moment, in dem die Teile zusammenkommen. Er brachte die Skalierungswerkzeuge mit einem Informationsabrufansatz zusammen, der seiner Aussage nach die Deep-Research-Systeme von Frontier-Labs übertrifft.
„Wir haben diese Teile kombiniert und uns weiter in die autonome Forschung vorgewagt, und auf dem Weg haben wir eine neue Informationsabruftechnik mit einer Präzision entwickelt, die ich noch nie zuvor gesehen habe.“
Der Leiter des Labors argumentiert, dass der Bedarf an spezialisiertem Wissen eine Frage der Einrahmung und nicht der Hardware ist. Zwei oder drei GPUs oder ein MacBook können ausreichen. Der Rest ist eine Frage der Abstraktion.
Warum die Renaissance in der Wissenschaft stattfindet
Der Laborleiter glaubt, dass der Pessimismus, auf den er immer wieder stößt – die Angst, dass Absolventen keine Jobs finden werden, die Doktoranden, die die Forschung verlassen wollen – fehl am Platz ist. Er glaubt, dass die Zukunft denen gehört, die das kohärenteste Ökosystem haben, nicht denjenigen mit den meisten GPUs.
Er argumentiert, dass die festen Ressourcen von der Hardware kommen, während das Fachwissen ein Designproblem ist, das durch die Abstraktion aller technischen Details gelöst werden kann, über die der Benutzer nicht nachdenken muss. Der Großteil der Arbeit seines Labors floss in diese Arbeit, und sie ist am sichtbarsten im Agenten-Harness.
Der Leiter des Labors setzt strategisch auf die Fähigkeit kleiner Labore, größere zu übertrumpfen, indem sie sich auf Benutzerfreundlichkeit konzentrieren. Die Nachfrage nach Fachwissen ist ein Designproblem, das dadurch angegangen wird, dass jedes technische Detail entfernt wird, das der Benutzer nicht berücksichtigen muss. Ein Großteil der Arbeit seines Labors ist in diese Abstraktion geflossen und macht sich besonders im Agent Harness bemerkbar.
Kernfakten
- Qwen 3.6 35B-A3B: Läuft mit 450 Token pro Sekunde bei 1,5 Bit pro Gewicht
- Qwen 3.8 Flash Next: 125 Milliarden Parameter, läuft auf einer einzelnen 24 GB GPU
- DeepSeek V4.1: 550B Modell, läuft auf NVIDIA DGX Spark, AMD Strix oder MacBook mit 128 GB Speicher
- Harness: Optimiert CUDA-Kernel auf einem Repository, keine menschliche Rückmeldung erforderlich
Was das Labor gebaut hat
- Inferenz-Frameworks, die Qwen 3.6 35B 35B-A3B bei 1,5 Bit pro Gewicht ausführen
- Ein Agent Harness, der CUDA-Kernel optimiert
- Eine Information Retrieval-Technik mit einer Präzision, die er noch nicht gesehen hat
- Ein System, das Deep-Research-Systeme auf dem neuesten Stand übertrifft
Anstatt seine Argumentation aufzuschreiben, macht der Laborleiter seinen Fall durch Code deutlich. Die Tools sind Open-Source, und sein Argument ist, dass eine Standard-GPU alles ist, was man braucht, um Modelle auszuführen, die zuvor Supercomputer erforderten. Er wettet darauf, dass dies verändert, wie die Zukunft der KI-Forschung betrieben wird.
Die Frage, ob er Recht hat, ist schwer zu beantworten. Die tatsächlichen Anforderungen an Hardware sind vorhanden, aber die offene Frage betrifft, ob die restliche Forschungsgemeinschaft dem Beispiel seines Labors folgen wird.
Quelle: “Frontier AI on Your Own Hardware,” timdettmers.com.
Das Notizbuch abonnieren.
Die besten Geschichten des Tages und jedes neue Urteil, in klarem Deutsch, um sieben im Postfach. Eine Mail am Tag, nicht mehr.

