Ein kleines Team verbrachte September damit, ein einzelnes Modell für alles zu nutzen, was sie taten. Sie wollten beweisen, dass sie monat für Monat effizientes Engineering auf einem einzigen, offenen Modell durchführen könnten. Sie scheiterten. Sie verbrauchten doppelt so viele Tokens, wie sie geplant hatten.
Die Geschichte mit dem Titel „Ein Monat Programmieren mit GLM 5.3 Flash“ ist eine warnende Geschichte über Modellwahl, Infrastruktur und die verborgenen Kosten des Experimentierens.
Der Plan
Das Ziel war einfach: den ganzen September über GLM 5.3 Flash zu nutzen, ein effizientes, offenes Modell mit einem großen Kontextfenster und Visus-Support. Das Team wollte sehen, ob sie ihre Arbeit schlank halten und gleichzeitig mitverfolgen konnten, was die Anbieter veröffentlichten. Sie legten ein Budget fest, verfolgten ihre Nutzung über AgentsView, eine ihrer Agenturbasierten Engineering-Empfehlungen, und beobachteten die Zahlen genau.
„Es stellt sich heraus, dass dies in der Praxis nicht so viel ist.“
Dies ist die Eröffnungszeile des Beitrags und fasst den ganzen Monat zusammen. Der Plan klang gut auf dem Papier. In der Ausführung hielt er jedoch nicht.
Was gut lief
Die erste Hälfte des Monats verlief reibungslos. Der Autor blieb innerhalb des Budgets und gab etwa 68 US-Dollar aus, was etwa 4 kWh Energieverbrauch und 365 Gramm Kohlenstoffemissionen entspricht. GLM 5.3 Flash war gut auf Wagtail, auf damit erstellten Websites, bei UI-Aufgaben, KI-Forschung und Dokumentationsschreiben. Es war vielseitig und konnte erweiterte Programmieraufgaben, Screenshots und visuelles QA bewältigen. Die Verfügbarkeit des Modells über eine breite Palette von Anbietern ließ den Autor die Vorteile eines gesunden Wettbewerbs erkennen.
Die Einschätzung des Autors über die Stärken des Modells ist es wert, wiederholt zu werden:
- Ein Kontextfenster von 1 Million Tokens, sodass jede erweiterte Programmieraufgabe möglich ist.
- Visus-Support, sodass es auf Screenshots aufbauen oder visuelles QA durchführen kann.
- Verfügbar über eine breite Palette von Anbietern, sodass Sie die Vorteile eines gesunden Wettbewerbs erkennen können.
Die Unerwarteten Hürden )
Die zweite Hälfte des Monats verlief nicht wie geplant. Der Autor verbrauchte 1 Milliarde Tokens für andere Modelle. Es gab drei Hauptgründe für die Überschreitung.
Vibe Coding )
Der experimentelle Wagtail MCP-Server des Autors ist ein Vibe-Coding-Prototyp. Vibe Coding ist nicht das, was sie normalerweise anstreben, aber für einen Prototyp funktionierte es. Das Problem war, dass sie das falsche Modell für den Prototyp gewählt hatten. Sie verbrauchten 450 Millionen Tokens, oder 150 $, oder 5 kWh Energieverbrauch, fast über Nacht.
Der MCP-Server selbst funktioniert gut, und sie haben jetzt eine großartige Demo der Fähigkeiten. Das ist nicht ohne Grund. Aber die Kosten waren real. Sie hätten ähnliche Ergebnisse wahrscheinlich zu 5-mal geringeren Kosten und mit nicht viel mehr Aufwand erzielen können. Die Lektion ist eindeutig: Seien Sie vorsichtig bei der Modellauswahl und bei agentenbezogenen Mustern. Planen Sie dafür ein Budget ein und seien Sie vorsichtiger.
Infrastruktur-Probleme )
Der Autor hat ausführlich über den Vergleich von Inferenz-Providern geschrieben. Ihre Auswahl funktioniert meistens gut, aber sie sind sehr beliebt. Sie verfügen nicht über die gleiche Kapazität wie die großen Labore, die alle GPUs horten. Der Autor wies auf eine Verschlechterung der Leistung von GLM 5.3 Flash hin, höchstwahrscheinlich, weil es so weit oben an der Pareto-Frontier der relevanten Modelle für ihre Arbeit liegt.
Das bedeutete, auf andere ähnliche Modelle umsteigen zu müssen: DeepSeek V4.1 Flash und Qwen 3.8 Flash. Der Wechsel ist einfach, aber er kam dennoch unerwartet. Der Autor musste von seinem Zielmodell abrücken, weil die Infrastruktur nicht mit der Nachfrage Schritt halten konnte.
Experimentationskosten )
Abgesehen von der täglichen Entwicklung hielt der Autor es für unerlässlich, weiterhin mit einer breiten Palette von Modellen zu experimentieren. Sie brauchten Daten über eine breite Palette von Modellen, als sie begannen, die Leistung bei Wagtail-Aufgaben zu bewerten. Der Benchmark ist ein erster Einblick und zeigt den Wert konkreter Daten.
Es ist viel einfacher, Menschen mit dieser Art von Informationen zu schlankeren Optionen zu führen. Der Autor arbeitet außerdem an einem neuen CLI-Prototyp, der gut mit Agenten funktionieren soll. Diese Daten helfen, diese Optionen praktikabler zu machen.
Die Kosten des Scheiterns )
Nur 50 % des monatlichen Verbrauchs entfielen auf das Zielmodell. Das ist unter jedem Aspekt ein technisches Versagen. Der Autor verbrauchte 1 Milliarde von 2 Milliarden Token und etwa 35 kWh Energie anstelle von 10. Die Überschreitung war erheblich, und der Autor weiß es.
Aber das Versagen produzierte etwas Wertvolles: gewonnene Erkenntnisse. Der Autor reflektierte über das, was schiefgelaufen ist und was sie im Oktober anders machen müssen. Die Reflexion ist der Kern des Beitrags, und es lohnt sich, sie sorgfältig zu lesen.
Lehren aus September
Der Autor identifizierte vier Schlüsselbereiche für Verbesserungen:
- Ständige, lokale Messung und Berichterstattung über den Verbrauch. Achten Sie nicht nur auf Token, sondern auch auf Energieverbrauch und Ausgaben, und idealerweise darauf, wie gut all dies zu konkreten positiven Ergebnissen führt.
- Budgetierung für Experimente, nicht nur für alltägliche Aufgaben. Treffen Sie gezieltere Entscheidungen darüber, welche Prototypen es wert sind, gebaut zu werden und wie.
- Bessere Prompt-Auswahl und Multi-Agent-Techniken. Verwenden Sie Orchestrator-, Scout-, Implementierer- und Reviewer-Agenten. Setzen Sie begrenzte Ziele. Keine Raketenwissenschaft, aber sicherlich etwas, was man lernen kann.
- Weiterhin effizientere Techniken und Modelle vorantreiben. Die Jev-artigen Entscheidungsdiffusionsmodelle scheinen sehr vielversprechend zu sein, wenn sie so effizient laufen können. Die neuesten Flaggschiffmodelle scheinen ebenfalls in dieser Hinsicht einen Schritt in die richtige Richtung zu sein.
Der Autor möchte die Herausforderung fortsetzen, aber nur für die 50+% des normalen alltäglichen Produktionsbetriebs, nicht für Forschung und Entwicklung. Die Forschungs- und Entwicklungsarbeit erfordert eine größere Bandbreite an Modellen, um diese zu benchmarken und zu testen. Die Produktionsarbeit kann bei einem oder zwei Modellen der Spitzenklasse im günstigen Bereich bleiben.
Was als Nächstes zu versuchen ist
Das Ziel des Autors für Oktober ist einfach: Der Großteil der KI-Inferenzarbeit sollte mit solchen effizienten Modellen durchgeführt werden, gemessen in Kosten oder Energieverbrauch anstatt an wertlosen Token. Das ist das Ziel, das sie sich selbst setzen.
Sie laden auch andere ein, mitzumachen. Der Beitrag endet mit einer Einladung, im November bei Wagtail Space 2026 vorbeizuschauen, um zu hören, wie es sich alles entwickelt.
Der Beitrag ist eine Erinnerung daran, dass Planung und Messung nicht ausreichen. Man muss auch beobachten, was geschieht, und bereit sein, Anpassungen vorzunehmen, wenn die Zahlen nicht mehr mit dem Plan übereinstimmen. Der Autor hat dies getan und darüber ehrlich geschrieben.
Sehen Sie das Video, auf das sich die Geschichte stützt, unter wagtail.org.
Das Notizbuch abonnieren.
Die besten Geschichten des Tages und jedes neue Urteil, in klarem Deutsch, um sieben im Postfach. Eine Mail am Tag, nicht mehr.

