Eine neue lokale Inferenz-Engine namens DwarfStar 4, oder ds4, ermöglicht es Nutzern, große KI-Modelle auf ihren eigenen Geräten auszuführen, anstatt Anfragen an einen entfernten Server zu senden. Das Projekt stammt von dem Schöpfer von Redis.
Was DwarfStar 4 leistet
Die DwarfStar 4 Engine läuft auf Mac-Systemen mit ausreichend Speicher, zusammen mit CUDA- und ROCm-Hardware, und funktioniert mit DeepSeek V4 und V4.1 Flash, GLM 5.x und Qwen3.8 Flash Next, einschließlich Text- und Vision-Modellen, lokalen APIs, einer Befehlszeilenschnittstelle und einem nativen Agenten – alles in einem Paket vereint. Diese Inferenz-Engine arbeitet innerhalb eines schlanken C-Frameworks und wird unter der MIT-Lizenz ausgeliefert.
Kompression steht im Mittelpunkt des Designs. Die Software komprimiert die weitergeleiteten Experten innerhalb eines Mixture-of-Experts-Modells, während gleichzeitig die wichtigsten gemeinsamen Pfade erhalten bleiben. Dies ist der Grund, warum die unterstützten routed-MoE-Builds mit ihren Zielmaschinen übereinstimmen.
Die drei Phasen
Das Projekt gliedert seinen Entwicklungspfad in drei Phasen:
- Phase 1: Der Riese – DeepSeek V4 Flash beginnt als großes Mixture-of-Experts-Modell, das remote bedient wird.
- Phase 2: Der Zusammenbruch – Asymmetrische Quantisierung zielt auf die weitergeleiteten Experten ab, während wichtige Pfade erhalten bleiben, wodurch das Modell auf High-Memory-Maschinen praktikabel wird.
- Phase 3: Der Zwergstern – Die lokale Engine stellt eine CLI, HTTP-APIs und einen nativen Agenten bereit, die alle denselben Modellstatus und Cache teilen.
Wie es funktioniert
DwarfStar 4 funktioniert nicht als gewöhnlicher GGUF-Runner. Stattdessen verlässt es sich auf eine begrenzte Auswahl von Modellfamilien und testet jedes unterstützte Layout von Anfang bis Ende. Der Ansatz beinhaltet das Beibehalten langer Präfixe auf SSDs und das Neustarten basierend auf dem Prompt-Hash, was bedeutet, dass eine Sitzung ohne Wiederholung des gesamten anfänglichen Setups fortgesetzt werden kann.
Eine eigenständige Engine bildet den Kern der Architektur, gepaart mit agentenorientierten Schnittstellen, während Project GGUFs als Grundlage dient, alles verifiziert anhand offizieller Modellausgaben.
Running It Yourself
Der Prozess ist einfach:
- Fetch the weights using the
./download_model.shscript. - Build for your backend using
make. - Sprechen Sie mit dem Modell über die Befehlszeile oder starten Sie den Server.
Eine Vergleichstabelle liefert die Zahlen hinter dem Projekt, und darunter befindet sich die Zeile „M5 MAX 128GB“ mit einem 32K CTX-Wert sowie einer Generierungsrate von 34,4 T/S und einer Vorlade-Rate von 557 T/S. Der vollständige Leitfaden ist unter Hardware und Installation zu finden.
Designentscheidungen
Der springende Punkt von DwarfStar 4 wird klar dargelegt und in mehreren Abschnitten wiederholt: Betreiben Sie Modelle lokal, ohne Anfragen an einen entfernten Server zu senden. Die Software komprimiert die gerouteten Experten in einem Mixture-of-Experts-Modell, während sie gleichzeitig kritische Shared Paths präzise hält.
Dieser Abschnitt erläutert die Designentscheidungen: Die Software beschränkt sich auf eine begrenzte Anzahl von Modellfamilien und überprüft jede Konfiguration von Anfang bis Ende, anstatt sich auf einen generischen GGUF-Runner zu verlassen.
DwarfStar 4 ist ein funktionierender lokaler Modellstapel von einem Team mit Erfahrung in verteilten Systemen.
Quelle: „Vom Schöpfer von Redis; betreiben Sie LLM lokal mit ds4“, dwarfstar.sh.
Das Notizbuch abonnieren.
Die besten Geschichten des Tages und jedes neue Urteil, in klarem Deutsch, um sieben im Postfach. Eine Mail am Tag, nicht mehr.

