Un nuevo motor de inferencia local llamado DwarfStar 4, o ds4, permite a los usuarios ejecutar grandes modelos de IA en sus propias máquinas en lugar de enviar solicitudes a un servidor distante. El proyecto es del creador de Redis.
Lo que hace DwarfStar 4
El motor DwarfStar 4 se ejecuta en sistemas Mac con abundante memoria, junto con hardware CUDA y ROCm, y funciona con DeepSeek V4 y V4.1 Flash, GLM 5.x y Qwen3.8 Flash Next, incluyendo modelos de texto y visión, APIs locales, una interfaz de línea de comandos y un agente nativo todo en un solo paquete. Este motor de inferencia opera dentro de un estrecho marco de C y se distribuye bajo la Licencia MIT.
La compresión está en el centro del diseño. El software comprime los expertos enrutados dentro de un modelo de mezcla de expertos, al tiempo que preserva los caminos compartidos que más importan. Esto es lo que hace que las compilaciones enrutadas de MoE compatibles coincidan con sus máquinas de destino.
Las Tres Fases
El proyecto divide su camino de desarrollo en tres fases:
- Fase 1: El Gigante — DeepSeek V4 Flash comienza como un gran modelo de mezcla de expertos servido de forma remota.
- Fase 2: El Colapso — La cuantificación asimétrica se dirige a los expertos enrutados al tiempo que preserva los caminos críticos, lo que hace que el modelo sea práctico en máquinas con mucha memoria.
- Fase 3: La Estrella Enana — El motor local expone una CLI, APIs HTTP y un agente nativo, todos compartiendo el mismo estado del modelo y caché.
Cómo Funciona
DwarfStar 4 no funciona como un corredor GGUF ordinario. En cambio, se basa en una selección limitada de familias de modelos y prueba cada diseño compatible de principio a fin. El enfoque incluye mantener prefijos largos en SSD y reiniciar en función del hash de la solicitud, lo que significa que una sesión se puede retomar sin repetir toda la configuración inicial.
Un motor autocontenido se encuentra en el núcleo de la arquitectura, junto con interfaces orientadas a agentes, mientras que el Proyecto GGUFs sirve como base, todo verificado contra las salidas oficiales del modelo.
Ejecútelo usted mismo )
El proceso es simple: )
- Fetch the weights using the
./download_model.shscript. - Build for your backend using
make. - Hable con el modelo a través de la CLI o inicie el servidor. )
Una tabla de referencia ofrece los números detrás del proyecto, y entre ellos se encuentra la fila de referencia M5 MAX 128GB, que lleva una cifra de CTX de 32K junto con una tasa de generación de 34.4 T/S y una tasa de precarga de 557 T/S. La guía completa se encuentra en Hardware e Instalación. )
Decisiones de diseño )
El punto fundamental de DwarfStar 4 se establece claramente y se repite en varias secciones: ejecutar modelos localmente sin enviar solicitudes a un servidor distante. El software comprime los expertos enrutable en un modelo de mezcla de expertos al tiempo que mantiene precisas las rutas compartidas críticas. )
Esta sección describe las decisiones de diseño: el software se adhiere a un número limitado de familias de modelos y verifica cada disposición de principio a fin, en lugar de depender de un corredor GGUF genérico. )
DwarfStar 4 es una pila de modelos local funcional de un equipo con un historial en sistemas distribuidos. )
Material fuente: «Del creador de Redis; ejecute LLM localmente con ds4», dwarfstar.sh. )
Recibe El Cuaderno.
Las mejores historias del día y cada veredicto nuevo, en español claro, en tu correo a las siete. Un correo al día, nada más.

