Cactus hat Needle 3 veröffentlicht, ein Basismodell, das einen kompletten KI-Assistenten in ein einzelnes 8-29-MB-Binärpaket packt. Das Unternehmen behauptet, es könne DeepSeek V4 Flash bei Extraktionsaufgaben übertreffen und Modelle, die zehnmal so groß sind, bei mobilen Tool-Aufrufen schlagen. Das Modell läuft auf einem Raspberry Pi und opfert allgemeine Chat-Fähigkeiten für fokussierte Leistung.
Die wichtigsten Fakten sind einfach zu nennen:
- Größe: 8-29 MB CQ2-Bit-Binärdatei, wobei Entwickler zwischen einem 2-Schichten- (2L) Subnetzwerk und einem 20-Schichten- (20L) Netzwerk wählen können
- Trainingsdaten: 360 Milliarden Tokens eines proprietären strukturierten Datensatzes
- Inferenz: 400-4k Tokens/s Decodierung und 1-10k Tokens/s Vorabfüllung auf einem Raspberry Pi 5
Was Needle 3 tatsächlich tut
Needle 3 erledigt drei Hauptaufgaben: Tool-Aufrufe, strukturierte Extraktion und Text-Einbettungen. Das Modell basiert auf einer Simple Attention Network-Architektur und ist auf CQ2-Bit-Tiefe quantisiert. Diese Komprimierung ist das gesamte Verkaufsargument: ein vollständiger KI-Assistent, der auf einem Mikrocontroller oder einem Wearable Platz findet, ohne eine Cloud-Verbindung zu benötigen.
Das Unternehmen präsentiert das Design als Intelligenz-Staffelung. Jede Schicht des Modells ist ein Subnetzwerk mit zunehmender Kapazität. Entwickler wählen die passende Größe aus dem kleinsten 2L-Subnetzwerk bis zum größten 20L-Subnetzwerk. Feinabstimmung wird unterstützt, sodass ein Vier-Schichten-Modell nach einer Epoche des Trainings für nachgelagerte Aufgaben DeepSeek V4 Flash erreichen kann.
Tool-Aufrufe und Extraktion
Das Hauptprinzip des Modells besteht darin, die richtige Funktion basierend auf der Benutzeranfrage auszuwählen. Das gegebene Beispiel beinhaltet ein Wetter-Tool, das mit einem Docstring und einer Funktionssignatur definiert ist. Der Assistent erkennt die Absicht, füllt die Argumente aus und gibt den Aufruf an den Code des Entwicklers zurück.
python
import needle @needle.tool def get_weather(city: str): "Get the current weather for a city." return {"city": city, "temp_c": 27, "sky": "clear"} agent = needle.Needle(tools=[get_weather]) print(agent.run("what's it like in Lagos right now?")["results"]) # [{'city': 'Lagos', 'temp_c': 27, 'sky': 'clear'}]
Wenn das Modell keine übereinstimmende Funktion findet, gibt es eine leere Liste zurück anstatt zu raten. Dieses Verhalten ist das ausdrückliche Versprechen des Unternehmens: keine Vermutungen, wenn kein Tool die Anfrage abdeckt.
Die Extraktion funktioniert in die entgegengesetzte Richtung. Anstatt eine Funktion aufzurufen, nimmt das Modell unstrukturierten Text entgegen und erzeugt eine strukturierte Ausgabe. Das Unternehmen sagt, die Decodiergrammatik garantiert, dass die Ausgabe analysiert, was bedeutet, dass das Ergebnis immer der deklarierten Form entspricht.
python
from pydantic import BaseModel class Invoice(BaseModel): vendor: str total: float due_date: str invoice = needle.extract("Invoice from Acme Corp, $1,200.00, due 2026-09-01", Invoice) print(invoice.vendor, invoice.total) # -> Acme Corp 1200.0
Das Beispiel zeigt, wie eine Rechnung aus einem String in ein typisiertes Objekt extrahiert wird. Das Modell verarbeitet Rechnungen, Buchungen, Benachrichtigungen und Formulare. Das Unternehmen weist außerdem darauf hin, dass das Extraktionsframework sich gut auf Klassifizierungsprobleme übertragen ließ.
Routing und Konfidenz
Jede Antwort enthält einen Konfidenzwert von einem kalibrierten Head. Der Engine wendet Gating automatisch an, obwohl der genaue Schwellenwert nicht angegeben wird. Das Unternehmen betont, dass eine gute Beschreibung von Werkzeugen das eigentliche Ziel ist.
Das Routing-System ermöglicht es Entwicklern, Anfragen mithilfe von regulären Ausdrücken bestimmten Funktionen zuzuordnen. Eine Übereinstimmung beschränkt die Dekodierung auf die übereinstimmenden Werkzeuge und erfordert einen Aufruf, sodass die Anfrage das benannte Werkzeug erreicht anstatt abgelehnt oder falsch geroutet zu werden. Das Beispiel zeigt ein Trigger-Muster, das gängige Wörter ausschließt, die andere Werkzeuge möglicherweise besitzen.
python
from typing import Literal @needle.tool(triggers=[r"\b(turn|switch|power|flip)\b.*\b(on|off)\b", r"\btoggle\b"]) def control_device(device: str, action: Literal["on", "off", "toggle"]): "Switch or toggle any named smart-home device." return {"device": device, "action": action} agent = needle.Needle(tools=[control_device, get_weather]) agent.complete("toggle the garage door") # function_calls [{"name": "control_device", "arguments": {"device": "garage door", "action": "toggle"}}]
Was es ausführt
Der Raspberry Pi 5 ist die Inferenzplattform. Das Modell läuft mit 400-4k Token pro Sekunde für die Dekodierung und 1-10k Token pro Sekunde für das Prefill. Das Unternehmen sagt, dass das Modell eine breite Palette von kleinen Geräten unterstützt, von Mikrocontrollern bis hin zu Smart-Home-Hubs.
Das Modell passt auf Geräte mit begrenztem Speicher. Die Beispiele des Unternehmens umfassen Telefone, Wearables, Roboter, Smart Homes, Autos und Computer. Die Embeddings ermöglichen lokale Suche und Alert-Merging, sodass eine Uhr nahezu doppelte Alerts zusammenführen kann, ohne etwas an die Cloud zu senden.
Los geht’s
Die Installation ist unkompliziert. Das Python-Paket lädt den Inferenz-Engine einmal von Hugging Face herunter und speichert ihn zwischen. Es gibt nichts weiter zu bauen. Das Unternehmen bezeichnet dies als ein Basismodell für Mobilgeräte, Wearables, Roboter, Smart Homes, Automobilanwendungen und Mikrocontroller.
Der Bereitstellungsprozess ist einfach. Das Modell liest Ihre Tool-Beschreibungen, wählt den richtigen Aufruf aus, füllt die Argumente aus und führt die Funktion aus. Das Ergebnis kommt als JSON mit den Ergebnissen des ausgeführten Tools zurück.
Der Beispiel-Workflow schließt den Loop ab: das Modell wählt den Aufruf aus, Needle führt die Funktion aus, speist das Ergebnis zurück und gibt die endgültige Antwort mit den Ergebnissen des ausgeführten Tools zurück.
Warum das wichtig ist
Die Behauptung ist gewagt: Ein Modell, das ein Zehntel der Größe seiner Konkurrenten hat, erreicht ihre Extraktionsleistung und übertrifft sie bei Tool-Aufrufen. Die Kalibrierung und das Gating bedeuten, dass das Modell weiß, wann es etwas nicht weiß. Das ist ein nützliches Merkmal für eingebettete Systeme, bei denen falsche Antworten schlimmer sind als keine Antworten.
Die Darstellung des Unternehmens ist pragmatisch. Dies ist kein allgemeines Konversationsmodell. Es ist ein Automatisierungsmodell, das natürliche Sprache auf bestimmte Aktionen abbildet. Die Tool-Call-Schnittstelle ist der entscheidende Punkt.
Der Raspberry Pi 5 Benchmark zeigt, dass das Modell mit 400-4k Token pro Sekunde für die Dekodierung und 1-10k Token pro Sekunde für das Prefill läuft. Ein Modell, das mit diesen Geschwindigkeiten auf einem Raspberry Pi läuft, kann Echtzeitinteraktionen auf einem Gerät unterstützen, das unter 100 US-Dollar kostet. Das ist eine niedrige Eintrittsbarriere.
Die Beispiele des Unternehmens zeigen das Modell in Aktion in jeder Kategorie, die es unterstützt. Ein intelligenter Home-Assistent kann das Schlafzimmer dimmen und verriegeln mit einem Befehl. Ein Roboter kann die Küche reinigen und das Schlafzimmer unberührt lassen. Ein Telefonassistent kann ein Album aus den Fotos vom letzten Wochenende erstellen oder den Bildschirm dimmen. Ein Wearable kann eine Kartenabrechnung in Händler, Betrag und Datum umwandeln. Eine AR-Brille kann von einer kurzen Anfrage aus navigieren. Ein Auto kann Klima, Medien, Navigation und Anrufe vom Innenraum aus steuern. Ein Computer kann einfache Sprachbefehle ausführen, wie z. B. das Verfassen einer E-Mail, das Starten eines Timers, das Kopieren einer Adresse oder das Öffnen eines Tabs.
Die Embeddings ermöglichen eine semantische Suche über Notizen, Nachrichten und Dokumente. Eine Abfrage wird mit dem passendsten von Hunderten von Tools abgeglichen. Nahezu identische Benachrichtigungen werden auf einer Watch zusammengeführt.
Needle 3 ist ein Basismodell für Mobilgeräte, Wearables, Roboter, Smart Homes, Automobile und Mikrocontroller. Es ist ein Modell, das auf einen Raspberry Pi passt und Modelle, die zehnmal so groß sind, bei mobilen Tool-Aufrufen übertrifft. Es ist ein Modell, das die allgemeine Chat-Kapazität gegen fokussierte Leistung eintauscht. Es ist ein Modell, das genau weiß, was es tun soll und es gut macht.
Quelle: „Show HN: Cactus Needle 3: 8-29MB Automatisierungsmodelle können DeepSeek V4 Flash abgleichen“, cactuscompute.com.
Das Notizbuch abonnieren.
Die besten Geschichten des Tages und jedes neue Urteil, in klarem Deutsch, um sieben im Postfach. Eine Mail am Tag, nicht mehr.

