Needle 2 im Test: 14MB-Modell startet lokalen KI-Agenten ohne GPU

Needle 2 im Test: 14MB-Modell startet lokalen KI-Agenten ohne GPU

Needle 2 im Test: 14MB-Modell startet lokalen KI-Agenten ohne GPU

Während die gesamte KI-Branche hunderte Milliarden Parameter großen Modellen hinterherjagt, geht ein Unternehmen namens Cactus Compute den genau gegenteiligen Weg — ihr neu veröffentlichtes Needle 2 ist ein Modell mit nur 45M Parametern und 14MB Größe, das dennoch einen vollständigen KI-Agenten mit 500 Token pro Sekunde auf einem Raspberry Pi ausführt.

Dies ist kein Laborkonzept. Needle 2 wird bereits kommerziell im Pebble Index 01 Smart-Ring eingesetzt, wo Benutzer mit dem Ring sprechen und Geräteaktionen ohne Internetverbindung auslösen.

Was ist Needle 2?

Needle 2 ist ein Open-Source-Edge-Agent-Modell von Cactus Compute. Ihre Kernphilosophie: Nicht jede KI-Aufgabe braucht ein großes Modell — in vielen Szenarien ist ein ausreichend kleines und schnelles spezialisiertes Modell tatsächlich besser.

Needle 2 macht genau drei Dinge:

  1. Tool Calling: Bildet natürliche Sprachanweisungen auf spezifische Funktionsaufrufe ab
  2. Device Use: Führt UI-Aktionssequenzen auf Mobilgeräten aus
  3. Structured Extraction: Extrahiert schema-konforme strukturierte Daten aus Text

In einem Satz: Needle 2 ist keine „dialogische KI” — es ist eine „Aktions-KI.”

Technische Daten

KennzahlNeedle 2Hinweis
Parameter45M45 Millionen Parameter
Modellgröße14 MBEinzelne Binärdatei
Laufzeit-RAM28 MBSpitzenwert Sitzungsspeicher
GPU erforderlichKeineReine CPU-Inferenz
QuantisierungCQ2-bitProprietäre 2-Bit-Quantisierung
Kontextfenster256 TokenSliding Window, Tool-Deklarationen fixiert
Dekodiergeschwindigkeit (RPi 5)500+ tok/sNur CPU
LizenzMITVollständig Open Source

Architektur: Simple Attention Network

Die wichtigsten Innovationen:

1. Hadamard MLP ersetzt traditionelle FFN — Kanalmischung bei nahezu null Parameter-Kosten.

2. Engram-Speichersystem — Weltwissen lebt in gehashten n-gram-Tabellen, nicht in Modellgewichten.

3. Train = Quantize — Needle 2 wird von Anfang bis Ende bei CQ2-bit-Präzision trainiert. Das 2-Bit-Modell, das Sie bereitstellen, IST das trainierte Modell.

Vergleich mit Modellen gleicher Klasse

ModellParameterGrößeRAMTool CallDevice UseOpen Source
Needle 245M14 MB28 MBMIT
FunctionGemma 270M270M~540 MB~1 GB
LFM2.5 230M230M~460 MB~800 MB
Apple Foundation ModelUnbekannt~hunderte MB~hunderte MB

Schnellstart

pip install cactus-needle
import needle

@needle.tool
def get_weather(city: str):
    """Aktuelles Wetter für eine Stadt abrufen."""
    return {"city": city, "temp_c": 27, "sky": "klar"}

agent = needle.Needle(tools=[get_weather])
print(agent.run("Wie ist das Wetter in Lagos?")["results"])

Einsatzszenarien und Einschränkungen

✅ Geeignet für

  • Smart-Home-Sprachsteuerung
  • Wearables (Uhren, Ringe)
  • Offline-Geräte mit lokaler Inferenz
  • IoT-Geräte (21 Mrd.+ Geräte, meist < 100MB RAM)
  • Browser-basierte KI via WebAssembly

❌ Nicht geeignet für

  • Offene Konversation
  • Lange Dokumentenverarbeitung
  • Weltwissen-Fragen
  • Komplexe Schlussfolgerungen

Fazit

DimensionBewertung
Technische Innovation⭐⭐⭐⭐⭐
Praxistauglichkeit⭐⭐⭐⭐
Open-Source-Engagement⭐⭐⭐⭐⭐
Preis-Leistung⭐⭐⭐⭐⭐

Needle 2 versucht nicht, das große Modell auf Ihrem Computer zu ersetzen — es gibt Geräten, die noch nie KI hatten, erstmals die Fähigkeit, intelligent zu sein.


FAQ

Was ist der Unterschied zwischen Needle 2 und Needle 1?

Needle 2 erhöht die Parameter von 26M auf 45M, fügt Geräte-Steuerung und strukturierte Extraktion hinzu und bietet Tool-Retrieval sowie Confidence-Gating.

Kann Needle 2 auf einem Handy laufen?

Ja. Auf Samsung A-Series Handys unter 200$ beträgt die Dekodiergeschwindigkeit 300-700 tok/s.

Braucht Needle 2 eine GPU?

Überhaupt nicht. Reine CPU-Inferenz, 500+ tok/s auf einem Raspberry Pi 5.

Wie feinabstimme ich Needle 2?

Mit pip install cactus-needle, dann LoRA-Feinabstimmung: JSONL-Daten vorbereiten → needle finetuneneedle build.

Was kann Needle 2 nicht?

Keine offene Konversation, kein Weltwissen, keine komplexe Schlussfolgerung. Es ist eine „Aktions-KI”, keine „dialogische KI”.