Needle 2 im Test: 14MB-Modell startet lokalen KI-Agenten ohne GPU
Während die gesamte KI-Branche hunderte Milliarden Parameter großen Modellen hinterherjagt, geht ein Unternehmen namens Cactus Compute den genau gegenteiligen Weg — ihr neu veröffentlichtes Needle 2 ist ein Modell mit nur 45M Parametern und 14MB Größe, das dennoch einen vollständigen KI-Agenten mit 500 Token pro Sekunde auf einem Raspberry Pi ausführt.
Dies ist kein Laborkonzept. Needle 2 wird bereits kommerziell im Pebble Index 01 Smart-Ring eingesetzt, wo Benutzer mit dem Ring sprechen und Geräteaktionen ohne Internetverbindung auslösen.
Was ist Needle 2?
Needle 2 ist ein Open-Source-Edge-Agent-Modell von Cactus Compute. Ihre Kernphilosophie: Nicht jede KI-Aufgabe braucht ein großes Modell — in vielen Szenarien ist ein ausreichend kleines und schnelles spezialisiertes Modell tatsächlich besser.
Needle 2 macht genau drei Dinge:
- Tool Calling: Bildet natürliche Sprachanweisungen auf spezifische Funktionsaufrufe ab
- Device Use: Führt UI-Aktionssequenzen auf Mobilgeräten aus
- Structured Extraction: Extrahiert schema-konforme strukturierte Daten aus Text
In einem Satz: Needle 2 ist keine „dialogische KI” — es ist eine „Aktions-KI.”
Technische Daten
| Kennzahl | Needle 2 | Hinweis |
|---|---|---|
| Parameter | 45M | 45 Millionen Parameter |
| Modellgröße | 14 MB | Einzelne Binärdatei |
| Laufzeit-RAM | 28 MB | Spitzenwert Sitzungsspeicher |
| GPU erforderlich | Keine | Reine CPU-Inferenz |
| Quantisierung | CQ2-bit | Proprietäre 2-Bit-Quantisierung |
| Kontextfenster | 256 Token | Sliding Window, Tool-Deklarationen fixiert |
| Dekodiergeschwindigkeit (RPi 5) | 500+ tok/s | Nur CPU |
| Lizenz | MIT | Vollständig Open Source |
Architektur: Simple Attention Network
Die wichtigsten Innovationen:
1. Hadamard MLP ersetzt traditionelle FFN — Kanalmischung bei nahezu null Parameter-Kosten.
2. Engram-Speichersystem — Weltwissen lebt in gehashten n-gram-Tabellen, nicht in Modellgewichten.
3. Train = Quantize — Needle 2 wird von Anfang bis Ende bei CQ2-bit-Präzision trainiert. Das 2-Bit-Modell, das Sie bereitstellen, IST das trainierte Modell.
Vergleich mit Modellen gleicher Klasse
| Modell | Parameter | Größe | RAM | Tool Call | Device Use | Open Source |
|---|---|---|---|---|---|---|
| Needle 2 | 45M | 14 MB | 28 MB | ✅ | ✅ | MIT |
| FunctionGemma 270M | 270M | ~540 MB | ~1 GB | ✅ | ❌ | ✅ |
| LFM2.5 230M | 230M | ~460 MB | ~800 MB | ✅ | ❌ | ✅ |
| Apple Foundation Model | Unbekannt | ~hunderte MB | ~hunderte MB | ✅ | ✅ | ❌ |
Schnellstart
pip install cactus-needle
import needle
@needle.tool
def get_weather(city: str):
"""Aktuelles Wetter für eine Stadt abrufen."""
return {"city": city, "temp_c": 27, "sky": "klar"}
agent = needle.Needle(tools=[get_weather])
print(agent.run("Wie ist das Wetter in Lagos?")["results"])
Einsatzszenarien und Einschränkungen
✅ Geeignet für
- Smart-Home-Sprachsteuerung
- Wearables (Uhren, Ringe)
- Offline-Geräte mit lokaler Inferenz
- IoT-Geräte (21 Mrd.+ Geräte, meist < 100MB RAM)
- Browser-basierte KI via WebAssembly
❌ Nicht geeignet für
- Offene Konversation
- Lange Dokumentenverarbeitung
- Weltwissen-Fragen
- Komplexe Schlussfolgerungen
Fazit
| Dimension | Bewertung |
|---|---|
| Technische Innovation | ⭐⭐⭐⭐⭐ |
| Praxistauglichkeit | ⭐⭐⭐⭐ |
| Open-Source-Engagement | ⭐⭐⭐⭐⭐ |
| Preis-Leistung | ⭐⭐⭐⭐⭐ |
Needle 2 versucht nicht, das große Modell auf Ihrem Computer zu ersetzen — es gibt Geräten, die noch nie KI hatten, erstmals die Fähigkeit, intelligent zu sein.
FAQ
Was ist der Unterschied zwischen Needle 2 und Needle 1?
Needle 2 erhöht die Parameter von 26M auf 45M, fügt Geräte-Steuerung und strukturierte Extraktion hinzu und bietet Tool-Retrieval sowie Confidence-Gating.
Kann Needle 2 auf einem Handy laufen?
Ja. Auf Samsung A-Series Handys unter 200$ beträgt die Dekodiergeschwindigkeit 300-700 tok/s.
Braucht Needle 2 eine GPU?
Überhaupt nicht. Reine CPU-Inferenz, 500+ tok/s auf einem Raspberry Pi 5.
Wie feinabstimme ich Needle 2?
Mit pip install cactus-needle, dann LoRA-Feinabstimmung: JSONL-Daten vorbereiten → needle finetune → needle build.
Was kann Needle 2 nicht?
Keine offene Konversation, kein Weltwissen, keine komplexe Schlussfolgerung. Es ist eine „Aktions-KI”, keine „dialogische KI”.