Needle 2 実践レビュー:14MBモデルでGPU不要のローカルAIエージェント
AI業界全体が数千億パラメータの巨大モデルを追い求める中、Cactus Computeという企業は全く逆の道を歩んでいます。彼らがリリースしたNeedle 2は、わずか45Mパラメータ・14MBのモデルでありながら、Raspberry Pi上で秒間500トークンの速度で完全なAIエージェントを実行できます。
これは実験室の概念実証ではありません。Needle 2はすでにPebble Index 01スマートリングで商用展開されており、インターネット接続なしで音声からデバイスを操作できます。
Needle 2とは?
Needle 2はCactus Computeが開発したオープンソースのエッジエージェントモデルです。正確に3つのことだけを行います:
- ツール呼び出し(Tool Calling):自然言語指示を特定の関数呼び出しにマッピング
- デバイス制御(Device Use):モバイルデバイス上でUI操作シーケンスを実行
- 構造化抽出(Structured Extraction):スキーマに準拠した構造化データをテキストから抽出
一言で:Needle 2は「対話AI」ではなく「アクションAI」です。
主要スペック
| 項目 | Needle 2 | 備考 |
|---|---|---|
| パラメータ数 | 45M | 4500万パラメータ |
| モデルサイズ | 14 MB | 単一バイナリファイル |
| 実行時RAM | 28 MB | ピークセッションRAM |
| GPU要否 | なし | CPU推論のみ |
| 量子化 | CQ2-bit | 独自2-bit量子化 |
| デコード速度(RPi 5) | 500+ tok/s | CPUのみ |
| ライセンス | MIT | 完全オープンソース |
アーキテクチャ:Simple Attention Network
主要な革新:
1. Hadamard MLP — 従来のFFNを置き換え、ほぼゼロのパラメータコストでチャネル混合を実現。
2. Engramメモリシステム — 世界知識はモデル重みではなくハッシュ化n-gramテーブルに格納。
3. 訓練=量子化 — Needle 2は事前訓練から後訓練までCQ2-bit精度で訓練されます。デプロイする2-bitモデルは訓練されたモデルそのものです。
同レベルモデルとの比較
| モデル | パラメータ | サイズ | RAM | ツール呼出 | デバイス制御 | OSS |
|---|---|---|---|---|---|---|
| Needle 2 | 45M | 14 MB | 28 MB | ✅ | ✅ | MIT |
| FunctionGemma 270M | 270M | ~540 MB | ~1 GB | ✅ | ❌ | ✅ |
| LFM2.5 230M | 230M | ~460 MB | ~800 MB | ✅ | ❌ | ✅ |
| Apple Foundation Model | 非公表 | ~数百MB | ~数百MB | ✅ | ✅ | ❌ |
クイックスタート
pip install cactus-needle
import needle
@needle.tool
def get_weather(city: str):
"""都市の現在の天気を取得する。"""
return {"city": city, "temp_c": 27, "sky": "晴れ"}
agent = needle.Needle(tools=[get_weather])
print(agent.run("ラゴスの天気は?")["results"])
用途と限界
✅ 適している用途
- スマートホーム音声制御
- ウェアラブルデバイス(時計、リング)
- オフラインデバイスのローカル推論
- IoTデバイス(21億台以上、ほとんどがRAM 100MB未満)
- WebAssemblyによるブラウザ内AI
❌ 適していない用途
- オープンな会話
- 長文ドキュメント理解
- 世界知識の質問応答
- 複雑な推論
総合評価
| 項目 | 評価 |
|---|---|
| 技術革新 | ⭐⭐⭐⭐⭐ |
| 実用性 | ⭐⭐⭐⭐ |
| OSSへの貢献 | ⭐⭐⭐⭐⭐ |
| コスパ | ⭐⭐⭐⭐⭐ |
Needle 2はコンピュータ上の大規模モデルを置き換えようとしているのではなく、AIを持ったことのないデバイスに初めて知能を与えるものです。
FAQ
Needle 2とNeedle 1の違いは?
Needle 2はパラメータを26Mから45Mに増やし、デバイス制御と構造化抽出を追加。ツール検索と信頼度ゲーティングも新搭載。
Needle 2はスマホで動きますか?
はい。200ドル以下のSamsung Aシリーズで300-700 tok/sのデコード速度。
Needle 2にGPUは必要ですか?
全く不要。CPU推論のみでRaspberry Pi 5で500+ tok/s。
Needle 2のファインチューニング方法は?
pip install cactus-needleの後、LoRAファインチューニング:JSONLデータ準備 → needle finetune → needle build。
Needle 2にできないことは?
オープンな会話、世界知識、複雑な推論は不可。「アクションAI」であり「対話AI」ではありません。