Needle 2 実践レビュー:14MBモデルでGPU不要のローカルAIエージェント

Needle 2 実践レビュー:14MBモデルでGPU不要のローカルAIエージェント

Needle 2 実践レビュー:14MBモデルでGPU不要のローカルAIエージェント

AI業界全体が数千億パラメータの巨大モデルを追い求める中、Cactus Computeという企業は全く逆の道を歩んでいます。彼らがリリースしたNeedle 2は、わずか45Mパラメータ・14MBのモデルでありながら、Raspberry Pi上で秒間500トークンの速度で完全なAIエージェントを実行できます。

これは実験室の概念実証ではありません。Needle 2はすでにPebble Index 01スマートリングで商用展開されており、インターネット接続なしで音声からデバイスを操作できます。

Needle 2とは?

Needle 2はCactus Computeが開発したオープンソースのエッジエージェントモデルです。正確に3つのことだけを行います:

  1. ツール呼び出し(Tool Calling):自然言語指示を特定の関数呼び出しにマッピング
  2. デバイス制御(Device Use):モバイルデバイス上でUI操作シーケンスを実行
  3. 構造化抽出(Structured Extraction):スキーマに準拠した構造化データをテキストから抽出

一言で:Needle 2は「対話AI」ではなく「アクションAI」です。

主要スペック

項目Needle 2備考
パラメータ数45M4500万パラメータ
モデルサイズ14 MB単一バイナリファイル
実行時RAM28 MBピークセッションRAM
GPU要否なしCPU推論のみ
量子化CQ2-bit独自2-bit量子化
デコード速度(RPi 5)500+ tok/sCPUのみ
ライセンスMIT完全オープンソース

アーキテクチャ:Simple Attention Network

主要な革新:

1. Hadamard MLP — 従来のFFNを置き換え、ほぼゼロのパラメータコストでチャネル混合を実現。

2. Engramメモリシステム — 世界知識はモデル重みではなくハッシュ化n-gramテーブルに格納。

3. 訓練=量子化 — Needle 2は事前訓練から後訓練までCQ2-bit精度で訓練されます。デプロイする2-bitモデルは訓練されたモデルそのものです。

同レベルモデルとの比較

モデルパラメータサイズRAMツール呼出デバイス制御OSS
Needle 245M14 MB28 MBMIT
FunctionGemma 270M270M~540 MB~1 GB
LFM2.5 230M230M~460 MB~800 MB
Apple Foundation Model非公表~数百MB~数百MB

クイックスタート

pip install cactus-needle
import needle

@needle.tool
def get_weather(city: str):
    """都市の現在の天気を取得する。"""
    return {"city": city, "temp_c": 27, "sky": "晴れ"}

agent = needle.Needle(tools=[get_weather])
print(agent.run("ラゴスの天気は?")["results"])

用途と限界

✅ 適している用途

  • スマートホーム音声制御
  • ウェアラブルデバイス(時計、リング)
  • オフラインデバイスのローカル推論
  • IoTデバイス(21億台以上、ほとんどがRAM 100MB未満)
  • WebAssemblyによるブラウザ内AI

❌ 適していない用途

  • オープンな会話
  • 長文ドキュメント理解
  • 世界知識の質問応答
  • 複雑な推論

総合評価

項目評価
技術革新⭐⭐⭐⭐⭐
実用性⭐⭐⭐⭐
OSSへの貢献⭐⭐⭐⭐⭐
コスパ⭐⭐⭐⭐⭐

Needle 2はコンピュータ上の大規模モデルを置き換えようとしているのではなく、AIを持ったことのないデバイスに初めて知能を与えるものです。


FAQ

Needle 2とNeedle 1の違いは?

Needle 2はパラメータを26Mから45Mに増やし、デバイス制御と構造化抽出を追加。ツール検索と信頼度ゲーティングも新搭載。

Needle 2はスマホで動きますか?

はい。200ドル以下のSamsung Aシリーズで300-700 tok/sのデコード速度。

Needle 2にGPUは必要ですか?

全く不要。CPU推論のみでRaspberry Pi 5で500+ tok/s。

Needle 2のファインチューニング方法は?

pip install cactus-needleの後、LoRAファインチューニング:JSONLデータ準備 → needle finetuneneedle build

Needle 2にできないことは?

オープンな会話、世界知識、複雑な推論は不可。「アクションAI」であり「対話AI」ではありません。