Needle 2 실측: 14MB 모델로 GPU 없이 로컬 AI 에이전트 실행
전체 AI 산업이 수천억 파라미터의 거대 모델을 추적하는 동안, Cactus Compute라는 회사는 정반대의 길을 걸었습니다. 그들이 출시한 Needle 2는 단 45M 파라미터, 14MB 크기의 모델이지만, 라즈베리파이에서 초당 500토큰의 속도로 완전한 AI 에이전트를 실행합니다.
이것은 실험실 개념 검증이 아닙니다. Needle 2는 이미 Pebble Index 01 스마트 링에 상용 배포되어, 인터넷 연결 없이 음성으로 기기 작업을 트리거할 수 있습니다.
Needle 2란?
Needle 2는 Cactus Compute에서 개발한 오픈소스 엣지 에이전트 모델입니다. 정확히 세 가지만 합니다:
- 도구 호출 (Tool Calling): 자연어 지시를 특정 함수 호출로 매핑
- 기기 제어 (Device Use): 모바일 기기에서 UI 작업 시퀀스 실행
- 구조화 추출 (Structured Extraction): 스키마에 맞는 구조화된 데이터를 텍스트에서 추출
한 마디로: Needle 2는 “대화 AI”가 아니라 “액션 AI”입니다.
핵심 사양
| 항목 | Needle 2 | 비고 |
|---|---|---|
| 파라미터 | 45M | 4500만 파라미터 |
| 모델 크기 | 14 MB | 단일 바이너리 파일 |
| 실행 RAM | 28 MB | 피크 세션 RAM |
| GPU 필요 | 없음 | 순수 CPU 추론 |
| 양자화 | CQ2-bit | 독자적 2-bit 양자화 |
| 디코드 속도 (RPi 5) | 500+ tok/s | CPU만 |
| 라이선스 | MIT | 완전 오픈소스 |
아키텍처: Simple Attention Network
주요 혁신:
1. Hadamard MLP — 기존 FFN을 대체하여 거의 제로 파라미터 비용으로 채널 혼합.
2. Engram 메모리 시스템 — 세계 지식은 모델 가중치가 아닌 해시 n-gram 테이블에 저장.
3. 훈련 = 양자화 — Needle 2는 사전훈련부터 사후훈련까지 CQ2-bit 정밀도로 훈련됩니다. 배포하는 2-bit 모델이 곧 훈련된 모델입니다.
동급 모델 비교
| 모델 | 파라미터 | 크기 | RAM | 도구 호출 | 기기 제어 | 오픈소스 |
|---|---|---|---|---|---|---|
| Needle 2 | 45M | 14 MB | 28 MB | ✅ | ✅ | MIT |
| FunctionGemma 270M | 270M | ~540 MB | ~1 GB | ✅ | ❌ | ✅ |
| LFM2.5 230M | 230M | ~460 MB | ~800 MB | ✅ | ❌ | ✅ |
| Apple Foundation Model | 미공개 | ~수백 MB | ~수백 MB | ✅ | ✅ | ❌ |
빠른 시작
pip install cactus-needle
import needle
@needle.tool
def get_weather(city: str):
"""도시의 현재 날씨를 가져옵니다."""
return {"city": city, "temp_c": 27, "sky": "맑음"}
agent = needle.Needle(tools=[get_weather])
print(agent.run("라고스의 날씨는 어때?")["results"])
사용 사례와 한계
✅ 적합한 경우
- 스마트홈 음성 제어
- 웨어러블 기기 (시계, 링)
- 오프라인 기기의 로컬 추론
- IoT 기기 (21억 대 이상, 대부분 RAM 100MB 미만)
- WebAssembly 기반 브라우저 AI
❌ 적합하지 않은 경우
- 개방형 대화
- 긴 문서 이해
- 세계 지식 질의응답
- 복잡한 추론
종합 평가
| 항목 | 평가 |
|---|---|
| 기술 혁신 | ⭐⭐⭐⭐⭐ |
| 실용성 | ⭐⭐⭐⭐ |
| 오픈소스 기여 | ⭐⭐⭐⭐⭐ |
| 가성비 | ⭐⭐⭐⭐⭐ |
Needle 2는 컴퓨터의 대형 모델을 대체하려는 것이 아니라, AI를 가져본 적 없는 기기에게 처음으로 지능을 부여하는 것입니다.
FAQ
Needle 2와 Needle 1의 차이점은?
Needle 2는 파라미터를 26M에서 45M으로 늘리고, 기기 제어와 구조화 추출을 추가했으며, 도구 검색과 신뢰도 게이팅을 새로 탑재했습니다.
Needle 2가 스마트폰에서 실행되나요?
네. 200달러 이하의 Samsung A 시리즈에서 300-700 tok/s의 디코드 속도.
Needle 2에 GPU가 필요한가요?
전혀 필요 없습니다. 순수 CPU 추론으로 라즈베리파이 5에서 500+ tok/s.
Needle 2 파인튜닝 방법은?
pip install cactus-needle 설치 후 LoRA 파인튜닝: JSONL 데이터 준비 → needle finetune → needle build.
Needle 2가 할 수 없는 것은?
개방형 대화, 세계 지식, 복잡한 추론 불가. “액션 AI”이지 “대화 AI”가 아닙니다.