Needle 2 실측: 14MB 모델로 GPU 없이 로컬 AI 에이전트 실행

Needle 2 실측: 14MB 모델로 GPU 없이 로컬 AI 에이전트 실행

Needle 2 실측: 14MB 모델로 GPU 없이 로컬 AI 에이전트 실행

전체 AI 산업이 수천억 파라미터의 거대 모델을 추적하는 동안, Cactus Compute라는 회사는 정반대의 길을 걸었습니다. 그들이 출시한 Needle 2는 단 45M 파라미터, 14MB 크기의 모델이지만, 라즈베리파이에서 초당 500토큰의 속도로 완전한 AI 에이전트를 실행합니다.

이것은 실험실 개념 검증이 아닙니다. Needle 2는 이미 Pebble Index 01 스마트 링에 상용 배포되어, 인터넷 연결 없이 음성으로 기기 작업을 트리거할 수 있습니다.

Needle 2란?

Needle 2는 Cactus Compute에서 개발한 오픈소스 엣지 에이전트 모델입니다. 정확히 세 가지만 합니다:

  1. 도구 호출 (Tool Calling): 자연어 지시를 특정 함수 호출로 매핑
  2. 기기 제어 (Device Use): 모바일 기기에서 UI 작업 시퀀스 실행
  3. 구조화 추출 (Structured Extraction): 스키마에 맞는 구조화된 데이터를 텍스트에서 추출

한 마디로: Needle 2는 “대화 AI”가 아니라 “액션 AI”입니다.

핵심 사양

항목Needle 2비고
파라미터45M4500만 파라미터
모델 크기14 MB단일 바이너리 파일
실행 RAM28 MB피크 세션 RAM
GPU 필요없음순수 CPU 추론
양자화CQ2-bit독자적 2-bit 양자화
디코드 속도 (RPi 5)500+ tok/sCPU만
라이선스MIT완전 오픈소스

아키텍처: Simple Attention Network

주요 혁신:

1. Hadamard MLP — 기존 FFN을 대체하여 거의 제로 파라미터 비용으로 채널 혼합.

2. Engram 메모리 시스템 — 세계 지식은 모델 가중치가 아닌 해시 n-gram 테이블에 저장.

3. 훈련 = 양자화 — Needle 2는 사전훈련부터 사후훈련까지 CQ2-bit 정밀도로 훈련됩니다. 배포하는 2-bit 모델이 곧 훈련된 모델입니다.

동급 모델 비교

모델파라미터크기RAM도구 호출기기 제어오픈소스
Needle 245M14 MB28 MBMIT
FunctionGemma 270M270M~540 MB~1 GB
LFM2.5 230M230M~460 MB~800 MB
Apple Foundation Model미공개~수백 MB~수백 MB

빠른 시작

pip install cactus-needle
import needle

@needle.tool
def get_weather(city: str):
    """도시의 현재 날씨를 가져옵니다."""
    return {"city": city, "temp_c": 27, "sky": "맑음"}

agent = needle.Needle(tools=[get_weather])
print(agent.run("라고스의 날씨는 어때?")["results"])

사용 사례와 한계

✅ 적합한 경우

  • 스마트홈 음성 제어
  • 웨어러블 기기 (시계, 링)
  • 오프라인 기기의 로컬 추론
  • IoT 기기 (21억 대 이상, 대부분 RAM 100MB 미만)
  • WebAssembly 기반 브라우저 AI

❌ 적합하지 않은 경우

  • 개방형 대화
  • 긴 문서 이해
  • 세계 지식 질의응답
  • 복잡한 추론

종합 평가

항목평가
기술 혁신⭐⭐⭐⭐⭐
실용성⭐⭐⭐⭐
오픈소스 기여⭐⭐⭐⭐⭐
가성비⭐⭐⭐⭐⭐

Needle 2는 컴퓨터의 대형 모델을 대체하려는 것이 아니라, AI를 가져본 적 없는 기기에게 처음으로 지능을 부여하는 것입니다.


FAQ

Needle 2와 Needle 1의 차이점은?

Needle 2는 파라미터를 26M에서 45M으로 늘리고, 기기 제어와 구조화 추출을 추가했으며, 도구 검색과 신뢰도 게이팅을 새로 탑재했습니다.

Needle 2가 스마트폰에서 실행되나요?

네. 200달러 이하의 Samsung A 시리즈에서 300-700 tok/s의 디코드 속도.

Needle 2에 GPU가 필요한가요?

전혀 필요 없습니다. 순수 CPU 추론으로 라즈베리파이 5에서 500+ tok/s.

Needle 2 파인튜닝 방법은?

pip install cactus-needle 설치 후 LoRA 파인튜닝: JSONL 데이터 준비 → needle finetuneneedle build.

Needle 2가 할 수 없는 것은?

개방형 대화, 세계 지식, 복잡한 추론 불가. “액션 AI”이지 “대화 AI”가 아닙니다.