一、準備工作
硬體要求
- 樹莓派5:推薦8GB或16GB記憶體版本
- 儲存裝置:至少32GB高速MicroSD卡(建議使用A2級)
- 散熱方案:主動散熱風扇或金屬散熱殼(持續高負載易發熱)
- 電源:官方27W PD電源(5V 5A)
軟體準備
- 刷寫64位系統:
- 首次啟動配置:
sudo raspi-config # 啟用SSH/VNC,擴充套件檔案系統,設定SWAP為2048MB
二、系統最佳化設定
1. 基礎配置
sudo apt update && sudo apt full-upgrade -y
sudo apt install -y git curl python3-pip cmake
2. 記憶體最佳化
編輯SWAP配置:
sudo nano /etc/dphys-swapfile
# 修改為:CONF_SWAPSIZE=2048
sudo systemctl restart dphys-swapfile
3. 啟用GPU加速
sudo usermod -aG render pi
echo "dtoverlay=vc4-kms-v3d" | sudo tee -a /boot/config.txt
sudo reboot
三、建立Python虛擬環境
mkdir ~/deepseek_deploy && cd ~/deepseek_deploy
python3 -m venv venv
source venv/bin/activate
四、安裝Ollama推理框架
安裝ARM64版本
curl -fsSL https://ollama.com/install.sh | sh
五、模型部署實戰
方案A:直接執行官方模型
# 1.5B基礎版(推薦入門使用)
ollama run deepseek-r1:1.5b
# 執行測試
>>> 樹莓派是什麼?
方案B:自訂量化模型
-
下載GGUF格式模型:
wget https://huggingface.co/TheBloke/DeepSeek-R1-Distill-Llama-8B-GGUF/resolve/main/deepseek-r1-distill-llama-8b.Q4_K_M.gguf -
建立Modelfile:
tee Modelfile <<EOF FROM ./deepseek-r1-distill-llama-8b.Q4_K_M.gguf PARAMETER num_ctx 2048 PARAMETER num_gqa 8 EOF -
匯入並執行:
ollama create deepseek-custom -f Modelfile ollama run deepseek-custom
六、效能最佳化技巧
1. 速度提升方案
# 設定CPU優先順序
sudo nice -n -20 ollama run deepseek-r1:1.5b
# 使用Metal著色器(GPU加速)
export OLLAMA_LLM_METAL=1
2. 記憶體最佳化配置
# 限制並行處理數
export OLLAMA_NUM_PARALLEL=1
3. 量化模型選擇建議
| 模型規格 | 記憶體佔用 | 推理速度 | 精度保持 |
|---|---|---|---|
| Q2_K | 3.2GB | 8.5tok/s | 60% |
| Q4_K_M | 4.8GB | 5.2tok/s | 80% |
| Q6_K | 6.4GB | 3.1tok/s | 90% |
七、進階使用技巧
1. API服務部署
ollama serve & # 後臺執行服務
curl http://localhost:11434/api/generate -d '{
"model": "deepseek-custom",
"prompt": "樹莓派5的效能特點",
"stream": false
}'
2. 中文最佳化提示詞
template = """[INST] <<SYS>>
你是一個執行在樹莓派上的AI助手,請用簡明中文回答。
當前系統時間:{time}
<</SYS>>
{query} [/INST]"""
八、常見問題排查
1. 記憶體不足錯誤
# 檢視記憶體狀態
free -h
# 解決方案:
# 1. 使用更低量化的模型
# 2. 增加SWAP空間
sudo dphys-swapfile swapoff
sudo nano /etc/dphys-swapfile # 修改為4096
sudo dphys-swapfile setup
sudo dphys-swapfile swapon
2. 響應速度慢
# 監控CPU頻率
watch -n 1 "vcgencmd measure_clock arm"
# 確保CPU滿頻執行
sudo apt install cpufrequtils
sudo cpufreq-set -g performance
九、效能實測資料
| 測試場景 | 1.5B模型 | 8B-Q4模型 |
|---|---|---|
| 中文問答響應時間 | 2.4s | 8.7s |
| 程式碼生成速度 | 5tok/s | 1.8tok/s |
| 連續對話輪次 | 12輪 | 5輪 |
| 記憶體峰值佔用 | 1.8GB | 5.3GB |
十、應用場景建議
- 智慧家居中控:結合Home Assistant實現語音控制
- 程式設計學習助手:透過VS Code遠端開發除錯
- 教育機器人:配合攝影機實現視覺問答
- 邊緣AI實驗:LoRA微調測試平臺