這是 Jetson 本地 AI 的主指南。我把 NVIDIA Jetson Orin NX 16GB 當成一台可以長期開機的桌邊節點:底層用 CUDA 版 llama.cpp 提供模型服務,上面再接 Hermes Agent、搜尋與工具。這裡放的是架構與閱讀順序,細節各自寫在子文章裡。
先讀哪一篇
- 把 AI 放在桌邊運行:Jetson Orin NX 本地 AI 部署:為什麼用 Orin NX、服務怎麼串、記憶體怎麼分配,以及哪些能力已經驗證、哪些還只是下一步。
- 在 Jetson Orin NX 安裝 llama.cpp:從確認 JetPack/CUDA、編譯、GGUF 啟動,到 systemd 常駐與 64K context 的 KV cache 量化。
這套架構在解什麼問題
雲端模型方便,但不適合把所有資料都送出去,也不適合我需要長時間、可觀察、可回滾的個人服務。Jetson 的限制很清楚:16GB 統一記憶體、單一推論 slot、散熱與電力模式都會影響速度。這些限制反而讓架構必須精簡。
目前的責任切分是:llama.cpp 只負責生成,Agent 決定何時呼叫工具,搜尋補即時資訊,驗證步驟再檢查結果。子文章會把「安裝成功」「服務啟動」和「功能真的能用」分開寫,避免把 log 裡的 enabled 當成端到端完成。
之後會補的主題
- 效能測試:相同 prompt 下的 tokens/s、first-token latency、溫度與是否 throttling。
- 模型選擇:3B~8B GGUF 在 16GB 上的記憶體與品質取捨。
- 故障排除:編譯參數過期、shared library、OOM 與 systemd 重啟。
延伸閱讀:關於 Roy 說明我怎麼寫技術筆記;若你也在自架服務,可看 CS:S 死鬥伺服器架設。