端侧大模型硬件
Jetson / Hailo / RK3588 / 高通 Hexagon 等边缘算力板与 NPU,精选可落地的部署教程与有趣测评。
按硬件选型 runtime:Jetson 用 TensorRT Edge-LLM,手机用 LiteRT/ExecuTorch,Pi/SBC 用 llama.cpp —— 一张表讲清 2026 端侧栈
核心洞察:端侧瓶颈是内存带宽不是算力;对比 Apple ANE、高通 Hexagon、WebLLM、Jetson Thor/T4000
NVIDIA 官方边缘 LLM/VLM C++ runtime:面向 Jetson / DRIVE / DGX Spark,支持 INT4 / NVFP4 / 投机解码
Thor 跑 Cosmos Reason2 8B(NVFP4)、Orin Nano 跑 Qwen3-4B(INT4 AWQ);量化→ONNX→板端 engine 全流程
面向汽车与机器人的边缘 LLM/VLM 加速:为何需要纯 C++ 推理路径、以及 Physical AI 场景
新一代 Jetson 边缘算力(约 2× AGX Orin)与 JetPack 7.1 对机器人/边缘 LLM 的意义
兼容发布版实操:主机量化导出 → Orin NX 上 build engine → 跑通 Qwen 小模型
专用 DRAM + 全流水线卸载到加速卡:LoRA、DFC 编译、HailoRT GenAI,主机几乎零占用
40 TOPS + 8GB 独立内存:Pi 5 上跑 Llama 3.2 / Qwen 2.5 / DeepSeek R1 小模型,推理不抢 CPU
QNN-HTP 后端首次真机数字:NPU vs CPU 约 2.5× decode / 8× prefill;也讲清 8B 上限与 KV spill
无 Python、无推理期 CPU fallback;LFM 2.5 230M 上 12k+ tok/s prefill 与平坦 TTFT
打破「必须 8 Gen 2+」传言:用社区 .pte 在 SM8450(Hexagon v69)上跑通 Qwen3-0.6B,~31 tok/s
RK3588/RK3576 NPU 部署 LLM 官方工具链:Toolkit 转换 → Runtime → Demo;国产 SBC 首选入口
W8A8 混合推理 + Ollama 兼容 API:预转换模型、systemd 服务、OpenAI 风格 HTTP,开箱可玩