Embodied AI Lab
Back to Module

Edge LLM Hardware

端侧大模型硬件

Jetson / Hailo / RK3588 / 高通 Hexagon 等边缘算力板与 NPU,精选可落地的部署教程与有趣测评。

Courses & Resources

The Edge LLM Runtime Stack 2026

按硬件选型 runtime:Jetson 用 TensorRT Edge-LLM,手机用 LiteRT/ExecuTorch,Pi/SBC 用 llama.cpp —— 一张表讲清 2026 端侧栈

Edge AI Stack
intermediate20 min

Edge Inference:ANE / Hexagon / WebGPU / Jetson

核心洞察:端侧瓶颈是内存带宽不是算力;对比 Apple ANE、高通 Hexagon、WebLLM、Jetson Thor/T4000

AI Engineering Academy
intermediate30 min

TensorRT Edge-LLM Overview

NVIDIA 官方边缘 LLM/VLM C++ runtime:面向 Jetson / DRIVE / DGX Spark,支持 INT4 / NVFP4 / 投机解码

NVIDIA
intermediateSelf-paced

TensorRT Edge-LLM on Jetson(实操)

Thor 跑 Cosmos Reason2 8B(NVFP4)、Orin Nano 跑 Qwen3-4B(INT4 AWQ);量化→ONNX→板端 engine 全流程

Jetson AI Lab
advanced2-3 hours

Accelerating LLM & VLM Inference with TensorRT Edge-LLM

面向汽车与机器人的边缘 LLM/VLM 加速:为何需要纯 C++ 推理路径、以及 Physical AI 场景

NVIDIA Developer Blog
intermediate15 min

Jetson T4000 + JetPack 7.1:边缘推理加速

新一代 Jetson 边缘算力(约 2× AGX Orin)与 JetPack 7.1 对机器人/边缘 LLM 的意义

NVIDIA Developer Blog
beginner10 min

Seeed:JetPack 6.2 上部署 TensorRT Edge-LLM

兼容发布版实操:主机量化导出 → Orin NX 上 build engine → 跑通 Qwen 小模型

Seeed Studio Wiki
intermediate1-2 hours

Hailo-10H:把 GenAI 搬到边缘

专用 DRAM + 全流水线卸载到加速卡:LoRA、DFC 编译、HailoRT GenAI,主机几乎零占用

Hailo
intermediate15 min

Raspberry Pi AI HAT+ 2(Hailo-10H)跑本地 LLM

40 TOPS + 8GB 独立内存:Pi 5 上跑 Llama 3.2 / Qwen 2.5 / DeepSeek R1 小模型,推理不抢 CPU

Raspberry Tips
beginner1 hour

llama.cpp × Snapdragon Hexagon NPU 实测

QNN-HTP 后端首次真机数字:NPU vs CPU 约 2.5× decode / 8× prefill;也讲清 8B 上限与 KV spill

SpecPicks
advanced25 min

QHexRT:100% 跑在 Hexagon NPU 上

无 Python、无推理期 CPU fallback;LFM 2.5 230M 上 12k+ tok/s prefill 与平坦 TTFT

RunAnywhere
intermediate10 min

老骁龙也能跑:Snapdragon 8 Gen 1 NPU LLM

打破「必须 8 Gen 2+」传言:用社区 .pte 在 SM8450(Hexagon v69)上跑通 Qwen3-0.6B,~31 tok/s

GitHub / avisre
advancedSelf-paced

Rockchip RKLLM 官方仓库(rknn-llm)

RK3588/RK3576 NPU 部署 LLM 官方工具链:Toolkit 转换 → Runtime → Demo;国产 SBC 首选入口

Rockchip
intermediateSelf-paced

Orange Pi 5 × RKLLM:Qwen3-4B 部署栈

W8A8 混合推理 + Ollama 兼容 API:预转换模型、systemd 服务、OpenAI 风格 HTTP,开箱可玩

GitHub / kamyarkazremi
advanced2 hours