端侧 AI 芯片是什么:CPU、GPU、NPU 怎么分工
“端侧 AI 芯片”通常不是指设备里只有一颗专门跑全部 AI 的芯片,而是 CPU、GPU、NPU 与内存系统共同完成任务。运行时会根据模型、算子、驱动和设备支持选择执行路径;某个芯片宣传有 NPU,也不代表你的模型一定全部跑在 NPU 上。
CPU:兼容与回退
CPU 的优势是通用、可调试、覆盖面广。很多运行时会把它作为基础路径或回退路径。代价是复杂模型的持续计算可能不适合只依靠 CPU。
产品必须测试回退。如果 GPU 或 NPU 初始化失败,应用是停止、降级还是改用 CPU?回退后能否完成核心任务?这些应是明确策略,而不是发生失败后临时决定。
GPU:并行计算与设备差异
GPU 擅长大量并行数值计算,但移动 GPU 的驱动、内存共享和运行时支持随设备变化。模型能在一台手机的 GPU 路径加载,不代表另一款 GPU 或系统版本自动兼容。
调试时要记录实际后端、模型 artifact 和运行时版本。只写“开启 GPU”不足以复现问题。
NPU:专用能力不等于通用保证
NPU 面向神经网络计算,但支持范围由芯片、系统接口、运行时和模型算子共同决定。若模型的一部分算子不受支持,运行时可能拆分执行、回退或拒绝加载。
因此,TOPS 这类峰值指标不能直接回答“某模型生成有多快”。真实体验还受内存带宽、模型结构、量化、上下文、温控和后端覆盖影响。
LiteRT 如何看这些后端
Google 将 LiteRT 定位为从 TensorFlow Lite 演进而来的跨平台端侧 AI 框架,官方说明覆盖受支持平台的 CPU、GPU 和 NPU 执行路径。这个表述说明运行时的目标范围,但不是每台设备、每个模型、每个算子的兼容承诺。
Gemma 官方运行指南将 LiteRT-LM 列为 Android 与 iOS 的端侧 LLM 路径,并描述 CPU、GPU、NPU 加速方向。工程上要继续追问:当前 artifact 选中了哪条路径,失败后是否回退,回退是否仍满足产品要求。
一次有效的后端测试
至少记录:
- 设备和系统版本;
- 芯片与可用后端;
- 模型 artifact、格式和量化;
- 运行时版本;
- 后端初始化日志;
- 代表任务输入;
- 加载、连续运行、取消和释放结果;
- 是否发生回退;
- 失败发生在哪一层。
不要只跑一次。相机、语音与长文本都需要持续任务测试,避免把首轮成功当作稳定兼容。
芯片选型表怎么读
| 表格里的字段 | 能回答什么 | 不能回答什么 |
|---|---|---|
| NPU/GPU 是否存在 | 设备有相关硬件 | 你的模型一定能用 |
| 官方支持列表 | 某运行时声明覆盖 | 当前 artifact 一定成功 |
| 峰值算力 | 理论计算上限 | 产品端到端响应 |
| 真机记录 | 指定配置下发生了什么 | 其他版本自动相同 |
Cove 当前尚未完成可发布的多设备 benchmark 数据集,所以不会先写“芯片性能排行”。封测阶段会优先积累真实设备、执行后端、内存、温控与失败记录,再生成兼容页。
实际选择顺序
- 明确任务与最大输入。
- 确定运行时和模型格式。
- 查运行时对目标设备的官方支持。
- 在真实设备确认实际后端。
- 测首轮与持续任务。
- 强制测试回退路径。
- 用原始记录决定是否支持,而不是用芯片营销页决定。
继续阅读本地大模型部署硬件要求和 LiteRT-LM Android 教程。Cove 的英文 benchmark 方法见 How to Test an On-Device AI Model。
本文最后核验于 2026-09-16,不包含未实测芯片排行或机型性能结论。
留言讨论
评论发布后会被人工复核,违规内容将被删除。
如果发表没有反应,可以前往联系我们告诉我们。