端侧 AI 芯片是什么:CPU、GPU、NPU 怎么分工

2026-09-16

“端侧 AI 芯片”通常不是指设备里只有一颗专门跑全部 AI 的芯片,而是 CPU、GPU、NPU 与内存系统共同完成任务。运行时会根据模型、算子、驱动和设备支持选择执行路径;某个芯片宣传有 NPU,也不代表你的模型一定全部跑在 NPU 上。

CPU:兼容与回退

CPU 的优势是通用、可调试、覆盖面广。很多运行时会把它作为基础路径或回退路径。代价是复杂模型的持续计算可能不适合只依靠 CPU。

产品必须测试回退。如果 GPU 或 NPU 初始化失败,应用是停止、降级还是改用 CPU?回退后能否完成核心任务?这些应是明确策略,而不是发生失败后临时决定。

GPU:并行计算与设备差异

GPU 擅长大量并行数值计算,但移动 GPU 的驱动、内存共享和运行时支持随设备变化。模型能在一台手机的 GPU 路径加载,不代表另一款 GPU 或系统版本自动兼容。

调试时要记录实际后端、模型 artifact 和运行时版本。只写“开启 GPU”不足以复现问题。

NPU:专用能力不等于通用保证

NPU 面向神经网络计算,但支持范围由芯片、系统接口、运行时和模型算子共同决定。若模型的一部分算子不受支持,运行时可能拆分执行、回退或拒绝加载。

因此,TOPS 这类峰值指标不能直接回答“某模型生成有多快”。真实体验还受内存带宽、模型结构、量化、上下文、温控和后端覆盖影响。

LiteRT 如何看这些后端

Google 将 LiteRT 定位为从 TensorFlow Lite 演进而来的跨平台端侧 AI 框架,官方说明覆盖受支持平台的 CPU、GPU 和 NPU 执行路径。这个表述说明运行时的目标范围,但不是每台设备、每个模型、每个算子的兼容承诺。

Gemma 官方运行指南将 LiteRT-LM 列为 Android 与 iOS 的端侧 LLM 路径,并描述 CPU、GPU、NPU 加速方向。工程上要继续追问:当前 artifact 选中了哪条路径,失败后是否回退,回退是否仍满足产品要求。

一次有效的后端测试

至少记录:

  • 设备和系统版本;
  • 芯片与可用后端;
  • 模型 artifact、格式和量化;
  • 运行时版本;
  • 后端初始化日志;
  • 代表任务输入;
  • 加载、连续运行、取消和释放结果;
  • 是否发生回退;
  • 失败发生在哪一层。

不要只跑一次。相机、语音与长文本都需要持续任务测试,避免把首轮成功当作稳定兼容。

芯片选型表怎么读

表格里的字段能回答什么不能回答什么
NPU/GPU 是否存在设备有相关硬件你的模型一定能用
官方支持列表某运行时声明覆盖当前 artifact 一定成功
峰值算力理论计算上限产品端到端响应
真机记录指定配置下发生了什么其他版本自动相同

Cove 当前尚未完成可发布的多设备 benchmark 数据集,所以不会先写“芯片性能排行”。封测阶段会优先积累真实设备、执行后端、内存、温控与失败记录,再生成兼容页。

实际选择顺序

  1. 明确任务与最大输入。
  2. 确定运行时和模型格式。
  3. 查运行时对目标设备的官方支持。
  4. 在真实设备确认实际后端。
  5. 测首轮与持续任务。
  6. 强制测试回退路径。
  7. 用原始记录决定是否支持,而不是用芯片营销页决定。

继续阅读本地大模型部署硬件要求LiteRT-LM Android 教程。Cove 的英文 benchmark 方法见 How to Test an On-Device AI Model


本文最后核验于 2026-09-16,不包含未实测芯片排行或机型性能结论。

想系统学会用 AI?报名体系课或加入会员,照着学、照着用。

留言讨论

评论发布后会被人工复核,违规内容将被删除。

    还没有人评论,来说说你的看法

    如果发表没有反应,可以前往联系我们告诉我们。

    这个页面有问题?

    提交时会附带当前页面地址和浏览器信息,帮助我们定位问题。不填联系方式即为匿名。