本地 AI 部署怎么选:手机、电脑和边缘设备三条路线

2026-09-16

搜“本地 AI 部署”时,最容易犯的错是先下载一个模型,再想它要跑在哪里。手机、个人电脑和边缘设备虽然都能叫“本地”,但运行时、模型格式、内存约束和产品目标完全不同。先选部署形态,再选模型,能省掉大量无效转换与兼容调试。

三条路线先摆在一起

路线典型设备常用运行时最适合的任务
手机端侧Android、iPhone、平板LiteRT-LM、ExecuTorch、Core ML、MediaPipe翻译、摘要、OCR 后处理、语音笔记、函数调用
个人电脑Windows、macOS、Linuxllama.cpp、Ollama、LM Studio、LiteRT-LM本地聊天、代码、文档分析、个人知识库
边缘设备工业盒子、Jetson、机器人、摄像头LiteRT、TensorRT、ONNX Runtime、厂商 SDK视觉检测、实时控制、现场异常识别

如果目标是做 Android App,就不要先围绕 Ollama 设计产品;如果目标是给局域网内多人提供服务,也不应从“把模型塞进每部手机”开始。

第一步:把任务写成可测的输入与输出

“我要一个本地 AI 助手”太宽,无法选模型。应改写成下面这种任务:

  • 输入一张菜单照片,输出识别后的双语文本;
  • 输入 20 分钟录音的转写稿,输出五条待办;
  • 输入一个本地 PDF,回答只依赖该文档的问题;
  • 输入一句语音命令,调用 App 内已经定义好的函数。

任务越明确,越容易用小模型完成。端侧部署最怕的是一开始要求“什么都能做”,最后只能把模型不断做大,失去本地运行的意义。

第二步:先算内存,不要只看模型文件大小

部署时至少要同时考虑四块:模型权重、运行时本身、上下文缓存、输入输出中间张量。一个磁盘上看起来能放下的模型,不代表加载后一定能稳定运行。图片和音频还会额外占用内存,长上下文也会让 KV cache 持续增长。

因此,“4 GB 手机能不能跑某模型”没有只看参数量就能得出的统一答案。模型精度、量化方式、上下文长度、模态和运行时都会改变峰值。正确方法是在目标设备上记录加载峰值、首轮推理峰值、连续运行后的温度与失败率。

第三步:模型格式必须与运行时一起选

GGUF 适合 llama.cpp 生态,但不能因为网上的模型是 GGUF,就假设 Android 的 NPU 路径会直接接受它。LiteRT-LM 使用自己的部署链路和模型包;Core ML、ExecuTorch、ONNX Runtime 也有各自支持范围。

Google 的 Gemma 移动部署文档把 AI Edge Gallery、MediaPipe 和移动平台入口放在一起;最新的 Gemma 推理方式总览则把 LiteRT-LM 明确列为移动与边缘部署路径。选型时应以运行时当前支持的模型卡和转换工具为准,不要用文件扩展名猜兼容性。

第四步:决定硬件加速与回退策略

手机上的 GPU/NPU 支持与芯片、系统版本和运行时版本绑定。生产应用至少要回答:

  1. 硬件加速不可用时是否回退 CPU?
  2. 回退后速度是否仍可接受?
  3. 模型加载失败时给用户什么提示?
  4. 下载过程中切后台、断网或空间不足怎么办?
  5. 同一模型在不同芯片上的输出是否一致到足以通过业务测试?

端侧产品的难点通常不在“第一次跑通”,而在这些失败分支。Google 对 LiteRT 的定位已经扩展到 Android、iOS、桌面和 Web 的端侧运行栈,但具体 delegate 与模型支持仍应逐设备验证,参见 LiteRT 官方介绍

第五步:把数据边界写进架构

本地部署并不自动阻止 App 联网。模型下载、更新检查、购买验证、可选统计和崩溃报告都可能产生网络请求。真正重视隐私的产品应区分“用户内容”和“运行元数据”,并明确哪些请求是必须的、哪些可以关闭。

Cove 的做法是让照片、语音、翻译和健康输入在设备内处理,同时把模型资料和真实应用入口汇总在 Cove 端侧 AI 中心。这个页面适合用来比较模型;本专题则继续讲部署和工程问题。

一张选择表

  • 要做手机 App:从 LiteRT-LM、ExecuTorch、Core ML 等移动运行时反推模型。
  • 要在个人电脑自用:从 llama.cpp、Ollama 或 LM Studio 开始,优先可维护性。
  • 要在工厂或机器人上运行:先确认芯片、实时性和厂商加速栈,再决定模型。
  • 要多人共享:考虑局域网服务,不必强行复制模型到每个终端。
  • 数据敏感但任务复杂:采用本地预处理加云端可控升级,而不是假装小模型无所不能。

下一步可看 Gemma 4 本地部署LiteRT-LM Android 教程


本文最后核验于 2026-09-16。运行时和硬件支持变化较快,部署前请用目标设备、目标模型文件和实际输入重新测量,不要直接套用他人的速度或内存数字。

想系统学会用 AI?报名体系课或加入会员,照着学、照着用。

留言讨论

评论发布后会被人工复核,违规内容将被删除。

    还没有人评论,来说说你的看法

    如果发表没有反应,可以前往联系我们告诉我们。

    这个页面有问题?

    提交时会附带当前页面地址和浏览器信息,帮助我们定位问题。不填联系方式即为匿名。