Gemma 4 本地部署:从模型文件到 LiteRT-LM 应用
Gemma 4 本地部署有两种完全不同的目标:在电脑上把模型跑起来,和把模型交付到真实手机 App。前者可以用桌面工具快速验证;后者还要解决模型格式、下载、校验、存储空间、进程生命周期、硬件兼容和失败回退。本文只讲后者。
先确认你拿到的是什么模型
“Gemma 4”是模型家族名,不是一个唯一文件。部署前至少记录:
- 具体变种和指令微调版本;
- 权重精度与量化方式;
- 上下文长度;
- 文本、视觉、音频等模态;
- 模型文件来源和固定版本;
- 运行时要求的包格式。
Google 的 Gemma 推理方式总览把云端服务、桌面运行和移动端部署分开列出。移动场景中,LiteRT-LM 是面向 Android 与 iOS 的主要路径之一;移动部署文档还提供 AI Edge Gallery 作为模型导入、参数调节和性能观察入口。
模型大小为什么会出现多个数字
同一个模型经常同时出现“参数规模”“量化权重大小”“部署包下载大小”和“运行时峰值内存”四个数字。它们不是同一件事。
以 Cove 当前固定的 Gemma 4 E2B LiteRT-LM 包为例,应用配置中的预期下载大小是 2,583,085,056 字节。这是实际交付文件的校验口径,不等于所有 Gemma 4 E2B 量化权重都必须是这个大小。不同量化、打包版本和附加元数据可能产生不同文件体积;加载后的峰值内存又会比磁盘文件更复杂。
因此,产品页如果写“模型 1.5 GB”,下载器却要求约 2.58 GB,必须明确前者是权重口径还是后者是完整部署包,不能让用户在首次启动时才发现差异。Cove 的模型资料会在 Gemma 4 端侧模型页持续校准。
Android 交付链路应拆成五层
1. 固定可重复的模型来源
生产下载地址应固定到明确版本或提交,而不是永远指向会变化的 main。否则同一个 App 版本在不同时间可能下载到不同文件,体积、哈希和输出都无法复现。
2. 下载前做空间和网络提示
端侧大模型通常远大于普通 App 安装包。下载前应告诉用户准确体积、建议网络、所需剩余空间,以及中断后能否续传。不要在用户第一次打开 App 时无解释地弹出一个数 GB 下载框。
3. 下载后验证完整性
至少验证文件长度;更稳妥的做法是固定 SHA-256。Cove 当前 E2B 配置里的 SHA-256 仍为空,因此不能宣称 artifact 已完成哈希校验。若哈希暂未固定,应明确这是发布阻塞,而不是静默跳过。
4. 把模型状态做成状态机
未下载、下载中、校验中、就绪、加载中、可推理、失败和需要更新,应是明确状态。UI 不应该通过“文件是否存在”猜模型可用性;ViewModel 和后台任务也不应各维护一份互相漂移的状态。
5. 在真实设备上验证回退
模拟器能验证 UI 和部分流程,不能代表 NPU、GPU、温控与内存行为。至少覆盖一台中端机和一台旗舰机,测试首次加载、连续推理、切后台、锁屏、低存储和模型切换。
什么时候先用 AI Edge Gallery
如果你还在选模型,不要先写完整 App。先在 AI Edge Gallery 或最小示例里确认三件事:模型能加载、目标输入能处理、输出质量达到最低标准。确认后再把下载管理、状态机和产品 UI 接进来。
这一步能避免一种常见浪费:花几天把下载和页面做好,最后才发现模型格式不被当前运行时支持,或任务质量根本不够。
生产前检查单
- 模型 URL 是否固定到具体版本;
- 文件大小和哈希是否来自实际下载;
- 磁盘空间预检是否包含临时文件与解压余量;
- 断点续传是否在切后台后仍有效;
- 加载失败是否能删除坏文件并重试;
- 模型升级是否会覆盖用户仍在使用的旧版本;
- CPU 回退是否会造成不可接受的等待或发热;
- 官网写的体积、设备要求和 App 实际配置是否一致。
接下来可以阅读 LiteRT-LM Android 教程,或从 Cove 端侧模型横评比较 Gemma、Qwen、Phi 等模型的公开规格。
本文依据 Google AI for Developers 的 Gemma 与移动部署文档,以及 Cove 当前 Android 模型配置整理,最后核验于 2026-09-16。具体文件体积和兼容性必须以你实际交付的模型包为准。
留言讨论
评论发布后会被人工复核,违规内容将被删除。
如果发表没有反应,可以前往联系我们告诉我们。