把模型真正放进设备里
端侧 AI 不只是「模型能在手机上启动」。真正落地还要同时处理模型格式、内存、硬件加速、下载与校验、离线数据边界和失败回退。 本专题在奇连 AI 讲部署和排错;模型规格、设备对照与真实离线产品证据沉淀在 Cove 端侧 AI 中心。
端侧 AI 是什么:模型为什么开始从云端回到设备
端侧 AI 是把推理放在手机、电脑或边缘设备本地完成。本篇讲清它与本地 AI、边缘 AI、云端 AI 的边界,以及隐私、延迟、离线与能力上限之间的真实取舍。
部署与工程
从模型文件进入 Android 应用,解释运行时、内存、生命周期与验证路径。
Gemma 4 本地部署:从模型文件到 LiteRT-LM 应用
Gemma 4 本地部署要同时处理模型版本、LiteRT-LM 格式、下载校验、内存预检和硬件回退。本文以 Android 端侧应用为主线,说明从模型文件到可发布产品的完整链路。
LiteRT-LM Android 教程:端侧大模型接入路线与常见坑
LiteRT-LM 在 Android 中负责模型加载与端侧生成,但生产接入还要处理模型格式、协程线程、生命周期、下载校验、设备回退与真实机测试。本文给出完整工程路线。
选型与边界
本地 AI 隐私不是自动成立:怎样做网络请求审计
本地模型只说明推理可以在设备完成,不代表 App 没有其他网络请求。本文给出数据清单、端点清单、飞行模式、抓包、日志、备份与导出审计方法。
本地大模型部署硬件要求:别只看显存和参数量
本地大模型部署硬件要求不能只看模型文件或参数量。本文拆解权重、量化、KV cache、输入张量、运行时、系统余量和真实设备测试方法。
端侧 AI 与云端 AI 区别:按任务选,不按口号选
端侧 AI 与云端 AI 的区别在推理边界、离线能力、数据流、更新和工程成本。本文给出隐私、网络、能力、成本与混合路由的决策表。
端侧 AI 芯片是什么:CPU、GPU、NPU 怎么分工
端侧 AI 芯片不是单独一颗万能芯片。本文从运行时视角解释 CPU、GPU、NPU 的职责、模型算子支持、后端回退和为什么 TOPS 不能直接等于真实体验。
Gemma 4 E2B 是什么:参数名、模型包和端侧部署
Gemma 4 E2B 是面向端侧部署的 Gemma 4 变种。本文区分有效参数、模型卡规格、量化权重、LiteRT-LM 部署包和 App 实际下载文件。
Gemma 4 下载:模型来源、断点续传和完整性校验
Gemma 4 下载不能只复制一个链接。本文讲清固定 revision、模型格式、文件长度、SHA-256、临时文件、HTTP Range 续传、镜像一致性和失败修复。
LiteRT-LM 与 llama.cpp 怎么选:先选运行时再下模型
LiteRT-LM 与 llama.cpp 使用不同模型格式和运行时边界。本文对比 .litertlm、GGUF、Android 集成、硬件路径、跨平台、调试和测试成本。
LiteRT 与 TensorFlow Lite 什么关系:迁移时看这几层
LiteRT 从 TensorFlow Lite 演进而来,但迁移不能只做名称替换。本文拆解经典模型、生成式模型、模型格式、API、硬件后端与验证边界。
本地 AI 部署怎么选:手机、电脑和边缘设备三条路线
本地 AI 部署不是只有 Ollama 一条路。本文按手机、个人电脑和边缘设备拆开模型格式、运行时、内存、硬件加速、数据边界与维护成本,帮助你先选对部署形态。
证据型长尾指南
这些页面不猜性能,统一给出事实边界、复现记录与发布检查单。
本地 AI 部署流程:从任务到真机验证
本地 AI 部署流程:从任务到真机验证。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
本地大模型内存估算:公式只是下界
本地大模型内存估算:公式只是下界。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
模型文件大小和运行内存有什么区别
模型文件大小和运行内存有什么区别。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
KV Cache 是什么:为什么上下文越长越吃内存
KV Cache 是什么:为什么上下文越长越吃内存。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
GGUF 和 .litertlm 区别:不是改后缀就能互转
GGUF 和 .litertlm 区别:不是改后缀就能互转。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
LiteRT GPU 回退怎么测:别让降级静默发生
LiteRT GPU 回退怎么测:别让降级静默发生。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
模型下载断点续传:Range、临时文件和 revision
模型下载断点续传:Range、临时文件和 revision。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
模型 SHA-256 校验:长度校验为什么不够
模型 SHA-256 校验:长度校验为什么不够。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
端侧模型更新与回滚:新文件验证前别删旧版
端侧模型更新与回滚:新文件验证前别删旧版。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
模型文件损坏怎么修:只修模型,不删用户数据
模型文件损坏怎么修:只修模型,不删用户数据。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
端侧 AI 网络审计:逐条列出请求与字段
端侧 AI 网络审计:逐条列出请求与字段。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
本地 AI 崩溃日志隐私:别把 prompt 一起上报
本地 AI 崩溃日志隐私:别把 prompt 一起上报。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
本地 AI 系统备份边界:不上传不等于不备份
本地 AI 系统备份边界:不上传不等于不备份。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
端侧 AI App 权限清单怎么审
端侧 AI App 权限清单怎么审。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
离线模式怎么验证:从输入走到保存结果
离线模式怎么验证:从输入走到保存结果。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
端侧 RAG 架构:切分、向量、检索、生成怎么分层
端侧 RAG 架构:切分、向量、检索、生成怎么分层。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
端侧函数调用安全:模型只能提案,不能直接执行
端侧函数调用安全:模型只能提案,不能直接执行。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
端侧 AI 测试集怎么建:输入、期望与隐私
端侧 AI 测试集怎么建:输入、期望与隐私。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
端侧 AI 性能怎么测:首轮、持续、内存和失败
端侧 AI 性能怎么测:首轮、持续、内存和失败。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
端侧 AI 发布检查清单:模型、隐私、失败与回滚
端侧 AI 发布检查清单:模型、隐私、失败与回滚。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
LiteRT-LM 流式输出:回调、取消和最终状态
LiteRT-LM 流式输出:回调、取消和最终状态。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
LiteRT-LM Tokenizer 不匹配怎么排查
LiteRT-LM Tokenizer 不匹配怎么排查。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
LiteRT 模型加载失败:完整排查顺序
LiteRT 模型加载失败:完整排查顺序。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
llama.cpp JNI 线程与生命周期怎么管
llama.cpp JNI 线程与生命周期怎么管。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
Android 端侧推理为什么不能堵主线程
Android 端侧推理为什么不能堵主线程。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
端侧模型预热怎么测:别隐藏冷启动
端侧模型预热怎么测:别隐藏冷启动。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
Android 进程重建后怎样恢复本地 AI
Android 进程重建后怎样恢复本地 AI。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
端侧运行时后端选择:GPU、CPU 回退怎么定
端侧运行时后端选择:GPU、CPU 回退怎么定。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
模型转换完成后必须验证什么
模型转换完成后必须验证什么。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
量化模型文件上线前检查清单
量化模型文件上线前检查清单。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
Android 本地 AI OOM:定位与恢复
Android 本地 AI OOM:定位与恢复。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
上下文窗口内存怎么在真机测
上下文窗口内存怎么在真机测。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
端侧图片预处理为什么会吃掉大量内存
端侧图片预处理为什么会吃掉大量内存。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
离线语音的音频缓冲内存怎么预算
离线语音的音频缓冲内存怎么预算。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
重复推理内存泄漏怎么测
重复推理内存泄漏怎么测。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
多个本地模型怎样制定内存策略
多个本地模型怎样制定内存策略。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
低内存设备如何决定是否开放端侧 AI
低内存设备如何决定是否开放端侧 AI。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
本地 AI 缓存清理:哪些能删,哪些不能删
本地 AI 缓存清理:哪些能删,哪些不能删。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
大模型下载重试策略:什么能重试
大模型下载重试策略:什么能重试。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
模型下载进度为什么不能乱算
模型下载进度为什么不能乱算。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
计量网络下载大模型:提醒、暂停和覆盖
计量网络下载大模型:提醒、暂停和覆盖。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
模型下载取消后怎样安全恢复
模型下载取消后怎样安全恢复。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
模型安装如何做原子切换
模型安装如何做原子切换。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
本地模型升级后用户数据怎么迁移
本地模型升级后用户数据怎么迁移。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
离线 AI App 首次启动应该怎么设计
离线 AI App 首次启动应该怎么设计。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
Android 离线聊天架构怎么分层
Android 离线聊天架构怎么分层。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
离线关键词抽取怎样定义验收集
离线关键词抽取怎样定义验收集。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
本地模型 JSON 抽取:解析失败怎么办
本地模型 JSON 抽取:解析失败怎么办。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
离线小票 OCR:识别、字段映射和复核
离线小票 OCR:识别、字段映射和复核。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
离线名片信息抽取:不要猜缺失字段
离线名片信息抽取:不要猜缺失字段。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
Android 离线 PDF 搜索架构
Android 离线 PDF 搜索架构。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
本地图片描述的证据边界
本地图片描述的证据边界。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
离线音频摘要:原始转写必须保留
离线音频摘要:原始转写必须保留。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
端侧意图分类怎样做安全回退
端侧意图分类怎样做安全回退。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
本地 AI 统计边界:不要上传用户内容
本地 AI 统计边界:不要上传用户内容。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
离线 AI 录音同意与状态提示
离线 AI 录音同意与状态提示。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
端侧 AI 相机数据保留策略
端侧 AI 相机数据保留策略。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
本地向量索引也属于用户数据
本地向量索引也属于用户数据。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
端侧首 Token 延迟应该怎么测
端侧首 Token 延迟应该怎么测。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
冷启动和热启动推理数据不能混在一起
冷启动和热启动推理数据不能混在一起。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
LiteRT-LM Chat Template 怎么验证
LiteRT-LM Chat Template 怎么验证。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
用 WorkManager 下载大模型要注意什么
用 WorkManager 下载大模型要注意什么。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
端侧 AI 启动时间怎么拆开测
端侧 AI 启动时间怎么拆开测。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
本地 AI 结构化日志:不记录用户原文
本地 AI 结构化日志:不记录用户原文。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
Android 离线图片批处理:并发和内存边界
Android 离线图片批处理:并发和内存边界。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
离线 AI 模型选择器应该显示什么
离线 AI 模型选择器应该显示什么。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
离线 AI 语言包如何下载、删除和回退
离线 AI 语言包如何下载、删除和回退。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
本地 AI 隐私政策检查清单
本地 AI 隐私政策检查清单。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
端侧 AI 电池测试怎样才可复现
端侧 AI 电池测试怎样才可复现。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
本地 AI 支持包怎样避免泄露隐私
本地 AI 支持包怎样避免泄露隐私。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
LiteRT-LM 多轮对话状态怎么管理
LiteRT-LM 多轮对话状态怎么管理。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
本地 AI Prompt 为什么也要做版本管理
本地 AI Prompt 为什么也要做版本管理。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
端侧 AI 错误提示怎么写才有用
端侧 AI 错误提示怎么写才有用。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
离线 AI 数据导出:预览、确认和版本
离线 AI 数据导出:预览、确认和版本。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
本地 AI 历史数据迁移怎么做
本地 AI 历史数据迁移怎么做。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
卸载端侧模型时不要删除用户数据
卸载端侧模型时不要删除用户数据。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
本地 AI Runtime 变更怎样使用功能开关
本地 AI Runtime 变更怎样使用功能开关。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
端侧 AI 结果来源怎么记录
端侧 AI 结果来源怎么记录。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
本地 AI App 安全模式怎么设计
本地 AI App 安全模式怎么设计。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。
收集本地 AI 反馈时不要上传对话原文
收集本地 AI 反馈时不要上传对话原文。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。