端侧 AI 专题

把模型真正放进设备里

端侧 AI 不只是「模型能在手机上启动」。真正落地还要同时处理模型格式、内存、硬件加速、下载与校验、离线数据边界和失败回退。 本专题在奇连 AI 讲部署和排错;模型规格、设备对照与真实离线产品证据沉淀在 Cove 端侧 AI 中心

从这里开始 · 2026-09-16

端侧 AI 是什么:模型为什么开始从云端回到设备

端侧 AI 是把推理放在手机、电脑或边缘设备本地完成。本篇讲清它与本地 AI、边缘 AI、云端 AI 的边界,以及隐私、延迟、离线与能力上限之间的真实取舍。

部署与工程

从模型文件进入 Android 应用,解释运行时、内存、生命周期与验证路径。

选型与边界

2026-09-16

本地 AI 隐私不是自动成立:怎样做网络请求审计

本地模型只说明推理可以在设备完成,不代表 App 没有其他网络请求。本文给出数据清单、端点清单、飞行模式、抓包、日志、备份与导出审计方法。

2026-09-16

本地大模型部署硬件要求:别只看显存和参数量

本地大模型部署硬件要求不能只看模型文件或参数量。本文拆解权重、量化、KV cache、输入张量、运行时、系统余量和真实设备测试方法。

2026-09-16

端侧 AI 与云端 AI 区别:按任务选,不按口号选

端侧 AI 与云端 AI 的区别在推理边界、离线能力、数据流、更新和工程成本。本文给出隐私、网络、能力、成本与混合路由的决策表。

2026-09-16

端侧 AI 芯片是什么:CPU、GPU、NPU 怎么分工

端侧 AI 芯片不是单独一颗万能芯片。本文从运行时视角解释 CPU、GPU、NPU 的职责、模型算子支持、后端回退和为什么 TOPS 不能直接等于真实体验。

2026-09-16

Gemma 4 E2B 是什么:参数名、模型包和端侧部署

Gemma 4 E2B 是面向端侧部署的 Gemma 4 变种。本文区分有效参数、模型卡规格、量化权重、LiteRT-LM 部署包和 App 实际下载文件。

2026-09-16

Gemma 4 下载:模型来源、断点续传和完整性校验

Gemma 4 下载不能只复制一个链接。本文讲清固定 revision、模型格式、文件长度、SHA-256、临时文件、HTTP Range 续传、镜像一致性和失败修复。

2026-09-16

LiteRT-LM 与 llama.cpp 怎么选:先选运行时再下模型

LiteRT-LM 与 llama.cpp 使用不同模型格式和运行时边界。本文对比 .litertlm、GGUF、Android 集成、硬件路径、跨平台、调试和测试成本。

2026-09-16

LiteRT 与 TensorFlow Lite 什么关系:迁移时看这几层

LiteRT 从 TensorFlow Lite 演进而来,但迁移不能只做名称替换。本文拆解经典模型、生成式模型、模型格式、API、硬件后端与验证边界。

2026-09-16

本地 AI 部署怎么选:手机、电脑和边缘设备三条路线

本地 AI 部署不是只有 Ollama 一条路。本文按手机、个人电脑和边缘设备拆开模型格式、运行时、内存、硬件加速、数据边界与维护成本,帮助你先选对部署形态。

证据型长尾指南

这些页面不猜性能,统一给出事实边界、复现记录与发布检查单。

部署 · 2026-09-16

本地 AI 部署流程:从任务到真机验证

本地 AI 部署流程:从任务到真机验证。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

内存 · 2026-09-16

本地大模型内存估算:公式只是下界

本地大模型内存估算:公式只是下界。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

内存 · 2026-09-16

模型文件大小和运行内存有什么区别

模型文件大小和运行内存有什么区别。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

内存 · 2026-09-16

KV Cache 是什么:为什么上下文越长越吃内存

KV Cache 是什么:为什么上下文越长越吃内存。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

运行时 · 2026-09-16

GGUF 和 .litertlm 区别:不是改后缀就能互转

GGUF 和 .litertlm 区别:不是改后缀就能互转。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

运行时 · 2026-09-16

LiteRT GPU 回退怎么测:别让降级静默发生

LiteRT GPU 回退怎么测:别让降级静默发生。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

交付 · 2026-09-16

模型下载断点续传:Range、临时文件和 revision

模型下载断点续传:Range、临时文件和 revision。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

交付 · 2026-09-16

模型 SHA-256 校验:长度校验为什么不够

模型 SHA-256 校验:长度校验为什么不够。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

交付 · 2026-09-16

端侧模型更新与回滚:新文件验证前别删旧版

端侧模型更新与回滚:新文件验证前别删旧版。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

交付 · 2026-09-16

模型文件损坏怎么修:只修模型,不删用户数据

模型文件损坏怎么修:只修模型,不删用户数据。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

隐私 · 2026-09-16

端侧 AI 网络审计:逐条列出请求与字段

端侧 AI 网络审计:逐条列出请求与字段。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

隐私 · 2026-09-16

本地 AI 崩溃日志隐私:别把 prompt 一起上报

本地 AI 崩溃日志隐私:别把 prompt 一起上报。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

隐私 · 2026-09-16

本地 AI 系统备份边界:不上传不等于不备份

本地 AI 系统备份边界:不上传不等于不备份。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

隐私 · 2026-09-16

端侧 AI App 权限清单怎么审

端侧 AI App 权限清单怎么审。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

隐私 · 2026-09-16

离线模式怎么验证:从输入走到保存结果

离线模式怎么验证:从输入走到保存结果。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

部署 · 2026-09-16

端侧 RAG 架构:切分、向量、检索、生成怎么分层

端侧 RAG 架构:切分、向量、检索、生成怎么分层。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

部署 · 2026-09-16

端侧函数调用安全:模型只能提案,不能直接执行

端侧函数调用安全:模型只能提案,不能直接执行。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

测试 · 2026-09-16

端侧 AI 测试集怎么建:输入、期望与隐私

端侧 AI 测试集怎么建:输入、期望与隐私。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

测试 · 2026-09-16

端侧 AI 性能怎么测:首轮、持续、内存和失败

端侧 AI 性能怎么测:首轮、持续、内存和失败。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

测试 · 2026-09-16

端侧 AI 发布检查清单:模型、隐私、失败与回滚

端侧 AI 发布检查清单:模型、隐私、失败与回滚。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

运行时 · 2026-09-16

LiteRT-LM 流式输出:回调、取消和最终状态

LiteRT-LM 流式输出:回调、取消和最终状态。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

运行时 · 2026-09-16

LiteRT-LM Tokenizer 不匹配怎么排查

LiteRT-LM Tokenizer 不匹配怎么排查。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

运行时 · 2026-09-16

LiteRT 模型加载失败:完整排查顺序

LiteRT 模型加载失败:完整排查顺序。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

运行时 · 2026-09-16

llama.cpp JNI 线程与生命周期怎么管

llama.cpp JNI 线程与生命周期怎么管。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

运行时 · 2026-09-16

Android 端侧推理为什么不能堵主线程

Android 端侧推理为什么不能堵主线程。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

运行时 · 2026-09-16

端侧模型预热怎么测:别隐藏冷启动

端侧模型预热怎么测:别隐藏冷启动。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

运行时 · 2026-09-16

Android 进程重建后怎样恢复本地 AI

Android 进程重建后怎样恢复本地 AI。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

运行时 · 2026-09-16

端侧运行时后端选择:GPU、CPU 回退怎么定

端侧运行时后端选择:GPU、CPU 回退怎么定。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

运行时 · 2026-09-16

模型转换完成后必须验证什么

模型转换完成后必须验证什么。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

运行时 · 2026-09-16

量化模型文件上线前检查清单

量化模型文件上线前检查清单。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

内存 · 2026-09-16

Android 本地 AI OOM:定位与恢复

Android 本地 AI OOM:定位与恢复。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

内存 · 2026-09-16

上下文窗口内存怎么在真机测

上下文窗口内存怎么在真机测。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

内存 · 2026-09-16

端侧图片预处理为什么会吃掉大量内存

端侧图片预处理为什么会吃掉大量内存。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

内存 · 2026-09-16

离线语音的音频缓冲内存怎么预算

离线语音的音频缓冲内存怎么预算。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

内存 · 2026-09-16

重复推理内存泄漏怎么测

重复推理内存泄漏怎么测。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

内存 · 2026-09-16

多个本地模型怎样制定内存策略

多个本地模型怎样制定内存策略。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

内存 · 2026-09-16

低内存设备如何决定是否开放端侧 AI

低内存设备如何决定是否开放端侧 AI。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

内存 · 2026-09-16

本地 AI 缓存清理:哪些能删,哪些不能删

本地 AI 缓存清理:哪些能删,哪些不能删。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

交付 · 2026-09-16

大模型下载重试策略:什么能重试

大模型下载重试策略:什么能重试。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

交付 · 2026-09-16

模型下载进度为什么不能乱算

模型下载进度为什么不能乱算。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

交付 · 2026-09-16

计量网络下载大模型:提醒、暂停和覆盖

计量网络下载大模型:提醒、暂停和覆盖。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

交付 · 2026-09-16

模型下载取消后怎样安全恢复

模型下载取消后怎样安全恢复。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

交付 · 2026-09-16

模型安装如何做原子切换

模型安装如何做原子切换。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

交付 · 2026-09-16

本地模型升级后用户数据怎么迁移

本地模型升级后用户数据怎么迁移。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

交付 · 2026-09-16

离线 AI App 首次启动应该怎么设计

离线 AI App 首次启动应该怎么设计。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

部署 · 2026-09-16

Android 离线聊天架构怎么分层

Android 离线聊天架构怎么分层。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

部署 · 2026-09-16

离线关键词抽取怎样定义验收集

离线关键词抽取怎样定义验收集。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

部署 · 2026-09-16

本地模型 JSON 抽取:解析失败怎么办

本地模型 JSON 抽取:解析失败怎么办。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

部署 · 2026-09-16

离线小票 OCR:识别、字段映射和复核

离线小票 OCR:识别、字段映射和复核。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

部署 · 2026-09-16

离线名片信息抽取:不要猜缺失字段

离线名片信息抽取:不要猜缺失字段。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

部署 · 2026-09-16

Android 离线 PDF 搜索架构

Android 离线 PDF 搜索架构。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

部署 · 2026-09-16

本地图片描述的证据边界

本地图片描述的证据边界。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

部署 · 2026-09-16

离线音频摘要:原始转写必须保留

离线音频摘要:原始转写必须保留。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

部署 · 2026-09-16

端侧意图分类怎样做安全回退

端侧意图分类怎样做安全回退。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

隐私 · 2026-09-16

本地 AI 统计边界:不要上传用户内容

本地 AI 统计边界:不要上传用户内容。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

隐私 · 2026-09-16

离线 AI 录音同意与状态提示

离线 AI 录音同意与状态提示。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

隐私 · 2026-09-16

端侧 AI 相机数据保留策略

端侧 AI 相机数据保留策略。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

隐私 · 2026-09-16

本地向量索引也属于用户数据

本地向量索引也属于用户数据。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

测试 · 2026-09-16

端侧首 Token 延迟应该怎么测

端侧首 Token 延迟应该怎么测。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

测试 · 2026-09-16

冷启动和热启动推理数据不能混在一起

冷启动和热启动推理数据不能混在一起。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

运行时 · 2026-09-16

LiteRT-LM Chat Template 怎么验证

LiteRT-LM Chat Template 怎么验证。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

交付 · 2026-09-16

用 WorkManager 下载大模型要注意什么

用 WorkManager 下载大模型要注意什么。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

测试 · 2026-09-16

端侧 AI 启动时间怎么拆开测

端侧 AI 启动时间怎么拆开测。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

隐私 · 2026-09-16

本地 AI 结构化日志:不记录用户原文

本地 AI 结构化日志:不记录用户原文。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

部署 · 2026-09-16

Android 离线图片批处理:并发和内存边界

Android 离线图片批处理:并发和内存边界。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

交付 · 2026-09-16

离线 AI 模型选择器应该显示什么

离线 AI 模型选择器应该显示什么。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

交付 · 2026-09-16

离线 AI 语言包如何下载、删除和回退

离线 AI 语言包如何下载、删除和回退。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

隐私 · 2026-09-16

本地 AI 隐私政策检查清单

本地 AI 隐私政策检查清单。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

测试 · 2026-09-16

端侧 AI 电池测试怎样才可复现

端侧 AI 电池测试怎样才可复现。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

隐私 · 2026-09-16

本地 AI 支持包怎样避免泄露隐私

本地 AI 支持包怎样避免泄露隐私。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

运行时 · 2026-09-16

LiteRT-LM 多轮对话状态怎么管理

LiteRT-LM 多轮对话状态怎么管理。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

测试 · 2026-09-16

本地 AI Prompt 为什么也要做版本管理

本地 AI Prompt 为什么也要做版本管理。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

交付 · 2026-09-16

端侧 AI 错误提示怎么写才有用

端侧 AI 错误提示怎么写才有用。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

隐私 · 2026-09-16

离线 AI 数据导出:预览、确认和版本

离线 AI 数据导出:预览、确认和版本。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

交付 · 2026-09-16

本地 AI 历史数据迁移怎么做

本地 AI 历史数据迁移怎么做。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

交付 · 2026-09-16

卸载端侧模型时不要删除用户数据

卸载端侧模型时不要删除用户数据。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

测试 · 2026-09-16

本地 AI Runtime 变更怎样使用功能开关

本地 AI Runtime 变更怎样使用功能开关。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

部署 · 2026-09-16

端侧 AI 结果来源怎么记录

端侧 AI 结果来源怎么记录。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

交付 · 2026-09-16

本地 AI App 安全模式怎么设计

本地 AI App 安全模式怎么设计。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

隐私 · 2026-09-16

收集本地 AI 反馈时不要上传对话原文

收集本地 AI 反馈时不要上传对话原文。按真实 artifact、运行时、设备与任务拆解证据、失败分支和发布检查,避免把估算写成兼容结论。

这个页面有问题?

提交时会附带当前页面地址和浏览器信息,帮助我们定位问题。不填联系方式即为匿名。