端侧 AI · 内存
多个本地模型怎样制定内存策略
明确哪些模型可同时加载、何时关闭、怎样切换。
主查询:多模型内存策略 · 核验:2026-09-16 · 事实卡:MEMORY-01
先给结论
这不是一篇替你猜性能或设备兼容的文章。它把「多模型内存策略」拆成可执行步骤,并告诉你什么证据足以支持结论。没有真机记录时,只给方法和待验证项。
需要先收集的证据
至少把下面三项与同一个 artifact、运行时和任务绑定:
- 模型所有权图
- 切换顺序
- 组合峰值测试
若缺一项,就把它写成未知,不要用模型参数、芯片宣传或网上截图代替。
实施流程
- 记录真实 artifact
- 测未加载基线
- 测加载后状态
- 跑代表任务
- 跑最大承诺输入
- 连续运行并观察释放
每一步都要能失败并恢复。错误记录保留阶段、artifact、运行时与脱敏上下文,不记录用户原始照片、音频、文档或 prompt。
最容易写错的地方
- 所有模型常驻
- 推理中直接切换
另外要防止静默回退、未固定 revision、只留成功结果、把一次运行推广为所有设备支持。
最小复现记录
| 层 | 必须记录 |
|---|---|
| 设备 | 型号、芯片、系统、RAM 档位 |
| 软件 | App 版本与 git commit |
| 模型 | 家族、变种、revision、格式、长度、hash、量化 |
| 运行时 | 版本、请求后端、实际后端证据 |
| 任务 | fixture、输入 hash、prompt hash、输出规则 |
| 结果 | 完成、失败、取消、回退与恢复 |
发布检查单
- 目标查询已在开头直接回答。
- 所有数字都能回到事实卡或原始记录。
- artifact、runtime、设备与任务没有混淆。
- 失败、取消、清理与回退都被测试。
- 隐私和网络边界单独说明。
- 结论只适用于记录中的配置。
事实来源与延伸
本页使用奇连 AI 的端侧事实卡镜像,性能结论等待 Cove 原始 benchmark 数据。