端侧 AI · 内存
上下文窗口内存怎么在真机测
用有序峰值和失败记录验证产品承诺的上下文策略。
主查询:上下文窗口内存测试 · 核验:2026-09-16 · 事实卡:MEMORY-01, BENCHMARK-01
先给结论
这不是一篇替你猜性能或设备兼容的文章。它把「上下文窗口内存测试」拆成可执行步骤,并告诉你什么证据足以支持结论。没有真机记录时,只给方法和待验证项。
需要先收集的证据
至少把下面三项与同一个 artifact、运行时和任务绑定:
- 精确上下文长度
- 峰值指标定义
- 所有成功和失败
若缺一项,就把它写成未知,不要用模型参数、芯片宣传或网上截图代替。
实施流程
- 记录真实 artifact
- 测未加载基线
- 测加载后状态
- 跑代表任务
- 跑最大承诺输入
- 连续运行并观察释放
每一步都要能失败并恢复。错误记录保留阶段、artifact、运行时与脱敏上下文,不记录用户原始照片、音频、文档或 prompt。
最容易写错的地方
- 只测短 prompt 后外推
- 丢弃分配失败
另外要防止静默回退、未固定 revision、只留成功结果、把一次运行推广为所有设备支持。
最小复现记录
| 层 | 必须记录 |
|---|---|
| 设备 | 型号、芯片、系统、RAM 档位 |
| 软件 | App 版本与 git commit |
| 模型 | 家族、变种、revision、格式、长度、hash、量化 |
| 运行时 | 版本、请求后端、实际后端证据 |
| 任务 | fixture、输入 hash、prompt hash、输出规则 |
| 结果 | 完成、失败、取消、回退与恢复 |
发布检查单
- 目标查询已在开头直接回答。
- 所有数字都能回到事实卡或原始记录。
- artifact、runtime、设备与任务没有混淆。
- 失败、取消、清理与回退都被测试。
- 隐私和网络边界单独说明。
- 结论只适用于记录中的配置。