Qwen3.8-27B 评测表里的 CI 是什么:model card 全文从未展开
读评测表最容易出事的地方,不是数字看错行,而是遇到一个自己”好像知道”的缩写。Qwen3.8-27B 的 model card 在 VL Performance 那张表里,把三行分数拆成了 “Without CI” 和 “With CI” 两个口径分开报。看到 CI 两个字母,不少人脑子里会立刻蹦出一个展开,而且不同的人蹦出来的多半不是同一个。麻烦就在这里:换一个展开,这三行分数该怎么读、能跟谁比,结论就完全不一样。
问题在于:这份 model card 里没有任何一处告诉你它是哪一个。
我们采集的是 Hugging Face Qwen/Qwen3.8-27B 仓库,快照 1d4bf0f2ff6012fd82039f2fa52739d0dd7c60c0,核对日 2026-08-16。下面的行号都是我们在这份快照的 README.md 里实读出来的。
CI 一共出现在哪几行
先把范围钉死。README.md 全文 583 行、原始 65,012 字节(换行为 CRLF)。带 “With CI” 或 “Without CI” 字样的行只有四行:
| 行号 | 是什么 |
|---|---|
README.md:203 | VL 表 MathVision 数据行 |
README.md:204 | VL 表 BabyVision 数据行 |
README.md:205 | VL 表 CharXiv (RQ) 数据行 |
README.md:213 | VL 表脚注第 1 条 |
也就是说,CI 只活在 VL Performance 这张表里的三行数据、外加一条脚注。Text Performance 那张表(README.md:70–README.md:174)一次都没出现过。
这三行原表的数值是这样的(列名照抄 README.md:192,加粗表示原表该单元格带 <strong>):
| 评测集 | Qwen3.8-27B | Qwen3.6-27B | Qwen3.7-Plus | Muse Glimmer-30B | Opus4.6 Max |
|---|---|---|---|---|---|
MathVision | Without CI 90.0 With CI 94.6 | Without CI 85.1 | Without CI 90.3 | — | Without CI 65.5 |
BabyVision | Without CI 65.7 With CI 85.6 | Without CI 28.9 | Without CI 64.7 With CI 70.4 | — | Without CI 12.6 |
CharXiv (RQ) | Without CI 83.7 With CI 90.2 | Without CI 78.4 | Without CI 85.8 With CI 85.9 | 78.8 | Without CI 66.0 |
这些数字全部是 model card 自述的评测结果,我们没有复现过任何一项,评测方法与环境以官方说明为准。
那条脚注解释的是格式,不是缩写
README.md:213 是 VL 表八条脚注里的第一条,原文是:
MathVision, BabyVision, and CharXiv (RQ): Where both settings are available, cells report “Without CI” and “With CI” separately; otherwise, only the available setting is shown. A small number of incorrect ground-truth annotations in MathVision and CharXiv (RQ) were corrected following manual verification, and all reported scores on those benchmarks were computed using the corrected annotations.
把这段话拆开看,它交代了两件事:一是呈现规则——两种设置都有的时候分开报,只有一种就只报那一种;二是 MathVision 与 CharXiv (RQ) 这两个评测集的标注被人工修正过,表里的分数是按修正后的标注算的。引用这两行分数时,这句限定必须一起带上。
它没交代的那件事,恰恰是最要命的:CI 是什么的缩写,“设置”具体设置的是什么,两种设置之间差在哪。脚注把 CI 当成一个读者已经知道的词用了。
一条可复现的检索命令
不要靠肉眼扫。判断一个缩写在文档里到底有没有被解释,最省事的办法是把两三种最可能的展开写成正则、大小写不敏感地全文扫一遍。我们扫的是这两种:
python -c "
import io,re
lines=io.open('README.md',encoding='utf-8').read().split('\n')
hits=[(i,l) for i,l in enumerate(lines,1) if re.search(r'code interpreter|Code Interpreter|confidence interval',l,re.I)]
print(hits if hits else 'NO DEFINITION OF CI FOUND')"
输出是 NO DEFINITION OF CI FOUND,零处命中。命令在 model card 所在目录里执行,python 是 Windows 上的 Python 3;Linux 与 macOS 上把 python 换成你环境里的 Python 3 解释器即可,脚本本身不用改。
零命中的意思很朴素:这份文件里既没有把 CI 展开成前一种,也没有展开成后一种。它不告诉你 CI 是什么,我们也就不知道 CI 是什么——这个位置只能留白,不能填。
留白比填空值钱
我知道有人会想,猜一下又不会怎么样,反正上下文摆在那儿。但这三行的读法会因为猜法不同而彻底翻转。
同一格里的 “With CI” 与 “Without CI” 是两个不同设置下报出来的数,这两个设置差在哪、哪一个能和别的模型的哪一个放在一起看,全都系在 CI 到底指什么上面。脚注只说了「两种设置都有就分开报」,至于设置本身是什么,model card 一个字都没给。补一个自己的展开进去,下游读者接下来的每一步比较都会站在这个补出来的前提上,而且不知道它是补的。
所以稳妥的写法只有一种:原样保留 “Without CI” / “With CI” 这两个标签,引用哪一格就写清哪一格。比如要引 CharXiv (RQ) 上 Qwen3.8-27B 的分数,得写成”model card 自述其 With CI 为 90.2、Without CI 为 83.7”,不能只丢一个 90.2 出去。
顺带说个更普遍的坑:这份表里的数字撞号撞得很凶。90.3 这个数在文件里至少出现在三个不同位置——Text 表 LiveCodeBench v6 行的 Qwen3.8-27B(README.md:167)、Text 表 GPQA Diamond 行的 Qwen3.7-Plus(README.md:153)、VL 表 MathVision 行 Without CI 的 Qwen3.7-Plus(README.md:203)。写”某模型得了 90.3 分”这种句子,读者根本没法回原文核对是哪一格。评测集名、模型列名、指标标签,三样缺一不可。
第三行还有一处标签不齐
CharXiv (RQ) 这一行(README.md:205)除了 CI 本身没解释,还有一处值得单独标出来:同一行里其余四列都写成 “Without CI xx” 的形式(其中两列还多一个 “With CI xx”),只有 Muse Glimmer-30B 那一格是裸的 78.8,前面既没有 “Without CI” 也没有 “With CI”。
而脚注(README.md:213)给的规则是 “otherwise, only the available setting is shown”——按字面读,只有一种设置可用时会只显示那一种,但没说这种情况下标签要不要省。文件里就是这个状态,两处的写法对不上。我们只陈述这处差异,不推断原因,也不由它去评价什么。
引用这一格的时候,老老实实写成”Muse Glimmer-30B 在该行的数值为 78.8,原表未标注 CI 设置”,别自作主张给它补一个 “Without CI”。
同一份文件里还有一个没展开的词
CI 不是孤例。Text 表第一行的评测集名写作 Terminal Bench 2.1 (Terminus)(README.md:76),括号里的 Terminus 在整份 README 里也没有任何解释,它只在那一行的评测集名里出现过一次。同样的处理办法:照抄,不展开,不猜。
顺着这条线还能看到更大的一片留白。VL 表的十三个评测行里,有五个评测集(OSWorld-Verified、AndroidWorld、OmniDocBench 1.5、RealWorldQA、ERQA)在八条脚注里完全没有对应说明;Text 表也有六个评测集没有脚注。有脚注的评测集,方法说明也只覆盖到脚注写了的那部分——评测执行日期、硬件、推理框架版本、随机种子、置信区间与方差,整节里都没有记载。这不是缺陷判断,只是在说:读表时能核到哪一层,取决于文件里写了哪一层。
什么情况说明不是这个问题
最后划个边界,免得把这套判断用错地方。
- 如果你手里的 model card 不是快照
1d4bf0f2ff6012fd82039f2fa52739d0dd7c60c0,先重新跑一遍上面那条检索命令。上游随时可能补上一句解释,届时零命中就会变成有命中,这篇的结论也就随之失效。 - 如果你要引的分数在 Text Performance 那张表里,那和 CI 没关系——CI 一次都没出现在表一,表一的多指标行是
Agents' Last Exam的Pass@1与Score(README.md:133–README.md:138),标签体系完全不同。 - 如果你看到的格子里是
--,那也不是 CI 的事。脚注对它的定义是 “Empty cells (—) indicate that results are not yet available or not applicable.”(README.md:184、README.md:220),照抄这句定义即可,别读成 0 分、别读成”不支持”。VL 表里这样的格子共 13 个。 - 如果分歧出在采样参数上,那属于另一条线:评测脚注里写的是
temp=1.0, top_p=0.95(README.md:177、README.md:179),而 model card 给使用者的推荐值、以及仓库里generation_config.json的实读值又各有各的写法,三处口径不完全相同,需要分别标明是哪一处,和 CI 无关。
一份 model card 里出现没展开的缩写,这在工程上是个很常见的状态。真正会出问题的不是缩写本身,而是引用的人替它做了决定,还没告诉下游读者这是自己补的。文件里查不到,就写”文件里查不到”,把行号和检索命令一起给出去——下一个人两分钟就能验证你说的对不对,这比一个看起来完整的展开有用得多。
延伸阅读
- 从头读起:Qwen3.8-27B 是什么:一个模型仓里有哪些文件、各自负责什么
- 本专题共 35 篇,完整分组目录见专题页
- Qwen3.8-27B 的评测表里,有一行两列同时被加粗
- Qwen3.8-27B 评测表的对比列:有一列在多数行上是空的
本文依据 Hugging Face 仓库 Qwen/Qwen3.8-27B 的 model card 与随仓配置文件
(config.json、generation_config.json、preprocessor_config.json、chat_template.jinja 等)整理,
核对日 2026-08-16,对应仓库快照 1d4bf0f。
本文内容为 model card 与配置文件口径,我们没有下载权重、没有部署、也没有推理过这个模型,
因此不涉及生成质量、推理速度与显存占用的任何描述;文中所有评测数字均为 model card 自述,我们没有复现。
模型仓库内容随上游更新而变动,请以官方最新说明为准。