Qwen3.8-27B 评测表里的 CI 是什么:model card 全文从未展开

2026-08-16

读评测表最容易出事的地方,不是数字看错行,而是遇到一个自己”好像知道”的缩写。Qwen3.8-27B 的 model card 在 VL Performance 那张表里,把三行分数拆成了 “Without CI” 和 “With CI” 两个口径分开报。看到 CI 两个字母,不少人脑子里会立刻蹦出一个展开,而且不同的人蹦出来的多半不是同一个。麻烦就在这里:换一个展开,这三行分数该怎么读、能跟谁比,结论就完全不一样。

问题在于:这份 model card 里没有任何一处告诉你它是哪一个。

我们采集的是 Hugging Face Qwen/Qwen3.8-27B 仓库,快照 1d4bf0f2ff6012fd82039f2fa52739d0dd7c60c0,核对日 2026-08-16。下面的行号都是我们在这份快照的 README.md 里实读出来的。

CI 一共出现在哪几行

先把范围钉死。README.md 全文 583 行、原始 65,012 字节(换行为 CRLF)。带 “With CI” 或 “Without CI” 字样的行只有四行:

行号是什么
README.md:203VL 表 MathVision 数据行
README.md:204VL 表 BabyVision 数据行
README.md:205VL 表 CharXiv (RQ) 数据行
README.md:213VL 表脚注第 1 条

也就是说,CI 只活在 VL Performance 这张表里的三行数据、外加一条脚注。Text Performance 那张表(README.md:70README.md:174)一次都没出现过。

这三行原表的数值是这样的(列名照抄 README.md:192,加粗表示原表该单元格带 <strong>):

评测集Qwen3.8-27BQwen3.6-27BQwen3.7-PlusMuse Glimmer-30BOpus4.6 Max
MathVisionWithout CI 90.0
With CI 94.6
Without CI 85.1Without CI 90.3Without CI 65.5
BabyVisionWithout CI 65.7
With CI 85.6
Without CI 28.9Without CI 64.7
With CI 70.4
Without CI 12.6
CharXiv (RQ)Without CI 83.7
With CI 90.2
Without CI 78.4Without CI 85.8
With CI 85.9
78.8Without CI 66.0

这些数字全部是 model card 自述的评测结果,我们没有复现过任何一项,评测方法与环境以官方说明为准。

那条脚注解释的是格式,不是缩写

README.md:213 是 VL 表八条脚注里的第一条,原文是:

MathVision, BabyVision, and CharXiv (RQ): Where both settings are available, cells report “Without CI” and “With CI” separately; otherwise, only the available setting is shown. A small number of incorrect ground-truth annotations in MathVision and CharXiv (RQ) were corrected following manual verification, and all reported scores on those benchmarks were computed using the corrected annotations.

把这段话拆开看,它交代了两件事:一是呈现规则——两种设置都有的时候分开报,只有一种就只报那一种;二是 MathVision 与 CharXiv (RQ) 这两个评测集的标注被人工修正过,表里的分数是按修正后的标注算的。引用这两行分数时,这句限定必须一起带上。

它没交代的那件事,恰恰是最要命的:CI 是什么的缩写,“设置”具体设置的是什么,两种设置之间差在哪。脚注把 CI 当成一个读者已经知道的词用了。

一条可复现的检索命令

不要靠肉眼扫。判断一个缩写在文档里到底有没有被解释,最省事的办法是把两三种最可能的展开写成正则、大小写不敏感地全文扫一遍。我们扫的是这两种:

python -c "
import io,re
lines=io.open('README.md',encoding='utf-8').read().split('\n')
hits=[(i,l) for i,l in enumerate(lines,1) if re.search(r'code interpreter|Code Interpreter|confidence interval',l,re.I)]
print(hits if hits else 'NO DEFINITION OF CI FOUND')"

输出是 NO DEFINITION OF CI FOUND,零处命中。命令在 model card 所在目录里执行,python 是 Windows 上的 Python 3;Linux 与 macOS 上把 python 换成你环境里的 Python 3 解释器即可,脚本本身不用改。

零命中的意思很朴素:这份文件里既没有把 CI 展开成前一种,也没有展开成后一种。它不告诉你 CI 是什么,我们也就不知道 CI 是什么——这个位置只能留白,不能填

留白比填空值钱

我知道有人会想,猜一下又不会怎么样,反正上下文摆在那儿。但这三行的读法会因为猜法不同而彻底翻转。

同一格里的 “With CI” 与 “Without CI” 是两个不同设置下报出来的数,这两个设置差在哪、哪一个能和别的模型的哪一个放在一起看,全都系在 CI 到底指什么上面。脚注只说了「两种设置都有就分开报」,至于设置本身是什么,model card 一个字都没给。补一个自己的展开进去,下游读者接下来的每一步比较都会站在这个补出来的前提上,而且不知道它是补的。

所以稳妥的写法只有一种:原样保留 “Without CI” / “With CI” 这两个标签,引用哪一格就写清哪一格。比如要引 CharXiv (RQ) 上 Qwen3.8-27B 的分数,得写成”model card 自述其 With CI 为 90.2、Without CI 为 83.7”,不能只丢一个 90.2 出去。

顺带说个更普遍的坑:这份表里的数字撞号撞得很凶90.3 这个数在文件里至少出现在三个不同位置——Text 表 LiveCodeBench v6 行的 Qwen3.8-27B(README.md:167)、Text 表 GPQA Diamond 行的 Qwen3.7-Plus(README.md:153)、VL 表 MathVision 行 Without CI 的 Qwen3.7-Plus(README.md:203)。写”某模型得了 90.3 分”这种句子,读者根本没法回原文核对是哪一格。评测集名、模型列名、指标标签,三样缺一不可。

第三行还有一处标签不齐

CharXiv (RQ) 这一行(README.md:205)除了 CI 本身没解释,还有一处值得单独标出来:同一行里其余四列都写成 “Without CI xx” 的形式(其中两列还多一个 “With CI xx”),只有 Muse Glimmer-30B 那一格是裸的 78.8,前面既没有 “Without CI” 也没有 “With CI”。

而脚注(README.md:213)给的规则是 “otherwise, only the available setting is shown”——按字面读,只有一种设置可用时会只显示那一种,但没说这种情况下标签要不要省。文件里就是这个状态,两处的写法对不上。我们只陈述这处差异,不推断原因,也不由它去评价什么。

引用这一格的时候,老老实实写成”Muse Glimmer-30B 在该行的数值为 78.8,原表未标注 CI 设置”,别自作主张给它补一个 “Without CI”。

同一份文件里还有一个没展开的词

CI 不是孤例。Text 表第一行的评测集名写作 Terminal Bench 2.1 (Terminus)README.md:76),括号里的 Terminus 在整份 README 里也没有任何解释,它只在那一行的评测集名里出现过一次。同样的处理办法:照抄,不展开,不猜。

顺着这条线还能看到更大的一片留白。VL 表的十三个评测行里,有五个评测集(OSWorld-VerifiedAndroidWorldOmniDocBench 1.5RealWorldQAERQA)在八条脚注里完全没有对应说明;Text 表也有六个评测集没有脚注。有脚注的评测集,方法说明也只覆盖到脚注写了的那部分——评测执行日期、硬件、推理框架版本、随机种子、置信区间与方差,整节里都没有记载。这不是缺陷判断,只是在说:读表时能核到哪一层,取决于文件里写了哪一层。

什么情况说明不是这个问题

最后划个边界,免得把这套判断用错地方。

  • 如果你手里的 model card 不是快照 1d4bf0f2ff6012fd82039f2fa52739d0dd7c60c0,先重新跑一遍上面那条检索命令。上游随时可能补上一句解释,届时零命中就会变成有命中,这篇的结论也就随之失效。
  • 如果你要引的分数在 Text Performance 那张表里,那和 CI 没关系——CI 一次都没出现在表一,表一的多指标行是 Agents' Last ExamPass@1ScoreREADME.md:133README.md:138),标签体系完全不同。
  • 如果你看到的格子里是 --,那也不是 CI 的事。脚注对它的定义是 “Empty cells (—) indicate that results are not yet available or not applicable.”(README.md:184README.md:220),照抄这句定义即可,别读成 0 分、别读成”不支持”。VL 表里这样的格子共 13 个。
  • 如果分歧出在采样参数上,那属于另一条线:评测脚注里写的是 temp=1.0, top_p=0.95README.md:177README.md:179),而 model card 给使用者的推荐值、以及仓库里 generation_config.json 的实读值又各有各的写法,三处口径不完全相同,需要分别标明是哪一处,和 CI 无关。

一份 model card 里出现没展开的缩写,这在工程上是个很常见的状态。真正会出问题的不是缩写本身,而是引用的人替它做了决定,还没告诉下游读者这是自己补的。文件里查不到,就写”文件里查不到”,把行号和检索命令一起给出去——下一个人两分钟就能验证你说的对不对,这比一个看起来完整的展开有用得多。

延伸阅读


本文依据 Hugging Face 仓库 Qwen/Qwen3.8-27B 的 model card 与随仓配置文件 (config.jsongeneration_config.jsonpreprocessor_config.jsonchat_template.jinja 等)整理, 核对日 2026-08-16,对应仓库快照 1d4bf0f。 本文内容为 model card 与配置文件口径,我们没有下载权重、没有部署、也没有推理过这个模型, 因此不涉及生成质量、推理速度与显存占用的任何描述;文中所有评测数字均为 model card 自述,我们没有复现。 模型仓库内容随上游更新而变动,请以官方最新说明为准。

想系统学会用 AI?报名体系课或加入会员,照着学、照着用。