WorkBuddy 怎么识别图片内容:截图转文档、图里的表格转 Excel、批量票据整理

2026-08-08

图片识别的脾气用过的人都知道:大部分时候好得出奇,偶尔错得毫无预兆。而且它错的方式很讨厌——不是空着不填,是给你填一个看起来很合理的值。金额里的 3 认成 8,日期里的 1 认成 7,表格某一行因为线条断开被并进上一行。这些错混在一整页整整齐齐的输出里,扫一眼根本看不出来。

所以把图片交给 WorkBuddy(Tencent WorkBuddy)这类桌面工作台,重点不在”它能不能认”,而在你怎么让它把没认准的地方交代出来,以及你自己该核哪几处

一、先分清你手上是哪一类图

三类图难度完全不同,混着交出去只会得到一份混着错的产出:

类型典型来源难点
截图转文档网页截图、聊天记录截图、幻灯片翻拍版面顺序、多栏分列,通常字迹清晰
图里的表格转 Excel报表照片、系统界面截图、纸质表格拍照行列对齐、合并单元格、表格线断裂
批量资料照片整理票据、名片、证件照、随手拍的资料数量大、清晰度参差、要归类命名

第一类最容易成,第二类看表格本身规整程度,第三类的坑不在识别而在——一百张里错三张,不逐张看就不知道是哪三张。

二、把图递进去,以及选哪个模型

官方文档在讲添加上下文时列了四种方式:用 @ 引用文件或文档、Ctrl/Cmd + V 粘贴截图、上传或拖拽文件、补充说明。截图场景用第二条最省事——不用先存盘再找路径,光标点进输入框粘贴就行;批量图片资料则适合放进工作目录,让它按目录读。

模型这层要留意。官方内置模型表里给了明确分工,其中 Kimi K2.5 的适用场景写的是「截图分析、图片转文档等视觉类任务」;同一份文档还注明,实际可用模型列表可能随产品版本、账号类型和服务可用性变化。所以别把某个模型名当常量记,看当下版本里哪个标着视觉类用途就用哪个,也可以开自动模式(Auto)让它自行选择。

这不是可选项。官方常见问题里专门有一条「无法读取图片」,给出的常见原因就是当前模型不支持对应文件类型,或者没安装相关插件与 Skill;官方做法是切换到支持图片输入的模型、把需求分步骤描述让它逐步完成环境安装与文件处理、并在插件或技能市场安装文档处理类插件与 Skill。遇到”图片发进去它却在打太极”,先怀疑模型选错了。

模式上,只读一张图出一段文字,用只问答不改文件的「问一问(Ask)」就够;一旦要批量改文件名、往目录里写产出,官方建议是处理重要文件前先备份

三、指令怎么写:三条可直接复制的

官方《创建任务》给的四要素是目标 / 输入 / 输出格式 / 约束条件。识别类任务的特殊之处在于,第四项”约束”要多担一个职责:逼它把不确定的地方标出来

3.1 截图转文档

【输入】我粘贴的这几张截图,是同一篇文章的连续页面,按粘贴顺序排列。

【目标】把截图里的文字完整转成可编辑文本,保留原有的标题层级和段落顺序,
不要改写、不要总结、不要补充原文没有的内容。

【输出格式】生成 Markdown 文件,保存到 D:/资料/截图整理 目录,
文件名为「原文整理_2026-08-08.md」。

【约束】遇到识别不清的字,用 ⬜ 占位,不要猜;
在文末单独列一份「存疑清单」,写明每处 ⬜ 出现在第几段、上下文是什么。
表格和图片说明单独成块,不要并进正文段落。

那句 ⬜ 占位最值得抄走。它默认不会主动汇报不确定性,你不要求,它就用一个看着通顺的字填上去;给一个明确的占位符号和一张清单位置,等于把”哪里没把握”搬到了纸面上。

3.2 图里的表格转 Excel

【输入】D:/资料/报表照片 目录下的 3 张照片,是同一张报表的左中右三段。

【目标】还原成一张完整表格,表头以第一张照片为准,
后两张按列拼接,行序保持一致。

【输出格式】生成 Excel 文件,保存到同目录,文件名为「报表还原_2026-08-08.xlsx」。
数字列存成数值格式,不要存成文本。

【约束】只填照片里能确认的内容,看不清的单元格留空并填 ⬜,不要根据上下行推算;
拼接后另起一个工作表,列出所有含 ⬜ 的单元格坐标,以及行数与原表是否一致的核对结果。
不要修改任何数字的量级和小数位。

两处是照着官方 FAQ 加的。一是输出格式写死:官方「生成的文件打不开」一条给的常见原因就是没在需求中明确指定输出文件类型,做法是下达任务时说清要 Word、Excel 还是 Markdown。二是”不要根据上下行推算”——表格最容易触发合理推断,一列数字缺一个,补个符合趋势的值太容易了。

3.3 批量票据、名片、资料照片整理

官方《实践案例》第一篇正好给了范式,针对的就是目录中大量命名混乱的图片、合同、票据:「请读取这个文件夹中的文件内容或文件属性,按 日期 + 主题 + 类型 的规则批量重命名,并先展示重命名预览结果。」

“先展示预览结果”是官方原话里带的,别删——批量改名跑完再发现错,得一张张改回来。补两条约束就能用:

【输入】D:/票据/2026-08 目录下的全部图片。

【目标】读取每张图片的内容,提取日期、金额、开票方、票据类型四项,
先输出一张对照表(原文件名 / 提取到的四项 / 建议新文件名),
确认后再执行重命名,规则为 日期_开票方_类型。

【输出格式】对照表先在对话里以表格呈现;
确认后另存一份 Excel 到 D:/票据/2026-08/汇总 目录。

【约束】任何一项没认清就在该单元格填 ⬜,并在表格最后一列标注"需人工确认";
不要合计金额,不要做任何汇率或税额换算;
重命名前先展示预览,我确认后再执行。

官方上手技巧里有一条”小步快跑”,主张把大任务拆成独立小目标一次推进一步,好处是发现偏了及时拉回,而不是最后整份推翻。批量识别正是最适用的场景:先出对照表,再执行改名,中间那道确认是你唯一能拦住错误的地方。

四、交付物落在哪

产出去向要在指令里说死。官方建议使用前先设置工作目录,未指定路径的任务也优先在这个目录内执行,并特意建议按任务类型分别建目录,举的例子就包括”发票整理”和”待处理照片”。识别类任务尤其该照办——原图和产出混在一起,跑第二轮时它很可能把上一轮的产出当成新输入。执行中右侧详情面板可以看到产物、全部文件和文件变更,批量任务跑完先看”变更”这一栏,比逐个打开文件快。

五、验收:命门全在数字上

写作类你读一遍就知道好不好,识别类你读一遍只能确认”通顺”,而通顺恰恰是错误最好的伪装。按这个顺序过:

  1. 先看存疑清单有几条。 要求了 ⬜ 占位、产出却一个都没有,别高兴太早:原图有模糊、有手写、有压折痕却零存疑,多半是在硬猜,这时直接追问”哪几处不太确定,按把握程度从低到高列出来”。官方说明继续追问会基于之前的上下文处理,不需要重复描述背景。
  2. 逐项核数字。 金额、日期、编号、电话必须逐个对着原图看,不能抽查。它们没有语义冗余:一句话里错一个字你看得出来,一串数字里错一位神仙也看不出来。
  3. 核条目数量。 表格核行数,票据核张数,名片核人数。对不上说明有整行整张被漏掉或被合并,这比单字识错严重得多。
  4. 核顺序和归属。 多张截图拼接最典型的错是顺序错位;多栏版面最典型的错是把右栏内容接到左栏后面。
  5. 手写、竖排、盖章遮挡处单独看。 这三种是公认的高错区,值得先跳过去看。

整体质量不行时别一句句改。官方”不满意就调整”给的四种方式里,识别任务最管用的是补充限制条件:补一句”第一列是日期不是编号""金额都是两位小数”,比让它重认一遍更有效。若长时间无响应或胡乱输出,官方口径是先切换模型、把任务拆得更小——批量图片本就是重任务,五十张一次跑不动,拆成五轮更稳。

六、这几种情况别交给它

第一,票据金额直接入账。 识别结果只能当录入草稿。错误的形态是”合理的错值”,记账一旦错了,往后每一步对账都得回来重查。要用就走”识别出草稿 → 人工逐笔核对 → 再入系统”,中间那步不能省。

第二,需要法律效力的证件信息录入。 合同主体、证件号码、签署日期这类字段,错一位的后果不是返工而是纠纷。正确用法是让它帮你列出需要核对的字段清单,人来填。

第三,大量手写体。 连笔、涂改、行距不齐都会显著拉低准确率,且错误分布不均——同一个人的字,一页里可能一半认得很准、另一半全靠猜。几十上百张手写件,逐张核对的时间很可能超过自己录入。

最后一条与其说不适用,不如说是必须带的前置动作:批量操作前先备份。官方上手技巧第 8 条说得很直接,它可能”改过头”——删掉你想保留的内容、打乱原有格式,建议动手前先复制一份备份,文件名加 _备份 或当天日期;成熟的用法不是期待它永不出错,而是提前准备好回退方案。官方常见问题里还记录过一个更具体的风险:有用户下发整理桌面的指令后执行完成,但部分文件疑似丢失,官方做法是执行前先备份、执行后优先检查目标整理目录与回收站。图片尤其经不起丢——文档丢了还能从聊天记录里翻回来,随手拍的票据照片丢了就是真没了。

小结

指令按目标 / 输入 / 输出格式 / 约束四要素写,输出格式写死,约束里要求用占位符标出不确定处并单列清单;批量改名一律先要预览再执行;验收从存疑清单看起,数字逐项核、条目数量核、顺序归属核。

至于它认没认准这件事,它自己是不知道的。这道关只能你来把。

相关阅读


本文依据 WorkBuddy 官方文档(workbuddy.ai/docs/zh/workbuddy/ 的《快速开始》《创建任务》《任务对话》《任务栏》《10 个上手技巧》《实践案例》《常见问题》等页面)整理,核对日 2026-08-08,非亲测操作记录。产品功能、内置模型列表与界面以官方最新说明为准。

想系统学会用 AI?报名体系课或加入会员,照着学、照着用。