WorkBuddy 怎么写短视频脚本?口播文案指令、时长换算与四步验收

2026-08-08

写短视频脚本,卡人的通常不是”想不出讲什么”。真正让人反复重写的是另一件事:稿子在屏幕上读着挺顺,一开口念就发现全是断不开的长句,气不够用,节奏也不对。

所以把这件事交给 WorkBuddy(Tencent WorkBuddy)这类桌面 Agent,判断标准不是”它文笔好不好”,而是它写出来的句子你能不能直接念。这篇讲清楚:指令怎么写、时长怎么换算成字数、产出怎么验收、哪些情况别交给它。

一、官方给的四个说明项,一个都别省

WorkBuddy 官方文档的实践案例里有一节讲自媒体运营,短视频部分说得很明确:描述需求时要说明时长、平台类型、目标受众、输出形式这四项。官方给的示例指令是:

请帮我生成一份 60 秒短视频脚本,包含开头钩子、口播文案、镜头建议和结尾行动引导。

这条指令里,“60 秒”是时长,“开头钩子 / 口播文案 / 镜头建议 / 结尾行动引导”是输出形式。剩下的平台类型和目标受众,示例里没写死,得你自己补——而这两项恰恰最影响成稿质量。同一个选题,讲给同行听和讲给完全外行听,用词密度差一大截;平台不同,开头能给的铺垫时间也不同。

官方在这一节还给了三条建议,都很实在:先定平台再写内容明确人群与风格先出初稿再分轮微调,标题、封面、标签、正文分开优化,不要指望一轮出成品。

二、这篇的重点:口播文案和书面文案是两种东西

上面那些照做,你大概率还是会拿到一份”看着专业、念不出口”的稿子。原因很简单:模型日常写的绝大多数是给眼睛看的文字,你不说,它默认就往书面语上走。

所谓书面语的毛病,具体是这么几种:

症状典型样子念出来的问题
长定语”一款专为长期伏案工作人群设计的支撑结构”一口气接不完,念到一半得换气
书面连接词”然而""与此同时""值得注意的是”说话没人这么讲,一出口就假
名词堆叠”实现效率的显著提升”拗口,观众也要多想一秒
数字书面化”占比 37.5%“口播得说”差不多三成七”

对策是把这些直接写进指令的约束项里。不要笼统地说”口语化一点”——这句话太软,它会理解成加几个语气词就完事。要说死:这是要念出来的,句子控制在多少字以内,不许用哪几类词,数字怎么处理。

三、可直接复制的完整指令

官方在《创建任务》里给的任务描述四要素是目标 / 输入 / 输出格式 / 约束条件。短视频脚本套进去,加上口播约束,是这样:

请帮我写一份短视频口播脚本。

【目标】面向抖音,60 秒左右,讲清楚「新手买第一台显示器最容易踩的三个坑」。
目标受众是第一次自己配电脑的大学生和职场新人,基本不懂参数。

【输入】选题要点见 D:/短视频/素材/显示器选购要点.md,只用这份文件里的信息。

【输出格式】按四段输出:开头钩子(3 秒内说完)/ 口播正文(分 3 个小节)/
每小节配一条镜头建议 / 结尾行动引导。保存为 Markdown,
放到 D:/短视频/脚本 目录,文件名「显示器三个坑_口播稿.md」。

【约束】这是要念出来的稿子,不是文章。
1. 单句不超过 20 字,一句话只讲一件事;
2. 不要用"然而""与此同时""值得注意的是"这类书面连接词;
3. 不要长定语,形容词往后拆成短句;
4. 数字口语化,百分比说成"差不多三成"这种说法;
5. 素材里没有的功效、参数、对比结论一律不许写,
   拿不准的单独列在文末「待我确认」区。

最后一条是给自己留的闸。产品类内容最容易出事的就是凭空多出来的功效和参数,与其让它混在正文里,不如逼它单独列出来,你扫一眼就知道哪几句需要自己核。

如果你担心它一上来就大改素材文件,可以先用「想一想」模式让它出执行计划,确认改动范围后再执行;「做一做」模式会直接动文件。官方也提示,处理重要文件前先备份。

四、时长不要交给它估,换算成字数自己校

这是最容易被忽略的一环。你写”60 秒”,它心里其实没有秒表,只能按一个大致的字数往里填。而语速这件事每个人差得非常远——同一段稿子,有人 50 秒念完,有人 75 秒还在念,节奏偏快的账号和慢条斯理的口播账号更是两套算法。

所以正确的做法不是相信它说的”这是 60 秒的量”,而是反过来:

  1. 第一遍先给字数,不给秒数。比如直接写”口播正文控制在 260 字以内”,让它按字数写。
  2. 自己念一遍掐表。用平时出镜的语速,别刻意放慢,念完看实际用了多少秒。
  3. 算出你自己的换算比例,回头改指令。比如 260 字念了 72 秒,那你的实际速度约等于每秒 3.6 个字,60 秒就该给 210 字上下。
  4. 这个比例定下来之后,以后所有脚本指令都直接用你自己的数,不用每次重算。

这一步花不了三分钟,但省掉的是剪辑台上发现”素材差 12 秒”的返工。顺带说一句,掐表时把开头钩子单独计时——钩子只有 3 秒,超了就是超了,这一句必须是念着掐出来的,不能靠估。

五、分镜建议只能当参考

它给的镜头建议,本质是文字层面的合理推断。它不知道你手上有几台机位、房间够不够宽、有没有那件道具、外面天亮不亮。所以看到”航拍空镜转推近特写”这种,别当任务清单,当灵感清单。

实际用法是反过来:先把你的拍摄条件写进指令,比如”只有手机 + 一个固定三脚架,室内单机位,不出外景”,让它在这个框子里给建议。约束给到位,它至少不会往你拍不了的方向写。

分镜这一栏的真实价值,其实是提醒你哪几句需要画面配合——哪句该切特写、哪句该上字幕板。至于具体怎么拍,还是你说了算。

六、把数据好的脚本喂给它当样本

官方 10 个上手技巧的第 6 条是”给它看例子”,说法是:一个好的参考样本胜过十行抽象要求,样本是明确的锚点。这条在口播脚本上尤其成立。

你号里那几条数据明显好的视频,把逐字稿整理出来一两份,连同指令一起给它,直接说”照这个节奏和句子长度写,尤其学开头三句的说法”。这比你用十行文字描述”什么叫我的风格”有效得多——语气、句长、口头禅这些东西,描述起来很费劲,给例子却是一秒钟的事。

同理,第 3 条技巧说的调整方式也适用:稿子不对劲时,直接指出问题(“第二段太书面""开头不够抓人,重写”),或者补充限制条件,不用重写整段提示词。官方给的比喻是,把它当成一个很勤奋但需要反馈的实习生。

七、交付物与四步验收

交付物就是工作目录里的一个 Markdown 文件,四段结构,你打开就能对着念。文件落在哪、叫什么,指令里说死,别让它自己决定,否则跑几轮之后你自己都找不着最新那版。

验收按这四步走,顺序别乱:

  1. 出声念一遍。不是默读,是真念。卡壳的地方直接标出来,把长句劈成两句。这一步能筛掉八成问题。
  2. 看开头三秒有没有东西。前三秒如果是”大家好,今天跟大家聊一个话题”,直接毙掉重写——这句话没有任何信息量。
  3. 查有没有编产品功效。逐句对着素材文件核,凡是素材里找不到出处的功效、参数、对比结论,一律删掉或自己补证据。这是它最容易出错的一步,也是最可能给你惹麻烦的一步。
  4. 看结尾引导是否明确。“感兴趣可以了解一下”等于没说。要具体到一个动作:关注、评论区扣关键词、看主页某条视频。

八、一个延伸用法:外文视频先翻译再改写

官方实践案例的第一节里还有一条相关用法——外文视频翻译,示例指令是让它提取外文视频的字幕内容、翻译成中文,并整理成一份便于阅读的摘要文档。

如果你的选题灵感常来自外文视频,可以把这一步接在前面:先出中文摘要,把摘要当素材文件,再走上面那套口播脚本的指令。注意这只是给你自己看的信息整理,成片该有的署名、引用和授权问题,工具不会替你解决。

九、三种情况,别交给它

第一,需要现场发挥的口播。 有些内容的好看之处就在于不照稿念——街采、连麦、开箱时的即时反应。这类你需要的是一张提纲和几个必须提到的点,不是一份逐字稿。逐字稿反而会把你框住,念出来一股背课文的味道。

第二,有严格合规审查的品类。 医美、保健、金融这几类,文案里一个功效词、一句收益表述就可能踩线,而模型对这些红线没有可靠判断。这类内容的每一句都得由懂合规的人过,AI 生成只会让你多一道核查工序,不会省事。官方在专家中心那边也提示过,AI 生成内容仅供参考,无法替代专业判断,不构成决策和投资建议。

第三,依赖真实体验的内容。 试用感受、探店、长期使用报告——这类内容的价值全在”你真的用过”。没用过的东西让它写体验,写出来的必然是可以套在任何产品上的空话,观众看得出来。

小结

短视频脚本交给 WorkBuddy,收益在于把选题要点快速变成一份有结构的口播初稿。指令里把时长、平台、受众、输出形式四项说清楚,再额外加一组口播约束(短句、不用书面连接词、不用长定语、数字口语化);时长先按字数写,自己念一遍掐表算出换算比例;分镜建议当参考,验收按”念、钩子、编没编、引导”四步过。

至于开口的那个人是不是你、这段体验是不是真的——它替不了,也不该替。

相关阅读


本文依据 WorkBuddy 官方文档(workbuddy.ai/docs/zh/workbuddy/ 的《实践案例·自媒体运营》《实践案例·文件内容识别与处理》《10 个上手技巧》《创建任务》《任务对话》等页面)整理,核对日 2026-08-08,非亲测操作记录。产品功能与界面以官方最新说明为准。

想系统学会用 AI?报名体系课或加入会员,照着学、照着用。