如果有一天,你的键盘坏了,鼠标也找不到了,只剩一张嘴,你还能完成一天的工作吗?
两周前,我给自己下了这个战书。
不是随便回几条微信、写个便签那种。是一个完整的项目:策划一场虚拟的线上发布会,主题是"AI 工具 2026 年中盘点"。从策划方案、开场演讲稿、配套 PPT,到宣传海报文案,全部只用语音完成。
工具只有一个:千问电脑端。
我知道这听起来有点极端。但正是这种极端场景,才能测出一个 AI 语音工具的真正上限,它到底是"偶尔用用的语音输入法",还是真正能让你"用嘴干活"的桌面助手?
下面是这场实验的完整复盘。有惊喜,有翻车,全程实录。
设计:4项任务,层层递进在开始之前,我先把发布会拆成了4个具体任务,这样评测就有了一把尺子:
阶段任务评测标准(耗时,成功率)
策划
写一份完整策划方案(流程、时间线、嘉宾设置)
方案完整度
内容
写一篇 1000 字开场演讲稿
语言流畅度
内容
生成一套 10 页配套 PPT
结构合理性
内容
生成 5 张宣传海报文案
创意度
规则很简单:全程不碰键盘。所有文字输入通过千问的语音输入法完成,所有任务通过动嘴来完成。
先说操作方式,后面就不再重复了,千问语音输入法有两种用法:
单击1个快捷键(Win:右 Alt,Mac:右 Command)→ 语音输入,不是简单转写,能帮你去口水化、去口误、结构化表达。
单击2个快捷键(Mac:右Command+右Option,Win:右Alt+右 )→语音指令,你说"帮我干 XXX",AI 直接帮你干活
当然也可以根据自己使用习惯自定义,我个人习惯是把语音指令的快捷键修改为双击右 Command 键。
第一关:策划方案,语音输入能扛住"正经内容"吗?第一个任务是最基础的:口述一份发布会策划方案。
很多人对语音输入的第一反应是,说话太口语了,写出来的东西能用吗?我也是因为这个质疑,才把策划方案放在第一关。
我在文档上直接单击右Command键,开始口述:
> "帮我策划一场线上发布会,主题是 AI 工具 2026 年中盘点,目标是面向 AI 从业者和工具使用者,时长 90 分钟。分为四个环节:年度趋势总结、五大工具盘点、嘉宾圆桌讨论、观众互动 QA。时间是 7 月第一个周六下午两点,线上直播。"说完千问自动识别转写完成。
让我比较意外的是两件事:
第一,它自动过滤了我口述中的"呃""那个""就是"这些口水词,转写出来的文字比我说的干净得多。
第二,中英混合识别没翻车。"QA","AI工具","圆桌讨论"这些词全对,这一点对经常在中英文之间横跳的人来说太重要了。
有了第一版框架,接下来才是真正考验结构化能力的时候,第一版只有大概方向,没有具体时间分配、没有嘉宾信息、没有推广计划。我对着方案口述了两轮补充,看千问能不能一边识别语音、一边自动整理出层级分明的完整方案。
我接着口述了两轮修改意见:
第一轮补充,加入时间分配、嘉宾设置和推广计划。
第一版只有四个环节没说各多长、没说嘉宾是谁、没说怎么推广。我单击右 Command,把这些全部补上,从头说了一遍完整的方案:
首先,第一部分,活动基本信息:主题是 AI 工具 2026 年中盘点,面向 AI 从业者和工具使用者,总时长 90 分钟,时间是 7 月第一个周六下午两点,线上直播形式。其次,第二部分,活动流程和时间分配。第一个环节,开场趋势总结,给 15 分钟,我来主讲,概述上半年 AI 工具领域的几个关键变化。第二个环节,五大工具深度盘点,给 30 分钟,每个工具 6 分钟,逐个展示核心功能和适用场景,也是我来讲。第三个环节,嘉宾圆桌讨论,给 25 分钟,围绕'AI 工具的下半场'这个话题展开。第四个环节,观众互动 QA,给 15 分钟,提前收集问题加现场提问。最后留 5 分钟,做总结和预告下一期。然后,第三部分,嘉宾设置。邀请两位嘉宾:第一位是某 AI 公司的产品负责人,第二位是一位独立开发者代表。每位嘉宾在圆桌讨论中发言 10 到 12 分钟。最后,第四部分,推广计划。发布前一周发两轮预热海报,发布前三天发嘉宾预告海报,发布当天实时推流。宣传渠道用公众号、视频号和 B 站同步。"
我注意到2个细节:
首先/其次/然后/最后"自动变成了一级编号,"第一部分/第二部分/第三部分/第四部分"自动变成了大标题,两个层级一次识别。
第二部分的每个环节后面,它自动标注了时间,开场趋势总结(15分钟),五大工具盘点(30分钟),四个环节合计 15+30+25+15=85 分钟,结束语 5 分钟,总计 90 分钟"。这句校验是我口述时没说的,它自己算出来的。
第二轮补充,细化嘉宾分工和推广节奏。
第一轮补完之后,嘉宾只有人数和身份,推广只有大致时间点。第二轮我把这两块细化,继续单击右Command,再一次完整口述:
首先,第一部分,嘉宾设置细化。原定的两位嘉宾不变,再增加第三位神秘嘉宾在圆桌讨论的最后 10 分钟出场,做一个 5 分钟的简短分享。三位嘉宾的具体分工是:嘉宾一负责从行业视角聊 AI 工具的产业化趋势,嘉宾二负责从开发者视角聊工具生态和开源动态,神秘嘉宾负责一个惊喜互动环节。每位嘉宾发言时间统一为 10 到 12 分钟,神秘嘉宾的分享控制在 5 分钟以内。其次,第二部分,推广节奏细化。预热期分成两个阶段来执行:第一阶段,发布会前 7 天到前 3 天,发两轮概念海报,第一轮制造悬念、第二轮释放关键信息;第二阶段,发布会前 3 天到当天,每天发一位嘉宾的预告短视频,三天按嘉宾一、嘉宾二、神秘嘉宾的顺序依次发布。另外,推广渠道除了之前确定的公众号、视频号、B 站之外,增加小红书和知乎,覆盖图文和问答场景。"
转写结果出来。这次的结构化表现进了一步:
嘉宾部分的三个人,嘉宾一,嘉宾二,神秘嘉宾,被单独拆成了三个子条目,分工、发言时间各占一行,不是一大段文字糊在一起。
"第一阶段/第二阶段"被识别为"推广节奏"下面的二级编号,嵌套结构识别正确。
另外后面追加的小红书和知乎,被正确放到了推广渠道列表的末尾,没有因为句子位置靠后就飞到别的地方。
两轮补充下来,方案从最初的四句话框架,变成了四板块、两层级、时间精确到分钟、嘉宾分工明确、推广节奏清晰的完整策划案。全程,我没碰键盘。
第一条结论:语音输入可以处理正经内容,不只是回微信用的,还能自动做结构化整理,你可以分多轮来补第一轮搭骨架、第二轮填血肉,每一轮千问都帮你整理好。
第二关:演讲稿,当你说出来的话比打出来的更好接下来是 1000 字的开场演讲稿。
这次我用的是双击。双击右Command,对着麦克风说,大概内容:
帮我写一篇 1000 字左右的发布会开场演讲稿,主题是 AI工具2026年中盘点,语气要正式但不生硬,开头最好有一个故事性的引入。"
千问开始生成。
大概十几秒后,一篇完整的演讲稿出现在文档里。
我仔细读了一遍。坦白说,质量超出预期,有故事感,全文的语言节奏也比我打字写出来的更自然、更有起伏。
这让我意识到一件事:说话和打字,本质上会影响你给AI的指令质量。打字的时候你会反复推敲、删删改改,最后给出一条过度优化的 prompt。说话的时候你是自然表达,prompt 更接近真实需求,AI 的输出反而更有人味。
当然也会出现幻觉问题,这个演讲稿还要精修,风格不错,但是具体细节和数据可以继续补充修改
修改也很方便。我选中那段话,双击唤起语音指令,说"把这段改得更口语化,加一个具体例子....."。
第二条结论:语音生成的演讲稿,比我打字生成的更自然。但数据细节需要再修改
第三关:PPT,真正让我服气的时刻接下来是整场实验的高潮:用语音指令生成 10 页配套 PPT。
这是我之前最没信心的任务。PPT 涉及结构化表达、排版、视觉呈现,光靠说能行吗?
我选中刚刚的文本,接着双击快捷键:
帮我把刚才的策划方案和演讲稿转化成一份 10 页的 PPT。包含封面、议程页、4个主题内容页、圆桌讨论介绍页、QA 环节页和结尾致谢页。"千问先展示了一个分析过程,它把策划方案拆解成了 PPT 的逻辑结构,规划了每页的内容和布局。这个过程大概花了 30 秒。然后 PPT 生成了。
第一次生成的成品:
↑ 上下滑动查看完整图片 ↑
翻了一眼内容:每页的主题清楚、结构逻辑通顺。虽然不是专业设计师水准,但作为一份"说出来就出来的 PPT,几十秒 vs 之前手动做两小时,这个质量很不错了。
第三条结论:语音生成 PPT 是整个实验里效率提升最大的环节。从 2小时降到几十秒。
第四关:生成海报文案海报用了同样的方式。双击说出需求:"帮我写5 张发布会宣传海报的文案,风格要有冲击力,每张聚焦一个不同的卖点”
第四条结论:高创意型海报文案需要人工判断,但千问这里给出5个还是很不错的,基本不用修改
评分总结:到底能替代多少工作?
任务完成度首次成功率实际耗时预估(生成加修改)传统预估耗时
策划方案
90%
一次过
10 分钟
60 分钟
演讲稿
85%
一次过
5 分钟
90 分钟
10 页 PPT
80%
第二次
20分钟
120 分钟
海报文案
95%
一次过
1分钟
30 分钟
4项任务全部完成,总耗时约 36 分钟,传统方式预估需要 300 分钟(5小时)。效率翻了好几倍。
翻车地方有几个地方必须诚实说:
PPT 第一版不够 10 页,需要补指令才能完整生成。所以不是每次说一句话就完美交付。
长时间连续使用后偶尔需要等待。复杂任务(如 PPT 生成)会有几十秒的处理时间,不像打字那么即时。但这个等待时间远小于你手动做这件事的时间。
还有一个问题,在文档里生成的文案及时保存,因为我测试过程遇到过一次删除文案的情况,这个算是这次测试里遇到的最大的一个bug,希望千问后续优化一下。
如果你在一个特别安静的开放办公室里,对着电脑说话多少会有点尴尬。这是语音输入本身的物理限制,跟工具无关。
最后想说的:语音办公不只是替代打字做完这场实验,我最大的感受不是语音比打字快,这本来就在预期之内。
真正让我意外的,是交互方式的改变。
打字的时候,你和 AI 之间隔着一层"措辞过滤器"。你会反复推敲 prompt,删了改、改了删,最后给出一条小心翼翼的指令。说话的时候,你是自然表达。Prompt 更长、更具体、更接近真实意图。AI 的输出质量反而更好。
这不是替代,是升级。
当然,我也不会从此把键盘扔了。精确调整格式、核实数据、处理敏感信息,这些还是打字更合适。但如果你问我现在写方案第一稿、做 PPT 大纲、出海报文案用什么方式,我会说,我动嘴。
顺便说一句,为什么我选千问来做这个实验。两个原因比较实在:第一,它完全免费,包括语音输入功能、内置的AI工具都不收费,不像有些工具用着用着就要付费;第二,它支持 Windows 和 Mac,我是两台电脑换着用的人,这一点对我很重要。
如果你也想试试动嘴干活的感觉,可以在千问官网下载电脑客户端,免费,好上手。单击右 Alt(Win)或右 Command(Mac),说第一句话,就开始了。
https://www.qianwen.com/download#千问#千问电脑端#千问电脑办公#千问语音输入法
--end--
最后记得我,每天都在更新:如果觉得文章还不错的话可以点赞转发推荐评论
/...@作者:你说的完全正确(YAR师)
本文网址:




