Normal view

There are new articles available, click to refresh the page.

Before yesterdayMain stream

千问电脑版上线语音输入法：打工人终于可以用嘴干活了

爱范儿

By: 李超凡

7 May 2026 at 10:04

Vibe Coding 火了之后，越来越多的人选择对着屏幕口述，而不是敲键盘，不少网友甚至为此整出 AI 语音键盘。

今年 3 月，Anthropic 也给 Claude Code 加了语音模式，在终端输入 /voice，按住空格说话，松手执行。很难想象，连「写代码」这种最依赖键盘输入的场景，都开始支持语音了。

既然写代码的人都开始用嘴干活了，那我一个每天写文章、写方案、做 PPT、整表格的打工人，还在一个字一个字敲键盘，显然也不够高效，尤其是查数据要切三个页面，做个汇报 PPT 要从找模板开始花三小时，整理会议纪要边听边记还漏一半。

究其原因，不是每个人的口头表达都那么好。哪怕也有一些 AI 输入法能解决，比如我们之前介绍过的 Typeless，每年光订阅费每年就得花 1000 块。

在真正干活的电脑端，至今没有和深度 AI 办公能力打通的语音入口。刚好，千问电脑版/网页版最近也上线了千问语音输入法，据说奔着「用嘴干活」而来。而且千问电脑版还是全免费——不只是语音免费，它内置的所有 AI 办公能力，全部敞开用。

别被输入法这个名字骗了

一开始，看到千问语音输入法这个名字，我下意识以为这就是一个识别准确率更好的 AI 输入法，结果我发现完全不是一回事。

千问语音输入法上手几乎没有门槛。两个快捷键搞定一切，按住是语音输入，双击是让 AI 干活。Win 是右 Alt，Mac 是右 Command，你可以根据使用习惯来设置唤起的快捷键。

你在 Word 里写文档也好，浏览器里看资料也好，钉钉里回消息也好，快捷键一按，语音入口浮出来。不用切到千问客户端，不用打开额外窗口。想问就问，想说就说。

千问语音输入法主要就两种使用姿势：按住开始语音输入，想到什么直接说就行，千问帮你自动去口水话、纠正口误、生成结构化表达。双击唤起语音指令，这时候你是在给 AI 派任务，比如查个东西、帮你回消息、生成文档。

打从一开始，它就不只是打算只做一个「帮你打字更快」的输入法。你的嘴负责下达指令，它是一个中枢接口，负责听懂、翻译、调度，让 AI 把活儿干完交给你。

说话就是比打字好使

2026 年，我对一款语音输入法的要求，已经远远不止是识别准确率。「听得清」的逐字听写都是基操，更重要的是理解我想表达什么，再帮我组织好。

比如口述一段想法，它能保留我的意图，帮同事把废话全部过滤掉，口误也顺手修正，吐出来出来的是干净、精炼、可以直接发出去的文字。

比如碰到方案延期这种事，也可以交给千问整理成一段清晰的书面表达，而我只需要直接按住快捷键，随口反馈给千问：

关于这个项目的延期，我… 啊不对，我想说的是关于这个方案的调整，其实原定计划是本周五交付，但是… 呃… 因为客户那边临时加了三个需求点，我们评估了一下大概需要多两天，所以… 不对，我的最终意思是：方案交付时间从本周五调整至下周三，原因是客户新增三个功能点，需要补充技术评估，我们承诺下周三前一定提交初版方案。

松手后结果就出来了，可以看到它自动删除所有「啊不对」「呃」「但是」等语气词，把我表达的核心清晰整理了出来；对比常规的语音输入，只能逐字记录，还要自己手动编辑，千问语音输入法基本无需手动调整，就能直接发出去。

在一些更专业和复杂的项目沟通中，千问语音输入法就更加实用了。

比如下面这个沟通需求，注意看，我长按说了一大堆话后，最后还补了一句：将关于数据部分提前。

这次产品改版的核心目标是提升新用户的留存率。我们在 onboarding 流程里增加了三个引导步骤，把原来的五步走改成了三步走，还在每个节点加了进度提示。另外，我们发现很多用户在第二步就流失了，所以把第二步的表单从 8 个字段缩减到 3 个必填字段。数据方面，改版后一周的留存率从 35% 提升到了 48%，次日留存提升了 12 个百分点。不过也有一个风险，就是表单精简后收集的用户信息变少了，可能会影响后续精准推荐的效果，这个需要持续观察。最后是团队层面的配合，设计部在两周内出了两版方案，开发部用了三天完成上线，整体节奏还是很快的。嗯把数据那段放到最前面，然后分段给我

这里结果对比就更明显了，只有千问听懂了「把数据那段放前面「」的指令，自动重排段落，我用嘴就完成了原本需要鼠标+键盘的操作。

▲ 常规语音输入结果

▲ 千问语音输入法结果

体验过程我还发现了一个让我惊喜的细节，千问语音输入法对于中英文夹杂的口述内容，识别特别到位。

这个函数的主要作用是处理用户登录时的 token 验证，首先会调用 validateToken 方法检查 token 是否过期，如果 expired 的话就返回 401，然后如果是 valid 的话，再调用 getUserInfo 接口去拉取用户信息，最后把 userId 和 role 写进 session 里面。注意一下，这里有一个 edge case，就是当 token 是 refresh token 的时候，要走另外一条逻辑分支。

千问不只把所有的英文术语都识别对了，而且还自动根据我的话分点输出，一目了然。

▲ 千问语音输入法结果

我还想分享一个对于内容创作者特别有帮助的用法，APPSO 每天早上都要开选题会，大家会有很多碎片想法，一个热点现象、一个行业观察、一个趋势判断……

之前有些想法是散装的，不成体系，现在我可以直接在会上按住唤出千问语音输入法，让它将这些想法整理成大纲。比如这一大段我在会上对编辑选题的反馈意见，如下图所示：

▲ 千问语音输入法结果

松开手后，一段详细的选题大纲就出来了，编辑能稳稳接住我的反馈，稍微扩充就能写出一篇深度分析稿件。最后的成文也附上给大家看看：苹果悄悄砍掉丐版 Mac mini，人人都要交「AI 税」的时代来了。

单就语音输入这个维度，千问给我最大感受是，真就说多快多乱都没关系，反正输出的质量 AI 会兜底。

万物皆可 Vibe，一句话的事

语音输入只是第一步，千问语音输入法更大的价值是还能帮你干活。

上面提到了整理选题大纲，然后我就需要沉浸式写作，但每次要查个数据和报告，都得切到其他网页和应用。这里千问语音输入法就很自然地出现了——它支持在任意软件、桌面全局唤起，不用切换窗口，动动嘴就能直接查。

比如我在写一篇关于 OpenAI 的文章时，刚好有一段要引用最近的融资金额和投资方。我双击唤起语音指令，说一句：「帮我找一下 OpenAI 最新融资背景。」

思考一两秒，千问小窗就直接弹出把详细结果发我了，我看着引用继续写，心流就不会被打断。

假期刚回来，一大堆工作等着推进，我需要整理一个清晰的周报，但又没时间慢慢敲字，于是双击并随口将把需求说了出来，里面夹杂着带着大量口头表达：

诶那个，我汇报下这周进度哈……A 项目目前跟进到第三阶段了，中间遇到了供应商交付延迟，大概迟了三天，后来通过加班把进度赶回来了……B 项目还在需求评审，产品那边原型图有点模糊，约了下周一早上十点对齐……下周还要申请两台测试服务器……你帮我整理为周报 word 文档，语气专业一点，条理清楚。

此外，千问语音输入法还有一个更有意思的功能——帮你回消息。

我每天往往需要在微信、钉钉、飞书等各种项目群里穿梭，回复各种消息。非常消耗精力，这时候我就能让千问让我的「嘴替」了。

比如假期还没过完就被同事催交文章，我就双击让它帮我来一段高情商回复。

▲ 我无需给它介绍背景，它就能根据屏幕内容补充上下文，给我一个「聪明」的回复

而在一些面对客户或者更正式的场合里，我也可以双击让它给我拟一个得体的回复。

这是因为千问语音输入法支持了「场景感知」。它自动识别你当前在什么应用里，看到你屏幕上的内容，据此调整输出的风格。你不用告诉它更多背景，它自己就能看懂。

下周要出差，我直接双击，在微信让它帮我根据聊天信息，整理成一个出行指南便签。

最后给我的这份出行指南，除了航班信息，还贴心地给我整理了待办事项，并根据当地天气和交通情况给了我一些具体建议，这对于常常出差的媒体人来说十分友好。

开周会的时候我还发现了一个实用的小技巧，会议开始，我双击两下唤起千问语音输入法，结束后一句：「帮我把刚才的内容整理成会议纪要。」它就自动帮我整理好了。

这很适合一些快速拉通的临时会议，不用再单独打开会议记录类的应用，随手双击马上记。

对着电脑说话，活儿 AI 自己就干完了

别误会，对着电脑喊「帮我查资料」「写个邮件」，现在只能算 AI 的基本操作。

千问电脑端这次真正亮出的底牌，是把语音输入和 PPT 创作、AI 表格、文档处理等功能组合起来，这也是真正能帮打工人实现「每天早下班一小时」的实用功能。

拿最折磨人的 PPT 来说，千问不是去素材库里给你拼凑烂大街的野生模板，而是直接用大模型的代码能力动态生成复杂排版。如果你觉得哪里不够完美？直接多轮对话让它接着改，改到你满意为止。

为了探探底，我先让它帮我做个视频号运营课程 PPT，几乎在语音落地的瞬间，AI 就进入了光速消化模式：填充血肉、匹配逻辑一气呵成。

最令人惊喜的是，千问对「图文穿插」的理解并非生搬硬套，而是根据内容深度匹配了差异化的版式，整份 PPT 拿出来，几乎就是可以直接交付的成稿。

这还没完，你还能一次性给千问喂最多 39 种不同格式的参考文件，让它自动梳理逻辑、提炼重点，帮你省去了来回翻资料的麻烦。至于配图，它也能根据上下文自动匹配，找不着合适的甚至能当场给你生图，全程都不需要你切出界面去求助搜索引擎、或者下载下来用 office 处理。

表格处理方面，千问的 Excel Agent 主打一个高水准。

不管是格式随意的聊天截图、手写笔记，还是大段的纯文本，丢给它就能快速生成标准的 Excel 表格。如果后续还要算算增长率、画个趋势图，也不用再去头疼怎么写函数公式了，直接用自然语言吩咐它就能搞定。

我试了一个稍微有点复杂的需求：让它根据 2026 广州最新版初中英语教材，把各句型的语法结构、时态变化和参考例句整理成 Excel 表格，格式要适合一页纸打印，方便拿来背诵。

换以前，这种事得自己一条条查资料、手动录入、再调格式，至少要折腾半小时。现在说一句话，它直接把表格生成好，列名、行距、例句填充，基本不需要再动手改。

文档处理这边，Word/PDF Agent 支持图文数据混合上传，能自动排版并输出直接可交付的文件。

更有意思的是，传完长文档你不需要自己去翻阅找重点，直接张嘴问，它就能快速定位给出答案；想修改哪里也是一句话的事儿，省去了自己去对照原文件一点点改的麻烦。

我试着传了一份繁杂的合同 PDF，直接问它：「独家授权内容是哪些？」它并没有傻傻地把全文复述一遍，而是精准定位到了授权条款，把独家范围、授权期限和限制事项一条条列得清清楚楚。

目前，这个语音指令甚至还能和 AI 写代码、手搓网页等任务助理功能组合使用，照这个架势下去，未来的办公形态，大概真的就是「动动嘴皮子就把活儿干了」。

和 AI 说话的人，会比键盘打字的人更早下班

用了一段时间千问语音输入法，我想到一件事。

过去几年「AI 提升办公效率」喊得震天响，但大部分人的体验是：我跟 AI 说了半天，它给我的东西根本不能用。然后就觉得 AI 也不过如此。

问题出在哪？出在沟通方式上。你用键盘跟 AI 对话，40% 的精力花在组织文字上，只剩 60% 在想你到底要什么。给出去的指令信息密度低、上下文薄，AI 当然输出垃圾。这不是 AI 不行，是你喂给它的东西不行。

语音把这个死结解开了。说话时你不会给自己设字数限制，细节会自然地冒出来，上下文会自动变厚。它能把嘴里说出的自然语言需求梳理得井井有条，让 AI 精确执行。

纽约销售平台 Clay 的教育负责人 Yash Tekriwal 提到，他用语音输入的速度是每分钟 205 个词，打字只有 110 到 120 个。但速度还不是最关键的，他发现口述的 prompt 质量更高。

AI 圈最近有个词特别火，叫 harness。它的意思大概是：你有一匹马（AI 的能力），但你得有一套缰绳才能驾驭它，让它往你要的方向跑。没有 harness，马再强壮也只是在原地打转。

千问电脑版的语音输入法就是这套 harness。

它连接的一端是你的嘴，另一端是 AI 的全套办公能力：PPT、表格、文档、搜索、分析、格式转换。你说一句话，它把你的意图翻译成 AI 能执行的指令，然后调度对应的 Agent 去跑腿。它不是输入法，是缰绳。是你驾驭 AI 办公能力的那套 harness。

而别的「带 AI 功能的输入法」解决的是什么？是入口问题，帮你找到 AI 在哪里。千问解决的是驾驭问题，帮你把 AI 的能力精确地用起来。一个是给你指路，一个是帮你套好缰绳直接上路。差距就在这。

在 Agent 时代，语音本来是驱动 AI 工作的最自然和高效的方式。千问语音输入法，就是率先在桌面入口端出了这套 harness 的产品，这也是为什么我期待，未来在更多终端上，能看到这种真正能驾驭 AI 的语音入口。

去年这个时候，如果你在办公室突然对着电脑说话，一次两次会被当成在打电话，三番五次就不禁让人怀疑，工作压力是不是太大了，精神状态还好吗？

今年开始，那些对着电脑自言自语的，可能就是全公司最早下班 (摸鱼) 的人。

附客户端下载地址：
https://www.qianwen.com/download?ch=tongyi_redirect
网页版体验地址：
https://www.qianwen.com/

#欢迎关注爱范儿官方微信公众号：爱范儿（微信号：ifanr），更多精彩内容第一时间为您奉上。

首发实测｜期待已久的HappyHorse 1.0，在千问能免费体验了

爱范儿

By: 张子豪

27 April 2026 at 19:23

那个一度在 Artifical Analysis 的 AI 视频竞技场排行榜中登顶第一的视频生成模型 HappyHorse 1.0，我们终于能用官方版了，现在打开千问 APP 和千问创作Web端（ c.qianwen.com ），直接就能用，甚至还有免费体验额度。

前段时间，一款名为 HappyHorse 1.0 的视频生成模型，悄然登顶权威 AI 评测平台 Artifical Analysis 的 AI 视频竞技场排行榜，引发社交媒体的纷纷议论。直到阿里正式认领 HappyHorse，谜团揭开，这匹快乐小马出自自家新成立不到一个月的 ATH 事业群。

今天，阿里公布了 HappyHorse 1.0 的体验渠道，千问官方首发灰测，千问 APP 和千问创作Web端都能直接使用。

移动端（千问 APP），我们只需将千问更新到最新版本，通过点击首页的「HappyHorse」胶囊，即可直接进入 HappyHorse 1.0 的生视频创作面板，并且千问还赠送了免费体验额度。

PC 网页版（千问创作 Web 端），针对有更专业创作需求的用户，可以通过浏览器打开 c.qianwen.com 登录使用。网页端每次生成消耗积分，综合对比下来，还是比较具有性价比的。

无论是文生视频还是图生视频，均支持最高 1080p 的视频分辨率。我们可以自由选择 16:9、9:16 或是 1:1 的视频宽高比，生成时长可选 5 秒、10 秒或15 秒，并且支持原生生成音频。

APPSO 第一时间拿到了体验资格，评测榜单的排名能说明结果，但是 HappyHorse 1.0 生成的视频，到底有什么优点，一起来看看我们的实测。

通过实测，能看到其实 HappyHorse 1.0 并没有在复杂的全能参考选项上做文章，而是将核心发力点放在了动作、声音、空间的自然度上，加上合理的镜头语言，和风格的准确还原，整体表现确实惊艳。

用一句指令，直接搞定运镜和故事板

大部分的主流视频模型，都会把镜头运动当做一个库，给用户来调用。所谓的镜头运动，更像是从这些库里，推进、拉远、旋转，随机挑一个运镜方式，并没有配合画面里正在发生的事情。

而镜头感作为视频最重要的一部分，往往一眼就能感受到明显的差距，但它本身又很难用具体数值来量化。

HappyHorse 1.0 的处理方式也表现得可圈可点，切换镜头的时机必须是服务于作品。情绪需要收紧的地方，镜头近一点；需要交代环境的地方，给我们全景；背后是一套有叙事逻辑的调度。

同样一个提示词，丢给多个模型生成的视频画面，可能都会偏向「固定机位」，人物站在中间，缺乏镜头调度。因为这样最不容易出错，但是给视频的观感又大打折扣。

HappyHorse 1.0 在生成的视频里，则是像一个懂行的摄影指导，各种大师级运镜，从全景到近距离跟拍马蹄的扬尘，再流畅切换到低角度仰拍拔枪的瞬间。

它打破了传统的 AI 视频生成模型「为了稳妥而选择平庸」的安全构图，用大量扎实的镜头调度，把这段追逐戏的动态张力，原原本本地拍了出来。

情绪和动作都有了层次感，微表情也能演戏

对于很多视频模型，人物动作是最难解决的问题。即便使用详细的参考生成，到了后半段还是容易出现变形，比如手指多一根、脸部模糊或者动作节奏突变。

但 HappyHorse 1.0 在这个硬指标上表现非常稳定，一段 5 秒的视频，人物动作从头到尾基本保持连贯，穿帮的频率明显更低。

举个具体的例子，我们用的提示词是一个穿着白色裙子的女生走在花海里，从画面的左边走到右边，镜头跟随，女生转动裙子，捧起一朵花闻。

HappyHorse 1.0 给的动作过渡非常自然，女孩在花丛中走路完全没有那些「太空步」的滑移，从她转动裙摆，到捧起花朵凑近鼻子，整个动作流程行云流水。

动作有层次感，人物的表情同样真实。我们生成了一个小朋友咬下酸柠檬的视频，从咬下柠檬的瞬间，到强烈的酸味，开始带来面部肌肉紧绷、五官皱起、紧闭双眼，再到酸劲儿逐渐过去，面部肌肉慢慢放松，最后茫然地重新睁大眼睛。

通过动作和表情，让人物的情绪更有层次感，HappyHorse 1.0 生成视频也更不容易让人出戏。

官方数据显示，HappyHorse 1.0 的内部 GSB（Good-Significant-Bad 人类偏好评分）是 Wan2.7 的 3 倍，动作流畅性和清晰度都进步明显。

对话听起来更像真人，环境音也开始参与叙事

除了画面表现，HappyHorse 在 AI 视频配音上的表现也比其他模型更出色。

大部分的 AI 视频配音，都有一个很难绕开的问题：听上去像在「念」，不像在「说」。

语气是平的，语调不跟着情绪走，两个人对话的时候，一方说话，另一方就在那里等着，没有反应，没有表情变化，像两个人在分别完成自己的任务。

HappyHorse 1.0 在这里的处理，是对白真的有情境感。语气和语调贴着画面里的情绪，惊讶的时候语调是对的，轻松的时候节奏是松的。多人对话的场景里，听的那一方也是自然，会有表情，有细微的肌肉反应，不是在发呆等下一句。

环境音也是一样的逻辑。书写声、翻页声、远处的背景音，这些细节在大多数视频模型里是缺席的，或者听上去是从音效库里随机抓来的。

HappyHorse 1.0 里，这些声音跟画面里正在发生的事情是对得上的，而且能参与情绪。在安静的场景里，出现一点纸张摩擦声，或许比大多数配乐都更容易让人有沉浸感。

还有一个比较小众但实用的能力：多语言的唇形同步，覆盖了普通话、粤语、英语、日语、韩语、德语、法语等语言。

输入中文文本生成人物说话的视频，嘴型就能跟上语音。这个能力的想象空间相当大，从短视频配音到虚拟主播，未来都会用得上。

不需要复杂的风格提示词，轻松拿捏经典影视剧风格

如果说前面关于镜头、动作和声音几点解决的是 AI 视频的硬件问题，即 AI 视频不能让人出戏；风格的还原，则是让最后的画面更有戏。它会开始用色彩、光影和质感，去建立属于创作者的美学氛围。

风格的添加也很讲究，不是套一层滤镜，或者一个打包好的 LUT 包，它也需要视频模型对不同美学风格的了解，以应用合适的风格化。

HappyHorse 1.0 在特定风格的还原上，细节非常扎实。各类经典影视剧的风格、老港片里胶片的颗粒感和偏冷的高光，我们在实测的生成结果里面都能看到。

无论是老水浒/三国画风那种粗粝写实的历史厚重感、光影迷离的经典港风，还是强调高反差冷峻光影的美剧质感、主打细腻柔光的韩剧氛围，它都能精准拿捏。

如果你是个对画面质感有追求的创作者，非常推荐去千问里亲自感受一下这种「导演级」的美学控制力。

AI 视频赛道需要一匹黑马

告别了动辄半天的视频生成排队，一个 Video Arena 榜单第一的模型，现在不仅直接放到了手机 App 里随手可用，还给了免费体验额度，千问这波实在是给力。

回头看 HappyHorse 1.0的这几个特点，动作不穿帮、镜头有语言感，解决了 AI 内容质量的可预期性，让我们不用再抱着「抽卡」的心态，去体验 AI 视频生成。

对白自然、真实的环境音、还有精准的风格化还原，更是让我们和创作者少了大量的后期修补成本，不需要在多个工具之间来回倒腾。

如果把这种极低门槛、高容错率的生成能力放到具体的商业语境中，价值是显而易见的。

对于新媒体运营、短剧导演或是电商营销团队而言，过去需要庞大后期团队和高昂拍摄预算才能完成的分镜预演、概念设计或视觉短片，现在只需在手机或电脑上输入指令就能快速落地。在千问里，一个人就是一支高效的视听制作团队。

▲现在我们在千问里，就能得到一段真实的虚拟主播视频

过去一段时间，视频生成赛道的竞争逻辑是「谁的模型更强」——更高的分辨率、更长的时长、更复杂的物理模拟。

拼的是参数和算法的技术竞赛，但我们真正卡住的地方很少是因为「模型做不到」，大多数时候是「做到了但用不起或用不到」，等待时间太长、声画要分开处理、动作稳不稳全靠运气，每一个环节的摩擦都在把视频生成挡在专业用户和 AI 超级创作者之外。

而这一次，千问不仅省去了我们在不同工具之间切换的折腾，把最顶级的视频生成能力直接放到了最熟悉的对话框里，更借助底层模型的实力，把这些创作摩擦一个个彻底抹平了。

▲千问现在是工作、学习、生活和创作中全能 AI 助手

HappyHorse 无疑是一匹强劲的黑马，他是阿里新成立的 ATH 事业群，在模型能力、平台分发、具体应用这条完整链条上的一块关键拼图；在千问首发灰测后，链条开始跑起来了。

从帮助用户解决日常问题、提升工作学习效率的文本对话，到如今整合了极高水准的 AI 生图与视频能力，千问的进化路径已经非常清晰：它正在打破「生活提效」与「专业创作」的壁垒。

通过一次次的功能迭代，千问正将顶级的算力平民化，真正从一个简单的问答工具，蜕变为一个覆盖用户全场景的「全能型 AI 助手」。

作为普通人，我们或许不需要关心背后复杂的算法架构，因为最好的技术，已经通过千问以最顺滑的方式装进了你的手机里。

现在，轮到大家上场了。

如果你也想体验 HappyHorse 1.0 强大的视频生成能力，千问还同步开启了「天马行空」挑战赛。一共四大 AIGC 视频赛道，20 万现金奖池等大家来拿。

直接前往千问 App 或千问创作 Web 端，用灵感在这个没有门槛的新画布上，真正「天马行空」一次。

*文章内视频播放可点击该链接预览*

#欢迎关注爱范儿官方微信公众号：爱范儿（微信号：ifanr），更多精彩内容第一时间为您奉上。