很可惜 T 。T 您现在还不是作者身份,不能自主发稿哦~
如有投稿需求,请把文章发送到邮箱tougao@appcpx.com,一经录用会有专人和您联系
咨询如何成为春羽作者请联系:鸟哥笔记小羽毛(ngbjxym)
作者|雨谷
声明|题图来源于网络。惊蛰研究所原创文章,如需转载请留言申请开白。
谁能想到,在市场格局几乎已经是铁板一块的情况下,输入法这个基本没什么存在感的“小众赛道”,竟然会在AI时代再次掀起新的波澜。
2025年下半年以来,豆包输入法、千问输入法相继上线,并且两款产品都把语音输入作为主打功能。有意思的是,就连2022年上线的微信输入法也在去年12月完成3.0大版本更新,重点升级了语音输入能力。而在海外市场,2023年开启公测的Wispr Flow已经累计获得8100万美元融资,估值突破20亿美金。
大家都在关心大模型和Agent的快速迭代时,输入法为何突然又火了?这幅奇异的景象背后,其实是一场关于AI时代的“未来战争”。
关于大厂们突然不约而同布局语音输入法的原因,业界早有共识。随着AI对话框取代搜索框成为新的流量入口,用户在线时长、互联网流量迎来一轮重新分配。而在大模型之外,输入法作为日常使用频率最高,并且能够跨应用、跨场景的基础性功能,同样具备“系统级入口”的潜力。由此,作为AI调用入口的输入法也就成为了大厂的必争之地。
不过,这个原因只解释了为什么大厂们“要做输入法”,并没有解释为什么“要做语音输入法”。而“语音”的一词之差,恰恰是关键。
在大部分普通用户的印象中,语音输入可能就是“我说你写”,其核心原理是识别用户语音然后转录成文字。但是由于早期语音识别多基于统计模型实现,准确率受环境、口音、口语化影响特别明显,语音输入远不如键盘输入准确。因此,语音输入虽然可能会在速度上更具优势,但准确率的短板让语音输入难以真正普及。
但如今,随着大模型能力的迅速提升,准确性的问题早已解决。更重要的是,在AI功能的加持下,输入法已经不只是一个转录声音的工具。
例如豆包输入法就是基于豆包同款语音大模型开发,除了准确率高达98%以上,键盘输入还具备自动纠错功能,可以结合上下文语义分析,实现文字、符号、表情以及日期的智能联想。千问则号称支持口语净化、智能纠错、上下文理解及创作、问答、翻译等指令。
换句话说,基于AI大模型推出的语音输入法产品,相当于一个具备标准化语言能力的自动化文本处理器。更形象地说,语音输入法就相当于一个“笔替”,用户不但可以用它回复日常工作和生活中的消息,还可以用AI语音输入法直接写作。这种产品功能的显著提升,让输入法实现了用户价值的突破,因为有了重新打开市场的机会。但更关键的是,AI自身的发展也需要语音输入法。
从生成式AI的发展到当前AI办公的流行,有一个问题逐渐浮出水面。Chatbot可以只花几分钟就给到一份旅游攻略,但用户可能需要十几分钟把出行需求的文字输入到对话框里。办公Agent可以只用几分钟就完成一份工作报告,但用户下需求之前,必须先花时间交代清楚项目背景、明确报告形式。
明明模型的能力越来越强大,AI的功能越来越丰富,但人类使用AI的效率似乎并没有实现飞跃性的提升。产生这种矛盾的原因,其实就是“打字”的交互方式,成为了限制人类使用AI的效率瓶颈。
如果还原打字和语音两种输入方式的行为过程会发现,打字是一个从思考、组织语言到敲键盘的过程,而语音输入除了省略了敲键盘的环节外,在具备自动纠错、结合上下文语义分析的模型能力加持下,组织语言的环节也几乎可以省去。因此,语音比打字的输入效率更高,语音输入法通过提高“输入效率”,也提升了人类使用AI的生产效率。
值得一提的是,正因为语音输入几乎“砍掉”了敲键盘的环节,从而变得更高效,不少热爱Vibe Coding的用户,还开始流行定制只保留了四个按键的语音输入键盘,这也从侧面反映出语音输入法对于使用AI的独特价值。
在运用语音输入使用AI的场景下,可以看到一个新的交互流程正在产生,用户通过输入法说话,输入法把语音内容转成文字,AI再理解文字并完成任务。在这个流程中,输入法相当于人类使用AI的“操纵杆”,所以输入法可以看作是AI的调用入口。但是如果把眼光放得更长远一点,AI入口就一定是输入法吗?
7月底,OpenAI给出了一个非常值得关注的答案。OpenAI宣布已对ChatGPT桌面应用进行更新,将ChatGPT Voice的语音能力进一步延伸到桌面端的ChatGPT Work和Codex等工作场景。
这意味着,用户可以直接通过语音指挥智能体干活,还可以随时用语音查看任务进度、继续提问、打断或重新向Agent下达指令。在这种场景功能下,语音不只是输入方式,而是开始成为电脑系统的操作方式——这或许将是AI时代人机交互真正的分水岭。
在“语音输入”这件事情上,国内AI大厂和OpenAI其实已经走出了两条路。国内大厂目前在做的,是把AI装进输入法,用产品的工具属性来满足用户使用AI的具体场景。OpenAI则是在尝试把语音装进AI工作台,让用户用AI直接操作电脑。
两种路线的根本区别在于,前者争夺的是用户在微信、浏览器、聊天软件、办公软件里的“输入权”,后者争夺的则是“操作权”。某种程度上,OpenAI的路线明显更具有AI Native的风格。但这两种路线本身并不存在高低之分,只是在不同市场环境下天然存在路线差异。
可能很多人会问,为什么国内大厂不直接让用户用语音来操作AI?这其实不是技术问题,而是生态问题。
在国内的AI市场上,几乎每家科技大厂都有自家的“大模型+AI办公”组合。腾讯有混元模型、微信、企业微信、WorkBuddy;阿里有千问、钉钉、千问办公;字节有豆包、飞书以及庞大的内容和办公产品体系。
对于这些公司来说,重新开发一个语音输入法几乎没有什么难度。它们也完全有能力像OpenAI一样,在AI工作台里加一个语音交互功能,让用户在日常场景中随时调用自家的AI。
但是如果要做一个可以控制电脑的AI,首先要考验的就是用户对产品的信任。而在此之前,OpenClaw曾因为突然失控,爆发泄露用户敏感数据、绝密文件的安全事故,引发用户对Agent的信任危机。
此外,控制电脑还需要操作系统权限、应用权限、文件权限和浏览器权限,并且还要面对不同软件之间的兼容问题。这些问题,无疑会在用户教育层面带来大量沟通成本和工作量。在AI产品尚未看到“Token经济”之外的成熟商业化路径之前,国内大厂没有理由也没有必要把步子迈得这么大。
而输入法作为人们习以为常的工具类产品,显然更容易被用户接受。因此,国内大厂们选择只做输入法的策略,明显更符合产品生态的整体布局,商业逻辑也更加清晰。但是这也不代表选择先做输入法的国内大厂,没有看到AI操作系统的方向。相反,输入法可能只是它们后续切换到这一方向的一块跳板。
如果回溯国内大厂AI产品变化会发现,过去一年各家主打的产品方向已经从“有问必答”的AI助手加速转向Agent平台。包括今年以来,AI办公成为大厂布局AI的新舞台。而在另一边,语音输入法产品也是从去年底开始密集发布与更新。
单纯从时间线来看,AI办公和语音输入法这两类看似独立的产品,意外给人一种渐渐交汇的趋势。而在现实层面,AI办公也为桌面语音输入提供了一个可用切口。
在过去,AI办公产品本质上还是一个聊天框,用户输入需求,然后等待提交结果。但现在Agent化的AI办公产品不再只是回答问题,而是能够写文档、做表格、搜索资料、分析数据、生成代码。而“一体多面”的AI办公工作台,实际上已经越来越像一个桌面Agent。
这种感觉就像AI办公工作台集成了电脑上所有软件功能和文件资料,用户只需要输入具体需求,就可以让AI干活。而一旦用户开始习惯“让AI干活”,语音输入就变得越来越重要。
试想一下,不久的将来或许会有这样的办公场景:你打开电脑,不用登录任何软件,只需要按下键盘上的语音输入按键,告诉AI“先整理昨天的会议纪要,列出今天的待办事项,然后把本周要提交的项目报表更新到最佳状态,下班前再提醒我跟进一下”,随后AI就开始自动执行任务。在整个过程中,你都不需要操作软件,甚至都不必知道会议纪要的文档在哪里、项目报表在哪里。
“让用户只需要负责说话,活儿都留给AI来干”,这才是AI工作台真正成熟的样子,也是AI时代使用AI的理想方式。而语音输入法,也有了AI系统级入口的潜力。
在移动互联网时代,谈到系统级入口,可能更多的人会想到APP、浏览器、搜索引擎、输入法,因为用户需要借助这些工具才能接入数字世界,从网络上获取信息、完成工作、执行任务。但在AI时代,AI的核心能力不是帮用户找到一个工具,而是直接把任务完成。在这种操作系统下,输入法作为一种被AI直接调用的工具,也会像其他工具一样“退居幕后”。
更具想象空间的是,当语音输入成为日常、变成全局可调用的无感交互方式,AI能够捕捉到的就不只是办公场景下的任务指令,而是用户的想法、计划和意图。用户午饭想吃什么?周末有什么计划?工作遇到了哪些问题?这些需求都会在日常表达中透露出来,AI不用像如今的某些APP一样,要通过监听用户的输入法才能获得“搜索关键词”,因为AI本身就已经承担起了输入法的功能。
所以大厂们布局语音输入法的目的,不是为了重新造一个跑得更快的“新轮子”,而是在人与AI对话的全新操作方式到来之前,先抢到一张入场券。围绕语音输入法展开的讨论,也不该是“它能不能替代键盘?”,而是“当语音成为系统级操作方式,我们还需不需要输入这件事?”“当输入走向无形,我们需要怎样的AI产品?”。
因为当AI已经能够理解自然语言、上下文和用户意图,人类要做的就只剩下表达目的。就像魔法世界里用咒语施法一样,或许未来有一天,AI也能够让用户只动动嘴就能完成所有工作,真正做到“言出法随”。
在过去,技术的进步往往也伴随着一代人的落后。就像下载APP、在互联网搜索信息这些基础操作,几乎是00后年轻一代用户的“出厂设置”,但对于很多高龄用户而言,要想使用智能手机,还得重新学习、适应系统操作。而在语音成为系统级入口的AI时代,技术的使用门槛被逐渐弱化,用户只需要表达目的,剩下的事情交给AI完成,这也是AI真正有机会改变普通人生活的方向。
语音输入法并不是AI的终点,而是一扇通往AI时代的大门。谁能够成为人类与数字世界沟通的“自然语言”,谁就能打开这扇门,真正掌握AI时代的“系统级入口”。
本文为作者独立观点,不代表鸟哥笔记立场,未经允许不得转载。
《鸟哥笔记版权及免责申明》 如对文章、图片、字体等版权有疑问,请点击 反馈举报
Powered by QINGMOB PTE. LTD. © 2010-2026 上海青墨信息科技有限公司 沪ICP备2021034055号-9

我们致力于提供一个高质量内容的交流平台。为落实国家互联网信息办公室“依法管网、依法办网、依法上网”的要求,为完善跟帖评论自律管理,为了保护用户创造的内容、维护开放、真实、专业的平台氛围,我们团队将依据本公约中的条款对注册用户和发布在本平台的内容进行管理。平台鼓励用户创作、发布优质内容,同时也将采取必要措施管理违法、侵权或有其他不良影响的网络信息。
一、根据《网络信息内容生态治理规定》《中华人民共和国未成年人保护法》等法律法规,对以下违法、不良信息或存在危害的行为进行处理。
1. 违反法律法规的信息,主要表现为:
1)反对宪法所确定的基本原则;
2)危害国家安全,泄露国家秘密,颠覆国家政权,破坏国家统一,损害国家荣誉和利益;
3)侮辱、滥用英烈形象,歪曲、丑化、亵渎、否定英雄烈士事迹和精神,以侮辱、诽谤或者其他方式侵害英雄烈士的姓名、肖像、名誉、荣誉;
4)宣扬恐怖主义、极端主义或者煽动实施恐怖活动、极端主义活动;
5)煽动民族仇恨、民族歧视,破坏民族团结;
6)破坏国家宗教政策,宣扬邪教和封建迷信;
7)散布谣言,扰乱社会秩序,破坏社会稳定;
8)宣扬淫秽、色情、赌博、暴力、凶杀、恐怖或者教唆犯罪;
9)煽动非法集会、结社、游行、示威、聚众扰乱社会秩序;
10)侮辱或者诽谤他人,侵害他人名誉、隐私和其他合法权益;
11)通过网络以文字、图片、音视频等形式,对未成年人实施侮辱、诽谤、威胁或者恶意损害未成年人形象进行网络欺凌的;
12)危害未成年人身心健康的;
13)含有法律、行政法规禁止的其他内容;
2. 不友善:不尊重用户及其所贡献内容的信息或行为。主要表现为:
1)轻蔑:贬低、轻视他人及其劳动成果;
2)诽谤:捏造、散布虚假事实,损害他人名誉;
3)嘲讽:以比喻、夸张、侮辱性的手法对他人或其行为进行揭露或描述,以此来激怒他人;
4)挑衅:以不友好的方式激怒他人,意图使对方对自己的言论作出回应,蓄意制造事端;
5)羞辱:贬低他人的能力、行为、生理或身份特征,让对方难堪;
6)谩骂:以不文明的语言对他人进行负面评价;
7)歧视:煽动人群歧视、地域歧视等,针对他人的民族、种族、宗教、性取向、性别、年龄、地域、生理特征等身份或者归类的攻击;
8)威胁:许诺以不良的后果来迫使他人服从自己的意志;
3. 发布垃圾广告信息:以推广曝光为目的,发布影响用户体验、扰乱本网站秩序的内容,或进行相关行为。主要表现为:
1)多次发布包含售卖产品、提供服务、宣传推广内容的垃圾广告。包括但不限于以下几种形式:
2)单个帐号多次发布包含垃圾广告的内容;
3)多个广告帐号互相配合发布、传播包含垃圾广告的内容;
4)多次发布包含欺骗性外链的内容,如未注明的淘宝客链接、跳转网站等,诱骗用户点击链接
5)发布大量包含推广链接、产品、品牌等内容获取搜索引擎中的不正当曝光;
6)购买或出售帐号之间虚假地互动,发布干扰网站秩序的推广内容及相关交易。
7)发布包含欺骗性的恶意营销内容,如通过伪造经历、冒充他人等方式进行恶意营销;
8)使用特殊符号、图片等方式规避垃圾广告内容审核的广告内容。
4. 色情低俗信息,主要表现为:
1)包含自己或他人性经验的细节描述或露骨的感受描述;
2)涉及色情段子、两性笑话的低俗内容;
3)配图、头图中包含庸俗或挑逗性图片的内容;
4)带有性暗示、性挑逗等易使人产生性联想;
5)展现血腥、惊悚、残忍等致人身心不适;
6)炒作绯闻、丑闻、劣迹等;
7)宣扬低俗、庸俗、媚俗内容。
5. 不实信息,主要表现为:
1)可能存在事实性错误或者造谣等内容;
2)存在事实夸大、伪造虚假经历等误导他人的内容;
3)伪造身份、冒充他人,通过头像、用户名等个人信息暗示自己具有特定身份,或与特定机构或个人存在关联。
6. 传播封建迷信,主要表现为:
1)找人算命、测字、占卜、解梦、化解厄运、使用迷信方式治病;
2)求推荐算命看相大师;
3)针对具体风水等问题进行求助或咨询;
4)问自己或他人的八字、六爻、星盘、手相、面相、五行缺失,包括通过占卜方法问婚姻、前程、运势,东西宠物丢了能不能找回、取名改名等;
7. 文章标题党,主要表现为:
1)以各种夸张、猎奇、不合常理的表现手法等行为来诱导用户;
2)内容与标题之间存在严重不实或者原意扭曲;
3)使用夸张标题,内容与标题严重不符的。
8.「饭圈」乱象行为,主要表现为:
1)诱导未成年人应援集资、高额消费、投票打榜
2)粉丝互撕谩骂、拉踩引战、造谣攻击、人肉搜索、侵犯隐私
3)鼓动「饭圈」粉丝攀比炫富、奢靡享乐等行为
4)以号召粉丝、雇用网络水军、「养号」形式刷量控评等行为
5)通过「蹭热点」、制造话题等形式干扰舆论,影响传播秩序
9. 其他危害行为或内容,主要表现为:
1)可能引发未成年人模仿不安全行为和违反社会公德行为、诱导未成年人不良嗜好影响未成年人身心健康的;
2)不当评述自然灾害、重大事故等灾难的;
3)美化、粉饰侵略战争行为的;
4)法律、行政法规禁止,或可能对网络生态造成不良影响的其他内容。
二、违规处罚
本网站通过主动发现和接受用户举报两种方式收集违规行为信息。所有有意的降低内容质量、伤害平台氛围及欺凌未成年人或危害未成年人身心健康的行为都是不能容忍的。
当一个用户发布违规内容时,本网站将依据相关用户违规情节严重程度,对帐号进行禁言 1 天、7 天、15 天直至永久禁言或封停账号的处罚。当涉及欺凌未成年人、危害未成年人身心健康、通过作弊手段注册、使用帐号,或者滥用多个帐号发布违规内容时,本网站将加重处罚。
三、申诉
随着平台管理经验的不断丰富,本网站出于维护本网站氛围和秩序的目的,将不断完善本公约。
如果本网站用户对本网站基于本公约规定做出的处理有异议,可以通过「建议反馈」功能向本网站进行反馈。
(规则的最终解释权归属本网站所有)