快手创始人宿华押注的 Voice Cursor,语音输入又卷起来了

快手创始人宿华押注的 Voice Cursor,语音输入又卷起来了

语音成为了AI交互的新方式。

手机输入法里按住麦克风说几句话,电脑听写负责把声音转成文字,遇到识别错误再自己改,类似功能存在了很多年。

大模型加入后改变了局面。

过去一年多,国内各个大厂AI语音输入法、Typeless等产品陆续获得关注,语音输入出现了另一种产品形态。

快手创始人宿华押注的 Voice Cursor,语音输入又卷起来了

国内的变化尤其明显,豆包输入法把语音作为核心卖点,支持方言、中英混说和弱网环境;

千问今年5月在PC端加入语音输入,除了去掉语气词和纠错,还会整理口语格式,并能结合前文继续处理内容;微信输入法也持续强化语音,支持结构化输出。

原本需要说完以后再删删改改的内容,如今有机会直接变成一版可以发送的文本。

快手创始人宿华押注的 Voice Cursor,语音输入又卷起来了

此外,该赛道的明星产品Typeless也已经获得真格基金和StartX支持,老玩家Wispr Flow则更早跑出规模。

最近,赛道里又出现了Voice Cursor,并宣布完成800万美元种子轮融资,由快手创始人宿华以个人身份领投。

快手创始人宿华押注的 Voice Cursor,语音输入又卷起来了

该团队的创始人陈龙并非第一次创业,他早年做过百度NLP,也在微软和Square工作过;

之后创办鳄梨科技,拿过红杉中国、金沙江创投、奇绩创坛和顺为资本等机构的投资。被收购进入字节体系后,他又做到飞书产品副总裁。

图像

另一位联合创始人Henry Song是伯克利计算机背景,学生时期已经连续折腾过几个AI项目,还有奇绩创坛和真格基金相关经历。

Voice Cursor的使用方式与其他的语音输入并无区别,按下快捷键就能直接说话。

说话之前也无需先把句子组织完整,重复内容、停顿和中途改口会被重新处理,生成的文本更接近一封能够直接发送的消息。

快手创始人宿华押注的 Voice Cursor,语音输入又卷起来了

类似能力并不罕见,只不过Voice Cursor更强调文字生成之后的操作。如果刚才那段内容太长,可以直接选中已有文本,再说一句简短一点;语气太生硬,也能选中后要求改得自然一些。

Voice Cursor名字里的Cursor,指向的正是这种体验。它希望语音能力跟着光标移动,用户正在什么软件里工作,语音就在哪里参与输入和修改。

快手创始人宿华押注的 Voice Cursor,语音输入又卷起来了

当前应用、选中的文字以及输入框附近已有的内容,都能帮助系统判断此刻的表达意图。因此,Context成了重要关键词。

同一句话出现在工作场景和正式邮件里,适合的表达往往不同。陌生的人名或者项目名如果刚刚在前文出现,系统可以结合已有内容进行识别,当然这些也算不上什么壁垒。

用户选中一段话之后继续说,软件还要判断此次语音属于补充内容,还是要求改写原文。

og-image.png

值得注意的是,Voice Cursor团队最近上线了一个叫VoiceKit的硬件产品。

它是一块可以随身携带的小设备,配对Voice Cursor之后,用户可以直接通过它说话,并完成文字输入、编辑、点击和发送等操作。

VoiceKit并不是一台完全独立运行的AI设备,它需要配合Voice Cursor使用,底层硬件则来自M5Stick S3。用户如果本来就有这块设备,还可以自行刷入VoiceKit的开放固件。

快手创始人宿华押注的 Voice Cursor,语音输入又卷起来了

目前Voice Cursor的年费为144美元,订阅一年会免费赠送一块VoiceKit Stick,单独购买则为99美元,不过仍然需要Voice Cursor软件才能使用。

VoiceKit上线首周获得了100名用户,并且这批用户第二天全部再次使用了产品。对于一款刚开始测试使用习惯的产品而言,这也是团队目前最关注的指标之一。

快手创始人宿华押注的 Voice Cursor,语音输入又卷起来了

陈龙最近在社交媒体分享自己的AI工作方式时,也提到相似的习惯:他会先用语音记录脑子里刚冒出来的内容,再交给Claude继续思考,最后进入光标位置执行。

对他而言,信息最容易丢失的环节恰好发生在想法准备写出来的时候,脑子里原本带着很多背景和细节,一旦切换到键盘,表达常常会被压缩。

快手创始人宿华押注的 Voice Cursor,语音输入又卷起来了

AI工具越来越强以后,很多工作开始变成向机器解释任务,但其中有个很容易被忽略的问题:用户脑子里的需求通常比最后输入的Prompt丰富。

键盘输入存在时间成本,人会自然压缩表达,原本包含目标、限制条件、具体例子和原因的一段需求,最后敲进输入框时可能只剩一句简化指令,模型获得的信息变少,结果也更容易偏离预期。

快手创始人宿华押注的 Voice Cursor,语音输入又卷起来了

语音提供了另一种可能,很多AI编程工作已经不要求开发者亲自敲完每一行代码,大量时间反而花在描述修改意图,虽然可能有些人更喜欢打字速度与思考速度同频共振的感觉。

如果最终只输入一句让页面简单一点,模型得到的信息很有限,语音则允许用户在相近时间里交代更多背景,再由Voice Cursor清理成适合发送给AI的文字。

快手创始人宿华押注的 Voice Cursor,语音输入又卷起来了

不过对于AI语音赛道,其竞争已经相当激烈,Typeless是最直接的参照之一。

它同样可以清理口语表达,处理临时改口,并根据不同应用调整文字风格。此外还有Wispr Flow,一个很早就开始研究新的语音交互方式的公司,后来将主要精力投入AI语音输入。

遇到技术术语和专有名词,它会利用词典与周围内容提高识别效果,不同应用还可设置相应的写作风格。

快手创始人宿华押注的 Voice Cursor,语音输入又卷起来了

因此,Voice Cursor很难依靠某个单独功能宣称自己开创了全新的产品形态。

选择在此时进入,并在产品还很早,团队规模也很小,却快速获得一笔不低的种子融资的情况下,创始团队的经历自然成为另一条重要因素。

陈龙的本科阶段在哈尔滨工业大学学习计算机相关专业,之后前往南加州大学继续深造。百度时期的NLP经历,让他很早接触语言模型和输入问题。

快手创始人宿华押注的 Voice Cursor,语音输入又卷起来了

2019年,陈龙回国创办北京鳄梨科技。鳄梨科技做的是招聘相关软件,核心产品曾围绕AI面试和招聘管理展开。企业面对大量候选人时,传统面试需要消耗很多时间,团队尝试利用视频和AI辅助完成筛选。

另一位联合创始人Henry Song,Berkeley官方曾介绍过他的创业经历,高中时期开发的软件曾获得一家世界五百强公司的关注。

快手创始人宿华押注的 Voice Cursor,语音输入又卷起来了

大学期间,他参与过GPTBang,后来创办Skylow。Skylow一度尝试用AI重构视频学习体验,UC Berkeley的CS61A课程也曾采用相关产品。

公司给出的长期目标也很清楚,希望让人和机器之间的语音交互变得更加自然。

接下来,Voice Cursor面对的竞争已经很难停留在谁识别得最准。

快手创始人宿华押注的 Voice Cursor,语音输入又卷起来了

底层模型快速进步以后,很多产品都能获得不错的基础转写效果,用户最终感受到的差异,会越来越集中在系统如何处理说话之后的内容。

另外,国内产品还有生态优势,而独立创业公司没有同等规模的入口,只能靠更鲜明的交互和更强的跨平台体验争取用户。

当生成式AI正在让越来越多软件接受自然语言指令,原本需要连续点击完成的任务,逐渐能够直接告诉Agent结果要求。

快手创始人宿华押注的 Voice Cursor,语音输入又卷起来了

随着执行成本下降以后,表达意图的效率变得更加重要,用户如何将脑子里的信息尽量完整地交给模型,同样会影响最终产出。

语音恰好适合承接其中一部分需求。

它早已不只是输入法里的一个按钮,AI开始负责理解和整理之后,语音能够进入更多工作环节,也获得了重新设计产品的空间。

快手创始人宿华押注的 Voice Cursor,语音输入又卷起来了

目前Voice Cursor仍处在很早的阶段。Wispr Flow已经建立起大量融资、用户和产品规模,Typeless同样提前积累了不少功能,后来者面对的竞争压力只会更大。

Voice Cursor值得关注的重点,也不在于今天比竞品多出多少功能。

它更像一个新的信号,AI越来越擅长执行任务以后,人和机器之间如何表达意图,正在成为新的产品机会。

语音输入,又卷起来了。

本文由作者@虾蛄AI,授权发布于平台,未经许可禁止转载。

AI情报

10 万 Star 的 DeepSeek Harness,终于有开源桌面版了。

2026-8-16 15:10:45

AI情报

Qwen-Audio-3.0系列语音模型正式上线千问AI平台

2026-8-17 15:59:25

0 条回复 A文章作者 M管理员
    暂无讨论,说说你的看法吧