Wispr完成2.8亿美元B轮融资,推出自研AI语音听写模型Canto

跨平台AI听写工具开发商Wispr AI宣布完成2.8亿美元B轮融资,估值达20亿美元。
本轮融资由Menlo Ventures领投,现有投资方Notable Capital、NEA、Neo Ventures、8VC和MVP Ventures跟投,新投资方Acrew、Forerunner、Goodwater、Peak XV、Together Fund和PLUS Capital也参与其中,使公司累计融资额达到3.61亿美元。
Wispr的核心产品是Flow,这是一款可集成到各类应用程序中的语音听写工具,支持用户在任意文本输入框内自然说话完成输入。该工具能够自动修正语法错误、口误、填充词(如"嗯""啊")以及语言停顿,将口语转化为简洁流畅的书面文字,适用于邮件、备忘录和文档等场景,在移动端、桌面端及其他希望以语音替代键盘输入的环境中尤为实用。
伴随本轮融资,Wispr同步发布了首个自研AI模型Canto的预览版。
与多数语音模型不同,Canto专门针对复杂声学环境进行训练,能够应对嘈杂环境、噪音干扰、说话中断、犬吠声、他人交谈以及各种背景声响。公司指出,目前大多数语音模型使用极为干净的录音素材训练,而Canto则通过大量真实场景样本学会了从环境噪音中快速分离人声,使用户无论是在家中、车内、路边还是办公室都能正常使用。
将Canto集成进Flow之后,该工具在嘈杂环境下的识别错误率从30%大幅降至接近5%至10%。
在安静环境中,现代AI转录技术通常已相当流畅,偶有小错;而在嘈杂环境中,识别效果往往急剧下降。过去十年里,大多数语音输入应用主要用于查天气、问时间或简单搜索等短句场景,正是因为内容简短,即便出错影响也有限。而有了Canto的支持,即便坐在车里或嘈杂场所附近,用户也可以侃侃而谈,模型能够将大部分内容准确转化为文字——这在一年前对语音模型而言还颇具挑战。
NBA三届全明星球员多曼塔斯·萨博尼斯表示:"我每天都在用Flow。我从小在英语、西班牙语和立陶宛语之间切换,它无论我说哪种语言都能跟上。"
受益于这项技术进步的不只是球员和商界人士。聋人及听力障碍群体也大量使用移动设备上的AI转录工具,而多人对话和嘈杂环境往往会导致转录结果出现明显偏差。尽管许多人目前主要依赖设备本地转录,但云端模型的持续演进正在推动整个行业向前发展。
Wispr表示,Flow上的累计输入量已超过600亿词,产品也已被近乎所有财富500强企业以及逾1万家企业采用,充分验证了其跨行业的应用价值。
Q&A
Q1:Wispr的Flow工具和普通语音输入有什么区别?
A:Flow不只是简单的语音转文字,它会自动过滤"嗯""啊"等填充词,修正语法和口误,输出干净的书面文字。更关键的是,配合自研模型Canto后,即便在嘈杂环境中,识别错误率也能从30%降至5%到10%,远超普通语音输入工具。
Q2:Canto模型是如何实现嘈杂环境下准确识别的?
A:大多数语音模型使用干净的录音数据训练,噪音一多就容易出错。Canto则专门用包含背景噪音、他人交谈、犬吠等真实场景的样本训练,学会了从复杂声学环境中分离人声,因此在车内、路边、办公室等嘈杂场景下仍能保持较高的识别准确率。
Q3:Flow目前的用户规模和企业采用情况如何?
A:根据Wispr公布的数据,用户已通过Flow累计输入超过600亿词,产品被几乎所有财富500强企业使用,企业用户总数超过1万家,覆盖多个行业,表明其在专业办公场景中已获得广泛认可。