产业 / 媒体
Smallest.ai 完成1300万美元A轮融资,专注打造以假乱真的超低延迟语音AI
语音AI初创公司Smallest.ai宣布完成1300万美元A轮融资,由Seligman Ventures领投,Sierra Ventures和3one4 Capital跟投,累计融资额超过2100万美元。该公司成立于2024年底,核心目标是让AI语音通话在体验上与真人对话无法区分。与依赖大型语言模型的传统方案不同,Smallest.ai开发了一种小型专用语音模型,能够模拟人类同步聆听、思考与说话的方式,将响应延迟压缩至接近零。当遇到超出模型知识范围的问题时,系统会短暂将用户置于等待状态,同时调用大型基础模型处理复杂查询,整个流程与真人客服的操作逻辑高度一致。目前,RingCentral和Truecaller已成为其客户。公司创始人兼CEO Sudarshan Kamath表示,公司的唯一目标就是让用户在通话中无法判断对方是AI还是人类。
尽管AI客服代理的能力日益增强,大多数用户仍能在通话中迅速察觉自己正在与机器交谈。Smallest.ai认为,这一问题的根源不在于大型语言模型的速度,而在于语音交互本身的特殊性。该公司押注于一种全新路径:用专为人类对话设计的小型模型,而非更大的通用模型,来弥合AI与真人之间的体验鸿沟。
Smallest.ai的核心技术是一套实时语音智能层,能够模拟人类在对话中同步进行聆听、思考和表达的过程。公司创始人兼CEO Sudarshan Kamath解释道,传统大型语言模型需要接收完整输入后才开始生成回复,这种延迟在文字聊天中尚可接受,但在语音通话中哪怕短暂的停顿都会显得极为不自然。Smallest.ai的模型则被设计为可以在用户说话的同时就开始处理信息,甚至能够在适当时机打断对话,与真人交流方式高度吻合。
在架构设计上,Smallest.ai采用了双模型协作机制。小型语音模型负责处理实时对话,保障响应速度;一旦遇到超出其知识范围的复杂问题,系统会将用户短暂置于等待状态,同时调用大型基础模型进行深度处理,随后再将答案反馈给用户。Kamath认为,这种模式将成为未来所有AI语音代理的标准架构——小模型主导实时交互,大模型按需处理复杂任务。
与竞争对手相比,Smallest.ai的定位更加垂直和专注。公司不涉足音频配音、播客制作等泛语音AI应用场景,而是将全部精力集中于企业级实时对话语音代理。在技术层面,公司重点攻克多口音识别、多语言支持以及嘈杂环境下的稳定运行等语音特有难题。目前,RingCentral和Truecaller已成为其客户,Kamath表示,所有客服类公司都是潜在目标客户群体。
面对市场上ElevenLabs、Cartesia以及专注本地语言的Sarvam等竞争对手,Kamath对Smallest.ai的差异化定位充满信心。他指出,对于Sierra、Decagon等AI客服初创公司而言,自行研发高质量语音模型会分散其核心业务的资源与注意力,因此选择专业语音模型供应商是更务实的路径。此轮融资所获得的1300万美元将用于加速模型研发与市场拓展,推动公司向其终极目标迈进——让用户在通话结束后仍无法确认对方究竟是AI还是真人。
要点
- Smallest.ai完成1300万美元A轮融资,累计融资超2100万美元,由Seligman Ventures领投。
- 公司核心技术是小型专用语音模型,可实现近零延迟的实时对话,模拟人类同步聆听与思考的方式。
- 系统采用双模型架构:小型模型处理实时交互,大型基础模型按需处理复杂问题,逻辑上与真人客服操作一致。
- 公司严格聚焦企业级实时对话场景,不涉足配音、播客等泛语音应用,与ElevenLabs等竞品形成差异化定位。
- 创始人Kamath明确将通过图灵测试作为公司唯一目标,即让用户在通话中无法区分AI与真人。
原始标题:Smallest.ai raises $13M to build ultra-fast voice AI that sounds genuinely human
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。