对话Soul创始人张璐团队解读AI布局,以情绪交互能力拓展应用场景
- 字号
- 放大
- 标准
在2026世界人工智能大会(WAIC)期间,AI应用与终端创新成为行业关注的重要话题。作为一家从社交领域成长起来的企业,Soul App带来了实时数字人与AI硬件“B Soul”等成果,引发广泛关注。从App到AI硬件,从社交产品到交互能力输出,Soul创始人张璐团队围绕AI交互能力持续推进技术探索,也让外界对其AI发展路径有了更多了解。WAIC前夕,Soul CTO陶明接受凤凰网科技《浪潮》栏目专访,首次较为完整地介绍了Soul在AI技术、产品布局以及商业方向上的思考。

过去一年,Soul创始人张璐团队持续推进技术研发,十个月内连续开源六款模型。其中,播客语音合成模型SoulX-Podcast登顶HuggingFace TTS趋势榜;实时数字人生成模型SoulX-FlashTalk首次实现14B数字人0.87秒亚秒级超低延时;轻量化模型SoulX-FlashHead可在单张4090显卡上达到96帧工业级运行速度;今年6月开源的端到端多人对话转录模型SoulX-Transcriber,则在多个会议数据集上取得了优于主流商用模型的表现。这些技术积累不仅提升了Soul在开源社区的影响力,也成为其进一步探索产业应用的重要基础。
围绕此次亮相的AI硬件“B Soul”,陶明表示,Soul的出发点与不少行业参与者有所不同。相比将硬件作为模型落地的载体,Soul更关注如何把线上积累的人机交互体验延伸至现实场景。过去,用户主要通过Soul App获得情绪交流体验,而离开手机之后,这种连接便中断。因此,Soul创始人张璐团队希望打造一种新的交互入口,让陪伴体验能够突破手机终端的限制。
不过,这款硬件并非Soul App的延伸,也不是手机的替代产品。陶明介绍,团队最终选择让它成为一个相对独立的体验空间,更强调陪伴和情绪交互能力,而不是简单迁移App中的社交关系。对于用户而言,它既可以作为日常陪伴工具,也能够承担个性表达与IP互动等功能,通过更加自然的交互方式,为年轻用户提供新的体验。

在产品规划中,IP也是“B Soul”的重要组成部分。陶明表示,未来硬件中将陆续加入丰富的IP角色,用户不仅可以与不同角色进行语音互动,也能够创建属于自己的虚拟形象,自定义音色,并体验包括陪伴、哄睡等多样化功能。因此,团队更希望用户关注的是背后的内容体验,而不仅仅是一件硬件产品本身。
支撑这些产品体验的核心,是Soul创始人张璐团队自主研发的SoulX实时多模态交互技术体系。与强调知识覆盖范围的通用大模型不同,Soul更关注实时理解、情绪感知以及自然交互能力,希望打造符合人与人交流习惯的人机互动方式。陶明介绍,传统的人机对话通常采用一问一答模式,而Soul希望实现更加贴近真实交流的交互体验。例如,对话过程中可以自然打断,也能够根据用户表达时的语气、停顿、副语言信息以及情绪变化,综合判断交流状态,并以更加符合场景的方式回应用户。
对于为何坚持“语音优先”的技术路线,陶明认为,视频虽然信息丰富,但使用成本较高;文字交流虽然便捷,却难以完整表达情绪。相比之下,语音兼顾信息密度与交互效率,同时包含语调、节奏、停顿等大量情绪信息。因此,Soul更关注如何在语音交互中实现情绪理解,而不仅是完成语音生成或声音复刻,这也是其与其他语音模型的重要区别之一。

Soul一直坚持以真人社交为核心,人机交互发挥辅助作用,因此产品设计更加重视人与AI之间的边界,以及AI对真实社交体验的促进作用。谈及AI是否会影响平台原有的人与人社交定位时,陶明指出,目前观察到的数据反而体现出积极作用。一些原本表达能力较弱、社交活跃度不高的用户,在与AI互动过程中逐渐建立起表达信心,也更愿意参与真实社交。
在此次专访中,陶明还介绍了Soul对于企业定位的理解。他表示,团队希望将自身打造为AI生态公司,围绕情绪感知交互能力,为不同类型的智能终端提供技术支持。这一定位既建立在长期积累的社交场景基础上,也来源于近年来持续推进的模型研发和交互技术实践。从社交平台到AI交互能力建设,再到智能硬件展示,Soul创始人张璐团队持续围绕情绪感知和人机交互展开探索,也进一步展现了Soul App在社交与AI融合方向上的技术积累和产品特色。

