Soul 把实时数字人带到 WAIC:AI 社交开始同时处理声音、画面和情绪线索

Soul 在 2026 WAIC 展示 SoulX 多模态模型与实时数字人 B Soul,尝试让 AI 陪伴从文字回复走向连续对话和更丰富的非语言线索。


SoulX 与实时数字人 B Soul 参加 WAIC 2026 的新闻配图,依据公开产品和大会信息制作。 来源:Soul 官方网站与 WAIC 2026 官方企业目录


和 AI 聊天时,真正容易让人出戏的往往不是某一句答错,而是它听不出语气变化、接不住上一轮情绪,也看不懂画面里正在发生什么。Soul 在 2026 WAIC 展示的 SoulX 多模态模型和实时数字人 B Soul,瞄准的正是这些断点。

这不是简单给聊天框换一张会动的脸。公开资料显示,SoulX 希望把语音、画面、上下文和情绪线索放进同一段交互里,再由数字人用声音和表情作出连续回应。对用户来说,变化不在参数表,而在一次对话能不能少一点机械停顿、多一点前后连贯。

从“说什么”走到“怎么说”
Soul 官网把 SoulX 定位为面向社交场景的多模态模型,并展示了实时语音、长上下文和数字人相关能力。它试图识别的不只是句子本身,还包括说话节奏、画面和前后对话。这样一来,AI 的回复可以参考用户此刻的表达方式,而不是每轮都像第一次见面。

Soul 也公开了 SoulX-FlashTalk、SoulX-Singer 和 SoulX-FlashHead 等研究或开源项目,分别指向实时语音、歌声和数字人生成。它们说明这套路线正在拆成多个可验证的技术环节,但公开演示和日常长期使用之间仍有距离,不能把展台体验直接当成稳定效果。

B Soul 把模型变成一个能面对面交流的角色
WAIC 现场报道提到,Soul 展示了实时数字人 B Soul。它把语音理解、表情生成和形象呈现放在同一块屏幕上,让用户不必只盯着文字气泡。另一篇现场报道称,这款产品计划在 8 月进入量产和销售阶段;具体时间、价格和可用范围仍应以正式发布为准。

对普通用户来说,最值得看的不是数字人像不像真人,而是它能否在多人环境、弱网和长对话里保持低延迟,也能否在听错、看错或拿不准情绪时主动说明不确定。只有这些细节稳定下来,数字人才会从展台效果变成可持续使用的交互入口。

更懂情绪,也意味着要把隐私边界说得更清楚
为了判断语气、表情和上下文,系统需要处理比文字更多的个人信息。用户在使用前应能看清哪些声音和画面会被上传、保留多久、是否用于训练,以及能否删除。涉及未成年人、心理困扰或敏感身份时,更不能让数字人的自然表达替代专业帮助和真实的人际支持。

WAIC 让 Soul 的技术路线有了一个公开观察窗口。接下来更关键的更新,会是 B Soul 的正式售价、隐私设置、内容安全机制和长期对话表现。对想尝试的人,先从非敏感话题开始,并保留关闭摄像头、麦克风和历史记录的选择,会比一开始就把它当成无所不知的朋友更稳妥。

想继续了解
Soul 官方网站:SoulX 与相关多模态能力
AIbase:Soul 在 WAIC 2026 展示 SoulX 与 B Soul
智通财经转引现场报道:B Soul 展示与上市计划
WAIC 2026 官方企业目录
0
一起维护这篇内容

发现链接失效、信息过时或内容有误,可以提交更新建议。

我要更新

交流讨论

最新评论

返回顶部