技术博客
其他

人脸机器人登上Science Robotics封面?首形科技已完成新一轮融资

Truman2026-07-09 15:17
人脸机器人登上Science Robotics封面?首形科技已完成新一轮融资

该论文是哥伦比亚大学团队在具身智能领域的最新突破,通过自监督学习实现多语言唇音同步,显著提升人机交互的自然度,登上了机器人领域顶刊Science Robotics 






学习类人面部机器人实现逼真唇部运动 

原文标题:Learning realistic lip motions for humanoid face robots

原文链接:Learning realistic lip motions for humanoid face robots | Science Robotics


简要总结

一句话总结:

哥伦比亚大学胡宇航团队提出一种基于变分自编码器(VAE)和面部动作变换器(FAT)的自监督学习框架,使10自由度机械唇部机器人能够直接从语音音频中推断逼真的唇部轨迹,在10种未训练语言中实现精准唇音同步。


核心方法:

  • 高自由度机械设计:采用软硅胶嘴唇和10自由度联动机构,覆盖24个辅音和16个元音的发音嘴型;


  • 视觉-动作隐空间对齐:通过VAE将合成视频帧编码为隐向量,与真实机器人动作数据建立映射关系;


  • 时序动作预测:设计FAT模型融合历史动作指令和未来隐向量,生成平滑连续的马达控制信号。


一、问题根源:为什么机器人嘴唇总像“假唱”?

人类对话中近50%的视觉注意力集中在嘴唇运动上,但传统人形机器人常因两大瓶颈导致唇音不同步:


1. 机械限制:多数机器人嘴唇仅支持1-2自由度开合运动,无法复现人类发音的细微形状变化(如圆唇、嘴角收缩);


2. 规则依赖:基于音素-动作映射的预定义规则缺乏适应性,难以处理多语言或个性化语音。


二、解决方案:从“硬编码”到“自学习”的范式转变

2.1 机械创新:10自由度仿生嘴唇设计

团队摒弃传统的线缆驱动方案,采用磁吸式快拆结构连接硅胶皮肤与机械骨架:


  • 上唇:3个垂直驱动器,模拟发/w/、/r/音时的前凸动作;

  • 下唇:2个驱动器配合欠驱动旋转轴,适应咬唇音/f/、/v/;

  • 嘴角:2组堆叠电机实现二维运动,支撑元音延伸时的形状维持。



2.2 算法核心:三阶段自监督学习流水线 

第一阶段:动作探索与数据收集

机器人通过随机动作探索(Motor Babbling)生成20,000组真实唇部运动视频帧与马达指令对:

其中Xt为视频帧,At为10维马达指令,覆盖12类音素相关嘴型(如爆破音、摩擦音)。


第二阶段:隐空间对齐训练

使用Wav2Lip生成语音合成视频,通过VAE编码器将合成帧Xt′与真实帧Xt映射到同一隐空间:


关键创新在于引入KL散度约束,使合成视频的隐向量Lt′与真实数据分布对齐,规避机械限制导致的运动不可行性。


第三阶段:时序动作生成

设计FAT模型,以历史动作At−2,At−1和未来隐向量Lt,Lt+1为输入,预测平滑马达指令:

其中闭唇损失Lclosure专门优化/b/、/p/等音素的完全闭合动作,避免细微不同步引发的“恐怖谷效应”。


三、效果验证:跨语言泛化能力超越基线 

3.1 定量评估 

在3段ChatGPT生成的测试句上,该方法均显著优于5种基线(见表1):


  • 最近邻特征点法:仅提取嘴唇轮廓,忽略牙齿显露等细节,MSE高达0.3896;

  • 音频振幅法:仅控制下颌开合,无法处理圆唇动作,MSE达0.8276;

  • 0.5秒时移:证实33毫秒延迟即可导致显著不同步,凸显实时性要求。


表1. 三种测试句上的MSE对比(数值越低越好)


3.2 多语言泛化

在11种语言测试中,非英语语言(包括俄语、汉语等复杂音系)的同步误差均落在英语基准范围内(图5)。例如希伯来语咽音和阿拉伯语喉音这类训练未见发音,仍能保持隐空间距离误差≤0.015,证明模型从英语数据中学习了通用发音动力学。


四、局限与展望

当前系统仍存在改进空间:


  1. 预发音缺失:人类说话时常提前80-300毫秒塑造嘴型,未来需引入前瞻性动作模块;


  2. 情感表达:当前聚焦于音素同步,未整合微笑、皱眉等情感动作;


  3. 伦理风险:逼真的唇部同步可能被滥用进行情感操纵,需制定儿童与老年人保护机制。


这项工作的真正价值在于将具身智能从“功能实现”推向“情感连接”,为教育、认知辅助等场景提供更自然的人机交互基础。


正如Hod Lipson所言:“我们并非要制造完美的仿生人,而是让机器学会以人类的方式与我们沟通。”





点赞收藏
// 评论0
0 / 500
还没有评论,快来抢沙发