人与人自然交谈时,一方刚刚说完,另一方往往几乎立刻就能接上。但对于人工智能语音助手来说,什么时候应该开口、什么时候应该等待,仍然是一道难题。
近日,来自南洋理工大学的一支参赛队伍进入第十一届信也科技杯全球人工智能算法大赛决赛,与其他高校和科技企业团队一起,挑战如何让人工智能更自然地“接话”。
200毫秒背后的对话难题
真人对话中,两轮发言之间的实际间隔通常只有约200毫秒。
但人从开始组织回答到真正开口,一般需要约600毫秒。这意味着,我们并不是等对方完全说完后才开始思考,而是在对方说话的过程中,便已经根据语气、停顿和上下文预测接下来的内容,并提前准备回答。

这种近乎本能的对话预判能力,正是目前不少语音人工智能系统所欠缺的。
人工智能虽然已经能够识别和理解说话内容,却仍可能出现抢话、反应过慢、错误打断,或者在应该回应时保持沉默等情况。真正的挑战不只是让系统运行得更快,而是让它判断什么时候应该开口。
南大团队进入十强决赛
7月29日,第十一届信也科技杯全球人工智能算法大赛总决赛在上海举行。
本届比赛共吸引776名选手、553支队伍参加。经过初赛和复赛,十支队伍进入线下决赛,分别来自南洋理工大学、上海交通大学、中国科学技术大学、吉林大学,以及蚂蚁国际、旷视科技等高校和企业。
需要注意的是,这并不是南洋理工大学与信也科技联合开展的研究项目,而是来自南大的参赛团队进入了信也科技主办的算法比赛决赛。
目前公开报道没有披露南大团队的具体成员、队伍名称和最终排名,也没有说明冠军团队来自哪一家机构。
预测接下来两秒会发生什么
比赛聚焦“对话轮次交互建模”。
参赛者需要分析5至30秒的真实电话对话录音,并判断接下来两秒内最可能出现哪一种情况:
说话者继续发言、双方转换发言顺序、另一方作出简短回应、出现打断,或者双方保持沉默。
为了作出更准确的判断,决赛中的多数团队没有只分析文字内容,而是采用多模态方法,同时结合语调、语速和音量等非文本信息。
例如,一个人虽然说出了完整句子,但语调仍然上扬,可能意味着他还没有说完;一次短暂停顿也可能只是思考,而不是准备把发言机会交给对方。
人工智能必须理解这些细微信号,才能避免在错误的时间插话。
从听懂内容到读懂节奏
信也科技首席运营官兼首席技术官王玉翔表示,过去语音技术主要关注让人工智能理解对话,并用接近真人的声音回答。随着技术发展,下一步是让人工智能学会更自然地加入对话。
信也科技总裁陈平平则表示,人工智能不仅要听懂人们说了什么,还要理解什么时候应该开口、什么时候应该保持沉默。
本届比赛也是第十五届自然语言处理与中文计算国际会议的官方合作赛事,由中国计算机学会自然语言处理专业委员会提供学术指导,并与复旦大学自然语言处理实验室合作。
浙江大学求是特聘教授庄越挺、复旦大学特聘教授黄萱菁等学者担任决赛评委。
不只是让人工智能回答得更快
对话轮次预测技术的意义,并不是单纯把人工智能的响应速度压缩到200毫秒,而是让系统能够提前判断人类的说话意图。
这一能力未来可能首先应用于人工智能客服和陪伴型语音系统。
当人工智能能够识别用户是否已经说完、是否正在犹豫,以及是否只需要一个简短回应时,人机交流就有望减少抢话、冷场和机械式停顿,变得更加自然。
对于南洋理工大学团队而言,进入全球算法大赛十强,也意味着其提出的方案已经通过初赛和复赛,在众多参赛团队中获得进入现场答辩的机会。
要点总结南洋理工大学团队进入第十一届信也科技杯全球人工智能算法大赛十强决赛。比赛研究的是人工智能如何判断什么时候接话,而不是简单把系统延迟降低到200毫秒。公开报道没有显示南洋理工大学与信也科技开展联合研究,也没有说明南大团队夺得冠军。比赛吸引776名选手和553支队伍参加,参赛者需要预测真实电话对话随后两秒内可能发生的五类对话动作。 当人工智能真正学会判断什么时候开口、什么时候沉默,我们与机器之间的交流,或许才会更接近人与人之间的自然对话。























