人與人自然交談時,一方剛剛說完,另一方往往幾乎立刻就能接上。但對於人工智慧語音助手來說,什麼時候應該開口、什麼時候應該等待,仍然是一道難題。
近日,來自南洋理工大學的一支參賽隊伍進入第十一屆信也科技杯全球人工智慧算法大賽決賽,與其他高校和科技企業團隊一起,挑戰如何讓人工智慧更自然地「接話」。
200毫秒背後的對話難題
真人對話中,兩輪發言之間的實際間隔通常只有約200毫秒。
但人從開始組織回答到真正開口,一般需要約600毫秒。這意味著,我們並不是等對方完全說完後才開始思考,而是在對方說話的過程中,便已經根據語氣、停頓和上下文預測接下來的內容,並提前準備回答。

這種近乎本能的對話預判能力,正是目前不少語音人工智慧系統所欠缺的。
人工智慧雖然已經能夠識別和理解說話內容,卻仍可能出現搶話、反應過慢、錯誤打斷,或者在應該回應時保持沉默等情況。真正的挑戰不只是讓系統運行得更快,而是讓它判斷什麼時候應該開口。
南大團隊進入十強決賽
7月29日,第十一屆信也科技杯全球人工智慧算法大賽總決賽在上海舉行。
本屆比賽共吸引776名選手、553支隊伍參加。經過初賽和複賽,十支隊伍進入線下決賽,分別來自南洋理工大學、上海交通大學、中國科學技術大學、吉林大學,以及螞蟻國際、曠視科技等高校和企業。
需要注意的是,這並不是南洋理工大學與信也科技聯合開展的研究項目,而是來自南大的參賽團隊進入了信也科技主辦的算法比賽決賽。
目前公開報道沒有披露南大團隊的具體成員、隊伍名稱和最終排名,也沒有說明冠軍團隊來自哪一家機構。
預測接下來兩秒會發生什麼
比賽聚焦「對話輪次交互建模」。
參賽者需要分析5至30秒的真實電話對話錄音,並判斷接下來兩秒內最可能出現哪一種情況:
說話者繼續發言、雙方轉換髮言順序、另一方作出簡短回應、出現打斷,或者雙方保持沉默。
為了作出更準確的判斷,決賽中的多數團隊沒有隻分析文字內容,而是採用多模態方法,同時結合語調、語速和音量等非文本信息。
例如,一個人雖然說出了完整句子,但語調仍然上揚,可能意味著他還沒有說完;一次短暫停頓也可能只是思考,而不是準備把發言機會交給對方。
人工智慧必須理解這些細微信號,才能避免在錯誤的時間插話。
從聽懂內容到讀懂節奏
信也科技營運長兼首席技術官王玉翔表示,過去語音技術主要關注讓人工智慧理解對話,並用接近真人的聲音回答。隨著技術發展,下一步是讓人工智慧學會更自然地加入對話。
信也科技總裁陳平平則表示,人工智慧不僅要聽懂人們說了什麼,還要理解什麼時候應該開口、什麼時候應該保持沉默。
本屆比賽也是第十五屆自然語言處理與中文計算國際會議的官方合作賽事,由中國計算機學會自然語言處理專業委員會提供學術指導,並與復旦大學自然語言處理實驗室合作。
浙江大學求是特聘教授莊越挺、復旦大學特聘教授黃萱菁等學者擔任決賽評委。
不只是讓人工智慧回答得更快
對話輪次預測技術的意義,並不是單純把人工智慧的響應速度壓縮到200毫秒,而是讓系統能夠提前判斷人類的說話意圖。
這一能力未來可能首先應用於人工智慧客服和陪伴型語音系統。
當人工智慧能夠識別用戶是否已經說完、是否正在猶豫,以及是否只需要一個簡短回應時,人機交流就有望減少搶話、冷場和機械式停頓,變得更加自然。
對於南洋理工大學團隊而言,進入全球算法大賽十強,也意味著其提出的方案已經通過初賽和複賽,在眾多參賽團隊中獲得進入現場答辯的機會。
要點總結南洋理工大學團隊進入第十一屆信也科技杯全球人工智慧算法大賽十強決賽。比賽研究的是人工智慧如何判斷什麼時候接話,而不是簡單把系統延遲降低到200毫秒。公開報道沒有顯示南洋理工大學與信也科技開展聯合研究,也沒有說明南大團隊奪得冠軍。比賽吸引776名選手和553支隊伍參加,參賽者需要預測真實電話對話隨後兩秒內可能發生的五類對話動作。 當人工智慧真正學會判斷什麼時候開口、什麼時候沉默,我們與機器之間的交流,或許才會更接近人與人之間的自然對話。























