
Sora的視頻刷爆全網,但這些以假亂真的畫面背後,AI真的理解它在「畫」什麼嗎?南洋理工大學的一項最新研究潑了盆冷水:這些模型,可能連基本的物理定律都不懂。
Sora很酷,但NTU發現了「硬傷」
OpenAI的Sora一發布,科技圈就沸騰了。無論是東京街頭漫步的時尚女郎,還是雪地里奔跑的猛獁象,那些以假亂真的視頻讓許多人驚呼「現實不存在了」。正當大家熱議AI將如何顛覆內容產業時,我們南洋理工大學(NTU)的研究團隊,卻給這股熱潮帶來了一些冷靜的思考。
他們最新發布的研究,像一面「照妖鏡」,直指這些視頻模型的核心問題:在生成逼真畫面的同時,AI是否真正「理解」了它所描繪的世界?
研究結果揭示了一個明顯的反差:當前的視頻生成模型雖然能夠製作出視覺上流暢、看似符合現實的運動畫面,但並不一定真正掌握了背後的物理規律。它們擅長從大量訓練數據中學習常見的視覺模式,卻可能在判斷物體的位置、速度、加速度和碰撞狀態時出現錯誤。尤其面對多個物理過程連續發生的複雜場景,模型的不足會更加明顯。
AI的物理課,為什麼不及格?
那麼,南洋理工大學的研究人員是如何給視頻模型進行「物理考試」的呢?研究團隊建立了一套包含400段視頻的評測體系,重點考察模型對經典力學規律的理解。測試場景包括自由落體、拋體運動、斜面運動、圓周運動以及物體碰撞等。模型不僅要識別畫面中的物體和參數,還要判斷適用的物理規律,並預測物體接下來的位置、速度和運動方向。
在這些「考題」面前,現有模型暴露出不少問題。有些模型雖然能夠識別畫面中的物體、文字和速度箭頭,卻可能錯誤理解箭頭所代表的運動方向,最終預測出錯誤的位置和運動軌跡。部分模型還會選擇不適用的物理公式,遺漏關鍵參數,或者在碰撞和連續運動過程中無法穩定保持物體的身份、速度和方向。
為什麼會這樣?原因出在這些模型的「基因」里。它們是基於海量數據訓練出來的統計學模型,而非基於物理公式構建的仿真引擎。它們的運行邏輯更接近「根據訓練數據中大量相似畫面,預測接下來最可能出現的視覺結果」,而不是根據牛頓定律等物理規則,推導物體下一步應當如何運動。說白了,這更像是對視覺模式的大規模模仿,還不能等同於真正的物理理解和推理。
從模仿到理解,AI還有多遠?
當然,指出這些局限性並非為了唱衰人工智慧。恰恰相反,這項研究說明,視頻模型若想從內容生成工具進一步發展為能夠理解現實世界的「世界模型」,還需要補上物理推理這一課。從更長遠的角度看,如果相關技術未來被應用於機器人、自動駕駛或科學模擬等領域,僅僅生成看起來合理的畫面還不夠,還必須更加準確地理解物體的運動規律和因果關係。
這項研究也促使我們重新思考「智能」的定義。一個能畫出蒙娜麗莎的AI,和一個能理解「蘋果為什麼會掉下來」的AI,哪一個更接近真正的智能?從模仿到理解,是AI發展必須跨越的鴻溝。未來,如何將物理規律、因果推理等能力融入現有模型,將是全球AI研究者面臨的共同挑戰。而NTU的這項工作,無疑在這條探索之路上投下了一束關鍵的光,照亮了前行的方向。
📌 要點總結
✦ 南洋理工大學研究指出,當前主流視頻生成模型雖然能生成逼真畫面,但物理推理能力仍然有限。
✦ 這些模型通過模仿海量數據學習,而非基於物理原理進行推理,導致在特定場景下會出錯。
✦ 該研究為未來AI發展指明方向,即需要從模仿智能邁向具備物理常識的認知智能。
聊聊你對AI「真智能」的看法











