NTU研究发现 视频模型其实不懂物理

2026/07/30   •   1061阅
Sora生成的视频以假乱真,但AI真的理解物理世界吗?南洋理工大学(NTU)最新研究揭秘:主流视频模型虽擅长视觉模仿,但在自由落体、物体碰撞等物理规律推理上仍存在明显“硬伤”。深度解析AI从‘视觉模仿’到‘认知智能’的鸿沟,探讨世界模型如何补齐物理课,带你洞察AI智能的真实边界!
/www/orgs.pro/web/images/image/1789/17892099.avif

Sora的视频刷爆全网,但这些以假乱真的画面背后,AI真的理解它在“画”什么吗?南洋理工大学的一项最新研究泼了盆冷水:这些模型,可能连基本的物理定律都不懂。

Sora很酷,但NTU发现了“硬伤”

OpenAI的Sora一发布,科技圈就沸腾了。无论是东京街头漫步的时尚女郎,还是雪地里奔跑的猛犸象,那些以假乱真的视频让许多人惊呼“现实不存在了”。正当大家热议AI将如何颠覆内容产业时,我们南洋理工大学(NTU)的研究团队,却给这股热潮带来了一些冷静的思考。

他们最新发布的研究,像一面“照妖镜”,直指这些视频模型的核心问题:在生成逼真画面的同时,AI是否真正“理解”了它所描绘的世界?

研究结果揭示了一个明显的反差:当前的视频生成模型虽然能够制作出视觉上流畅、看似符合现实的运动画面,但并不一定真正掌握了背后的物理规律。它们擅长从大量训练数据中学习常见的视觉模式,却可能在判断物体的位置、速度、加速度和碰撞状态时出现错误。尤其面对多个物理过程连续发生的复杂场景,模型的不足会更加明显。

AI的物理课,为什么不及格?

那么,南洋理工大学的研究人员是如何给视频模型进行“物理考试”的呢?研究团队建立了一套包含400段视频的评测体系,重点考察模型对经典力学规律的理解。测试场景包括自由落体、抛体运动、斜面运动、圆周运动以及物体碰撞等。模型不仅要识别画面中的物体和参数,还要判断适用的物理规律,并预测物体接下来的位置、速度和运动方向。

在这些“考题”面前,现有模型暴露出不少问题。有些模型虽然能够识别画面中的物体、文字和速度箭头,却可能错误理解箭头所代表的运动方向,最终预测出错误的位置和运动轨迹。部分模型还会选择不适用的物理公式,遗漏关键参数,或者在碰撞和连续运动过程中无法稳定保持物体的身份、速度和方向。

为什么会这样?原因出在这些模型的“基因”里。它们是基于海量数据训练出来的统计学模型,而非基于物理公式构建的仿真引擎。它们的运行逻辑更接近“根据训练数据中大量相似画面,预测接下来最可能出现的视觉结果”,而不是根据牛顿定律等物理规则,推导物体下一步应当如何运动。说白了,这更像是对视觉模式的大规模模仿,还不能等同于真正的物理理解和推理。

从模仿到理解,AI还有多远?

当然,指出这些局限性并非为了唱衰人工智能。恰恰相反,这项研究说明,视频模型若想从内容生成工具进一步发展为能够理解现实世界的“世界模型”,还需要补上物理推理这一课。从更长远的角度看,如果相关技术未来被应用于机器人、自动驾驶或科学模拟等领域,仅仅生成看起来合理的画面还不够,还必须更加准确地理解物体的运动规律和因果关系。

这项研究也促使我们重新思考“智能”的定义。一个能画出蒙娜丽莎的AI,和一个能理解“苹果为什么会掉下来”的AI,哪一个更接近真正的智能?从模仿到理解,是AI发展必须跨越的鸿沟。未来,如何将物理规律、因果推理等能力融入现有模型,将是全球AI研究者面临的共同挑战。而NTU的这项工作,无疑在这条探索之路上投下了一束关键的光,照亮了前行的方向。

📌 要点总结

✦ 南洋理工大学研究指出,当前主流视频生成模型虽然能生成逼真画面,但物理推理能力仍然有限。

✦ 这些模型通过模仿海量数据学习,而非基于物理原理进行推理,导致在特定场景下会出错。

✦ 该研究为未来AI发展指明方向,即需要从模仿智能迈向具备物理常识的认知智能。

聊聊你对AI“真智能”的看法

及时获取本站更新:

设为 Google 偏好来源