# NTU研究发现 视频模型其实不懂物理

URL: https://www.shicheng.news/v/Jr8BM
Published: 2026-07-30
Source: 狮城新闻

<a>

</a><a></a><a>![NTU研究发现 视频模型其实不懂物理](https://www.shicheng.news/images/image/1789/17892099.avif?0)</a>

<a></a>

<a>

</a> 

Sora的视频刷爆全网，但这些以假乱真的画面背后，AI真的理解它在“画”什么吗？南洋理工大学的一项最新研究泼了盆冷水：这些模型，可能连基本的物理定律都不懂。

Sora很酷，但NTU发现了“硬伤” 

OpenAI的Sora一发布，科技圈就沸腾了。无论是东京街头漫步的时尚女郎，还是雪地里奔跑的猛犸象，那些以假乱真的视频让许多人惊呼“现实不存在了”。正当大家热议AI将如何颠覆内容产业时，我们南洋理工大学（NTU）的研究团队，却给这股热潮带来了一些冷静的思考。

他们最新发布的研究，像一面“照妖镜”，直指这些视频模型的核心问题：在生成逼真画面的同时，AI是否真正“理解”了它所描绘的世界？

研究结果揭示了一个明显的反差：当前的视频生成模型虽然能够制作出视觉上流畅、看似符合现实的运动画面，但并不一定真正掌握了背后的物理规律。它们擅长从大量训练数据中学习常见的视觉模式，却可能在判断物体的位置、速度、加速度和碰撞状态时出现错误。尤其面对多个物理过程连续发生的复杂场景，模型的不足会更加明显。

AI的物理课，为什么不及格？ 

那么，南洋理工大学的研究人员是如何给视频模型进行“物理考试”的呢？研究团队建立了一套包含400段视频的评测体系，重点考察模型对经典力学规律的理解。测试场景包括自由落体、抛体运动、斜面运动、圆周运动以及物体碰撞等。模型不仅要识别画面中的物体和参数，还要判断适用的物理规律，并预测物体接下来的位置、速度和运动方向。

在这些“考题”面前，现有模型暴露出不少问题。有些模型虽然能够识别画面中的物体、文字和速度箭头，却可能错误理解箭头所代表的运动方向，最终预测出错误的位置和运动轨迹。部分模型还会选择不适用的物理公式，遗漏关键参数，或者在碰撞和连续运动过程中无法稳定保持物体的身份、速度和方向。

为什么会这样？原因出在这些模型的“基因”里。它们是基于海量**数据**训练出来的统计学模型，而非基于物理公式构建的仿真引擎。它们的运行逻辑更接近“根据训练数据中大量相似画面，预测接下来最可能出现的视觉结果”，而不是根据牛顿定律等物理规则，推导物体下一步应当如何运动。说白了，这更像是对视觉模式的大规模模仿，还不能等同于真正的物理理解和推理。

从模仿到理解，AI还有多远？ 

当然，指出这些局限性并非为了唱衰人工智能。恰恰相反，这项研究说明，视频模型若想从内容生成工具进一步发展为能够理解现实世界的“世界模型”，还需要补上物理推理这一课。从更长远的角度看，如果相关技术未来被应用于机器人、自动驾驶或科学模拟等领域，仅仅生成看起来合理的画面还不够，还必须更加准确地理解物体的运动规律和因果关系。

这项研究也促使我们重新思考“智能”的定义。一个能画出蒙娜丽莎的AI，和一个能理解“苹果为什么会掉下来”的AI，哪一个更接近真正的智能？从模仿到理解，是AI发展必须跨越的鸿沟。未来，如何将物理规律、因果推理等能力融入现有模型，将是全球AI研究者面临的共同挑战。而NTU的这项工作，无疑在这条探索之路上投下了一束**关键**的光，照亮了前行的方向。

📌 要点总结

✦ 南洋理工大学研究指出，当前主流视频生成模型虽然能生成逼真画面，但物理推理能力仍然有限。 

✦ 这些模型通过模仿海量数据学习，而非基于物理原理进行推理，导致在特定场景下会出错。 

✦ 该研究为未来AI发展指明方向，即需要从模仿智能迈向具备物理常识的认知智能。 

聊聊你对AI“真智能”的看法
