Meta 首席 AI 科学家 Yann LeCun(杨立昆):AI 需要理解物理世界才能进化

CN
56分钟前

撰文:Techub News 整理

导语

2025 年 3 月,Meta 首席 AI 科学家、图灵奖得主 Yann LeCun(杨立昆)接受了科学传播者、前欧盟数字大使 Matt Keçi 博士的深度访谈。作为深度学习领域的奠基人之一,LeCun 不仅回顾了该领域数十年来的起伏,更着重剖析了当前以大型语言模型(LLM)为代表的 AI 系统的根本性局限,并勾勒了他眼中下一代 AI 的演进蓝图。在 AI 技术日新月异、竞争与合作格局日益复杂的当下,这位顶尖学者的思考为我们理解 AI 的未来发展方向提供了至关重要的视角。

摘要

  • 当前 AI(尤其是 LLM)虽能熟练操纵语言,但在理解物理世界、持久记忆、推理与规划方面“非常愚蠢”,远未达到人类或动物智能水平。
  • 实现人类级别 AI 的关键在于让机器像婴儿或动物一样,通过感官输入高效学习“直观物理”,这需要全新的架构,如他提出的 JEPA(联合嵌入预测架构)。
  • 开源与开放研究是 AI 领域过去十年飞速发展的基石,封闭系统将阻碍整体进步;AI 的未来是全球协作,而非零和竞争。
  • 真正的自主机器人(包括 L5 自动驾驶)依赖于能理解物理世界、具备常识的 AI 系统,这可能是“机器人十年”即将到来的前提。
  • AI 的情感可能源于对行动结果的“预期”,而非被硬编码的愤怒或嫉妒;意识目前尚无明确定义,不应成为研究焦点。

从深度学习浪潮到 AI 的“愚蠢”现状

Yann LeCun(杨立昆)回顾了深度学习的两次浪潮:第一次在 80 年代末至 90 年代中期,因计算力和数据限制而沉寂;第二次则自 2013 年左右开始爆炸性增长,并因 2015 年他与 Geoffrey Hinton(杰弗里·辛顿)在《自然》上发表的那篇标志性综述论文而广为人知。然而,面对如今 ChatGPT 等模型引发的狂热,LeCun 却给出了冷静甚至尖锐的评价:“目前的 AI 系统在很多方面非常愚蠢。”他指出,我们被其流畅的语言能力所迷惑,误以为它们很聪明,但实际上,它们无法理解物理世界,缺乏人类那样的持久记忆,也不能真正进行推理和规划——而这些正是智能行为的核心特征。

LeCun 强调,语言之所以看起来复杂,实则因为它是离散符号的序列,处理起来相对简单。相比之下,通过视觉等感官接收的关于物理世界的信息量是海量且连续的,理解和预测这个世界要困难得多。这就是所谓的“莫拉维克悖论”:让计算机完成抽象思维任务(如下棋)相对容易,但让它们具备婴儿或小猫级别的物理直觉和行动能力却极其困难。他举例道,一个大型语言模型训练所用的文本数据总量(约 10^14 字节),一个幼儿在大约四年的视觉体验中就能通过眼睛接收到同等量级的信息。这启示我们,仅靠文本训练永远无法达到人类水平的 AI,必须让 AI 学会理解真实的物理世界。

下一代 AI 蓝图:理解物理、记忆、推理与情感

那么,如何构建能够理解物理世界的 AI?LeCun 介绍了其团队在 Meta FAIR 实验室和纽约大学正在探索的新路径。他们致力于设计一种仍然基于深度学习、但能力更全面的新型 AI 系统。这套系统的关键能力包括:

  • 理解物理世界:掌握直观物理,能够预测自身行动可能带来的后果。
  • 持久记忆:拥有类似人类的记忆系统。
  • 推理与规划:能够进行层次化规划,将复杂目标分解为可执行的子任务序列。

LeCun 特别指出,当前 LLM 的推理方式(在“词元空间”中大量生成再筛选)效率低下且不似人类。人类是在内心的“世界模型”中进行模拟和推理,预测不同行动路径的结果,从而制定计划。构建这样的世界模型是重大挑战。

关于情感与意识,LeCun 提出了一个有趣的观点:未来先进的 AI 系统可能会拥有“情感”,但这并非被编程的愤怒或嫉妒,而是源于对行动结果的“预期”。当系统预测自己的行动将成功达成目标时,会产生类似“快乐”的积极信号;反之则产生消极信号。这是一种基于预测机制的内在驱动。至于意识,他认为目前尚无清晰定义和测量方法,过度关注可能像历史上纠结于“视网膜成像是倒置的为何我们看到正像”一样,是问错了问题。

学习范式演进与世界模型架构 JEPA

LeCun 梳理了机器学习的三大范式:监督学习、强化学习和自监督学习。他指出,强化学习效率低下(不适合训练自动驾驶,因为会撞毁成千上万次),而近年来取得巨大成功的 LLM 主要依赖于自监督学习(如预测文本中被掩盖的词)。然而,将这种适用于离散文本的自监督学习直接套用到连续、高维度的物理世界(如视频预测)时,却遭遇了失败。因为无法有效表示对未来视频帧的预测概率分布。

为此,LeCun 提出了 JEPA(Joint Embedding Predictive Architecture,联合嵌入预测架构)作为解决方案。JEPA 的核心思想是:不在原始输入空间(如像素)进行预测,而是让系统学习输入的抽象表征,并在这种抽象表征空间中进行预测。这避免了系统浪费资源去预测不可预测的细节(例如摄像机转动后墙上画作的全部细节),转而关注更高层次、更本质的变化。JEPA 是一个宏观架构,其中可以包含 Transformer 等模块。它并非直接替代 Transformer,而是为处理物理世界信息提供了一种更可行的框架。

开源协作、机器人未来与行业洞见

针对 AI 领域的竞争,尤其是近期中国团队推出高性能开源模型 DeepSeek 引发的讨论,LeCun 坚决捍卫开源与开放研究的价值。他强调,开源让整个领域乃至全世界受益,是过去十年 AI 飞速进步的根本原因。PyTorch 等开源框架被整个行业广泛使用就是明证。他认为,基础研究方法层面的竞争并非零和游戏,而是全球性的合作。好的想法来自世界各地,开放环境能加速整个领域的进步。对于微软等公司传闻的千亿美元级“星际之门”(Stargate)计算项目,LeCun 指出其投资规模与 Meta、微软当前的投入同属一个量级,且大部分投资将用于服务亿万用户的推理需求,而非训练。

谈到机器人时,LeCun 认为未来十年将是“机器人的十年”,但其实现前提是 AI 在理解物理世界方面取得突破。当前的人形机器人演示虽令人印象深刻,但其智能程度还远不足以应对真实世界的复杂性。他特别评论了 Elon Musk(埃隆·马斯克)对特斯拉自动驾驶的预测,直言“必须停止相信他在这方面的说法”,因为其预测已连续八年未能实现。L5 自动驾驶的难点不在于传感器,而在于 AI 缺乏对物理世界的理解和常识。

对于欧洲在 AI 竞争中的角色,LeCun 指出欧洲拥有顶尖人才,但在监管明确性上面临挑战(例如其 Meta 智能眼镜的视觉功能因监管不确定性未在欧洲推出)。他相信欧洲将继续扮演重要角色。

反思、遗产与未来方向

被问及职业生涯是否有遗憾时,LeCun 坦言,他可能过晚地认识到自监督学习的重要性,并希望自己当年能更努力地维持社区对神经网络的兴趣,以避免“AI 寒冬”的出现。他推测 Geoffrey Hinton(杰弗里·辛顿)的遗憾或许在于花了太长时间寻找大脑可能使用的、不同于反向传播的学习算法,最终才发现反向传播本身已经非常有效。

作为卷积神经网络(CNN)的发明者,LeCun 的遗产已深入日常生活,从手机图像识别、语音助手到汽车自动紧急刹车系统,背后都有 CNN 的身影。如今,他将目光投向更前沿的“世界模型”,致力于为 AI 赋予真正的物理理解和常识。在访谈最后,他也表达了对 AI 在医疗等领域(如乳腺癌诊断)应用的积极期待,并担任了相关初创公司的顾问,相信深度学习将为人类健康带来巨大福祉。

免责声明:本文章仅代表作者个人观点,不代表本平台的立场和观点。本文章仅供信息分享,不构成对任何人的任何投资建议。用户与作者之间的任何争议,与本平台无关。如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到support@aicoin.com,本平台相关工作人员将会进行核查。

分享至:
APP下载

X

Telegram

Facebook

Reddit

复制链接