中国政策档案 Governance Archive HOLDINGS 234,771 · FONDS 122
Record · qbitai ACC. 900074505

LeCun's Last Paper at Meta

LeCun在Meta的最后一篇论文

Issuer
Date
2025-11-03
Instrument
other
Cited by
0
This article reports on LeJEPA, a self-supervised learning method proposed by Yann LeCun, submitted to arXiv on the same day his departure from Meta was disclosed. The method introduces isotropic Gaussian embeddings to address representation collapse.
Full text · 原文 5,050 字
henry 发自 凹非寺<br> 量子位 | 公众号 QbitAI<br> 《LeJEPA:无需启发式的可证明且可扩展的自监督学习》。<br> “这可能是LeCun以Meta身份发表的最后一篇论文了。”<br> 没错,这篇带“Le”的论文,介绍了一种自监督学习方法,于11月11日在arXiv提交,是LeCun的最新公开成果。<br> 也是在这一天,他离职Meta的消息被曝光。<br> 如果说LeCun在2013年加入开启了Meta AI研究的一个时代,那么LeJEPA就是他在Meta的告别之作。<br> LeJEPA究竟是怎样的“最后一舞”?<br> LeJEPA:基于各向同性高斯嵌入的自监督学习方法<br> LeJEPA核心是提出了一种基于各向同性高斯嵌入的自监督学习方法,通过引入SIGReg正则化,有效解决了表示崩溃问题,并显著提升了模型的泛化能力。<br> 在传统的JEPA框架中,预测任务常面临表示崩溃的问题。<br> 这意味着,在训练过程中,模型可能将所有输入映射到单一的点或低维空间,导致嵌入空间中的样本不可区分,从而无法有效捕捉样本间的语义差异。<br> 针对这一问题,现有方法依赖启发式技术,如停止梯度、非对称视图生成和教师-学生网络,但这些方法由于缺乏对JEPA基础理论的探索,被视为替代方案。<br> 基于以上背景,研究提出一种新的JEPA框架——潜在欧几里得JEPA(Latent-Euclidean Joint Embedding PredictiveArchitecture,LeJEPA),其核心是使嵌入空间遵循特定的统计分布,从而提升模型的预测性能。<br> 嵌入分布的影响<br> 首先,研究通过最小二乘回归(OLS)分析了嵌入分布对偏差和方差的影响。<br> 结果表明,等向高斯分布能够最小化训练过程中的偏差和方差。<br> 特别地,在总方差相同的情况下,非等向分布会导致更高的偏差和方差,而等向高斯分布则能够有效地保证最小的偏差和方差,从而提高下游任务的稳定性和准确性。<br> 通过在非线性探测和几何直觉方面的实验,研究进一步验证了等向高斯分布的优越性。<br> 实验表明,无论是在回归任务还是分类任务中,等向高斯分布都能保持最小的误差,而非等向分布则表现出较高的方差。<br> 研究表明, 各向同性高斯分布是嵌入空间的最佳分布,它可以在没有任务信息的情况下,保证最小化偏差和方差,从而提高下游任务的表现。<br> SIGReg:实现高斯分布的正则化<br> 为实现上述分布匹配,研究提出了草图化各向同性高斯正则化(Sketched Isotropic Gaussian Regularization,SIGReg),这是一种可处理、可证明正确的正则化方法。<br> SIGReg的创新点在于:<br> 将分布匹配问题转化为统计假设检验,通过零假设与目标分布的匹配来实现<br> 提供了一种测试方法,保证在多GPU训练时的高效性,并确保梯度和曲率有界<br> 解决了高维空间中的维度灾难问题。<br> SIGReg通过单变量方向检验,结合Epps-Pulley测试来判断嵌入分布与目标分布(等向高斯分布)的匹配程度。<br> 它将分布匹配转化为零假设与备择假设的检验,并通过统计量判断是否拒绝零假设,从而确认分布是否匹配。<br> 高维问题的解决<br> SIGReg还通过两条机制解决了高维空间中的计算挑战:<br> 平滑性:嵌入函数的Sobolev平滑性保证了在仅需O(K)个方向切片的情况下即可有效约束整个空间,进行有效的统计检验。<br> SGD迭代特性:训练过程中方向的重复采样累积效应使得即使方向数量很少(如M=16),也能迅速收敛到各向同性分布,优于固定方向集。<br> 在实现方面,LeJEPA结合了SIGReg和预测损失两部分,通过Epps-Pulley统计量实现分布匹配,并通过小批次训练保证计算效率和稳定性。最终的总损失是SIGReg损失和预测损失的加权和。<br> SIGReg损失:通过Epps-Pulley统计量计算,确保训练过程中梯度有界,并通过积分近似提升计算效率。小批次训练引入的偏差对训练影响较小。<br> 预测损失:与DINO方法相似,通过计算所有视图预测全局视图的差异。<br> LeJEPA总损失:是SIGReg损失和预测损失的加权和,其中一个超参数λ用于平衡这两部分的权重。<br> 实验验证与结果<br> 为了验证LeJEPA的可靠性,研究在多个大型架构上进行实验,包括ViT、ConvNeXt、ResNet、MaxViT和Swin Transformer等,模型规模接近10亿参数。<br> 实验结果显示,LeJEPA在这些架构上表现超越现有方法,且保持了训练的简便性和鲁棒性。<br> 特别地,在领域特定的数据集(如Galaxy10、Food101)上,LeJEPA在直接在目标数据上预训练时超越了基于DINOv2的迁移学习方法。<br> 总的来说,LeJEPA延续了之前JEPA的探索,重新确立了自监督学习作为AI研究的核心方法。<br> LeJEPA通过提供一个简单且理论上有支持的框架,使得从数据中学习表示变得更加高效,并在多个任务中展示了优越的性能。<br> JEPA世界模型<br> 自LeCun于2022年在《A Path Towards Autonomous Machine Intelligence》中首次提出JEPA以来,基于JEPA的架构已经发展了整整三年。<br> JEPA(Joint-Embedding Predictive Architecture)是一种自监督学习框架,旨在通过基于嵌入空间的联合预测方法来提升模型的表达能力和推理能力。<br> 与生成式模型不同,它并不能简单地用于从x预测y,它仅捕捉x和y之间的依赖关系而无需显式生成y的预测。<br> 此外,为了应对长期规划问题,JEPA还可以进一步通过分层架构(即H-JEPA)来增强其抽象能力。<br> 在H-JEPA中,低层表示处理短期预测任务,而高层表示则用于长期预测。<br> 这种分层结构使得模型在进行长期规划时,可以在不同的抽象层次上进行操作,从而提高可预测性和减少信息损失。<br> 值得一提的是,JEPA架构通常与世界模型密切相关,只不过其与一般意义上的世界模型仍有区别。<br> 传统的世界模型一般指能够模拟环境或系统的模型,其主要目的是通过预测未来状态来实现长期规划和决策(如强化学习)。<br> 而JEPA则是一种通过联合嵌入空间学习状态与动作转移的架构,重点在于结合表示学习和自监督学习来完成预测和规划任务。<br> 在JEPA中,世界模型的目的是预测世界状态的未来表现形式。<br> 具体而言,JEPA通过学习状态与动作的转移来训练世界模型,其核心在于从当前状态的表示推断未来状态的表示,这一过程是在联合嵌入空间中完成的。该空间通过最小化预测误差来学习状态表示与动作之间的关系。<br> 尽管最初的JEPA论文呈现出一种对生成式AI的反思,描述了人工智能未来的愿景,并指出这一愿景可能需要数十年的时间才能实现。<br> 但自2022年夏季发布以来,在LeCun的推动下,JEPA架构已经取得了一些显著进展。<br> I-JEPA: Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture<br> 与其他图像SSL方法相比,I-JEPA充分利用了Transformer架构的灵活性。<br> 在I-JEPA中,上下文编码器是一个ViT,它仅处理可见的上下文块。<br> 预测器接收上下文编码器的输出,并根据位置标记(以颜色显示)预测特定位置的目标块表示。<br> 目标表示对应于目标编码器的输出,权重在每次迭代中通过上下文编码器权重的指数滑动平均进行更新。<br> V-JEPA: Revisiting Feature Prediction for Learning Visual Representations from Video<br> V-JEPA是I-JEPA在视频领域的扩展,它通过将视频视为3D图像来实现这一点。<br> 训练过程基于一个包含T帧的视频片段,空间分辨率为H×W,并将其展平成一个L个token的序列。<br> 首先通过从视频片段中去除一些tokens来获得x-encoder的输入。<br> 接着,x-encoder处理被屏蔽的视频序列,并为每个输入token输出一个嵌入向量。<br> 然后,x-encoder的输出与一组可学习的mask tokens进行拼接,这些mask tokens包含了被屏蔽的时空补丁的位置信息嵌入。<br> 预测网络处理拼接后的token序列,并为每个mask token输出一个嵌入向量。<br> 最后,预测网络的输出通过 L1 损失回归到预测目标。预测目标对应于y-encoder的输出。<br> 今年7月,LeCun团队又进一步发布了V-JEPA 2。<br> V -JEPA 2基于V-JEPA,进一步提升了动作预测和世界建模能力,使机器人能够与陌生物体和环境进行交互,从而完成任务。<br> MC-JEPA: A Joint-Embedding Predictive Architecture for Self-Supervised Learning of Motion and Content Features<br> MC-JEPA是JEPA 的扩展,使其能够包含运动信息。<br> 架构通过在视频中使用光流估计学习运动,并通过图像视角的联合嵌入学习内容,以多任务方式共享编码器。其光流估计架构基于PWC-Net。<br> 光流估计采用粗到精的方式,先估算初步的光流,再逐层精细化,最终通过图像重建损失来优化。<br> 整个过程中,前向-反向光流的一致性通过循环一致性损失得到强化。为了避免训练不稳定,模型在每个特征层使用方差-协方差正则化。<br> 除上述工作以外,LeCun及其团队还进一步围绕JEPA发表了JEPAs、LLM-JEAP等工作。<br> 总的来说,尽管JEPA架构相较于传统监督学习方法提供了一条新路径,但其自发布以来就毁誉参半。<br> 比如,有人批评JEPA架构过于抽象,难以应用到最前沿的主流模型中,其与生成式AI的背离也让不少网友将Meta的失利归咎于LeCun的学术取向。<br> 甚至有Meta AI员工表示:Fair尚未证明自己是DeepMind等研究机构的真正竞争对手。<br> 而最新发布的LeJEPA也彻底在LeCun和Meta之间划上了句号。<br> 不过,LeJEPA虽然可能LeCun在Meta的研究终点,但肯定不是JEPA发展的终结。<br> 据消息称,LeCun已经在筹集资金,创办初创公司,继续推进他在世界模型方面的工作。<br> 而在AI热辣滚烫之下,这位65岁图灵奖得主、AI三巨头之一的教父级人物,创业又岂会缺资源?<br> 唯一的问题,只可能是LeCun一直以来给人过于“学术”的风格和印象,担忧他在严格计算ROI的商业世界里,再次遭遇Meta生涯末期里的分歧和困境。<br> One more thing<br> 虽然LeCun与Meta的“分手”说不上体面,但在Meta的这十多年也许是LeCun生涯中最顺的时期——<br> 深度学习爆发、加入纽大、建立FAIR、办顶会(ICLR)、拿图灵奖、出自传(《科学之路》)、发paper,带学生。<br> 自2013年加入Meta以来,LeCun的个人被引飙升,约为406919次,占总数的93%。<br> 虽然光三巨头合写的《深度学习》综述就贡献了10万多次,但也足见LeCun学术影响力的飙升。<br> 这段黄金时期不仅见证了LeCun个人事业的巅峰,更推动了整个AI领域的发展。<br> 江湖上至今流传着扎克伯格当年现身NIPS时的轰动,并且都在认为他会带走一票AI天才……<br> 扎克伯格与约书亚·本吉奥在NIPS 2013<br> 但最后扎克伯格只是请来了LeCun,一人胜过千军万马。<br> LeCun成就了FacebookMeta的AI转型之名,成为了金字招牌;Meta也一度给过LeCun足够自由的研究待遇和环境。<br> 只是最后结局前的波澜,令人唏嘘~<br> 好在,65岁的Yann LeCun,依旧是闯的年纪~~<br> 参考链接<br> [1]https://ai.meta.com/blog/v-jepa-2-world-model-benchmarks/<br> [2]https://arxiv.org/abs/2511.08544<br> [3]https://arxiv.org/abs/2301.08243<br> [4]https://malcolmlett.medium.com/critical-review-of-lecuns-introductory-jepa-paper-fabe5783134e<br> [5]https://github.com/GihhArwtw