Meta首席人工智能科學家Yann LeCun的AI世界模型正式推出: 自監督視覺模型,可像人一樣理解世界并作出預測?

Meta首席人工智能科学家Yann LeCun的AI世界模型正式推出: 自监督视觉模型,可像人一样理解世界并作出预测?

發布日期:

科技 Tech


要点:
Yann LeCun所提出的“世界模型”: 它先学习世界运作方式,而后形成一个内部模型,再通过这个内部模型来更快速地学习,为完成复杂任务做出计划,并且随时应对不熟悉的新情况。而具体到I-JEPA,其在补全图像的过程中,它比较的是图像的抽象表征,而不是比较像素本身。这个方式与我们人类认识世界的方式颇为一致。

致力于传播优质的中国知识内容、构建全球新共识。我们将通过一系列时事资讯、精品课程、论坛、节目、咨询报告等内容产品,提供关于当代中国的最新的舆论思潮、深入的社会观察、亮眼的科技成就等优质信息。我们已与五大洲十多个国家、百余个研究机构、媒体机构、政治团体、民间组织建立合作关系。希望通过我们的工作在海外分享中国经验,讲述中国故事,客观分析我们共同面对的挑战和机遇,携手全球青年寻找全球化发展的新共识。
联系我们// Substack // Twitter // YouTube // 相关文章

自从ChatGPT问世以来,生成式模型炙手可热。但是这些模型单纯根据概率生成内容,因而无法解决幻觉问题,经常一本正经地胡说八道,让人诟病。

这也是人工智能领域的大咖Yann LeCun长期以来对GPT颇为不屑的原因,甚至断言GPT模式活不过5年。那么在Yann LeCun看来究竟哪条技术路线才是人工智能的正途呢?答案在本周揭晓了。他所领衔的Meta AI刚刚发布了基于图像的联合嵌入预测架构/Image based Joint-Embedding Predictive Architecture,简称I-JEPA。


点击查看研究论文

这个模型正是Yann LeCun之前所提出的“世界模型”:它先学习世界运作方式,而后形成一个内部模型,再通过这个内部模型来更快速地学习,为完成复杂任务做出计划,并且随时应对不熟悉的新情况。而具体到I-JEPA,其在补全图像的过程中,它比较的是图像的抽象表征,而不是比较像素本身。这个方式与我们人类认识世界的方式颇为一致。认知学习理论认为,生物系统中的表征学习的关键在于内部模型逐渐做出调整以预测感官输入的信息,这构成了表征学习背后的驱动机制。而这个理念正是完全自监督学习的核心理念,即去除一部分输入信息后,学习怎样预测缺失的那部分内容。

非生成式的自监督学习<br>在学习外部世界的表征时,通常使用的是自监督学习的方式,使用未标记的数据,如图像和声音,而不是标记过的数据集。

自监督学习一般有3种架构:联合嵌入式架构、生成式架构、联合嵌入式预测架构。

当输入x和y兼容时,联合嵌入式架构学习输出相似的嵌入;而当输入不兼容时,则输出不同的嵌入。生成式架构学习的是使用解码器网络直接从兼容信号x来重构信号y。联合嵌入式预测架构学习的是使用预测器网络来从兼容信号x来预测信号y的嵌入。

联合嵌入式预测架构
I-JEPA作为一种联合嵌入式预测架构的自监督学习方法,可以学习高度语义化的图像表征,而无需依赖手工设计的数据增强技术。 I-JEPA的关键是使用掩蔽策略,即随机遮挡输入图像的部分区域,然后训练模型根据剩余的上下文预测被遮挡的区域。这促使模型去学习有意义的表征,从而捕捉图像的基本结构。此外,I-JEPA将这种掩蔽策略与视觉Transformer相结合:使用单个上下文块来预测来自同一图像的表征,上下文编码器是一个视觉Transformer,它只处理可见的上下文。而预测器可以接收上下文编码器的输出,并根据目标的位置来预测目标块的表征。实验结果证明了这种方法在生成语义表征方面的有效性。

这种方式就与生成式模型不同。生成式模型会擦除图像的一部分或隐藏段落中的一些单词,再尝试预测缺失的部分。在这个过程中,生成式模型往往会试图填补每一段缺失的信息,陷入琐碎而无关紧要的细节中,比如生成图片时产生千奇百怪的人手。

相反,I-JEPA用更像人类的方式来预测缺失的信息,用抽象的目标来去掉不需要的像素细节。这样做,I-JEPA的预测器可以根据一些可看到的上下文,为图像建立一个模型,也就是有了大局观,这会帮助它预测图像中看不到的区域的更高级别的信息,而不是执着于像素级别的细节。为了理解模型捕获到的信息,研究团队训练了一个随机解码器,它将I-JEPA模型输出的表征映射回像素空间, 从而展示出模型进行预测时的输出结果。例如,在给定的一张图像随机釆样4个目标块,然后再随机釆样一个上下文块,并删除任何重叠的目标块。利用这个策略,目标块相对语义化,而上下文块为了提高处理效率而更稀疏,但信息量大。

预测器的可视化<br>预测器的可视化对于理解I-JEPA模型的作用至关重要。预测器的作用是基于上下文编码器的输出和位置掩蔽标记,预测目标块指定位置掩蔽标记所对应的表征。这里的关键问题是依靠位置掩蔽标记的预测器是否能正确捕获目标位置的不确定性。

下面的例子中,第一列包含原始图像,第二列包含上下文图像,绿色边界框包含来自预测器输出解码的生成模型的样本。预测器正确捕捉了位置的不确定性,所产生的部位的姿态也是正确的,比如鸟的背面和车的顶部。

计算效率大大提高<br>相比其它的方法,I-JEPA具有高度可扩展性。 I-JEPA需要较少的计算量就可以获得很强的效果,而不需要依赖人工设计的数据增强。与MAE之类的方法相比,I-JEPA通过在表征空间计算目标而慢了约7%的迭代时间。然而,由于I-JEPA大约只需要前者1/5的迭代次数就会收敛,所以在实践中仍然可以显著节省计算时间。与基于视觉不变性的方法(如iBOT)相比,I-JEPA也运行得更快。特别是,I-JEPA的巨大模型(ViT-H/14)所需要的计算量少于iBOT的小模型(ViT-S/16)。 I-JEPA在训练中学到的表征也可以直接用于其他任务,而无需进行大量的微调。比如在ImageNet-1K线性探测和半监督评估中,它还优于像素和标记重建方法。

I-JEPA的这个优势让Yann LeCun团队只用了16个A100 GPU在不到72小时的时间内,就训练出了一个6.32亿参数的视觉变换器模型,并在ImageNet的低样本分类上取得了最先进的性能。而每个类别只有12个标记示例。其他方法通常需要高达2到10倍GPU小时,并且使用相同数量的数据进行训练时,错误率也更高。

I-JEPA是一种简单高效的方法来学习图片语义表征,且不依赖人工制作的知识作为额外的辅助。相比于日益闭源的OpenAI,Meta AI研究团队将开源I-JEPA的训练代码和模型检查点,并且下一步将扩展该方法到其他领域,例如图像-文本配对数据和视频数据,这也将是应用和扩展自监督方法来学习世界模型的重要一步。借此,未来的人工智能将具备常识、真正理解世界,走向通往AGI的快车道。

致力于传播优质的中国知识内容、构建全球新共识。我们将通过一系列时事资讯、精品课程、论坛、节目、咨询报告等内容产品,提供关于当代中国的最新的舆论思潮、深入的社会观察、亮眼的科技成就等优质信息。我们已与五大洲十多个国家、百余个研究机构、媒体机构、政治团体、民间组织建立合作关系。希望通过我们的工作在海外分享中国经验,讲述中国故事,客观分析我们共同面对的挑战和机遇,携手全球青年寻找全球化发展的新共识。
联系我们// Substack // Twitter // YouTube // 相关文章

免責聲明:本網站提供的信息僅供一般信息分享目的,並不應被視為投資建議。

返回博客
  • PDD拼多多2026年第一季財報,不及市場預期

    PDD拼多多2026年第一季财报,不及市场预期

    因国内主站营收增长不及预期,营销支出也并未明显下滑,因此实际利润表现并不及预期。分板块来看背后原因,我们认为一方面是 Temu 本季减亏的幅度大概率并没有预期的那么多,另外国内主站的经营利润增长应当也相当有限。

    PDD拼多多2026年第一季财报,不及市场预期

    因国内主站营收增长不及预期,营销支出也并未明显下滑,因此实际利润表现并不及预期。分板块来看背后原因,我们认为一方面是 Temu 本季减亏的幅度大概率并没有预期的那么多,另外国内主站的经营利润增长应当也相当有限。

  • 小米2026年第一季度財報,主要受手機和汽車毛利率同比回落影響

    小米2026年第一季度财报,主要受手机和汽车毛利率同比回落影响

    小米本季度汽车业务毛利率下滑至 20.1%,接近市场预期(20.5%),主要是受均价下滑的影响,其中包含了小米对购置税进行补贴的影响,并在本季度销售了一部分的低价现车。由于毛利率再次回落,海豚君测算本季度小米汽车业务核心经营利润再度陷入亏损 31 亿元。

    小米2026年第一季度财报,主要受手机和汽车毛利率同比回落影响

    小米本季度汽车业务毛利率下滑至 20.1%,接近市场预期(20.5%),主要是受均价下滑的影响,其中包含了小米对购置税进行补贴的影响,并在本季度销售了一部分的低价现车。由于毛利率再次回落,海豚君测算本季度小米汽车业务核心经营利润再度陷入亏损 31 亿元。

  • NVDA英偉達2027財年第一季度財報,收入752億美元,環比增量為129億美元

    英伟达2027财年第一季度财报,收入752亿美元,环比增量为129亿美元

    NVDA核心经营指标:总收入816亿美元,好于上调后的买方预期(780-800亿美元),其中季度环比增长135亿美元,几乎都来自于数据中心业务中Blackwell量产增加的带动。

    英伟达2027财年第一季度财报,收入752亿美元,环比增量为129亿美元

    NVDA核心经营指标:总收入816亿美元,好于上调后的买方预期(780-800亿美元),其中季度环比增长135亿美元,几乎都来自于数据中心业务中Blackwell量产增加的带动。

  • BYD比亞迪2025年第四季度業績仍然不及預期,賣車單價仍處於下行軌道

    比亚迪2025年第四季度业绩仍然不及预期,卖车单价仍处于下行轨道

    比亚迪的业绩仍然不及预期。收入虽超预期,但主要由于非核心的比亚迪电子业务高增带来,而在核心的卖车业务上,卖车单价仍处于下行轨道,卖车成本降幅不够,最后卖车毛利率虽有回暖,但仍低于市场预期。

    比亚迪2025年第四季度业绩仍然不及预期,卖车单价仍处于下行轨道

    比亚迪的业绩仍然不及预期。收入虽超预期,但主要由于非核心的比亚迪电子业务高增带来,而在核心的卖车业务上,卖车单价仍处于下行轨道,卖车成本降幅不够,最后卖车毛利率虽有回暖,但仍低于市场预期。

  • GOOG谷歌TurboQuant新聞導緻MU美光科技等內存股股價暴跌,但這合理嗎?

    GOOG谷歌TurboQuant新闻导致MU美光科技等内存股股价暴跌,但这合理吗?

    消息一出,华尔街一度陷入恐慌:如果 AI 突然间不再需要那么多 RAM 就能运作,这是否意味着内存产业的“超级周期”即将结束?答案是否定的。事实上,从历史规律与经济学角度来看,情况正好相反。要理解这一点,我们只需要观察你电脑上的网页浏览器。

    GOOG谷歌TurboQuant新闻导致MU美光科技等内存股股价暴跌,但这合理吗?

    消息一出,华尔街一度陷入恐慌:如果 AI 突然间不再需要那么多 RAM 就能运作,这是否意味着内存产业的“超级周期”即将结束?答案是否定的。事实上,从历史规律与经济学角度来看,情况正好相反。要理解这一点,我们只需要观察你电脑上的网页浏览器。

  • BABA財報AI投入比較激進

    BABA财报AI投入比较激进

    BABA发布第四季财报后股价下跌,财报显示其营收和利润均大幅低于预期。这家電商巨头的季度净利暴跌67%,而总营收仅增长1.7%约413亿美元。这些表现引发了人们对阿里巴巴在AI人工智能领域巨额投资(总额超过530亿美元)有效性的担忧。

    BABA财报AI投入比较激进

    BABA发布第四季财报后股价下跌,财报显示其营收和利润均大幅低于预期。这家電商巨头的季度净利暴跌67%,而总营收仅增长1.7%约413亿美元。这些表现引发了人们对阿里巴巴在AI人工智能领域巨额投资(总额超过530亿美元)有效性的担忧。

  • MU美光業績,季度毛利率達到 74.4%!

    MU美光业绩,季度毛利率达到 74.4%!

    MU 整体业绩:美光本季度营收 238.6 亿美元,环比增长 75%,好于上调后的买方预期(199 亿美元),本季度收入增长主要来自于 DRAM 和 NAND 业务的双重带动,两大业务环增都在 70% 以上。

    MU美光业绩,季度毛利率达到 74.4%!

    MU 整体业绩:美光本季度营收 238.6 亿美元,环比增长 75%,好于上调后的买方预期(199 亿美元),本季度收入增长主要来自于 DRAM 和 NAND 业务的双重带动,两大业务环增都在 70% 以上。

  • Tencent騰訊業績整體看無驚無喜?

    腾讯业绩整体看无惊无喜?

    腾讯一口气连发多个“龙虾”产品,能够看出公司在元宝春节大战中失利后的焦虑,虽然仓促推出产品还不完善。不过这个紧迫感的转变很关键也很必要。就目前来看,微信入口似乎在 AI 原生应用盛行的当下仍然有无法撼动的地位。

    腾讯业绩整体看无惊无喜?

    腾讯一口气连发多个“龙虾”产品,能够看出公司在元宝春节大战中失利后的焦虑,虽然仓促推出产品还不完善。不过这个紧迫感的转变很关键也很必要。就目前来看,微信入口似乎在 AI 原生应用盛行的当下仍然有无法撼动的地位。

1 / 8
  • Sharpa機器人削蘋果

    Sharpa机器人削苹果

    对人类来说,削苹果是件轻而易举的晨间小事,但对机器人而言,这是双手协调能力的「终极挑战」。 Sharpa机器人正在为能够像人类一样灵巧地完成复杂家务和工业装配的机器人铺平道路。

    Sharpa机器人削苹果

    对人类来说,削苹果是件轻而易举的晨间小事,但对机器人而言,这是双手协调能力的「终极挑战」。 Sharpa机器人正在为能够像人类一样灵巧地完成复杂家务和工业装配的机器人铺平道路。

  • 腫瘤療法突破,中國團隊給癌細胞打上“豬”標簽,癌細胞“偽裝朮”被破解

    肿瘤疗法突破,中国团队给癌细胞打上“猪”标签,癌细胞“伪装术”被破解

    近期,中国科学家在“Cell”杂志上发表的一项突破性研究,为这一顽疾提供了全新思路。他们利用基因编辑技术,将癌细胞改造成免疫系统眼中的“异类”,类似于人体对猪器官产生的超急性排斥反应,从而引发了一场针对癌细胞的精准“免疫歼灭战”。

    肿瘤疗法突破,中国团队给癌细胞打上“猪”标签,癌细胞“伪装术”被破解

    近期,中国科学家在“Cell”杂志上发表的一项突破性研究,为这一顽疾提供了全新思路。他们利用基因编辑技术,将癌细胞改造成免疫系统眼中的“异类”,类似于人体对猪器官产生的超急性排斥反应,从而引发了一场针对癌细胞的精准“免疫歼灭战”。

  • 新型大腦設備首次讀出內心聲音,腦機接口技朮打破失語者困境

    新型大脑设备首次读出内心声音,脑机接口技术打破失语者困境

    新系统的核心原理与常见的“尝试说话”型脑机介面相似,都是在大脑运动皮质植入感测器,这一区域负责向声道肌肉下达运动指令。感测器捕捉到的神经活动会送入机器学习模型,模型依据个人化数据判断信号对应的声音,进而预测使用者想说的单字。

    新型大脑设备首次读出内心声音,脑机接口技术打破失语者困境

    新系统的核心原理与常见的“尝试说话”型脑机介面相似,都是在大脑运动皮质植入感测器,这一区域负责向声道肌肉下达运动指令。感测器捕捉到的神经活动会送入机器学习模型,模型依据个人化数据判断信号对应的声音,进而预测使用者想说的单字。

  • “垃圾DNA”新發現:遠古病毒DNA在人類發育中發揮關鍵作用

    “垃圾DNA”新发现:远古病毒DNA在人类发育中发挥关键作用

    自这类非编码DNA片段首次被发现并被称作“垃圾”以来,生物学家们一直在探讨它们是否真的无用。如今的主流观点认为,这些片段虽不直接参与蛋白质合成,却在整体基因组中占据了极大比例,显示它们可能具有重要功能。

    “垃圾DNA”新发现:远古病毒DNA在人类发育中发挥关键作用

    自这类非编码DNA片段首次被发现并被称作“垃圾”以来,生物学家们一直在探讨它们是否真的无用。如今的主流观点认为,这些片段虽不直接参与蛋白质合成,却在整体基因组中占据了极大比例,显示它们可能具有重要功能。

1 / 4
1 / 4
  • 從中國經濟看背後困境及發展新構想?

    从中国经济看背后困境及发展新构想?

    中国未来发展或许可以参考“五环构想”进行战略布局。这一构想包括高等教育培训、创新科技驱动、产品生产销售、市场推广营销、出海战略布局五大领域。通过“五环构想”的实施,中国经济可能有一个全新的契机注入新的动力,推动经济稳定健康发展。

    从中国经济看背后困境及发展新构想?

    中国未来发展或许可以参考“五环构想”进行战略布局。这一构想包括高等教育培训、创新科技驱动、产品生产销售、市场推广营销、出海战略布局五大领域。通过“五环构想”的实施,中国经济可能有一个全新的契机注入新的动力,推动经济稳定健康发展。

  • 在變革中的抉擇:當今大環境下如何實現職業規劃與人生價值?

    在变革中的抉择:当今大环境下如何实现职业规划与人生价值?

    随着时代的变迁,人生价值的内涵也变得更加多样化和个性化。每个人对于“成功”和“幸福”的理解不同,有些人追求的是即时的快乐和成就感,而有些人则看重长期的进步和自我超越。

    在变革中的抉择:当今大环境下如何实现职业规划与人生价值?

    随着时代的变迁,人生价值的内涵也变得更加多样化和个性化。每个人对于“成功”和“幸福”的理解不同,有些人追求的是即时的快乐和成就感,而有些人则看重长期的进步和自我超越。

  • 再見愛人:探索現代婚姻中的情感困境

    再见爱人:探索现代婚姻中的情感困境

    芒果TV婚姻纪实观察节目“再见爱人4”邀请黄圣依、杨子,麦琳、李行亮,葛夕、刘爽三对情感关系10年以上的夫妻,以“婚姻纪实观察”为切口,呈现出不同婚姻样本在亲密关系中的挣扎与甜蜜、桎梏与觉醒。

    再见爱人:探索现代婚姻中的情感困境

    芒果TV婚姻纪实观察节目“再见爱人4”邀请黄圣依、杨子,麦琳、李行亮,葛夕、刘爽三对情感关系10年以上的夫妻,以“婚姻纪实观察”为切口,呈现出不同婚姻样本在亲密关系中的挣扎与甜蜜、桎梏与觉醒。

  • 抖音短劇新風潮:中老年人成為新的增長點?

    抖音短剧新风潮:中老年人成为新的增长点?

    近日,不少以老年人为主角的抖音短剧“闪婚五十岁”、“金榜题名之母凭子贵”、“人到五十,闪婚霸总”等等登上热度榜单。老年人的婚姻、情感以及生活故事,成了当下短剧创作的“新流量密码”。

    抖音短剧新风潮:中老年人成为新的增长点?

    近日,不少以老年人为主角的抖音短剧“闪婚五十岁”、“金榜题名之母凭子贵”、“人到五十,闪婚霸总”等等登上热度榜单。老年人的婚姻、情感以及生活故事,成了当下短剧创作的“新流量密码”。

1 / 4