【NeurIPS 2025】以语言为中心的全模态表征学习的可扩展性研究 - 专知VIP

会员服务 ·

1

NeurIPS 2025 · 全模态表征学习 · 对比学习 ·

【NeurIPS 2025】以语言为中心的全模态表征学习的可扩展性研究

专知会员服务

专知，提供专业可信的知识分发服务，让认知协作更快更好！

近年来，利用多模态大语言模型（Multimodal Large Language Models, MLLMs）并结合对比学习（Contrastive Learning, CL）进行微调的多模态嵌入方法表现出令人瞩目的成果，但其优越性的根本原因尚未得到充分探究。本文指出，基于 MLLM 的方法之所以具备关键优势，源于生成式预训练过程中隐式形成的跨模态对齐（implicit cross-modal alignment）。在这一阶段，语言解码器（language decoder）学会在共享表征空间中利用多模态信号，以生成单模态输出。通过对各向异性（anisotropy）与核相似性结构（kernel similarity structure）的实证分析，本文证实了 MLLM 表征内部确实存在潜在的对齐关系，使得对比学习可以作为一种轻量级的后续精炼阶段。基于这一洞见，我们提出了一种以语言为中心的全模态嵌入框架（Language-Centric Omnimodal Embedding Framework, 简称 LCO-EMB）。在多种主干网络与基准任务上的广泛实验表明，该框架在不同模态下均取得了当前最先进（state-of-the-art）的表现。此外，我们发现并提出了一个生成–表征缩放定律（Generation–Representation Scaling Law, GRSL），揭示了通过对比学习精炼获得的表征能力与 MLLM 的生成能力之间存在正相关关系。这一规律表明：提升模型的生成能力，本质上是一种增强表征质量的有效范式。我们进一步从理论上解释了 GRSL，形式化地建立了 MLLM 的生成质量与其表征性能上界之间的联系。最后，我们在一个具有挑战性的低资源视觉文档检索任务上验证了该理论，结果显示：在进行对比学习之前持续开展生成式预训练，能够进一步释放模型的嵌入潜力。

成为VIP会员查看完整内容

1

相关内容

NeurIPS 2025

【ICML2025】迈向多模态通用人工智能之路：通用级别与通用基准

【ICML2025】迈向多模态通用人工智能之路：通用级别与通用基准

专知会员服务

22+阅读 · 5月8日

基于大语言模型的智能体优化研究综述

基于大语言模型的智能体优化研究综述

专知会员服务

56+阅读 · 3月25日

如何构建o1模型推理能力？清华北大等提出LLaVA-o1: 让视觉语言模型逐步推理

如何构建o1模型推理能力？清华北大等提出LLaVA-o1: 让视觉语言模型逐步推理

专知会员服务

30+阅读 · 2024年11月19日

基础语言模型在持续学习中的最新进展：综述

基础语言模型在持续学习中的最新进展：综述

专知会员服务

35+阅读 · 2024年6月9日

GPT系列大模型在自然语言处理任务中的鲁棒性研究

GPT系列大模型在自然语言处理任务中的鲁棒性研究

专知会员服务

30+阅读 · 2024年3月22日

基于图神经网络的小样本学习方法研究进展

基于图神经网络的小样本学习方法研究进展

专知会员服务

44+阅读 · 2023年11月18日

【NeurIPS 2023】基于时间注意力的多任务强化学习对比模块

【NeurIPS 2023】基于时间注意力的多任务强化学习对比模块

专知会员服务

33+阅读 · 2023年11月5日

WSDM 2022 | 基于图神经网络的协同过滤设计空间研究

WSDM 2022 | 基于图神经网络的协同过滤设计空间研究

专知会员服务

37+阅读 · 2022年1月3日

基于大型预训练语言模型的自然语言处理研究进展综述

基于大型预训练语言模型的自然语言处理研究进展综述

专知会员服务

96+阅读 · 2021年11月4日

【WSDM 2021】面向信息检索的预训练语言模型

专知会员服务

36+阅读 · 2020年11月29日

港科大浙大最新《深度生成模型三维表示》综述，20页pdf全面阐述3D生成进展

港科大浙大最新《深度生成模型三维表示》综述，20页pdf全面阐述3D生成进展

专知

12+阅读 · 2022年10月31日

NLP如何用元学习？李宏毅老师NAACL2022最新《元学习自然语言处理》综述论文阐述最新研究进展

NLP如何用元学习？李宏毅老师NAACL2022最新《元学习自然语言处理》综述论文阐述最新研究进展

专知

24+阅读 · 2022年5月4日

最新《知识驱动的文本生成》综述论文，44页pdf

最新《知识驱动的文本生成》综述论文，44页pdf

专知

25+阅读 · 2020年10月14日

【KDD2020-Tutorial】深度学习异常检测，180页ppt

【KDD2020-Tutorial】深度学习异常检测，180页ppt

专知

49+阅读 · 2020年8月28日

【ICML2020-南大周志华老师组】针对未见类未标记数据的安全深度半监督学习

【ICML2020-南大周志华老师组】针对未见类未标记数据的安全深度半监督学习

专知

46+阅读 · 2020年7月5日

最新《可解释深度学习XDL》2020研究进展综述大全，54页pdf

最新《可解释深度学习XDL》2020研究进展综述大全，54页pdf

专知

36+阅读 · 2020年5月2日

【学界】CVPR 2019 | 基于级联语义引导下的多通道注意力选择图像翻译

【学界】CVPR 2019 | 基于级联语义引导下的多通道注意力选择图像翻译

GAN生成式对抗网络

10+阅读 · 2019年8月17日

基于Tacotron模型的语音合成实践

基于Tacotron模型的语音合成实践

深度学习每日摘要

15+阅读 · 2018年12月25日

一文详解深度学习在命名实体识别(NER)中的应用

一文详解深度学习在命名实体识别(NER)中的应用

AINLP

24+阅读 · 2018年10月23日

论文浅尝 | 当知识图谱遇上零样本学习——零样本学习综述

论文浅尝 | 当知识图谱遇上零样本学习——零样本学习综述

开放知识图谱

20+阅读 · 2018年9月26日

基于进化算法的大规模本体匹配问题研究

国家自然科学基金

2+阅读 · 2015年12月31日

基于对称识别方法的贝叶斯probit模型稳健性研究

国家自然科学基金

3+阅读 · 2015年12月31日

面向不同对称性分子的自适应高性能单颗粒重构算法研究

国家自然科学基金

0+阅读 · 2015年12月31日

大规模模糊RDF数据管理关键技术研究

国家自然科学基金

8+阅读 · 2015年12月31日

基于神经网络的无约束0-1二次规划全局最优算法研究

国家自然科学基金

3+阅读 · 2015年12月31日

面向大规模多步学习问题的学习分类元系统技术研究

国家自然科学基金

5+阅读 · 2015年12月31日

共现潜在语义向量空间模型及其语义核的构建与应用研究

国家自然科学基金

1+阅读 · 2015年12月31日

基于低维连续表示的启发式智能规划技术研究

国家自然科学基金

4+阅读 · 2015年12月31日

高阶图像去噪模型的快速数值算法研究

国家自然科学基金

1+阅读 · 2015年12月31日

基于结构学习的非平行支持向量机最优化方法研究

国家自然科学基金

0+阅读 · 2014年12月31日

Benchmarking foundation models for hyperspectral image classification: Application to cereal crop type mapping

Arxiv

0+阅读 · 10月13日

Emergence of hybrid computational dynamics through reinforcement learning

Arxiv

0+阅读 · 10月13日

Structured Output Regularization: a framework for few-shot transfer learning

Arxiv

0+阅读 · 10月9日

Is ChatGPT a Good Recommender? A Preliminary Study

Arxiv

171+阅读 · 2023年4月20日

A Comprehensive Survey on Deep Graph Representation Learning

Arxiv

103+阅读 · 2023年4月11日

On Efficient Training of Large-Scale Deep Learning Models: A Literature Review

Arxiv

219+阅读 · 2023年4月7日

A Survey of Large Language Models

A Survey of Large Language Models

Arxiv

484+阅读 · 2023年3月31日

Data-centric Artificial Intelligence: A Survey

Arxiv

25+阅读 · 2023年3月17日

A survey and taxonomy of loss functions in machine learning

Arxiv

26+阅读 · 2023年1月13日

Meta-learning in natural and artificial intelligence

Arxiv

10+阅读 · 2020年11月26日

VIP会员

相关主题

全模态表征学习

相关VIP内容

【ICML2025】迈向多模态通用人工智能之路：通用级别与通用基准

【ICML2025】迈向多模态通用人工智能之路：通用级别与通用基准

专知会员服务

22+阅读 · 5月8日

基于大语言模型的智能体优化研究综述

基于大语言模型的智能体优化研究综述

专知会员服务

56+阅读 · 3月25日

如何构建o1模型推理能力？清华北大等提出LLaVA-o1: 让视觉语言模型逐步推理

如何构建o1模型推理能力？清华北大等提出LLaVA-o1: 让视觉语言模型逐步推理

专知会员服务

30+阅读 · 2024年11月19日

基础语言模型在持续学习中的最新进展：综述

基础语言模型在持续学习中的最新进展：综述

专知会员服务

35+阅读 · 2024年6月9日

GPT系列大模型在自然语言处理任务中的鲁棒性研究

GPT系列大模型在自然语言处理任务中的鲁棒性研究

专知会员服务

30+阅读 · 2024年3月22日

基于图神经网络的小样本学习方法研究进展

基于图神经网络的小样本学习方法研究进展

专知会员服务

44+阅读 · 2023年11月18日

【NeurIPS 2023】基于时间注意力的多任务强化学习对比模块

【NeurIPS 2023】基于时间注意力的多任务强化学习对比模块

专知会员服务

33+阅读 · 2023年11月5日

WSDM 2022 | 基于图神经网络的协同过滤设计空间研究

WSDM 2022 | 基于图神经网络的协同过滤设计空间研究

专知会员服务

37+阅读 · 2022年1月3日

基于大型预训练语言模型的自然语言处理研究进展综述

基于大型预训练语言模型的自然语言处理研究进展综述

专知会员服务

96+阅读 · 2021年11月4日

【WSDM 2021】面向信息检索的预训练语言模型

专知会员服务

36+阅读 · 2020年11月29日

热门VIP内容

开通专知VIP会员享更多权益服务

【博士论文】在低维与高维空间中对潜在表征的分析、建模与变换

《美军使用大语言模型技术生成领域特定文档》2025最新379页

【NeurIPS 2025】以语言为中心的全模态表征学习的可扩展性研究

智能体化多模态大语言模型综述

相关资讯

港科大浙大最新《深度生成模型三维表示》综述，20页pdf全面阐述3D生成进展

港科大浙大最新《深度生成模型三维表示》综述，20页pdf全面阐述3D生成进展

专知

12+阅读 · 2022年10月31日

NLP如何用元学习？李宏毅老师NAACL2022最新《元学习自然语言处理》综述论文阐述最新研究进展

NLP如何用元学习？李宏毅老师NAACL2022最新《元学习自然语言处理》综述论文阐述最新研究进展

专知

24+阅读 · 2022年5月4日

最新《知识驱动的文本生成》综述论文，44页pdf

最新《知识驱动的文本生成》综述论文，44页pdf

专知

25+阅读 · 2020年10月14日

【KDD2020-Tutorial】深度学习异常检测，180页ppt

【KDD2020-Tutorial】深度学习异常检测，180页ppt

专知

49+阅读 · 2020年8月28日

【ICML2020-南大周志华老师组】针对未见类未标记数据的安全深度半监督学习

【ICML2020-南大周志华老师组】针对未见类未标记数据的安全深度半监督学习

专知

46+阅读 · 2020年7月5日

最新《可解释深度学习XDL》2020研究进展综述大全，54页pdf

最新《可解释深度学习XDL》2020研究进展综述大全，54页pdf

专知

36+阅读 · 2020年5月2日

【学界】CVPR 2019 | 基于级联语义引导下的多通道注意力选择图像翻译

【学界】CVPR 2019 | 基于级联语义引导下的多通道注意力选择图像翻译

GAN生成式对抗网络

10+阅读 · 2019年8月17日

基于Tacotron模型的语音合成实践

基于Tacotron模型的语音合成实践

深度学习每日摘要

15+阅读 · 2018年12月25日

一文详解深度学习在命名实体识别(NER)中的应用

一文详解深度学习在命名实体识别(NER)中的应用

AINLP

24+阅读 · 2018年10月23日

论文浅尝 | 当知识图谱遇上零样本学习——零样本学习综述

论文浅尝 | 当知识图谱遇上零样本学习——零样本学习综述

开放知识图谱

20+阅读 · 2018年9月26日

相关基金

基于进化算法的大规模本体匹配问题研究

国家自然科学基金

2+阅读 · 2015年12月31日

基于对称识别方法的贝叶斯probit模型稳健性研究

国家自然科学基金

3+阅读 · 2015年12月31日

面向不同对称性分子的自适应高性能单颗粒重构算法研究

国家自然科学基金

0+阅读 · 2015年12月31日

大规模模糊RDF数据管理关键技术研究

国家自然科学基金

8+阅读 · 2015年12月31日

基于神经网络的无约束0-1二次规划全局最优算法研究

国家自然科学基金

3+阅读 · 2015年12月31日

面向大规模多步学习问题的学习分类元系统技术研究

国家自然科学基金

5+阅读 · 2015年12月31日

共现潜在语义向量空间模型及其语义核的构建与应用研究

国家自然科学基金

1+阅读 · 2015年12月31日

基于低维连续表示的启发式智能规划技术研究

国家自然科学基金

4+阅读 · 2015年12月31日

高阶图像去噪模型的快速数值算法研究

国家自然科学基金

1+阅读 · 2015年12月31日

基于结构学习的非平行支持向量机最优化方法研究

国家自然科学基金

0+阅读 · 2014年12月31日

相关论文

Benchmarking foundation models for hyperspectral image classification: Application to cereal crop type mapping

Arxiv

0+阅读 · 10月13日

Emergence of hybrid computational dynamics through reinforcement learning

Arxiv

0+阅读 · 10月13日

Structured Output Regularization: a framework for few-shot transfer learning

Arxiv

0+阅读 · 10月9日

Is ChatGPT a Good Recommender? A Preliminary Study

Arxiv

171+阅读 · 2023年4月20日

A Comprehensive Survey on Deep Graph Representation Learning

Arxiv

103+阅读 · 2023年4月11日

On Efficient Training of Large-Scale Deep Learning Models: A Literature Review

Arxiv

219+阅读 · 2023年4月7日

A Survey of Large Language Models

A Survey of Large Language Models

Arxiv

484+阅读 · 2023年3月31日

Data-centric Artificial Intelligence: A Survey

Arxiv

25+阅读 · 2023年3月17日

A survey and taxonomy of loss functions in machine learning

Arxiv

26+阅读 · 2023年1月13日

Meta-learning in natural and artificial intelligence

Arxiv

10+阅读 · 2020年11月26日

微信扫码咨询专知VIP会员