Paper Reading AI Learner

VLM2Vec-V2: Advancing Multimodal Embedding for Videos, Images, and Visual Documents

2025-07-07 00:51:57
Rui Meng, Ziyan Jiang, Ye Liu, Mingyi Su, Xinyi Yang, Yuepeng Fu, Can Qin, Zeyuan Chen, Ran Xu, Caiming Xiong, Yingbo Zhou, Wenhu Chen, Semih Yavuz

Abstract

Multimodal embedding models have been crucial in enabling various downstream tasks such as semantic similarity, information retrieval, and clustering over different modalities. However, existing multimodal embeddings like VLM2Vec, E5-V, GME are predominantly focused on natural images, with limited support for other visual forms such as videos and visual documents. This restricts their applicability in real-world scenarios, including AI agents, multi-modal search and recommendation, and retrieval-augmented generation (RAG). To close this gap, we propose VLM2Vec-V2, a unified framework for learning embeddings across diverse visual forms. First, we introduce MMEB-V2, a comprehensive benchmark that extends MMEB with five new task types: visual document retrieval, video retrieval, temporal grounding, video classification and video question answering - spanning text, image, video, and visual document inputs. Next, we train VLM2Vec-V2, a general-purpose embedding model that supports text, image, video, and visual document inputs. Extensive experiments show that VLM2Vec-V2 achieves strong performance not only on the newly introduced video and document retrieval tasks, but also improves over prior baselines on the original image benchmarks. Through extensive evaluation, our study offers insights into the generalizability of various multimodal embedding models and highlights effective strategies for unified embedding learning, laying the groundwork for more scalable and adaptable representation learning in both research and real-world settings.

Abstract (translated)

多模态嵌入模型在各种下游任务中发挥了关键作用,如语义相似性、信息检索和跨不同模式的聚类。然而,现有的多模态嵌入方法(例如VLM2Vec、E5-V、GME)主要关注自然图像,对视频和其他视觉形式的支持有限,这限制了它们在现实场景中的应用范围,包括AI代理、多模态搜索和推荐以及检索增强生成(RAG)。为填补这一空白,我们提出了VLM2Vec-V2,这是一个用于跨多种视觉形式学习嵌入的统一框架。 首先,我们介绍MMEB-V2,这是一个综合基准测试库,它在原有的MMEB基础上新增了五种任务类型:视觉文档检索、视频检索、时间定位(temporal grounding)、视频分类和视频问答——这些任务涵盖了文本、图像、视频和可视文档输入。接下来,我们训练了一个通用的嵌入模型VLM2Vec-V2,该模型支持文本、图像、视频和可视文档输入。 经过广泛的实验验证,结果显示VLM2Vec-V2不仅在新引入的视频和文档检索任务中表现出色,在原有的图像基准测试上也超越了先前的方法。通过全面评估,我们的研究为各种多模态嵌入模型的泛化能力提供了见解,并突出了统一嵌入学习的有效策略,从而为科研界和实际应用中的可扩展性和适应性表示学习奠定了基础。

URL

https://arxiv.org/abs/2507.04590

PDF

https://arxiv.org/pdf/2507.04590.pdf


Tags
3D Action Action_Localization Action_Recognition Activity Adversarial Agent Attention Autonomous Bert Boundary_Detection Caption Chat Classification CNN Compressive_Sensing Contour Contrastive_Learning Deep_Learning Denoising Detection Dialog Diffusion Drone Dynamic_Memory_Network Edge_Detection Embedding Embodied Emotion Enhancement Face Face_Detection Face_Recognition Facial_Landmark Few-Shot Gait_Recognition GAN Gaze_Estimation Gesture Gradient_Descent Handwriting Human_Parsing Image_Caption Image_Classification Image_Compression Image_Enhancement Image_Generation Image_Matting Image_Retrieval Inference Inpainting Intelligent_Chip Knowledge Knowledge_Graph Language_Model LLM Matching Medical Memory_Networks Multi_Modal Multi_Task NAS NMT Object_Detection Object_Tracking OCR Ontology Optical_Character Optical_Flow Optimization Person_Re-identification Point_Cloud Portrait_Generation Pose Pose_Estimation Prediction QA Quantitative Quantitative_Finance Quantization Re-identification Recognition Recommendation Reconstruction Regularization Reinforcement_Learning Relation Relation_Extraction Represenation Represenation_Learning Restoration Review RNN Robot Salient Scene_Classification Scene_Generation Scene_Parsing Scene_Text Segmentation Self-Supervised Semantic_Instance_Segmentation Semantic_Segmentation Semi_Global Semi_Supervised Sence_graph Sentiment Sentiment_Classification Sketch SLAM Sparse Speech Speech_Recognition Style_Transfer Summarization Super_Resolution Surveillance Survey Text_Classification Text_Generation Time_Series Tracking Transfer_Learning Transformer Unsupervised Video_Caption Video_Classification Video_Indexing Video_Prediction Video_Retrieval Visual_Relation VQA Weakly_Supervised Zero-Shot