Embed-RL: Reinforcement Learning for Reasoning-Driven Multimodal Embeddings
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Jiang, Haonan, Wang, Yuji, Zhu, Yongjie, Lu, Xin, Qin, Wenyu, Wang, Meng, Wan, Pengfei, Tang, Yansong |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Analytic Score Optimization for Multi Dimension Video Quality Assessment
von: Lin, Boda, et al.
Veröffentlicht: (2026)
von: Lin, Boda, et al.
Veröffentlicht: (2026)
Omni-o3: Deep Nested Omnimodal Deduction for Deliberative Audio-Visual Reasoning
von: Zhang, Zhicheng, et al.
Veröffentlicht: (2026)
von: Zhang, Zhicheng, et al.
Veröffentlicht: (2026)
VidEmo: Affective-Tree Reasoning for Emotion-Centric Video Foundation Models
von: Zhang, Zhicheng, et al.
Veröffentlicht: (2025)
von: Zhang, Zhicheng, et al.
Veröffentlicht: (2025)
VG-Refiner: Towards Tool-Refined Referring Grounded Reasoning via Agentic Reinforcement Learning
von: Wang, Yuji, et al.
Veröffentlicht: (2025)
von: Wang, Yuji, et al.
Veröffentlicht: (2025)
LIVE: Leveraging Image Manipulation Priors for Instruction-based Video Editing
von: Wang, Weicheng, et al.
Veröffentlicht: (2026)
von: Wang, Weicheng, et al.
Veröffentlicht: (2026)
KPM-Bench: A Kinematic Parsing Motion Benchmark for Fine-grained Motion-centric Video Understanding
von: Lin, Boda, et al.
Veröffentlicht: (2026)
von: Lin, Boda, et al.
Veröffentlicht: (2026)
Reasoning Guided Embeddings: Leveraging MLLM Reasoning for Improved Multimodal Retrieval
von: Liu, Chunxu, et al.
Veröffentlicht: (2025)
von: Liu, Chunxu, et al.
Veröffentlicht: (2025)
Mags-RL: Wearing Multimodal LLMs a Magnifying Glass via Agentic Reinforcement Learning For Complex Scene Reasoning
von: Dong, Xuanzhao, et al.
Veröffentlicht: (2026)
von: Dong, Xuanzhao, et al.
Veröffentlicht: (2026)
JEPA for RL: Investigating Joint-Embedding Predictive Architectures for Reinforcement Learning
von: Kenneweg, Tristan, et al.
Veröffentlicht: (2025)
von: Kenneweg, Tristan, et al.
Veröffentlicht: (2025)
Beyond the Golden Data: Resolving the Motion-Vision Quality Dilemma via Timestep Selective Training
von: Luo, Xiangyang, et al.
Veröffentlicht: (2026)
von: Luo, Xiangyang, et al.
Veröffentlicht: (2026)
MODA: MOdular Duplex Attention for Multimodal Perception, Cognition, and Emotion Understanding
von: Zhang, Zhicheng, et al.
Veröffentlicht: (2025)
von: Zhang, Zhicheng, et al.
Veröffentlicht: (2025)
Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning
von: Zhang, Haoji, et al.
Veröffentlicht: (2025)
von: Zhang, Haoji, et al.
Veröffentlicht: (2025)
ThinkRL-Edit: Thinking in Reinforcement Learning for Reasoning-Centric Image Editing
von: Li, Hengjia, et al.
Veröffentlicht: (2026)
von: Li, Hengjia, et al.
Veröffentlicht: (2026)
PLUME: Latent Reasoning Based Universal Multimodal Embedding
von: He, Chenwei, et al.
Veröffentlicht: (2026)
von: He, Chenwei, et al.
Veröffentlicht: (2026)
MoRL: Reinforced Reasoning for Unified Motion Understanding and Generation
von: Wang, Hongpeng, et al.
Veröffentlicht: (2026)
von: Wang, Hongpeng, et al.
Veröffentlicht: (2026)
WAVE: Learning Unified & Versatile Audio-Visual Embeddings with Multimodal LLM
von: Tang, Changli, et al.
Veröffentlicht: (2025)
von: Tang, Changli, et al.
Veröffentlicht: (2025)
Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs
von: Li, Qi, et al.
Veröffentlicht: (2026)
von: Li, Qi, et al.
Veröffentlicht: (2026)
AlphaDrive: Unleashing the Power of VLMs in Autonomous Driving via Reinforcement Learning and Reasoning
von: Jiang, Bo, et al.
Veröffentlicht: (2025)
von: Jiang, Bo, et al.
Veröffentlicht: (2025)
DriveVLM-RL: Neuroscience-Inspired Reinforcement Learning with Vision-Language Models for Safe and Deployable Autonomous Driving
von: Huang, Zilin, et al.
Veröffentlicht: (2026)
von: Huang, Zilin, et al.
Veröffentlicht: (2026)
Segment Anything with Motion, Geometry, and Semantic Adaptation for Complex Nonlinear Visual Object Tracking
von: Zhu, Deyi, et al.
Veröffentlicht: (2026)
von: Zhu, Deyi, et al.
Veröffentlicht: (2026)
Timestep Embedding Tells: It's Time to Cache for Video Diffusion Model
von: Liu, Feng, et al.
Veröffentlicht: (2024)
von: Liu, Feng, et al.
Veröffentlicht: (2024)
ObjEmbed: Towards Universal Multimodal Object Embeddings
von: Fu, Shenghao, et al.
Veröffentlicht: (2026)
von: Fu, Shenghao, et al.
Veröffentlicht: (2026)
SEA: Supervised Embedding Alignment for Token-Level Visual-Textual Integration in MLLMs
von: Yin, Yuanyang, et al.
Veröffentlicht: (2024)
von: Yin, Yuanyang, et al.
Veröffentlicht: (2024)
Breaking the Modality Barrier: Universal Embedding Learning with Multimodal LLMs
von: Gu, Tiancheng, et al.
Veröffentlicht: (2025)
von: Gu, Tiancheng, et al.
Veröffentlicht: (2025)
SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes
von: Wang, Yuji, et al.
Veröffentlicht: (2025)
von: Wang, Yuji, et al.
Veröffentlicht: (2025)
IteRPrimE: Zero-shot Referring Image Segmentation with Iterative Grad-CAM Refinement and Primary Word Emphasis
von: Wang, Yuji, et al.
Veröffentlicht: (2025)
von: Wang, Yuji, et al.
Veröffentlicht: (2025)
UniVG-R1: Reasoning Guided Universal Visual Grounding with Reinforcement Learning
von: Bai, Sule, et al.
Veröffentlicht: (2025)
von: Bai, Sule, et al.
Veröffentlicht: (2025)
Beyond Chain-of-Thought: Rewrite as a Universal Interface for Generative Multimodal Embeddings
von: Wu, Peixi, et al.
Veröffentlicht: (2026)
von: Wu, Peixi, et al.
Veröffentlicht: (2026)
Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture
von: Zhang, Longxiang, et al.
Veröffentlicht: (2026)
von: Zhang, Longxiang, et al.
Veröffentlicht: (2026)
Phy124: Fast Physics-Driven 4D Content Generation from a Single Image
von: Lin, Jiajing, et al.
Veröffentlicht: (2024)
von: Lin, Jiajing, et al.
Veröffentlicht: (2024)
mmE5: Improving Multimodal Multilingual Embeddings via High-quality Synthetic Data
von: Chen, Haonan, et al.
Veröffentlicht: (2025)
von: Chen, Haonan, et al.
Veröffentlicht: (2025)
Learning Brain Representation with Hierarchical Visual Embeddings
von: Zheng, Jiawen, et al.
Veröffentlicht: (2026)
von: Zheng, Jiawen, et al.
Veröffentlicht: (2026)
Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning
von: Hao, Pengfei, et al.
Veröffentlicht: (2025)
von: Hao, Pengfei, et al.
Veröffentlicht: (2025)
MIRG-RL: Multi-Image Reasoning and Grounding with Reinforcement Learning
von: Zheng, Lihao, et al.
Veröffentlicht: (2025)
von: Zheng, Lihao, et al.
Veröffentlicht: (2025)
MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning
von: Meng, Fanqing, et al.
Veröffentlicht: (2025)
von: Meng, Fanqing, et al.
Veröffentlicht: (2025)
BadCLIP: Dual-Embedding Guided Backdoor Attack on Multimodal Contrastive Learning
von: Liang, Siyuan, et al.
Veröffentlicht: (2023)
von: Liang, Siyuan, et al.
Veröffentlicht: (2023)
RGBX-R1: Visual Modality Chain-of-Thought Guided Reinforcement Learning for Multimodal Grounding
von: Wu, Jiahe, et al.
Veröffentlicht: (2026)
von: Wu, Jiahe, et al.
Veröffentlicht: (2026)
RL-I2IT: Image-to-Image Translation with Deep Reinforcement Learning
von: Hu, Jing, et al.
Veröffentlicht: (2023)
von: Hu, Jing, et al.
Veröffentlicht: (2023)
ST-Gen4D: Embedding 4D Spatiotemporal Cognition into World Model for 4D Generation
von: Wang, Haonan, et al.
Veröffentlicht: (2026)
von: Wang, Haonan, et al.
Veröffentlicht: (2026)
Multimodal Mathematical Reasoning Embedded in Aerial Vehicle Imagery: Benchmarking, Analysis, and Exploration
von: Zhou, Yue, et al.
Veröffentlicht: (2025)
von: Zhou, Yue, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Analytic Score Optimization for Multi Dimension Video Quality Assessment
von: Lin, Boda, et al.
Veröffentlicht: (2026) -
Omni-o3: Deep Nested Omnimodal Deduction for Deliberative Audio-Visual Reasoning
von: Zhang, Zhicheng, et al.
Veröffentlicht: (2026) -
VidEmo: Affective-Tree Reasoning for Emotion-Centric Video Foundation Models
von: Zhang, Zhicheng, et al.
Veröffentlicht: (2025) -
VG-Refiner: Towards Tool-Refined Referring Grounded Reasoning via Agentic Reinforcement Learning
von: Wang, Yuji, et al.
Veröffentlicht: (2025) -
LIVE: Leveraging Image Manipulation Priors for Instruction-based Video Editing
von: Wang, Weicheng, et al.
Veröffentlicht: (2026)