Multimodal Label Relevance Ranking via Reinforcement Learning
Fuente:
arXiv
Saved in:
| Main Authors: | Guo, Taian, Zhang, Taolin, Wu, Haoqian, Li, Hanjun, Qiao, Ruizhi, Sun, Xing |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Unified and Dynamic Graph for Temporal Character Grouping in Long Videos
by: Shu, Xiujun, et al.
Published: (2023)
by: Shu, Xiujun, et al.
Published: (2023)
Ranked from Within: Ranking Large Multimodal Models Without Labels
by: Tu, Weijie, et al.
Published: (2024)
by: Tu, Weijie, et al.
Published: (2024)
Lifelong Knowledge Editing for Vision Language Models with Low-Rank Mixture-of-Experts
by: Chen, Qizhou, et al.
Published: (2024)
by: Chen, Qizhou, et al.
Published: (2024)
VSearcher: Long-Horizon Multimodal Search Agent via Reinforcement Learning
by: Zhang, Ruiyang, et al.
Published: (2026)
by: Zhang, Ruiyang, et al.
Published: (2026)
Multi-Granularity Reasoning for Image Quality Assessment via Attribute-Aware Reinforcement Learning to Rank
by: Chen, Xiangyong, et al.
Published: (2026)
by: Chen, Xiangyong, et al.
Published: (2026)
VisualQuality-R1: Reasoning-Induced Image Quality Assessment via Reinforcement Learning to Rank
by: Wu, Tianhe, et al.
Published: (2025)
by: Wu, Tianhe, et al.
Published: (2025)
BoostAdapter: Improving Vision-Language Test-Time Adaptation via Regional Bootstrapping
by: Zhang, Taolin, et al.
Published: (2024)
by: Zhang, Taolin, et al.
Published: (2024)
FastVAR: Linear Visual Autoregressive Modeling via Cached Token Pruning
by: Guo, Hang, et al.
Published: (2025)
by: Guo, Hang, et al.
Published: (2025)
MQADet: A Plug-and-Play Paradigm for Enhancing Open-Vocabulary Object Detection via Multimodal Question Answering
by: Li, Caixiong, et al.
Published: (2025)
by: Li, Caixiong, et al.
Published: (2025)
VL-Mamba: Exploring State Space Models for Multimodal Learning
by: Qiao, Yanyuan, et al.
Published: (2024)
by: Qiao, Yanyuan, et al.
Published: (2024)
Patho-AgenticRAG: Towards Multimodal Agentic Retrieval-Augmented Generation for Pathology VLMs via Reinforcement Learning
by: Zhang, Wenchuan, et al.
Published: (2025)
by: Zhang, Wenchuan, et al.
Published: (2025)
HHMR: Holistic Hand Mesh Recovery by Enhancing the Multimodal Controllability of Graph Diffusion Models
by: Li, Mengcheng, et al.
Published: (2024)
by: Li, Mengcheng, et al.
Published: (2024)
OmniColor: A Unified Framework for Multi-modal Lineart Colorization
by: Zhang, Xulu, et al.
Published: (2026)
by: Zhang, Xulu, et al.
Published: (2026)
SenseNova-MARS: Empowering Multimodal Agentic Reasoning and Search via Reinforcement Learning
by: Chng, Yong Xien, et al.
Published: (2025)
by: Chng, Yong Xien, et al.
Published: (2025)
Towards Weakly Supervised End-to-end Learning for Long-video Action Recognition
by: Zhou, Jiaming, et al.
Published: (2023)
by: Zhou, Jiaming, et al.
Published: (2023)
LLaVA-RE: Binary Image-Text Relevancy Evaluation with Multimodal Large Language Model
by: Sun, Tao, et al.
Published: (2025)
by: Sun, Tao, et al.
Published: (2025)
HumanCoser: Layered 3D Human Generation via Semantic-Aware Diffusion Model
by: Wang, Yi, et al.
Published: (2024)
by: Wang, Yi, et al.
Published: (2024)
Beyond Where to Look: Trajectory-Guided Reinforcement Learning for Multimodal RLVR
by: Lu, Jinda, et al.
Published: (2026)
by: Lu, Jinda, et al.
Published: (2026)
Motion-X++: A Large-Scale Multimodal 3D Whole-body Human Motion Dataset
by: Zhang, Yuhong, et al.
Published: (2025)
by: Zhang, Yuhong, et al.
Published: (2025)
Towards Robust Pseudo-Label Learning in Semantic Segmentation: An Encoding Perspective
by: Li, Wangkai, et al.
Published: (2025)
by: Li, Wangkai, et al.
Published: (2025)
MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning
by: Meng, Fanqing, et al.
Published: (2025)
by: Meng, Fanqing, et al.
Published: (2025)
Fingerprint Presentation Attack Detector Using Global-Local Model
by: Liu, Haozhe, et al.
Published: (2024)
by: Liu, Haozhe, et al.
Published: (2024)
DAGait: Generalized Skeleton-Guided Data Alignment for Gait Recognition
by: Wu, Zhengxian, et al.
Published: (2025)
by: Wu, Zhengxian, et al.
Published: (2025)
Prompt-SID: Learning Structural Representation Prompt via Latent Diffusion for Single-Image Denoising
by: Li, Huaqiu, et al.
Published: (2025)
by: Li, Huaqiu, et al.
Published: (2025)
ReinPath: A Multimodal Reinforcement Learning Approach for Pathology
by: Zhou, Kangcheng, et al.
Published: (2026)
by: Zhou, Kangcheng, et al.
Published: (2026)
Perceptual-Evidence Anchored Reinforced Learning for Multimodal Reasoning
by: Zhang, Chi, et al.
Published: (2025)
by: Zhang, Chi, et al.
Published: (2025)
Layered 3D Human Generation via Semantic-Aware Diffusion Model
by: Wang, Yi, et al.
Published: (2023)
by: Wang, Yi, et al.
Published: (2023)
Efficient Adaptive Label Refinement for Label Noise Learning
by: Zhang, Wenzhen, et al.
Published: (2025)
by: Zhang, Wenzhen, et al.
Published: (2025)
Perceive What Matters: Relevance-Driven Scheduling for Multimodal Streaming Perception
by: Huang, Dingcheng, et al.
Published: (2026)
by: Huang, Dingcheng, et al.
Published: (2026)
Spotlight on Token Perception for Multimodal Reinforcement Learning
by: Huang, Siyuan, et al.
Published: (2025)
by: Huang, Siyuan, et al.
Published: (2025)
Towards Multimodal Domain Generalization with Few Labels
by: Li, Hongzhao, et al.
Published: (2026)
by: Li, Hongzhao, et al.
Published: (2026)
Monocular Gaussian SLAM with Language Extended Loop Closure
by: Lan, Tian, et al.
Published: (2024)
by: Lan, Tian, et al.
Published: (2024)
RED-DOT: Multimodal Fact-checking via Relevant Evidence Detection
by: Papadopoulos, Stefanos-Iordanis, et al.
Published: (2023)
by: Papadopoulos, Stefanos-Iordanis, et al.
Published: (2023)
MSRL: Scaling Generative Multimodal Reward Modeling via Multi-Stage Reinforcement Learning
by: Wang, Chenglong, et al.
Published: (2026)
by: Wang, Chenglong, et al.
Published: (2026)
Toward Native Multimodal Modeling: A Roadmap
by: An, Siyu, et al.
Published: (2026)
by: An, Siyu, et al.
Published: (2026)
TexVocab: Texture Vocabulary-conditioned Human Avatars
by: Liu, Yuxiao, et al.
Published: (2024)
by: Liu, Yuxiao, et al.
Published: (2024)
TranSplat: Generalizable 3D Gaussian Splatting from Sparse Multi-View Images with Transformers
by: Zhang, Chuanrui, et al.
Published: (2024)
by: Zhang, Chuanrui, et al.
Published: (2024)
ConvRot: Rotation-Based Plug-and-Play 4-bit Quantization for Diffusion Transformers
by: Huang, Feice, et al.
Published: (2025)
by: Huang, Feice, et al.
Published: (2025)
Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning
by: Zhang, Haoji, et al.
Published: (2025)
by: Zhang, Haoji, et al.
Published: (2025)
PreResQ-R1: Towards Fine-Grained Rank-and-Score Reinforcement Learning for Visual Quality Assessment via Preference-Response Disentangled Policy Optimization
by: Feng, Zehui, et al.
Published: (2025)
by: Feng, Zehui, et al.
Published: (2025)
Similar Items
-
Unified and Dynamic Graph for Temporal Character Grouping in Long Videos
by: Shu, Xiujun, et al.
Published: (2023) -
Ranked from Within: Ranking Large Multimodal Models Without Labels
by: Tu, Weijie, et al.
Published: (2024) -
Lifelong Knowledge Editing for Vision Language Models with Low-Rank Mixture-of-Experts
by: Chen, Qizhou, et al.
Published: (2024) -
VSearcher: Long-Horizon Multimodal Search Agent via Reinforcement Learning
by: Zhang, Ruiyang, et al.
Published: (2026) -
Multi-Granularity Reasoning for Image Quality Assessment via Attribute-Aware Reinforcement Learning to Rank
by: Chen, Xiangyong, et al.
Published: (2026)