Bridging Perception and Reasoning: Token Reweighting for RLVR in Multimodal LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lu, Jinda, Wu, Junkang, Li, Jinghan, Huang, Kexin, Yang, Shuo, Wang, Guoyin, Wu, Jiancan, Wang, Xiang, He, Xiangnan |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Beyond Where to Look: Trajectory-Guided Reinforcement Learning for Multimodal RLVR
par: Lu, Jinda, et autres
Publié: (2026)
par: Lu, Jinda, et autres
Publié: (2026)
AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization
par: Lu, Jinda, et autres
Publié: (2025)
par: Lu, Jinda, et autres
Publié: (2025)
Quantile Advantage Estimation: Stabilizing RLVR for LLM Reasoning
par: Wu, Junkang, et autres
Publié: (2025)
par: Wu, Junkang, et autres
Publié: (2025)
DAMA: Data- and Model-aware Alignment of Multi-modal LLMs
par: Lu, Jinda, et autres
Publié: (2025)
par: Lu, Jinda, et autres
Publié: (2025)
On the Direction of RLVR Updates for LLM Reasoning: Identification and Exploitation
par: Huang, Kexin, et autres
Publié: (2026)
par: Huang, Kexin, et autres
Publié: (2026)
Enhancing Multi-Modal LLMs Reasoning via Difficulty-Aware Group Normalization
par: Li, Jinghan, et autres
Publié: (2026)
par: Li, Jinghan, et autres
Publié: (2026)
Boosting Few-Shot Learning via Attentive Feature Regularization
par: Zhu, Xingyu, et autres
Publié: (2024)
par: Zhu, Xingyu, et autres
Publié: (2024)
UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs
par: Jiang, Houcheng, et autres
Publié: (2026)
par: Jiang, Houcheng, et autres
Publié: (2026)
Rethinking Visual Content Refinement in Low-Shot CLIP Adaptation
par: Lu, Jinda, et autres
Publié: (2024)
par: Lu, Jinda, et autres
Publié: (2024)
RePO: Understanding Preference Learning Through ReLU-Based Optimization
par: Wu, Junkang, et autres
Publié: (2025)
par: Wu, Junkang, et autres
Publié: (2025)
GuardAlign: Test-time Safety Alignment in Multimodal Large Language Models
par: Zhu, Xingyu, et autres
Publié: (2026)
par: Zhu, Xingyu, et autres
Publié: (2026)
Spotlight on Token Perception for Multimodal Reinforcement Learning
par: Huang, Siyuan, et autres
Publié: (2025)
par: Huang, Siyuan, et autres
Publié: (2025)
Reasoning Portability: Guiding Continual Learning for MLLMs in the RLVR Era
par: Hong, Qiuhe, et autres
Publié: (2026)
par: Hong, Qiuhe, et autres
Publié: (2026)
Unified Parameter-Efficient Unlearning for LLMs
par: Ding, Chenlu, et autres
Publié: (2024)
par: Ding, Chenlu, et autres
Publié: (2024)
bi-GRPO: Bidirectional Optimization for Jailbreak Backdoor Injection on LLMs
par: Ji, Wence, et autres
Publié: (2025)
par: Ji, Wence, et autres
Publié: (2025)
Sparse but Critical: A Token-Level Analysis of Distributional Shifts in RLVR Fine-Tuning of LLMs
par: Meng, Haoming, et autres
Publié: (2026)
par: Meng, Haoming, et autres
Publié: (2026)
Aligning Multimodal LLM with Human Preference: A Survey
par: Yu, Tao, et autres
Publié: (2025)
par: Yu, Tao, et autres
Publié: (2025)
Attend to Evidence: Evidence-Anchored Spatial Attention Supervision for Multimodal RLVR
par: Hu, Ruina, et autres
Publié: (2026)
par: Hu, Ruina, et autres
Publié: (2026)
Larger or Smaller Reward Margins to Select Preferences for Alignment?
par: Huang, Kexin, et autres
Publié: (2025)
par: Huang, Kexin, et autres
Publié: (2025)
Dynamic Token Reweighting for Robust Vision-Language Models
par: Jiang, Tanqiu, et autres
Publié: (2025)
par: Jiang, Tanqiu, et autres
Publié: (2025)
BridgeV2W: Bridging Video Generation Models to Embodied World Models via Embodiment Masks
par: Chen, Yixiang, et autres
Publié: (2026)
par: Chen, Yixiang, et autres
Publié: (2026)
SpatialGeo:Boosting Spatial Reasoning in Multimodal LLMs via Geometry-Semantics Fusion
par: Guo, Jiajie, et autres
Publié: (2025)
par: Guo, Jiajie, et autres
Publié: (2025)
GeoTikzBridge: Advancing Multimodal Code Generation for Geometric Perception and Reasoning
par: Sun, Jiayin, et autres
Publié: (2026)
par: Sun, Jiayin, et autres
Publié: (2026)
Accelerating Diffusion Transformer via Gradient-Optimized Cache
par: Qiu, Junxiang, et autres
Publié: (2025)
par: Qiu, Junxiang, et autres
Publié: (2025)
Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning
par: Ou, Siqu, et autres
Publié: (2025)
par: Ou, Siqu, et autres
Publié: (2025)
SeViCES: Unifying Semantic-Visual Evidence Consensus for Long Video Understanding
par: Sheng, Yuan, et autres
Publié: (2025)
par: Sheng, Yuan, et autres
Publié: (2025)
Instruction Tuning-free Visual Token Complement for Multimodal LLMs
par: Wang, Dongsheng, et autres
Publié: (2024)
par: Wang, Dongsheng, et autres
Publié: (2024)
Enhancing Tree Type Detection in Forest Fire Risk Assessment: Multi-Stage Approach and Color Encoding with Forest Fire Risk Evaluation Framework for UAV Imagery
par: Zhang, Jinda
Publié: (2024)
par: Zhang, Jinda
Publié: (2024)
Perception Tokens Enhance Visual Reasoning in Multimodal Language Models
par: Bigverdi, Mahtab, et autres
Publié: (2024)
par: Bigverdi, Mahtab, et autres
Publié: (2024)
IV-Bench: A Benchmark for Image-Grounded Video Perception and Reasoning in Multimodal LLMs
par: Ma, David, et autres
Publié: (2025)
par: Ma, David, et autres
Publié: (2025)
Introducing Visual Perception Token into Multimodal Large Language Model
par: Yu, Runpeng, et autres
Publié: (2025)
par: Yu, Runpeng, et autres
Publié: (2025)
Thinking with Frames: Generative Video Distortion Evaluation via Frame Reward Model
par: Wang, Yuan, et autres
Publié: (2026)
par: Wang, Yuan, et autres
Publié: (2026)
Mitigating Hallucinations in Large Vision-Language Models without Performance Degradation
par: Zhu, Xingyu, et autres
Publié: (2026)
par: Zhu, Xingyu, et autres
Publié: (2026)
Video Token Sparsification for Efficient Multimodal LLMs in Autonomous Driving
par: Ma, Yunsheng, et autres
Publié: (2024)
par: Ma, Yunsheng, et autres
Publié: (2024)
Unleashing Perception-Time Scaling to Multimodal Reasoning Models
par: Li, Yifan, et autres
Publié: (2025)
par: Li, Yifan, et autres
Publié: (2025)
STORM: Token-Efficient Long Video Understanding for Multimodal LLMs
par: Jiang, Jindong, et autres
Publié: (2025)
par: Jiang, Jindong, et autres
Publié: (2025)
AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization
par: Wu, Junkang, et autres
Publié: (2024)
par: Wu, Junkang, et autres
Publié: (2024)
Perception-Aware Multimodal Spatial Reasoning from Monocular Images
par: Cheng, Yanchun, et autres
Publié: (2026)
par: Cheng, Yanchun, et autres
Publié: (2026)
Accelerating Diffusion Transformer via Error-Optimized Cache
par: Qiu, Junxiang, et autres
Publié: (2025)
par: Qiu, Junxiang, et autres
Publié: (2025)
EntropyPrune: Matrix Entropy Guided Visual Token Pruning for Multimodal Large Language Models
par: Wang, Yahong, et autres
Publié: (2026)
par: Wang, Yahong, et autres
Publié: (2026)
Documents similaires
-
Beyond Where to Look: Trajectory-Guided Reinforcement Learning for Multimodal RLVR
par: Lu, Jinda, et autres
Publié: (2026) -
AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization
par: Lu, Jinda, et autres
Publié: (2025) -
Quantile Advantage Estimation: Stabilizing RLVR for LLM Reasoning
par: Wu, Junkang, et autres
Publié: (2025) -
DAMA: Data- and Model-aware Alignment of Multi-modal LLMs
par: Lu, Jinda, et autres
Publié: (2025) -
On the Direction of RLVR Updates for LLM Reasoning: Identification and Exploitation
par: Huang, Kexin, et autres
Publié: (2026)