APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hong, Minjie, Guo, Zirun, Xia, Yan, Wang, Zehan, Zhang, Ziang, Jin, Tao, Zhao, Zhou |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Observe-R1: Unlocking Reasoning Abilities of MLLMs with Dynamic Progressive Reinforcement Learning
par: Guo, Zirun, et autres
Publié: (2025)
par: Guo, Zirun, et autres
Publié: (2025)
DSI-Bench: A Benchmark for Dynamic Spatial Intelligence
par: Zhang, Ziang, et autres
Publié: (2025)
par: Zhang, Ziang, et autres
Publié: (2025)
Decoupling Stability and Plasticity for Multi-Modal Test-Time Adaptation
par: He, Yongbo, et autres
Publié: (2026)
par: He, Yongbo, et autres
Publié: (2026)
Thinking with Programming Vision: Towards a Unified View for Thinking with Images
par: Guo, Zirun, et autres
Publié: (2025)
par: Guo, Zirun, et autres
Publié: (2025)
Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans
par: Qiu, Yansheng, et autres
Publié: (2025)
par: Qiu, Yansheng, et autres
Publié: (2025)
Multimodal Prompt Learning with Missing Modalities for Sentiment Analysis and Emotion Recognition
par: Guo, Zirun, et autres
Publié: (2024)
par: Guo, Zirun, et autres
Publié: (2024)
Classifier-guided Gradient Modulation for Enhanced Multimodal Learning
par: Guo, Zirun, et autres
Publié: (2024)
par: Guo, Zirun, et autres
Publié: (2024)
Smoothing the Shift: Towards Stable Test-Time Adaptation under Complex Multimodal Noises
par: Guo, Zirun, et autres
Publié: (2025)
par: Guo, Zirun, et autres
Publié: (2025)
ConceptGuard: Continual Personalized Text-to-Image Generation with Forgetting and Confusion Mitigation
par: Guo, Zirun, et autres
Publié: (2025)
par: Guo, Zirun, et autres
Publié: (2025)
Mitigating Visual Hallucinations via Semantic Curriculum Preference Optimization in MLLMs
par: Li, Yuanshuai, et autres
Publié: (2025)
par: Li, Yuanshuai, et autres
Publié: (2025)
Diff-Prompt: Diffusion-Driven Prompt Generator with Mask Supervision
par: Yan, Weicai, et autres
Publié: (2025)
par: Yan, Weicai, et autres
Publié: (2025)
Towards Faithful Reasoning in Comics for Small MLLMs
par: Feng, Chengcheng, et autres
Publié: (2026)
par: Feng, Chengcheng, et autres
Publié: (2026)
UniAPO: Unified Multimodal Automated Prompt Optimization
par: Zhu, Qipeng, et autres
Publié: (2025)
par: Zhu, Qipeng, et autres
Publié: (2025)
Low-rank Prompt Interaction for Continual Vision-Language Retrieval
par: Yan, Weicai, et autres
Publié: (2025)
par: Yan, Weicai, et autres
Publié: (2025)
FreeBind: Free Lunch in Unified Multimodal Space via Knowledge Fusion
par: Wang, Zehan, et autres
Publié: (2024)
par: Wang, Zehan, et autres
Publié: (2024)
MME-Reasoning: A Comprehensive Benchmark for Logical Reasoning in MLLMs
par: Yuan, Jiakang, et autres
Publié: (2025)
par: Yuan, Jiakang, et autres
Publié: (2025)
Tables as Texts or Images: Evaluating the Table Reasoning Ability of LLMs and MLLMs
par: Deng, Naihao, et autres
Publié: (2024)
par: Deng, Naihao, et autres
Publié: (2024)
Towards Unified Surgical Scene Understanding:Bridging Reasoning and Grounding via MLLMs
par: Huang, Jincai, et autres
Publié: (2026)
par: Huang, Jincai, et autres
Publié: (2026)
Interpretable and Reliable Detection of AI-Generated Images via Grounded Reasoning in MLLMs
par: Ji, Yikun, et autres
Publié: (2025)
par: Ji, Yikun, et autres
Publié: (2025)
S$^2$-MLLM: Boosting Spatial Reasoning Capability of MLLMs for 3D Visual Grounding with Structural Guidance
par: Xu, Beining, et autres
Publié: (2025)
par: Xu, Beining, et autres
Publié: (2025)
TimeSuite: Improving MLLMs for Long Video Understanding via Grounded Tuning
par: Zeng, Xiangyu, et autres
Publié: (2024)
par: Zeng, Xiangyu, et autres
Publié: (2024)
Enhancing Advanced Visual Reasoning Ability of Large Language Models
par: Li, Zhiyuan, et autres
Publié: (2024)
par: Li, Zhiyuan, et autres
Publié: (2024)
A Wander Through the Multimodal Landscape: Efficient Transfer Learning via Low-rank Sequence Multimodal Adapter
par: Guo, Zirun, et autres
Publié: (2024)
par: Guo, Zirun, et autres
Publié: (2024)
Unlocking the Essence of Beauty: Advanced Aesthetic Reasoning with Relative-Absolute Policy Optimization
par: Liu, Boyang, et autres
Publié: (2025)
par: Liu, Boyang, et autres
Publié: (2025)
VAP-Diffusion: Enriching Descriptions with MLLMs for Enhanced Medical Image Generation
par: Huang, Peng, et autres
Publié: (2025)
par: Huang, Peng, et autres
Publié: (2025)
VITAL: Visual-Semantic Dual Supervision for Enhanced and Interpretable Latent Reasoning in Medical MLLMs
par: Li, Qiaoru, et autres
Publié: (2026)
par: Li, Qiaoru, et autres
Publié: (2026)
SpatialTree: How Spatial Abilities Branch Out in MLLMs
par: Xiao, Yuxi, et autres
Publié: (2025)
par: Xiao, Yuxi, et autres
Publié: (2025)
Reasoning via Video: The First Evaluation of Video Models' Reasoning Abilities through Maze-Solving Tasks
par: Yang, Cheng, et autres
Publié: (2025)
par: Yang, Cheng, et autres
Publié: (2025)
ProAPO: Progressively Automatic Prompt Optimization for Visual Classification
par: Qu, Xiangyan, et autres
Publié: (2025)
par: Qu, Xiangyan, et autres
Publié: (2025)
MLLMs Know When Before Speaking: Revealing and Recovering Temporal Grounding via Attention Cues
par: Du, Dazhao, et autres
Publié: (2026)
par: Du, Dazhao, et autres
Publié: (2026)
Look Before You Decide: Prompting Active Deduction of MLLMs for Assumptive Reasoning
par: Li, Yian, et autres
Publié: (2024)
par: Li, Yian, et autres
Publié: (2024)
Enhancing Image Quality Assessment Ability of LMMs via Retrieval-Augmented Generation
par: Fu, Kang, et autres
Publié: (2026)
par: Fu, Kang, et autres
Publié: (2026)
Orient Anything: Learning Robust Object Orientation Estimation from Rendering 3D Models
par: Wang, Zehan, et autres
Publié: (2024)
par: Wang, Zehan, et autres
Publié: (2024)
Improving the Reasoning of Multi-Image Grounding in MLLMs via Reinforcement Learning
par: Zhang, Bob, et autres
Publié: (2025)
par: Zhang, Bob, et autres
Publié: (2025)
LLM-I: LLMs are Naturally Interleaved Multimodal Creators
par: Guo, Zirun, et autres
Publié: (2025)
par: Guo, Zirun, et autres
Publié: (2025)
VISA: Group-wise Visual Token Selection and Aggregation via Graph Summarization for Efficient MLLMs Inference
par: Jiang, Pengfei, et autres
Publié: (2025)
par: Jiang, Pengfei, et autres
Publié: (2025)
IF-Bench: Benchmarking and Enhancing MLLMs for Infrared Images with Generative Visual Prompting
par: Zhang, Tao, et autres
Publié: (2025)
par: Zhang, Tao, et autres
Publié: (2025)
OmniBind: Large-scale Omni Multimodal Representation via Binding Spaces
par: Wang, Zehan, et autres
Publié: (2024)
par: Wang, Zehan, et autres
Publié: (2024)
Unlocking the Potential of MLLMs in Referring Expression Segmentation via a Light-weight Mask Decoder
par: Wang, Jingchao, et autres
Publié: (2025)
par: Wang, Jingchao, et autres
Publié: (2025)
Reasoning Can Hurt the Inductive Abilities of Large Language Models
par: Jin, Haibo, et autres
Publié: (2025)
par: Jin, Haibo, et autres
Publié: (2025)
Documents similaires
-
Observe-R1: Unlocking Reasoning Abilities of MLLMs with Dynamic Progressive Reinforcement Learning
par: Guo, Zirun, et autres
Publié: (2025) -
DSI-Bench: A Benchmark for Dynamic Spatial Intelligence
par: Zhang, Ziang, et autres
Publié: (2025) -
Decoupling Stability and Plasticity for Multi-Modal Test-Time Adaptation
par: He, Yongbo, et autres
Publié: (2026) -
Thinking with Programming Vision: Towards a Unified View for Thinking with Images
par: Guo, Zirun, et autres
Publié: (2025) -
Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans
par: Qiu, Yansheng, et autres
Publié: (2025)