APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization
Fuente:
arXiv
Salvato in:
| Autori principali: | Hong, Minjie, Guo, Zirun, Xia, Yan, Wang, Zehan, Zhang, Ziang, Jin, Tao, Zhao, Zhou |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Observe-R1: Unlocking Reasoning Abilities of MLLMs with Dynamic Progressive Reinforcement Learning
di: Guo, Zirun, et al.
Pubblicazione: (2025)
di: Guo, Zirun, et al.
Pubblicazione: (2025)
DSI-Bench: A Benchmark for Dynamic Spatial Intelligence
di: Zhang, Ziang, et al.
Pubblicazione: (2025)
di: Zhang, Ziang, et al.
Pubblicazione: (2025)
Decoupling Stability and Plasticity for Multi-Modal Test-Time Adaptation
di: He, Yongbo, et al.
Pubblicazione: (2026)
di: He, Yongbo, et al.
Pubblicazione: (2026)
Thinking with Programming Vision: Towards a Unified View for Thinking with Images
di: Guo, Zirun, et al.
Pubblicazione: (2025)
di: Guo, Zirun, et al.
Pubblicazione: (2025)
Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans
di: Qiu, Yansheng, et al.
Pubblicazione: (2025)
di: Qiu, Yansheng, et al.
Pubblicazione: (2025)
Multimodal Prompt Learning with Missing Modalities for Sentiment Analysis and Emotion Recognition
di: Guo, Zirun, et al.
Pubblicazione: (2024)
di: Guo, Zirun, et al.
Pubblicazione: (2024)
Classifier-guided Gradient Modulation for Enhanced Multimodal Learning
di: Guo, Zirun, et al.
Pubblicazione: (2024)
di: Guo, Zirun, et al.
Pubblicazione: (2024)
Smoothing the Shift: Towards Stable Test-Time Adaptation under Complex Multimodal Noises
di: Guo, Zirun, et al.
Pubblicazione: (2025)
di: Guo, Zirun, et al.
Pubblicazione: (2025)
ConceptGuard: Continual Personalized Text-to-Image Generation with Forgetting and Confusion Mitigation
di: Guo, Zirun, et al.
Pubblicazione: (2025)
di: Guo, Zirun, et al.
Pubblicazione: (2025)
Mitigating Visual Hallucinations via Semantic Curriculum Preference Optimization in MLLMs
di: Li, Yuanshuai, et al.
Pubblicazione: (2025)
di: Li, Yuanshuai, et al.
Pubblicazione: (2025)
Diff-Prompt: Diffusion-Driven Prompt Generator with Mask Supervision
di: Yan, Weicai, et al.
Pubblicazione: (2025)
di: Yan, Weicai, et al.
Pubblicazione: (2025)
Towards Faithful Reasoning in Comics for Small MLLMs
di: Feng, Chengcheng, et al.
Pubblicazione: (2026)
di: Feng, Chengcheng, et al.
Pubblicazione: (2026)
UniAPO: Unified Multimodal Automated Prompt Optimization
di: Zhu, Qipeng, et al.
Pubblicazione: (2025)
di: Zhu, Qipeng, et al.
Pubblicazione: (2025)
Low-rank Prompt Interaction for Continual Vision-Language Retrieval
di: Yan, Weicai, et al.
Pubblicazione: (2025)
di: Yan, Weicai, et al.
Pubblicazione: (2025)
FreeBind: Free Lunch in Unified Multimodal Space via Knowledge Fusion
di: Wang, Zehan, et al.
Pubblicazione: (2024)
di: Wang, Zehan, et al.
Pubblicazione: (2024)
MME-Reasoning: A Comprehensive Benchmark for Logical Reasoning in MLLMs
di: Yuan, Jiakang, et al.
Pubblicazione: (2025)
di: Yuan, Jiakang, et al.
Pubblicazione: (2025)
Tables as Texts or Images: Evaluating the Table Reasoning Ability of LLMs and MLLMs
di: Deng, Naihao, et al.
Pubblicazione: (2024)
di: Deng, Naihao, et al.
Pubblicazione: (2024)
Towards Unified Surgical Scene Understanding:Bridging Reasoning and Grounding via MLLMs
di: Huang, Jincai, et al.
Pubblicazione: (2026)
di: Huang, Jincai, et al.
Pubblicazione: (2026)
Interpretable and Reliable Detection of AI-Generated Images via Grounded Reasoning in MLLMs
di: Ji, Yikun, et al.
Pubblicazione: (2025)
di: Ji, Yikun, et al.
Pubblicazione: (2025)
S$^2$-MLLM: Boosting Spatial Reasoning Capability of MLLMs for 3D Visual Grounding with Structural Guidance
di: Xu, Beining, et al.
Pubblicazione: (2025)
di: Xu, Beining, et al.
Pubblicazione: (2025)
Enhancing Advanced Visual Reasoning Ability of Large Language Models
di: Li, Zhiyuan, et al.
Pubblicazione: (2024)
di: Li, Zhiyuan, et al.
Pubblicazione: (2024)
TimeSuite: Improving MLLMs for Long Video Understanding via Grounded Tuning
di: Zeng, Xiangyu, et al.
Pubblicazione: (2024)
di: Zeng, Xiangyu, et al.
Pubblicazione: (2024)
Unlocking the Essence of Beauty: Advanced Aesthetic Reasoning with Relative-Absolute Policy Optimization
di: Liu, Boyang, et al.
Pubblicazione: (2025)
di: Liu, Boyang, et al.
Pubblicazione: (2025)
A Wander Through the Multimodal Landscape: Efficient Transfer Learning via Low-rank Sequence Multimodal Adapter
di: Guo, Zirun, et al.
Pubblicazione: (2024)
di: Guo, Zirun, et al.
Pubblicazione: (2024)
VAP-Diffusion: Enriching Descriptions with MLLMs for Enhanced Medical Image Generation
di: Huang, Peng, et al.
Pubblicazione: (2025)
di: Huang, Peng, et al.
Pubblicazione: (2025)
VITAL: Visual-Semantic Dual Supervision for Enhanced and Interpretable Latent Reasoning in Medical MLLMs
di: Li, Qiaoru, et al.
Pubblicazione: (2026)
di: Li, Qiaoru, et al.
Pubblicazione: (2026)
SpatialTree: How Spatial Abilities Branch Out in MLLMs
di: Xiao, Yuxi, et al.
Pubblicazione: (2025)
di: Xiao, Yuxi, et al.
Pubblicazione: (2025)
Reasoning via Video: The First Evaluation of Video Models' Reasoning Abilities through Maze-Solving Tasks
di: Yang, Cheng, et al.
Pubblicazione: (2025)
di: Yang, Cheng, et al.
Pubblicazione: (2025)
ProAPO: Progressively Automatic Prompt Optimization for Visual Classification
di: Qu, Xiangyan, et al.
Pubblicazione: (2025)
di: Qu, Xiangyan, et al.
Pubblicazione: (2025)
MLLMs Know When Before Speaking: Revealing and Recovering Temporal Grounding via Attention Cues
di: Du, Dazhao, et al.
Pubblicazione: (2026)
di: Du, Dazhao, et al.
Pubblicazione: (2026)
Look Before You Decide: Prompting Active Deduction of MLLMs for Assumptive Reasoning
di: Li, Yian, et al.
Pubblicazione: (2024)
di: Li, Yian, et al.
Pubblicazione: (2024)
Enhancing Image Quality Assessment Ability of LMMs via Retrieval-Augmented Generation
di: Fu, Kang, et al.
Pubblicazione: (2026)
di: Fu, Kang, et al.
Pubblicazione: (2026)
Orient Anything: Learning Robust Object Orientation Estimation from Rendering 3D Models
di: Wang, Zehan, et al.
Pubblicazione: (2024)
di: Wang, Zehan, et al.
Pubblicazione: (2024)
Improving the Reasoning of Multi-Image Grounding in MLLMs via Reinforcement Learning
di: Zhang, Bob, et al.
Pubblicazione: (2025)
di: Zhang, Bob, et al.
Pubblicazione: (2025)
LLM-I: LLMs are Naturally Interleaved Multimodal Creators
di: Guo, Zirun, et al.
Pubblicazione: (2025)
di: Guo, Zirun, et al.
Pubblicazione: (2025)
VISA: Group-wise Visual Token Selection and Aggregation via Graph Summarization for Efficient MLLMs Inference
di: Jiang, Pengfei, et al.
Pubblicazione: (2025)
di: Jiang, Pengfei, et al.
Pubblicazione: (2025)
IF-Bench: Benchmarking and Enhancing MLLMs for Infrared Images with Generative Visual Prompting
di: Zhang, Tao, et al.
Pubblicazione: (2025)
di: Zhang, Tao, et al.
Pubblicazione: (2025)
Unlocking the Potential of MLLMs in Referring Expression Segmentation via a Light-weight Mask Decoder
di: Wang, Jingchao, et al.
Pubblicazione: (2025)
di: Wang, Jingchao, et al.
Pubblicazione: (2025)
OmniBind: Large-scale Omni Multimodal Representation via Binding Spaces
di: Wang, Zehan, et al.
Pubblicazione: (2024)
di: Wang, Zehan, et al.
Pubblicazione: (2024)
Reasoning Can Hurt the Inductive Abilities of Large Language Models
di: Jin, Haibo, et al.
Pubblicazione: (2025)
di: Jin, Haibo, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Observe-R1: Unlocking Reasoning Abilities of MLLMs with Dynamic Progressive Reinforcement Learning
di: Guo, Zirun, et al.
Pubblicazione: (2025) -
DSI-Bench: A Benchmark for Dynamic Spatial Intelligence
di: Zhang, Ziang, et al.
Pubblicazione: (2025) -
Decoupling Stability and Plasticity for Multi-Modal Test-Time Adaptation
di: He, Yongbo, et al.
Pubblicazione: (2026) -
Thinking with Programming Vision: Towards a Unified View for Thinking with Images
di: Guo, Zirun, et al.
Pubblicazione: (2025) -
Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans
di: Qiu, Yansheng, et al.
Pubblicazione: (2025)