Enregistré dans:
| Auteurs principaux: | Yan, Yuming, Tang, Kai, Chen, Sihong, Xu, Ke, Hu, Dan, Yu, Qun, Hu, Pengfei |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2604.16557 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
On Asymmetric Optimization of Reasoning and Perception in Vision-Language Model Post-Training
par: Wu, Xueqing, et autres
Publié: (2026)
par: Wu, Xueqing, et autres
Publié: (2026)
Enhancing Large Vision Language Models with Self-Training on Image Comprehension
par: Deng, Yihe, et autres
Publié: (2024)
par: Deng, Yihe, et autres
Publié: (2024)
Fast-Slow Thinking GRPO for Large Vision-Language Model Reasoning
par: Xiao, Wenyi, et autres
Publié: (2025)
par: Xiao, Wenyi, et autres
Publié: (2025)
Watch Closely: Mitigating Object Hallucinations in Large Vision-Language Models with Disentangled Decoding
par: Ma, Ruiqi, et autres
Publié: (2025)
par: Ma, Ruiqi, et autres
Publié: (2025)
From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models
par: Wu, Juncheng, et autres
Publié: (2026)
par: Wu, Juncheng, et autres
Publié: (2026)
Conflict Adaptation in Vision-Language Models
par: Hu, Xiaoyang
Publié: (2025)
par: Hu, Xiaoyang
Publié: (2025)
Unified Triplet-Level Hallucination Evaluation for Large Vision-Language Models
par: Wu, Junjie, et autres
Publié: (2024)
par: Wu, Junjie, et autres
Publié: (2024)
Vision-centric Token Compression in Large Language Model
par: Xing, Ling, et autres
Publié: (2025)
par: Xing, Ling, et autres
Publié: (2025)
Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding
par: Wang, Ye, et autres
Publié: (2025)
par: Wang, Ye, et autres
Publié: (2025)
Matryoshka Query Transformer for Large Vision-Language Models
par: Hu, Wenbo, et autres
Publié: (2024)
par: Hu, Wenbo, et autres
Publié: (2024)
A Unified Hallucination Mitigation Framework for Large Vision-Language Models
par: Chang, Yue, et autres
Publié: (2024)
par: Chang, Yue, et autres
Publié: (2024)
VALOR-EVAL: Holistic Coverage and Faithfulness Evaluation of Large Vision-Language Models
par: Qiu, Haoyi, et autres
Publié: (2024)
par: Qiu, Haoyi, et autres
Publié: (2024)
LLM Post-Training: A Deep Dive into Reasoning Large Language Models
par: Kumar, Komal, et autres
Publié: (2025)
par: Kumar, Komal, et autres
Publié: (2025)
AlignMMBench: Evaluating Chinese Multimodal Alignment in Large Vision-Language Models
par: Wu, Yuhang, et autres
Publié: (2024)
par: Wu, Yuhang, et autres
Publié: (2024)
Mitigating Hallucinations in Large Vision-Language Models by Self-Injecting Hallucinations
par: Lu, Yifan, et autres
Publié: (2025)
par: Lu, Yifan, et autres
Publié: (2025)
UniChange: Unifying Change Detection with Multimodal Large Language Model
par: Zhang, Xu, et autres
Publié: (2025)
par: Zhang, Xu, et autres
Publié: (2025)
On Domain-Adaptive Post-Training for Multimodal Large Language Models
par: Cheng, Daixuan, et autres
Publié: (2024)
par: Cheng, Daixuan, et autres
Publié: (2024)
ChartMuseum: Testing Visual Reasoning Capabilities of Large Vision-Language Models
par: Tang, Liyan, et autres
Publié: (2025)
par: Tang, Liyan, et autres
Publié: (2025)
URPO: A Unified Reward & Policy Optimization Framework for Large Language Models
par: Lu, Songshuo, et autres
Publié: (2025)
par: Lu, Songshuo, et autres
Publié: (2025)
Large Vision-Language Model Alignment and Misalignment: A Survey Through the Lens of Explainability
par: Shu, Dong, et autres
Publié: (2025)
par: Shu, Dong, et autres
Publié: (2025)
Think-Reflect-Revise: A Policy-Guided Reflective Framework for Safety Alignment in Large Vision Language Models
par: Weng, Fenghua, et autres
Publié: (2025)
par: Weng, Fenghua, et autres
Publié: (2025)
Beyond Translation: Cross-Cultural Meme Transcreation with Vision-Language Models
par: Zhao, Yuming, et autres
Publié: (2026)
par: Zhao, Yuming, et autres
Publié: (2026)
On the Limits of Token Reduction for Efficient Unified Vision Language Training
par: Chen, Siyi, et autres
Publié: (2026)
par: Chen, Siyi, et autres
Publié: (2026)
Diving into Mitigating Hallucinations from a Vision Perspective for Large Vision-Language Models
par: Wang, Weihang, et autres
Publié: (2025)
par: Wang, Weihang, et autres
Publié: (2025)
Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models
par: Huang, Wenxuan, et autres
Publié: (2025)
par: Huang, Wenxuan, et autres
Publié: (2025)
IdealGPT: Iteratively Decomposing Vision and Language Reasoning via Large Language Models
par: You, Haoxuan, et autres
Publié: (2023)
par: You, Haoxuan, et autres
Publié: (2023)
From Heads to Neurons: Causal Attribution and Steering in Multi-Task Vision-Language Models
par: Wang, Qidong, et autres
Publié: (2026)
par: Wang, Qidong, et autres
Publié: (2026)
TemMed-Bench: Evaluating Temporal Medical Image Reasoning in Vision-Language Models
par: Zhang, Junyi, et autres
Publié: (2025)
par: Zhang, Junyi, et autres
Publié: (2025)
ICT: Image-Object Cross-Level Trusted Intervention for Mitigating Object Hallucination in Large Vision-Language Models
par: Chen, Junzhe, et autres
Publié: (2024)
par: Chen, Junzhe, et autres
Publié: (2024)
G$^2$VLM: Geometry Grounded Vision Language Model with Unified 3D Reconstruction and Spatial Reasoning
par: Hu, Wenbo, et autres
Publié: (2025)
par: Hu, Wenbo, et autres
Publié: (2025)
Beyond the Vision Encoder: Identifying and Mitigating Spatial Bias in Large Vision-Language Models
par: Zhu, Yingjie, et autres
Publié: (2025)
par: Zhu, Yingjie, et autres
Publié: (2025)
Growing a Multi-head Twig via Distillation and Reinforcement Learning to Accelerate Large Vision-Language Models
par: Shao, Zhenwei, et autres
Publié: (2025)
par: Shao, Zhenwei, et autres
Publié: (2025)
VisualSimpleQA: A Benchmark for Decoupled Evaluation of Large Vision-Language Models in Fact-Seeking Question Answering
par: Wang, Yanling, et autres
Publié: (2025)
par: Wang, Yanling, et autres
Publié: (2025)
ODE: Open-Set Evaluation of Hallucinations in Multimodal Large Language Models
par: Tu, Yahan, et autres
Publié: (2024)
par: Tu, Yahan, et autres
Publié: (2024)
UniFine: A Unified and Fine-grained Approach for Zero-shot Vision-Language Understanding
par: Wang, Zhecan, et autres
Publié: (2023)
par: Wang, Zhecan, et autres
Publié: (2023)
VScan: Rethinking Visual Token Reduction for Efficient Large Vision-Language Models
par: Zhang, Ce, et autres
Publié: (2025)
par: Zhang, Ce, et autres
Publié: (2025)
A Survey on Hallucination in Large Vision-Language Models
par: Liu, Hanchao, et autres
Publié: (2024)
par: Liu, Hanchao, et autres
Publié: (2024)
Intriguing Properties of Large Language and Vision Models
par: Lee, Young-Jun, et autres
Publié: (2024)
par: Lee, Young-Jun, et autres
Publié: (2024)
Cross-Modal Obfuscation for Jailbreak Attacks on Large Vision-Language Models
par: Jiang, Lei, et autres
Publié: (2025)
par: Jiang, Lei, et autres
Publié: (2025)
VEGAS: Mitigating Hallucinations in Large Vision-Language Models via Vision-Encoder Attention Guided Adaptive Steering
par: Wang, Zihu, et autres
Publié: (2025)
par: Wang, Zihu, et autres
Publié: (2025)
Documents similaires
-
On Asymmetric Optimization of Reasoning and Perception in Vision-Language Model Post-Training
par: Wu, Xueqing, et autres
Publié: (2026) -
Enhancing Large Vision Language Models with Self-Training on Image Comprehension
par: Deng, Yihe, et autres
Publié: (2024) -
Fast-Slow Thinking GRPO for Large Vision-Language Model Reasoning
par: Xiao, Wenyi, et autres
Publié: (2025) -
Watch Closely: Mitigating Object Hallucinations in Large Vision-Language Models with Disentangled Decoding
par: Ma, Ruiqi, et autres
Publié: (2025) -
From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models
par: Wu, Juncheng, et autres
Publié: (2026)