Cognitive Pivot Points and Visual Anchoring: Unveiling and Rectifying Hallucinations in Multimodal Reasoning Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Qian, Zhe, Ma, Yanbiao, Ouyang, Zhuohan, Wang, Zhonghua, Xu, Zhongxing, Luo, Fei, Liu, Xinyu, Ge, Zongyuan, Guo, Yike, Han, Jungong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SVSR: A Self-Verification and Self-Rectification Paradigm for Multimodal Reasoning
por: Qian, Zhe, et al.
Publicado: (2026)
por: Qian, Zhe, et al.
Publicado: (2026)
Thinking in Uncertainty: Mitigating Hallucinations in MLRMs with Latent Entropy-Aware Decoding
por: Xu, Zhongxing, et al.
Publicado: (2026)
por: Xu, Zhongxing, et al.
Publicado: (2026)
From Perception to Cognition: A Survey of Vision-Language Interactive Reasoning in Multimodal Large Language Models
por: Zhou, Chenyue, et al.
Publicado: (2025)
por: Zhou, Chenyue, et al.
Publicado: (2025)
Unveiling the Pivotal Parameters for Advancing High Energy Density in Lithium‐Sulfur Batteries: A Comprehensive Review
por: Yue Fei, et al.
Publicado: (2024)
por: Yue Fei, et al.
Publicado: (2024)
Region-Constrained Group Relative Policy Optimization for Flow-Based Image Editing
por: Ouyang, Zhuohan, et al.
Publicado: (2026)
por: Ouyang, Zhuohan, et al.
Publicado: (2026)
Unveiling the Cognitive Compass: Theory-of-Mind-Guided Multimodal Emotion Reasoning
por: Luo, Meng, et al.
Publicado: (2026)
por: Luo, Meng, et al.
Publicado: (2026)
VisionPulse: Dynamic Visual Sparsity for Efficient Multimodal Reasoning
por: Xu, Hengbo, et al.
Publicado: (2026)
por: Xu, Hengbo, et al.
Publicado: (2026)
Mostly Text, Smart Visuals: Asymmetric Text-Visual Pruning for Large Vision-Language Models
por: Li, Sijie, et al.
Publicado: (2026)
por: Li, Sijie, et al.
Publicado: (2026)
Reasoning emerges from constrained inference manifolds in large language models
por: Ma, Yanbiao, et al.
Publicado: (2026)
por: Ma, Yanbiao, et al.
Publicado: (2026)
Toward Modality Gap: Vision Prototype Learning for Weakly-supervised Semantic Segmentation with CLIP
por: Xu, Zhongxing, et al.
Publicado: (2024)
por: Xu, Zhongxing, et al.
Publicado: (2024)
More Thinking, Less Seeing? Assessing Amplified Hallucination in Multimodal Reasoning Models
por: Liu, Chengzhi, et al.
Publicado: (2025)
por: Liu, Chengzhi, et al.
Publicado: (2025)
Hunting Attributes: Context Prototype-Aware Learning for Weakly Supervised Semantic Segmentation
por: Tang, Feilong, et al.
Publicado: (2024)
por: Tang, Feilong, et al.
Publicado: (2024)
Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding
por: Tang, Feilong, et al.
Publicado: (2025)
por: Tang, Feilong, et al.
Publicado: (2025)
ChainMPQ: Interleaved Text-Image Reasoning Chains for Mitigating Relation Hallucinations
por: Wu, Yike, et al.
Publicado: (2025)
por: Wu, Yike, et al.
Publicado: (2025)
Towards Reason-Informed Video Editing in Unified Models with Self-Reflective Learning
por: Liu, Xinyu, et al.
Publicado: (2025)
por: Liu, Xinyu, et al.
Publicado: (2025)
Point Linguist Model: Segment Any Object via Bridged Large 3D-Language Model
por: Huang, Zhuoxu, et al.
Publicado: (2025)
por: Huang, Zhuoxu, et al.
Publicado: (2025)
Neurosymbolic Framework for Concept-Driven Logical Reasoning in Skeleton-Based Human Action Recognition
por: Ilyas, Talha, et al.
Publicado: (2026)
por: Ilyas, Talha, et al.
Publicado: (2026)
SATORI-R1: Incentivizing Multimodal Reasoning through Explicit Visual Anchoring
por: Shen, Chuming, et al.
Publicado: (2025)
por: Shen, Chuming, et al.
Publicado: (2025)
Reinforcing 3D Understanding in Point-VLMs via Geometric Reward Credit Assignment
por: Chen, Jingkun, et al.
Publicado: (2026)
por: Chen, Jingkun, et al.
Publicado: (2026)
MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning
por: Wu, Chengfei, et al.
Publicado: (2025)
por: Wu, Chengfei, et al.
Publicado: (2025)
HaloQuest: A Visual Hallucination Dataset for Advancing Multimodal Reasoning
por: Wang, Zhecan, et al.
Publicado: (2024)
por: Wang, Zhecan, et al.
Publicado: (2024)
Faithful-MR1: Faithful Multimodal Reasoning via Anchoring and Reinforcing Visual Attention
por: Tian, Changyuan, et al.
Publicado: (2026)
por: Tian, Changyuan, et al.
Publicado: (2026)
PiLLar: Matching for Pivot Table Schema via LLM-guided Monte-Carlo Tree Search
por: Gao, Yunjun, et al.
Publicado: (2026)
por: Gao, Yunjun, et al.
Publicado: (2026)
On Exploring PDE Modeling for Point Cloud Video Representation Learning
por: Huang, Zhuoxu, et al.
Publicado: (2024)
por: Huang, Zhuoxu, et al.
Publicado: (2024)
RectifID: Personalizing Rectified Flow with Anchored Classifier Guidance
por: Sun, Zhicheng, et al.
Publicado: (2024)
por: Sun, Zhicheng, et al.
Publicado: (2024)
Geometric Prior-Guided Federated Prompt Calibration
por: Luo, Fei, et al.
Publicado: (2025)
por: Luo, Fei, et al.
Publicado: (2025)
Token Preference Optimization with Self-Calibrated Visual-Anchored Rewards for Hallucination Mitigation
por: Gu, Jihao, et al.
Publicado: (2024)
por: Gu, Jihao, et al.
Publicado: (2024)
Benchmarking and Evolving Reason-Reflect-Rectify for Reflective Visual Generation
por: Wang, Junjie, et al.
Publicado: (2026)
por: Wang, Junjie, et al.
Publicado: (2026)
The Geometry of the Pivot: A Note on Lazy Pivoted Cholesky and Farthest Point Sampling
por: Shabat, Gil
Publicado: (2026)
por: Shabat, Gil
Publicado: (2026)
Look on Demand: A Cognitive Scheduling Framework for Visual Evidence Acquisition in Multimodal Reasoning
por: Zhang, Yang, et al.
Publicado: (2026)
por: Zhang, Yang, et al.
Publicado: (2026)
M$^3$-ACE: Rectifying Visual Perception in Multimodal Math Reasoning via Multi-Agentic Context Engineering
por: Xie, Peijin, et al.
Publicado: (2026)
por: Xie, Peijin, et al.
Publicado: (2026)
CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal Reasoning
por: Wang, Yongxin, et al.
Publicado: (2025)
por: Wang, Yongxin, et al.
Publicado: (2025)
Paving the Way for Point Cloud Video Representation Learning Using A PDE Model
por: Huang, Zhuoxu, et al.
Publicado: (2026)
por: Huang, Zhuoxu, et al.
Publicado: (2026)
Combating Multimodal LLM Hallucination via Bottom-Up Holistic Reasoning
por: Wu, Shengqiong, et al.
Publicado: (2024)
por: Wu, Shengqiong, et al.
Publicado: (2024)
Generalized Category Discovery under Domain Shift: A Frequency Domain Perspective
por: Feng, Wei, et al.
Publicado: (2025)
por: Feng, Wei, et al.
Publicado: (2025)
Cognitive Visual-Language Mapper: Advancing Multimodal Comprehension with Enhanced Visual Knowledge Alignment
por: Li, Yunxin, et al.
Publicado: (2024)
por: Li, Yunxin, et al.
Publicado: (2024)
Thinking Before Looking: Improving Multimodal LLM Reasoning via Mitigating Visual Hallucination
por: Zheng, Haojie, et al.
Publicado: (2024)
por: Zheng, Haojie, et al.
Publicado: (2024)
Memory-Anchored Multimodal Reasoning for Explainable Video Forensics
por: Chen, Chen, et al.
Publicado: (2025)
por: Chen, Chen, et al.
Publicado: (2025)
Perceptual-Evidence Anchored Reinforced Learning for Multimodal Reasoning
por: Zhang, Chi, et al.
Publicado: (2025)
por: Zhang, Chi, et al.
Publicado: (2025)
Open Vision Reasoner: Transferring Linguistic Cognitive Behavior for Visual Reasoning
por: Wei, Yana, et al.
Publicado: (2025)
por: Wei, Yana, et al.
Publicado: (2025)
Ejemplares similares
-
SVSR: A Self-Verification and Self-Rectification Paradigm for Multimodal Reasoning
por: Qian, Zhe, et al.
Publicado: (2026) -
Thinking in Uncertainty: Mitigating Hallucinations in MLRMs with Latent Entropy-Aware Decoding
por: Xu, Zhongxing, et al.
Publicado: (2026) -
From Perception to Cognition: A Survey of Vision-Language Interactive Reasoning in Multimodal Large Language Models
por: Zhou, Chenyue, et al.
Publicado: (2025) -
Unveiling the Pivotal Parameters for Advancing High Energy Density in Lithium‐Sulfur Batteries: A Comprehensive Review
por: Yue Fei, et al.
Publicado: (2024) -
Region-Constrained Group Relative Policy Optimization for Flow-Based Image Editing
por: Ouyang, Zhuohan, et al.
Publicado: (2026)