Reflection Anchors for Propagation-Aware Visual Retention in Long-Chain Multimodal Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Gong, Xuan, Huang, Hanbo, Zheng, Hao, Zhang, Yiran, Dai, Wenbin, Zhao, Weishu, Liang, Shiyu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MM-HELIX: Boosting Multimodal Long-Chain Reflective Reasoning with Holistic Platform and Adaptive Hybrid Policy Optimization
di: Zhao, Xiangyu, et al.
Pubblicazione: (2025)
di: Zhao, Xiangyu, et al.
Pubblicazione: (2025)
RLSpoofer: A Lightweight Evaluator for LLM Watermark Spoofing Resilience
di: Huang, Hanbo, et al.
Pubblicazione: (2026)
di: Huang, Hanbo, et al.
Pubblicazione: (2026)
Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models
di: Dong, Yuhao, et al.
Pubblicazione: (2024)
di: Dong, Yuhao, et al.
Pubblicazione: (2024)
Prototype-Aware Multimodal Alignment for Open-Vocabulary Visual Grounding
di: Xie, Jiangnan, et al.
Pubblicazione: (2025)
di: Xie, Jiangnan, et al.
Pubblicazione: (2025)
AnE: Pushing the Reasoning Frontier of Multimodal LLMs via Anchor Evolution
di: Wang, Zehao, et al.
Pubblicazione: (2026)
di: Wang, Zehao, et al.
Pubblicazione: (2026)
Render-of-Thought: Rendering Textual Chain-of-Thought as Images for Visual Latent Reasoning
di: Wang, Yifan, et al.
Pubblicazione: (2026)
di: Wang, Yifan, et al.
Pubblicazione: (2026)
Decoupled Contrastive Learning for Long-Tailed Recognition
di: Xuan, Shiyu, et al.
Pubblicazione: (2024)
di: Xuan, Shiyu, et al.
Pubblicazione: (2024)
Visual Anchors Are Strong Information Aggregators For Multimodal Large Language Model
di: Liu, Haogeng, et al.
Pubblicazione: (2024)
di: Liu, Haogeng, et al.
Pubblicazione: (2024)
MIRROR: Multimodal Iterative Reasoning via Reflection on Visual Regions
di: Zhang, Haoyu, et al.
Pubblicazione: (2026)
di: Zhang, Haoyu, et al.
Pubblicazione: (2026)
ChainV: Atomic Visual Hints Make Multimodal Reasoning Shorter and Better
di: Zhang, Yuan, et al.
Pubblicazione: (2025)
di: Zhang, Yuan, et al.
Pubblicazione: (2025)
GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing
di: Fang, Rongyao, et al.
Pubblicazione: (2025)
di: Fang, Rongyao, et al.
Pubblicazione: (2025)
Unveiling Fine-Grained Visual Traces: Evaluating Multimodal Interleaved Reasoning Chains in Multimodal STEM Tasks
di: Jin, Jing, et al.
Pubblicazione: (2026)
di: Jin, Jing, et al.
Pubblicazione: (2026)
EVLM: Self-Reflective Multimodal Reasoning for Cross-Dimensional Visual Editing
di: Khalid, Umar, et al.
Pubblicazione: (2024)
di: Khalid, Umar, et al.
Pubblicazione: (2024)
Federated Modality-specific Encoders and Multimodal Anchors for Personalized Brain Tumor Segmentation
di: Dai, Qian, et al.
Pubblicazione: (2024)
di: Dai, Qian, et al.
Pubblicazione: (2024)
REVISOR: Beyond Textual Reflection, Towards Multimodal Introspective Reasoning in Long-Form Video Understanding
di: Li, Jiaze, et al.
Pubblicazione: (2025)
di: Li, Jiaze, et al.
Pubblicazione: (2025)
Visual Attention Drifts,but Anchors Hold:Mitigating Hallucination in Multimodal Large Language Models via Cross-Layer Visual Anchors
di: Yang, Chengxu, et al.
Pubblicazione: (2026)
di: Yang, Chengxu, et al.
Pubblicazione: (2026)
Learn to Think: Improving Multimodal Reasoning through Vision-Aware Self-Improvement Training
di: Zhong, Qihuang, et al.
Pubblicazione: (2026)
di: Zhong, Qihuang, et al.
Pubblicazione: (2026)
Visual-CoG: Stage-Aware Reinforcement Learning with Chain of Guidance for Text-to-Image Generation
di: Li, Yaqi, et al.
Pubblicazione: (2025)
di: Li, Yaqi, et al.
Pubblicazione: (2025)
MathCanvas: Intrinsic Visual Chain-of-Thought for Multimodal Mathematical Reasoning
di: Shi, Weikang, et al.
Pubblicazione: (2025)
di: Shi, Weikang, et al.
Pubblicazione: (2025)
Progressive Proxy Anchor Propagation for Unsupervised Semantic Segmentation
di: Seong, Hyun Seok, et al.
Pubblicazione: (2024)
di: Seong, Hyun Seok, et al.
Pubblicazione: (2024)
VideoAnchor: Reinforcing Subspace-Structured Visual Cues for Coherent Visual-Spatial Reasoning
di: Wang, Zhaozhi, et al.
Pubblicazione: (2025)
di: Wang, Zhaozhi, et al.
Pubblicazione: (2025)
WorldQA: Multimodal World Knowledge in Videos through Long-Chain Reasoning
di: Zhang, Yuanhan, et al.
Pubblicazione: (2024)
di: Zhang, Yuanhan, et al.
Pubblicazione: (2024)
MoviePuzzle: Visual Narrative Reasoning through Multimodal Order Learning
di: Wang, Jianghui, et al.
Pubblicazione: (2023)
di: Wang, Jianghui, et al.
Pubblicazione: (2023)
Insight-V++: Towards Advanced Long-Chain Visual Reasoning with Multimodal Large Language Models
di: Dong, Yuhao, et al.
Pubblicazione: (2026)
di: Dong, Yuhao, et al.
Pubblicazione: (2026)
Reinforcing Multimodal Reasoning Against Visual Degradation
di: Liu, Rui, et al.
Pubblicazione: (2026)
di: Liu, Rui, et al.
Pubblicazione: (2026)
Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey
di: Wang, Yaoting, et al.
Pubblicazione: (2025)
di: Wang, Yaoting, et al.
Pubblicazione: (2025)
Unlocking Complex Visual Generation via Closed-Loop Verified Reasoning
di: Cheng, Hanbo, et al.
Pubblicazione: (2026)
di: Cheng, Hanbo, et al.
Pubblicazione: (2026)
GGBound: A Genome-Grounded Agent for Microbial Life-Boundary Prediction
di: Huang, Hanbo, et al.
Pubblicazione: (2026)
di: Huang, Hanbo, et al.
Pubblicazione: (2026)
MM-CoT:A Benchmark for Probing Visual Chain-of-Thought Reasoning in Multimodal Models
di: Zhang, Jusheng, et al.
Pubblicazione: (2025)
di: Zhang, Jusheng, et al.
Pubblicazione: (2025)
Chain-of-Frames: Advancing Video Understanding in Multimodal LLMs via Frame-Aware Reasoning
di: Ghazanfari, Sara, et al.
Pubblicazione: (2025)
di: Ghazanfari, Sara, et al.
Pubblicazione: (2025)
Chain-of-Thought Degrades Visual Spatial Reasoning Capabilities of Multimodal LLMs
di: Kancheti, Sai Srinivas, et al.
Pubblicazione: (2026)
di: Kancheti, Sai Srinivas, et al.
Pubblicazione: (2026)
Benchmarking and Evolving Reason-Reflect-Rectify for Reflective Visual Generation
di: Wang, Junjie, et al.
Pubblicazione: (2026)
di: Wang, Junjie, et al.
Pubblicazione: (2026)
VideoTIR: Accurate Understanding for Long Videos with Efficient Tool-Integrated Reasoning
di: Gao, Zhe, et al.
Pubblicazione: (2026)
di: Gao, Zhe, et al.
Pubblicazione: (2026)
From Parameters to Prompts: Understanding and Mitigating the Factuality Gap between Fine-Tuned LLMs
di: Gong, Xuan, et al.
Pubblicazione: (2025)
di: Gong, Xuan, et al.
Pubblicazione: (2025)
ChartSketcher: Reasoning with Multimodal Feedback and Reflection for Chart Understanding
di: Huang, Muye, et al.
Pubblicazione: (2025)
di: Huang, Muye, et al.
Pubblicazione: (2025)
Unsupervised Visual Chain-of-Thought Reasoning via Preference Optimization
di: Zhao, Kesen, et al.
Pubblicazione: (2025)
di: Zhao, Kesen, et al.
Pubblicazione: (2025)
Fair-Eye Net: A Fair, Trustworthy, Multimodal Integrated Glaucoma Full Chain AI System
di: Wei, Wenbin, et al.
Pubblicazione: (2026)
di: Wei, Wenbin, et al.
Pubblicazione: (2026)
ImgCoT: Compressing Long Chain of Thought into Compact Visual Tokens for Efficient Reasoning of Large Language Model
di: Chen, Xiaoshu, et al.
Pubblicazione: (2026)
di: Chen, Xiaoshu, et al.
Pubblicazione: (2026)
Fleming-VL: Towards Universal Medical Visual Reasoning with Multimodal LLMs
di: Shu, Yan, et al.
Pubblicazione: (2025)
di: Shu, Yan, et al.
Pubblicazione: (2025)
Annotation-Free Visual Reasoning for High-Resolution Large Multimodal Models via Reinforcement Learning
di: Yang, Jiacheng, et al.
Pubblicazione: (2026)
di: Yang, Jiacheng, et al.
Pubblicazione: (2026)
Documenti analoghi
-
MM-HELIX: Boosting Multimodal Long-Chain Reflective Reasoning with Holistic Platform and Adaptive Hybrid Policy Optimization
di: Zhao, Xiangyu, et al.
Pubblicazione: (2025) -
RLSpoofer: A Lightweight Evaluator for LLM Watermark Spoofing Resilience
di: Huang, Hanbo, et al.
Pubblicazione: (2026) -
Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models
di: Dong, Yuhao, et al.
Pubblicazione: (2024) -
Prototype-Aware Multimodal Alignment for Open-Vocabulary Visual Grounding
di: Xie, Jiangnan, et al.
Pubblicazione: (2025) -
AnE: Pushing the Reasoning Frontier of Multimodal LLMs via Anchor Evolution
di: Wang, Zehao, et al.
Pubblicazione: (2026)