Context-Aware Multi-Turn Visual-Textual Reasoning in LVLMs via Dynamic Memory and Adaptive Visual Guidance
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Shen, Weijie, Wang, Xinrui, Nie, Yuanqi, Boonmee, Apiradee |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Revolutionizing Radiology Workflow with Factual and Efficient CXR Report Generation
par: Sukjai, Pimchanok, et autres
Publié: (2025)
par: Sukjai, Pimchanok, et autres
Publié: (2025)
Vision-Driven Prompt Optimization for Large Language Models in Multimodal Generative Tasks
par: Franklin, Leo, et autres
Publié: (2025)
par: Franklin, Leo, et autres
Publié: (2025)
CoMemo: LVLMs Need Image Context with Image Memory
par: Liu, Shi, et autres
Publié: (2025)
par: Liu, Shi, et autres
Publié: (2025)
Mitigating Action-Relation Hallucinations in LVLMs via Relation-aware Visual Enhancement
par: Qin, Zhenxin, et autres
Publié: (2026)
par: Qin, Zhenxin, et autres
Publié: (2026)
SAVAA: Mitigating Hallucinations in LVLMs via Step-wise Adaptive Visual Attention Amplification
par: Zhang, Jiacheng, et autres
Publié: (2026)
par: Zhang, Jiacheng, et autres
Publié: (2026)
Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs
par: Huang, Siyuan, et autres
Publié: (2026)
par: Huang, Siyuan, et autres
Publié: (2026)
Elevating Visual Question Answering through Implicitly Learned Reasoning Pathways in LVLMs
par: Jing, Liu, et autres
Publié: (2025)
par: Jing, Liu, et autres
Publié: (2025)
High-Resolution Visual Reasoning via Multi-Turn Grounding-Based Reinforcement Learning
par: Huang, Xinyu, et autres
Publié: (2025)
par: Huang, Xinyu, et autres
Publié: (2025)
Visual Memory Injection Attacks for Multi-Turn Conversations
par: Schlarmann, Christian, et autres
Publié: (2026)
par: Schlarmann, Christian, et autres
Publié: (2026)
RealCamo: Boosting Real Camouflage Synthesis with Layout Controls and Textual-Visual Guidance
par: Chen, Chunyuan, et autres
Publié: (2025)
par: Chen, Chunyuan, et autres
Publié: (2025)
Visual Description Grounding Reduces Hallucinations and Boosts Reasoning in LVLMs
par: Ghosh, Sreyan, et autres
Publié: (2024)
par: Ghosh, Sreyan, et autres
Publié: (2024)
Self-Prophetic Decoding to Unlock Visual Search in LVLMs
par: He, Zhendong, et autres
Publié: (2026)
par: He, Zhendong, et autres
Publié: (2026)
Boosting Visual Knowledge-Intensive Training for LVLMs Through Causality-Driven Visual Object Completion
par: Hu, Qingguo, et autres
Publié: (2025)
par: Hu, Qingguo, et autres
Publié: (2025)
See It, Say It, Sorted: An Iterative Training-Free Framework for Visually-Grounded Multimodal Reasoning in LVLMs
par: Zhang, Yongchang, et autres
Publié: (2026)
par: Zhang, Yongchang, et autres
Publié: (2026)
Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning
par: Li, Zejun, et autres
Publié: (2025)
par: Li, Zejun, et autres
Publié: (2025)
Rethinking Visual Token Reduction in LVLMs Under Cross-Modal Misalignment
par: Xu, Rui, et autres
Publié: (2025)
par: Xu, Rui, et autres
Publié: (2025)
FSMR: A Feature Swapping Multi-modal Reasoning Approach with Joint Textual and Visual Clues
par: Li, Shuang, et autres
Publié: (2024)
par: Li, Shuang, et autres
Publié: (2024)
EntropyScan: Towards Model-level Backdoor Detection in LVLMs via Visual Attention Entropy
par: Ge, Xuanyu, et autres
Publié: (2026)
par: Ge, Xuanyu, et autres
Publié: (2026)
Revealing and Enhancing Core Visual Regions: Harnessing Internal Attention Dynamics for Hallucination Mitigation in LVLMs
par: Lyu, Guangtao, et autres
Publié: (2026)
par: Lyu, Guangtao, et autres
Publié: (2026)
Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding
par: Wu, Hang, et autres
Publié: (2026)
par: Wu, Hang, et autres
Publié: (2026)
ThinkOmni: Lifting Textual Reasoning to Omni-modal Scenarios via Guidance Decoding
par: Guan, Yiran, et autres
Publié: (2026)
par: Guan, Yiran, et autres
Publié: (2026)
See Different, Think Better: Visual Variations Mitigating Hallucinations in LVLMs
par: Dai, Ziyun, et autres
Publié: (2025)
par: Dai, Ziyun, et autres
Publié: (2025)
AutoV: Loss-Oriented Ranking for Visual Prompt Retrieval in LVLMs
par: Zhang, Yuan, et autres
Publié: (2025)
par: Zhang, Yuan, et autres
Publié: (2025)
Adaptive Chain-of-Focus Reasoning via Dynamic Visual Search and Zooming for Efficient VLMs
par: Zhang, Xintong, et autres
Publié: (2025)
par: Zhang, Xintong, et autres
Publié: (2025)
Make LVLMs Focus: Context-Aware Attention Modulation for Better Multimodal In-Context Learning
par: Li, Yanshu, et autres
Publié: (2025)
par: Li, Yanshu, et autres
Publié: (2025)
Enhancing Spatial Reasoning through Visual and Textual Thinking
par: Liang, Xun, et autres
Publié: (2025)
par: Liang, Xun, et autres
Publié: (2025)
Finding the Correct Visual Evidence Without Forgetting: Mitigating Hallucination in LVLMs via Inter-Layer Visual Attention Discrepancy
par: Xie, Yutong, et autres
Publié: (2026)
par: Xie, Yutong, et autres
Publié: (2026)
VIRAL: Visual In-Context Reasoning via Analogy in Diffusion Transformers
par: Li, Zhiwen, et autres
Publié: (2026)
par: Li, Zhiwen, et autres
Publié: (2026)
Autonomous Imagination: Closed-Loop Decomposition of Visual-to-Textual Conversion in Visual Reasoning for Multimodal Large Language Models
par: Liu, Jingming, et autres
Publié: (2024)
par: Liu, Jingming, et autres
Publié: (2024)
Turn-by-Turn Indoor Navigation for the Visually Impaired
par: Srinivasaiah, Santosh, et autres
Publié: (2024)
par: Srinivasaiah, Santosh, et autres
Publié: (2024)
Structure Causal Models and LLMs Integration in Medical Visual Question Answering
par: Xu, Zibo, et autres
Publié: (2025)
par: Xu, Zibo, et autres
Publié: (2025)
VLingNav: Embodied Navigation with Adaptive Reasoning and Visual-Assisted Linguistic Memory
par: Wang, Shaoan, et autres
Publié: (2026)
par: Wang, Shaoan, et autres
Publié: (2026)
Can Textual Reasoning Improve the Performance of MLLMs on Fine-grained Visual Classification?
par: Zhu, Jie, et autres
Publié: (2026)
par: Zhu, Jie, et autres
Publié: (2026)
Render-of-Thought: Rendering Textual Chain-of-Thought as Images for Visual Latent Reasoning
par: Wang, Yifan, et autres
Publié: (2026)
par: Wang, Yifan, et autres
Publié: (2026)
FancyVideo: Towards Dynamic and Consistent Video Generation via Cross-frame Textual Guidance
par: Feng, Jiasong, et autres
Publié: (2024)
par: Feng, Jiasong, et autres
Publié: (2024)
TagFog: Textual Anchor Guidance and Fake Outlier Generation for Visual Out-of-Distribution Detection
par: Chen, Jiankang, et autres
Publié: (2024)
par: Chen, Jiankang, et autres
Publié: (2024)
Restorer: Removing Multi-Degradation with All-Axis Attention and Prompt Guidance
par: Mao, Jiawei, et autres
Publié: (2024)
par: Mao, Jiawei, et autres
Publié: (2024)
IVC-Prune: Revealing the Implicit Visual Coordinates in LVLMs for Vision Token Pruning
par: Sun, Zhichao, et autres
Publié: (2026)
par: Sun, Zhichao, et autres
Publié: (2026)
Think Visually, Reason Textually: Vision-Language Synergy in ARC
par: Zhang, Beichen, et autres
Publié: (2025)
par: Zhang, Beichen, et autres
Publié: (2025)
VFXMaster: Unlocking Dynamic Visual Effect Generation via In-Context Learning
par: Li, Baolu, et autres
Publié: (2025)
par: Li, Baolu, et autres
Publié: (2025)
Documents similaires
-
Revolutionizing Radiology Workflow with Factual and Efficient CXR Report Generation
par: Sukjai, Pimchanok, et autres
Publié: (2025) -
Vision-Driven Prompt Optimization for Large Language Models in Multimodal Generative Tasks
par: Franklin, Leo, et autres
Publié: (2025) -
CoMemo: LVLMs Need Image Context with Image Memory
par: Liu, Shi, et autres
Publié: (2025) -
Mitigating Action-Relation Hallucinations in LVLMs via Relation-aware Visual Enhancement
par: Qin, Zhenxin, et autres
Publié: (2026) -
SAVAA: Mitigating Hallucinations in LVLMs via Step-wise Adaptive Visual Attention Amplification
par: Zhang, Jiacheng, et autres
Publié: (2026)