Beyond Visual Memory: Mechanistic Diagnostics of Latent Visual Reasoning
Fuente:
arXiv
Guardado en:
| Autores principales: | Guo, Garvin, Chen, Yu, Wang, Xiang, Li, Shuai, Zhao, Xinpei, Liu, Huaxing, Dong, Shuai |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Do Multimodal Agents Really Benefit from Tool Use? A Systematic Study of Capability Gains
por: Guo, Garvin, et al.
Publicado: (2026)
por: Guo, Garvin, et al.
Publicado: (2026)
Monet: Reasoning in Latent Visual Space Beyond Images and Language
por: Wang, Qixun, et al.
Publicado: (2025)
por: Wang, Qixun, et al.
Publicado: (2025)
Determined by User Needs: A Salient Object Detection Rationale Beyond Conventional Visual Stimuli
por: Chen, Chenglizhao, et al.
Publicado: (2026)
por: Chen, Chenglizhao, et al.
Publicado: (2026)
Dual Latent Memory for Visual Multi-agent System
por: Yu, Xinlei, et al.
Publicado: (2026)
por: Yu, Xinlei, et al.
Publicado: (2026)
MedLVR: Latent Visual Reasoning for Reliable Medical Visual Question Answering
por: Xi, Suyang, et al.
Publicado: (2026)
por: Xi, Suyang, et al.
Publicado: (2026)
Beyond Static Visual Tokens: Structured Sequential Visual Chain-of-Thought Reasoning
por: Guo, Guangfu, et al.
Publicado: (2026)
por: Guo, Guangfu, et al.
Publicado: (2026)
LatentPilot: Scene-Aware Vision-and-Language Navigation by Dreaming Ahead with Latent Visual Reasoning
por: Hao, Haihong, et al.
Publicado: (2026)
por: Hao, Haihong, et al.
Publicado: (2026)
Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens
por: Yang, Zeyuan, et al.
Publicado: (2025)
por: Yang, Zeyuan, et al.
Publicado: (2025)
ATLAS: Agentic or Latent Visual Reasoning? One Word is Enough for Both
por: Guo, Ziyu, et al.
Publicado: (2026)
por: Guo, Ziyu, et al.
Publicado: (2026)
DiffDub: Person-generic Visual Dubbing Using Inpainting Renderer with Diffusion Auto-encoder
por: Liu, Tao, et al.
Publicado: (2023)
por: Liu, Tao, et al.
Publicado: (2023)
Counting Circuits: Mechanistic Interpretability of Visual Reasoning in Large Vision-Language Models
por: Che, Liwei, et al.
Publicado: (2026)
por: Che, Liwei, et al.
Publicado: (2026)
LaViT: Aligning Latent Visual Thoughts for Multi-modal Reasoning
por: Wu, Linquan, et al.
Publicado: (2026)
por: Wu, Linquan, et al.
Publicado: (2026)
CrystaL: Spontaneous Emergence of Visual Latents in MLLMs
por: Zhang, Yang, et al.
Publicado: (2026)
por: Zhang, Yang, et al.
Publicado: (2026)
Reasoning Path and Latent State Analysis for Multi-view Visual Spatial Reasoning: A Cognitive Science Perspective
por: Xue, Qiyao, et al.
Publicado: (2025)
por: Xue, Qiyao, et al.
Publicado: (2025)
Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning
por: Li, Zejun, et al.
Publicado: (2025)
por: Li, Zejun, et al.
Publicado: (2025)
VITAL: Visual-Semantic Dual Supervision for Enhanced and Interpretable Latent Reasoning in Medical MLLMs
por: Li, Qiaoru, et al.
Publicado: (2026)
por: Li, Qiaoru, et al.
Publicado: (2026)
Beyond Pixels: Visual Metaphor Transfer via Schema-Driven Agentic Reasoning
por: Xu, Yu, et al.
Publicado: (2026)
por: Xu, Yu, et al.
Publicado: (2026)
Visual Para-Thinker: Divide-and-Conquer Reasoning for Visual Comprehension
por: Xu, Haoran, et al.
Publicado: (2026)
por: Xu, Haoran, et al.
Publicado: (2026)
Beyond Task-Specific Reasoning: A Unified Conditional Generative Framework for Abstract Visual Reasoning
por: Shi, Fan, et al.
Publicado: (2025)
por: Shi, Fan, et al.
Publicado: (2025)
TrackVLA++: Unleashing Reasoning and Memory Capabilities in VLA Models for Embodied Visual Tracking
por: Liu, Jiahang, et al.
Publicado: (2025)
por: Liu, Jiahang, et al.
Publicado: (2025)
MedSynapse-V: Bridging Visual Perception and Clinical Intuition via Latent Memory Evolution
por: Zhu, Chunzheng, et al.
Publicado: (2026)
por: Zhu, Chunzheng, et al.
Publicado: (2026)
Thinking with Gaze: Sequential Eye-Tracking as Visual Reasoning Supervision for Medical VLMs
por: Li, Yiwei, et al.
Publicado: (2026)
por: Li, Yiwei, et al.
Publicado: (2026)
Exploring Visual Prompting: Robustness Inheritance and Beyond
por: Li, Qi, et al.
Publicado: (2025)
por: Li, Qi, et al.
Publicado: (2025)
Interleaved Latent Visual Reasoning with Selective Perceptual Modeling
por: Dong, Shuai, et al.
Publicado: (2025)
por: Dong, Shuai, et al.
Publicado: (2025)
Focusing by Contrastive Attention: Enhancing VLMs' Visual Reasoning
por: Ge, Yuyao, et al.
Publicado: (2025)
por: Ge, Yuyao, et al.
Publicado: (2025)
Unbiased Visual Reasoning with Controlled Visual Inputs
por: Li, Zhaonan, et al.
Publicado: (2025)
por: Li, Zhaonan, et al.
Publicado: (2025)
Beyond Visual Safety: Jailbreaking Multimodal Large Language Models for Harmful Image Generation via Semantic-Agnostic Inputs
por: Yu, Mingyu, et al.
Publicado: (2026)
por: Yu, Mingyu, et al.
Publicado: (2026)
SeMOPO: Learning High-quality Model and Policy from Low-quality Offline Visual Datasets
por: Wan, Shenghua, et al.
Publicado: (2024)
por: Wan, Shenghua, et al.
Publicado: (2024)
Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs
por: Huang, Siyuan, et al.
Publicado: (2026)
por: Huang, Siyuan, et al.
Publicado: (2026)
CorrDetail: Visual Detail Enhanced Self-Correction for Face Forgery Detection
por: Zhou, Binjia, et al.
Publicado: (2025)
por: Zhou, Binjia, et al.
Publicado: (2025)
Predictive Reasoning with Augmented Anomaly Contrastive Learning for Compositional Visual Relations
por: Li, Chengtai, et al.
Publicado: (2026)
por: Li, Chengtai, et al.
Publicado: (2026)
Beyond Perception: Evaluating Abstract Visual Reasoning through Multi-Stage Task
por: Jiang, Yanbei, et al.
Publicado: (2025)
por: Jiang, Yanbei, et al.
Publicado: (2025)
Beyond Text-Visual Attention: Exploiting Visual Cues for Effective Token Pruning in VLMs
por: Zhang, Qizhe, et al.
Publicado: (2024)
por: Zhang, Qizhe, et al.
Publicado: (2024)
EmoVIT: Revolutionizing Emotion Insights with Visual Instruction Tuning
por: Xie, Hongxia, et al.
Publicado: (2024)
por: Xie, Hongxia, et al.
Publicado: (2024)
Point-It-Out: Benchmarking Embodied Reasoning for Vision Language Models in Multi-Stage Visual Grounding
por: Xue, Haotian, et al.
Publicado: (2025)
por: Xue, Haotian, et al.
Publicado: (2025)
Faithful-MR1: Faithful Multimodal Reasoning via Anchoring and Reinforcing Visual Attention
por: Tian, Changyuan, et al.
Publicado: (2026)
por: Tian, Changyuan, et al.
Publicado: (2026)
Enhancing Advanced Visual Reasoning Ability of Large Language Models
por: Li, Zhiyuan, et al.
Publicado: (2024)
por: Li, Zhiyuan, et al.
Publicado: (2024)
Perception Before Reasoning: Two-Stage Reinforcement Learning for Visual Reasoning in Vision-Language Models
por: Chen, Yan, et al.
Publicado: (2025)
por: Chen, Yan, et al.
Publicado: (2025)
Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT
por: Dong, Zhuobai, et al.
Publicado: (2025)
por: Dong, Zhuobai, et al.
Publicado: (2025)
ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning
por: Huang, Chi-Pin, et al.
Publicado: (2025)
por: Huang, Chi-Pin, et al.
Publicado: (2025)
Ejemplares similares
-
Do Multimodal Agents Really Benefit from Tool Use? A Systematic Study of Capability Gains
por: Guo, Garvin, et al.
Publicado: (2026) -
Monet: Reasoning in Latent Visual Space Beyond Images and Language
por: Wang, Qixun, et al.
Publicado: (2025) -
Determined by User Needs: A Salient Object Detection Rationale Beyond Conventional Visual Stimuli
por: Chen, Chenglizhao, et al.
Publicado: (2026) -
Dual Latent Memory for Visual Multi-agent System
por: Yu, Xinlei, et al.
Publicado: (2026) -
MedLVR: Latent Visual Reasoning for Reliable Medical Visual Question Answering
por: Xi, Suyang, et al.
Publicado: (2026)