Multimodal Latent Reasoning via Hierarchical Visual Cues Injection
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Yiming, Yan, Qiangyu, Jiang, Borui, Han, Kai |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs
por: Zhang, Yiman, et al.
Publicado: (2025)
por: Zhang, Yiman, et al.
Publicado: (2025)
EmoKGEdit: Training-free Affective Injection via Visual Cue Transformation
por: Zhang, Jing, et al.
Publicado: (2026)
por: Zhang, Jing, et al.
Publicado: (2026)
LaRe: Latent Refocusing for Multimodal Reasoning
por: Ma, Jizheng, et al.
Publicado: (2025)
por: Ma, Jizheng, et al.
Publicado: (2025)
PatchCue: Enhancing Vision-Language Model Reasoning with Patch-Based Visual Cues
por: Qi, Yukun, et al.
Publicado: (2026)
por: Qi, Yukun, et al.
Publicado: (2026)
Latent Sketchpad: Sketching Visual Thoughts to Elicit Multimodal Reasoning in MLLMs
por: Zhang, Huanyu, et al.
Publicado: (2025)
por: Zhang, Huanyu, et al.
Publicado: (2025)
CoLVR: Enhancing Exploratory Latent Visual Reasoning via Contrastive Optimization
por: Ding, Ziyang, et al.
Publicado: (2026)
por: Ding, Ziyang, et al.
Publicado: (2026)
PPE: Positional Preservation Embedding for Token Compression in Multimodal Large Language Models
por: Huang, Mouxiao, et al.
Publicado: (2025)
por: Huang, Mouxiao, et al.
Publicado: (2025)
Leveraging Latent Visual Reasoning in Silence
por: Zhu, Dongyao, et al.
Publicado: (2026)
por: Zhu, Dongyao, et al.
Publicado: (2026)
Q-Tacit: Image Quality Assessment via Latent Visual Reasoning
por: Jiang, Yuxuan, et al.
Publicado: (2026)
por: Jiang, Yuxuan, et al.
Publicado: (2026)
Latent Visual Reasoning
por: Li, Bangzheng, et al.
Publicado: (2025)
por: Li, Bangzheng, et al.
Publicado: (2025)
Visual Enhanced Depth Scaling for Multimodal Latent Reasoning
por: Han, Yudong, et al.
Publicado: (2026)
por: Han, Yudong, et al.
Publicado: (2026)
VideoAnchor: Reinforcing Subspace-Structured Visual Cues for Coherent Visual-Spatial Reasoning
por: Wang, Zhaozhi, et al.
Publicado: (2025)
por: Wang, Zhaozhi, et al.
Publicado: (2025)
UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs
por: Jiang, Houcheng, et al.
Publicado: (2026)
por: Jiang, Houcheng, et al.
Publicado: (2026)
GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking
por: Zhan, Yufei, et al.
Publicado: (2025)
por: Zhan, Yufei, et al.
Publicado: (2025)
VRR-QA: Visual Relational Reasoning in Videos Beyond Explicit Cues
por: Swetha, Sirnam, et al.
Publicado: (2025)
por: Swetha, Sirnam, et al.
Publicado: (2025)
Latent Implicit Visual Reasoning
por: Li, Kelvin, et al.
Publicado: (2025)
por: Li, Kelvin, et al.
Publicado: (2025)
Semantic-Enriched Latent Visual Reasoning
por: Xu, Tianrun, et al.
Publicado: (2026)
por: Xu, Tianrun, et al.
Publicado: (2026)
Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?
por: He, Haibin, et al.
Publicado: (2025)
por: He, Haibin, et al.
Publicado: (2025)
ControlThinker: Unveiling Latent Semantics for Controllable Image Generation through Visual Reasoning
por: Han, Feng, et al.
Publicado: (2025)
por: Han, Feng, et al.
Publicado: (2025)
MIRROR: Multimodal Iterative Reasoning via Reflection on Visual Regions
por: Zhang, Haoyu, et al.
Publicado: (2026)
por: Zhang, Haoyu, et al.
Publicado: (2026)
NoisyGRPO: Incentivizing Multimodal CoT Reasoning via Noise Injection and Bayesian Estimation
por: Qiu, Longtian, et al.
Publicado: (2025)
por: Qiu, Longtian, et al.
Publicado: (2025)
LatentGeo: Learnable Auxiliary Constructions in Latent Space for Multimodal Geometric Reasoning
por: Xu, Haiying, et al.
Publicado: (2026)
por: Xu, Haiying, et al.
Publicado: (2026)
Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs
por: Li, Xudong, et al.
Publicado: (2025)
por: Li, Xudong, et al.
Publicado: (2025)
LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning
por: Dai, Yifan, et al.
Publicado: (2026)
por: Dai, Yifan, et al.
Publicado: (2026)
PaLMR: Towards Faithful Visual Reasoning via Multimodal Process Alignment
por: Li, Yantao, et al.
Publicado: (2026)
por: Li, Yantao, et al.
Publicado: (2026)
StructXLIP: Enhancing Vision-language Models with Multimodal Structural Cues
por: Ruan, Zanxi, et al.
Publicado: (2026)
por: Ruan, Zanxi, et al.
Publicado: (2026)
Boosting Reasoning in Large Multimodal Models via Activation Replay
por: Xing, Yun, et al.
Publicado: (2025)
por: Xing, Yun, et al.
Publicado: (2025)
Enhancing Vision-Language Tracking by Effectively Converting Textual Cues into Visual Cues
por: Feng, X., et al.
Publicado: (2024)
por: Feng, X., et al.
Publicado: (2024)
Manipulating Multimodal Agents via Cross-Modal Prompt Injection
por: Wang, Le, et al.
Publicado: (2025)
por: Wang, Le, et al.
Publicado: (2025)
Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens
por: Yang, Zeyuan, et al.
Publicado: (2025)
por: Yang, Zeyuan, et al.
Publicado: (2025)
Nested Diffusion Models Using Hierarchical Latent Priors
por: Zhang, Xiao, et al.
Publicado: (2024)
por: Zhang, Xiao, et al.
Publicado: (2024)
MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning
por: Wu, Chengfei, et al.
Publicado: (2025)
por: Wu, Chengfei, et al.
Publicado: (2025)
DeepLatent: Think with Images via Parallel Latent Visual Reasoning
por: Lu, Dongchen, et al.
Publicado: (2026)
por: Lu, Dongchen, et al.
Publicado: (2026)
PuzzleVQA: Diagnosing Multimodal Reasoning Challenges of Language Models with Abstract Visual Patterns
por: Chia, Yew Ken, et al.
Publicado: (2024)
por: Chia, Yew Ken, et al.
Publicado: (2024)
Hierarchical Multimodal Pre-training for Visually Rich Webpage Understanding
por: Xu, Hongshen, et al.
Publicado: (2024)
por: Xu, Hongshen, et al.
Publicado: (2024)
XEmoGPT: An Explainable Multimodal Emotion Recognition Framework with Cue-Level Perception and Reasoning
por: Zhang, Hanwen, et al.
Publicado: (2026)
por: Zhang, Hanwen, et al.
Publicado: (2026)
DeepSketcher: Internalizing Visual Manipulation for Multimodal Reasoning
por: Zhang, Chi, et al.
Publicado: (2025)
por: Zhang, Chi, et al.
Publicado: (2025)
PLUME: Latent Reasoning Based Universal Multimodal Embedding
por: He, Chenwei, et al.
Publicado: (2026)
por: He, Chenwei, et al.
Publicado: (2026)
LiVisSfM: Accurate and Robust Structure-from-Motion with LiDAR and Visual Cues
por: Jiang, Hanqing, et al.
Publicado: (2024)
por: Jiang, Hanqing, et al.
Publicado: (2024)
Learning Multimodal Cues of Children's Uncertainty
por: Cheng, Qi, et al.
Publicado: (2024)
por: Cheng, Qi, et al.
Publicado: (2024)
Ejemplares similares
-
OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs
por: Zhang, Yiman, et al.
Publicado: (2025) -
EmoKGEdit: Training-free Affective Injection via Visual Cue Transformation
por: Zhang, Jing, et al.
Publicado: (2026) -
LaRe: Latent Refocusing for Multimodal Reasoning
por: Ma, Jizheng, et al.
Publicado: (2025) -
PatchCue: Enhancing Vision-Language Model Reasoning with Patch-Based Visual Cues
por: Qi, Yukun, et al.
Publicado: (2026) -
Latent Sketchpad: Sketching Visual Thoughts to Elicit Multimodal Reasoning in MLLMs
por: Zhang, Huanyu, et al.
Publicado: (2025)