Look-Back: Implicit Visual Re-focusing in MLLM Reasoning
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Shuo, Niu, Yuwei, Liu, Yuyang, Ye, Yang, Lin, Bin, Yuan, Li |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information
por: Chu, Xu, et al.
Publicado: (2025)
por: Chu, Xu, et al.
Publicado: (2025)
Uniworld-V2: Reinforce Image Editing with Diffusion Negative-aware Finetuning and MLLM Implicit Feedback
por: Li, Zongjian, et al.
Publicado: (2025)
por: Li, Zongjian, et al.
Publicado: (2025)
Reasoning Portability: Guiding Continual Learning for MLLMs in the RLVR Era
por: Hong, Qiuhe, et al.
Publicado: (2026)
por: Hong, Qiuhe, et al.
Publicado: (2026)
MIRAGE: Assessing Hallucination in Multimodal Reasoning Chains of MLLM
por: Dong, Bowen, et al.
Publicado: (2025)
por: Dong, Bowen, et al.
Publicado: (2025)
Test-Time Multimodal Backdoor Detection by Contrastive Prompting
por: Niu, Yuwei, et al.
Publicado: (2024)
por: Niu, Yuwei, et al.
Publicado: (2024)
GNSP: Gradient Null Space Projection for Preserving Cross-Modal Alignment in VLMs Continual Learning
por: Peng, Tiantian, et al.
Publicado: (2025)
por: Peng, Tiantian, et al.
Publicado: (2025)
ReLaX: Reasoning with Latent Exploration for Large Reasoning Models
por: Zhang, Shimin, et al.
Publicado: (2025)
por: Zhang, Shimin, et al.
Publicado: (2025)
Adaptive Global and Fine-Grained Perceptual Fusion for MLLM Embeddings Compatible with Hard Negative Amplification
por: Hu, Lexiang, et al.
Publicado: (2026)
por: Hu, Lexiang, et al.
Publicado: (2026)
Logo-VGR: Visual Grounded Reasoning for Open-world Logo Recognition
por: Liang, Zichen, et al.
Publicado: (2025)
por: Liang, Zichen, et al.
Publicado: (2025)
GoT-R1: Unleashing Reasoning Capability of MLLM for Visual Generation with Reinforcement Learning
por: Duan, Chengqi, et al.
Publicado: (2025)
por: Duan, Chengqi, et al.
Publicado: (2025)
Mitigating Visual Knowledge Forgetting in MLLM Instruction-tuning via Modality-decoupled Gradient Descent
por: Wu, Junda, et al.
Publicado: (2025)
por: Wu, Junda, et al.
Publicado: (2025)
What's Holding Back Latent Visual Reasoning?
por: Viveiros, André G., et al.
Publicado: (2026)
por: Viveiros, André G., et al.
Publicado: (2026)
Revisiting Disentanglement in Downstream Tasks: A Study on Its Necessity for Abstract Visual Reasoning
por: Nai, Ruiqian, et al.
Publicado: (2024)
por: Nai, Ruiqian, et al.
Publicado: (2024)
TopoFR: A Closer Look at Topology Alignment on Face Recognition
por: Dan, Jun, et al.
Publicado: (2024)
por: Dan, Jun, et al.
Publicado: (2024)
Look, Remember and Reason: Grounded reasoning in videos with language models
por: Bhattacharyya, Apratim, et al.
Publicado: (2023)
por: Bhattacharyya, Apratim, et al.
Publicado: (2023)
FedMLLM: Federated Fine-tuning MLLM on Multimodal Heterogeneity Data
por: Xu, Binqian, et al.
Publicado: (2024)
por: Xu, Binqian, et al.
Publicado: (2024)
Spectral Roll-off Points Variations: Exploring Useful Information in Feature Maps by Its Variations
por: Yu, Yunkai, et al.
Publicado: (2021)
por: Yu, Yunkai, et al.
Publicado: (2021)
Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs
por: Janjua, Muhammad Kamran, et al.
Publicado: (2026)
por: Janjua, Muhammad Kamran, et al.
Publicado: (2026)
Re-ranking Reasoning Context with Tree Search Makes Large Vision-Language Models Stronger
por: Yang, Qi, et al.
Publicado: (2025)
por: Yang, Qi, et al.
Publicado: (2025)
From Exploration to Exploitation: A Two-Stage Entropy RLVR Approach for Noise-Tolerant MLLM Training
por: Xu, Donglai, et al.
Publicado: (2025)
por: Xu, Donglai, et al.
Publicado: (2025)
Outlier-Aware Training for Low-Bit Quantization of Structural Re-Parameterized Networks
por: Niu, Muqun, et al.
Publicado: (2024)
por: Niu, Muqun, et al.
Publicado: (2024)
Visual RAG: Expanding MLLM visual knowledge without fine-tuning
por: Bonomo, Mirco, et al.
Publicado: (2025)
por: Bonomo, Mirco, et al.
Publicado: (2025)
PromptHub: Enhancing Multi-Prompt Visual In-Context Learning with Locality-Aware Fusion, Concentration and Alignment
por: Luo, Tianci, et al.
Publicado: (2026)
por: Luo, Tianci, et al.
Publicado: (2026)
You Only Look One Step: Accelerating Backpropagation in Diffusion Sampling with Gradient Shortcuts
por: Dou, Hongkun, et al.
Publicado: (2025)
por: Dou, Hongkun, et al.
Publicado: (2025)
More Than Memory Savings: Zeroth-Order Optimization Mitigates Forgetting in Continual Learning
por: Yu, Wanhao, et al.
Publicado: (2025)
por: Yu, Wanhao, et al.
Publicado: (2025)
NTK-Guided Implicit Neural Teaching
por: Zhang, Chen, et al.
Publicado: (2025)
por: Zhang, Chen, et al.
Publicado: (2025)
Chart-FR1: Visual Focus-Driven Fine-Grained Reasoning on Dense Charts
por: Pan, Hongkun, et al.
Publicado: (2026)
por: Pan, Hongkun, et al.
Publicado: (2026)
GAvatar: Animatable 3D Gaussian Avatars with Implicit Mesh Learning
por: Yuan, Ye, et al.
Publicado: (2023)
por: Yuan, Ye, et al.
Publicado: (2023)
AdaptVision: Efficient Vision-Language Models via Adaptive Visual Acquisition
por: Lin, Zichuan, et al.
Publicado: (2025)
por: Lin, Zichuan, et al.
Publicado: (2025)
Map-Relative Pose Regression for Visual Re-Localization
por: Chen, Shuai, et al.
Publicado: (2024)
por: Chen, Shuai, et al.
Publicado: (2024)
DenseMLLM: Standard Multimodal LLMs for Dense Prediction
por: Li, Yi, et al.
Publicado: (2026)
por: Li, Yi, et al.
Publicado: (2026)
VisReason: A Large-Scale Dataset for Visual Chain-of-Thought Reasoning
por: Li, Lingxiao, et al.
Publicado: (2025)
por: Li, Lingxiao, et al.
Publicado: (2025)
NICE: Neural Implicit Craniofacial Model for Orthognathic Surgery Prediction
por: Yang, Jiawen, et al.
Publicado: (2025)
por: Yang, Jiawen, et al.
Publicado: (2025)
Vision Verification Enhanced Fusion of VLMs for Efficient Visual Reasoning
por: Tekin, Selim Furkan, et al.
Publicado: (2026)
por: Tekin, Selim Furkan, et al.
Publicado: (2026)
AD3: Implicit Action is the Key for World Models to Distinguish the Diverse Visual Distractors
por: Wang, Yucen, et al.
Publicado: (2024)
por: Wang, Yucen, et al.
Publicado: (2024)
Query-Conditioned Evidential Keyframe Sampling for MLLM-Based Long-Form Video Understanding
por: Wang, Yiheng, et al.
Publicado: (2026)
por: Wang, Yiheng, et al.
Publicado: (2026)
Learning Informative Attention Weights for Person Re-Identification
por: Wang, Yancheng, et al.
Publicado: (2025)
por: Wang, Yancheng, et al.
Publicado: (2025)
Reason, Retrieve, Re-rank: A Zero-Shot Reasoning-Aware Framework for Composed Video Retrieval
por: Alavi, Ali
Publicado: (2026)
por: Alavi, Ali
Publicado: (2026)
A Sober Look at the Robustness of CLIPs to Spurious Features
por: Wang, Qizhou, et al.
Publicado: (2024)
por: Wang, Qizhou, et al.
Publicado: (2024)
Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence
por: Wu, Diankun, et al.
Publicado: (2025)
por: Wu, Diankun, et al.
Publicado: (2025)
Ejemplares similares
-
Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information
por: Chu, Xu, et al.
Publicado: (2025) -
Uniworld-V2: Reinforce Image Editing with Diffusion Negative-aware Finetuning and MLLM Implicit Feedback
por: Li, Zongjian, et al.
Publicado: (2025) -
Reasoning Portability: Guiding Continual Learning for MLLMs in the RLVR Era
por: Hong, Qiuhe, et al.
Publicado: (2026) -
MIRAGE: Assessing Hallucination in Multimodal Reasoning Chains of MLLM
por: Dong, Bowen, et al.
Publicado: (2025) -
Test-Time Multimodal Backdoor Detection by Contrastive Prompting
por: Niu, Yuwei, et al.
Publicado: (2024)