Adaptive Chain-of-Focus Reasoning via Dynamic Visual Search and Zooming for Efficient VLMs
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Xintong, Gao, Zhi, Zhang, Bofei, Li, Pengxiang, Zhang, Xiaowen, Liu, Yang, Yuan, Tao, Wu, Yuwei, Jia, Yunde, Zhu, Song-Chun, Li, Qing |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
FIRE: A Dataset for Feedback Integration and Refinement Evaluation of Multimodal Models
por: Li, Pengxiang, et al.
Publicado: (2024)
por: Li, Pengxiang, et al.
Publicado: (2024)
Multi-modal Agent Tuning: Building a VLM-Driven Agent for Efficient Tool Usage
por: Gao, Zhi, et al.
Publicado: (2024)
por: Gao, Zhi, et al.
Publicado: (2024)
MIRROR: Multimodal Iterative Reasoning via Reflection on Visual Regions
por: Zhang, Haoyu, et al.
Publicado: (2026)
por: Zhang, Haoyu, et al.
Publicado: (2026)
AdaptMMBench: Benchmarking Adaptive Multimodal Reasoning for Mode Selection and Reasoning Process
por: Zhang, Xintong, et al.
Publicado: (2026)
por: Zhang, Xintong, et al.
Publicado: (2026)
Iterative Tool Usage Exploration for Multimodal Agents via Step-wise Preference Tuning
por: Li, Pengxiang, et al.
Publicado: (2025)
por: Li, Pengxiang, et al.
Publicado: (2025)
Efficient Multi-turn RL for GUI Agents via Decoupled Training and Adaptive Data Curation
por: Li, Pengxiang, et al.
Publicado: (2025)
por: Li, Pengxiang, et al.
Publicado: (2025)
Long-Horizon Visual Imitation Learning via Plan and Code Reflection
por: Chen, Quan, et al.
Publicado: (2025)
por: Chen, Quan, et al.
Publicado: (2025)
GUI Knowledge Bench: Revealing the Knowledge Gap of VLMs in GUI Tasks
por: Shi, Chenrui, et al.
Publicado: (2025)
por: Shi, Chenrui, et al.
Publicado: (2025)
Modality Alignment across Trees on Heterogeneous Hyperbolic Manifolds
por: Wu, Wei, et al.
Publicado: (2025)
por: Wu, Wei, et al.
Publicado: (2025)
Memory-Centric Embodied Question Answering
por: Zhai, Mingliang, et al.
Publicado: (2025)
por: Zhai, Mingliang, et al.
Publicado: (2025)
Adaptive Model Ensemble for Continual Learning
por: Mao, Yuchuan, et al.
Publicado: (2025)
por: Mao, Yuchuan, et al.
Publicado: (2025)
Geometry-aware Distance Measure for Diverse Hierarchical Structures in Hyperbolic Spaces
por: Li, Pengxiang, et al.
Publicado: (2025)
por: Li, Pengxiang, et al.
Publicado: (2025)
Multi-Sourced Compositional Generalization in Visual Question Answering
por: Li, Chuanhao, et al.
Publicado: (2025)
por: Li, Chuanhao, et al.
Publicado: (2025)
CLOVA: A Closed-Loop Visual Assistant with Tool Usage and Update
por: Gao, Zhi, et al.
Publicado: (2023)
por: Gao, Zhi, et al.
Publicado: (2023)
A Set-to-Set Distance Measure in Hyperbolic Space
por: Li, Pengxiang, et al.
Publicado: (2025)
por: Li, Pengxiang, et al.
Publicado: (2025)
Large-Scale Riemannian Meta-Optimization via Subspace Adaptation
por: Yu, Peilin, et al.
Publicado: (2025)
por: Yu, Peilin, et al.
Publicado: (2025)
Curvature Learning for Generalization of Hyperbolic Neural Networks
por: Fan, Xiaomeng, et al.
Publicado: (2025)
por: Fan, Xiaomeng, et al.
Publicado: (2025)
STVG-R1: Incentivizing Instance-Level Reasoning and Grounding in Videos via Reinforcement Learning
por: Zhang, Xiaowen, et al.
Publicado: (2026)
por: Zhang, Xiaowen, et al.
Publicado: (2026)
TongUI: Internet-Scale Trajectories from Multimodal Web Tutorials for Generalized GUI Agents
por: Zhang, Bofei, et al.
Publicado: (2025)
por: Zhang, Bofei, et al.
Publicado: (2025)
Look Where It Matters: Training-Free Ultra-HR Remote Sensing VQA via Adaptive Zoom Search
por: Zhou, Yunqi, et al.
Publicado: (2025)
por: Zhou, Yunqi, et al.
Publicado: (2025)
Facial Expression Generation Aligned with Human Preference for Natural Dyadic Interaction
por: Chen, Xu, et al.
Publicado: (2026)
por: Chen, Xu, et al.
Publicado: (2026)
Focusing by Contrastive Attention: Enhancing VLMs' Visual Reasoning
por: Ge, Yuyao, et al.
Publicado: (2025)
por: Ge, Yuyao, et al.
Publicado: (2025)
SCI-Reason: A Dataset with Chain-of-Thought Rationales for Complex Multimodal Reasoning in Academic Areas
por: Ma, Chenghao, et al.
Publicado: (2025)
por: Ma, Chenghao, et al.
Publicado: (2025)
Multi-Step Reasoning for Embodied Question Answering via Tool Augmentation
por: Zhai, Mingliang, et al.
Publicado: (2025)
por: Zhai, Mingliang, et al.
Publicado: (2025)
Hyperbolic Dual Feature Augmentation for Open-Environment
por: Yu, Peilin, et al.
Publicado: (2025)
por: Yu, Peilin, et al.
Publicado: (2025)
Beyond the Seen: Bounded Distribution Estimation for Open-Vocabulary Learning
por: Fan, Xiaomeng, et al.
Publicado: (2025)
por: Fan, Xiaomeng, et al.
Publicado: (2025)
Fine-Grained 3D Facial Reconstruction for Micro-Expressions
por: Sun, Che, et al.
Publicado: (2026)
por: Sun, Che, et al.
Publicado: (2026)
Why Is Spatial Reasoning Hard for VLMs? An Attention Mechanism Perspective on Focus Areas
por: Chen, Shiqi, et al.
Publicado: (2025)
por: Chen, Shiqi, et al.
Publicado: (2025)
VLMs have Tunnel Vision: Evaluating Nonlocal Visual Reasoning in Leading VLMs
por: Berman, Shmuel, et al.
Publicado: (2025)
por: Berman, Shmuel, et al.
Publicado: (2025)
FocusVLA: Focused Visual Utilization for Vision-Language-Action Models
por: Zhang, Yichi, et al.
Publicado: (2026)
por: Zhang, Yichi, et al.
Publicado: (2026)
Activating Visual Context and Commonsense Reasoning through Masked Prediction in VLMs
por: Yu, Jiaao, et al.
Publicado: (2025)
por: Yu, Jiaao, et al.
Publicado: (2025)
Stepwise Penalization for Length-Efficient Chain-of-Thought Reasoning
por: Li, Xintong, et al.
Publicado: (2026)
por: Li, Xintong, et al.
Publicado: (2026)
3D Visual Illusion Depth Estimation
por: Yao, Chengtang, et al.
Publicado: (2025)
por: Yao, Chengtang, et al.
Publicado: (2025)
AdaZoom-GUI: Adaptive Zoom-based GUI Grounding with Instruction Refinement
por: Pei, Siqi, et al.
Publicado: (2026)
por: Pei, Siqi, et al.
Publicado: (2026)
Temporally Consistent Stereo Matching
por: Zeng, Jiaxi, et al.
Publicado: (2024)
por: Zeng, Jiaxi, et al.
Publicado: (2024)
Toward Multi-Session Personalized Conversation: A Large-Scale Dataset and Hierarchical Tree Framework for Implicit Reasoning
por: Li, Xintong, et al.
Publicado: (2025)
por: Li, Xintong, et al.
Publicado: (2025)
ProSR: Process-Shaped Spatial Reasoning for Reliable Chain-of-Thought in VLMs
por: Li, Jiangyang, et al.
Publicado: (2026)
por: Li, Jiangyang, et al.
Publicado: (2026)
MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders
por: Cao, Jiajun, et al.
Publicado: (2025)
por: Cao, Jiajun, et al.
Publicado: (2025)
Reinforcement Learning for Chain of Thought Compression with One-Domain-to-All Generalization
por: Li, Hanyu, et al.
Publicado: (2025)
por: Li, Hanyu, et al.
Publicado: (2025)
VACoT: Rethinking Visual Data Augmentation with VLMs
por: Xu, Zhengzhuo, et al.
Publicado: (2025)
por: Xu, Zhengzhuo, et al.
Publicado: (2025)
Ejemplares similares
-
FIRE: A Dataset for Feedback Integration and Refinement Evaluation of Multimodal Models
por: Li, Pengxiang, et al.
Publicado: (2024) -
Multi-modal Agent Tuning: Building a VLM-Driven Agent for Efficient Tool Usage
por: Gao, Zhi, et al.
Publicado: (2024) -
MIRROR: Multimodal Iterative Reasoning via Reflection on Visual Regions
por: Zhang, Haoyu, et al.
Publicado: (2026) -
AdaptMMBench: Benchmarking Adaptive Multimodal Reasoning for Mode Selection and Reasoning Process
por: Zhang, Xintong, et al.
Publicado: (2026) -
Iterative Tool Usage Exploration for Multimodal Agents via Step-wise Preference Tuning
por: Li, Pengxiang, et al.
Publicado: (2025)