Foveated Reasoning: Stateful, Action-based Visual Focusing for Vision-Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Min, Juhong, Valkov, Lazar, Petsiuk, Vitali, Souri, Hossein, Mohan, Deen Dayal |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
GoldiCLIP: The Goldilocks Approach for Balancing Explicit Supervision for Language-Image Pretraining
di: Mohan, Deen Dayal, et al.
Pubblicazione: (2026)
di: Mohan, Deen Dayal, et al.
Pubblicazione: (2026)
ARGENT: Adaptive Hierarchical Image-Text Representations
di: Huynh, Chuong, et al.
Pubblicazione: (2026)
di: Huynh, Chuong, et al.
Pubblicazione: (2026)
Concept Arithmetics for Circumventing Concept Inhibition in Diffusion Models
di: Petsiuk, Vitali, et al.
Pubblicazione: (2024)
di: Petsiuk, Vitali, et al.
Pubblicazione: (2024)
Reading in the Dark with Foveated Event Vision
di: Brander, Carl, et al.
Pubblicazione: (2025)
di: Brander, Carl, et al.
Pubblicazione: (2025)
Policy-based Foveated Imaging and Perception
di: Xiao, Howard, et al.
Pubblicazione: (2026)
di: Xiao, Howard, et al.
Pubblicazione: (2026)
Towards Two-Stream Foveation-based Active Vision Learning
di: Ibrayev, Timur, et al.
Pubblicazione: (2024)
di: Ibrayev, Timur, et al.
Pubblicazione: (2024)
Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers
di: Chuang, Ian, et al.
Pubblicazione: (2025)
di: Chuang, Ian, et al.
Pubblicazione: (2025)
Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
di: Yang, Ganlin, et al.
Pubblicazione: (2025)
di: Yang, Ganlin, et al.
Pubblicazione: (2025)
Visual Acuity Consistent Foveated Rendering towards Retinal Resolution
di: Zhang, Zhi, et al.
Pubblicazione: (2025)
di: Zhang, Zhi, et al.
Pubblicazione: (2025)
ProFocus: Proactive Perception and Focused Reasoning in Vision-and-Language Navigation
di: Xue, Wei, et al.
Pubblicazione: (2026)
di: Xue, Wei, et al.
Pubblicazione: (2026)
Focusing Where Vision Matters: Selective Training for Large Vision Language Models via Visual Information Gain
di: Lee, Seulbi, et al.
Pubblicazione: (2026)
di: Lee, Seulbi, et al.
Pubblicazione: (2026)
Foveated Instance Segmentation
di: Zeng, Hongyi, et al.
Pubblicazione: (2025)
di: Zeng, Hongyi, et al.
Pubblicazione: (2025)
RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation
di: Liu, Jiaming, et al.
Pubblicazione: (2024)
di: Liu, Jiaming, et al.
Pubblicazione: (2024)
Benchmarking and Improving Large Vision-Language Models for Fundamental Visual Graph Understanding and Reasoning
di: Zhu, Yingjie, et al.
Pubblicazione: (2024)
di: Zhu, Yingjie, et al.
Pubblicazione: (2024)
DualCoT-VLA: Visual-Linguistic Chain of Thought via Parallel Reasoning for Vision-Language-Action Models
di: Zhong, Zhide, et al.
Pubblicazione: (2026)
di: Zhong, Zhide, et al.
Pubblicazione: (2026)
TS-VLM: Text-Guided SoftSort Pooling for Vision-Language Models in Multi-View Driving Reasoning
di: Chen, Lihong, et al.
Pubblicazione: (2025)
di: Chen, Lihong, et al.
Pubblicazione: (2025)
MoReVQA: Exploring Modular Reasoning Models for Video Question Answering
di: Min, Juhong, et al.
Pubblicazione: (2024)
di: Min, Juhong, et al.
Pubblicazione: (2024)
VLA-R1: Enhancing Reasoning in Vision-Language-Action Models
di: Ye, Angen, et al.
Pubblicazione: (2025)
di: Ye, Angen, et al.
Pubblicazione: (2025)
DepthVLA: Enhancing Vision-Language-Action Models with Depth-Aware Spatial Reasoning
di: Yuan, Tianyuan, et al.
Pubblicazione: (2025)
di: Yuan, Tianyuan, et al.
Pubblicazione: (2025)
VisualThink-VLA: Visual Intermediate Reasoning for Effective and Low-Latency Vision-Language-Action Policies
di: Gao, Mingjian, et al.
Pubblicazione: (2026)
di: Gao, Mingjian, et al.
Pubblicazione: (2026)
Reasoning-VLA: A Fast and General Vision-Language-Action Reasoning Model for Autonomous Driving
di: Zhang, Dapeng, et al.
Pubblicazione: (2025)
di: Zhang, Dapeng, et al.
Pubblicazione: (2025)
StateVLM: A State-Aware Vision-Language Model for Robotic Affordance Reasoning
di: Sun, Xiaowen, et al.
Pubblicazione: (2026)
di: Sun, Xiaowen, et al.
Pubblicazione: (2026)
Reasoning or Pattern Matching? Probing Large Vision-Language Models with Visual Puzzles
di: Lymperaiou, Maria, et al.
Pubblicazione: (2026)
di: Lymperaiou, Maria, et al.
Pubblicazione: (2026)
Triage: Hierarchical Visual Budgeting for Efficient Video Reasoning in Vision-Language Models
di: Wang, Anmin, et al.
Pubblicazione: (2026)
di: Wang, Anmin, et al.
Pubblicazione: (2026)
Guide, Think, Act: Interactive Embodied Reasoning in Vision-Language-Action Models
di: Ling, Yiran, et al.
Pubblicazione: (2026)
di: Ling, Yiran, et al.
Pubblicazione: (2026)
Improving Robustness of Vision-Language-Action Models by Restoring Corrupted Visual Inputs
di: Orjuela, Daniel Yezid Guarnizo, et al.
Pubblicazione: (2026)
di: Orjuela, Daniel Yezid Guarnizo, et al.
Pubblicazione: (2026)
BabyVision: Visual Reasoning Beyond Language
di: Chen, Liang, et al.
Pubblicazione: (2026)
di: Chen, Liang, et al.
Pubblicazione: (2026)
CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models
di: Zhao, Qingqing, et al.
Pubblicazione: (2025)
di: Zhao, Qingqing, et al.
Pubblicazione: (2025)
Foveated Diffusion: Efficient Spatially Adaptive Image and Video Generation
di: Chao, Brian, et al.
Pubblicazione: (2026)
di: Chao, Brian, et al.
Pubblicazione: (2026)
ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning
di: Huang, Chi-Pin, et al.
Pubblicazione: (2025)
di: Huang, Chi-Pin, et al.
Pubblicazione: (2025)
TSkel-Mamba: Temporal Dynamic Modeling via State Space Model for Human Skeleton-based Action Recognition
di: Liu, Yanan, et al.
Pubblicazione: (2025)
di: Liu, Yanan, et al.
Pubblicazione: (2025)
PatchCue: Enhancing Vision-Language Model Reasoning with Patch-Based Visual Cues
di: Qi, Yukun, et al.
Pubblicazione: (2026)
di: Qi, Yukun, et al.
Pubblicazione: (2026)
VGRP-Bench: Visual Grid Reasoning Puzzle Benchmark for Large Vision-Language Models
di: Ren, Yufan, et al.
Pubblicazione: (2025)
di: Ren, Yufan, et al.
Pubblicazione: (2025)
QUAR-VLA: Vision-Language-Action Model for Quadruped Robots
di: Ding, Pengxiang, et al.
Pubblicazione: (2023)
di: Ding, Pengxiang, et al.
Pubblicazione: (2023)
Do Vision-Language Transformers Exhibit Visual Commonsense? An Empirical Study of VCR
di: Li, Zhenyang, et al.
Pubblicazione: (2024)
di: Li, Zhenyang, et al.
Pubblicazione: (2024)
OTTER: A Vision-Language-Action Model with Text-Aware Visual Feature Extraction
di: Huang, Huang, et al.
Pubblicazione: (2025)
di: Huang, Huang, et al.
Pubblicazione: (2025)
DiSa: Directional Saliency-Aware Prompt Learning for Generalizable Vision-Language Models
di: Talemi, Niloufar Alipour, et al.
Pubblicazione: (2025)
di: Talemi, Niloufar Alipour, et al.
Pubblicazione: (2025)
Unified Vision-Language-Action Model
di: Wang, Yuqi, et al.
Pubblicazione: (2025)
di: Wang, Yuqi, et al.
Pubblicazione: (2025)
PVI: Plug-in Visual Injection for Vision-Language-Action Models
di: Zhang, Zezhou, et al.
Pubblicazione: (2026)
di: Zhang, Zezhou, et al.
Pubblicazione: (2026)
Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models
di: Tan, Huajie, et al.
Pubblicazione: (2025)
di: Tan, Huajie, et al.
Pubblicazione: (2025)
Documenti analoghi
-
GoldiCLIP: The Goldilocks Approach for Balancing Explicit Supervision for Language-Image Pretraining
di: Mohan, Deen Dayal, et al.
Pubblicazione: (2026) -
ARGENT: Adaptive Hierarchical Image-Text Representations
di: Huynh, Chuong, et al.
Pubblicazione: (2026) -
Concept Arithmetics for Circumventing Concept Inhibition in Diffusion Models
di: Petsiuk, Vitali, et al.
Pubblicazione: (2024) -
Reading in the Dark with Foveated Event Vision
di: Brander, Carl, et al.
Pubblicazione: (2025) -
Policy-based Foveated Imaging and Perception
di: Xiao, Howard, et al.
Pubblicazione: (2026)