AdaGlimpse: Active Visual Exploration with Arbitrary Glimpse Position and Scale
Fuente:
arXiv
Saved in:
| Main Authors: | , , , , , |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
| _version_ | 1866914996388102144 |
|---|---|
| author | Pardyl, Adam Wronka, Michał Wołczyk, Maciej Adamczewski, Kamil Trzciński, Tomasz Zieliński, Bartosz |
| author_facet | Pardyl, Adam Wronka, Michał Wołczyk, Maciej Adamczewski, Kamil Trzciński, Tomasz Zieliński, Bartosz |
| contents | Active Visual Exploration (AVE) is a task that involves dynamically selecting observations (glimpses), which is critical to facilitate comprehension and navigation within an environment. While modern AVE methods have demonstrated impressive performance, they are constrained to fixed-scale glimpses from rigid grids. In contrast, existing mobile platforms equipped with optical zoom capabilities can capture glimpses of arbitrary positions and scales. To address this gap between software and hardware capabilities, we introduce AdaGlimpse. It uses Soft Actor-Critic, a reinforcement learning algorithm tailored for exploration tasks, to select glimpses of arbitrary position and scale. This approach enables our model to rapidly establish a general awareness of the environment before zooming in for detailed analysis. Experimental results demonstrate that AdaGlimpse surpasses previous methods across various visual tasks while maintaining greater applicability in realistic AVE scenarios. |
| format | Preprint |
| id |
arxiv_https___arxiv_org_abs_2404_03482 |
| institution | arXiv |
| publishDate | 2024 |
| record_format | arxiv |
| spellingShingle | AdaGlimpse: Active Visual Exploration with Arbitrary Glimpse Position and Scale Pardyl, Adam Wronka, Michał Wołczyk, Maciej Adamczewski, Kamil Trzciński, Tomasz Zieliński, Bartosz Computer Vision and Pattern Recognition Active Visual Exploration (AVE) is a task that involves dynamically selecting observations (glimpses), which is critical to facilitate comprehension and navigation within an environment. While modern AVE methods have demonstrated impressive performance, they are constrained to fixed-scale glimpses from rigid grids. In contrast, existing mobile platforms equipped with optical zoom capabilities can capture glimpses of arbitrary positions and scales. To address this gap between software and hardware capabilities, we introduce AdaGlimpse. It uses Soft Actor-Critic, a reinforcement learning algorithm tailored for exploration tasks, to select glimpses of arbitrary position and scale. This approach enables our model to rapidly establish a general awareness of the environment before zooming in for detailed analysis. Experimental results demonstrate that AdaGlimpse surpasses previous methods across various visual tasks while maintaining greater applicability in realistic AVE scenarios. |
| title | AdaGlimpse: Active Visual Exploration with Arbitrary Glimpse Position and Scale |
| topic | Computer Vision and Pattern Recognition |
| url | https://arxiv.org/abs/2404.03482 |