Emergence of Fixational and Saccadic Movements in a Multi-Level Recurrent Attention Model for Vision
Fuente:
arXiv
Salvato in:
| Autori principali: | Pan, Pengcheng, Shogo, Yonekura, Kuniyoshi, Yasuo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Debiasing Central Fixation Confounds Reveals a Peripheral "Sweet Spot" for Human-like Scanpaths in Hard-Attention Vision
di: Pan, Pengcheng, et al.
Pubblicazione: (2026)
di: Pan, Pengcheng, et al.
Pubblicazione: (2026)
EVA: Bridging Performance and Human Alignment in Hard-Attention Vision Models for Image Classification
di: Pan, Pengcheng, et al.
Pubblicazione: (2026)
di: Pan, Pengcheng, et al.
Pubblicazione: (2026)
Spiking Vision Transformer with Saccadic Attention
di: Wang, Shuai, et al.
Pubblicazione: (2025)
di: Wang, Shuai, et al.
Pubblicazione: (2025)
SaFiRe: Saccade-Fixation Reiteration with Mamba for Referring Image Segmentation
di: Mao, Zhenjie, et al.
Pubblicazione: (2025)
di: Mao, Zhenjie, et al.
Pubblicazione: (2025)
Saccadic Vision for Fine-Grained Visual Classification
di: Schmidt, Johann, et al.
Pubblicazione: (2025)
di: Schmidt, Johann, et al.
Pubblicazione: (2025)
AtteConDA: Attention-Based Conflict Suppression in Multi-Condition Diffusion Models and Synthetic Data Augmentation
di: Noguchi, Shogo
Pubblicazione: (2026)
di: Noguchi, Shogo
Pubblicazione: (2026)
Feature-Based Lie Group Transformer for Real-World Applications
di: Komatsu, Takayuki, et al.
Pubblicazione: (2025)
di: Komatsu, Takayuki, et al.
Pubblicazione: (2025)
H-CNN-ViT: A Hierarchical Gated Attention Multi-Branch Model for Bladder Cancer Recurrence Prediction
di: Li, Xueyang, et al.
Pubblicazione: (2025)
di: Li, Xueyang, et al.
Pubblicazione: (2025)
SAFER-AiD: Saccade-Assisted Foveal-peripheral vision Enhanced Reconstruction for Adversarial Defense
di: Liu, Jiayang, et al.
Pubblicazione: (2025)
di: Liu, Jiayang, et al.
Pubblicazione: (2025)
MAP: Mitigating Hallucinations in Large Vision-Language Models with Map-Level Attention Processing
di: Li, Chenxi, et al.
Pubblicazione: (2025)
di: Li, Chenxi, et al.
Pubblicazione: (2025)
Saccade Attention Networks: Using Transfer Learning of Attention to Reduce Network Sizes
di: Estafanous, Marc
Pubblicazione: (2026)
di: Estafanous, Marc
Pubblicazione: (2026)
Synaptic bundle theory for spike-driven sensor-motor system: More than eight independent synaptic bundles collapse reward-STDP learning
di: Kobayashi, Takeshi, et al.
Pubblicazione: (2025)
di: Kobayashi, Takeshi, et al.
Pubblicazione: (2025)
Locating Demographic Bias at the Attention-Head Level in CLIP's Vision Encoder
di: Yasser, Alaa, et al.
Pubblicazione: (2026)
di: Yasser, Alaa, et al.
Pubblicazione: (2026)
MHLA: Restoring Expressivity of Linear Attention via Token-Level Multi-Head
di: Zhang, Kewei, et al.
Pubblicazione: (2026)
di: Zhang, Kewei, et al.
Pubblicazione: (2026)
Large Vision-Language Models Get Lost in Attention
di: Xi, Gongli, et al.
Pubblicazione: (2026)
di: Xi, Gongli, et al.
Pubblicazione: (2026)
Attention Prompting on Image for Large Vision-Language Models
di: Yu, Runpeng, et al.
Pubblicazione: (2024)
di: Yu, Runpeng, et al.
Pubblicazione: (2024)
Recurrent Reasoning with Vision-Language Models for Estimating Long-Horizon Embodied Task Progress
di: Zhang, Yuelin, et al.
Pubblicazione: (2026)
di: Zhang, Yuelin, et al.
Pubblicazione: (2026)
Don't Miss the Forest for the Trees: Attentional Vision Calibration for Large Vision Language Models
di: Woo, Sangmin, et al.
Pubblicazione: (2024)
di: Woo, Sangmin, et al.
Pubblicazione: (2024)
Diffusion Models in Low-Level Vision: A Survey
di: He, Chunming, et al.
Pubblicazione: (2024)
di: He, Chunming, et al.
Pubblicazione: (2024)
ECViT: Efficient Convolutional Vision Transformer with Local-Attention and Multi-scale Stages
di: Qian, Zhoujie
Pubblicazione: (2025)
di: Qian, Zhoujie
Pubblicazione: (2025)
MSVIT: Improving Spiking Vision Transformer Using Multi-scale Attention Fusion
di: Hua, Wei, et al.
Pubblicazione: (2025)
di: Hua, Wei, et al.
Pubblicazione: (2025)
Learning to Look: Cognitive Attention Alignment with Vision-Language Models
di: Yang, Ryan L., et al.
Pubblicazione: (2025)
di: Yang, Ryan L., et al.
Pubblicazione: (2025)
Leveraging Vision-Language Models to Detect Attention in Educational Videos
di: Becquet, Gabriel, et al.
Pubblicazione: (2026)
di: Becquet, Gabriel, et al.
Pubblicazione: (2026)
A-VL: Adaptive Attention for Large Vision-Language Models
di: Zhang, Junyang, et al.
Pubblicazione: (2024)
di: Zhang, Junyang, et al.
Pubblicazione: (2024)
LMLT: Low-to-high Multi-Level Vision Transformer for Image Super-Resolution
di: Kim, Jeongsoo, et al.
Pubblicazione: (2024)
di: Kim, Jeongsoo, et al.
Pubblicazione: (2024)
Beyond Attention Scores: SVD-Based Vision Token Pruning for Efficient Vision-Language Models
di: Apedo, Yvon, et al.
Pubblicazione: (2026)
di: Apedo, Yvon, et al.
Pubblicazione: (2026)
Token-Level Inference-Time Alignment for Vision-Language Models
di: Chen, Kejia, et al.
Pubblicazione: (2025)
di: Chen, Kejia, et al.
Pubblicazione: (2025)
Attention Hijacking: Response Manipulation Across Queries in Vision-Language Models
di: Wang, Zhiqiang, et al.
Pubblicazione: (2026)
di: Wang, Zhiqiang, et al.
Pubblicazione: (2026)
OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language Model
di: Chen, Qiguang, et al.
Pubblicazione: (2026)
di: Chen, Qiguang, et al.
Pubblicazione: (2026)
The Linear Attention Resurrection in Vision Transformer
di: Zheng, Chuanyang
Pubblicazione: (2025)
di: Zheng, Chuanyang
Pubblicazione: (2025)
Improved Belief-Attention in Vision Task
di: Zhang, Guoqiang
Pubblicazione: (2026)
di: Zhang, Guoqiang
Pubblicazione: (2026)
LoopVLA: Learning Sufficiency in Recurrent Refinement for Vision-Language-Action Models
di: Shen, Boyang, et al.
Pubblicazione: (2026)
di: Shen, Boyang, et al.
Pubblicazione: (2026)
Mitigating Object Hallucinations in Large Vision-Language Models via Attention Calibration
di: Zhu, Younan, et al.
Pubblicazione: (2025)
di: Zhu, Younan, et al.
Pubblicazione: (2025)
bViT: Investigating Single-Block Recurrence in Vision Transformers for Image Recognition
di: Byra, Michal, et al.
Pubblicazione: (2026)
di: Byra, Michal, et al.
Pubblicazione: (2026)
CASA: Cross-Attention over Self-Attention for Efficient Vision-Language Fusion
di: Böhle, Moritz, et al.
Pubblicazione: (2025)
di: Böhle, Moritz, et al.
Pubblicazione: (2025)
Attention Guided CAM: Visual Explanations of Vision Transformer Guided by Self-Attention
di: Leem, Saebom, et al.
Pubblicazione: (2024)
di: Leem, Saebom, et al.
Pubblicazione: (2024)
Attention Retention for Continual Learning with Vision Transformers
di: Lu, Yue, et al.
Pubblicazione: (2026)
di: Lu, Yue, et al.
Pubblicazione: (2026)
Revisiting the Integration of Convolution and Attention for Vision Backbone
di: Zhu, Lei, et al.
Pubblicazione: (2024)
di: Zhu, Lei, et al.
Pubblicazione: (2024)
A Saccade-inspired Approach to Image Classification using Vision Transformer Attention Maps
di: Dallain, Matthis, et al.
Pubblicazione: (2026)
di: Dallain, Matthis, et al.
Pubblicazione: (2026)
Modelling Visual Semantics via Image Captioning to extract Enhanced Multi-Level Cross-Modal Semantic Incongruity Representation with Attention for Multimodal Sarcasm Detection
di: Aggarwal, Sajal, et al.
Pubblicazione: (2024)
di: Aggarwal, Sajal, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Debiasing Central Fixation Confounds Reveals a Peripheral "Sweet Spot" for Human-like Scanpaths in Hard-Attention Vision
di: Pan, Pengcheng, et al.
Pubblicazione: (2026) -
EVA: Bridging Performance and Human Alignment in Hard-Attention Vision Models for Image Classification
di: Pan, Pengcheng, et al.
Pubblicazione: (2026) -
Spiking Vision Transformer with Saccadic Attention
di: Wang, Shuai, et al.
Pubblicazione: (2025) -
SaFiRe: Saccade-Fixation Reiteration with Mamba for Referring Image Segmentation
di: Mao, Zhenjie, et al.
Pubblicazione: (2025) -
Saccadic Vision for Fine-Grained Visual Classification
di: Schmidt, Johann, et al.
Pubblicazione: (2025)