MDS-ViTNet: Improving saliency prediction for Eye-Tracking with Vision Transformer
Fuente:
arXiv
Guardado en:
| Autores principales: | Ignat, Polezhaev, Igor, Goncharenko, Natalya, Iurina |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Case-Enhanced Vision Transformer: Improving Explanations of Image Similarity with a ViT-based Similarity Metric
por: Zhao, Ziwei, et al.
Publicado: (2024)
por: Zhao, Ziwei, et al.
Publicado: (2024)
SAC-ViT: Semantic-Aware Clustering Vision Transformer with Early Exit
por: Hu, Youbing, et al.
Publicado: (2025)
por: Hu, Youbing, et al.
Publicado: (2025)
ButterflyViT: 354$\times$ Expert Compression for Edge Vision Transformers
por: Karmore, Aryan
Publicado: (2026)
por: Karmore, Aryan
Publicado: (2026)
LF-ViT: Reducing Spatial Redundancy in Vision Transformer for Efficient Image Recognition
por: Hu, Youbing, et al.
Publicado: (2024)
por: Hu, Youbing, et al.
Publicado: (2024)
DFQ-ViT: Data-Free Quantization for Vision Transformers without Fine-tuning
por: Tong, Yujia, et al.
Publicado: (2025)
por: Tong, Yujia, et al.
Publicado: (2025)
bViT: Investigating Single-Block Recurrence in Vision Transformers for Image Recognition
por: Byra, Michal, et al.
Publicado: (2026)
por: Byra, Michal, et al.
Publicado: (2026)
GTP-ViT: Efficient Vision Transformers via Graph-based Token Propagation
por: Xu, Xuwei, et al.
Publicado: (2023)
por: Xu, Xuwei, et al.
Publicado: (2023)
Trio-ViT: Post-Training Quantization and Acceleration for Softmax-Free Efficient Vision Transformer
por: Shi, Huihong, et al.
Publicado: (2024)
por: Shi, Huihong, et al.
Publicado: (2024)
JetViT: Efficient High-Resolution Vision Transformer with Post-Training Attention Search
por: Zou, Dongyun, et al.
Publicado: (2026)
por: Zou, Dongyun, et al.
Publicado: (2026)
ViTs are Everywhere: A Comprehensive Study Showcasing Vision Transformers in Different Domain
por: Mia, Md Sohag, et al.
Publicado: (2023)
por: Mia, Md Sohag, et al.
Publicado: (2023)
CascadedViT: Cascaded Chunk-FeedForward and Cascaded Group Attention Vision Transformer
por: Sivakumar, Srivathsan, et al.
Publicado: (2025)
por: Sivakumar, Srivathsan, et al.
Publicado: (2025)
ViT-2SPN: Vision Transformer-based Dual-Stream Self-Supervised Pretraining Networks for Retinal OCT Classification
por: Saraei, Mohammadreza, et al.
Publicado: (2025)
por: Saraei, Mohammadreza, et al.
Publicado: (2025)
FasterViT: Fast Vision Transformers with Hierarchical Attention
por: Hatamizadeh, Ali, et al.
Publicado: (2023)
por: Hatamizadeh, Ali, et al.
Publicado: (2023)
Tiny-ViT: A Compact Vision Transformer for Efficient and Explainable Potato Leaf Disease Classification
por: Mia, Shakil, et al.
Publicado: (2026)
por: Mia, Shakil, et al.
Publicado: (2026)
IPTQ-ViT: Post-Training Quantization of Non-linear Functions for Integer-only Vision Transformers
por: Kim, Gihwan, et al.
Publicado: (2025)
por: Kim, Gihwan, et al.
Publicado: (2025)
CornViT: A Multi-Stage Convolutional Vision Transformer Framework for Hierarchical Corn Kernel Analysis
por: Erukude, Sai Teja, et al.
Publicado: (2025)
por: Erukude, Sai Teja, et al.
Publicado: (2025)
RePaViT: Scalable Vision Transformer Acceleration via Structural Reparameterization on Feedforward Network Layers
por: Xu, Xuwei, et al.
Publicado: (2025)
por: Xu, Xuwei, et al.
Publicado: (2025)
VariViT: A Vision Transformer for Variable Image Sizes
por: Varma, Aswathi, et al.
Publicado: (2026)
por: Varma, Aswathi, et al.
Publicado: (2026)
ScriptViT: Vision Transformer-Based Personalized Handwriting Generation
por: Acharya, Sajjan, et al.
Publicado: (2025)
por: Acharya, Sajjan, et al.
Publicado: (2025)
Octic Vision Transformers: Quicker ViTs Through Equivariance
por: Nordström, David, et al.
Publicado: (2025)
por: Nordström, David, et al.
Publicado: (2025)
Beyond Translation: Cross-Cultural Meme Transcreation with Vision-Language Models
por: Zhao, Yuming, et al.
Publicado: (2026)
por: Zhao, Yuming, et al.
Publicado: (2026)
ViGoR: Improving Visual Grounding of Large Vision Language Models with Fine-Grained Reward Modeling
por: Yan, Siming, et al.
Publicado: (2024)
por: Yan, Siming, et al.
Publicado: (2024)
Q-HyViT: Post-Training Quantization of Hybrid Vision Transformers with Bridge Block Reconstruction for IoT Systems
por: Lee, Jemin, et al.
Publicado: (2023)
por: Lee, Jemin, et al.
Publicado: (2023)
Event-Based Eye Tracking. 2025 Event-based Vision Workshop
por: Chen, Qinyu, et al.
Publicado: (2025)
por: Chen, Qinyu, et al.
Publicado: (2025)
[Re] Improving Interpretation Faithfulness for Vision Transformers
por: Kurek, Izabela, et al.
Publicado: (2025)
por: Kurek, Izabela, et al.
Publicado: (2025)
TinyViT-Batten: Few-Shot Vision Transformer with Explainable Attention for Early Batten-Disease Detection on Pediatric MRI
por: Uppalapati, Khartik, et al.
Publicado: (2025)
por: Uppalapati, Khartik, et al.
Publicado: (2025)
Event-Based Eye Tracking. AIS 2024 Challenge Survey
por: Wang, Zuowen, et al.
Publicado: (2024)
por: Wang, Zuowen, et al.
Publicado: (2024)
Evaluating Image-Based Face and Eye Tracking with Event Cameras
por: Iddrisu, Khadija, et al.
Publicado: (2024)
por: Iddrisu, Khadija, et al.
Publicado: (2024)
Improved Ear Verification with Vision Transformers and Overlapping Patches
por: Arun, Deeksha, et al.
Publicado: (2025)
por: Arun, Deeksha, et al.
Publicado: (2025)
The Progression of Transformers from Language to Vision to MOT: A Literature Review on Multi-Object Tracking with Transformers
por: Kamboj, Abhi
Publicado: (2024)
por: Kamboj, Abhi
Publicado: (2024)
COST: Contrastive One-Stage Transformer for Vision-Language Small Object Tracking
por: Zhang, Chunhui, et al.
Publicado: (2025)
por: Zhang, Chunhui, et al.
Publicado: (2025)
Quasar-ViT: Hardware-Oriented Quantization-Aware Architecture Search for Vision Transformers
por: Li, Zhengang, et al.
Publicado: (2024)
por: Li, Zhengang, et al.
Publicado: (2024)
TAP-ViTs: Task-Adaptive Pruning for On-Device Deployment of Vision Transformers
por: Wang, Zhibo, et al.
Publicado: (2026)
por: Wang, Zhibo, et al.
Publicado: (2026)
LoViT: Long Video Transformer for Surgical Phase Recognition
por: Liu, Yang, et al.
Publicado: (2023)
por: Liu, Yang, et al.
Publicado: (2023)
Sub-token ViT Embedding via Stochastic Resonance Transformers
por: Lao, Dong, et al.
Publicado: (2023)
por: Lao, Dong, et al.
Publicado: (2023)
A Lightweight Spatiotemporal Network for Online Eye Tracking with Event Camera
por: Pei, Yan Ru, et al.
Publicado: (2024)
por: Pei, Yan Ru, et al.
Publicado: (2024)
ViT-Linearizer: Distilling Quadratic Knowledge into Linear-Time Vision Models
por: Wei, Guoyizhe, et al.
Publicado: (2025)
por: Wei, Guoyizhe, et al.
Publicado: (2025)
SkipViT: Speeding Up Vision Transformers with a Token-Level Skip Connection
por: Ataiefard, Foozhan, et al.
Publicado: (2024)
por: Ataiefard, Foozhan, et al.
Publicado: (2024)
Post-Disaster Affected Area Segmentation with a Vision Transformer (ViT)-based EVAP Model using Sentinel-2 and Formosat-5 Imagery
por: Chu, Yi-Shan, et al.
Publicado: (2025)
por: Chu, Yi-Shan, et al.
Publicado: (2025)
GranViT: A Fine-Grained Vision Model With Autoregressive Perception For MLLMs
por: Zheng, Guanghao, et al.
Publicado: (2025)
por: Zheng, Guanghao, et al.
Publicado: (2025)
Ejemplares similares
-
Case-Enhanced Vision Transformer: Improving Explanations of Image Similarity with a ViT-based Similarity Metric
por: Zhao, Ziwei, et al.
Publicado: (2024) -
SAC-ViT: Semantic-Aware Clustering Vision Transformer with Early Exit
por: Hu, Youbing, et al.
Publicado: (2025) -
ButterflyViT: 354$\times$ Expert Compression for Edge Vision Transformers
por: Karmore, Aryan
Publicado: (2026) -
LF-ViT: Reducing Spatial Redundancy in Vision Transformer for Efficient Image Recognition
por: Hu, Youbing, et al.
Publicado: (2024) -
DFQ-ViT: Data-Free Quantization for Vision Transformers without Fine-tuning
por: Tong, Yujia, et al.
Publicado: (2025)