ROI-Aware Multiscale Cross-Attention Vision Transformer for Pest Image Identification
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kim, Ga-Eun, Son, Chang-Hwan |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Locally Grouped and Scale-Guided Attention for Dense Pest Counting
par: Son, Chang-Hwan
Publié: (2024)
par: Son, Chang-Hwan
Publié: (2024)
Degradation-Agnostic Statistical Facial Feature Transformation for Blind Face Restoration in Adverse Weather Conditions
par: Son, Chang-Hwan, et autres
Publié: (2025)
par: Son, Chang-Hwan, et autres
Publié: (2025)
New Encoder Learning for Captioning Heavy Rain Images via Semantic Visual Feature Matching
par: Son, Chang-Hwan, et autres
Publié: (2021)
par: Son, Chang-Hwan, et autres
Publié: (2021)
Decision-Aware Attention Propagation for Vision Transformer Explainability
par: Jo, Sehyeong, et autres
Publié: (2026)
par: Jo, Sehyeong, et autres
Publié: (2026)
Pixel-aligned RGB-NIR Stereo Imaging and Dataset for Robot Vision
par: Kim, Jinnyeong, et autres
Publié: (2024)
par: Kim, Jinnyeong, et autres
Publié: (2024)
MedROI: Codec-Agnostic Region of Interest-Centric Compression for Medical Images
par: Kim, Jiwon, et autres
Publié: (2026)
par: Kim, Jiwon, et autres
Publié: (2026)
Structural Attention: Rethinking Transformer for Unpaired Medical Image Synthesis
par: Phan, Vu Minh Hieu, et autres
Publié: (2024)
par: Phan, Vu Minh Hieu, et autres
Publié: (2024)
Lightweight Spatiotemporal Highway Lane Detection via 3D-ResNet and PINet with ROI-Aware Attention
par: Raja, Sorna Shanmuga, et autres
Publié: (2026)
par: Raja, Sorna Shanmuga, et autres
Publié: (2026)
Calibration Attention: Learning Reliability-Aware Representations for Vision Transformers
par: Liang, Wenhao, et autres
Publié: (2025)
par: Liang, Wenhao, et autres
Publié: (2025)
DAONet-YOLOv8: An Occlusion-Aware Dual-Attention Network for Tea Leaf Pest and Disease Detection
par: Wu, Yefeng, et autres
Publié: (2025)
par: Wu, Yefeng, et autres
Publié: (2025)
ROI-Packing: Efficient Region-Based Compression for Machine Vision
par: Eimon, Md Eimran Hossain, et autres
Publié: (2025)
par: Eimon, Md Eimran Hossain, et autres
Publié: (2025)
PestVL-Net: Enabling Multimodal Pest Learning via Fine-grained Vision-Language Interaction
par: Li, Xueheng, et autres
Publié: (2026)
par: Li, Xueheng, et autres
Publié: (2026)
Fieldscale: Locality-Aware Field-based Adaptive Rescaling for Thermal Infrared Image
par: Gil, Hyeonjae, et autres
Publié: (2024)
par: Gil, Hyeonjae, et autres
Publié: (2024)
RNA: Video Editing with ROI-based Neural Atlas
par: Lee, Jaekyeong, et autres
Publié: (2024)
par: Lee, Jaekyeong, et autres
Publié: (2024)
Intra-task Mutual Attention based Vision Transformer for Few-Shot Learning
par: Jiang, Weihao, et autres
Publié: (2024)
par: Jiang, Weihao, et autres
Publié: (2024)
Representative Attention For Vision Transformers
par: Li, Yuntong, et autres
Publié: (2026)
par: Li, Yuntong, et autres
Publié: (2026)
Vision Transformers with Hierarchical Attention
par: Liu, Yun, et autres
Publié: (2021)
par: Liu, Yun, et autres
Publié: (2021)
Lightweight Vision Transformer with Window and Spatial Attention for Food Image Classification
par: Gao, Xinle, et autres
Publié: (2025)
par: Gao, Xinle, et autres
Publié: (2025)
How Do Large Vision-Language Models See Text in Image? Unveiling the Distinctive Role of OCR Heads
par: Baek, Ingeol, et autres
Publié: (2025)
par: Baek, Ingeol, et autres
Publié: (2025)
SAMReg: SAM-enabled Image Registration with ROI-based Correspondence
par: Huang, Shiqi, et autres
Publié: (2024)
par: Huang, Shiqi, et autres
Publié: (2024)
Estimating Extreme 3D Image Rotation with Transformer Cross-Attention
par: Dekel, Shay, et autres
Publié: (2023)
par: Dekel, Shay, et autres
Publié: (2023)
Crafting Query-Aware Selective Attention for Single Image Super-Resolution
par: Kim, Junyoung, et autres
Publié: (2025)
par: Kim, Junyoung, et autres
Publié: (2025)
Embedded Heterogeneous Attention Transformer for Cross-lingual Image Captioning
par: Song, Zijie, et autres
Publié: (2023)
par: Song, Zijie, et autres
Publié: (2023)
Structured Initialization for Attention in Vision Transformers
par: Zheng, Jianqiao, et autres
Publié: (2024)
par: Zheng, Jianqiao, et autres
Publié: (2024)
Vision Transformers are Circulant Attention Learners
par: Han, Dongchen, et autres
Publié: (2025)
par: Han, Dongchen, et autres
Publié: (2025)
Multi-manifold Attention for Vision Transformers
par: Konstantinidis, Dimitrios, et autres
Publié: (2022)
par: Konstantinidis, Dimitrios, et autres
Publié: (2022)
HAViT: Historical Attention Vision Transformer
par: Banik, Swarnendu, et autres
Publié: (2026)
par: Banik, Swarnendu, et autres
Publié: (2026)
DBAT: Dynamic Backward Attention Transformer for Material Segmentation with Cross-Resolution Patches
par: Heng, Yuwen, et autres
Publié: (2023)
par: Heng, Yuwen, et autres
Publié: (2023)
Local-Aware Global Attention Network for Person Re-Identification Based on Body and Hand Images
par: Baisa, Nathanael L.
Publié: (2022)
par: Baisa, Nathanael L.
Publié: (2022)
DeforHMR: Vision Transformer with Deformable Cross-Attention for 3D Human Mesh Recovery
par: Heo, Jaewoo, et autres
Publié: (2024)
par: Heo, Jaewoo, et autres
Publié: (2024)
MedFormer: Hierarchical Medical Vision Transformer with Content-Aware Dual Sparse Selection Attention
par: Xia, Zunhui, et autres
Publié: (2025)
par: Xia, Zunhui, et autres
Publié: (2025)
Interpretability-Aware Vision Transformer
par: Qiang, Yao, et autres
Publié: (2023)
par: Qiang, Yao, et autres
Publié: (2023)
Aligned Novel View Image and Geometry Synthesis via Cross-modal Attention Instillation
par: Kwak, Min-Seop, et autres
Publié: (2025)
par: Kwak, Min-Seop, et autres
Publié: (2025)
CSTA: CNN-based Spatiotemporal Attention for Video Summarization
par: Son, Jaewon, et autres
Publié: (2024)
par: Son, Jaewon, et autres
Publié: (2024)
TERDNet: Transformer Encoder-Recurrent Decoder Network for Scene Change Detection
par: Yoon, Jiae, et autres
Publié: (2026)
par: Yoon, Jiae, et autres
Publié: (2026)
TCSAFormer: Efficient Vision Transformer with Token Compression and Sparse Attention for Medical Image Segmentation
par: Xia, Zunhui, et autres
Publié: (2025)
par: Xia, Zunhui, et autres
Publié: (2025)
A Saccade-inspired Approach to Image Classification using Vision Transformer Attention Maps
par: Dallain, Matthis, et autres
Publié: (2026)
par: Dallain, Matthis, et autres
Publié: (2026)
Multiscale Vision Transformers meet Bipartite Matching for efficient single-stage Action Localization
par: Ntinou, Ioanna, et autres
Publié: (2023)
par: Ntinou, Ioanna, et autres
Publié: (2023)
Improved Multiscale Structural Mapping with Supervertex Vision Transformer for the Detection of Alzheimer's Disease Neurodegeneration
par: Baek, Geonwoo, et autres
Publié: (2026)
par: Baek, Geonwoo, et autres
Publié: (2026)
Multi-criteria Token Fusion with One-step-ahead Attention for Efficient Vision Transformers
par: Lee, Sanghyeok, et autres
Publié: (2024)
par: Lee, Sanghyeok, et autres
Publié: (2024)
Documents similaires
-
Locally Grouped and Scale-Guided Attention for Dense Pest Counting
par: Son, Chang-Hwan
Publié: (2024) -
Degradation-Agnostic Statistical Facial Feature Transformation for Blind Face Restoration in Adverse Weather Conditions
par: Son, Chang-Hwan, et autres
Publié: (2025) -
New Encoder Learning for Captioning Heavy Rain Images via Semantic Visual Feature Matching
par: Son, Chang-Hwan, et autres
Publié: (2021) -
Decision-Aware Attention Propagation for Vision Transformer Explainability
par: Jo, Sehyeong, et autres
Publié: (2026) -
Pixel-aligned RGB-NIR Stereo Imaging and Dataset for Robot Vision
par: Kim, Jinnyeong, et autres
Publié: (2024)