Guardado en:
| Autores principales: | Zhu, Guangyang, Zhang, Jianfeng, Feng, Yuanzhi, Lan, Hai |
|---|---|
| Formato: | Preprint |
| Publicado: |
2022
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2201.01410 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Mitigating Object Hallucinations in Vision-Language Models through Region-Aware Attention Recalibration
por: Xu, Yuanzhi, et al.
Publicado: (2026)
por: Xu, Yuanzhi, et al.
Publicado: (2026)
Revisiting Disentanglement in Downstream Tasks: A Study on Its Necessity for Abstract Visual Reasoning
por: Nai, Ruiqian, et al.
Publicado: (2024)
por: Nai, Ruiqian, et al.
Publicado: (2024)
HEP-NAS: Towards Efficient Few-shot Neural Architecture Search via Hierarchical Edge Partitioning
por: Li, Jianfeng, et al.
Publicado: (2024)
por: Li, Jianfeng, et al.
Publicado: (2024)
AnchorFormer: Differentiable Anchor Attention for Efficient Vision Transformer
por: Shan, Jiquan, et al.
Publicado: (2025)
por: Shan, Jiquan, et al.
Publicado: (2025)
Fairness-aware Vision Transformer via Debiased Self-Attention
por: Qiang, Yao, et al.
Publicado: (2023)
por: Qiang, Yao, et al.
Publicado: (2023)
Attention Guided Alignment in Efficient Vision-Language Models
por: Mahajan, Shweta, et al.
Publicado: (2025)
por: Mahajan, Shweta, et al.
Publicado: (2025)
Role of Locality and Weight Sharing in Image-Based Tasks: A Sample Complexity Separation between CNNs, LCNs, and FCNs
por: Lahoti, Aakash, et al.
Publicado: (2024)
por: Lahoti, Aakash, et al.
Publicado: (2024)
M2H: Multi-Task Learning with Efficient Window-Based Cross-Task Attention for Monocular Spatial Perception
por: Udugama, U. V. B. L, et al.
Publicado: (2025)
por: Udugama, U. V. B. L, et al.
Publicado: (2025)
Seg-LSTM: Performance of xLSTM for Semantic Segmentation of Remotely Sensed Images
por: Zhu, Qinfeng, et al.
Publicado: (2024)
por: Zhu, Qinfeng, et al.
Publicado: (2024)
SGW-based Multi-Task Learning in Vision Tasks
por: Zhang, Ruiyuan, et al.
Publicado: (2024)
por: Zhang, Ruiyuan, et al.
Publicado: (2024)
Attention Transfer Is Not Universally Effective for Vision Transformers
por: Qin, Huaiyuan, et al.
Publicado: (2026)
por: Qin, Huaiyuan, et al.
Publicado: (2026)
COMCAT: Towards Efficient Compression and Customization of Attention-Based Vision Models
por: Xiao, Jinqi, et al.
Publicado: (2023)
por: Xiao, Jinqi, et al.
Publicado: (2023)
STAR: Stage-Wise Attention-Guided Token Reduction for Efficient Large Vision-Language Models Inference
por: Guo, Yichen, et al.
Publicado: (2025)
por: Guo, Yichen, et al.
Publicado: (2025)
Discrete Cosine Transform Based Decorrelated Attention for Vision Transformers
por: Pan, Hongyi, et al.
Publicado: (2024)
por: Pan, Hongyi, et al.
Publicado: (2024)
Efficient and Long-Tailed Generalization for Pre-trained Vision-Language Model
por: Shi, Jiang-Xin, et al.
Publicado: (2024)
por: Shi, Jiang-Xin, et al.
Publicado: (2024)
Enhancing Cognition and Explainability of Multimodal Foundation Models with Self-Synthesized Data
por: Shi, Yucheng, et al.
Publicado: (2025)
por: Shi, Yucheng, et al.
Publicado: (2025)
Convolutional Rectangular Attention Module
por: Nguyen, Hai-Vy, et al.
Publicado: (2025)
por: Nguyen, Hai-Vy, et al.
Publicado: (2025)
SmartFRZ: An Efficient Training Framework using Attention-Based Layer Freezing
por: Li, Sheng, et al.
Publicado: (2024)
por: Li, Sheng, et al.
Publicado: (2024)
Elastic Attention Cores for Scalable Vision Transformers
por: Song, Alan Z., et al.
Publicado: (2026)
por: Song, Alan Z., et al.
Publicado: (2026)
Data Attribution for Text-to-Image Models by Unlearning Synthesized Images
por: Wang, Sheng-Yu, et al.
Publicado: (2024)
por: Wang, Sheng-Yu, et al.
Publicado: (2024)
SupMAE: Supervised Masked Autoencoders Are Efficient Vision Learners
por: Liang, Feng, et al.
Publicado: (2022)
por: Liang, Feng, et al.
Publicado: (2022)
Soft-Di[M]O: Improving One-Step Discrete Image Generation with Soft Embeddings
por: Zhu, Yuanzhi, et al.
Publicado: (2025)
por: Zhu, Yuanzhi, et al.
Publicado: (2025)
Di$\mathtt{[M]}$O: Distilling Masked Diffusion Models into One-step Generator
por: Zhu, Yuanzhi, et al.
Publicado: (2025)
por: Zhu, Yuanzhi, et al.
Publicado: (2025)
Diffusion Reinforcement Learning via Centered Reward Distillation
por: Zhu, Yuanzhi, et al.
Publicado: (2026)
por: Zhu, Yuanzhi, et al.
Publicado: (2026)
One-step Diffusion Models with Bregman Density Ratio Matching
por: Zhu, Yuanzhi, et al.
Publicado: (2025)
por: Zhu, Yuanzhi, et al.
Publicado: (2025)
Ultrasound Vision-Language Alignment via Contrastive Learning
por: Lyu, Zhuoyang, et al.
Publicado: (2026)
por: Lyu, Zhuoyang, et al.
Publicado: (2026)
Knowledge Transfer from Vision Foundation Models for Efficient Training of Small Task-specific Models
por: Vemulapalli, Raviteja, et al.
Publicado: (2023)
por: Vemulapalli, Raviteja, et al.
Publicado: (2023)
Tensor Decomposition Based Attention Module for Spiking Neural Networks
por: Deng, Haoyu, et al.
Publicado: (2023)
por: Deng, Haoyu, et al.
Publicado: (2023)
Self-Supervised Weight Templates for Scalable Vision Model Initialization
por: Xie, Yucheng, et al.
Publicado: (2026)
por: Xie, Yucheng, et al.
Publicado: (2026)
RadZero: Similarity-Based Cross-Attention for Explainable Vision-Language Alignment in Chest X-ray with Zero-Shot Multi-Task Capability
por: Park, Jonggwon, et al.
Publicado: (2025)
por: Park, Jonggwon, et al.
Publicado: (2025)
Memory Efficient Neural Processes via Constant Memory Attention Block
por: Feng, Leo, et al.
Publicado: (2023)
por: Feng, Leo, et al.
Publicado: (2023)
Hierarchical Self Attention Based Autoencoder for Open-Set Human Activity Recognition
por: Tonmoy, M Tanjid Hasan, et al.
Publicado: (2021)
por: Tonmoy, M Tanjid Hasan, et al.
Publicado: (2021)
Vision Mamba: Efficient Visual Representation Learning with Bidirectional State Space Model
por: Zhu, Lianghui, et al.
Publicado: (2024)
por: Zhu, Lianghui, et al.
Publicado: (2024)
Hierarchical Invariance for Robust and Interpretable Vision Tasks at Larger Scales
por: Qi, Shuren, et al.
Publicado: (2024)
por: Qi, Shuren, et al.
Publicado: (2024)
Online Self-Calibration Against Hallucination in Vision-Language Models
por: Chen, Minghui, et al.
Publicado: (2026)
por: Chen, Minghui, et al.
Publicado: (2026)
SpargeAttention2: Trainable Sparse Attention via Hybrid Top-k+Top-p Masking and Distillation Fine-Tuning
por: Zhang, Jintao, et al.
Publicado: (2026)
por: Zhang, Jintao, et al.
Publicado: (2026)
Understanding Task Transfer in Vision-Language Models
por: Sachdeva, Bhuvan, et al.
Publicado: (2025)
por: Sachdeva, Bhuvan, et al.
Publicado: (2025)
IBMA: An Imputation-Based Mixup Augmentation Using Self-Supervised Learning for Time Series Data
por: Nguyen, Dang Nha, et al.
Publicado: (2025)
por: Nguyen, Dang Nha, et al.
Publicado: (2025)
MABViT -- Modified Attention Block Enhances Vision Transformers
por: Ramesh, Mahesh, et al.
Publicado: (2023)
por: Ramesh, Mahesh, et al.
Publicado: (2023)
Evaluating the Impact of Point Cloud Colorization on Semantic Segmentation Accuracy
por: Zhu, Qinfeng, et al.
Publicado: (2024)
por: Zhu, Qinfeng, et al.
Publicado: (2024)
Ejemplares similares
-
Mitigating Object Hallucinations in Vision-Language Models through Region-Aware Attention Recalibration
por: Xu, Yuanzhi, et al.
Publicado: (2026) -
Revisiting Disentanglement in Downstream Tasks: A Study on Its Necessity for Abstract Visual Reasoning
por: Nai, Ruiqian, et al.
Publicado: (2024) -
HEP-NAS: Towards Efficient Few-shot Neural Architecture Search via Hierarchical Edge Partitioning
por: Li, Jianfeng, et al.
Publicado: (2024) -
AnchorFormer: Differentiable Anchor Attention for Efficient Vision Transformer
por: Shan, Jiquan, et al.
Publicado: (2025) -
Fairness-aware Vision Transformer via Debiased Self-Attention
por: Qiang, Yao, et al.
Publicado: (2023)