ResCLIP: Residual Attention for Training-free Dense Vision-language Inference
Fuente:
arXiv
Saved in:
| Main Authors: | Yang, Yuhang, Deng, Jinhong, Li, Wen, Duan, Lixin |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Towards Unsupervised Model Selection for Domain Adaptive Object Detection
by: Yu, Hengfu, et al.
Published: (2024)
by: Yu, Hengfu, et al.
Published: (2024)
Instance-Free Domain Adaptive Object Detection
by: Yu, Hengfu, et al.
Published: (2026)
by: Yu, Hengfu, et al.
Published: (2026)
ClearCLIP: Decomposing CLIP Representations for Dense Vision-Language Inference
by: Lan, Mengcheng, et al.
Published: (2024)
by: Lan, Mengcheng, et al.
Published: (2024)
Res$^2$CLIP: Few-Shot Generalist Anomaly Detection with Residual-to-Residual Alignment
by: Liu, Xinyue, et al.
Published: (2026)
by: Liu, Xinyue, et al.
Published: (2026)
VPNeXt -- Rethinking Dense Decoding for Plain Vision Transformer
by: Tang, Xikai, et al.
Published: (2025)
by: Tang, Xikai, et al.
Published: (2025)
ResPanDiff: Diffusion Model for Pansharpening by Inferring Residual Inference
by: Cao, Shiqi, et al.
Published: (2025)
by: Cao, Shiqi, et al.
Published: (2025)
SCLIP: Rethinking Self-Attention for Dense Vision-Language Inference
by: Wang, Feng, et al.
Published: (2023)
by: Wang, Feng, et al.
Published: (2023)
Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation
by: Chi, Zhixiang, et al.
Published: (2025)
by: Chi, Zhixiang, et al.
Published: (2025)
Interpreting ResNet-based CLIP via Neuron-Attention Decomposition
by: Bu, Edmund, et al.
Published: (2025)
by: Bu, Edmund, et al.
Published: (2025)
The Devil is in Attention Sharing: Improving Complex Non-rigid Image Editing Faithfulness via Attention Synergy
by: Chen, Zhuo, et al.
Published: (2025)
by: Chen, Zhuo, et al.
Published: (2025)
Training-free Spatially Grounded Geometric Shape Encoding (Technical Report)
by: He, Yuhang
Published: (2026)
by: He, Yuhang
Published: (2026)
Two-stage Progressive Residual Dense Attention Network for Image Denoising
by: Wu, Wencong, et al.
Published: (2024)
by: Wu, Wencong, et al.
Published: (2024)
DiCLIP: Diffusion Model Enhances CLIP's Dense Knowledge for Weakly Supervised Semantic Segmentation
by: Yang, Zhiwei, et al.
Published: (2026)
by: Yang, Zhiwei, et al.
Published: (2026)
SCOPE: Saliency-Coverage Oriented Token Pruning for Efficient Multimodel LLMs
by: Deng, Jinhong, et al.
Published: (2025)
by: Deng, Jinhong, et al.
Published: (2025)
Training-free Token Reduction for Vision Mamba
by: Ma, Qiankun, et al.
Published: (2025)
by: Ma, Qiankun, et al.
Published: (2025)
SynA-ResNet: Spike-driven ResNet Achieved through OR Residual Connection
by: Shan, Yimeng, et al.
Published: (2023)
by: Shan, Yimeng, et al.
Published: (2023)
ResFlow: Fine-tuning Residual Optical Flow for Event-based High Temporal Resolution Motion Estimation
by: Zhou, Qianang, et al.
Published: (2024)
by: Zhou, Qianang, et al.
Published: (2024)
ResFields: Residual Neural Fields for Spatiotemporal Signals
by: Mihajlovic, Marko, et al.
Published: (2023)
by: Mihajlovic, Marko, et al.
Published: (2023)
Long-CLIP: Unlocking the Long-Text Capability of CLIP
by: Zhang, Beichen, et al.
Published: (2024)
by: Zhang, Beichen, et al.
Published: (2024)
RWKV-CLIP: A Robust Vision-Language Representation Learner
by: Gu, Tiancheng, et al.
Published: (2024)
by: Gu, Tiancheng, et al.
Published: (2024)
Deformation-based In-Context Learning for Point Cloud Understanding
by: Lin, Chengxing, et al.
Published: (2026)
by: Lin, Chengxing, et al.
Published: (2026)
Low-light Image Enhancement via CLIP-Fourier Guided Wavelet Diffusion
by: Xue, Minglong, et al.
Published: (2024)
by: Xue, Minglong, et al.
Published: (2024)
DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception
by: Wang, Junjie, et al.
Published: (2025)
by: Wang, Junjie, et al.
Published: (2025)
SmartCLIP: Modular Vision-language Alignment with Identification Guarantees
by: Xie, Shaoan, et al.
Published: (2025)
by: Xie, Shaoan, et al.
Published: (2025)
Attention Residual Fusion Network with Contrast for Source-free Domain Adaptation
by: Shao, Renrong, et al.
Published: (2025)
by: Shao, Renrong, et al.
Published: (2025)
Beyond CLIP Generalization: Against Forward&Backward Forgetting Adapter for Continual Learning of Vision-Language Models
by: Dong, Songlin, et al.
Published: (2025)
by: Dong, Songlin, et al.
Published: (2025)
XAttnRes: Cross-Stage Attention Residuals for Medical Image Segmentation
by: Liu, Xinyu, et al.
Published: (2026)
by: Liu, Xinyu, et al.
Published: (2026)
SSR: SAM is a Strong Regularizer for domain adaptive semantic segmentation
by: Ge, Yanqi, et al.
Published: (2024)
by: Ge, Yanqi, et al.
Published: (2024)
Learning Semantic Latent Directions for Accurate and Controllable Human Motion Prediction
by: Xu, Guowei, et al.
Published: (2024)
by: Xu, Guowei, et al.
Published: (2024)
Balanced Sharpness-Aware Minimization for Imbalanced Regression
by: Liu, Yahao, et al.
Published: (2025)
by: Liu, Yahao, et al.
Published: (2025)
Object-Centric Vision Token Pruning for Vision Language Models
by: Li, Guangyuan, et al.
Published: (2025)
by: Li, Guangyuan, et al.
Published: (2025)
ProxyCLIP: Proxy Attention Improves CLIP for Open-Vocabulary Segmentation
by: Lan, Mengcheng, et al.
Published: (2024)
by: Lan, Mengcheng, et al.
Published: (2024)
UMG-CLIP: A Unified Multi-Granularity Vision Generalist for Open-World Understanding
by: Shi, Bowen, et al.
Published: (2024)
by: Shi, Bowen, et al.
Published: (2024)
Interpreting the Residual Stream of ResNet18
by: Longon, André
Published: (2024)
by: Longon, André
Published: (2024)
ResTok: Learning Hierarchical Residuals in 1D Visual Tokenizers for Autoregressive Image Generation
by: Zhang, Xu, et al.
Published: (2026)
by: Zhang, Xu, et al.
Published: (2026)
ARANet: Attention-based Residual Adversarial Network with Deep Supervision for Radiotherapy Dose Prediction of Cervical Cancer
by: Wen, Lu, et al.
Published: (2024)
by: Wen, Lu, et al.
Published: (2024)
VIP: Visual-guided Prompt Evolution for Efficient Dense Vision-Language Inference
by: Zhu, Hao, et al.
Published: (2026)
by: Zhu, Hao, et al.
Published: (2026)
GeoAlignCLIP: Enhancing Fine-Grained Vision-Language Alignment in Remote Sensing via Multi-Granular Consistency Learning
by: Yang, Xiao, et al.
Published: (2026)
by: Yang, Xiao, et al.
Published: (2026)
VeCAF: Vision-language Collaborative Active Finetuning with Training Objective Awareness
by: Zhang, Rongyu, et al.
Published: (2024)
by: Zhang, Rongyu, et al.
Published: (2024)
Training-free Subject-Enhanced Attention Guidance for Compositional Text-to-image Generation
by: Liu, Shengyuan, et al.
Published: (2024)
by: Liu, Shengyuan, et al.
Published: (2024)
Similar Items
-
Towards Unsupervised Model Selection for Domain Adaptive Object Detection
by: Yu, Hengfu, et al.
Published: (2024) -
Instance-Free Domain Adaptive Object Detection
by: Yu, Hengfu, et al.
Published: (2026) -
ClearCLIP: Decomposing CLIP Representations for Dense Vision-Language Inference
by: Lan, Mengcheng, et al.
Published: (2024) -
Res$^2$CLIP: Few-Shot Generalist Anomaly Detection with Residual-to-Residual Alignment
by: Liu, Xinyue, et al.
Published: (2026) -
VPNeXt -- Rethinking Dense Decoding for Plain Vision Transformer
by: Tang, Xikai, et al.
Published: (2025)