Attend and Enrich: Enhanced Visual Prompt for Zero-Shot Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Man, Bai, Huihui, Li, Feng, Zhang, Chunjie, Wei, Yunchao, Chua, Tat-Seng, Zhao, Yao |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
PSVMA+: Exploring Multi-granularity Semantic-visual Adaption for Generalized Zero-shot Learning
par: Liu, Man, et autres
Publié: (2024)
par: Liu, Man, et autres
Publié: (2024)
Zero-1-to-A: Zero-Shot One Image to Animatable Head Avatars Using Video Diffusion
par: Zhou, Zhenglin, et autres
Publié: (2025)
par: Zhou, Zhenglin, et autres
Publié: (2025)
Extending Visual Dynamics for Video-to-Music Generation
par: Liu, Xiaohao, et autres
Publié: (2025)
par: Liu, Xiaohao, et autres
Publié: (2025)
Can I Trust Your Answer? Visually Grounded Video Question Answering
par: Xiao, Junbin, et autres
Publié: (2023)
par: Xiao, Junbin, et autres
Publié: (2023)
Harnessing Group-Oriented Consistency Constraints for Semi-Supervised Semantic Segmentation in CdZnTe Semiconductors
par: Li, Peihao, et autres
Publié: (2025)
par: Li, Peihao, et autres
Publié: (2025)
Compose Your Aesthetics: Empowering Text-to-Image Models with the Principles of Art
par: Jin, Zhe, et autres
Publié: (2025)
par: Jin, Zhe, et autres
Publié: (2025)
Region-Adaptive Transform with Segmentation Prior for Image Compression
par: Liu, Yuxi, et autres
Publié: (2024)
par: Liu, Yuxi, et autres
Publié: (2024)
FOCoOp: Enhancing Out-of-Distribution Robustness in Federated Prompt Learning for Vision-Language Models
par: Liao, Xinting, et autres
Publié: (2025)
par: Liao, Xinting, et autres
Publié: (2025)
Universal Scene Graph Generation
par: Wu, Shengqiong, et autres
Publié: (2025)
par: Wu, Shengqiong, et autres
Publié: (2025)
Visual and Semantic Prompt Collaboration for Generalized Zero-Shot Learning
par: Jiang, Huajie, et autres
Publié: (2025)
par: Jiang, Huajie, et autres
Publié: (2025)
Visual Adaptive Prompting for Compositional Zero-Shot Learning
par: Stein, Kyle, et autres
Publié: (2025)
par: Stein, Kyle, et autres
Publié: (2025)
Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval
par: Fang, Xiang, et autres
Publié: (2026)
par: Fang, Xiang, et autres
Publié: (2026)
Active Zero: Self-Evolving Vision-Language Models through Active Environment Exploration
par: He, Jinghan, et autres
Publié: (2026)
par: He, Jinghan, et autres
Publié: (2026)
PVLM: Parsing-Aware Vision Language Model with Dynamic Contrastive Learning for Zero-Shot Deepfake Attribution
par: Zhang, Yaning, et autres
Publié: (2025)
par: Zhang, Yaning, et autres
Publié: (2025)
Disentangling Masked Autoencoders for Unsupervised Domain Generalization
par: Zhang, An, et autres
Publié: (2024)
par: Zhang, An, et autres
Publié: (2024)
Understanding Long Videos via LLM-Powered Entity Relation Graphs
par: Chu, Meng, et autres
Publié: (2025)
par: Chu, Meng, et autres
Publié: (2025)
Learning Visual Proxy for Compositional Zero-Shot Learning
par: Zhang, Shiyu, et autres
Publié: (2025)
par: Zhang, Shiyu, et autres
Publié: (2025)
C2P-CLIP: Injecting Category Common Prompt in CLIP to Enhance Generalization in Deepfake Detection
par: Tan, Chuangchuang, et autres
Publié: (2024)
par: Tan, Chuangchuang, et autres
Publié: (2024)
Principled Multimodal Representation Learning
par: Liu, Xiaohao, et autres
Publié: (2025)
par: Liu, Xiaohao, et autres
Publié: (2025)
Diffuse, Attend, and Segment: Unsupervised Zero-Shot Segmentation using Stable Diffusion
par: Tian, Junjiao, et autres
Publié: (2023)
par: Tian, Junjiao, et autres
Publié: (2023)
Prompt to Restore, Restore to Prompt: Cyclic Prompting for Universal Adverse Weather Removal
par: Liao, Rongxin, et autres
Publié: (2025)
par: Liao, Rongxin, et autres
Publié: (2025)
Composed Image Retrieval with Text Feedback via Multi-grained Uncertainty Regularization
par: Chen, Yiyang, et autres
Publié: (2022)
par: Chen, Yiyang, et autres
Publié: (2022)
3D Magic Mirror: Clothing Reconstruction from a Single Image via a Causal Perspective
par: Zheng, Zhedong, et autres
Publié: (2022)
par: Zheng, Zhedong, et autres
Publié: (2022)
Fine-tuning Multimodal LLMs to Follow Zero-shot Demonstrative Instructions
par: Li, Juncheng, et autres
Publié: (2023)
par: Li, Juncheng, et autres
Publié: (2023)
PromptMoE: Generalizable Zero-Shot Anomaly Detection via Visually-Guided Prompt Mixtures
par: Shao, Yuheng, et autres
Publié: (2025)
par: Shao, Yuheng, et autres
Publié: (2025)
An LMM for Efficient Video Understanding via Reinforced Compression of Video Cubes
par: Qi, Ji, et autres
Publié: (2025)
par: Qi, Ji, et autres
Publié: (2025)
A Unified Reasoning Framework for Holistic Zero-Shot Video Anomaly Analysis
par: Lin, Dongheng, et autres
Publié: (2025)
par: Lin, Dongheng, et autres
Publié: (2025)
Enhancing Video-Language Representations with Structural Spatio-Temporal Alignment
par: Fei, Hao, et autres
Publié: (2024)
par: Fei, Hao, et autres
Publié: (2024)
Enhancing Zero-Shot Vision Models by Label-Free Prompt Distribution Learning and Bias Correcting
par: Zhu, Xingyu, et autres
Publié: (2024)
par: Zhu, Xingyu, et autres
Publié: (2024)
CoPS: Conditional Prompt Synthesis for Zero-Shot Anomaly Detection
par: Chen, Qiyu, et autres
Publié: (2025)
par: Chen, Qiyu, et autres
Publié: (2025)
Dynamic Multimodal Fusion via Meta-Learning Towards Micro-Video Recommendation
par: Liu, Han, et autres
Publié: (2025)
par: Liu, Han, et autres
Publié: (2025)
Dysen-VDM: Empowering Dynamics-aware Text-to-Video Diffusion with LLMs
par: Fei, Hao, et autres
Publié: (2023)
par: Fei, Hao, et autres
Publié: (2023)
UniFGVC: Universal Training-Free Few-Shot Fine-Grained Vision Classification via Attribute-Aware Multimodal Retrieval
par: Guo, Hongyu, et autres
Publié: (2025)
par: Guo, Hongyu, et autres
Publié: (2025)
Bayesian Prompt Flow Learning for Zero-Shot Anomaly Detection
par: Qu, Zhen, et autres
Publié: (2025)
par: Qu, Zhen, et autres
Publié: (2025)
Towards Natural Language-Guided Drones: GeoText-1652 Benchmark with Spatial Relation Matching
par: Chu, Meng, et autres
Publié: (2023)
par: Chu, Meng, et autres
Publié: (2023)
Multiple Information Prompt Learning for Cloth-Changing Person Re-Identification
par: Wei, Shengxun, et autres
Publié: (2024)
par: Wei, Shengxun, et autres
Publié: (2024)
SVIP: Semantically Contextualized Visual Patches for Zero-Shot Learning
par: Chen, Zhi, et autres
Publié: (2025)
par: Chen, Zhi, et autres
Publié: (2025)
Investigating Prompting Techniques for Zero- and Few-Shot Visual Question Answering
par: Awal, Rabiul, et autres
Publié: (2023)
par: Awal, Rabiul, et autres
Publié: (2023)
MMDocBench: Benchmarking Large Vision-Language Models for Fine-Grained Visual Document Understanding
par: Zhu, Fengbin, et autres
Publié: (2024)
par: Zhu, Fengbin, et autres
Publié: (2024)
FALIP: Visual Prompt as Foveal Attention Boosts CLIP Zero-Shot Performance
par: Zhuang, Jiedong, et autres
Publié: (2024)
par: Zhuang, Jiedong, et autres
Publié: (2024)
Documents similaires
-
PSVMA+: Exploring Multi-granularity Semantic-visual Adaption for Generalized Zero-shot Learning
par: Liu, Man, et autres
Publié: (2024) -
Zero-1-to-A: Zero-Shot One Image to Animatable Head Avatars Using Video Diffusion
par: Zhou, Zhenglin, et autres
Publié: (2025) -
Extending Visual Dynamics for Video-to-Music Generation
par: Liu, Xiaohao, et autres
Publié: (2025) -
Can I Trust Your Answer? Visually Grounded Video Question Answering
par: Xiao, Junbin, et autres
Publié: (2023) -
Harnessing Group-Oriented Consistency Constraints for Semi-Supervised Semantic Segmentation in CdZnTe Semiconductors
par: Li, Peihao, et autres
Publié: (2025)