Visual-Augmented Dynamic Semantic Prototype for Generative Zero-Shot Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hou, Wenjin, Chen, Shiming, Chen, Shuhuang, Hong, Ziming, Wang, Yan, Feng, Xuetao, Khan, Salman, Khan, Fahad Shahbaz, You, Xinge |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Discriminative Image Generation with Diffusion Models for Zero-Shot Learning
par: Fu, Dingjie, et autres
Publié: (2024)
par: Fu, Dingjie, et autres
Publié: (2024)
Progressive Semantic-Guided Vision Transformer for Zero-Shot Learning
par: Chen, Shiming, et autres
Publié: (2024)
par: Chen, Shiming, et autres
Publié: (2024)
Mutually Causal Semantic Distillation Network for Zero-Shot Learning
par: Chen, Shiming, et autres
Publié: (2026)
par: Chen, Shiming, et autres
Publié: (2026)
GenZSL: Generative Zero-Shot Learning Via Inductive Variational Autoencoder
par: Chen, Shiming, et autres
Publié: (2025)
par: Chen, Shiming, et autres
Publié: (2025)
Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model
par: Chen, Shiming, et autres
Publié: (2025)
par: Chen, Shiming, et autres
Publié: (2025)
Prototype-Guided Curriculum Learning for Zero-Shot Learning
par: Wang, Lei, et autres
Publié: (2025)
par: Wang, Lei, et autres
Publié: (2025)
Detail Reinforcement Diffusion Model: Augmentation Fine-Grained Visual Categorization in Few-Shot Conditions
par: Wu, Tianxu, et autres
Publié: (2023)
par: Wu, Tianxu, et autres
Publié: (2023)
ZeroMamba: Exploring Visual State Space Model for Zero-Shot Learning
par: Hou, Wenjin, et autres
Publié: (2024)
par: Hou, Wenjin, et autres
Publié: (2024)
Align Your Prompts: Test-Time Prompting with Distribution Alignment for Zero-Shot Generalization
par: Hassan, Jameel, et autres
Publié: (2023)
par: Hassan, Jameel, et autres
Publié: (2023)
Concept Drift and Long-Tailed Distribution in Fine-Grained Visual Categorization: Benchmark and Method
par: Ye, Shuo, et autres
Publié: (2023)
par: Ye, Shuo, et autres
Publié: (2023)
Language Guided Domain Generalized Medical Image Segmentation
par: Kunhimon, Shahina, et autres
Publié: (2024)
par: Kunhimon, Shahina, et autres
Publié: (2024)
Cross-Modal Self-Training: Aligning Images and Pointclouds to Learn Classification without Labels
par: Dharmasiri, Amaya, et autres
Publié: (2024)
par: Dharmasiri, Amaya, et autres
Publié: (2024)
Efficient Localized Adaptation of Neural Weather Forecasting: A Case Study in the MENA Region
par: Munir, Muhammad Akhtar, et autres
Publié: (2024)
par: Munir, Muhammad Akhtar, et autres
Publié: (2024)
Towards Evaluating the Robustness of Visual State Space Models
par: Malik, Hashmat Shadab, et autres
Publié: (2024)
par: Malik, Hashmat Shadab, et autres
Publié: (2024)
Semantically Guided Dynamic Visual Prototype Refinement for Compositional Zero-Shot Learning
par: Peng, Zhong, et autres
Publié: (2025)
par: Peng, Zhong, et autres
Publié: (2025)
Vocabulary-free Fine-grained Visual Recognition via Enriched Contextually Grounded Vision-Language Model
par: Demidov, Dmitry, et autres
Publié: (2025)
par: Demidov, Dmitry, et autres
Publié: (2025)
AURORA:Augmented Understanding via Structured Reasoning and Reinforcement Learning for Reference Audio-Visual Segmentation
par: Luo, Ziyang, et autres
Publié: (2025)
par: Luo, Ziyang, et autres
Publié: (2025)
Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models
par: Maaz, Muhammad, et autres
Publié: (2023)
par: Maaz, Muhammad, et autres
Publié: (2023)
Video-R2: Reinforcing Consistent and Grounded Reasoning in Multimodal Language Models
par: Maaz, Muhammad, et autres
Publié: (2025)
par: Maaz, Muhammad, et autres
Publié: (2025)
Enhancing Novel Object Detection via Cooperative Foundational Models
par: Bharadwaj, Rohit, et autres
Publié: (2023)
par: Bharadwaj, Rohit, et autres
Publié: (2023)
GroupMamba: Efficient Group-Based Visual State Space Model
par: Shaker, Abdelrahman, et autres
Publié: (2024)
par: Shaker, Abdelrahman, et autres
Publié: (2024)
VURF: A General-purpose Reasoning and Self-refinement Framework for Video Understanding
par: Mahmood, Ahmad, et autres
Publié: (2024)
par: Mahmood, Ahmad, et autres
Publié: (2024)
Incentivizing Generative Zero-Shot Learning via Outcome-Reward Reinforcement Learning with Visual Cues
par: Hou, Wenjin, et autres
Publié: (2026)
par: Hou, Wenjin, et autres
Publié: (2026)
FasterVAR: Plug-and-Play Acceleration for Visual Autoregressive Models
par: Li, Senmao, et autres
Publié: (2025)
par: Li, Senmao, et autres
Publié: (2025)
Visual-Semantic Graph Matching Net for Zero-Shot Learning
par: Duan, Bowen, et autres
Publié: (2024)
par: Duan, Bowen, et autres
Publié: (2024)
Hierarchical Visual Prompt Learning for Continual Video Instance Segmentation
par: Dong, Jiahua, et autres
Publié: (2025)
par: Dong, Jiahua, et autres
Publié: (2025)
Learnable Weight Initialization for Volumetric Medical Image Segmentation
par: Kunhimon, Shahina, et autres
Publié: (2023)
par: Kunhimon, Shahina, et autres
Publié: (2023)
VANE-Bench: Video Anomaly Evaluation Benchmark for Conversational LMMs
par: Bharadwaj, Rohit, et autres
Publié: (2024)
par: Bharadwaj, Rohit, et autres
Publié: (2024)
ELGC-Net: Efficient Local-Global Context Aggregation for Remote Sensing Change Detection
par: Noman, Mubashir, et autres
Publié: (2024)
par: Noman, Mubashir, et autres
Publié: (2024)
Paper Circle: An Open-source Multi-agent Research Discovery and Analysis Framework
par: Kumar, Komal, et autres
Publié: (2026)
par: Kumar, Komal, et autres
Publié: (2026)
Hierarchical Text-to-Vision Self Supervised Alignment for Improved Histopathology Representation Learning
par: Watawana, Hasindri, et autres
Publié: (2024)
par: Watawana, Hasindri, et autres
Publié: (2024)
GCA Framework: A GCC Countries-Grounded Dataset and Agentic Pipeline for Climate Decision Support
par: Sheikh, Muhammad Umer, et autres
Publié: (2026)
par: Sheikh, Muhammad Umer, et autres
Publié: (2026)
WorldCache: Content-Aware Caching for Accelerated Video World Models
par: Nawaz, Umair, et autres
Publié: (2026)
par: Nawaz, Umair, et autres
Publié: (2026)
Connecting Dreams with Visual Brainstorming Instruction
par: Sun, Yasheng, et autres
Publié: (2024)
par: Sun, Yasheng, et autres
Publié: (2024)
VideoGLaMM: A Large Multimodal Model for Pixel-Level Visual Grounding in Videos
par: Munasinghe, Shehan, et autres
Publié: (2024)
par: Munasinghe, Shehan, et autres
Publié: (2024)
UniMed-CLIP: Towards a Unified Image-Text Pretraining Paradigm for Diverse Medical Imaging Modalities
par: Khattak, Muhammad Uzair, et autres
Publié: (2024)
par: Khattak, Muhammad Uzair, et autres
Publié: (2024)
ObjectCompose: Evaluating Resilience of Vision-Based Models on Object-to-Background Compositional Changes
par: Malik, Hashmat Shadab, et autres
Publié: (2024)
par: Malik, Hashmat Shadab, et autres
Publié: (2024)
RainDiff: End-to-end Precipitation Nowcasting Via Token-wise Attention Diffusion
par: Nguyen, Thao, et autres
Publié: (2025)
par: Nguyen, Thao, et autres
Publié: (2025)
Hierarchical Self-Supervised Adversarial Training for Robust Vision Models in Histopathology
par: Malik, Hashmat Shadab, et autres
Publié: (2025)
par: Malik, Hashmat Shadab, et autres
Publié: (2025)
CLIP-Decoder : ZeroShot Multilabel Classification using Multimodal CLIP Aligned Representation
par: Ali, Muhammad, et autres
Publié: (2024)
par: Ali, Muhammad, et autres
Publié: (2024)
Documents similaires
-
Discriminative Image Generation with Diffusion Models for Zero-Shot Learning
par: Fu, Dingjie, et autres
Publié: (2024) -
Progressive Semantic-Guided Vision Transformer for Zero-Shot Learning
par: Chen, Shiming, et autres
Publié: (2024) -
Mutually Causal Semantic Distillation Network for Zero-Shot Learning
par: Chen, Shiming, et autres
Publié: (2026) -
GenZSL: Generative Zero-Shot Learning Via Inductive Variational Autoencoder
par: Chen, Shiming, et autres
Publié: (2025) -
Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model
par: Chen, Shiming, et autres
Publié: (2025)