Hierarchical Visual Prompt Learning for Continual Video Instance Segmentation
Fuente:
arXiv
Salvato in:
| Autori principali: | Dong, Jiahua, Yin, Hui, Liang, Wenqi, Zhao, Hanbin, Ding, Henghui, Sebe, Nicu, Khan, Salman, Khan, Fahad Shahbaz |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
How to Continually Adapt Text-to-Image Diffusion Models for Flexible Customization?
di: Dong, Jiahua, et al.
Pubblicazione: (2024)
di: Dong, Jiahua, et al.
Pubblicazione: (2024)
IAP: Improving Continual Learning of Vision-Language Models via Instance-Aware Prompting
di: Fu, Hao, et al.
Pubblicazione: (2025)
di: Fu, Hao, et al.
Pubblicazione: (2025)
Bring Your Dreams to Life: Continual Text-to-Video Customization
di: Dong, Jiahua, et al.
Pubblicazione: (2025)
di: Dong, Jiahua, et al.
Pubblicazione: (2025)
VideoGLaMM: A Large Multimodal Model for Pixel-Level Visual Grounding in Videos
di: Munasinghe, Shehan, et al.
Pubblicazione: (2024)
di: Munasinghe, Shehan, et al.
Pubblicazione: (2024)
Dual Hyperspectral Mamba for Efficient Spectral Compressive Imaging
di: Dong, Jiahua, et al.
Pubblicazione: (2024)
di: Dong, Jiahua, et al.
Pubblicazione: (2024)
Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models
di: Maaz, Muhammad, et al.
Pubblicazione: (2023)
di: Maaz, Muhammad, et al.
Pubblicazione: (2023)
Language Guided Domain Generalized Medical Image Segmentation
di: Kunhimon, Shahina, et al.
Pubblicazione: (2024)
di: Kunhimon, Shahina, et al.
Pubblicazione: (2024)
Video-R2: Reinforcing Consistent and Grounded Reasoning in Multimodal Language Models
di: Maaz, Muhammad, et al.
Pubblicazione: (2025)
di: Maaz, Muhammad, et al.
Pubblicazione: (2025)
Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model
di: Chen, Shiming, et al.
Pubblicazione: (2025)
di: Chen, Shiming, et al.
Pubblicazione: (2025)
PECTP: Parameter-Efficient Cross-Task Prompts for Incremental Vision Transformer
di: Feng, Qian, et al.
Pubblicazione: (2024)
di: Feng, Qian, et al.
Pubblicazione: (2024)
Cross-Modal Self-Training: Aligning Images and Pointclouds to Learn Classification without Labels
di: Dharmasiri, Amaya, et al.
Pubblicazione: (2024)
di: Dharmasiri, Amaya, et al.
Pubblicazione: (2024)
Hierarchical Text-to-Vision Self Supervised Alignment for Improved Histopathology Representation Learning
di: Watawana, Hasindri, et al.
Pubblicazione: (2024)
di: Watawana, Hasindri, et al.
Pubblicazione: (2024)
CE-SDWV: Effective and Efficient Concept Erasure for Text-to-Image Diffusion Models via a Semantic-Driven Word Vocabulary
di: Tu, Jiahang, et al.
Pubblicazione: (2025)
di: Tu, Jiahang, et al.
Pubblicazione: (2025)
Progressive Semantic-Guided Vision Transformer for Zero-Shot Learning
di: Chen, Shiming, et al.
Pubblicazione: (2024)
di: Chen, Shiming, et al.
Pubblicazione: (2024)
GenZSL: Generative Zero-Shot Learning Via Inductive Variational Autoencoder
di: Chen, Shiming, et al.
Pubblicazione: (2025)
di: Chen, Shiming, et al.
Pubblicazione: (2025)
VANE-Bench: Video Anomaly Evaluation Benchmark for Conversational LMMs
di: Bharadwaj, Rohit, et al.
Pubblicazione: (2024)
di: Bharadwaj, Rohit, et al.
Pubblicazione: (2024)
Efficient Video Object Segmentation via Modulated Cross-Attention Memory
di: Shaker, Abdelrahman, et al.
Pubblicazione: (2024)
di: Shaker, Abdelrahman, et al.
Pubblicazione: (2024)
Hierarchical Self-Supervised Adversarial Training for Robust Vision Models in Histopathology
di: Malik, Hashmat Shadab, et al.
Pubblicazione: (2025)
di: Malik, Hashmat Shadab, et al.
Pubblicazione: (2025)
Learnable Weight Initialization for Volumetric Medical Image Segmentation
di: Kunhimon, Shahina, et al.
Pubblicazione: (2023)
di: Kunhimon, Shahina, et al.
Pubblicazione: (2023)
VURF: A General-purpose Reasoning and Self-refinement Framework for Video Understanding
di: Mahmood, Ahmad, et al.
Pubblicazione: (2024)
di: Mahmood, Ahmad, et al.
Pubblicazione: (2024)
Towards Evaluating the Robustness of Visual State Space Models
di: Malik, Hashmat Shadab, et al.
Pubblicazione: (2024)
di: Malik, Hashmat Shadab, et al.
Pubblicazione: (2024)
Open-YOLO 3D: Towards Fast and Accurate Open-Vocabulary 3D Instance Segmentation
di: Boudjoghra, Mohamed El Amine, et al.
Pubblicazione: (2024)
di: Boudjoghra, Mohamed El Amine, et al.
Pubblicazione: (2024)
CRISP: Contrastive Residual Injection and Semantic Prompting for Continual Video Instance Segmentation
di: Liu, Baichen, et al.
Pubblicazione: (2025)
di: Liu, Baichen, et al.
Pubblicazione: (2025)
Vocabulary-free Fine-grained Visual Recognition via Enriched Contextually Grounded Vision-Language Model
di: Demidov, Dmitry, et al.
Pubblicazione: (2025)
di: Demidov, Dmitry, et al.
Pubblicazione: (2025)
BAPLe: Backdoor Attacks on Medical Foundational Models using Prompt Learning
di: Hanif, Asif, et al.
Pubblicazione: (2024)
di: Hanif, Asif, et al.
Pubblicazione: (2024)
Mobile-VideoGPT: Fast and Accurate Model for Mobile Video Understanding
di: Shaker, Abdelrahman, et al.
Pubblicazione: (2025)
di: Shaker, Abdelrahman, et al.
Pubblicazione: (2025)
Video-GroundingDINO: Towards Open-Vocabulary Spatio-Temporal Video Grounding
di: Wasim, Syed Talal, et al.
Pubblicazione: (2023)
di: Wasim, Syed Talal, et al.
Pubblicazione: (2023)
GroupMamba: Efficient Group-Based Visual State Space Model
di: Shaker, Abdelrahman, et al.
Pubblicazione: (2024)
di: Shaker, Abdelrahman, et al.
Pubblicazione: (2024)
AURORA:Augmented Understanding via Structured Reasoning and Reinforcement Learning for Reference Audio-Visual Segmentation
di: Luo, Ziyang, et al.
Pubblicazione: (2025)
di: Luo, Ziyang, et al.
Pubblicazione: (2025)
Decoupling Static and Hierarchical Motion Perception for Referring Video Segmentation
di: He, Shuting, et al.
Pubblicazione: (2024)
di: He, Shuting, et al.
Pubblicazione: (2024)
Video-CoM: Interactive Video Reasoning via Chain of Manipulations
di: Rasheed, Hanoona, et al.
Pubblicazione: (2025)
di: Rasheed, Hanoona, et al.
Pubblicazione: (2025)
TAViS: Text-bridged Audio-Visual Segmentation with Foundation Models
di: Luo, Ziyang, et al.
Pubblicazione: (2025)
di: Luo, Ziyang, et al.
Pubblicazione: (2025)
WorldCache: Content-Aware Caching for Accelerated Video World Models
di: Nawaz, Umair, et al.
Pubblicazione: (2026)
di: Nawaz, Umair, et al.
Pubblicazione: (2026)
FasterVAR: Plug-and-Play Acceleration for Visual Autoregressive Models
di: Li, Senmao, et al.
Pubblicazione: (2025)
di: Li, Senmao, et al.
Pubblicazione: (2025)
Enhancing Novel Object Detection via Cooperative Foundational Models
di: Bharadwaj, Rohit, et al.
Pubblicazione: (2023)
di: Bharadwaj, Rohit, et al.
Pubblicazione: (2023)
VideoGPT+: Integrating Image and Video Encoders for Enhanced Video Understanding
di: Maaz, Muhammad, et al.
Pubblicazione: (2024)
di: Maaz, Muhammad, et al.
Pubblicazione: (2024)
Align Your Prompts: Test-Time Prompting with Distribution Alignment for Zero-Shot Generalization
di: Hassan, Jameel, et al.
Pubblicazione: (2023)
di: Hassan, Jameel, et al.
Pubblicazione: (2023)
MedContext: Learning Contextual Cues for Efficient Volumetric Medical Segmentation
di: Gani, Hanan, et al.
Pubblicazione: (2024)
di: Gani, Hanan, et al.
Pubblicazione: (2024)
UNETR++: Delving into Efficient and Accurate 3D Medical Image Segmentation
di: Shaker, Abdelrahman, et al.
Pubblicazione: (2022)
di: Shaker, Abdelrahman, et al.
Pubblicazione: (2022)
LW2G: Learning Whether to Grow for Prompt-based Continual Learning
di: Feng, Qian, et al.
Pubblicazione: (2024)
di: Feng, Qian, et al.
Pubblicazione: (2024)
Documenti analoghi
-
How to Continually Adapt Text-to-Image Diffusion Models for Flexible Customization?
di: Dong, Jiahua, et al.
Pubblicazione: (2024) -
IAP: Improving Continual Learning of Vision-Language Models via Instance-Aware Prompting
di: Fu, Hao, et al.
Pubblicazione: (2025) -
Bring Your Dreams to Life: Continual Text-to-Video Customization
di: Dong, Jiahua, et al.
Pubblicazione: (2025) -
VideoGLaMM: A Large Multimodal Model for Pixel-Level Visual Grounding in Videos
di: Munasinghe, Shehan, et al.
Pubblicazione: (2024) -
Dual Hyperspectral Mamba for Efficient Spectral Compressive Imaging
di: Dong, Jiahua, et al.
Pubblicazione: (2024)