PSVMA+: Exploring Multi-granularity Semantic-visual Adaption for Generalized Zero-shot Learning
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Man, Bai, Huihui, Li, Feng, Zhang, Chunjie, Wei, Yunchao, Wang, Meng, Chua, Tat-Seng, Zhao, Yao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Attend and Enrich: Enhanced Visual Prompt for Zero-Shot Learning
por: Liu, Man, et al.
Publicado: (2024)
por: Liu, Man, et al.
Publicado: (2024)
Harnessing Group-Oriented Consistency Constraints for Semi-Supervised Semantic Segmentation in CdZnTe Semiconductors
por: Li, Peihao, et al.
Publicado: (2025)
por: Li, Peihao, et al.
Publicado: (2025)
Zero-1-to-A: Zero-Shot One Image to Animatable Head Avatars Using Video Diffusion
por: Zhou, Zhenglin, et al.
Publicado: (2025)
por: Zhou, Zhenglin, et al.
Publicado: (2025)
Fine-tuning Multimodal LLMs to Follow Zero-shot Demonstrative Instructions
por: Li, Juncheng, et al.
Publicado: (2023)
por: Li, Juncheng, et al.
Publicado: (2023)
Universal Scene Graph Generation
por: Wu, Shengqiong, et al.
Publicado: (2025)
por: Wu, Shengqiong, et al.
Publicado: (2025)
Understanding Long Videos via LLM-Powered Entity Relation Graphs
por: Chu, Meng, et al.
Publicado: (2025)
por: Chu, Meng, et al.
Publicado: (2025)
Compose Your Aesthetics: Empowering Text-to-Image Models with the Principles of Art
por: Jin, Zhe, et al.
Publicado: (2025)
por: Jin, Zhe, et al.
Publicado: (2025)
Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval
por: Fang, Xiang, et al.
Publicado: (2026)
por: Fang, Xiang, et al.
Publicado: (2026)
Region-Adaptive Transform with Segmentation Prior for Image Compression
por: Liu, Yuxi, et al.
Publicado: (2024)
por: Liu, Yuxi, et al.
Publicado: (2024)
Disentangling Masked Autoencoders for Unsupervised Domain Generalization
por: Zhang, An, et al.
Publicado: (2024)
por: Zhang, An, et al.
Publicado: (2024)
Composed Image Retrieval with Text Feedback via Multi-grained Uncertainty Regularization
por: Chen, Yiyang, et al.
Publicado: (2022)
por: Chen, Yiyang, et al.
Publicado: (2022)
Towards Natural Language-Guided Drones: GeoText-1652 Benchmark with Spatial Relation Matching
por: Chu, Meng, et al.
Publicado: (2023)
por: Chu, Meng, et al.
Publicado: (2023)
Extending Visual Dynamics for Video-to-Music Generation
por: Liu, Xiaohao, et al.
Publicado: (2025)
por: Liu, Xiaohao, et al.
Publicado: (2025)
Active Zero: Self-Evolving Vision-Language Models through Active Environment Exploration
por: He, Jinghan, et al.
Publicado: (2026)
por: He, Jinghan, et al.
Publicado: (2026)
Can I Trust Your Answer? Visually Grounded Video Question Answering
por: Xiao, Junbin, et al.
Publicado: (2023)
por: Xiao, Junbin, et al.
Publicado: (2023)
Bridge the Points: Graph-based Few-shot Segment Anything Semantically
por: Zhang, Anqi, et al.
Publicado: (2024)
por: Zhang, Anqi, et al.
Publicado: (2024)
IPSeg: Image Posterior Mitigates Semantic Drift in Class-Incremental Segmentation
por: Yu, Xiao, et al.
Publicado: (2025)
por: Yu, Xiao, et al.
Publicado: (2025)
VideoWorld: Exploring Knowledge Learning from Unlabeled Videos
por: Ren, Zhongwei, et al.
Publicado: (2025)
por: Ren, Zhongwei, et al.
Publicado: (2025)
Principled Multimodal Representation Learning
por: Liu, Xiaohao, et al.
Publicado: (2025)
por: Liu, Xiaohao, et al.
Publicado: (2025)
Enabling Generalized Zero-shot Learning Towards Unseen Domains by Intrinsic Learning from Redundant LLM Semantics
por: Yue, Jiaqi, et al.
Publicado: (2024)
por: Yue, Jiaqi, et al.
Publicado: (2024)
Audio-visual Generalized Zero-shot Learning the Easy Way
por: Mo, Shentong, et al.
Publicado: (2024)
por: Mo, Shentong, et al.
Publicado: (2024)
FlowOVD: Learning Generative Latent Flows for Zero-shot Open-vocabulary Detection
por: Wei, Yao, et al.
Publicado: (2026)
por: Wei, Yao, et al.
Publicado: (2026)
Towards Semantic Equivalence of Tokenization in Multimodal LLM
por: Wu, Shengqiong, et al.
Publicado: (2024)
por: Wu, Shengqiong, et al.
Publicado: (2024)
Instilling Multi-round Thinking to Text-guided Image Generation
por: Zeng, Lidong, et al.
Publicado: (2024)
por: Zeng, Lidong, et al.
Publicado: (2024)
Extremely Simple Out-of-distribution Detection for Audio-visual Generalized Zero-shot Learning
por: Liu, Yang, et al.
Publicado: (2025)
por: Liu, Yang, et al.
Publicado: (2025)
3D Magic Mirror: Clothing Reconstruction from a Single Image via a Causal Perspective
por: Zheng, Zhedong, et al.
Publicado: (2022)
por: Zheng, Zhedong, et al.
Publicado: (2022)
SAGE: Exploring the Boundaries of Unsafe Concept Domain with Semantic-Augment Erasing
por: Zhu, Hongguang, et al.
Publicado: (2025)
por: Zhu, Hongguang, et al.
Publicado: (2025)
An LMM for Efficient Video Understanding via Reinforced Compression of Video Cubes
por: Qi, Ji, et al.
Publicado: (2025)
por: Qi, Ji, et al.
Publicado: (2025)
Attribute Distribution Modeling and Semantic-Visual Alignment for Generative Zero-shot Learning
por: Pu, Haojie, et al.
Publicado: (2026)
por: Pu, Haojie, et al.
Publicado: (2026)
Prioritized Semantic Learning for Zero-shot Instance Navigation
por: Sun, Xinyu, et al.
Publicado: (2024)
por: Sun, Xinyu, et al.
Publicado: (2024)
Vitron: A Unified Pixel-level Vision LLM for Understanding, Generating, Segmenting, Editing
por: Fei, Hao, et al.
Publicado: (2024)
por: Fei, Hao, et al.
Publicado: (2024)
Bridged Semantic Alignment for Zero-shot 3D Medical Image Diagnosis
por: Lai, Haoran, et al.
Publicado: (2025)
por: Lai, Haoran, et al.
Publicado: (2025)
AIR: Zero-shot Generative Model Adaptation with Iterative Refinement
por: Liu, Guimeng, et al.
Publicado: (2025)
por: Liu, Guimeng, et al.
Publicado: (2025)
Dysen-VDM: Empowering Dynamics-aware Text-to-Video Diffusion with LLMs
por: Fei, Hao, et al.
Publicado: (2023)
por: Fei, Hao, et al.
Publicado: (2023)
Dynamic Multimodal Fusion via Meta-Learning Towards Micro-Video Recommendation
por: Liu, Han, et al.
Publicado: (2025)
por: Liu, Han, et al.
Publicado: (2025)
Frozen CLIP: A Strong Backbone for Weakly Supervised Semantic Segmentation
por: Zhang, Bingfeng, et al.
Publicado: (2024)
por: Zhang, Bingfeng, et al.
Publicado: (2024)
Towards Modality Generalization: A Benchmark and Prospective Analysis
por: Liu, Xiaohao, et al.
Publicado: (2024)
por: Liu, Xiaohao, et al.
Publicado: (2024)
Boosting Audio-visual Zero-shot Learning with Large Language Models
por: Chen, Haoxing, et al.
Publicado: (2023)
por: Chen, Haoxing, et al.
Publicado: (2023)
Generalizable Semantic Vision Query Generation for Zero-shot Panoptic and Semantic Segmentation
por: Chen, Jialei, et al.
Publicado: (2024)
por: Chen, Jialei, et al.
Publicado: (2024)
InstantID: Zero-shot Identity-Preserving Generation in Seconds
por: Wang, Qixun, et al.
Publicado: (2024)
por: Wang, Qixun, et al.
Publicado: (2024)
Ejemplares similares
-
Attend and Enrich: Enhanced Visual Prompt for Zero-Shot Learning
por: Liu, Man, et al.
Publicado: (2024) -
Harnessing Group-Oriented Consistency Constraints for Semi-Supervised Semantic Segmentation in CdZnTe Semiconductors
por: Li, Peihao, et al.
Publicado: (2025) -
Zero-1-to-A: Zero-Shot One Image to Animatable Head Avatars Using Video Diffusion
por: Zhou, Zhenglin, et al.
Publicado: (2025) -
Fine-tuning Multimodal LLMs to Follow Zero-shot Demonstrative Instructions
por: Li, Juncheng, et al.
Publicado: (2023) -
Universal Scene Graph Generation
por: Wu, Shengqiong, et al.
Publicado: (2025)