Data-free Multi-label Image Recognition via LLM-powered Prompt Tuning
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Shuo, Shang, Zirui, Wang, Yongqi, Deng, Derong, Chen, Hongwei, Cheng, Qiyuan, Wu, Xinxiao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LLM-powered Query Expansion for Enhancing Boundary Prediction in Language-driven Action Localization
por: Shang, Zirui, et al.
Publicado: (2025)
por: Shang, Zirui, et al.
Publicado: (2025)
LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching
por: Tian, Mengxiao, et al.
Publicado: (2025)
por: Tian, Mengxiao, et al.
Publicado: (2025)
End-to-end Open-vocabulary Video Visual Relationship Detection using Multi-modal Prompting
por: Wang, Yongqi, et al.
Publicado: (2024)
por: Wang, Yongqi, et al.
Publicado: (2024)
METOR: A Unified Framework for Mutual Enhancement of Objects and Relationships in Open-vocabulary Video Visual Relationship Detection
por: Wang, Yongqi, et al.
Publicado: (2025)
por: Wang, Yongqi, et al.
Publicado: (2025)
Video Summarization using Denoising Diffusion Probabilistic Model
por: Shang, Zirui, et al.
Publicado: (2024)
por: Shang, Zirui, et al.
Publicado: (2024)
Curriculum Point Prompting for Weakly-Supervised Referring Image Segmentation
por: Dai, Qiyuan, et al.
Publicado: (2024)
por: Dai, Qiyuan, et al.
Publicado: (2024)
Information Bottleneck-based Causal Attention for Multi-label Medical Image Recognition
por: Cui, Xiaoxiao, et al.
Publicado: (2025)
por: Cui, Xiaoxiao, et al.
Publicado: (2025)
Storyboard guided Alignment for Fine-grained Video Action Recognition
por: Liu, Enqi, et al.
Publicado: (2024)
por: Liu, Enqi, et al.
Publicado: (2024)
PRO-VPT: Distribution-Adaptive Visual Prompt Tuning via Prompt Relocation
por: Shang, Chikai, et al.
Publicado: (2025)
por: Shang, Chikai, et al.
Publicado: (2025)
Self-Prompting Diffusion Transformer for Open-Vocabulary Scene Text Editing via In-Context Learning
por: Li, Hongxi, et al.
Publicado: (2026)
por: Li, Hongxi, et al.
Publicado: (2026)
Pedestrian Attribute Recognition as Label-balanced Multi-label Learning
por: Zhou, Yibo, et al.
Publicado: (2024)
por: Zhou, Yibo, et al.
Publicado: (2024)
Domain Adaptation for Multi-label Image Classification: a Discriminator-free Approach
por: Singh, Inder Pal, et al.
Publicado: (2025)
por: Singh, Inder Pal, et al.
Publicado: (2025)
Efficient Multi-turn RL for GUI Agents via Decoupled Training and Adaptive Data Curation
por: Li, Pengxiang, et al.
Publicado: (2025)
por: Li, Pengxiang, et al.
Publicado: (2025)
Heterogeneous Semantic Transfer for Multi-label Recognition with Partial Labels
por: Chen, Tianshui, et al.
Publicado: (2022)
por: Chen, Tianshui, et al.
Publicado: (2022)
Correlative and Discriminative Label Grouping for Multi-Label Visual Prompt Tuning
por: Ma, LeiLei, et al.
Publicado: (2025)
por: Ma, LeiLei, et al.
Publicado: (2025)
FreeInpaint: Tuning-free Prompt Alignment and Visual Rationality Enhancement in Image Inpainting
por: Gong, Chao, et al.
Publicado: (2025)
por: Gong, Chao, et al.
Publicado: (2025)
TongUI: Internet-Scale Trajectories from Multimodal Web Tutorials for Generalized GUI Agents
por: Zhang, Bofei, et al.
Publicado: (2025)
por: Zhang, Bofei, et al.
Publicado: (2025)
VUDG: A Dataset for Video Understanding Domain Generalization
por: Wang, Ziyi, et al.
Publicado: (2025)
por: Wang, Ziyi, et al.
Publicado: (2025)
Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning
por: Feng, Chun-Mei, et al.
Publicado: (2025)
por: Feng, Chun-Mei, et al.
Publicado: (2025)
Differentiable Room Acoustic Rendering with Multi-View Vision Priors
por: Jin, Derong, et al.
Publicado: (2025)
por: Jin, Derong, et al.
Publicado: (2025)
PromptSafe: Gated Prompt Tuning for Safe Text-to-Image Generation
por: Jing, Zonglei, et al.
Publicado: (2025)
por: Jing, Zonglei, et al.
Publicado: (2025)
Multi-label Cluster Discrimination for Visual Representation Learning
por: An, Xiang, et al.
Publicado: (2024)
por: An, Xiang, et al.
Publicado: (2024)
Action Selection Learning for Multi-label Multi-view Action Recognition
por: Nguyen, Trung Thanh, et al.
Publicado: (2024)
por: Nguyen, Trung Thanh, et al.
Publicado: (2024)
HiPrompt: Tuning-free Higher-Resolution Generation with Hierarchical MLLM Prompts
por: Liu, Xinyu, et al.
Publicado: (2024)
por: Liu, Xinyu, et al.
Publicado: (2024)
Adaptive Physical-Facial Representation Fusion via Subject-Invariant Cross-Modal Prompt Tuning for Video-Based Emotion Recognition
por: Luo, Xiwen, et al.
Publicado: (2026)
por: Luo, Xiwen, et al.
Publicado: (2026)
Multi-rater Prompting for Ambiguous Medical Image Segmentation
por: Wang, Jinhong, et al.
Publicado: (2024)
por: Wang, Jinhong, et al.
Publicado: (2024)
MetaWriter: Personalized Handwritten Text Recognition Using Meta-Learned Prompt Tuning
por: Gu, Wenhao, et al.
Publicado: (2025)
por: Gu, Wenhao, et al.
Publicado: (2025)
Prompt-aligned Gradient for Prompt Tuning
por: Zhu, Beier, et al.
Publicado: (2022)
por: Zhu, Beier, et al.
Publicado: (2022)
Knowledge-Guided Prompt Learning for Deepfake Facial Image Detection
por: Wang, Hao, et al.
Publicado: (2025)
por: Wang, Hao, et al.
Publicado: (2025)
LMPT: Prompt Tuning with Class-Specific Embedding Loss for Long-tailed Multi-Label Visual Recognition
por: Xia, Peng, et al.
Publicado: (2023)
por: Xia, Peng, et al.
Publicado: (2023)
PanAdapter: Two-Stage Fine-Tuning with Spatial-Spectral Priors Injecting for Pansharpening
por: Wu, RuoCheng, et al.
Publicado: (2024)
por: Wu, RuoCheng, et al.
Publicado: (2024)
Rethinking Rainy 3D Scene Reconstruction via Perspective Transforming and Brightness Tuning
por: Yang, Qianfeng, et al.
Publicado: (2025)
por: Yang, Qianfeng, et al.
Publicado: (2025)
Visual Fourier Prompt Tuning
por: Zeng, Runjia, et al.
Publicado: (2024)
por: Zeng, Runjia, et al.
Publicado: (2024)
TAI++: Text as Image for Multi-Label Image Classification by Co-Learning Transferable Prompt
por: Wu, Xiangyu, et al.
Publicado: (2024)
por: Wu, Xiangyu, et al.
Publicado: (2024)
Improving Visual Prompt Tuning by Gaussian Neighborhood Minimization for Long-Tailed Visual Recognition
por: Li, Mengke, et al.
Publicado: (2024)
por: Li, Mengke, et al.
Publicado: (2024)
MSCPT: Few-shot Whole Slide Image Classification with Multi-scale and Context-focused Prompt Tuning
por: Han, Minghao, et al.
Publicado: (2024)
por: Han, Minghao, et al.
Publicado: (2024)
SSPA: Split-and-Synthesize Prompting with Gated Alignments for Multi-Label Image Recognition
por: Tan, Hao, et al.
Publicado: (2024)
por: Tan, Hao, et al.
Publicado: (2024)
PromptDx: Differentiable Prompt Tuning for Multimodal In-Context Alzheimer's Diagnosis
por: Zhong, Lujia, et al.
Publicado: (2026)
por: Zhong, Lujia, et al.
Publicado: (2026)
Defending Multimodal Backdoored Models by Repulsive Visual Prompt Tuning
por: Zhang, Zhifang, et al.
Publicado: (2024)
por: Zhang, Zhifang, et al.
Publicado: (2024)
Pseudo-Prompt Generating in Pre-trained Vision-Language Models for Multi-Label Medical Image Classification
por: Ye, Yaoqin, et al.
Publicado: (2024)
por: Ye, Yaoqin, et al.
Publicado: (2024)
Ejemplares similares
-
LLM-powered Query Expansion for Enhancing Boundary Prediction in Language-driven Action Localization
por: Shang, Zirui, et al.
Publicado: (2025) -
LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching
por: Tian, Mengxiao, et al.
Publicado: (2025) -
End-to-end Open-vocabulary Video Visual Relationship Detection using Multi-modal Prompting
por: Wang, Yongqi, et al.
Publicado: (2024) -
METOR: A Unified Framework for Mutual Enhancement of Objects and Relationships in Open-vocabulary Video Visual Relationship Detection
por: Wang, Yongqi, et al.
Publicado: (2025) -
Video Summarization using Denoising Diffusion Probabilistic Model
por: Shang, Zirui, et al.
Publicado: (2024)