LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching
Fuente:
arXiv
Saved in:
| Main Authors: | Tian, Mengxiao, Wu, Xinxiao, Yang, Shuo |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
End-to-end Open-vocabulary Video Visual Relationship Detection using Multi-modal Prompting
by: Wang, Yongqi, et al.
Published: (2024)
by: Wang, Yongqi, et al.
Published: (2024)
Data-free Multi-label Image Recognition via LLM-powered Prompt Tuning
by: Yang, Shuo, et al.
Published: (2024)
by: Yang, Shuo, et al.
Published: (2024)
LLM-powered Query Expansion for Enhancing Boundary Prediction in Language-driven Action Localization
by: Shang, Zirui, et al.
Published: (2025)
by: Shang, Zirui, et al.
Published: (2025)
METOR: A Unified Framework for Mutual Enhancement of Objects and Relationships in Open-vocabulary Video Visual Relationship Detection
by: Wang, Yongqi, et al.
Published: (2025)
by: Wang, Yongqi, et al.
Published: (2025)
DMPT: Decoupled Modality-aware Prompt Tuning for Multi-modal Object Re-identification
by: Lin, Minghui, et al.
Published: (2025)
by: Lin, Minghui, et al.
Published: (2025)
Progressive Multi-modal Conditional Prompt Tuning
by: Qiu, Xiaoyu, et al.
Published: (2024)
by: Qiu, Xiaoyu, et al.
Published: (2024)
PromptSafe: Gated Prompt Tuning for Safe Text-to-Image Generation
by: Jing, Zonglei, et al.
Published: (2025)
by: Jing, Zonglei, et al.
Published: (2025)
Video Summarization using Denoising Diffusion Probabilistic Model
by: Shang, Zirui, et al.
Published: (2024)
by: Shang, Zirui, et al.
Published: (2024)
View-aware Cross-modal Distillation for Multi-view Action Recognition
by: Nguyen, Trung Thanh, et al.
Published: (2025)
by: Nguyen, Trung Thanh, et al.
Published: (2025)
DAMA: Data- and Model-aware Alignment of Multi-modal LLMs
by: Lu, Jinda, et al.
Published: (2025)
by: Lu, Jinda, et al.
Published: (2025)
Self-Prompting Diffusion Transformer for Open-Vocabulary Scene Text Editing via In-Context Learning
by: Li, Hongxi, et al.
Published: (2026)
by: Li, Hongxi, et al.
Published: (2026)
Storyboard guided Alignment for Fine-grained Video Action Recognition
by: Liu, Enqi, et al.
Published: (2024)
by: Liu, Enqi, et al.
Published: (2024)
TAI++: Text as Image for Multi-Label Image Classification by Co-Learning Transferable Prompt
by: Wu, Xiangyu, et al.
Published: (2024)
by: Wu, Xiangyu, et al.
Published: (2024)
Multi-modal Attribute Prompting for Vision-Language Models
by: Liu, Xin, et al.
Published: (2024)
by: Liu, Xin, et al.
Published: (2024)
Text as Any-Modality for Zero-Shot Classification by Consistent Prompt Tuning
by: Wu, Xiangyu, et al.
Published: (2025)
by: Wu, Xiangyu, et al.
Published: (2025)
TALENT: Target-aware Efficient Tuning for Referring Image Segmentation
by: Jin, Shuo, et al.
Published: (2026)
by: Jin, Shuo, et al.
Published: (2026)
SAM2Grasp: Resolve Multi-modal Grasping via Prompt-conditioned Temporal Action Prediction
by: Wu, Shengkai, et al.
Published: (2025)
by: Wu, Shengkai, et al.
Published: (2025)
Prompt-Softbox-Prompt: A Free-Text Embedding Control for Image Editing
by: Yang, Yitong, et al.
Published: (2024)
by: Yang, Yitong, et al.
Published: (2024)
3D-aware Image Generation and Editing with Multi-modal Conditions
by: Li, Bo, et al.
Published: (2024)
by: Li, Bo, et al.
Published: (2024)
Cross-modal Context-aware Learning for Visual Prompt Guided Multimodal Image Understanding in Remote Sensing
by: Zhang, Xu, et al.
Published: (2025)
by: Zhang, Xu, et al.
Published: (2025)
STPNet: Scale-aware Text Prompt Network for Medical Image Segmentation
by: Shan, Dandan, et al.
Published: (2025)
by: Shan, Dandan, et al.
Published: (2025)
Ambiguity-aware Truncated Flow Matching for Ambiguous Medical Image Segmentation
by: Li, Fanding, et al.
Published: (2025)
by: Li, Fanding, et al.
Published: (2025)
Monkey: Image Resolution and Text Label Are Important Things for Large Multi-modal Models
by: Li, Zhang, et al.
Published: (2023)
by: Li, Zhang, et al.
Published: (2023)
EIMC: Efficient Instance-aware Multi-modal Collaborative Perception
by: Yang, Kang, et al.
Published: (2026)
by: Yang, Kang, et al.
Published: (2026)
Why Only Text: Empowering Vision-and-Language Navigation with Multi-modal Prompts
by: Hong, Haodong, et al.
Published: (2024)
by: Hong, Haodong, et al.
Published: (2024)
DGL: Dynamic Global-Local Prompt Tuning for Text-Video Retrieval
by: Yang, Xiangpeng, et al.
Published: (2024)
by: Yang, Xiangpeng, et al.
Published: (2024)
Vision-aware Multimodal Prompt Tuning for Uploadable Multi-source Few-shot Domain Adaptation
by: Liu, Kuanghong, et al.
Published: (2025)
by: Liu, Kuanghong, et al.
Published: (2025)
Correlative and Discriminative Label Grouping for Multi-Label Visual Prompt Tuning
by: Ma, LeiLei, et al.
Published: (2025)
by: Ma, LeiLei, et al.
Published: (2025)
Multi-modal Reference Learning for Fine-grained Text-to-Image Retrieval
by: Ma, Zehong, et al.
Published: (2025)
by: Ma, Zehong, et al.
Published: (2025)
Visual Instance-aware Prompt Tuning
by: Xiao, Xi, et al.
Published: (2025)
by: Xiao, Xi, et al.
Published: (2025)
Craft: Cross-modal Aligned Features Improve Robustness of Prompt Tuning
by: Sun, Jingchen, et al.
Published: (2024)
by: Sun, Jingchen, et al.
Published: (2024)
Cross-modal Prompting for Balanced Incomplete Multi-modal Emotion Recognition
by: He, Wen-Jue, et al.
Published: (2025)
by: He, Wen-Jue, et al.
Published: (2025)
Hire: Hybrid-modal Interaction with Multiple Relational Enhancements for Image-Text Matching
by: Ge, Xuri, et al.
Published: (2024)
by: Ge, Xuri, et al.
Published: (2024)
LLM Blueprint: Enabling Text-to-Image Generation with Complex and Detailed Prompts
by: Gani, Hanan, et al.
Published: (2023)
by: Gani, Hanan, et al.
Published: (2023)
X-Prompt: Multi-modal Visual Prompt for Video Object Segmentation
by: Guo, Pinxue, et al.
Published: (2024)
by: Guo, Pinxue, et al.
Published: (2024)
OTTER: Open-Tagging via Text-Image Representation for Multi-modal Understanding
by: Ouyang, Jieer, et al.
Published: (2025)
by: Ouyang, Jieer, et al.
Published: (2025)
DTVLT: A Multi-modal Diverse Text Benchmark for Visual Language Tracking Based on LLM
by: Li, Xuchen, et al.
Published: (2024)
by: Li, Xuchen, et al.
Published: (2024)
POET: Prompt Offset Tuning for Continual Human Action Adaptation
by: Garg, Prachi, et al.
Published: (2025)
by: Garg, Prachi, et al.
Published: (2025)
DialogGen: Multi-modal Interactive Dialogue System for Multi-turn Text-to-Image Generation
by: Huang, Minbin, et al.
Published: (2024)
by: Huang, Minbin, et al.
Published: (2024)
AutoPrompt: Automated Red-Teaming of Text-to-Image Models via LLM-Driven Adversarial Prompts
by: Liu, Yufan, et al.
Published: (2025)
by: Liu, Yufan, et al.
Published: (2025)
Similar Items
-
End-to-end Open-vocabulary Video Visual Relationship Detection using Multi-modal Prompting
by: Wang, Yongqi, et al.
Published: (2024) -
Data-free Multi-label Image Recognition via LLM-powered Prompt Tuning
by: Yang, Shuo, et al.
Published: (2024) -
LLM-powered Query Expansion for Enhancing Boundary Prediction in Language-driven Action Localization
by: Shang, Zirui, et al.
Published: (2025) -
METOR: A Unified Framework for Mutual Enhancement of Objects and Relationships in Open-vocabulary Video Visual Relationship Detection
by: Wang, Yongqi, et al.
Published: (2025) -
DMPT: Decoupled Modality-aware Prompt Tuning for Multi-modal Object Re-identification
by: Lin, Minghui, et al.
Published: (2025)