Efficient Vision Language Model Fine-tuning for Text-based Person Anomaly Search
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | He, Jiayi, Tang, Shengeng, Liu, Ao, Cheng, Lechao, Wu, Jingjing, Wei, Yanyan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Sign-IDD: Iconicity Disentangled Diffusion for Sign Language Production
par: Tang, Shengeng, et autres
Publié: (2024)
par: Tang, Shengeng, et autres
Publié: (2024)
Beyond Walking: A Large-Scale Image-Text Benchmark for Text-based Person Anomaly Search
par: Yang, Shuyu, et autres
Publié: (2024)
par: Yang, Shuyu, et autres
Publié: (2024)
Linguistics-Vision Monotonic Consistent Network for Sign Language Production
par: Wang, Xu, et autres
Publié: (2024)
par: Wang, Xu, et autres
Publié: (2024)
Bridging the Pose-Semantic Gap: A Cascade Framework for Text-Based Person Anomaly Search
par: Xie, Zequn, et autres
Publié: (2026)
par: Xie, Zequn, et autres
Publié: (2026)
TextRefiner: Internal Visual Feature as Efficient Refiner for Vision-Language Models Prompt Tuning
par: Xie, Jingjing, et autres
Publié: (2024)
par: Xie, Jingjing, et autres
Publié: (2024)
ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
par: Zhang, Zhenxing, et autres
Publié: (2024)
par: Zhang, Zhenxing, et autres
Publié: (2024)
From Data Deluge to Data Curation: A Filtering-WoRA Paradigm for Efficient Text-based Person Search
par: Sun, Jintao, et autres
Publié: (2024)
par: Sun, Jintao, et autres
Publié: (2024)
Text-Driven Diffusion Model for Sign Language Production
par: He, Jiayi, et autres
Publié: (2025)
par: He, Jiayi, et autres
Publié: (2025)
Discrete to Continuous: Generating Smooth Transition Poses from Sign Language Observation
par: Tang, Shengeng, et autres
Publié: (2024)
par: Tang, Shengeng, et autres
Publié: (2024)
Not Just What's There: Enabling CLIP to Comprehend Negated Visual Descriptions Without Fine-tuning
par: Xiao, Junhao, et autres
Publié: (2026)
par: Xiao, Junhao, et autres
Publié: (2026)
DuoTeach: Dual Role Self-Teaching for Coarse-to-Fine Decision Coordination in Vision--Language Models
par: Yang, Wei, et autres
Publié: (2025)
par: Yang, Wei, et autres
Publié: (2025)
Patch-level Sounding Object Tracking for Audio-Visual Question Answering
par: Li, Zhangbin, et autres
Publié: (2024)
par: Li, Zhangbin, et autres
Publié: (2024)
Cross-modal Proxy Evolving for OOD Detection with Vision-Language Models
par: Tang, Hao, et autres
Publié: (2026)
par: Tang, Hao, et autres
Publié: (2026)
Multimodal Large Language Model is a Human-Aligned Annotator for Text-to-Image Generation
par: Wu, Xun, et autres
Publié: (2024)
par: Wu, Xun, et autres
Publié: (2024)
ROGLE: Robust Global-Local Alignment with Automated Region Supervision for Text-Based Person Search
par: Xie, Zequn, et autres
Publié: (2026)
par: Xie, Zequn, et autres
Publié: (2026)
Accelerating Controllable Generation via Hybrid-grained Cache
par: Liu, Lin, et autres
Publié: (2025)
par: Liu, Lin, et autres
Publié: (2025)
Fine-grained Image Retrieval via Dual-Vision Adaptation
par: Jiang, Xin, et autres
Publié: (2025)
par: Jiang, Xin, et autres
Publié: (2025)
MAO: Efficient Model-Agnostic Optimization of Prompt Tuning for Vision-Language Models
par: Li, Haoyang, et autres
Publié: (2025)
par: Li, Haoyang, et autres
Publié: (2025)
Deciphering Personalization: Towards Fine-Grained Explainability in Natural Language for Personalized Image Generation Models
par: Wang, Haoming, et autres
Publié: (2025)
par: Wang, Haoming, et autres
Publié: (2025)
PDA: Text-Augmented Defense Framework for Robust Vision-Language Models against Adversarial Image Attacks
par: Xu, Jingning, et autres
Publié: (2026)
par: Xu, Jingning, et autres
Publié: (2026)
EntroAD: Structural Entropy-Guided Prompt Adaptation for Zero-Shot Anomaly Detection
par: Zhao, Xinyu, et autres
Publié: (2026)
par: Zhao, Xinyu, et autres
Publié: (2026)
PixCLIP: Achieving Fine-grained Visual Language Understanding via Any-granularity Pixel-Text Alignment Learning
par: Xiao, Yicheng, et autres
Publié: (2025)
par: Xiao, Yicheng, et autres
Publié: (2025)
Vision-Language Models Learn Super Images for Efficient Partially Relevant Video Retrieval
par: Nishimura, Taichi, et autres
Publié: (2023)
par: Nishimura, Taichi, et autres
Publié: (2023)
CAMeL: Cross-modality Adaptive Meta-Learning for Text-based Person Retrieval
par: Yu, Hang, et autres
Publié: (2025)
par: Yu, Hang, et autres
Publié: (2025)
Logic Unseen: Revealing the Logical Blindspots of Vision-Language Models
par: Zhou, Yuchen, et autres
Publié: (2025)
par: Zhou, Yuchen, et autres
Publié: (2025)
Exploring Phrase-Level Grounding with Text-to-Image Diffusion Model
par: Yang, Danni, et autres
Publié: (2024)
par: Yang, Danni, et autres
Publié: (2024)
CalliReader: Contextualizing Chinese Calligraphy via an Embedding-Aligned Vision-Language Model
par: Luo, Yuxuan, et autres
Publié: (2025)
par: Luo, Yuxuan, et autres
Publié: (2025)
Text-Only Data Synthesis for Vision Language Model Training
par: Yu, Xiaomin, et autres
Publié: (2025)
par: Yu, Xiaomin, et autres
Publié: (2025)
Exploring the Distinctiveness and Fidelity of the Descriptions Generated by Large Vision-Language Models
par: Huang, Yuhang, et autres
Publié: (2024)
par: Huang, Yuhang, et autres
Publié: (2024)
HeGraphAdapter: Tuning Multi-Modal Vision-Language Models with Heterogeneous Graph Adapter
par: Zhao, Yumiao, et autres
Publié: (2024)
par: Zhao, Yumiao, et autres
Publié: (2024)
Segmentation-Based Attention Entropy: Detecting and Mitigating Object Hallucinations in Large Vision-Language Models
par: Song, Jiale, et autres
Publié: (2026)
par: Song, Jiale, et autres
Publié: (2026)
LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention
par: Zhang, Renrui, et autres
Publié: (2023)
par: Zhang, Renrui, et autres
Publié: (2023)
StableDub: Taming Diffusion Prior for Generalized and Efficient Visual Dubbing
par: Chen, Liyang, et autres
Publié: (2025)
par: Chen, Liyang, et autres
Publié: (2025)
Unveiling Encoder-Free Vision-Language Models
par: Diao, Haiwen, et autres
Publié: (2024)
par: Diao, Haiwen, et autres
Publié: (2024)
Noisy-Correspondence Learning for Text-to-Image Person Re-identification
par: Qin, Yang, et autres
Publié: (2023)
par: Qin, Yang, et autres
Publié: (2023)
VAAS: Vision-Attention Anomaly Scoring for Image Manipulation Detection in Digital Forensics
par: Bamigbade, Opeyemi, et autres
Publié: (2025)
par: Bamigbade, Opeyemi, et autres
Publié: (2025)
Towards Robust and Generalizable Continuous Space-Time Video Super-Resolution with Events
par: Wei, Shuoyan, et autres
Publié: (2025)
par: Wei, Shuoyan, et autres
Publié: (2025)
MuLTI: Efficient Video-and-Language Understanding with Text-Guided MultiWay-Sampler and Multiple Choice Modeling
par: Xu, Jiaqi, et autres
Publié: (2023)
par: Xu, Jiaqi, et autres
Publié: (2023)
A Novel FACS-Aligned Anatomical Text Description Paradigm for Fine-Grained Facial Behavior Synthesis
par: Wang, Jiahe, et autres
Publié: (2026)
par: Wang, Jiahe, et autres
Publié: (2026)
StgcDiff: Spatial-Temporal Graph Condition Diffusion for Sign Language Transition Generation
par: He, Jiashu, et autres
Publié: (2025)
par: He, Jiashu, et autres
Publié: (2025)
Documents similaires
-
Sign-IDD: Iconicity Disentangled Diffusion for Sign Language Production
par: Tang, Shengeng, et autres
Publié: (2024) -
Beyond Walking: A Large-Scale Image-Text Benchmark for Text-based Person Anomaly Search
par: Yang, Shuyu, et autres
Publié: (2024) -
Linguistics-Vision Monotonic Consistent Network for Sign Language Production
par: Wang, Xu, et autres
Publié: (2024) -
Bridging the Pose-Semantic Gap: A Cascade Framework for Text-Based Person Anomaly Search
par: Xie, Zequn, et autres
Publié: (2026) -
TextRefiner: Internal Visual Feature as Efficient Refiner for Vision-Language Models Prompt Tuning
par: Xie, Jingjing, et autres
Publié: (2024)