Training-Free Unsupervised Prompt for Vision-Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Long, Sifan, Wang, Linbin, Zhao, Zhen, Tan, Zichang, Wu, Yiming, Wang, Shengsheng, Wang, Jingdong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Perception Before Reasoning: Two-Stage Reinforcement Learning for Visual Reasoning in Vision-Language Models
por: Chen, Yan, et al.
Publicado: (2025)
por: Chen, Yan, et al.
Publicado: (2025)
SkySenseGPT: A Fine-Grained Instruction Tuning Dataset and Model for Remote Sensing Vision-Language Understanding
por: Luo, Junwei, et al.
Publicado: (2024)
por: Luo, Junwei, et al.
Publicado: (2024)
Efficient Prompt Tuning of Large Vision-Language Model for Fine-Grained Ship Classification
por: Lan, Long, et al.
Publicado: (2024)
por: Lan, Long, et al.
Publicado: (2024)
Adversarial Prompt Distillation for Vision-Language Models
por: Luo, Lin, et al.
Publicado: (2024)
por: Luo, Lin, et al.
Publicado: (2024)
Vocabulary-Free 3D Instance Segmentation with Vision and Language Assistant
por: Mei, Guofeng, et al.
Publicado: (2024)
por: Mei, Guofeng, et al.
Publicado: (2024)
Adversarial Prompt Tuning for Vision-Language Models
por: Zhang, Jiaming, et al.
Publicado: (2023)
por: Zhang, Jiaming, et al.
Publicado: (2023)
MODIX: A Training-Free Multimodal Information-Driven Positional Index Scaling for Vision-Language Models
por: Huang, Ruoxiang, et al.
Publicado: (2026)
por: Huang, Ruoxiang, et al.
Publicado: (2026)
Attention Prompting on Image for Large Vision-Language Models
por: Yu, Runpeng, et al.
Publicado: (2024)
por: Yu, Runpeng, et al.
Publicado: (2024)
ST-Prune: Training-Free Spatio-Temporal Token Pruning for Vision-Language Models in Autonomous Driving
por: Sha, Lin, et al.
Publicado: (2026)
por: Sha, Lin, et al.
Publicado: (2026)
Seeing the Abstract: Translating the Abstract Language for Vision Language Models
por: Talon, Davide, et al.
Publicado: (2025)
por: Talon, Davide, et al.
Publicado: (2025)
Robust Prompt Tuning for Vision-Language Models with Mild Semantic Noise
por: Gao, Yansheng, et al.
Publicado: (2025)
por: Gao, Yansheng, et al.
Publicado: (2025)
Evolving Prompt Adaptation for Vision-Language Models
por: Zhang, Enming, et al.
Publicado: (2026)
por: Zhang, Enming, et al.
Publicado: (2026)
EVEv2: Improved Baselines for Encoder-Free Vision-Language Models
por: Diao, Haiwen, et al.
Publicado: (2025)
por: Diao, Haiwen, et al.
Publicado: (2025)
See&Trek: Training-Free Spatial Prompting for Multimodal Large Language Model
por: Li, Pengteng, et al.
Publicado: (2025)
por: Li, Pengteng, et al.
Publicado: (2025)
Prompt Tuning with Soft Context Sharing for Vision-Language Models
por: Ding, Kun, et al.
Publicado: (2022)
por: Ding, Kun, et al.
Publicado: (2022)
Dropout Prompt Learning: Towards Robust and Adaptive Vision-Language Models
por: Chen, Biao, et al.
Publicado: (2025)
por: Chen, Biao, et al.
Publicado: (2025)
LPT: Less-overfitting Prompt Tuning for Vision-Language Model
por: Ding, Chenhao, et al.
Publicado: (2024)
por: Ding, Chenhao, et al.
Publicado: (2024)
Pre-Trained Vision-Language Models as Partial Annotators
por: Wang, Qian-Wei, et al.
Publicado: (2024)
por: Wang, Qian-Wei, et al.
Publicado: (2024)
Free Video-LLM: Prompt-guided Visual Perception for Efficient Training-free Video LLMs
por: Han, Kai, et al.
Publicado: (2024)
por: Han, Kai, et al.
Publicado: (2024)
Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning
por: Zhan, Yufei, et al.
Publicado: (2025)
por: Zhan, Yufei, et al.
Publicado: (2025)
Unsupervised Training of Vision Transformers with Synthetic Negatives
por: Giakoumoglou, Nikolaos, et al.
Publicado: (2025)
por: Giakoumoglou, Nikolaos, et al.
Publicado: (2025)
Mitigating the Reasoning Tax in Vision-Language Fine-Tuning with Input-Adaptive Depth Aggregation
por: Ren, Yiming, et al.
Publicado: (2026)
por: Ren, Yiming, et al.
Publicado: (2026)
SSMG: Spatial-Semantic Map Guided Diffusion Model for Free-form Layout-to-Image Generation
por: Jia, Chengyou, et al.
Publicado: (2023)
por: Jia, Chengyou, et al.
Publicado: (2023)
Gram-Anchored Prompt Learning for Vision-Language Models via Second-Order Statistics
por: Chen, Minglei, et al.
Publicado: (2026)
por: Chen, Minglei, et al.
Publicado: (2026)
FDBPL: Faster Distillation-Based Prompt Learning for Region-Aware Vision-Language Models Adaptation
por: Zhang, Zherui, et al.
Publicado: (2025)
por: Zhang, Zherui, et al.
Publicado: (2025)
Pedestrian Attribute Recognition via CLIP based Prompt Vision-Language Fusion
por: Wang, Xiao, et al.
Publicado: (2023)
por: Wang, Xiao, et al.
Publicado: (2023)
Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing
por: Wu, Junfei, et al.
Publicado: (2025)
por: Wu, Junfei, et al.
Publicado: (2025)
When Language Overwrites Vision: Over-Alignment and Geometric Debiasing in Vision-Language Models
por: Saini, Harshvardhan, et al.
Publicado: (2026)
por: Saini, Harshvardhan, et al.
Publicado: (2026)
NAP-Tuning: Neural Augmented Prompt Tuning for Adversarially Robust Vision-Language Models
por: Zhang, Jiaming, et al.
Publicado: (2025)
por: Zhang, Jiaming, et al.
Publicado: (2025)
PromptEcho: Annotation-Free Reward from Vision-Language Models for Text-to-Image Reinforcement Learning
por: Liu, Jinlong, et al.
Publicado: (2026)
por: Liu, Jinlong, et al.
Publicado: (2026)
Object-Centric Vision Token Pruning for Vision Language Models
por: Li, Guangyuan, et al.
Publicado: (2025)
por: Li, Guangyuan, et al.
Publicado: (2025)
MixFlow Training: Alleviating Exposure Bias with Slowed Interpolation Mixture
por: Li, Hui, et al.
Publicado: (2025)
por: Li, Hui, et al.
Publicado: (2025)
Towards Small Object Editing: A Benchmark Dataset and A Training-Free Approach
por: Pan, Qihe, et al.
Publicado: (2024)
por: Pan, Qihe, et al.
Publicado: (2024)
Egocentric Bias in Vision-Language Models
por: Wang, Maijunxian, et al.
Publicado: (2026)
por: Wang, Maijunxian, et al.
Publicado: (2026)
CadVLM: Bridging Language and Vision in the Generation of Parametric CAD Sketches
por: Wu, Sifan, et al.
Publicado: (2024)
por: Wu, Sifan, et al.
Publicado: (2024)
ClueTracer: Question-to-Vision Clue Tracing for Training-Free Hallucination Suppression in Multimodal Reasoning
por: Xi, Gongli, et al.
Publicado: (2026)
por: Xi, Gongli, et al.
Publicado: (2026)
Safety Alignment for Vision Language Models
por: Liu, Zhendong, et al.
Publicado: (2024)
por: Liu, Zhendong, et al.
Publicado: (2024)
Trio-ViT: Post-Training Quantization and Acceleration for Softmax-Free Efficient Vision Transformer
por: Shi, Huihong, et al.
Publicado: (2024)
por: Shi, Huihong, et al.
Publicado: (2024)
EchoPilot: Training-Free Ultrasound Video Segmentation via Scale-Space Semantic Prompting and Reliability-Gated Memory
por: Xiao, Ruiqiang, et al.
Publicado: (2026)
por: Xiao, Ruiqiang, et al.
Publicado: (2026)
Language-assisted Vision Model Debugger: A Sample-Free Approach to Finding and Fixing Bugs
por: Jiang, Chaoquan, et al.
Publicado: (2023)
por: Jiang, Chaoquan, et al.
Publicado: (2023)
Ejemplares similares
-
Perception Before Reasoning: Two-Stage Reinforcement Learning for Visual Reasoning in Vision-Language Models
por: Chen, Yan, et al.
Publicado: (2025) -
SkySenseGPT: A Fine-Grained Instruction Tuning Dataset and Model for Remote Sensing Vision-Language Understanding
por: Luo, Junwei, et al.
Publicado: (2024) -
Efficient Prompt Tuning of Large Vision-Language Model for Fine-Grained Ship Classification
por: Lan, Long, et al.
Publicado: (2024) -
Adversarial Prompt Distillation for Vision-Language Models
por: Luo, Lin, et al.
Publicado: (2024) -
Vocabulary-Free 3D Instance Segmentation with Vision and Language Assistant
por: Mei, Guofeng, et al.
Publicado: (2024)