Language-assisted Vision Model Debugger: A Sample-Free Approach to Finding and Fixing Bugs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jiang, Chaoquan, Wang, Jinqiang, Hu, Rui, Sang, Jitao |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Debiased Prompt Tuning in Vision-Language Model without Annotations
par: Jiang, Chaoquan, et autres
Publié: (2025)
par: Jiang, Chaoquan, et autres
Publié: (2025)
Prescribing the Right Remedy: Mitigating Hallucinations in Large Vision-Language Models via Targeted Instruction Tuning
par: Hu, Rui, et autres
Publié: (2024)
par: Hu, Rui, et autres
Publié: (2024)
Adversarial Prompt Tuning for Vision-Language Models
par: Zhang, Jiaming, et autres
Publié: (2023)
par: Zhang, Jiaming, et autres
Publié: (2023)
NAP-Tuning: Neural Augmented Prompt Tuning for Adversarially Robust Vision-Language Models
par: Zhang, Jiaming, et autres
Publié: (2025)
par: Zhang, Jiaming, et autres
Publié: (2025)
Debiasing Vison-Language Models with Text-Only Training
par: Yang, Yunfan, et autres
Publié: (2024)
par: Yang, Yunfan, et autres
Publié: (2024)
Aesthetic Assessment of Chinese Handwritings Based on Vision Language Models
par: Zheng, Chen, et autres
Publié: (2026)
par: Zheng, Chen, et autres
Publié: (2026)
Training-Free Unsupervised Prompt for Vision-Language Models
par: Long, Sifan, et autres
Publié: (2024)
par: Long, Sifan, et autres
Publié: (2024)
UrbanVideo-Bench: Benchmarking Vision-Language Models on Embodied Intelligence with Video Data in Urban Spaces
par: Zhao, Baining, et autres
Publié: (2025)
par: Zhao, Baining, et autres
Publié: (2025)
Prompting Large Vision-Language Models for Compositional Reasoning
par: Ossowski, Timothy, et autres
Publié: (2024)
par: Ossowski, Timothy, et autres
Publié: (2024)
Hidden Clones: Exposing and Fixing Family Bias in Vision-Language Model Ensembles
par: Bugaud, Zacharie
Publié: (2026)
par: Bugaud, Zacharie
Publié: (2026)
EVEv2: Improved Baselines for Encoder-Free Vision-Language Models
par: Diao, Haiwen, et autres
Publié: (2025)
par: Diao, Haiwen, et autres
Publié: (2025)
VLADriver-RAG: Retrieval-Augmented Vision-Language-Action Models for Autonomous Driving
par: Zhao, Rui, et autres
Publié: (2026)
par: Zhao, Rui, et autres
Publié: (2026)
INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling
par: Dong, Xin, et autres
Publié: (2025)
par: Dong, Xin, et autres
Publié: (2025)
VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models
par: Zhang, Jianke, et autres
Publié: (2026)
par: Zhang, Jianke, et autres
Publié: (2026)
Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning
par: Zhan, Yufei, et autres
Publié: (2025)
par: Zhan, Yufei, et autres
Publié: (2025)
PromptEcho: Annotation-Free Reward from Vision-Language Models for Text-to-Image Reinforcement Learning
par: Liu, Jinlong, et autres
Publié: (2026)
par: Liu, Jinlong, et autres
Publié: (2026)
MoHoBench: Assessing Honesty of Multimodal Large Language Models via Unanswerable Visual Questions
par: Zhu, Yanxu, et autres
Publié: (2025)
par: Zhu, Yanxu, et autres
Publié: (2025)
Distilling Vision-Language Foundation Models: A Data-Free Approach via Prompt Diversification
par: Xuan, Yunyi, et autres
Publié: (2024)
par: Xuan, Yunyi, et autres
Publié: (2024)
A Unified Debiasing Approach for Vision-Language Models across Modalities and Tasks
par: Jung, Hoin, et autres
Publié: (2024)
par: Jung, Hoin, et autres
Publié: (2024)
Structured Labeling Enables Faster Vision-Language Models for End-to-End Autonomous Driving
par: Jiang, Hao, et autres
Publié: (2025)
par: Jiang, Hao, et autres
Publié: (2025)
Adversarial Prompt Distillation for Vision-Language Models
par: Luo, Lin, et autres
Publié: (2024)
par: Luo, Lin, et autres
Publié: (2024)
Steering Away from Harm: An Adaptive Approach to Defending Vision Language Model Against Jailbreaks
par: Wang, Han, et autres
Publié: (2024)
par: Wang, Han, et autres
Publié: (2024)
Fine-tuning Pre-trained Vision-Language Models in a Human-Annotation-Free Manner
par: Wang, Qian-Wei, et autres
Publié: (2026)
par: Wang, Qian-Wei, et autres
Publié: (2026)
ST-Prune: Training-Free Spatio-Temporal Token Pruning for Vision-Language Models in Autonomous Driving
par: Sha, Lin, et autres
Publié: (2026)
par: Sha, Lin, et autres
Publié: (2026)
ODE: Open-Set Evaluation of Hallucinations in Multimodal Large Language Models
par: Tu, Yahan, et autres
Publié: (2024)
par: Tu, Yahan, et autres
Publié: (2024)
Vocabulary-Free 3D Instance Segmentation with Vision and Language Assistant
par: Mei, Guofeng, et autres
Publié: (2024)
par: Mei, Guofeng, et autres
Publié: (2024)
Leveraging Vision-Language Models to Select Trustworthy Super-Resolution Samples Generated by Diffusion Models
par: Korkmaz, Cansu, et autres
Publié: (2025)
par: Korkmaz, Cansu, et autres
Publié: (2025)
A Hybrid Co-Finetuning Approach for Visual Bug Detection in Video Games
par: Yi, Faliu, et autres
Publié: (2025)
par: Yi, Faliu, et autres
Publié: (2025)
Probing the Robustness of Vision-Language Pretrained Models: A Multimodal Adversarial Attack Approach
par: Guan, Jiwei, et autres
Publié: (2024)
par: Guan, Jiwei, et autres
Publié: (2024)
Dynamic Token Reduction during Generation for Vision Language Models
par: Liang, Xiaoyu, et autres
Publié: (2025)
par: Liang, Xiaoyu, et autres
Publié: (2025)
IDEATOR: Jailbreaking and Benchmarking Large Vision-Language Models Using Themselves
par: Wang, Ruofan, et autres
Publié: (2024)
par: Wang, Ruofan, et autres
Publié: (2024)
Weierstrass Positional Encoding for Vision Transformers
par: Xin, Zhihang, et autres
Publié: (2026)
par: Xin, Zhihang, et autres
Publié: (2026)
LocateBench: Evaluating the Locating Ability of Vision Language Models
par: Chiang, Ting-Rui, et autres
Publié: (2024)
par: Chiang, Ting-Rui, et autres
Publié: (2024)
Benchmarking and Mitigating Sycophancy in Medical Vision Language Models
par: Xu, Juangui, et autres
Publié: (2025)
par: Xu, Juangui, et autres
Publié: (2025)
Enhancing Model Performance: Another Approach to Vision-Language Instruction Tuning
par: Vedanshu, et autres
Publié: (2024)
par: Vedanshu, et autres
Publié: (2024)
Skill-Conditioned Visual Geolocation for Vision-Language Models
par: Yang, Chenjie, et autres
Publié: (2026)
par: Yang, Chenjie, et autres
Publié: (2026)
Gram-Anchored Prompt Learning for Vision-Language Models via Second-Order Statistics
par: Chen, Minglei, et autres
Publié: (2026)
par: Chen, Minglei, et autres
Publié: (2026)
FFF: Fixing Flawed Foundations in contrastive pre-training results in very strong Vision-Language models
par: Bulat, Adrian, et autres
Publié: (2024)
par: Bulat, Adrian, et autres
Publié: (2024)
VaLiD: Mitigating the Hallucination of Large Vision Language Models by Visual Layer Fusion Contrastive Decoding
par: Wang, Jiaqi, et autres
Publié: (2024)
par: Wang, Jiaqi, et autres
Publié: (2024)
MedPruner: Training-Free Hierarchical Token Pruning for Efficient 3D Medical Image Understanding in Vision-Language Models
par: Liu, Shengyuan, et autres
Publié: (2026)
par: Liu, Shengyuan, et autres
Publié: (2026)
Documents similaires
-
Debiased Prompt Tuning in Vision-Language Model without Annotations
par: Jiang, Chaoquan, et autres
Publié: (2025) -
Prescribing the Right Remedy: Mitigating Hallucinations in Large Vision-Language Models via Targeted Instruction Tuning
par: Hu, Rui, et autres
Publié: (2024) -
Adversarial Prompt Tuning for Vision-Language Models
par: Zhang, Jiaming, et autres
Publié: (2023) -
NAP-Tuning: Neural Augmented Prompt Tuning for Adversarially Robust Vision-Language Models
par: Zhang, Jiaming, et autres
Publié: (2025) -
Debiasing Vison-Language Models with Text-Only Training
par: Yang, Yunfan, et autres
Publié: (2024)