ClipGrader: Leveraging Vision-Language Models for Robust Label Quality Assessment in Object Detection
Fuente:
arXiv
Guardado en:
| Autores principales: | Lu, Hong, Bian, Yali, Shah, Rahul C. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Beyond Boundaries: Leveraging Vision Foundation Models for Source-Free Object Detection
por: Yao, Huizai, et al.
Publicado: (2025)
por: Yao, Huizai, et al.
Publicado: (2025)
Leveraging Vision-Language Models to Detect Attention in Educational Videos
por: Becquet, Gabriel, et al.
Publicado: (2026)
por: Becquet, Gabriel, et al.
Publicado: (2026)
Video-GPT via Next Clip Diffusion
por: Zhuang, Shaobin, et al.
Publicado: (2025)
por: Zhuang, Shaobin, et al.
Publicado: (2025)
Wholly-WOOD: Wholly Leveraging Diversified-quality Labels for Weakly-supervised Oriented Object Detection
por: Yu, Yi, et al.
Publicado: (2025)
por: Yu, Yi, et al.
Publicado: (2025)
Vision-Language Model for Object Detection and Segmentation: A Review and Evaluation
por: Feng, Yongchao, et al.
Publicado: (2025)
por: Feng, Yongchao, et al.
Publicado: (2025)
Leveraging Chat-Based Large Vision Language Models for Multimodal Out-Of-Context Detection
por: Shalabi, Fatma, et al.
Publicado: (2024)
por: Shalabi, Fatma, et al.
Publicado: (2024)
Towards Robust Optical-SAR Object Detection under Missing Modalities: A Dynamic Quality-Aware Fusion Framework
por: Zhao, Zhicheng, et al.
Publicado: (2025)
por: Zhao, Zhicheng, et al.
Publicado: (2025)
Object-Centric Vision Token Pruning for Vision Language Models
por: Li, Guangyuan, et al.
Publicado: (2025)
por: Li, Guangyuan, et al.
Publicado: (2025)
PAS : Prelim Attention Score for Detecting Object Hallucinations in Large Vision--Language Models
por: Hoang-Xuan, Nhat, et al.
Publicado: (2025)
por: Hoang-Xuan, Nhat, et al.
Publicado: (2025)
GroundCount: Grounding Vision-Language Models with Object Detection for Mitigating Counting Hallucinations
por: Chen, Boyuan, et al.
Publicado: (2026)
por: Chen, Boyuan, et al.
Publicado: (2026)
Beyond Cross-Modal Alignment: Measuring and Leveraging Modality Gap in Vision-Language Models
por: Yan, Hanqi, et al.
Publicado: (2025)
por: Yan, Hanqi, et al.
Publicado: (2025)
Bias Detection and Rotation-Robustness Mitigation in Vision-Language Models and Generative Image Models
por: Mithila, Tarannum
Publicado: (2026)
por: Mithila, Tarannum
Publicado: (2026)
Sanitizing Manufacturing Dataset Labels Using Vision-Language Models
por: Mahjourian, Nazanin, et al.
Publicado: (2025)
por: Mahjourian, Nazanin, et al.
Publicado: (2025)
Tuning Vision-Language Models with Candidate Labels by Prompt Alignment
por: Zhang, Zhifang, et al.
Publicado: (2024)
por: Zhang, Zhifang, et al.
Publicado: (2024)
From Open Vocabulary to Open World: Teaching Vision Language Models to Detect Novel Objects
por: Li, Zizhao, et al.
Publicado: (2024)
por: Li, Zizhao, et al.
Publicado: (2024)
IQAGPT: Image Quality Assessment with Vision-language and ChatGPT Models
por: Chen, Zhihao, et al.
Publicado: (2023)
por: Chen, Zhihao, et al.
Publicado: (2023)
Replay Consolidation with Label Propagation for Continual Object Detection
por: De Monte, Riccardo, et al.
Publicado: (2024)
por: De Monte, Riccardo, et al.
Publicado: (2024)
Leveraging Unknown Objects to Construct Labeled-Unlabeled Meta-Relationships for Zero-Shot Object Navigation
por: Zheng, Yanwei, et al.
Publicado: (2024)
por: Zheng, Yanwei, et al.
Publicado: (2024)
Believing is Seeing: Unobserved Object Detection using Generative Models
por: Bhattacharjee, Subhransu S., et al.
Publicado: (2024)
por: Bhattacharjee, Subhransu S., et al.
Publicado: (2024)
Dragonfly: Multi-Resolution Zoom-In Encoding Enhances Vision-Language Models
por: Thapa, Rahul, et al.
Publicado: (2024)
por: Thapa, Rahul, et al.
Publicado: (2024)
TTP: Test-Time Padding for Adversarial Detection and Robust Adaptation on Vision-Language Models
por: Li, Zhiwei, et al.
Publicado: (2025)
por: Li, Zhiwei, et al.
Publicado: (2025)
RT-VLM: Re-Thinking Vision Language Model with 4-Clues for Real-World Object Recognition Robustness
por: Park, Junghyun, et al.
Publicado: (2025)
por: Park, Junghyun, et al.
Publicado: (2025)
Hyperspectral Imaging-Based Grain Quality Assessment With Limited Labelled Data
por: Karmakar, Priyabrata, et al.
Publicado: (2024)
por: Karmakar, Priyabrata, et al.
Publicado: (2024)
Decoupling Perception and Calibration: Label-Efficient Image Quality Assessment Framework
por: Li, Xinyue, et al.
Publicado: (2026)
por: Li, Xinyue, et al.
Publicado: (2026)
MetaDent: Labeling Clinical Images for Vision-Language Models in Dentistry
por: Li, Meng-Xun, et al.
Publicado: (2026)
por: Li, Meng-Xun, et al.
Publicado: (2026)
Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI
por: Ernhofer, Benjamin Raphael, et al.
Publicado: (2025)
por: Ernhofer, Benjamin Raphael, et al.
Publicado: (2025)
Text-Guided Attention is All You Need for Zero-Shot Robustness in Vision-Language Models
por: Yu, Lu, et al.
Publicado: (2024)
por: Yu, Lu, et al.
Publicado: (2024)
Learning Camouflaged Object Detection from Noisy Pseudo Label
por: Zhang, Jin, et al.
Publicado: (2024)
por: Zhang, Jin, et al.
Publicado: (2024)
An Empirical Study on the Robustness of YOLO Models for Underwater Object Detection
por: Nabahirwa, Edwine, et al.
Publicado: (2025)
por: Nabahirwa, Edwine, et al.
Publicado: (2025)
HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models
por: Liu, Han, et al.
Publicado: (2026)
por: Liu, Han, et al.
Publicado: (2026)
Explainable Adversarial-Robust Vision-Language-Action Model for Robotic Manipulation
por: Kim, Ju-Young, et al.
Publicado: (2025)
por: Kim, Ju-Young, et al.
Publicado: (2025)
Object Detection with Multimodal Large Vision-Language Models: An In-depth Review
por: Sapkota, Ranjan, et al.
Publicado: (2025)
por: Sapkota, Ranjan, et al.
Publicado: (2025)
A Structured Review of Underwater Object Detection Challenges and Solutions: From Traditional to Large Vision Language Models
por: Nabahirwa, Edwine, et al.
Publicado: (2025)
por: Nabahirwa, Edwine, et al.
Publicado: (2025)
Semantic-Clipping: Efficient Vision-Language Modeling with Semantic-Guidedd Visual Selection
por: Li, Bangzheng, et al.
Publicado: (2025)
por: Li, Bangzheng, et al.
Publicado: (2025)
Semi-Supervised Semantic Segmentation Based on Pseudo-Labels: A Survey
por: Ran, Lingyan, et al.
Publicado: (2024)
por: Ran, Lingyan, et al.
Publicado: (2024)
LAPT: Label-driven Automated Prompt Tuning for OOD Detection with Vision-Language Models
por: Zhang, Yabin, et al.
Publicado: (2024)
por: Zhang, Yabin, et al.
Publicado: (2024)
SparseFormer: Detecting Objects in HRW Shots via Sparse Vision Transformer
por: Li, Wenxi, et al.
Publicado: (2025)
por: Li, Wenxi, et al.
Publicado: (2025)
Leveraging Vision-Language Models to Select Trustworthy Super-Resolution Samples Generated by Diffusion Models
por: Korkmaz, Cansu, et al.
Publicado: (2025)
por: Korkmaz, Cansu, et al.
Publicado: (2025)
VLM-RobustBench: A Comprehensive Benchmark for Robustness of Vision-Language Models
por: Saxena, Rohit, et al.
Publicado: (2026)
por: Saxena, Rohit, et al.
Publicado: (2026)
Investigating and Mitigating Object Hallucinations in Pretrained Vision-Language (CLIP) Models
por: Liu, Yufang, et al.
Publicado: (2024)
por: Liu, Yufang, et al.
Publicado: (2024)
Ejemplares similares
-
Beyond Boundaries: Leveraging Vision Foundation Models for Source-Free Object Detection
por: Yao, Huizai, et al.
Publicado: (2025) -
Leveraging Vision-Language Models to Detect Attention in Educational Videos
por: Becquet, Gabriel, et al.
Publicado: (2026) -
Video-GPT via Next Clip Diffusion
por: Zhuang, Shaobin, et al.
Publicado: (2025) -
Wholly-WOOD: Wholly Leveraging Diversified-quality Labels for Weakly-supervised Oriented Object Detection
por: Yu, Yi, et al.
Publicado: (2025) -
Vision-Language Model for Object Detection and Segmentation: A Review and Evaluation
por: Feng, Yongchao, et al.
Publicado: (2025)