"It's trained by non-disabled people": Evaluating How Image Quality Affects Product Captioning with Vision-Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Garg, Kapil, Tang, Xinru, Heo, Jimin, Morgan, Dwayne R., Gergle, Darren, Sudderth, Erik B., Piper, Anne Marie |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VIPaint: Image Inpainting with Pre-Trained Diffusion Models via Variational Inference
di: Agarwal, Sakshi, et al.
Pubblicazione: (2024)
di: Agarwal, Sakshi, et al.
Pubblicazione: (2024)
Reimagining Sign Language Technologies: Analyzing Translation Work of Chinese Deaf Online Content Creators
di: Tang, Xinru, et al.
Pubblicazione: (2026)
di: Tang, Xinru, et al.
Pubblicazione: (2026)
Designing for Collective Access: In Search of a Solution to Accessible Communication in a Mixed-Ability Non-Profit
di: Tang, Xinru, et al.
Pubblicazione: (2026)
di: Tang, Xinru, et al.
Pubblicazione: (2026)
Linguistic Similarity Within Centralized FLOSS Development
di: Gaughan, Matthew, et al.
Pubblicazione: (2026)
di: Gaughan, Matthew, et al.
Pubblicazione: (2026)
The Accessibility Paradox: How Blind and Low Vision Employees Experience and Negotiate Accessibility in the Technology Industry
di: Marathe, Aparajita, et al.
Pubblicazione: (2025)
di: Marathe, Aparajita, et al.
Pubblicazione: (2025)
Beyond Words: An Experimental Study of Signaling in Crowdfunding
di: Dambanemuya, Henry K., et al.
Pubblicazione: (2022)
di: Dambanemuya, Henry K., et al.
Pubblicazione: (2022)
When Testing AI Tests Us: Safeguarding Mental Health on the Digital Frontlines
di: Pendse, Sachin R., et al.
Pubblicazione: (2025)
di: Pendse, Sachin R., et al.
Pubblicazione: (2025)
Avoid Wasted Annotation Costs in Open-set Active Learning with Pre-trained Vision-Language Model
di: Heo, Jaehyuk, et al.
Pubblicazione: (2024)
di: Heo, Jaehyuk, et al.
Pubblicazione: (2024)
CLIP with Quality Captions: A Strong Pretraining for Vision Tasks
di: Vasu, Pavan Kumar Anasosalu, et al.
Pubblicazione: (2024)
di: Vasu, Pavan Kumar Anasosalu, et al.
Pubblicazione: (2024)
SynthVLM: Towards High-Quality and Efficient Synthesis of Image-Caption Datasets for Vision-Language Models
di: Liu, Zheng, et al.
Pubblicazione: (2024)
di: Liu, Zheng, et al.
Pubblicazione: (2024)
The Agony of Opacity: Foundations for Reflective Interpretability in AI-Mediated Mental Health Support
di: Pendse, Sachin R., et al.
Pubblicazione: (2025)
di: Pendse, Sachin R., et al.
Pubblicazione: (2025)
Understanding How Paper Writers Use AI-Generated Captions in Figure Caption Writing
di: Yin, Ho, et al.
Pubblicazione: (2025)
di: Yin, Ho, et al.
Pubblicazione: (2025)
Low-hallucination Synthetic Captions for Large-Scale Vision-Language Model Pre-training
di: Zhang, Xinsong, et al.
Pubblicazione: (2025)
di: Zhang, Xinsong, et al.
Pubblicazione: (2025)
CXMArena: Unified Dataset to benchmark performance in realistic CXM Scenarios
di: Garg, Raghav, et al.
Pubblicazione: (2025)
di: Garg, Raghav, et al.
Pubblicazione: (2025)
video-SALMONN 2: Caption-Enhanced Audio-Visual Large Language Models
di: Tang, Changli, et al.
Pubblicazione: (2025)
di: Tang, Changli, et al.
Pubblicazione: (2025)
How Users Experience Closed Captions on Live Television: Quality Metrics Remain a Challenge
di: Chavez, Mariana Arroyo, et al.
Pubblicazione: (2024)
di: Chavez, Mariana Arroyo, et al.
Pubblicazione: (2024)
Differentiable and Stable Long-Range Tracking of Multiple Posterior Modes
di: Younis, Ali, et al.
Pubblicazione: (2024)
di: Younis, Ali, et al.
Pubblicazione: (2024)
The Perils of Chart Deception: How Misleading Visualizations Affect Vision-Language Models
di: Mahbub, Ridwan, et al.
Pubblicazione: (2025)
di: Mahbub, Ridwan, et al.
Pubblicazione: (2025)
Stay in your Lane: Role Specific Queries with Overlap Suppression Loss for Dense Video Captioning
di: Baek, Seung Hyup, et al.
Pubblicazione: (2026)
di: Baek, Seung Hyup, et al.
Pubblicazione: (2026)
Beyond Captioning: Task-Specific Prompting for Improved VLM Performance in Mathematical Reasoning
di: Singh, Ayush, et al.
Pubblicazione: (2024)
di: Singh, Ayush, et al.
Pubblicazione: (2024)
Linear Alignment of Vision-language Models for Image Captioning
di: Paischer, Fabian, et al.
Pubblicazione: (2023)
di: Paischer, Fabian, et al.
Pubblicazione: (2023)
How Quality Affects Deep Neural Networks in Fine-Grained Image Classification
di: Smith, Joseph, et al.
Pubblicazione: (2024)
di: Smith, Joseph, et al.
Pubblicazione: (2024)
Enhancing Multimodal LLM for Detailed and Accurate Video Captioning using Multi-Round Preference Optimization
di: Tang, Changli, et al.
Pubblicazione: (2024)
di: Tang, Changli, et al.
Pubblicazione: (2024)
Modeling Caption Diversity in Contrastive Vision-Language Pretraining
di: Lavoie, Samuel, et al.
Pubblicazione: (2024)
di: Lavoie, Samuel, et al.
Pubblicazione: (2024)
Unifying Vision-Language Latents for Zero-label Image Caption Enhancement
di: Byun, Sanghyun, et al.
Pubblicazione: (2025)
di: Byun, Sanghyun, et al.
Pubblicazione: (2025)
Large-scale Pre-training for Grounded Video Caption Generation
di: Kazakos, Evangelos, et al.
Pubblicazione: (2025)
di: Kazakos, Evangelos, et al.
Pubblicazione: (2025)
DreamLIP: Language-Image Pre-training with Long Captions
di: Zheng, Kecheng, et al.
Pubblicazione: (2024)
di: Zheng, Kecheng, et al.
Pubblicazione: (2024)
How Does the Spatial Distribution of Pre-training Data Affect Geospatial Foundation Models?
di: Purohit, Mirali, et al.
Pubblicazione: (2025)
di: Purohit, Mirali, et al.
Pubblicazione: (2025)
Imagine How To Change: Explicit Procedure Modeling for Change Captioning
di: Sun, Jiayang, et al.
Pubblicazione: (2026)
di: Sun, Jiayang, et al.
Pubblicazione: (2026)
VIVECaption: A Split Approach to Caption Quality Improvement
di: Ananth, Varun, et al.
Pubblicazione: (2026)
di: Ananth, Varun, et al.
Pubblicazione: (2026)
BRACE: A Benchmark for Robust Audio Caption Quality Evaluation
di: Guo, Tianyu, et al.
Pubblicazione: (2025)
di: Guo, Tianyu, et al.
Pubblicazione: (2025)
Learning to be Smooth: An End-to-End Differentiable Particle Smoother
di: Younis, Ali, et al.
Pubblicazione: (2025)
di: Younis, Ali, et al.
Pubblicazione: (2025)
How people use Copilot for Health
di: Costa-Gomes, Beatriz, et al.
Pubblicazione: (2026)
di: Costa-Gomes, Beatriz, et al.
Pubblicazione: (2026)
OmniCaptioner: One Captioner to Rule Them All
di: Lu, Yiting, et al.
Pubblicazione: (2025)
di: Lu, Yiting, et al.
Pubblicazione: (2025)
ViTOC: Vision Transformer and Object-aware Captioner
di: Huang, Feiyang
Pubblicazione: (2024)
di: Huang, Feiyang
Pubblicazione: (2024)
Long-term Pre-training for Temporal Action Detection with Transformers
di: Kim, Jihwan, et al.
Pubblicazione: (2024)
di: Kim, Jihwan, et al.
Pubblicazione: (2024)
How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey
di: Qi, Yayun, et al.
Pubblicazione: (2024)
di: Qi, Yayun, et al.
Pubblicazione: (2024)
LOTUS: A Leaderboard for Detailed Image Captioning from Quality to Societal Bias and User Preferences
di: Hirota, Yusuke, et al.
Pubblicazione: (2025)
di: Hirota, Yusuke, et al.
Pubblicazione: (2025)
Visually-Aware Context Modeling for News Image Captioning
di: Qu, Tingyu, et al.
Pubblicazione: (2023)
di: Qu, Tingyu, et al.
Pubblicazione: (2023)
Mitigating Image Captioning Hallucinations in Vision-Language Models
di: Zhao, Fei, et al.
Pubblicazione: (2025)
di: Zhao, Fei, et al.
Pubblicazione: (2025)
Documenti analoghi
-
VIPaint: Image Inpainting with Pre-Trained Diffusion Models via Variational Inference
di: Agarwal, Sakshi, et al.
Pubblicazione: (2024) -
Reimagining Sign Language Technologies: Analyzing Translation Work of Chinese Deaf Online Content Creators
di: Tang, Xinru, et al.
Pubblicazione: (2026) -
Designing for Collective Access: In Search of a Solution to Accessible Communication in a Mixed-Ability Non-Profit
di: Tang, Xinru, et al.
Pubblicazione: (2026) -
Linguistic Similarity Within Centralized FLOSS Development
di: Gaughan, Matthew, et al.
Pubblicazione: (2026) -
The Accessibility Paradox: How Blind and Low Vision Employees Experience and Negotiate Accessibility in the Technology Industry
di: Marathe, Aparajita, et al.
Pubblicazione: (2025)