From Descriptive Richness to Bias: Unveiling the Dark Side of Generative Image Caption Enrichment
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hirota, Yusuke, Hachiuma, Ryo, Yang, Chao-Han Huck, Nakashima, Yuta |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LOTUS: A Leaderboard for Detailed Image Captioning from Quality to Societal Bias and User Preferences
par: Hirota, Yusuke, et autres
Publié: (2025)
par: Hirota, Yusuke, et autres
Publié: (2025)
From Global to Local: Social Bias Transfer in CLIP
par: Ramos, Ryan, et autres
Publié: (2025)
par: Ramos, Ryan, et autres
Publié: (2025)
Bias in Gender Bias Benchmarks: How Spurious Features Distort Evaluation
par: Hirota, Yusuke, et autres
Publié: (2025)
par: Hirota, Yusuke, et autres
Publié: (2025)
Would Deep Generative Models Amplify Bias in Future Models?
par: Chen, Tianwei, et autres
Publié: (2024)
par: Chen, Tianwei, et autres
Publié: (2024)
SANER: Annotation-free Societal Attribute Neutralizer for Debiasing CLIP
par: Hirota, Yusuke, et autres
Publié: (2024)
par: Hirota, Yusuke, et autres
Publié: (2024)
Resampled Datasets Are Not Enough: Mitigating Societal Bias Beyond Single Attributes
par: Hirota, Yusuke, et autres
Publié: (2024)
par: Hirota, Yusuke, et autres
Publié: (2024)
Interpretable Debiasing of Vision-Language Models for Social Fairness
par: An, Na Min, et autres
Publié: (2026)
par: An, Na Min, et autres
Publié: (2026)
Stable Diffusion Exposed: Gender Bias from Prompt to Image
par: Wu, Yankun, et autres
Publié: (2023)
par: Wu, Yankun, et autres
Publié: (2023)
RealTraj: Towards Real-World Pedestrian Trajectory Forecasting
par: Fujii, Ryo, et autres
Publié: (2024)
par: Fujii, Ryo, et autres
Publié: (2024)
Weakly Semi-supervised Tool Detection in Minimally Invasive Surgery Videos
par: Fujii, Ryo, et autres
Publié: (2024)
par: Fujii, Ryo, et autres
Publié: (2024)
VIOLA: Towards Video In-Context Learning with Minimal Annotations
par: Fujii, Ryo, et autres
Publié: (2026)
par: Fujii, Ryo, et autres
Publié: (2026)
EMAG: Ego-motion Aware and Generalizable 2D Hand Forecasting from Egocentric Videos
par: Hatano, Masashi, et autres
Publié: (2024)
par: Hatano, Masashi, et autres
Publié: (2024)
Multimodal Cross-Domain Few-Shot Learning for Egocentric Action Recognition
par: Hatano, Masashi, et autres
Publié: (2024)
par: Hatano, Masashi, et autres
Publié: (2024)
Human Preference-Aligned Concept Customization Benchmark via Decomposed Evaluation
par: Ishikawa, Reina, et autres
Publié: (2025)
par: Ishikawa, Reina, et autres
Publié: (2025)
CrowdMAC: Masked Crowd Density Completion for Robust Crowd Density Forecasting
par: Fujii, Ryo, et autres
Publié: (2024)
par: Fujii, Ryo, et autres
Publié: (2024)
Towards Predicting Any Human Trajectory In Context
par: Fujii, Ryo, et autres
Publié: (2025)
par: Fujii, Ryo, et autres
Publié: (2025)
GradBias: Unveiling Word Influence on Bias in Text-to-Image Generative Models
par: D'Incà, Moreno, et autres
Publié: (2024)
par: D'Incà, Moreno, et autres
Publié: (2024)
Temporal Image Caption Retrieval Competition -- Description and Results
par: Pokrywka, Jakub, et autres
Publié: (2024)
par: Pokrywka, Jakub, et autres
Publié: (2024)
UIT-DarkCow team at ImageCLEFmedical Caption 2024: Diagnostic Captioning for Radiology Images Efficiency with Transformer Models
par: Van Nguyen, Quan, et autres
Publié: (2024)
par: Van Nguyen, Quan, et autres
Publié: (2024)
LiDAR Data Synthesis with Denoising Diffusion Probabilistic Models
par: Nakashima, Kazuto, et autres
Publié: (2023)
par: Nakashima, Kazuto, et autres
Publié: (2023)
Generating an Image From 1,000 Words: Enhancing Text-to-Image With Structured Captions
par: Gutflaish, Eyal, et autres
Publié: (2025)
par: Gutflaish, Eyal, et autres
Publié: (2025)
Measure Twice, Cut Once: A Semantic-Oriented Approach to Video Temporal Localization with Video LLMs
par: Pang, Zongshang, et autres
Publié: (2025)
par: Pang, Zongshang, et autres
Publié: (2025)
EMMA: Concept Erasure Benchmark with Comprehensive Semantic Metrics and Diverse Categories
par: Wei, Lu, et autres
Publié: (2025)
par: Wei, Lu, et autres
Publié: (2025)
Privacy in Image Datasets: A Case Study on Pregnancy Ultrasounds
par: Lohanimit, Rawisara, et autres
Publié: (2026)
par: Lohanimit, Rawisara, et autres
Publié: (2026)
Explainable Image Recognition via Enhanced Slot-attention Based Classifier
par: Wang, Bowen, et autres
Publié: (2024)
par: Wang, Bowen, et autres
Publié: (2024)
CaptionQA: Is Your Caption as Useful as the Image Itself?
par: Yang, Shijia, et autres
Publié: (2025)
par: Yang, Shijia, et autres
Publié: (2025)
From Image Captioning to Visual Storytelling
par: Passadakis, Admitos, et autres
Publié: (2025)
par: Passadakis, Admitos, et autres
Publié: (2025)
Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model
par: AlJunaid, Reem, et autres
Publié: (2025)
par: AlJunaid, Reem, et autres
Publié: (2025)
Image Generation from Image Captioning -- Invertible Approach
par: Menon, Nandakishore S, et autres
Publié: (2024)
par: Menon, Nandakishore S, et autres
Publié: (2024)
Embodied Image Captioning: Self-supervised Learning Agents for Spatially Coherent Image Descriptions
par: Galliena, Tommaso, et autres
Publié: (2025)
par: Galliena, Tommaso, et autres
Publié: (2025)
PixLore: A Dataset-driven Approach to Rich Image Captioning
par: Bonilla-Salvador, Diego, et autres
Publié: (2023)
par: Bonilla-Salvador, Diego, et autres
Publié: (2023)
Primitive Geometry Segment Pre-training for 3D Medical Image Segmentation
par: Tadokoro, Ryu, et autres
Publié: (2024)
par: Tadokoro, Ryu, et autres
Publié: (2024)
Improving Text Generation on Images with Synthetic Captions
par: Koh, Jun Young, et autres
Publié: (2024)
par: Koh, Jun Young, et autres
Publié: (2024)
VASCAR: Content-Aware Layout Generation via Visual-Aware Self-Correction
par: Zhang, Jiahao, et autres
Publié: (2024)
par: Zhang, Jiahao, et autres
Publié: (2024)
Zoom-Zero: Reinforced Coarse-to-Fine Video Understanding via Temporal Zoom-in
par: Shen, Xiaoqian, et autres
Publié: (2025)
par: Shen, Xiaoqian, et autres
Publié: (2025)
Panoptic Captioning: An Equivalence Bridge for Image and Text
par: Lin, Kun-Yu, et autres
Publié: (2025)
par: Lin, Kun-Yu, et autres
Publié: (2025)
Enhancing Descriptive Captions with Visual Attributes for Multimodal Perception
par: Sun, Yanpeng, et autres
Publié: (2024)
par: Sun, Yanpeng, et autres
Publié: (2024)
Precision or Recall? An Analysis of Image Captions for Training Text-to-Image Generation Model
par: Cheng, Sheng, et autres
Publié: (2024)
par: Cheng, Sheng, et autres
Publié: (2024)
Exploring Diverse In-Context Configurations for Image Captioning
par: Yang, Xu, et autres
Publié: (2023)
par: Yang, Xu, et autres
Publié: (2023)
OpenFACADES: An Open Framework for Architectural Caption and Attribute Data Enrichment via Street View Imagery
par: Liang, Xiucheng, et autres
Publié: (2025)
par: Liang, Xiucheng, et autres
Publié: (2025)
Documents similaires
-
LOTUS: A Leaderboard for Detailed Image Captioning from Quality to Societal Bias and User Preferences
par: Hirota, Yusuke, et autres
Publié: (2025) -
From Global to Local: Social Bias Transfer in CLIP
par: Ramos, Ryan, et autres
Publié: (2025) -
Bias in Gender Bias Benchmarks: How Spurious Features Distort Evaluation
par: Hirota, Yusuke, et autres
Publié: (2025) -
Would Deep Generative Models Amplify Bias in Future Models?
par: Chen, Tianwei, et autres
Publié: (2024) -
SANER: Annotation-free Societal Attribute Neutralizer for Debiasing CLIP
par: Hirota, Yusuke, et autres
Publié: (2024)