Enregistré dans:
| Auteurs principaux: | Hirota, Yusuke, Hachiuma, Ryo, Yang, Chao-Han Huck, Nakashima, Yuta |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2406.13912 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LOTUS: A Leaderboard for Detailed Image Captioning from Quality to Societal Bias and User Preferences
par: Hirota, Yusuke, et autres
Publié: (2025)
par: Hirota, Yusuke, et autres
Publié: (2025)
Bias in Gender Bias Benchmarks: How Spurious Features Distort Evaluation
par: Hirota, Yusuke, et autres
Publié: (2025)
par: Hirota, Yusuke, et autres
Publié: (2025)
From Global to Local: Social Bias Transfer in CLIP
par: Ramos, Ryan, et autres
Publié: (2025)
par: Ramos, Ryan, et autres
Publié: (2025)
SANER: Annotation-free Societal Attribute Neutralizer for Debiasing CLIP
par: Hirota, Yusuke, et autres
Publié: (2024)
par: Hirota, Yusuke, et autres
Publié: (2024)
Would Deep Generative Models Amplify Bias in Future Models?
par: Chen, Tianwei, et autres
Publié: (2024)
par: Chen, Tianwei, et autres
Publié: (2024)
Interpretable Debiasing of Vision-Language Models for Social Fairness
par: An, Na Min, et autres
Publié: (2026)
par: An, Na Min, et autres
Publié: (2026)
Resampled Datasets Are Not Enough: Mitigating Societal Bias Beyond Single Attributes
par: Hirota, Yusuke, et autres
Publié: (2024)
par: Hirota, Yusuke, et autres
Publié: (2024)
Stable Diffusion Exposed: Gender Bias from Prompt to Image
par: Wu, Yankun, et autres
Publié: (2023)
par: Wu, Yankun, et autres
Publié: (2023)
RealTraj: Towards Real-World Pedestrian Trajectory Forecasting
par: Fujii, Ryo, et autres
Publié: (2024)
par: Fujii, Ryo, et autres
Publié: (2024)
Weakly Semi-supervised Tool Detection in Minimally Invasive Surgery Videos
par: Fujii, Ryo, et autres
Publié: (2024)
par: Fujii, Ryo, et autres
Publié: (2024)
VIOLA: Towards Video In-Context Learning with Minimal Annotations
par: Fujii, Ryo, et autres
Publié: (2026)
par: Fujii, Ryo, et autres
Publié: (2026)
Multimodal Cross-Domain Few-Shot Learning for Egocentric Action Recognition
par: Hatano, Masashi, et autres
Publié: (2024)
par: Hatano, Masashi, et autres
Publié: (2024)
Human Preference-Aligned Concept Customization Benchmark via Decomposed Evaluation
par: Ishikawa, Reina, et autres
Publié: (2025)
par: Ishikawa, Reina, et autres
Publié: (2025)
EMAG: Ego-motion Aware and Generalizable 2D Hand Forecasting from Egocentric Videos
par: Hatano, Masashi, et autres
Publié: (2024)
par: Hatano, Masashi, et autres
Publié: (2024)
CrowdMAC: Masked Crowd Density Completion for Robust Crowd Density Forecasting
par: Fujii, Ryo, et autres
Publié: (2024)
par: Fujii, Ryo, et autres
Publié: (2024)
Towards Predicting Any Human Trajectory In Context
par: Fujii, Ryo, et autres
Publié: (2025)
par: Fujii, Ryo, et autres
Publié: (2025)
GradBias: Unveiling Word Influence on Bias in Text-to-Image Generative Models
par: D'Incà, Moreno, et autres
Publié: (2024)
par: D'Incà, Moreno, et autres
Publié: (2024)
Temporal Image Caption Retrieval Competition -- Description and Results
par: Pokrywka, Jakub, et autres
Publié: (2024)
par: Pokrywka, Jakub, et autres
Publié: (2024)
LiDAR Data Synthesis with Denoising Diffusion Probabilistic Models
par: Nakashima, Kazuto, et autres
Publié: (2023)
par: Nakashima, Kazuto, et autres
Publié: (2023)
UIT-DarkCow team at ImageCLEFmedical Caption 2024: Diagnostic Captioning for Radiology Images Efficiency with Transformer Models
par: Van Nguyen, Quan, et autres
Publié: (2024)
par: Van Nguyen, Quan, et autres
Publié: (2024)
Measure Twice, Cut Once: A Semantic-Oriented Approach to Video Temporal Localization with Video LLMs
par: Pang, Zongshang, et autres
Publié: (2025)
par: Pang, Zongshang, et autres
Publié: (2025)
EMMA: Concept Erasure Benchmark with Comprehensive Semantic Metrics and Diverse Categories
par: Wei, Lu, et autres
Publié: (2025)
par: Wei, Lu, et autres
Publié: (2025)
Privacy in Image Datasets: A Case Study on Pregnancy Ultrasounds
par: Lohanimit, Rawisara, et autres
Publié: (2026)
par: Lohanimit, Rawisara, et autres
Publié: (2026)
Explainable Image Recognition via Enhanced Slot-attention Based Classifier
par: Wang, Bowen, et autres
Publié: (2024)
par: Wang, Bowen, et autres
Publié: (2024)
Zoom-Zero: Reinforced Coarse-to-Fine Video Understanding via Temporal Zoom-in
par: Shen, Xiaoqian, et autres
Publié: (2025)
par: Shen, Xiaoqian, et autres
Publié: (2025)
Masking Teacher and Reinforcing Student for Distilling Vision-Language Models
par: Lee, Byung-Kwan, et autres
Publié: (2025)
par: Lee, Byung-Kwan, et autres
Publié: (2025)
Learning from Synthetic Data via Provenance-Based Input Gradient Guidance
par: Nagano, Koshiro, et autres
Publié: (2026)
par: Nagano, Koshiro, et autres
Publié: (2026)
Generating an Image From 1,000 Words: Enhancing Text-to-Image With Structured Captions
par: Gutflaish, Eyal, et autres
Publié: (2025)
par: Gutflaish, Eyal, et autres
Publié: (2025)
Primitive Geometry Segment Pre-training for 3D Medical Image Segmentation
par: Tadokoro, Ryu, et autres
Publié: (2024)
par: Tadokoro, Ryu, et autres
Publié: (2024)
VASCAR: Content-Aware Layout Generation via Visual-Aware Self-Correction
par: Zhang, Jiahao, et autres
Publié: (2024)
par: Zhang, Jiahao, et autres
Publié: (2024)
From Image Captioning to Visual Storytelling
par: Passadakis, Admitos, et autres
Publié: (2025)
par: Passadakis, Admitos, et autres
Publié: (2025)
CaptionQA: Is Your Caption as Useful as the Image Itself?
par: Yang, Shijia, et autres
Publié: (2025)
par: Yang, Shijia, et autres
Publié: (2025)
PixLore: A Dataset-driven Approach to Rich Image Captioning
par: Bonilla-Salvador, Diego, et autres
Publié: (2023)
par: Bonilla-Salvador, Diego, et autres
Publié: (2023)
Omni-RGPT: Unifying Image and Video Region-level Understanding via Token Marks
par: Heo, Miran, et autres
Publié: (2025)
par: Heo, Miran, et autres
Publié: (2025)
Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model
par: AlJunaid, Reem, et autres
Publié: (2025)
par: AlJunaid, Reem, et autres
Publié: (2025)
Image Generation from Image Captioning -- Invertible Approach
par: Menon, Nandakishore S, et autres
Publié: (2024)
par: Menon, Nandakishore S, et autres
Publié: (2024)
Embodied Image Captioning: Self-supervised Learning Agents for Spatially Coherent Image Descriptions
par: Galliena, Tommaso, et autres
Publié: (2025)
par: Galliena, Tommaso, et autres
Publié: (2025)
Metropolis-Hastings Captioning Game: Knowledge Fusion of Vision Language Models via Decentralized Bayesian Inference
par: Matsui, Yuta, et autres
Publié: (2025)
par: Matsui, Yuta, et autres
Publié: (2025)
VLsI: Verbalized Layers-to-Interactions from Large to Small Vision Language Models
par: Lee, Byung-Kwan, et autres
Publié: (2024)
par: Lee, Byung-Kwan, et autres
Publié: (2024)
Unified Reinforcement and Imitation Learning for Vision-Language Models
par: Lee, Byung-Kwan, et autres
Publié: (2025)
par: Lee, Byung-Kwan, et autres
Publié: (2025)
Documents similaires
-
LOTUS: A Leaderboard for Detailed Image Captioning from Quality to Societal Bias and User Preferences
par: Hirota, Yusuke, et autres
Publié: (2025) -
Bias in Gender Bias Benchmarks: How Spurious Features Distort Evaluation
par: Hirota, Yusuke, et autres
Publié: (2025) -
From Global to Local: Social Bias Transfer in CLIP
par: Ramos, Ryan, et autres
Publié: (2025) -
SANER: Annotation-free Societal Attribute Neutralizer for Debiasing CLIP
par: Hirota, Yusuke, et autres
Publié: (2024) -
Would Deep Generative Models Amplify Bias in Future Models?
par: Chen, Tianwei, et autres
Publié: (2024)