Image Captioning Evaluation in the Age of Multimodal LLMs: Challenges and Future Perspectives
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sarto, Sara, Cornia, Marcella, Cucchiara, Rita |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
BRIDGE: Bridging Gaps in Image Captioning Evaluation with Stronger Visual Cues
par: Sarto, Sara, et autres
Publié: (2024)
par: Sarto, Sara, et autres
Publié: (2024)
Towards Retrieval-Augmented Architectures for Image Captioning
par: Sarto, Sara, et autres
Publié: (2024)
par: Sarto, Sara, et autres
Publié: (2024)
Recurrence Meets Transformers for Universal Multimodal Retrieval
par: Caffagni, Davide, et autres
Publié: (2025)
par: Caffagni, Davide, et autres
Publié: (2025)
Recurrence-Enhanced Vision-and-Language Transformers for Robust Multimodal Document Retrieval
par: Caffagni, Davide, et autres
Publié: (2025)
par: Caffagni, Davide, et autres
Publié: (2025)
Positive-Augmented Contrastive Learning for Vision-and-Language Evaluation and Training
par: Sarto, Sara, et autres
Publié: (2024)
par: Sarto, Sara, et autres
Publié: (2024)
Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis
par: Bucciarelli, Davide, et autres
Publié: (2024)
par: Bucciarelli, Davide, et autres
Publié: (2024)
Wiki-LLaVA: Hierarchical Retrieval-Augmented Generation for Multimodal LLMs
par: Caffagni, Davide, et autres
Publié: (2024)
par: Caffagni, Davide, et autres
Publié: (2024)
Revisiting Image Captioning Training Paradigm via Direct CLIP-based Optimization
par: Moratelli, Nicholas, et autres
Publié: (2024)
par: Moratelli, Nicholas, et autres
Publié: (2024)
RaTA-Tool: Retrieval-based Tool Selection with Multimodal Large Language Models
par: Mattioli, Gabriele, et autres
Publié: (2026)
par: Mattioli, Gabriele, et autres
Publié: (2026)
LLaVA-MORE: A Comparative Study of LLMs and Visual Backbones for Enhanced Visual Instruction Tuning
par: Cocchi, Federico, et autres
Publié: (2025)
par: Cocchi, Federico, et autres
Publié: (2025)
Look Twice: Training-Free Evidence Highlighting in Multimodal Large Language Models
par: Morini, Marco, et autres
Publié: (2026)
par: Morini, Marco, et autres
Publié: (2026)
Augmenting Multimodal LLMs with Self-Reflective Tokens for Knowledge-based Visual Question Answering
par: Cocchi, Federico, et autres
Publié: (2024)
par: Cocchi, Federico, et autres
Publié: (2024)
Multi-Class Unlearning for Image Classification via Weight Filtering
par: Poppi, Samuele, et autres
Publié: (2023)
par: Poppi, Samuele, et autres
Publié: (2023)
Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization
par: Compagnoni, Alberto, et autres
Publié: (2025)
par: Compagnoni, Alberto, et autres
Publié: (2025)
The Revolution of Multimodal Large Language Models: A Survey
par: Caffagni, Davide, et autres
Publié: (2024)
par: Caffagni, Davide, et autres
Publié: (2024)
Seeing Beyond Words: Self-Supervised Visual Learning for Multimodal Large Language Models
par: Caffagni, Davide, et autres
Publié: (2025)
par: Caffagni, Davide, et autres
Publié: (2025)
What Changed? Detecting and Evaluating Instruction-Guided Image Edits with Multimodal Large Language Models
par: Baraldi, Lorenzo, et autres
Publié: (2025)
par: Baraldi, Lorenzo, et autres
Publié: (2025)
ReAG: Reasoning-Augmented Generation for Knowledge-based Visual Question Answering
par: Compagnoni, Alberto, et autres
Publié: (2025)
par: Compagnoni, Alberto, et autres
Publié: (2025)
Fashion-RAG: Multimodal Fashion Image Editing via Retrieval-Augmented Generation
par: Sanguigni, Fulvio, et autres
Publié: (2025)
par: Sanguigni, Fulvio, et autres
Publié: (2025)
Embodied Agents for Efficient Exploration and Smart Scene Description
par: Bigazzi, Roberto, et autres
Publié: (2023)
par: Bigazzi, Roberto, et autres
Publié: (2023)
Unveiling the Truth: Exploring Human Gaze Patterns in Fake Images
par: Cartella, Giuseppe, et autres
Publié: (2024)
par: Cartella, Giuseppe, et autres
Publié: (2024)
Safe-CLIP: Removing NSFW Concepts from Vision-and-Language Models
par: Poppi, Samuele, et autres
Publié: (2023)
par: Poppi, Samuele, et autres
Publié: (2023)
Explore and Explain: Self-supervised Navigation and Recounting
par: Bigazzi, Roberto, et autres
Publié: (2020)
par: Bigazzi, Roberto, et autres
Publié: (2020)
Fluent and Accurate Image Captioning with a Self-Trained Reward Model
par: Moratelli, Nicholas, et autres
Publié: (2024)
par: Moratelli, Nicholas, et autres
Publié: (2024)
Parents and Children: Distinguishing Multimodal DeepFakes from Natural Images
par: Amoroso, Roberto, et autres
Publié: (2023)
par: Amoroso, Roberto, et autres
Publié: (2023)
Talking to DINO: Bridging Self-Supervised Vision Backbones with Language for Open-Vocabulary Segmentation
par: Barsellotti, Luca, et autres
Publié: (2024)
par: Barsellotti, Luca, et autres
Publié: (2024)
Trends, Applications, and Challenges in Human Attention Modelling
par: Cartella, Giuseppe, et autres
Publié: (2024)
par: Cartella, Giuseppe, et autres
Publié: (2024)
Few Channels Draw The Whole Picture: Revealing Massive Activations in Diffusion Transformers
par: Turri, Evelyn, et autres
Publié: (2026)
par: Turri, Evelyn, et autres
Publié: (2026)
CounterVid: Counterfactual Video Generation for Mitigating Action and Temporal Hallucinations in Video-Language Models
par: Poppi, Tobia, et autres
Publié: (2026)
par: Poppi, Tobia, et autres
Publié: (2026)
Modeling Human Gaze Behavior with Diffusion Models for Unified Scanpath Prediction
par: Cartella, Giuseppe, et autres
Publié: (2025)
par: Cartella, Giuseppe, et autres
Publié: (2025)
Learning to Mask and Permute Visual Tokens for Vision Transformer Pre-Training
par: Baraldi, Lorenzo, et autres
Publié: (2023)
par: Baraldi, Lorenzo, et autres
Publié: (2023)
Spot the Difference: A Novel Task for Embodied Agents in Changing Environments
par: Landi, Federico, et autres
Publié: (2022)
par: Landi, Federico, et autres
Publié: (2022)
Contrasting Deepfakes Diffusion via Contrastive Learning and Global-Local Similarities
par: Baraldi, Lorenzo, et autres
Publié: (2024)
par: Baraldi, Lorenzo, et autres
Publié: (2024)
Tiny Inference-Time Scaling with Latent Verifiers
par: Bucciarelli, Davide, et autres
Publié: (2026)
par: Bucciarelli, Davide, et autres
Publié: (2026)
Embodied Navigation at the Art Gallery
par: Bigazzi, Roberto, et autres
Publié: (2022)
par: Bigazzi, Roberto, et autres
Publié: (2022)
Multimodal-Conditioned Latent Diffusion Models for Fashion Image Editing
par: Baldrati, Alberto, et autres
Publié: (2024)
par: Baldrati, Alberto, et autres
Publié: (2024)
TPP-Gaze: Modelling Gaze Dynamics in Space and Time with Neural Temporal Point Processes
par: D'Amelio, Alessandro, et autres
Publié: (2024)
par: D'Amelio, Alessandro, et autres
Publié: (2024)
FLEUR: An Explainable Reference-Free Evaluation Metric for Image Captioning Using a Large Multimodal Model
par: Lee, Yebin, et autres
Publié: (2024)
par: Lee, Yebin, et autres
Publié: (2024)
The Power of Many: Multi-Agent Multimodal Models for Cultural Image Captioning
par: Bai, Longju, et autres
Publié: (2024)
par: Bai, Longju, et autres
Publié: (2024)
Polos: Multimodal Metric Learning from Human Feedback for Image Captioning
par: Wada, Yuiga, et autres
Publié: (2024)
par: Wada, Yuiga, et autres
Publié: (2024)
Documents similaires
-
BRIDGE: Bridging Gaps in Image Captioning Evaluation with Stronger Visual Cues
par: Sarto, Sara, et autres
Publié: (2024) -
Towards Retrieval-Augmented Architectures for Image Captioning
par: Sarto, Sara, et autres
Publié: (2024) -
Recurrence Meets Transformers for Universal Multimodal Retrieval
par: Caffagni, Davide, et autres
Publié: (2025) -
Recurrence-Enhanced Vision-and-Language Transformers for Robust Multimodal Document Retrieval
par: Caffagni, Davide, et autres
Publié: (2025) -
Positive-Augmented Contrastive Learning for Vision-and-Language Evaluation and Training
par: Sarto, Sara, et autres
Publié: (2024)