CounterVid: Counterfactual Video Generation for Mitigating Action and Temporal Hallucinations in Video-Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Poppi, Tobia, Uzkent, Burak, Garg, Amanmeet, Porto, Lucas, Kessler, Garin, Yang, Yezhou, Cornia, Marcella, Baraldi, Lorenzo, Cucchiara, Rita, Schiffers, Florian |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Safe-CLIP: Removing NSFW Concepts from Vision-and-Language Models
di: Poppi, Samuele, et al.
Pubblicazione: (2023)
di: Poppi, Samuele, et al.
Pubblicazione: (2023)
Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization
di: Compagnoni, Alberto, et al.
Pubblicazione: (2025)
di: Compagnoni, Alberto, et al.
Pubblicazione: (2025)
BRIDGE: Bridging Gaps in Image Captioning Evaluation with Stronger Visual Cues
di: Sarto, Sara, et al.
Pubblicazione: (2024)
di: Sarto, Sara, et al.
Pubblicazione: (2024)
Hyperbolic Safety-Aware Vision-Language Models
di: Poppi, Tobia, et al.
Pubblicazione: (2025)
di: Poppi, Tobia, et al.
Pubblicazione: (2025)
Learning to Mask and Permute Visual Tokens for Vision Transformer Pre-Training
di: Baraldi, Lorenzo, et al.
Pubblicazione: (2023)
di: Baraldi, Lorenzo, et al.
Pubblicazione: (2023)
Contrasting Deepfakes Diffusion via Contrastive Learning and Global-Local Similarities
di: Baraldi, Lorenzo, et al.
Pubblicazione: (2024)
di: Baraldi, Lorenzo, et al.
Pubblicazione: (2024)
Tiny Inference-Time Scaling with Latent Verifiers
di: Bucciarelli, Davide, et al.
Pubblicazione: (2026)
di: Bucciarelli, Davide, et al.
Pubblicazione: (2026)
Recurrence-Enhanced Vision-and-Language Transformers for Robust Multimodal Document Retrieval
di: Caffagni, Davide, et al.
Pubblicazione: (2025)
di: Caffagni, Davide, et al.
Pubblicazione: (2025)
Positive-Augmented Contrastive Learning for Vision-and-Language Evaluation and Training
di: Sarto, Sara, et al.
Pubblicazione: (2024)
di: Sarto, Sara, et al.
Pubblicazione: (2024)
Towards Retrieval-Augmented Architectures for Image Captioning
di: Sarto, Sara, et al.
Pubblicazione: (2024)
di: Sarto, Sara, et al.
Pubblicazione: (2024)
Recurrence Meets Transformers for Universal Multimodal Retrieval
di: Caffagni, Davide, et al.
Pubblicazione: (2025)
di: Caffagni, Davide, et al.
Pubblicazione: (2025)
Augmenting Multimodal LLMs with Self-Reflective Tokens for Knowledge-based Visual Question Answering
di: Cocchi, Federico, et al.
Pubblicazione: (2024)
di: Cocchi, Federico, et al.
Pubblicazione: (2024)
Revisiting Image Captioning Training Paradigm via Direct CLIP-based Optimization
di: Moratelli, Nicholas, et al.
Pubblicazione: (2024)
di: Moratelli, Nicholas, et al.
Pubblicazione: (2024)
Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis
di: Bucciarelli, Davide, et al.
Pubblicazione: (2024)
di: Bucciarelli, Davide, et al.
Pubblicazione: (2024)
What Changed? Detecting and Evaluating Instruction-Guided Image Edits with Multimodal Large Language Models
di: Baraldi, Lorenzo, et al.
Pubblicazione: (2025)
di: Baraldi, Lorenzo, et al.
Pubblicazione: (2025)
RaTA-Tool: Retrieval-based Tool Selection with Multimodal Large Language Models
di: Mattioli, Gabriele, et al.
Pubblicazione: (2026)
di: Mattioli, Gabriele, et al.
Pubblicazione: (2026)
Parents and Children: Distinguishing Multimodal DeepFakes from Natural Images
di: Amoroso, Roberto, et al.
Pubblicazione: (2023)
di: Amoroso, Roberto, et al.
Pubblicazione: (2023)
Fashion-RAG: Multimodal Fashion Image Editing via Retrieval-Augmented Generation
di: Sanguigni, Fulvio, et al.
Pubblicazione: (2025)
di: Sanguigni, Fulvio, et al.
Pubblicazione: (2025)
LLaVA-MORE: A Comparative Study of LLMs and Visual Backbones for Enhanced Visual Instruction Tuning
di: Cocchi, Federico, et al.
Pubblicazione: (2025)
di: Cocchi, Federico, et al.
Pubblicazione: (2025)
Wiki-LLaVA: Hierarchical Retrieval-Augmented Generation for Multimodal LLMs
di: Caffagni, Davide, et al.
Pubblicazione: (2024)
di: Caffagni, Davide, et al.
Pubblicazione: (2024)
The Revolution of Multimodal Large Language Models: A Survey
di: Caffagni, Davide, et al.
Pubblicazione: (2024)
di: Caffagni, Davide, et al.
Pubblicazione: (2024)
ReAG: Reasoning-Augmented Generation for Knowledge-based Visual Question Answering
di: Compagnoni, Alberto, et al.
Pubblicazione: (2025)
di: Compagnoni, Alberto, et al.
Pubblicazione: (2025)
Seeing Beyond Words: Self-Supervised Visual Learning for Multimodal Large Language Models
di: Caffagni, Davide, et al.
Pubblicazione: (2025)
di: Caffagni, Davide, et al.
Pubblicazione: (2025)
Multi-Class Unlearning for Image Classification via Weight Filtering
di: Poppi, Samuele, et al.
Pubblicazione: (2023)
di: Poppi, Samuele, et al.
Pubblicazione: (2023)
Few Channels Draw The Whole Picture: Revealing Massive Activations in Diffusion Transformers
di: Turri, Evelyn, et al.
Pubblicazione: (2026)
di: Turri, Evelyn, et al.
Pubblicazione: (2026)
Learning to Rank Caption Chains for Video-Text Alignment
di: Blume, Ansel, et al.
Pubblicazione: (2026)
di: Blume, Ansel, et al.
Pubblicazione: (2026)
Narrative Aligned Long Form Video Question Answering
di: Jain, Rahul, et al.
Pubblicazione: (2026)
di: Jain, Rahul, et al.
Pubblicazione: (2026)
Improving LLM First-Token Predictions in Multiple-Choice Question Answering via Output Prefilling
di: Cappelletti, Silvia, et al.
Pubblicazione: (2025)
di: Cappelletti, Silvia, et al.
Pubblicazione: (2025)
Hallucination Localization in Video Captioning
di: Nakada, Shota, et al.
Pubblicazione: (2025)
di: Nakada, Shota, et al.
Pubblicazione: (2025)
FlowVid: Taming Imperfect Optical Flows for Consistent Video-to-Video Synthesis
di: Liang, Feng, et al.
Pubblicazione: (2023)
di: Liang, Feng, et al.
Pubblicazione: (2023)
InstructVid2Vid: Controllable Video Editing with Natural Language Instructions
di: Qin, Bosheng, et al.
Pubblicazione: (2023)
di: Qin, Bosheng, et al.
Pubblicazione: (2023)
Causal Graphical Models for Vision-Language Compositional Understanding
di: Parascandolo, Fiorenzo, et al.
Pubblicazione: (2024)
di: Parascandolo, Fiorenzo, et al.
Pubblicazione: (2024)
Fluent and Accurate Image Captioning with a Self-Trained Reward Model
di: Moratelli, Nicholas, et al.
Pubblicazione: (2024)
di: Moratelli, Nicholas, et al.
Pubblicazione: (2024)
Cross-Platform Neural Video Coding: A Case Study
di: Conceição, Ruhan, et al.
Pubblicazione: (2024)
di: Conceição, Ruhan, et al.
Pubblicazione: (2024)
VidCompress: Memory-Enhanced Temporal Compression for Video Understanding in Large Language Models
di: Lan, Xiaohan, et al.
Pubblicazione: (2024)
di: Lan, Xiaohan, et al.
Pubblicazione: (2024)
STEAR: Layer-Aware Spatiotemporal Evidence Intervention for Hallucination Mitigation in Video Large Language Models
di: Fan, Linfeng, et al.
Pubblicazione: (2026)
di: Fan, Linfeng, et al.
Pubblicazione: (2026)
VidCtx: Context-aware Video Question Answering with Image Models
di: Goulas, Andreas, et al.
Pubblicazione: (2024)
di: Goulas, Andreas, et al.
Pubblicazione: (2024)
UniVid: Pyramid Diffusion Model for High Quality Video Generation
di: Xiao, Xinyu, et al.
Pubblicazione: (2026)
di: Xiao, Xinyu, et al.
Pubblicazione: (2026)
CounterFlow: A Two-Phase Inference-Time Sampling for Counterfactual Video Foley Generation
di: Lee, Gyubin, et al.
Pubblicazione: (2026)
di: Lee, Gyubin, et al.
Pubblicazione: (2026)
VidTune: Creating Video Soundtracks with Generative Music and Contextual Thumbnails
di: Huh, Mina, et al.
Pubblicazione: (2026)
di: Huh, Mina, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Safe-CLIP: Removing NSFW Concepts from Vision-and-Language Models
di: Poppi, Samuele, et al.
Pubblicazione: (2023) -
Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization
di: Compagnoni, Alberto, et al.
Pubblicazione: (2025) -
BRIDGE: Bridging Gaps in Image Captioning Evaluation with Stronger Visual Cues
di: Sarto, Sara, et al.
Pubblicazione: (2024) -
Hyperbolic Safety-Aware Vision-Language Models
di: Poppi, Tobia, et al.
Pubblicazione: (2025) -
Learning to Mask and Permute Visual Tokens for Vision Transformer Pre-Training
di: Baraldi, Lorenzo, et al.
Pubblicazione: (2023)