VidLBEval: Benchmarking and Mitigating Language Bias in Video-Involved LVLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yang, Yiming, Guo, Yangyang, Lu, Hui, Wang, Yan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CrossVid: A Comprehensive Benchmark for Evaluating Cross-Video Reasoning in Multimodal Large Language Models
par: Li, Jingyao, et autres
Publié: (2025)
par: Li, Jingyao, et autres
Publié: (2025)
AdaVid: Adaptive Video-Language Pretraining
par: Patel, Chaitanya, et autres
Publié: (2025)
par: Patel, Chaitanya, et autres
Publié: (2025)
CounterVid: Counterfactual Video Generation for Mitigating Action and Temporal Hallucinations in Video-Language Models
par: Poppi, Tobia, et autres
Publié: (2026)
par: Poppi, Tobia, et autres
Publié: (2026)
InstructVid2Vid: Controllable Video Editing with Natural Language Instructions
par: Qin, Bosheng, et autres
Publié: (2023)
par: Qin, Bosheng, et autres
Publié: (2023)
SurgVidLM: Towards Multi-grained Surgical Video Understanding with Large Language Model
par: Wang, Guankun, et autres
Publié: (2025)
par: Wang, Guankun, et autres
Publié: (2025)
VidDoS: Universal Denial-of-Service Attack on Video-based Large Language Models
par: Tang, Duoxun, et autres
Publié: (2026)
par: Tang, Duoxun, et autres
Publié: (2026)
SafeVid: Toward Safety Aligned Video Large Multimodal Models
par: Wang, Yixu, et autres
Publié: (2025)
par: Wang, Yixu, et autres
Publié: (2025)
MRFD: Multi-Region Fusion Decoding with Self-Consistency for Mitigating Hallucinations in LVLMs
par: Ge, Haonan, et autres
Publié: (2025)
par: Ge, Haonan, et autres
Publié: (2025)
Mitigating Object Hallucinations in LVLMs via Attention Imbalance Rectification
par: Sun, Han, et autres
Publié: (2026)
par: Sun, Han, et autres
Publié: (2026)
VidEgoThink: Assessing Egocentric Video Understanding Capabilities for Embodied AI
par: Cheng, Sijie, et autres
Publié: (2024)
par: Cheng, Sijie, et autres
Publié: (2024)
VidLaDA: Bidirectional Diffusion Large Language Models for Efficient Video Understanding
par: He, Zhihao, et autres
Publié: (2026)
par: He, Zhihao, et autres
Publié: (2026)
BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations
par: Feng, Weixi, et autres
Publié: (2025)
par: Feng, Weixi, et autres
Publié: (2025)
Optimizing LVLMs with On-Policy Data for Effective Hallucination Mitigation
par: Yu, Chengzhi, et autres
Publié: (2025)
par: Yu, Chengzhi, et autres
Publié: (2025)
CATCH: Complementary Adaptive Token-level Contrastive Decoding to Mitigate Hallucinations in LVLMs
par: Kan, Zhehan, et autres
Publié: (2024)
par: Kan, Zhehan, et autres
Publié: (2024)
VidPrism: Heterogeneous Mixture of Experts for Image-to-Video Transfer
par: Lin, Rui, et autres
Publié: (2026)
par: Lin, Rui, et autres
Publié: (2026)
VidComposition: Can MLLMs Analyze Compositions in Compiled Videos?
par: Tang, Yolo Y., et autres
Publié: (2024)
par: Tang, Yolo Y., et autres
Publié: (2024)
TARAC: Mitigating Hallucination in LVLMs via Temporal Attention Real-time Accumulative Connection
par: Jiang, Lei, et autres
Publié: (2025)
par: Jiang, Lei, et autres
Publié: (2025)
Causally-Grounded Dual-Path Attention Intervention for Object Hallucination Mitigation in LVLMs
par: Yu, Liu, et autres
Publié: (2025)
par: Yu, Liu, et autres
Publié: (2025)
MHSA: A Lightweight Framework for Mitigating Hallucinations via Steered Attention in LVLMs
par: Ding, Wei, et autres
Publié: (2026)
par: Ding, Wei, et autres
Publié: (2026)
Mitigating Cross-Image Information Leakage in LVLMs for Multi-Image Tasks
par: Park, Yeji, et autres
Publié: (2025)
par: Park, Yeji, et autres
Publié: (2025)
RelightVid: Temporal-Consistent Diffusion Model for Video Relighting
par: Fang, Ye, et autres
Publié: (2025)
par: Fang, Ye, et autres
Publié: (2025)
VidTwin: Video VAE with Decoupled Structure and Dynamics
par: Wang, Yuchi, et autres
Publié: (2024)
par: Wang, Yuchi, et autres
Publié: (2024)
Benchmarking and Mitigating Sycophancy in Medical Vision Language Models
par: Xu, Juangui, et autres
Publié: (2025)
par: Xu, Juangui, et autres
Publié: (2025)
VidVec: Unlocking Video MLLM Embeddings for Video-Text Retrieval
par: Tzachor, Issar, et autres
Publié: (2026)
par: Tzachor, Issar, et autres
Publié: (2026)
OTT-Vid: Optimal Transport Temporal Token Compression for Video Large Language Models
par: Kang, Minseok, et autres
Publié: (2026)
par: Kang, Minseok, et autres
Publié: (2026)
Mitigating Hallucinations in Large Vision-Language Models (LVLMs) via Language-Contrastive Decoding (LCD)
par: Manevich, Avshalom, et autres
Publié: (2024)
par: Manevich, Avshalom, et autres
Publié: (2024)
Mitigating the Reasoning Tax in Vision-Language Fine-Tuning with Input-Adaptive Depth Aggregation
par: Ren, Yiming, et autres
Publié: (2026)
par: Ren, Yiming, et autres
Publié: (2026)
Vid-SME: Membership Inference Attacks against Large Video Understanding Models
par: Li, Qi, et autres
Publié: (2025)
par: Li, Qi, et autres
Publié: (2025)
Steering LVLMs via Sparse Autoencoder for Hallucination Mitigation
par: Hua, Zhenglin, et autres
Publié: (2025)
par: Hua, Zhenglin, et autres
Publié: (2025)
BAMI: Training-Free Bias Mitigation in GUI Grounding
par: Zhang, Borui, et autres
Publié: (2026)
par: Zhang, Borui, et autres
Publié: (2026)
Countering the Over-Reliance Trap: Mitigating Object Hallucination for LVLMs via a Self-Validation Framework
par: Liu, Shiyu, et autres
Publié: (2026)
par: Liu, Shiyu, et autres
Publié: (2026)
VidFormer: A novel end-to-end framework fused by 3DCNN and Transformer for Video-based Remote Physiological Measurement
par: Li, Jiachen, et autres
Publié: (2025)
par: Li, Jiachen, et autres
Publié: (2025)
Mitigating Query Selection Bias in Referring Video Object Segmentation
par: Zhang, Dingwei, et autres
Publié: (2025)
par: Zhang, Dingwei, et autres
Publié: (2025)
EdgeVidSum: Real-Time Personalized Video Summarization at the Edge
par: Mujtaba, Ghulam, et autres
Publié: (2025)
par: Mujtaba, Ghulam, et autres
Publié: (2025)
UniVid: Pyramid Diffusion Model for High Quality Video Generation
par: Xiao, Xinyu, et autres
Publié: (2026)
par: Xiao, Xinyu, et autres
Publié: (2026)
VidTok: A Versatile and Open-Source Video Tokenizer
par: Tang, Anni, et autres
Publié: (2024)
par: Tang, Anni, et autres
Publié: (2024)
Identify, Isolate, and Purge: Mitigating Hallucinations in LVLMs via Self-Evolving Distillation
par: Li, Wenhao, et autres
Publié: (2025)
par: Li, Wenhao, et autres
Publié: (2025)
Finding the Correct Visual Evidence Without Forgetting: Mitigating Hallucination in LVLMs via Inter-Layer Visual Attention Discrepancy
par: Xie, Yutong, et autres
Publié: (2026)
par: Xie, Yutong, et autres
Publié: (2026)
Think Before You Act: A Two-Stage Framework for Mitigating Gender Bias Towards Vision-Language Tasks
par: Zhang, Yunqi, et autres
Publié: (2024)
par: Zhang, Yunqi, et autres
Publié: (2024)
VidBridge-R1: Bridging QA and Captioning for RL-based Video Understanding Models with Intermediate Proxy Tasks
par: Chen, Xinlong, et autres
Publié: (2025)
par: Chen, Xinlong, et autres
Publié: (2025)
Documents similaires
-
CrossVid: A Comprehensive Benchmark for Evaluating Cross-Video Reasoning in Multimodal Large Language Models
par: Li, Jingyao, et autres
Publié: (2025) -
AdaVid: Adaptive Video-Language Pretraining
par: Patel, Chaitanya, et autres
Publié: (2025) -
CounterVid: Counterfactual Video Generation for Mitigating Action and Temporal Hallucinations in Video-Language Models
par: Poppi, Tobia, et autres
Publié: (2026) -
InstructVid2Vid: Controllable Video Editing with Natural Language Instructions
par: Qin, Bosheng, et autres
Publié: (2023) -
SurgVidLM: Towards Multi-grained Surgical Video Understanding with Large Language Model
par: Wang, Guankun, et autres
Publié: (2025)