Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Xia, Hou, Fu, Zheren, Ling, Fangcan, Li, Jiajun, Tu, Yi, Mao, Zhendong, Zhang, Yongdong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Uncertainty-Aware Exploratory Direct Preference Optimization for Multimodal Large Language Models
di: Zhang, Huatian, et al.
Pubblicazione: (2026)
di: Zhang, Huatian, et al.
Pubblicazione: (2026)
Stream-R1: Reliability-Perplexity Aware Reward Distillation for Streaming Video Generation
di: Wu, Bin, et al.
Pubblicazione: (2026)
di: Wu, Bin, et al.
Pubblicazione: (2026)
SparseRM: A Lightweight Preference Modeling with Sparse Autoencoder
di: Liu, Dengcan, et al.
Pubblicazione: (2025)
di: Liu, Dengcan, et al.
Pubblicazione: (2025)
DualReal: Adaptive Joint Training for Lossless Identity-Motion Fusion in Video Customization
di: Wang, Wenchuan, et al.
Pubblicazione: (2025)
di: Wang, Wenchuan, et al.
Pubblicazione: (2025)
FACE-net: Factual Calibration and Emotion Augmentation for Retrieval-enhanced Emotional Video Captioning
di: Chen, Weidong, et al.
Pubblicazione: (2026)
di: Chen, Weidong, et al.
Pubblicazione: (2026)
SVLTA: Benchmarking Vision-Language Temporal Alignment via Synthetic Video Situation
di: Du, Hao, et al.
Pubblicazione: (2025)
di: Du, Hao, et al.
Pubblicazione: (2025)
Exploring Enhanced Contextual Information for Video-Level Object Tracking
di: Kang, Ben, et al.
Pubblicazione: (2024)
di: Kang, Ben, et al.
Pubblicazione: (2024)
Lance: Unified Multimodal Modeling by Multi-Task Synergy
di: Fu, Fengyi, et al.
Pubblicazione: (2026)
di: Fu, Fengyi, et al.
Pubblicazione: (2026)
Sentiment-oriented Transformer-based Variational Autoencoder Network for Live Video Commenting
di: Fu, Fengyi, et al.
Pubblicazione: (2024)
di: Fu, Fengyi, et al.
Pubblicazione: (2024)
SpaceVLLM: Endowing Multimodal Large Language Model with Spatio-Temporal Video Grounding Capability
di: Wang, Jiankang, et al.
Pubblicazione: (2025)
di: Wang, Jiankang, et al.
Pubblicazione: (2025)
Stream-T1: Test-Time Scaling for Streaming Video Generation
di: Tu, Yijing, et al.
Pubblicazione: (2026)
di: Tu, Yijing, et al.
Pubblicazione: (2026)
VideoLLM-online: Online Video Large Language Model for Streaming Video
di: Chen, Joya, et al.
Pubblicazione: (2024)
di: Chen, Joya, et al.
Pubblicazione: (2024)
RealCustom: Narrowing Real Text Word for Real-Time Open-Domain Text-to-Image Customization
di: Huang, Mengqi, et al.
Pubblicazione: (2024)
di: Huang, Mengqi, et al.
Pubblicazione: (2024)
DSE-GAN: Dynamic Semantic Evolution Generative Adversarial Network for Text-to-Image Generation
di: Huang, Mengqi, et al.
Pubblicazione: (2022)
di: Huang, Mengqi, et al.
Pubblicazione: (2022)
RealGeneral: Unifying Visual Generation via Temporal In-Context Learning with Video Models
di: Lin, Yijing, et al.
Pubblicazione: (2025)
di: Lin, Yijing, et al.
Pubblicazione: (2025)
Investigating Video Reasoning Capability of Large Language Models with Tropes in Movies
di: Su, Hung-Ting, et al.
Pubblicazione: (2024)
di: Su, Hung-Ting, et al.
Pubblicazione: (2024)
Dual-path Collaborative Generation Network for Emotional Video Captioning
di: Ye, Cheng, et al.
Pubblicazione: (2024)
di: Ye, Cheng, et al.
Pubblicazione: (2024)
Leveraging Robust Optimization for LLM Alignment under Distribution Shifts
di: Zhu, Mingye, et al.
Pubblicazione: (2025)
di: Zhu, Mingye, et al.
Pubblicazione: (2025)
Geometry-Aware Rotary Position Embedding for Consistent Video World Model
di: Xiang, Chendong, et al.
Pubblicazione: (2026)
di: Xiang, Chendong, et al.
Pubblicazione: (2026)
RealCustom++: Representing Images as Real Textual Word for Real-Time Customization
di: Mao, Zhendong, et al.
Pubblicazione: (2024)
di: Mao, Zhendong, et al.
Pubblicazione: (2024)
T-SVG: Text-Driven Stereoscopic Video Generation
di: Jin, Qiao, et al.
Pubblicazione: (2024)
di: Jin, Qiao, et al.
Pubblicazione: (2024)
Video Summarization with Large Language Models
di: Lee, Min Jung, et al.
Pubblicazione: (2025)
di: Lee, Min Jung, et al.
Pubblicazione: (2025)
ManiVideo: Generating Hand-Object Manipulation Video with Dexterous and Generalizable Grasping
di: Pang, Youxin, et al.
Pubblicazione: (2024)
di: Pang, Youxin, et al.
Pubblicazione: (2024)
Vision-Language Models Assisted Unsupervised Video Anomaly Detection
di: Jiang, Yalong, et al.
Pubblicazione: (2024)
di: Jiang, Yalong, et al.
Pubblicazione: (2024)
VideoGLaMM: A Large Multimodal Model for Pixel-Level Visual Grounding in Videos
di: Munasinghe, Shehan, et al.
Pubblicazione: (2024)
di: Munasinghe, Shehan, et al.
Pubblicazione: (2024)
ViLLa: Video Reasoning Segmentation with Large Language Model
di: Zheng, Rongkun, et al.
Pubblicazione: (2024)
di: Zheng, Rongkun, et al.
Pubblicazione: (2024)
Tango: Taming Visual Signals for Efficient Video Large Language Models
di: Yin, Shukang, et al.
Pubblicazione: (2026)
di: Yin, Shukang, et al.
Pubblicazione: (2026)
Contextualized Diffusion Models for Text-Guided Image and Video Generation
di: Yang, Ling, et al.
Pubblicazione: (2024)
di: Yang, Ling, et al.
Pubblicazione: (2024)
Linear Scaling Video VLMs for Long Video Understanding
di: Eyzaguirre, Cristobal, et al.
Pubblicazione: (2026)
di: Eyzaguirre, Cristobal, et al.
Pubblicazione: (2026)
Video SimpleQA: Towards Factuality Evaluation in Large Video Language Models
di: Cao, Meng, et al.
Pubblicazione: (2025)
di: Cao, Meng, et al.
Pubblicazione: (2025)
VideoHallucer: Evaluating Intrinsic and Extrinsic Hallucinations in Large Video-Language Models
di: Wang, Yuxuan, et al.
Pubblicazione: (2024)
di: Wang, Yuxuan, et al.
Pubblicazione: (2024)
Enhancing Video Large Language Models with Structured Multi-Video Collaborative Reasoning
di: He, Zhihao, et al.
Pubblicazione: (2025)
di: He, Zhihao, et al.
Pubblicazione: (2025)
DynaTok: Temporally Adaptive and Positional Bias-Aware Token Compression for Video-LLMs
di: Park, Minyoung, et al.
Pubblicazione: (2026)
di: Park, Minyoung, et al.
Pubblicazione: (2026)
Large Language Models for Video Surveillance Applications
di: De Silva, Ulindu, et al.
Pubblicazione: (2025)
di: De Silva, Ulindu, et al.
Pubblicazione: (2025)
Prompts to Summaries: Zero-Shot Language-Guided Video Summarization with Large Language and Video Models
di: Barbara, Mario, et al.
Pubblicazione: (2025)
di: Barbara, Mario, et al.
Pubblicazione: (2025)
Video-CCAM: Enhancing Video-Language Understanding with Causal Cross-Attention Masks for Short and Long Videos
di: Fei, Jiajun, et al.
Pubblicazione: (2024)
di: Fei, Jiajun, et al.
Pubblicazione: (2024)
Video-RAG: Visually-aligned Retrieval-Augmented Long Video Comprehension
di: Luo, Yongdong, et al.
Pubblicazione: (2024)
di: Luo, Yongdong, et al.
Pubblicazione: (2024)
Generative Ghost: Investigating Ranking Bias Hidden in AI-Generated Videos
di: Gao, Haowen, et al.
Pubblicazione: (2025)
di: Gao, Haowen, et al.
Pubblicazione: (2025)
A Large-Scale Analysis on Contextual Self-Supervised Video Representation Learning
di: Kumar, Akash, et al.
Pubblicazione: (2025)
di: Kumar, Akash, et al.
Pubblicazione: (2025)
Video Compression Commander: Plug-and-Play Inference Acceleration for Video Large Language Models
di: Liu, Xuyang, et al.
Pubblicazione: (2025)
di: Liu, Xuyang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Uncertainty-Aware Exploratory Direct Preference Optimization for Multimodal Large Language Models
di: Zhang, Huatian, et al.
Pubblicazione: (2026) -
Stream-R1: Reliability-Perplexity Aware Reward Distillation for Streaming Video Generation
di: Wu, Bin, et al.
Pubblicazione: (2026) -
SparseRM: A Lightweight Preference Modeling with Sparse Autoencoder
di: Liu, Dengcan, et al.
Pubblicazione: (2025) -
DualReal: Adaptive Joint Training for Lossless Identity-Motion Fusion in Video Customization
di: Wang, Wenchuan, et al.
Pubblicazione: (2025) -
FACE-net: Factual Calibration and Emotion Augmentation for Retrieval-enhanced Emotional Video Captioning
di: Chen, Weidong, et al.
Pubblicazione: (2026)