When Video Coding Meets Multimodal Large Language Models: A Unified Paradigm for Video Coding
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Pingping, Li, Jinlong, Chen, Kecheng, Wang, Meng, Xu, Long, Li, Haoliang, Sebe, Nicu, Kwong, Sam, Wang, Shiqi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Test-time adaptation for image compression with distribution regularization
di: Chen, Kecheng, et al.
Pubblicazione: (2024)
di: Chen, Kecheng, et al.
Pubblicazione: (2024)
Memory-enhanced Retrieval Augmentation for Long Video Understanding
di: Yuan, Huaying, et al.
Pubblicazione: (2025)
di: Yuan, Huaying, et al.
Pubblicazione: (2025)
UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation
di: Chen, Yanzhe, et al.
Pubblicazione: (2025)
di: Chen, Yanzhe, et al.
Pubblicazione: (2025)
T-GVC: Trajectory-Guided Generative Video Coding at Ultra-Low Bitrates
di: Wang, Zhitao, et al.
Pubblicazione: (2025)
di: Wang, Zhitao, et al.
Pubblicazione: (2025)
Code2Video: A Code-centric Paradigm for Educational Video Generation
di: Chen, Yanzhe, et al.
Pubblicazione: (2025)
di: Chen, Yanzhe, et al.
Pubblicazione: (2025)
Unified Coding for Both Human Perception and Generalized Machine Analytics with CLIP Supervision
di: Yin, Kangsheng, et al.
Pubblicazione: (2025)
di: Yin, Kangsheng, et al.
Pubblicazione: (2025)
Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models
di: Xu, Yifang, et al.
Pubblicazione: (2025)
di: Xu, Yifang, et al.
Pubblicazione: (2025)
Advanced Learning-Based Inter Prediction for Future Video Coding
di: Zhao, Yanchen, et al.
Pubblicazione: (2024)
di: Zhao, Yanchen, et al.
Pubblicazione: (2024)
What Changed? Detecting and Evaluating Instruction-Guided Image Edits with Multimodal Large Language Models
di: Baraldi, Lorenzo, et al.
Pubblicazione: (2025)
di: Baraldi, Lorenzo, et al.
Pubblicazione: (2025)
Multi-task Just Recognizable Difference for Video Coding for Machines: Database, Model, and Coding Application
di: Liu, Junqi, et al.
Pubblicazione: (2026)
di: Liu, Junqi, et al.
Pubblicazione: (2026)
M3FAS: An Accurate and Robust MultiModal Mobile Face Anti-Spoofing System
di: Kong, Chenqi, et al.
Pubblicazione: (2023)
di: Kong, Chenqi, et al.
Pubblicazione: (2023)
In-Loop Filtering Using Learned Look-Up Tables for Video Coding
di: Li, Zhuoyuan, et al.
Pubblicazione: (2025)
di: Li, Zhuoyuan, et al.
Pubblicazione: (2025)
ChatVTG: Video Temporal Grounding via Chat with Video Dialogue Large Language Models
di: Qu, Mengxue, et al.
Pubblicazione: (2024)
di: Qu, Mengxue, et al.
Pubblicazione: (2024)
Multimodal LLM-based Query Paraphrasing for Video Search
di: Wu, Jiaxin, et al.
Pubblicazione: (2024)
di: Wu, Jiaxin, et al.
Pubblicazione: (2024)
PRVR: Partially Relevant Video Retrieval
di: Chen, Xianke, et al.
Pubblicazione: (2022)
di: Chen, Xianke, et al.
Pubblicazione: (2022)
HPC: Hierarchical Progressive Coding Framework for Volumetric Video
di: Zheng, Zihan, et al.
Pubblicazione: (2024)
di: Zheng, Zihan, et al.
Pubblicazione: (2024)
FakeBench: Probing Explainable Fake Image Detection via Large Multimodal Models
di: Li, Yixuan, et al.
Pubblicazione: (2024)
di: Li, Yixuan, et al.
Pubblicazione: (2024)
When and How to Cut Classical Concerts? A Multimodal Automated Video Editing Approach
di: Gonzálbez-Biosca, Daniel, et al.
Pubblicazione: (2025)
di: Gonzálbez-Biosca, Daniel, et al.
Pubblicazione: (2025)
Failures to Surface Harmful Contents in Video Large Language Models
di: Cao, Yuxin, et al.
Pubblicazione: (2025)
di: Cao, Yuxin, et al.
Pubblicazione: (2025)
Scaling and Masking: A New Paradigm of Data Sampling for Image and Video Quality Assessment
di: Liu, Yongxu, et al.
Pubblicazione: (2024)
di: Liu, Yongxu, et al.
Pubblicazione: (2024)
Anim-Director: A Large Multimodal Model Powered Agent for Controllable Animation Video Generation
di: Li, Yunxin, et al.
Pubblicazione: (2024)
di: Li, Yunxin, et al.
Pubblicazione: (2024)
Voxel-GS: Quantized Scaffold Gaussian Splatting Compression with Run-Length Coding
di: Fu, Chunyang, et al.
Pubblicazione: (2025)
di: Fu, Chunyang, et al.
Pubblicazione: (2025)
Recent Advances of End-to-End Video Coding Technologies for AVS Standard Development
di: Sheng, Xihua, et al.
Pubblicazione: (2026)
di: Sheng, Xihua, et al.
Pubblicazione: (2026)
Unified Video-Language Pre-training with Synchronized Audio
di: Mo, Shentong, et al.
Pubblicazione: (2024)
di: Mo, Shentong, et al.
Pubblicazione: (2024)
VideoZeroBench: Probing the Limits of Video MLLMs with Spatio-Temporal Evidence Verification
di: Meng, Jiahao, et al.
Pubblicazione: (2026)
di: Meng, Jiahao, et al.
Pubblicazione: (2026)
Error Analyses of Auto-Regressive Video Diffusion Models: A Unified Framework
di: Wang, Jing, et al.
Pubblicazione: (2025)
di: Wang, Jing, et al.
Pubblicazione: (2025)
DS-NeRV: Implicit Neural Video Representation with Decomposed Static and Dynamic Codes
di: Yan, Hao, et al.
Pubblicazione: (2024)
di: Yan, Hao, et al.
Pubblicazione: (2024)
UVG-VPC: Voxelized Point Cloud Dataset for Visual Volumetric Video-based Coding
di: Gautier, Guillaume, et al.
Pubblicazione: (2025)
di: Gautier, Guillaume, et al.
Pubblicazione: (2025)
Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models
di: Li, Jinlong, et al.
Pubblicazione: (2026)
di: Li, Jinlong, et al.
Pubblicazione: (2026)
ControlFoley: Unified and Controllable Video-to-Audio Generation with Cross-Modal Conflict Handling
di: Yang, Jianxuan, et al.
Pubblicazione: (2026)
di: Yang, Jianxuan, et al.
Pubblicazione: (2026)
Multimodal Fake News Video Explanation: Dataset, Analysis and Evaluation
di: Chen, Lizhi, et al.
Pubblicazione: (2025)
di: Chen, Lizhi, et al.
Pubblicazione: (2025)
MMSD3.0: A Multi-Image Benchmark for Real-World Multimodal Sarcasm Detection
di: Zhao, Haochen, et al.
Pubblicazione: (2025)
di: Zhao, Haochen, et al.
Pubblicazione: (2025)
VideoSTF: Stress-Testing Output Repetition in Video Large Language Models
di: Cao, Yuxin, et al.
Pubblicazione: (2026)
di: Cao, Yuxin, et al.
Pubblicazione: (2026)
MHAD: Multimodal Home Activity Dataset with Multi-Angle Videos and Synchronized Physiological Signals
di: Yu, Lei, et al.
Pubblicazione: (2024)
di: Yu, Lei, et al.
Pubblicazione: (2024)
StreamingEval: A Unified Evaluation Protocol towards Realistic Streaming Video Understanding
di: Tang, Guowei, et al.
Pubblicazione: (2026)
di: Tang, Guowei, et al.
Pubblicazione: (2026)
VCoME: Verbal Video Composition with Multimodal Editing Effects
di: Gong, Weibo, et al.
Pubblicazione: (2024)
di: Gong, Weibo, et al.
Pubblicazione: (2024)
Tora3: Trajectory-Guided Audio-Video Generation with Physical Coherence
di: Liao, Junchao, et al.
Pubblicazione: (2026)
di: Liao, Junchao, et al.
Pubblicazione: (2026)
UniTalking: A Unified Audio-Video Framework for Talking Portrait Generation
di: Li, Hebeizi, et al.
Pubblicazione: (2026)
di: Li, Hebeizi, et al.
Pubblicazione: (2026)
VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering
di: Meng, Yiran, et al.
Pubblicazione: (2025)
di: Meng, Yiran, et al.
Pubblicazione: (2025)
STEAR: Layer-Aware Spatiotemporal Evidence Intervention for Hallucination Mitigation in Video Large Language Models
di: Fan, Linfeng, et al.
Pubblicazione: (2026)
di: Fan, Linfeng, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Test-time adaptation for image compression with distribution regularization
di: Chen, Kecheng, et al.
Pubblicazione: (2024) -
Memory-enhanced Retrieval Augmentation for Long Video Understanding
di: Yuan, Huaying, et al.
Pubblicazione: (2025) -
UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation
di: Chen, Yanzhe, et al.
Pubblicazione: (2025) -
T-GVC: Trajectory-Guided Generative Video Coding at Ultra-Low Bitrates
di: Wang, Zhitao, et al.
Pubblicazione: (2025) -
Code2Video: A Code-centric Paradigm for Educational Video Generation
di: Chen, Yanzhe, et al.
Pubblicazione: (2025)