Context Guided Transformer Entropy Modeling for Video Compression
Fuente:
arXiv
Salvato in:
| Autori principali: | Tong, Junlong, Zhang, Wei, Jin, Yaohui, Shen, Xiaoyu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Hybrid Local-Global Context Learning for Neural Video Compression
di: Zhai, Yongqi, et al.
Pubblicazione: (2024)
di: Zhai, Yongqi, et al.
Pubblicazione: (2024)
Efficient Token Compression for Vision Transformer with Spatial Information Preserved
di: Mao, Junzhu, et al.
Pubblicazione: (2025)
di: Mao, Junzhu, et al.
Pubblicazione: (2025)
VidCompress: Memory-Enhanced Temporal Compression for Video Understanding in Large Language Models
di: Lan, Xiaohan, et al.
Pubblicazione: (2024)
di: Lan, Xiaohan, et al.
Pubblicazione: (2024)
Region-Constraint In-Context Generation for Instructional Video Editing
di: Zhang, Zhongwei, et al.
Pubblicazione: (2025)
di: Zhang, Zhongwei, et al.
Pubblicazione: (2025)
ROI-Guided Point Cloud Geometry Compression Towards Human and Machine Vision
di: Liang, Xie, et al.
Pubblicazione: (2025)
di: Liang, Xie, et al.
Pubblicazione: (2025)
GSVC: Efficient Video Representation and Compression Through 2D Gaussian Splatting
di: Wang, Longan, et al.
Pubblicazione: (2025)
di: Wang, Longan, et al.
Pubblicazione: (2025)
Context-Enhanced Video Moment Retrieval with Large Language Models
di: Liu, Weijia, et al.
Pubblicazione: (2024)
di: Liu, Weijia, et al.
Pubblicazione: (2024)
A Tri-Dynamic Preprocessing Framework for UGC Video Compression
di: Zhao, Fei, et al.
Pubblicazione: (2025)
di: Zhao, Fei, et al.
Pubblicazione: (2025)
A Preprocessing Framework for Video Machine Vision under Compression
di: Zhao, Fei, et al.
Pubblicazione: (2025)
di: Zhao, Fei, et al.
Pubblicazione: (2025)
Rate-aware Compression for NeRF-based Volumetric Video
di: Zhang, Zhiyu, et al.
Pubblicazione: (2024)
di: Zhang, Zhiyu, et al.
Pubblicazione: (2024)
Reversing the Damage: A QP-Aware Transformer-Diffusion Approach for 8K Video Restoration under Codec Compression
di: Dehaghi, Ali Mollaahmadi, et al.
Pubblicazione: (2024)
di: Dehaghi, Ali Mollaahmadi, et al.
Pubblicazione: (2024)
Learning Video Context as Interleaved Multimodal Sequences
di: Lin, Kevin Qinghong, et al.
Pubblicazione: (2024)
di: Lin, Kevin Qinghong, et al.
Pubblicazione: (2024)
L-LBVC: Long-Term Motion Estimation and Prediction for Learned Bi-Directional Video Compression
di: Zhai, Yongqi, et al.
Pubblicazione: (2025)
di: Zhai, Yongqi, et al.
Pubblicazione: (2025)
Failures to Surface Harmful Contents in Video Large Language Models
di: Cao, Yuxin, et al.
Pubblicazione: (2025)
di: Cao, Yuxin, et al.
Pubblicazione: (2025)
SMC++: Masked Learning of Unsupervised Video Semantic Compression
di: Tian, Yuan, et al.
Pubblicazione: (2024)
di: Tian, Yuan, et al.
Pubblicazione: (2024)
D-FCGS: Feedforward Compression of Dynamic Gaussian Splatting for Free-Viewpoint Videos
di: Zhang, Wenkang, et al.
Pubblicazione: (2025)
di: Zhang, Wenkang, et al.
Pubblicazione: (2025)
SmartSplat: Feature-Smart Gaussians for Scalable Compression of Ultra-High-Resolution Images
di: Li, Linfei, et al.
Pubblicazione: (2025)
di: Li, Linfei, et al.
Pubblicazione: (2025)
Accelerated Event-Based Feature Detection and Compression for Surveillance Video Systems
di: Freeman, Andrew C., et al.
Pubblicazione: (2023)
di: Freeman, Andrew C., et al.
Pubblicazione: (2023)
SSNVC: Single Stream Neural Video Compression with Implicit Temporal Information
di: Wang, Feng, et al.
Pubblicazione: (2024)
di: Wang, Feng, et al.
Pubblicazione: (2024)
EntroAD: Structural Entropy-Guided Prompt Adaptation for Zero-Shot Anomaly Detection
di: Zhao, Xinyu, et al.
Pubblicazione: (2026)
di: Zhao, Xinyu, et al.
Pubblicazione: (2026)
Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval
di: Fang, Xiang, et al.
Pubblicazione: (2026)
di: Fang, Xiang, et al.
Pubblicazione: (2026)
Video Summarisation with Incident and Context Information using Generative AI
di: De Silva, Ulindu, et al.
Pubblicazione: (2025)
di: De Silva, Ulindu, et al.
Pubblicazione: (2025)
Compression of 3D Gaussian Splatting with Optimized Feature Planes and Standard Video Codecs
di: Lee, Soonbin, et al.
Pubblicazione: (2025)
di: Lee, Soonbin, et al.
Pubblicazione: (2025)
UniAnimate-DiT: Human Image Animation with Large-Scale Video Diffusion Transformer
di: Wang, Xiang, et al.
Pubblicazione: (2025)
di: Wang, Xiang, et al.
Pubblicazione: (2025)
GaussianForest: Hierarchical-Hybrid 3D Gaussian Splatting for Compressed Scene Modeling
di: Zhang, Fengyi, et al.
Pubblicazione: (2024)
di: Zhang, Fengyi, et al.
Pubblicazione: (2024)
LipGen: Viseme-Guided Lip Video Generation for Enhancing Visual Speech Recognition
di: Hao, Bowen, et al.
Pubblicazione: (2025)
di: Hao, Bowen, et al.
Pubblicazione: (2025)
Learned Image Compression with Hierarchical Progressive Context Modeling
di: Li, Yuqi, et al.
Pubblicazione: (2025)
di: Li, Yuqi, et al.
Pubblicazione: (2025)
MFQE 2.0: A New Approach for Multi-frame Quality Enhancement on Compressed Video
di: Xing, Qunliang, et al.
Pubblicazione: (2019)
di: Xing, Qunliang, et al.
Pubblicazione: (2019)
HDCompression: Hybrid-Diffusion Image Compression for Ultra-Low Bitrates
di: Lu, Lei, et al.
Pubblicazione: (2025)
di: Lu, Lei, et al.
Pubblicazione: (2025)
VideoZeroBench: Probing the Limits of Video MLLMs with Spatio-Temporal Evidence Verification
di: Meng, Jiahao, et al.
Pubblicazione: (2026)
di: Meng, Jiahao, et al.
Pubblicazione: (2026)
T-GVC: Trajectory-Guided Generative Video Coding at Ultra-Low Bitrates
di: Wang, Zhitao, et al.
Pubblicazione: (2025)
di: Wang, Zhitao, et al.
Pubblicazione: (2025)
Delving Deeper: Hierarchical Visual Perception for Robust Video-Text Retrieval
di: Xie, Zequn, et al.
Pubblicazione: (2026)
di: Xie, Zequn, et al.
Pubblicazione: (2026)
Rendering-Oriented 3D Point Cloud Attribute Compression using Sparse Tensor-based Transformer
di: Huo, Xiao, et al.
Pubblicazione: (2024)
di: Huo, Xiao, et al.
Pubblicazione: (2024)
Transformer-based Video Saliency Prediction with High Temporal Dimension Decoding
di: Moradi, Morteza, et al.
Pubblicazione: (2024)
di: Moradi, Morteza, et al.
Pubblicazione: (2024)
Context-aware TFL: A Universal Context-aware Contrastive Learning Framework for Temporal Forgery Localization
di: Yin, Qilin, et al.
Pubblicazione: (2025)
di: Yin, Qilin, et al.
Pubblicazione: (2025)
Arena: A Patch-of-Interest ViT Inference Acceleration System for Edge-Assisted Video Analytics
di: Peng, Haosong, et al.
Pubblicazione: (2024)
di: Peng, Haosong, et al.
Pubblicazione: (2024)
TAVGBench: Benchmarking Text to Audible-Video Generation
di: Mao, Yuxin, et al.
Pubblicazione: (2024)
di: Mao, Yuxin, et al.
Pubblicazione: (2024)
Teacher-Guided Pseudo Supervision and Cross-Modal Alignment for Audio-Visual Video Parsing
di: Chen, Yaru, et al.
Pubblicazione: (2025)
di: Chen, Yaru, et al.
Pubblicazione: (2025)
PolySmart @ TRECVid 2024 Video Captioning (VTT)
di: Wu, Jiaxin, et al.
Pubblicazione: (2024)
di: Wu, Jiaxin, et al.
Pubblicazione: (2024)
Video2Roleplay: A Multimodal Dataset and Framework for Video-Guided Role-playing Agents
di: Zhang, Xueqiao, et al.
Pubblicazione: (2025)
di: Zhang, Xueqiao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Hybrid Local-Global Context Learning for Neural Video Compression
di: Zhai, Yongqi, et al.
Pubblicazione: (2024) -
Efficient Token Compression for Vision Transformer with Spatial Information Preserved
di: Mao, Junzhu, et al.
Pubblicazione: (2025) -
VidCompress: Memory-Enhanced Temporal Compression for Video Understanding in Large Language Models
di: Lan, Xiaohan, et al.
Pubblicazione: (2024) -
Region-Constraint In-Context Generation for Instructional Video Editing
di: Zhang, Zhongwei, et al.
Pubblicazione: (2025) -
ROI-Guided Point Cloud Geometry Compression Towards Human and Machine Vision
di: Liang, Xie, et al.
Pubblicazione: (2025)