Unified Spatiotemporal Token Compression for Video-LLMs at Ultra-Low Retention
Fuente:
arXiv
Salvato in:
| Autori principali: | Du, Junhao, Xue, Jialong, Li, Anqi, Dai, Jincheng, Lu, Guo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Next-Frame Decoding for Ultra-Low-Bitrate Image Compression with Video Diffusion Priors
di: Chen, Yunuo, et al.
Pubblicazione: (2026)
di: Chen, Yunuo, et al.
Pubblicazione: (2026)
Dual-Representation Image Compression at Ultra-Low Bitrates via Explicit Semantics and Implicit Textures
di: Zhou, Chuqin, et al.
Pubblicazione: (2026)
di: Zhou, Chuqin, et al.
Pubblicazione: (2026)
Learning Spatiotemporal Sensitivity in Video LLMs via Counterfactual Reinforcement Learning
di: Du, Dazhao, et al.
Pubblicazione: (2026)
di: Du, Dazhao, et al.
Pubblicazione: (2026)
PVC: Progressive Visual Token Compression for Unified Image and Video Processing in Large Vision-Language Models
di: Yang, Chenyu, et al.
Pubblicazione: (2024)
di: Yang, Chenyu, et al.
Pubblicazione: (2024)
Sharp Eyes and Memory for VideoLLMs: Information-Aware Visual Token Pruning for Efficient and Reliable VideoLLM Reasoning
di: Qin, Jialong, et al.
Pubblicazione: (2025)
di: Qin, Jialong, et al.
Pubblicazione: (2025)
UniCompress: Token Compression for Unified Vision-Language Understanding and Generation
di: Wang, Ziyao, et al.
Pubblicazione: (2026)
di: Wang, Ziyao, et al.
Pubblicazione: (2026)
EarlyTom: Early Token Compression Completes Fast Video Understanding
di: Wang, Hesong, et al.
Pubblicazione: (2026)
di: Wang, Hesong, et al.
Pubblicazione: (2026)
Generative Latent Coding for Ultra-Low Bitrate Image and Video Compression
di: Qi, Linfeng, et al.
Pubblicazione: (2025)
di: Qi, Linfeng, et al.
Pubblicazione: (2025)
TokenDial: Continuous Attribute Control in Text-to-Video via Spatiotemporal Token Offsets
di: Liu, Zhixuan, et al.
Pubblicazione: (2026)
di: Liu, Zhixuan, et al.
Pubblicazione: (2026)
STORM: Token-Efficient Long Video Understanding for Multimodal LLMs
di: Jiang, Jindong, et al.
Pubblicazione: (2025)
di: Jiang, Jindong, et al.
Pubblicazione: (2025)
DynaTok: Temporally Adaptive and Positional Bias-Aware Token Compression for Video-LLMs
di: Park, Minyoung, et al.
Pubblicazione: (2026)
di: Park, Minyoung, et al.
Pubblicazione: (2026)
Structure-Guided Allocation of 2D Gaussians for Image Representation and Compression
di: Liang, Huanxiong, et al.
Pubblicazione: (2025)
di: Liang, Huanxiong, et al.
Pubblicazione: (2025)
Dynamic-VLM: Simple Dynamic Visual Token Compression for VideoLLM
di: Wang, Han, et al.
Pubblicazione: (2024)
di: Wang, Han, et al.
Pubblicazione: (2024)
Representation Shift: Unifying Token Compression with FlashAttention
di: Choi, Joonmyung, et al.
Pubblicazione: (2025)
di: Choi, Joonmyung, et al.
Pubblicazione: (2025)
Video-XL-Pro: Reconstructive Token Compression for Extremely Long Video Understanding
di: Liu, Xiangrui, et al.
Pubblicazione: (2025)
di: Liu, Xiangrui, et al.
Pubblicazione: (2025)
VisionSelector: End-to-End Learnable Visual Token Compression for Efficient Multimodal LLMs
di: Zhu, Jiaying, et al.
Pubblicazione: (2025)
di: Zhu, Jiaying, et al.
Pubblicazione: (2025)
FastSTAR: Spatiotemporal Token Pruning for Efficient Autoregressive Video Synthesis
di: Yune, Sungwoong, et al.
Pubblicazione: (2026)
di: Yune, Sungwoong, et al.
Pubblicazione: (2026)
Token Merging via Spatiotemporal Information Mining for Surgical Video Understanding
di: Jiang, Xixi, et al.
Pubblicazione: (2025)
di: Jiang, Xixi, et al.
Pubblicazione: (2025)
Generative Video Compression with One-Dimensional Latent Representation
di: Zheng, Zihan, et al.
Pubblicazione: (2026)
di: Zheng, Zihan, et al.
Pubblicazione: (2026)
HDCompression: Hybrid-Diffusion Image Compression for Ultra-Low Bitrates
di: Lu, Lei, et al.
Pubblicazione: (2025)
di: Lu, Lei, et al.
Pubblicazione: (2025)
VTok: A Unified Video Tokenizer with Decoupled Spatial-Temporal Latents
di: Wang, Feng, et al.
Pubblicazione: (2026)
di: Wang, Feng, et al.
Pubblicazione: (2026)
RayFormer: Modeling Inter- and Intra-Ray Similarity for NeRF-Based Video Snapshot Compressive Imaging
di: Dong, Yubo, et al.
Pubblicazione: (2026)
di: Dong, Yubo, et al.
Pubblicazione: (2026)
Learning Adaptive and Temporally Causal Video Tokenization in a 1D Latent Space
di: Li, Yan, et al.
Pubblicazione: (2025)
di: Li, Yan, et al.
Pubblicazione: (2025)
VisionTrim: Unified Vision Token Compression for Training-Free MLLM Acceleration
di: Yu, Hanxun, et al.
Pubblicazione: (2026)
di: Yu, Hanxun, et al.
Pubblicazione: (2026)
Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration
di: Zeng, Fanhu, et al.
Pubblicazione: (2025)
di: Zeng, Fanhu, et al.
Pubblicazione: (2025)
Block Modulating Video Compression: An Ultra Low Complexity Image Compression Encoder for Resource Limited Platforms
di: Zheng, Siming, et al.
Pubblicazione: (2022)
di: Zheng, Siming, et al.
Pubblicazione: (2022)
LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding
di: Shen, Xiaoqian, et al.
Pubblicazione: (2024)
di: Shen, Xiaoqian, et al.
Pubblicazione: (2024)
EMCompress: Video-LLMs with Endomorphic Multimodal Compression
di: Fan, Zheyu, et al.
Pubblicazione: (2025)
di: Fan, Zheyu, et al.
Pubblicazione: (2025)
Active Sampling for Ultra-Low-Bit-Rate Video Compression via Conditional Controlled Diffusion
di: Javadi, Amirhosein, et al.
Pubblicazione: (2026)
di: Javadi, Amirhosein, et al.
Pubblicazione: (2026)
TokenBinder: Text-Video Retrieval with One-to-Many Alignment Paradigm
di: Zhang, Bingqing, et al.
Pubblicazione: (2024)
di: Zhang, Bingqing, et al.
Pubblicazione: (2024)
Video Compression with Hierarchical Temporal Neural Representation
di: Zhu, Jun, et al.
Pubblicazione: (2026)
di: Zhu, Jun, et al.
Pubblicazione: (2026)
VIA: Unified Spatiotemporal Video Adaptation Framework for Global and Local Video Editing
di: Gu, Jing, et al.
Pubblicazione: (2024)
di: Gu, Jing, et al.
Pubblicazione: (2024)
KTV: Keyframes and Key Tokens Selection for Efficient Training-Free Video LLMs
di: Song, Baiyang, et al.
Pubblicazione: (2026)
di: Song, Baiyang, et al.
Pubblicazione: (2026)
Real-Time Neural Video Compression with Unified Intra and Inter Coding
di: Xiang, Hui, et al.
Pubblicazione: (2025)
di: Xiang, Hui, et al.
Pubblicazione: (2025)
VideoCanvas: Unified Video Completion from Arbitrary Spatiotemporal Patches via In-Context Conditioning
di: Cai, Minghong, et al.
Pubblicazione: (2025)
di: Cai, Minghong, et al.
Pubblicazione: (2025)
Can Visual Input Be Compressed? A Visual Token Compression Benchmark for Large Multimodal Models
di: Peng, Tianfan, et al.
Pubblicazione: (2025)
di: Peng, Tianfan, et al.
Pubblicazione: (2025)
Exploring Spatiotemporal Feature Propagation for Video-Level Compressive Spectral Reconstruction: Dataset, Model and Benchmark
di: Cai, Lijing, et al.
Pubblicazione: (2026)
di: Cai, Lijing, et al.
Pubblicazione: (2026)
Generative Latent Coding for Ultra-Low Bitrate Image Compression
di: Jia, Zhaoyang, et al.
Pubblicazione: (2025)
di: Jia, Zhaoyang, et al.
Pubblicazione: (2025)
UHR-BAT: Budget-Aware Token Compression Vision-Language model for Ultra-High-Resolution Remote Sensing
di: Dang, Yunkai, et al.
Pubblicazione: (2026)
di: Dang, Yunkai, et al.
Pubblicazione: (2026)
Instinct vs. Reflection: Unifying Token and Verbalized Confidence in Multimodal Large Models
di: Dang, Yunkai, et al.
Pubblicazione: (2026)
di: Dang, Yunkai, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Next-Frame Decoding for Ultra-Low-Bitrate Image Compression with Video Diffusion Priors
di: Chen, Yunuo, et al.
Pubblicazione: (2026) -
Dual-Representation Image Compression at Ultra-Low Bitrates via Explicit Semantics and Implicit Textures
di: Zhou, Chuqin, et al.
Pubblicazione: (2026) -
Learning Spatiotemporal Sensitivity in Video LLMs via Counterfactual Reinforcement Learning
di: Du, Dazhao, et al.
Pubblicazione: (2026) -
PVC: Progressive Visual Token Compression for Unified Image and Video Processing in Large Vision-Language Models
di: Yang, Chenyu, et al.
Pubblicazione: (2024) -
Sharp Eyes and Memory for VideoLLMs: Information-Aware Visual Token Pruning for Efficient and Reliable VideoLLM Reasoning
di: Qin, Jialong, et al.
Pubblicazione: (2025)