MambaVideo for Discrete Video Tokenization with Channel-Split Quantization
Fuente:
arXiv
Salvato in:
| Autori principali: | Argaw, Dawit Mureja, Liu, Xian, Chung, Joon Son, Liu, Ming-Yu, Reda, Fitsum |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Scaling Up Video Summarization Pretraining with Large Language Models
di: Argaw, Dawit Mureja, et al.
Pubblicazione: (2024)
di: Argaw, Dawit Mureja, et al.
Pubblicazione: (2024)
Towards Automated Movie Trailer Generation
di: Argaw, Dawit Mureja, et al.
Pubblicazione: (2024)
di: Argaw, Dawit Mureja, et al.
Pubblicazione: (2024)
InfoTok: Adaptive Discrete Video Tokenizer via Information-Theoretic Compression
di: Ye, Haotian, et al.
Pubblicazione: (2025)
di: Ye, Haotian, et al.
Pubblicazione: (2025)
Let Me Finish My Sentence: Video Temporal Grounding with Holistic Text Understanding
di: Woo, Jongbhin, et al.
Pubblicazione: (2024)
di: Woo, Jongbhin, et al.
Pubblicazione: (2024)
Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs
di: Jung, Chaeyoung, et al.
Pubblicazione: (2026)
di: Jung, Chaeyoung, et al.
Pubblicazione: (2026)
VideoMAP: Toward Scalable Mamba-based Video Autoregressive Pretraining
di: Liu, Yunze, et al.
Pubblicazione: (2025)
di: Liu, Yunze, et al.
Pubblicazione: (2025)
Vivim: a Video Vision Mamba for Medical Video Segmentation
di: Yang, Yijun, et al.
Pubblicazione: (2024)
di: Yang, Yijun, et al.
Pubblicazione: (2024)
VideoMamba: State Space Model for Efficient Video Understanding
di: Li, Kunchang, et al.
Pubblicazione: (2024)
di: Li, Kunchang, et al.
Pubblicazione: (2024)
Plenoptic Video Generation
di: Fu, Xiao, et al.
Pubblicazione: (2026)
di: Fu, Xiao, et al.
Pubblicazione: (2026)
MVQA: Mamba with Unified Sampling for Efficient Video Quality Assessment
di: Mi, Yachun, et al.
Pubblicazione: (2025)
di: Mi, Yachun, et al.
Pubblicazione: (2025)
Matten: Video Generation with Mamba-Attention
di: Gao, Yu, et al.
Pubblicazione: (2024)
di: Gao, Yu, et al.
Pubblicazione: (2024)
V2SFlow: Video-to-Speech Generation with Speech Decomposition and Rectified Flow
di: Choi, Jeongsoo, et al.
Pubblicazione: (2024)
di: Choi, Jeongsoo, et al.
Pubblicazione: (2024)
Video-XL-Pro: Reconstructive Token Compression for Extremely Long Video Understanding
di: Liu, Xiangrui, et al.
Pubblicazione: (2025)
di: Liu, Xiangrui, et al.
Pubblicazione: (2025)
Aligning Effective Tokens with Video Anomaly in Large Language Models
di: Chen, Yingxian, et al.
Pubblicazione: (2025)
di: Chen, Yingxian, et al.
Pubblicazione: (2025)
OneVAE: Joint Discrete and Continuous Optimization Helps Discrete Video VAE Train Better
di: Zhou, Yupeng, et al.
Pubblicazione: (2025)
di: Zhou, Yupeng, et al.
Pubblicazione: (2025)
Moment Quantization for Video Temporal Grounding
di: Sun, Xiaolong, et al.
Pubblicazione: (2025)
di: Sun, Xiaolong, et al.
Pubblicazione: (2025)
Towards Joint Quantization and Token Pruning of Vision-Language Models
di: Li, Xinqing, et al.
Pubblicazione: (2026)
di: Li, Xinqing, et al.
Pubblicazione: (2026)
Video Diffusion Models Excel at Tracking Similar-Looking Objects Without Supervision
di: Zhang, Chenshuang, et al.
Pubblicazione: (2025)
di: Zhang, Chenshuang, et al.
Pubblicazione: (2025)
MoLT: Mixture of Layer-Wise Tokens for Efficient Audio-Visual Learning
di: Rho, Kyeongha, et al.
Pubblicazione: (2025)
di: Rho, Kyeongha, et al.
Pubblicazione: (2025)
DiTPainter: Efficient Video Inpainting with Diffusion Transformers
di: Wu, Xian, et al.
Pubblicazione: (2025)
di: Wu, Xian, et al.
Pubblicazione: (2025)
Layer-Aware Video Composition via Split-then-Merge
di: Kara, Ozgur, et al.
Pubblicazione: (2025)
di: Kara, Ozgur, et al.
Pubblicazione: (2025)
AVCD: Mitigating Hallucinations in Audio-Visual Large Language Models through Contrastive Decoding
di: Jung, Chaeyoung, et al.
Pubblicazione: (2025)
di: Jung, Chaeyoung, et al.
Pubblicazione: (2025)
Test-Time Augmentation for Pose-invariant Face Recognition
di: Jung, Jaemin, et al.
Pubblicazione: (2025)
di: Jung, Jaemin, et al.
Pubblicazione: (2025)
On the Nature of Attention Sink that Shapes Decoding Strategy in Omni-LLMs
di: Yoo, Suho, et al.
Pubblicazione: (2026)
di: Yoo, Suho, et al.
Pubblicazione: (2026)
TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval
di: Shen, Leqi, et al.
Pubblicazione: (2024)
di: Shen, Leqi, et al.
Pubblicazione: (2024)
STNMamba: Mamba-based Spatial-Temporal Normality Learning for Video Anomaly Detection
di: Li, Zhangxun, et al.
Pubblicazione: (2024)
di: Li, Zhangxun, et al.
Pubblicazione: (2024)
QVGen: Pushing the Limit of Quantized Video Generative Models
di: Huang, Yushi, et al.
Pubblicazione: (2025)
di: Huang, Yushi, et al.
Pubblicazione: (2025)
MARC: Memory-Augmented RL Token Compression for Efficient Video Understanding
di: Wu, Peiran, et al.
Pubblicazione: (2025)
di: Wu, Peiran, et al.
Pubblicazione: (2025)
Video Token Merging for Long-form Video Understanding
di: Lee, Seon-Ho, et al.
Pubblicazione: (2024)
di: Lee, Seon-Ho, et al.
Pubblicazione: (2024)
Astraea: A Token-wise Acceleration Framework for Video Diffusion Transformers
di: Liu, Haosong, et al.
Pubblicazione: (2025)
di: Liu, Haosong, et al.
Pubblicazione: (2025)
TokenBinder: Text-Video Retrieval with One-to-Many Alignment Paradigm
di: Zhang, Bingqing, et al.
Pubblicazione: (2024)
di: Zhang, Bingqing, et al.
Pubblicazione: (2024)
S$^2$Q-VDiT: Accurate Quantized Video Diffusion Transformer with Salient Data and Sparse Token Distillation
di: Feng, Weilun, et al.
Pubblicazione: (2025)
di: Feng, Weilun, et al.
Pubblicazione: (2025)
STORM: Token-Efficient Long Video Understanding for Multimodal LLMs
di: Jiang, Jindong, et al.
Pubblicazione: (2025)
di: Jiang, Jindong, et al.
Pubblicazione: (2025)
HieraMamba: Video Temporal Grounding via Hierarchical Anchor-Mamba Pooling
di: An, Joungbin, et al.
Pubblicazione: (2025)
di: An, Joungbin, et al.
Pubblicazione: (2025)
OmniTokenizer: A Joint Image-Video Tokenizer for Visual Generation
di: Wang, Junke, et al.
Pubblicazione: (2024)
di: Wang, Junke, et al.
Pubblicazione: (2024)
QVD: Post-training Quantization for Video Diffusion Models
di: Tian, Shilong, et al.
Pubblicazione: (2024)
di: Tian, Shilong, et al.
Pubblicazione: (2024)
Generative Video Propagation
di: Liu, Shaoteng, et al.
Pubblicazione: (2024)
di: Liu, Shaoteng, et al.
Pubblicazione: (2024)
Mamba-VGGT: Persistent Long-Sequence Video Geometry Grounded Transformer via External Sliding Window Mamba Memory
di: Deng, Tianchen, et al.
Pubblicazione: (2026)
di: Deng, Tianchen, et al.
Pubblicazione: (2026)
RefTok: Reference-Based Tokenization for Video Generation
di: Fan, Xiang, et al.
Pubblicazione: (2025)
di: Fan, Xiang, et al.
Pubblicazione: (2025)
DeRA: Decoupled Representation Alignment for Video Tokenization
di: Guo, Pengbo, et al.
Pubblicazione: (2025)
di: Guo, Pengbo, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Scaling Up Video Summarization Pretraining with Large Language Models
di: Argaw, Dawit Mureja, et al.
Pubblicazione: (2024) -
Towards Automated Movie Trailer Generation
di: Argaw, Dawit Mureja, et al.
Pubblicazione: (2024) -
InfoTok: Adaptive Discrete Video Tokenizer via Information-Theoretic Compression
di: Ye, Haotian, et al.
Pubblicazione: (2025) -
Let Me Finish My Sentence: Video Temporal Grounding with Holistic Text Understanding
di: Woo, Jongbhin, et al.
Pubblicazione: (2024) -
Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs
di: Jung, Chaeyoung, et al.
Pubblicazione: (2026)