FastSTAR: Spatiotemporal Token Pruning for Efficient Autoregressive Video Synthesis
Fuente:
arXiv
Guardado en:
| Autores principales: | Yune, Sungwoong, Jeong, Suheon, Kim, Joo-Young |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
FastVAR: Linear Visual Autoregressive Modeling via Cached Token Pruning
por: Guo, Hang, et al.
Publicado: (2025)
por: Guo, Hang, et al.
Publicado: (2025)
MEVG: Multi-event Video Generation with Text-to-Video Models
por: Oh, Gyeongrok, et al.
Publicado: (2023)
por: Oh, Gyeongrok, et al.
Publicado: (2023)
TokenTrim: Inference-Time Token Pruning for Autoregressive Long Video Generation
por: Shaulov, Ariel, et al.
Publicado: (2026)
por: Shaulov, Ariel, et al.
Publicado: (2026)
ORBIS: Output-Guided Token Reduction with Distribution-Aware Matching for Video Diffusion Acceleration
por: Lee, Hangyeol, et al.
Publicado: (2026)
por: Lee, Hangyeol, et al.
Publicado: (2026)
PruneVid: Visual Token Pruning for Efficient Video Large Language Models
por: Huang, Xiaohu, et al.
Publicado: (2024)
por: Huang, Xiaohu, et al.
Publicado: (2024)
EVATok: Adaptive Length Video Tokenization for Efficient Visual Autoregressive Generation
por: Xiong, Tianwei, et al.
Publicado: (2026)
por: Xiong, Tianwei, et al.
Publicado: (2026)
LightSplat: Fast and Memory-Efficient Open-Vocabulary 3D Scene Understanding in Five Seconds
por: Bang, Jaehun, et al.
Publicado: (2026)
por: Bang, Jaehun, et al.
Publicado: (2026)
Language-Guided Temporal Token Pruning for Efficient VideoLLM Processing
por: Kumar, Yogesh
Publicado: (2025)
por: Kumar, Yogesh
Publicado: (2025)
Video Patch Pruning: Efficient Video Instance Segmentation via Early Token Reduction
por: Glandorf, Patrick, et al.
Publicado: (2026)
por: Glandorf, Patrick, et al.
Publicado: (2026)
HieraVid: Hierarchical Token Pruning for Fast Video Large Language Models
por: Guo, Yansong, et al.
Publicado: (2026)
por: Guo, Yansong, et al.
Publicado: (2026)
DocPrune:Efficient Document Question Answering via Background, Question, and Comprehension-aware Token Pruning
por: Choi, Joonmyung, et al.
Publicado: (2026)
por: Choi, Joonmyung, et al.
Publicado: (2026)
Rethinking Token Reduction for Diffusion Models via Output-Similarity-Awareness
por: Lee, Hangyeol, et al.
Publicado: (2026)
por: Lee, Hangyeol, et al.
Publicado: (2026)
EgoPrune: Efficient Token Pruning for Egomotion Video Reasoning in Embodied Agent
por: Li, Jiaao, et al.
Publicado: (2025)
por: Li, Jiaao, et al.
Publicado: (2025)
Fast SAM2 with Text-Driven Token Pruning
por: Mandal, Avilasha, et al.
Publicado: (2025)
por: Mandal, Avilasha, et al.
Publicado: (2025)
Efficient Video Sampling: Pruning Temporally Redundant Tokens for Faster VLM Inference
por: Bagrov, Natan, et al.
Publicado: (2025)
por: Bagrov, Natan, et al.
Publicado: (2025)
Autoregressive Universal Video Segmentation Model
por: Heo, Miran, et al.
Publicado: (2025)
por: Heo, Miran, et al.
Publicado: (2025)
Adaptive Begin-of-Video Tokens for Autoregressive Video Diffusion Models
por: Cheng, Tianle, et al.
Publicado: (2025)
por: Cheng, Tianle, et al.
Publicado: (2025)
Efficient Token Pruning for LLaDA-V
por: Wan, Zhewen, et al.
Publicado: (2026)
por: Wan, Zhewen, et al.
Publicado: (2026)
HiPrune: Hierarchical Attention for Efficient Token Pruning in Vision-Language Models
por: Liu, Jizhihui, et al.
Publicado: (2025)
por: Liu, Jizhihui, et al.
Publicado: (2025)
EVEREST: Efficient Masked Video Autoencoder by Removing Redundant Spatiotemporal Tokens
por: Hwang, Sunil, et al.
Publicado: (2022)
por: Hwang, Sunil, et al.
Publicado: (2022)
VideoMAR: Autoregressive Video Generatio with Continuous Tokens
por: Yu, Hu, et al.
Publicado: (2025)
por: Yu, Hu, et al.
Publicado: (2025)
TokenDial: Continuous Attribute Control in Text-to-Video via Spatiotemporal Token Offsets
por: Liu, Zhixuan, et al.
Publicado: (2026)
por: Liu, Zhixuan, et al.
Publicado: (2026)
PPT: Token Pruning and Pooling for Efficient Vision Transformers
por: Wu, Xinjian, et al.
Publicado: (2023)
por: Wu, Xinjian, et al.
Publicado: (2023)
Less is More: Token-Efficient Video-QA via Adaptive Frame-Pruning and Semantic Graph Integration
por: Wang, Shaoguang, et al.
Publicado: (2025)
por: Wang, Shaoguang, et al.
Publicado: (2025)
StreamingAssistant: Efficient Visual Token Pruning for Accelerating Online Video Understanding
por: Jin, Xinqi, et al.
Publicado: (2025)
por: Jin, Xinqi, et al.
Publicado: (2025)
FastVID: Dynamic Density Pruning for Fast Video Large Language Models
por: Shen, Leqi, et al.
Publicado: (2025)
por: Shen, Leqi, et al.
Publicado: (2025)
ERASE: Eliminating Redundant Visual Tokens via Adaptive Two-Stage Token Pruning
por: Lee, Yuna, et al.
Publicado: (2026)
por: Lee, Yuna, et al.
Publicado: (2026)
ReDiPrune: Relevance-Diversity Pre-Projection Token Pruning for Efficient Multimodal LLMs
por: Yu, An, et al.
Publicado: (2026)
por: Yu, An, et al.
Publicado: (2026)
Unified Spatiotemporal Token Compression for Video-LLMs at Ultra-Low Retention
por: Du, Junhao, et al.
Publicado: (2026)
por: Du, Junhao, et al.
Publicado: (2026)
Token Merging via Spatiotemporal Information Mining for Surgical Video Understanding
por: Jiang, Xixi, et al.
Publicado: (2025)
por: Jiang, Xixi, et al.
Publicado: (2025)
From Slow Bidirectional to Fast Autoregressive Video Diffusion Models
por: Yin, Tianwei, et al.
Publicado: (2024)
por: Yin, Tianwei, et al.
Publicado: (2024)
Beyond Surrogate Gradients: Fully Differentiable Token Pruning for Vision-Language Models
por: He, Landi, et al.
Publicado: (2026)
por: He, Landi, et al.
Publicado: (2026)
Fast-Slow Efficient Training for Multimodal Large Language Models via Visual Token Pruning
por: Zhang, Dingkun, et al.
Publicado: (2026)
por: Zhang, Dingkun, et al.
Publicado: (2026)
OSPO: Object-Centric Self-Improving Preference Optimization for Text-to-Image Generation
por: Oh, Yoonjin, et al.
Publicado: (2025)
por: Oh, Yoonjin, et al.
Publicado: (2025)
Efficient Autoregressive Video Diffusion with Dummy Head
por: Guo, Hang, et al.
Publicado: (2026)
por: Guo, Hang, et al.
Publicado: (2026)
EventPrune: Cascaded Event-Assisted Token Pruning for Efficient First-Person Dynamic Spatial Reasoning
por: Ma, Pengtao, et al.
Publicado: (2026)
por: Ma, Pengtao, et al.
Publicado: (2026)
Efficient Autoregressive Shape Generation via Octree-Based Adaptive Tokenization
por: Deng, Kangle, et al.
Publicado: (2025)
por: Deng, Kangle, et al.
Publicado: (2025)
Rethinking Discrete Tokens: Treating Them as Conditions for Continuous Autoregressive Image Synthesis
por: Zheng, Peng, et al.
Publicado: (2025)
por: Zheng, Peng, et al.
Publicado: (2025)
MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers
por: Bae, Jongseong, et al.
Publicado: (2024)
por: Bae, Jongseong, et al.
Publicado: (2024)
Geometry-Guided 3D Visual Token Pruning for Video-Language Models
por: Li, Han, et al.
Publicado: (2026)
por: Li, Han, et al.
Publicado: (2026)
Ejemplares similares
-
FastVAR: Linear Visual Autoregressive Modeling via Cached Token Pruning
por: Guo, Hang, et al.
Publicado: (2025) -
MEVG: Multi-event Video Generation with Text-to-Video Models
por: Oh, Gyeongrok, et al.
Publicado: (2023) -
TokenTrim: Inference-Time Token Pruning for Autoregressive Long Video Generation
por: Shaulov, Ariel, et al.
Publicado: (2026) -
ORBIS: Output-Guided Token Reduction with Distribution-Aware Matching for Video Diffusion Acceleration
por: Lee, Hangyeol, et al.
Publicado: (2026) -
PruneVid: Visual Token Pruning for Efficient Video Large Language Models
por: Huang, Xiaohu, et al.
Publicado: (2024)