Salvato in:
| Autori principali: | Jiang, Jindong, Li, Xiuyu, Liu, Zhijian, Li, Muyang, Chen, Guo, Li, Zhiqi, Huang, De-An, Liu, Guilin, Yu, Zhiding, Keutzer, Kurt, Ahn, Sungjin, Kautz, Jan, Yin, Hongxu, Lu, Yao, Han, Song, Byeon, Wonmin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2503.04130 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Stateful Token Reduction for Long-Video Hybrid VLMs
di: Jiang, Jindong, et al.
Pubblicazione: (2026)
di: Jiang, Jindong, et al.
Pubblicazione: (2026)
VideoITG: Multimodal Video Understanding with Instructed Temporal Grounding
di: Wang, Shihao, et al.
Pubblicazione: (2025)
di: Wang, Shihao, et al.
Pubblicazione: (2025)
Eagle 2.5: Boosting Long-Context Post-Training for Frontier Vision-Language Models
di: Chen, Guo, et al.
Pubblicazione: (2025)
di: Chen, Guo, et al.
Pubblicazione: (2025)
RegionGPT: Towards Region Understanding Vision Language Model
di: Guo, Qiushan, et al.
Pubblicazione: (2024)
di: Guo, Qiushan, et al.
Pubblicazione: (2024)
FRAG: Frame Selection Augmented Generation for Long Video and Long Document Understanding
di: Huang, De-An, et al.
Pubblicazione: (2025)
di: Huang, De-An, et al.
Pubblicazione: (2025)
LongVILA: Scaling Long-Context Visual Language Models for Long Videos
di: Chen, Yukang, et al.
Pubblicazione: (2024)
di: Chen, Yukang, et al.
Pubblicazione: (2024)
PhyCritic: Multimodal Critic Models for Physical AI
di: Xiong, Tianyi, et al.
Pubblicazione: (2026)
di: Xiong, Tianyi, et al.
Pubblicazione: (2026)
Eagle: Exploring The Design Space for Multimodal LLMs with Mixture of Encoders
di: Shi, Min, et al.
Pubblicazione: (2024)
di: Shi, Min, et al.
Pubblicazione: (2024)
Quant VideoGen: Auto-Regressive Long Video Generation via 2-Bit KV-Cache Quantization
di: Xi, Haocheng, et al.
Pubblicazione: (2026)
di: Xi, Haocheng, et al.
Pubblicazione: (2026)
Sparse VideoGen2: Accelerate Video Generation with Sparse Attention via Semantic-Aware Permutation
di: Yang, Shuo, et al.
Pubblicazione: (2025)
di: Yang, Shuo, et al.
Pubblicazione: (2025)
Sparse VideoGen: Accelerating Video Diffusion Transformers with Spatial-Temporal Sparsity
di: Xi, Haocheng, et al.
Pubblicazione: (2025)
di: Xi, Haocheng, et al.
Pubblicazione: (2025)
VNU-Bench: A Benchmarking Dataset for Multi-Source Multimodal News Video Understanding
di: Liu, Zibo, et al.
Pubblicazione: (2026)
di: Liu, Zibo, et al.
Pubblicazione: (2026)
StreamDiffusionV2: A Streaming System for Dynamic and Interactive Video Generation
di: Feng, Tianrui, et al.
Pubblicazione: (2025)
di: Feng, Tianrui, et al.
Pubblicazione: (2025)
Scaling RL to Long Videos
di: Chen, Yukang, et al.
Pubblicazione: (2025)
di: Chen, Yukang, et al.
Pubblicazione: (2025)
SparseLoRA: Accelerating LLM Fine-Tuning with Contextual Sparsity
di: Khaki, Samir, et al.
Pubblicazione: (2025)
di: Khaki, Samir, et al.
Pubblicazione: (2025)
LLoCO: Learning Long Contexts Offline
di: Tan, Sijun, et al.
Pubblicazione: (2024)
di: Tan, Sijun, et al.
Pubblicazione: (2024)
QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation
di: Zhao, Yue, et al.
Pubblicazione: (2025)
di: Zhao, Yue, et al.
Pubblicazione: (2025)
Towards Multimodal Lifelong Understanding: A Dataset and Agentic Baseline
di: Chen, Guo, et al.
Pubblicazione: (2026)
di: Chen, Guo, et al.
Pubblicazione: (2026)
LITA: Language Instructed Temporal-Localization Assistant
di: Huang, De-An, et al.
Pubblicazione: (2024)
di: Huang, De-An, et al.
Pubblicazione: (2024)
Discrete Tokenization for Multimodal LLMs: A Comprehensive Survey
di: Li, Jindong, et al.
Pubblicazione: (2025)
di: Li, Jindong, et al.
Pubblicazione: (2025)
MEVG: Multi-event Video Generation with Text-to-Video Models
di: Oh, Gyeongrok, et al.
Pubblicazione: (2023)
di: Oh, Gyeongrok, et al.
Pubblicazione: (2023)
LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding
di: Wang, Shihao, et al.
Pubblicazione: (2026)
di: Wang, Shihao, et al.
Pubblicazione: (2026)
Is Ego Status All You Need for Open-Loop End-to-End Autonomous Driving?
di: Li, Zhiqi, et al.
Pubblicazione: (2023)
di: Li, Zhiqi, et al.
Pubblicazione: (2023)
GSPN-2: Efficient Parallel Sequence Modeling
di: Wang, Hongjun, et al.
Pubblicazione: (2025)
di: Wang, Hongjun, et al.
Pubblicazione: (2025)
Magic-Me: Identity-Specific Video Customized Diffusion
di: Ma, Ze, et al.
Pubblicazione: (2024)
di: Ma, Ze, et al.
Pubblicazione: (2024)
Flash-KMeans: Fast and Memory-Efficient Exact K-Means
di: Yang, Shuo, et al.
Pubblicazione: (2026)
di: Yang, Shuo, et al.
Pubblicazione: (2026)
Parallel Sequence Modeling via Generalized Spatial Propagation Network
di: Wang, Hongjun, et al.
Pubblicazione: (2025)
di: Wang, Hongjun, et al.
Pubblicazione: (2025)
QFT: Quantized Full-parameter Tuning of LLMs with Affordable Resources
di: Li, Zhikai, et al.
Pubblicazione: (2023)
di: Li, Zhikai, et al.
Pubblicazione: (2023)
Video-XL-Pro: Reconstructive Token Compression for Extremely Long Video Understanding
di: Liu, Xiangrui, et al.
Pubblicazione: (2025)
di: Liu, Xiangrui, et al.
Pubblicazione: (2025)
Radial Attention: $O(n\log n)$ Sparse Attention with Energy Decay for Long Video Generation
di: Li, Xingyang, et al.
Pubblicazione: (2025)
di: Li, Xingyang, et al.
Pubblicazione: (2025)
Slot State Space Models
di: Jiang, Jindong, et al.
Pubblicazione: (2024)
di: Jiang, Jindong, et al.
Pubblicazione: (2024)
Video Token Merging for Long-form Video Understanding
di: Lee, Seon-Ho, et al.
Pubblicazione: (2024)
di: Lee, Seon-Ho, et al.
Pubblicazione: (2024)
SqueezeLLM: Dense-and-Sparse Quantization
di: Kim, Sehoon, et al.
Pubblicazione: (2023)
di: Kim, Sehoon, et al.
Pubblicazione: (2023)
S*: Test Time Scaling for Code Generation
di: Li, Dacheng, et al.
Pubblicazione: (2025)
di: Li, Dacheng, et al.
Pubblicazione: (2025)
Hydra-MDP: End-to-end Multimodal Planning with Multi-target Hydra-Distillation
di: Li, Zhenxin, et al.
Pubblicazione: (2024)
di: Li, Zhenxin, et al.
Pubblicazione: (2024)
StreamChat: Chatting with Streaming Video
di: Liu, Jihao, et al.
Pubblicazione: (2024)
di: Liu, Jihao, et al.
Pubblicazione: (2024)
Learning Adaptive Parallel Reasoning with Language Models
di: Pan, Jiayi, et al.
Pubblicazione: (2025)
di: Pan, Jiayi, et al.
Pubblicazione: (2025)
RouterBench: A Benchmark for Multi-LLM Routing System
di: Hu, Qitian Jason, et al.
Pubblicazione: (2024)
di: Hu, Qitian Jason, et al.
Pubblicazione: (2024)
Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders
di: Jiang, Yitong, et al.
Pubblicazione: (2026)
di: Jiang, Yitong, et al.
Pubblicazione: (2026)
MITRA: A Large-Scale Parallel Corpus and Multilingual Pretrained Language Model for Machine Translation and Semantic Retrieval for Pāli, Sanskrit, Buddhist Chinese, and Tibetan
di: Nehrdich, Sebastian, et al.
Pubblicazione: (2026)
di: Nehrdich, Sebastian, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Stateful Token Reduction for Long-Video Hybrid VLMs
di: Jiang, Jindong, et al.
Pubblicazione: (2026) -
VideoITG: Multimodal Video Understanding with Instructed Temporal Grounding
di: Wang, Shihao, et al.
Pubblicazione: (2025) -
Eagle 2.5: Boosting Long-Context Post-Training for Frontier Vision-Language Models
di: Chen, Guo, et al.
Pubblicazione: (2025) -
RegionGPT: Towards Region Understanding Vision Language Model
di: Guo, Qiushan, et al.
Pubblicazione: (2024) -
FRAG: Frame Selection Augmented Generation for Long Video and Long Document Understanding
di: Huang, De-An, et al.
Pubblicazione: (2025)