SWIFT: Prompt-Adaptive Memory for Efficient Interactive Long Video Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tan, Shanwen, Li, Hao, Zhang, Jingtao, Jia, Xiaosong, Yang, Xue, Zhang, Shaofeng, Zhang, Yanyong |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VideoRouter: Query-Adaptive Dual Routing for Efficient Long-Video Understanding
par: Lin, Kuanwei, et autres
Publié: (2026)
par: Lin, Kuanwei, et autres
Publié: (2026)
RISE-Video: Can Video Generators Decode Implicit World Rules?
par: Liu, Mingxin, et autres
Publié: (2026)
par: Liu, Mingxin, et autres
Publié: (2026)
UAR-NVC: A Unified AutoRegressive Framework for Memory-Efficient Neural Video Compression
par: Wang, Jia, et autres
Publié: (2025)
par: Wang, Jia, et autres
Publié: (2025)
DreamWorld: Unified World Modeling in Video Generation
par: Tan, Boming, et autres
Publié: (2026)
par: Tan, Boming, et autres
Publié: (2026)
Pack and Force Your Memory: Long-form and Consistent Video Generation
par: Wu, Xiaofei, et autres
Publié: (2025)
par: Wu, Xiaofei, et autres
Publié: (2025)
Video-Infinity: Distributed Long Video Generation
par: Tan, Zhenxiong, et autres
Publié: (2024)
par: Tan, Zhenxiong, et autres
Publié: (2024)
AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction
par: Man, Yuanbin, et autres
Publié: (2024)
par: Man, Yuanbin, et autres
Publié: (2024)
PMG: Progressive Motion Generation via Sparse Anchor Postures Curriculum Learning
par: Xi, Yingjie, et autres
Publié: (2025)
par: Xi, Yingjie, et autres
Publié: (2025)
Bridging Modalities, Spanning Time: Structured Memory for Ultra-Long Agentic Video Reasoning
par: Li, Jiazheng, et autres
Publié: (2026)
par: Li, Jiazheng, et autres
Publié: (2026)
SpatialMem: Metric-Aligned Long-Horizon Video Memory for Language Grounding and QA
par: Zheng, Xinyi, et autres
Publié: (2026)
par: Zheng, Xinyi, et autres
Publié: (2026)
RoboVIP: Multi-View Video Generation with Visual Identity Prompting Augments Robot Manipulation
par: Wang, Boyang, et autres
Publié: (2026)
par: Wang, Boyang, et autres
Publié: (2026)
Streaming Video Understanding and Multi-round Interaction with Memory-enhanced Knowledge
par: Xiong, Haomiao, et autres
Publié: (2025)
par: Xiong, Haomiao, et autres
Publié: (2025)
Free-Lunch Long Video Generation via Layer-Adaptive O.O.D Correction
par: Tian, Jiahao, et autres
Publié: (2026)
par: Tian, Jiahao, et autres
Publié: (2026)
Memory-Efficient Continual Learning Object Segmentation for Long Video
par: Nazemi, Amir, et autres
Publié: (2023)
par: Nazemi, Amir, et autres
Publié: (2023)
Video-EM: Event-Centric Episodic Memory for Long-Form Video Understanding
par: Wang, Yun, et autres
Publié: (2025)
par: Wang, Yun, et autres
Publié: (2025)
Memory-Inspired Temporal Prompt Interaction for Text-Image Classification
par: Yu, Xinyao, et autres
Publié: (2024)
par: Yu, Xinyao, et autres
Publié: (2024)
Dual-IPO: Dual-Iterative Preference Optimization for Text-to-Video Generation
par: Yang, Xiaomeng, et autres
Publié: (2025)
par: Yang, Xiaomeng, et autres
Publié: (2025)
OmniAvatar: Efficient Audio-Driven Avatar Video Generation with Adaptive Body Animation
par: Gan, Qijun, et autres
Publié: (2025)
par: Gan, Qijun, et autres
Publié: (2025)
Spatia: Video Generation with Updatable Spatial Memory
par: Zhao, Jinjing, et autres
Publié: (2025)
par: Zhao, Jinjing, et autres
Publié: (2025)
SEATrack: Simple, Efficient, and Adaptive Multimodal Tracker
par: Su, Junbin, et autres
Publié: (2026)
par: Su, Junbin, et autres
Publié: (2026)
Enhancing Long Video Generation Consistency without Tuning
par: Li, Xingyao, et autres
Publié: (2024)
par: Li, Xingyao, et autres
Publié: (2024)
Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events
par: Liu, Xiaolin, et autres
Publié: (2026)
par: Liu, Xiaolin, et autres
Publié: (2026)
Shallow Features Matter: Hierarchical Memory with Heterogeneous Interaction for Unsupervised Video Object Segmentation
par: Xiangyu, Zheng, et autres
Publié: (2025)
par: Xiangyu, Zheng, et autres
Publié: (2025)
AdaCluster: Adaptive Query-Key Clustering for Sparse Attention in Video Generation
par: Tan, Haoyue, et autres
Publié: (2026)
par: Tan, Haoyue, et autres
Publié: (2026)
VideoZoomer: Reinforcement-Learned Temporal Focusing for Long Video Reasoning
par: Ding, Yang, et autres
Publié: (2025)
par: Ding, Yang, et autres
Publié: (2025)
GA-GS: Generation-Assisted Gaussian Splatting for Static Scene Reconstruction
par: Shen, Yedong, et autres
Publié: (2026)
par: Shen, Yedong, et autres
Publié: (2026)
Yan: Foundational Interactive Video Generation
par: Ye, Deheng, et autres
Publié: (2025)
par: Ye, Deheng, et autres
Publié: (2025)
TimeSearch-R: Adaptive Temporal Search for Long-Form Video Understanding via Self-Verification Reinforcement Learning
par: Pan, Junwen, et autres
Publié: (2025)
par: Pan, Junwen, et autres
Publié: (2025)
Mixture of Contexts for Long Video Generation
par: Cai, Shengqu, et autres
Publié: (2025)
par: Cai, Shengqu, et autres
Publié: (2025)
EM-Vid: Training-Free Entity-Centric Memory for Efficient and Consistent Multi-Shot Video Generation
par: Vandersanden, Jente, et autres
Publié: (2026)
par: Vandersanden, Jente, et autres
Publié: (2026)
Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding
par: Wu, Hang, et autres
Publié: (2026)
par: Wu, Hang, et autres
Publié: (2026)
Prompt-Aware Adapter: Towards Learning Adaptive Visual Tokens for Multimodal Large Language Models
par: Zhang, Yue, et autres
Publié: (2024)
par: Zhang, Yue, et autres
Publié: (2024)
Head Forcing: Long Autoregressive Video Generation via Head Heterogeneity
par: Tian, Jiahao, et autres
Publié: (2026)
par: Tian, Jiahao, et autres
Publié: (2026)
AdaFocus: Adaptive Relevance-Diversity Sampling with Zero-Cache Look-back for Efficient Long Video Understanding
par: Yang, Xiao, et autres
Publié: (2026)
par: Yang, Xiao, et autres
Publié: (2026)
Memory-Efficient Prompt Tuning for Incremental Histopathology Classification
par: Zhu, Yu, et autres
Publié: (2024)
par: Zhu, Yu, et autres
Publié: (2024)
Scaling the Long Video Understanding of Multimodal Large Language Models via Visual Memory Mechanism
par: Chen, Tao, et autres
Publié: (2026)
par: Chen, Tao, et autres
Publié: (2026)
HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding
par: Zhang, Haowei, et autres
Publié: (2026)
par: Zhang, Haowei, et autres
Publié: (2026)
MemCam: Memory-Augmented Camera Control for Consistent Video Generation
par: Gao, Xinhang, et autres
Publié: (2026)
par: Gao, Xinhang, et autres
Publié: (2026)
Adaptive Greedy Frame Selection for Long Video Understanding
par: Huang, Yuning, et autres
Publié: (2026)
par: Huang, Yuning, et autres
Publié: (2026)
SANA-Video: Efficient Video Generation with Block Linear Diffusion Transformer
par: Chen, Junsong, et autres
Publié: (2025)
par: Chen, Junsong, et autres
Publié: (2025)
Documents similaires
-
VideoRouter: Query-Adaptive Dual Routing for Efficient Long-Video Understanding
par: Lin, Kuanwei, et autres
Publié: (2026) -
RISE-Video: Can Video Generators Decode Implicit World Rules?
par: Liu, Mingxin, et autres
Publié: (2026) -
UAR-NVC: A Unified AutoRegressive Framework for Memory-Efficient Neural Video Compression
par: Wang, Jia, et autres
Publié: (2025) -
DreamWorld: Unified World Modeling in Video Generation
par: Tan, Boming, et autres
Publié: (2026) -
Pack and Force Your Memory: Long-form and Consistent Video Generation
par: Wu, Xiaofei, et autres
Publié: (2025)