Fast Autoregressive Video Diffusion and World Models with Temporal Cache Compression and Sparse Attention
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Samuel, Dvir, Tzachor, Issar, Levy, Matan, Green, Micahel, Chechik, Gal, Ben-Ari, Rami |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VidVec: Unlocking Video MLLM Embeddings for Video-Text Retrieval
par: Tzachor, Issar, et autres
Publié: (2026)
par: Tzachor, Issar, et autres
Publié: (2026)
Find your Needle: Small Object Image Retrieval via Multi-Object Attention Optimization
par: Green, Michael, et autres
Publié: (2025)
par: Green, Michael, et autres
Publié: (2025)
OmnimatteZero: Fast Training-free Omnimatte with Pre-trained Video Diffusion Models
par: Samuel, Dvir, et autres
Publié: (2025)
par: Samuel, Dvir, et autres
Publié: (2025)
Where's Waldo: Diffusion Features for Personalized Segmentation and Retrieval
par: Samuel, Dvir, et autres
Publié: (2024)
par: Samuel, Dvir, et autres
Publié: (2024)
Retrieval-Augmented Gaussian Avatars: Improving Expression Generalization
par: Levy, Matan, et autres
Publié: (2026)
par: Levy, Matan, et autres
Publié: (2026)
Fast 4D Mesh Generation by Spatio-Temporal Attention Chains
par: Samuel, Dvir, et autres
Publié: (2026)
par: Samuel, Dvir, et autres
Publié: (2026)
EffoVPR: Effective Foundation Model Utilization for Visual Place Recognition
par: Tzachor, Issar, et autres
Publié: (2024)
par: Tzachor, Issar, et autres
Publié: (2024)
Lightning-Fast Image Inversion and Editing for Text-to-Image Diffusion Models
par: Samuel, Dvir, et autres
Publié: (2023)
par: Samuel, Dvir, et autres
Publié: (2023)
Task-Specific Adaptation with Restricted Model Access
par: Levy, Matan, et autres
Publié: (2025)
par: Levy, Matan, et autres
Publié: (2025)
Per-Query Visual Concept Learning
par: Malca, Ori, et autres
Publié: (2025)
par: Malca, Ori, et autres
Publié: (2025)
Set Features for Anomaly Detection
par: Cohen, Niv, et autres
Publié: (2023)
par: Cohen, Niv, et autres
Publié: (2023)
Bringing Objects to Life: training-free 4D generation from 3D objects through view consistent noise
par: Rahamim, Ohad, et autres
Publié: (2024)
par: Rahamim, Ohad, et autres
Publié: (2024)
Add-it: Training-Free Object Insertion in Images With Pretrained Diffusion Models
par: Tewel, Yoad, et autres
Publié: (2024)
par: Tewel, Yoad, et autres
Publié: (2024)
Forcing-KV: Hybrid KV Cache Compression for Efficient Autoregressive Video Diffusion Models
par: Ji, Yicheng, et autres
Publié: (2026)
par: Ji, Yicheng, et autres
Publié: (2026)
Light Forcing: Accelerating Autoregressive Video Diffusion via Sparse Attention
par: Lv, Chengtao, et autres
Publié: (2026)
par: Lv, Chengtao, et autres
Publié: (2026)
Story2Board: A Training-Free Approach for Expressive Storyboard Generation
par: Dinkevich, David, et autres
Publié: (2025)
par: Dinkevich, David, et autres
Publié: (2025)
MSC: Multi-Scale Spatio-Temporal Causal Attention for Autoregressive Video Diffusion
par: Xu, Xunnong, et autres
Publié: (2024)
par: Xu, Xunnong, et autres
Publié: (2024)
Motion by Queries: Identity-Motion Trade-offs in Text-to-Video Generation
par: Atzmon, Yuval, et autres
Publié: (2024)
par: Atzmon, Yuval, et autres
Publié: (2024)
Sparse Forcing: Native Trainable Sparse Attention for Real-time Autoregressive Diffusion Video Generation
par: Xu, Boxun, et autres
Publié: (2026)
par: Xu, Boxun, et autres
Publié: (2026)
LiveSVG: Zero-Shot SVG Animation via Video Generation
par: Levy, Matan, et autres
Publié: (2026)
par: Levy, Matan, et autres
Publié: (2026)
CarGait: Cross-Attention based Re-ranking for Gait recognition
par: Habib, Gavriel, et autres
Publié: (2025)
par: Habib, Gavriel, et autres
Publié: (2025)
RL-RC-DoT: A Block-level RL agent for Task-Aware Video Compression
par: Gadot, Uri, et autres
Publié: (2025)
par: Gadot, Uri, et autres
Publié: (2025)
Linguistic Binding in Diffusion Models: Enhancing Attribute Correspondence through Attention Map Alignment
par: Rassin, Royi, et autres
Publié: (2023)
par: Rassin, Royi, et autres
Publié: (2023)
QuantSparse: Comprehensively Compressing Video Diffusion Transformer with Model Quantization and Attention Sparsification
par: Feng, Weilun, et autres
Publié: (2025)
par: Feng, Weilun, et autres
Publié: (2025)
Compositional Video Generation via Inference-Time Guidance
par: Shaulov, Ariel, et autres
Publié: (2026)
par: Shaulov, Ariel, et autres
Publié: (2026)
Past- and Future-Informed KV Cache Policy with Salience Estimation in Autoregressive Video Diffusion
par: Chen, Hanmo, et autres
Publié: (2026)
par: Chen, Hanmo, et autres
Publié: (2026)
FilmWeaver: Weaving Consistent Multi-Shot Videos with Cache-Guided Autoregressive Diffusion
par: Luo, Xiangyang, et autres
Publié: (2025)
par: Luo, Xiangyang, et autres
Publié: (2025)
From Slow Bidirectional to Fast Autoregressive Video Diffusion Models
par: Yin, Tianwei, et autres
Publié: (2024)
par: Yin, Tianwei, et autres
Publié: (2024)
VideoMLA: Low-Rank Latent KV Cache for Minute-Scale Autoregressive Video Diffusion
par: Yesiltepe, Hidir, et autres
Publié: (2026)
par: Yesiltepe, Hidir, et autres
Publié: (2026)
Head-Aware KV Cache Compression for Efficient Visual Autoregressive Modeling
par: Qin, Ziran, et autres
Publié: (2025)
par: Qin, Ziran, et autres
Publié: (2025)
Ca2-VDM: Efficient Autoregressive Video Diffusion Model with Causal Generation and Cache Sharing
par: Gao, Kaifeng, et autres
Publié: (2024)
par: Gao, Kaifeng, et autres
Publié: (2024)
JUST-DUB-IT: Video Dubbing via Joint Audio-Visual Diffusion
par: Chen, Anthony, et autres
Publié: (2026)
par: Chen, Anthony, et autres
Publié: (2026)
LiteAttention: A Temporal Sparse Attention for Diffusion Transformers
par: Shmilovich, Dor, et autres
Publié: (2025)
par: Shmilovich, Dor, et autres
Publié: (2025)
Data-Driven Loss Functions for Inference-Time Optimization in Text-to-Image
par: Yiflach, Sapir Esther, et autres
Publié: (2025)
par: Yiflach, Sapir Esther, et autres
Publié: (2025)
X-Cache: Cross-Chunk Block Caching for Few-Step Autoregressive World Models Inference
par: Zeng, Yixiao, et autres
Publié: (2026)
par: Zeng, Yixiao, et autres
Publié: (2026)
Single Image Iterative Subject-driven Generation and Editing
par: Shpitzer, Yair, et autres
Publié: (2025)
par: Shpitzer, Yair, et autres
Publié: (2025)
Key-Locked Rank One Editing for Text-to-Image Personalization
par: Tewel, Yoad, et autres
Publié: (2023)
par: Tewel, Yoad, et autres
Publié: (2023)
Assessing Image Quality Using a Simple Generative Representation
par: Raviv, Simon, et autres
Publié: (2024)
par: Raviv, Simon, et autres
Publié: (2024)
FastCache: Fast Caching for Diffusion Transformer Through Learnable Linear Approximation
par: Liu, Dong, et autres
Publié: (2025)
par: Liu, Dong, et autres
Publié: (2025)
MagCache: Fast Video Generation with Magnitude-Aware Cache
par: Ma, Zehong, et autres
Publié: (2025)
par: Ma, Zehong, et autres
Publié: (2025)
Documents similaires
-
VidVec: Unlocking Video MLLM Embeddings for Video-Text Retrieval
par: Tzachor, Issar, et autres
Publié: (2026) -
Find your Needle: Small Object Image Retrieval via Multi-Object Attention Optimization
par: Green, Michael, et autres
Publié: (2025) -
OmnimatteZero: Fast Training-free Omnimatte with Pre-trained Video Diffusion Models
par: Samuel, Dvir, et autres
Publié: (2025) -
Where's Waldo: Diffusion Features for Personalized Segmentation and Retrieval
par: Samuel, Dvir, et autres
Publié: (2024) -
Retrieval-Augmented Gaussian Avatars: Improving Expression Generalization
par: Levy, Matan, et autres
Publié: (2026)