StoryDiffusion: Consistent Self-Attention for Long-Range Image and Video Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhou, Yupeng, Zhou, Daquan, Cheng, Ming-Ming, Feng, Jiashi, Hou, Qibin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Sora Generates Videos with Stunning Geometrical Consistency
di: Li, Xuanyi, et al.
Pubblicazione: (2024)
di: Li, Xuanyi, et al.
Pubblicazione: (2024)
AR-1-to-3: Single Image to Consistent 3D Object Generation via Next-View Prediction
di: Zhang, Xuying, et al.
Pubblicazione: (2025)
di: Zhang, Xuying, et al.
Pubblicazione: (2025)
Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation
di: Zhou, Yupeng, et al.
Pubblicazione: (2026)
di: Zhou, Yupeng, et al.
Pubblicazione: (2026)
SRFormerV2: Taking a Closer Look at Permuted Self-Attention for Image Super-Resolution
di: Zhou, Yupeng, et al.
Pubblicazione: (2023)
di: Zhou, Yupeng, et al.
Pubblicazione: (2023)
Low-Resolution Self-Attention for Semantic Segmentation
di: Wu, Yu-Huan, et al.
Pubblicazione: (2023)
di: Wu, Yu-Huan, et al.
Pubblicazione: (2023)
OneVAE: Joint Discrete and Continuous Optimization Helps Discrete Video VAE Train Better
di: Zhou, Yupeng, et al.
Pubblicazione: (2025)
di: Zhou, Yupeng, et al.
Pubblicazione: (2025)
High-Quality Mask Tuning Matters for Open-Vocabulary Segmentation
di: Zeng, Quan-Sheng, et al.
Pubblicazione: (2024)
di: Zeng, Quan-Sheng, et al.
Pubblicazione: (2024)
Loong: Generating Minute-level Long Videos with Autoregressive Language Models
di: Wang, Yuqing, et al.
Pubblicazione: (2024)
di: Wang, Yuqing, et al.
Pubblicazione: (2024)
DFormerv2: Geometry Self-Attention for RGBD Semantic Segmentation
di: Yin, Bo-Wen, et al.
Pubblicazione: (2025)
di: Yin, Bo-Wen, et al.
Pubblicazione: (2025)
PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning
di: Xu, Lin, et al.
Pubblicazione: (2024)
di: Xu, Lin, et al.
Pubblicazione: (2024)
ControlSR: Taming Diffusion Models for Consistent Real-World Image Super Resolution
di: Wan, Yuhao, et al.
Pubblicazione: (2024)
di: Wan, Yuhao, et al.
Pubblicazione: (2024)
TS-Attn: Temporal-wise Separable Attention for Multi-Event Video Generation
di: Zhang, Hongyu, et al.
Pubblicazione: (2026)
di: Zhang, Hongyu, et al.
Pubblicazione: (2026)
The Consistency Critic: Correcting Inconsistencies in Generated Images via Reference-Guided Attentive Alignment
di: Ouyang, Ziheng, et al.
Pubblicazione: (2025)
di: Ouyang, Ziheng, et al.
Pubblicazione: (2025)
LVD-2M: A Long-take Video Dataset with Temporally Dense Captions
di: Xiong, Tianwei, et al.
Pubblicazione: (2024)
di: Xiong, Tianwei, et al.
Pubblicazione: (2024)
Contrastive Masked Autoencoders are Stronger Vision Learners
di: Huang, Zhicheng, et al.
Pubblicazione: (2022)
di: Huang, Zhicheng, et al.
Pubblicazione: (2022)
Object Isolated Attention for Consistent Story Visualization
di: Luo, Xiangyang, et al.
Pubblicazione: (2025)
di: Luo, Xiangyang, et al.
Pubblicazione: (2025)
Context Forcing: Consistent Autoregressive Video Generation with Long Context
di: Chen, Shuo, et al.
Pubblicazione: (2026)
di: Chen, Shuo, et al.
Pubblicazione: (2026)
Magic-Me: Identity-Specific Video Customized Diffusion
di: Ma, Ze, et al.
Pubblicazione: (2024)
di: Ma, Ze, et al.
Pubblicazione: (2024)
Mixture of Style Experts for Diverse Image Stylization
di: Zhu, Shihao, et al.
Pubblicazione: (2026)
di: Zhu, Shihao, et al.
Pubblicazione: (2026)
TempSamp-R1: Effective Temporal Sampling with Reinforcement Fine-Tuning for Video LLMs
di: Li, Yunheng, et al.
Pubblicazione: (2025)
di: Li, Yunheng, et al.
Pubblicazione: (2025)
HumanNet: Scaling Human-centric Video Learning to One Million Hours
di: Deng, Yufan, et al.
Pubblicazione: (2026)
di: Deng, Yufan, et al.
Pubblicazione: (2026)
GeoWorld: Unlocking the Potential of Geometry Models to Facilitate High-Fidelity 3D Scene Generation
di: Wan, Yuhao, et al.
Pubblicazione: (2025)
di: Wan, Yuhao, et al.
Pubblicazione: (2025)
Video Depth Anything: Consistent Depth Estimation for Super-Long Videos
di: Chen, Sili, et al.
Pubblicazione: (2025)
di: Chen, Sili, et al.
Pubblicazione: (2025)
Voyager: Long-Range and World-Consistent Video Diffusion for Explorable 3D Scene Generation
di: Huang, Tianyu, et al.
Pubblicazione: (2025)
di: Huang, Tianyu, et al.
Pubblicazione: (2025)
Real-time One-Step Diffusion-based Expressive Portrait Videos Generation
di: Guo, Hanzhong, et al.
Pubblicazione: (2024)
di: Guo, Hanzhong, et al.
Pubblicazione: (2024)
MDTv2: Masked Diffusion Transformer is a Strong Image Synthesizer
di: Gao, Shanghua, et al.
Pubblicazione: (2023)
di: Gao, Shanghua, et al.
Pubblicazione: (2023)
Cascade-CLIP: Cascaded Vision-Language Embeddings Alignment for Zero-Shot Semantic Segmentation
di: Li, Yunheng, et al.
Pubblicazione: (2024)
di: Li, Yunheng, et al.
Pubblicazione: (2024)
Towards Universal Video MLLMs with Attribute-Structured and Quality-Verified Instructions
di: Li, Yunheng, et al.
Pubblicazione: (2026)
di: Li, Yunheng, et al.
Pubblicazione: (2026)
ReDiStory: Region-Disentangled Diffusion for Consistent Visual Story Generation
di: Sarkar, Ayushman, et al.
Pubblicazione: (2026)
di: Sarkar, Ayushman, et al.
Pubblicazione: (2026)
MagicVideo-V2: Multi-Stage High-Aesthetic Video Generation
di: Wang, Weimin, et al.
Pubblicazione: (2024)
di: Wang, Weimin, et al.
Pubblicazione: (2024)
Unbiased Region-Language Alignment for Open-Vocabulary Dense Prediction
di: Li, Yunheng, et al.
Pubblicazione: (2024)
di: Li, Yunheng, et al.
Pubblicazione: (2024)
DFormer: Rethinking RGBD Representation Learning for Semantic Segmentation
di: Yin, Bowen, et al.
Pubblicazione: (2023)
di: Yin, Bowen, et al.
Pubblicazione: (2023)
Zone Evaluation: Revealing Spatial Bias in Object Detection
di: Zheng, Zhaohui, et al.
Pubblicazione: (2023)
di: Zheng, Zhaohui, et al.
Pubblicazione: (2023)
Revisiting Efficient Semantic Segmentation: Learning Offsets for Better Spatial and Class Feature Alignment
di: Zhang, Shi-Chen, et al.
Pubblicazione: (2025)
di: Zhang, Shi-Chen, et al.
Pubblicazione: (2025)
CrossKD: Cross-Head Knowledge Distillation for Object Detection
di: Wang, Jiabao, et al.
Pubblicazione: (2023)
di: Wang, Jiabao, et al.
Pubblicazione: (2023)
MedSeg-R: Medical Image Segmentation with Clinical Reasoning
di: Shao, Hao, et al.
Pubblicazione: (2025)
di: Shao, Hao, et al.
Pubblicazione: (2025)
StyleDiffusion: Prompt-Embedding Inversion for Text-Based Editing
di: Li, Senmao, et al.
Pubblicazione: (2023)
di: Li, Senmao, et al.
Pubblicazione: (2023)
Ouroboros-Diffusion: Exploring Consistent Content Generation in Tuning-free Long Video Diffusion
di: Chen, Jingyuan, et al.
Pubblicazione: (2025)
di: Chen, Jingyuan, et al.
Pubblicazione: (2025)
Hierarchical Memory for Long Video QA
di: Wang, Yiqin, et al.
Pubblicazione: (2024)
di: Wang, Yiqin, et al.
Pubblicazione: (2024)
Traffic Scene Parsing through the TSP6K Dataset
di: Jiang, Peng-Tao, et al.
Pubblicazione: (2023)
di: Jiang, Peng-Tao, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Sora Generates Videos with Stunning Geometrical Consistency
di: Li, Xuanyi, et al.
Pubblicazione: (2024) -
AR-1-to-3: Single Image to Consistent 3D Object Generation via Next-View Prediction
di: Zhang, Xuying, et al.
Pubblicazione: (2025) -
Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation
di: Zhou, Yupeng, et al.
Pubblicazione: (2026) -
SRFormerV2: Taking a Closer Look at Permuted Self-Attention for Image Super-Resolution
di: Zhou, Yupeng, et al.
Pubblicazione: (2023) -
Low-Resolution Self-Attention for Semantic Segmentation
di: Wu, Yu-Huan, et al.
Pubblicazione: (2023)