VideoGrain: Modulating Space-Time Attention for Multi-grained Video Editing
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Yang, Xiangpeng, Zhu, Linchao, Fan, Hehe, Yang, Yi |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
EVA: Zero-shot Accurate Attributes and Multi-Object Video Editing
von: Yang, Xiangpeng, et al.
Veröffentlicht: (2024)
von: Yang, Xiangpeng, et al.
Veröffentlicht: (2024)
DGL: Dynamic Global-Local Prompt Tuning for Text-Video Retrieval
von: Yang, Xiangpeng, et al.
Veröffentlicht: (2024)
von: Yang, Xiangpeng, et al.
Veröffentlicht: (2024)
AudioScenic: Audio-Driven Video Scene Editing
von: Shen, Kaixin, et al.
Veröffentlicht: (2024)
von: Shen, Kaixin, et al.
Veröffentlicht: (2024)
FreeLong: Training-Free Long Video Generation with SpectralBlend Temporal Attention
von: Lu, Yu, et al.
Veröffentlicht: (2024)
von: Lu, Yu, et al.
Veröffentlicht: (2024)
VideoCoF: Unified Video Editing with Temporal Reasoner
von: Yang, Xiangpeng, et al.
Veröffentlicht: (2025)
von: Yang, Xiangpeng, et al.
Veröffentlicht: (2025)
BVINet: Unlocking Blind Video Inpainting with Zero Annotations
von: Wu, Zhiliang, et al.
Veröffentlicht: (2025)
von: Wu, Zhiliang, et al.
Veröffentlicht: (2025)
EnergyMoGen: Compositional Human Motion Generation with Energy-Based Diffusion Model in Latent Space
von: Zhang, Jianrong, et al.
Veröffentlicht: (2024)
von: Zhang, Jianrong, et al.
Veröffentlicht: (2024)
MC-Bench: A Benchmark for Multi-Context Visual Grounding in the Era of MLLMs
von: Xu, Yunqiu, et al.
Veröffentlicht: (2024)
von: Xu, Yunqiu, et al.
Veröffentlicht: (2024)
FlexSelect: Flexible Token Selection for Efficient Long Video Understanding
von: Zhang, Yunzhu, et al.
Veröffentlicht: (2025)
von: Zhang, Yunzhu, et al.
Veröffentlicht: (2025)
Edit-Your-Motion: Space-Time Diffusion Decoupling Learning for Video Motion Editing
von: Zuo, Yi, et al.
Veröffentlicht: (2024)
von: Zuo, Yi, et al.
Veröffentlicht: (2024)
MAKIMA: Tuning-free Multi-Attribute Open-domain Video Editing via Mask-Guided Attention Modulation
von: Zheng, Haoyu, et al.
Veröffentlicht: (2024)
von: Zheng, Haoyu, et al.
Veröffentlicht: (2024)
Trajectory Attention for Fine-grained Video Motion Control
von: Xiao, Zeqi, et al.
Veröffentlicht: (2024)
von: Xiao, Zeqi, et al.
Veröffentlicht: (2024)
DVAR: Adversarial Multi-Agent Debate for Video Authenticity Detection
von: Qi, Hongyuan, et al.
Veröffentlicht: (2026)
von: Qi, Hongyuan, et al.
Veröffentlicht: (2026)
GPD: Guided Progressive Distillation for Fast and High-Quality Video Generation
von: Liang, Xiao, et al.
Veröffentlicht: (2026)
von: Liang, Xiao, et al.
Veröffentlicht: (2026)
From Trial to Triumph: Advancing Long Video Understanding via Visual Context Sample Scaling and Self-reward Alignment
von: Suo, Yucheng, et al.
Veröffentlicht: (2025)
von: Suo, Yucheng, et al.
Veröffentlicht: (2025)
Knowledge-Enhanced Dual-stream Zero-shot Composed Image Retrieval
von: Suo, Yucheng, et al.
Veröffentlicht: (2024)
von: Suo, Yucheng, et al.
Veröffentlicht: (2024)
STDAN: Deformable Attention Network for Space-Time Video Super-Resolution
von: Wang, Hai, et al.
Veröffentlicht: (2022)
von: Wang, Hai, et al.
Veröffentlicht: (2022)
ImVideoEdit: Image-learning Video Editing via 2D Spatial Difference Attention Blocks
von: Xu, Jiayang, et al.
Veröffentlicht: (2026)
von: Xu, Jiayang, et al.
Veröffentlicht: (2026)
DeMoGen: Towards Decompositional Human Motion Generation with Energy-Based Diffusion Models
von: Zhang, Jianrong, et al.
Veröffentlicht: (2025)
von: Zhang, Jianrong, et al.
Veröffentlicht: (2025)
TransNormal: Dense Visual Semantics for Diffusion-based Transparent Object Normal Estimation
von: Li, Mingwei, et al.
Veröffentlicht: (2026)
von: Li, Mingwei, et al.
Veröffentlicht: (2026)
Scaling Video Understanding via Compact Latent Multi-Agent Collaboration
von: Chen, Kerui, et al.
Veröffentlicht: (2026)
von: Chen, Kerui, et al.
Veröffentlicht: (2026)
TOPA: Extending Large Language Models for Video Understanding via Text-Only Pre-Alignment
von: Li, Wei, et al.
Veröffentlicht: (2024)
von: Li, Wei, et al.
Veröffentlicht: (2024)
MMAD: Multi-label Micro-Action Detection in Videos
von: Li, Kun, et al.
Veröffentlicht: (2024)
von: Li, Kun, et al.
Veröffentlicht: (2024)
TV-Dialogue: Crafting Theme-Aware Video Dialogues with Immersive Interaction
von: Wang, Sai, et al.
Veröffentlicht: (2025)
von: Wang, Sai, et al.
Veröffentlicht: (2025)
Test-Time Adaptation with CLIP Reward for Zero-Shot Generalization in Vision-Language Models
von: Zhao, Shuai, et al.
Veröffentlicht: (2023)
von: Zhao, Shuai, et al.
Veröffentlicht: (2023)
Zero-1-to-A: Zero-Shot One Image to Animatable Head Avatars Using Video Diffusion
von: Zhou, Zhenglin, et al.
Veröffentlicht: (2025)
von: Zhou, Zhenglin, et al.
Veröffentlicht: (2025)
AnchorFlow: Training-Free 3D Editing via Latent Anchor-Aligned Flows
von: Zhou, Zhenglin, et al.
Veröffentlicht: (2025)
von: Zhou, Zhenglin, et al.
Veröffentlicht: (2025)
VividDreamer: Invariant Score Distillation For Hyper-Realistic Text-to-3D Generation
von: Zhuo, Wenjie, et al.
Veröffentlicht: (2024)
von: Zhuo, Wenjie, et al.
Veröffentlicht: (2024)
Edit As You Wish: Video Caption Editing with Multi-grained User Control
von: Yao, Linli, et al.
Veröffentlicht: (2023)
von: Yao, Linli, et al.
Veröffentlicht: (2023)
CAST: Cross-Attention in Space and Time for Video Action Recognition
von: Lee, Dongho, et al.
Veröffentlicht: (2023)
von: Lee, Dongho, et al.
Veröffentlicht: (2023)
MTC-VAE: Multi-Level Temporal Compression with Content Awareness
von: Dong, Yubo, et al.
Veröffentlicht: (2026)
von: Dong, Yubo, et al.
Veröffentlicht: (2026)
FAME: Fairness-aware Attention-modulated Video Editing
von: Wu, Zhangkai, et al.
Veröffentlicht: (2025)
von: Wu, Zhangkai, et al.
Veröffentlicht: (2025)
Streaming Video Diffusion: Online Video Editing with Diffusion Models
von: Chen, Feng, et al.
Veröffentlicht: (2024)
von: Chen, Feng, et al.
Veröffentlicht: (2024)
HeadStudio: Text to Animatable Head Avatars with 3D Gaussian Splatting
von: Zhou, Zhenglin, et al.
Veröffentlicht: (2024)
von: Zhou, Zhenglin, et al.
Veröffentlicht: (2024)
ZeroMamba: Exploring Visual State Space Model for Zero-Shot Learning
von: Hou, Wenjin, et al.
Veröffentlicht: (2024)
von: Hou, Wenjin, et al.
Veröffentlicht: (2024)
I2VEdit: First-Frame-Guided Video Editing via Image-to-Video Diffusion Models
von: Ouyang, Wenqi, et al.
Veröffentlicht: (2024)
von: Ouyang, Wenqi, et al.
Veröffentlicht: (2024)
Neural Video Fields Editing
von: Yang, Shuzhou, et al.
Veröffentlicht: (2023)
von: Yang, Shuzhou, et al.
Veröffentlicht: (2023)
Qffusion: Controllable Portrait Video Editing via Quadrant-Grid Attention Learning
von: Li, Maomao, et al.
Veröffentlicht: (2025)
von: Li, Maomao, et al.
Veröffentlicht: (2025)
Prompt-Aware Adapter: Towards Learning Adaptive Visual Tokens for Multimodal Large Language Models
von: Zhang, Yue, et al.
Veröffentlicht: (2024)
von: Zhang, Yue, et al.
Veröffentlicht: (2024)
Generative Model-Based Feature Attention Module for Video Action Analysis
von: Wang, Guiqin, et al.
Veröffentlicht: (2025)
von: Wang, Guiqin, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
EVA: Zero-shot Accurate Attributes and Multi-Object Video Editing
von: Yang, Xiangpeng, et al.
Veröffentlicht: (2024) -
DGL: Dynamic Global-Local Prompt Tuning for Text-Video Retrieval
von: Yang, Xiangpeng, et al.
Veröffentlicht: (2024) -
AudioScenic: Audio-Driven Video Scene Editing
von: Shen, Kaixin, et al.
Veröffentlicht: (2024) -
FreeLong: Training-Free Long Video Generation with SpectralBlend Temporal Attention
von: Lu, Yu, et al.
Veröffentlicht: (2024) -
VideoCoF: Unified Video Editing with Temporal Reasoner
von: Yang, Xiangpeng, et al.
Veröffentlicht: (2025)