EgoEdit: Dataset, Real-Time Streaming Model, and Benchmark for Egocentric Video Editing
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Runjia, Haji-Ali, Moayed, Mirzaei, Ashkan, Wang, Chaoyang, Sahni, Arpit, Skorokhodov, Ivan, Siarohin, Aliaksandr, Jakab, Tomas, Han, Junlin, Tulyakov, Sergey, Torr, Philip, Menapace, Willi |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Improving Progressive Generation with Decomposable Flow Matching
par: Haji-Ali, Moayed, et autres
Publié: (2025)
par: Haji-Ali, Moayed, et autres
Publié: (2025)
Hierarchical Patch Diffusion Models for High-Resolution Video Generation
par: Skorokhodov, Ivan, et autres
Publié: (2024)
par: Skorokhodov, Ivan, et autres
Publié: (2024)
DenseDPO: Fine-Grained Temporal Preference Optimization for Video Diffusion Models
par: Wu, Ziyi, et autres
Publié: (2025)
par: Wu, Ziyi, et autres
Publié: (2025)
AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation
par: Haji-Ali, Moayed, et autres
Publié: (2024)
par: Haji-Ali, Moayed, et autres
Publié: (2024)
One Model, Many Budgets: Elastic Latent Interfaces for Diffusion Transformers
par: Haji-Ali, Moayed, et autres
Publié: (2026)
par: Haji-Ali, Moayed, et autres
Publié: (2026)
Taming Data and Transformers for Audio Generation
par: Haji-Ali, Moayed, et autres
Publié: (2024)
par: Haji-Ali, Moayed, et autres
Publié: (2024)
AlphaFlow: Understanding and Improving MeanFlow Models
par: Zhang, Huijie, et autres
Publié: (2025)
par: Zhang, Huijie, et autres
Publié: (2025)
4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation
par: Wang, Chaoyang, et autres
Publié: (2025)
par: Wang, Chaoyang, et autres
Publié: (2025)
Sprint: Sparse-Dense Residual Fusion for Efficient Diffusion Transformers
par: Park, Dogyun, et autres
Publié: (2025)
par: Park, Dogyun, et autres
Publié: (2025)
Dynamic Concepts Personalization from Single Videos
par: Abdal, Rameen, et autres
Publié: (2025)
par: Abdal, Rameen, et autres
Publié: (2025)
Improving the Diffusability of Autoencoders
par: Skorokhodov, Ivan, et autres
Publié: (2025)
par: Skorokhodov, Ivan, et autres
Publié: (2025)
Mind the Time: Temporally-Controlled Multi-Event Video Generation
par: Wu, Ziyi, et autres
Publié: (2024)
par: Wu, Ziyi, et autres
Publié: (2024)
Taming Diffusion Transformer for Efficient Mobile Video Generation in Seconds
par: Wu, Yushu, et autres
Publié: (2025)
par: Wu, Yushu, et autres
Publié: (2025)
AC3D: Analyzing and Improving 3D Camera Control in Video Diffusion Transformers
par: Bahmani, Sherwin, et autres
Publié: (2024)
par: Bahmani, Sherwin, et autres
Publié: (2024)
EasyV2V: A High-quality Instruction-based Video Editing Framework
par: Mai, Jinjie, et autres
Publié: (2025)
par: Mai, Jinjie, et autres
Publié: (2025)
VIMI: Grounding Video Generation through Multi-modal Instruction
par: Fang, Yuwei, et autres
Publié: (2024)
par: Fang, Yuwei, et autres
Publié: (2024)
H3AE: High Compression, High Speed, and High Quality AutoEncoder for Video Diffusion Models
par: Wu, Yushu, et autres
Publié: (2025)
par: Wu, Yushu, et autres
Publié: (2025)
4Real-Video: Learning Generalizable Photo-Realistic 4D Video Diffusion
par: Wang, Chaoyang, et autres
Publié: (2024)
par: Wang, Chaoyang, et autres
Publié: (2024)
Promptable Game Models: Text-Guided Game Simulation via Masked Diffusion Models
par: Menapace, Willi, et autres
Publié: (2023)
par: Menapace, Willi, et autres
Publié: (2023)
Video Motion Transfer with Diffusion Transformers
par: Pondaven, Alexander, et autres
Publié: (2024)
par: Pondaven, Alexander, et autres
Publié: (2024)
Omni-Attribute: Open-vocabulary Attribute Encoder for Visual Concept Personalization
par: Chen, Tsai-Shien, et autres
Publié: (2025)
par: Chen, Tsai-Shien, et autres
Publié: (2025)
OmniView: An All-Seeing Diffusion Model for 3D and 4D View Synthesis
par: Fan, Xiang, et autres
Publié: (2025)
par: Fan, Xiang, et autres
Publié: (2025)
AsCAN: Asymmetric Convolution-Attention Networks for Efficient Recognition and Generation
par: Kag, Anil, et autres
Publié: (2024)
par: Kag, Anil, et autres
Publié: (2024)
4Real: Towards Photorealistic 4D Scene Generation via Video Diffusion Models
par: Yu, Heng, et autres
Publié: (2024)
par: Yu, Heng, et autres
Publié: (2024)
VD3D: Taming Large Video Diffusion Transformers for 3D Camera Control
par: Bahmani, Sherwin, et autres
Publié: (2024)
par: Bahmani, Sherwin, et autres
Publié: (2024)
Snap Video: Scaled Spatiotemporal Transformers for Text-to-Video Synthesis
par: Menapace, Willi, et autres
Publié: (2024)
par: Menapace, Willi, et autres
Publié: (2024)
SF-V: Single Forward Video Generation Model
par: Zhang, Zhixing, et autres
Publié: (2024)
par: Zhang, Zhixing, et autres
Publié: (2024)
Multi-subject Open-set Personalization in Video Generation
par: Chen, Tsai-Shien, et autres
Publié: (2025)
par: Chen, Tsai-Shien, et autres
Publié: (2025)
VMem: Consistent Interactive Video Scene Generation with Surfel-Indexed View Memory
par: Li, Runjia, et autres
Publié: (2025)
par: Li, Runjia, et autres
Publié: (2025)
ActionParty: Multi-Subject Action Binding in Generative Video Games
par: Pondaven, Alexander, et autres
Publié: (2026)
par: Pondaven, Alexander, et autres
Publié: (2026)
Diffusion Priors for Dynamic View Synthesis from Monocular Videos
par: Wang, Chaoyang, et autres
Publié: (2024)
par: Wang, Chaoyang, et autres
Publié: (2024)
S2DiT: Sandwich Diffusion Transformer for Mobile Streaming Video Generation
par: Zhao, Lin, et autres
Publié: (2026)
par: Zhao, Lin, et autres
Publié: (2026)
HyperHuman: Hyper-Realistic Human Generation with Latent Structural Diffusion
par: Liu, Xian, et autres
Publié: (2023)
par: Liu, Xian, et autres
Publié: (2023)
Pixel-Aligned Multi-View Generation with Depth Guided Decoder
par: Tang, Zhenggang, et autres
Publié: (2024)
par: Tang, Zhenggang, et autres
Publié: (2024)
LayerComposer: Multi-Human Personalized Generation via Layered Canvas
par: Qian, Guocheng Gordon, et autres
Publié: (2025)
par: Qian, Guocheng Gordon, et autres
Publié: (2025)
AlcheMinT: Fine-grained Temporal Control for Multi-Reference Consistent Video Generation
par: Girish, Sharath, et autres
Publié: (2025)
par: Girish, Sharath, et autres
Publié: (2025)
Can Text-to-Video Generation help Video-Language Alignment?
par: Zanella, Luca, et autres
Publié: (2025)
par: Zanella, Luca, et autres
Publié: (2025)
GTR: Improving Large 3D Reconstruction Models through Geometry and Texture Refinement
par: Zhuang, Peiye, et autres
Publié: (2024)
par: Zhuang, Peiye, et autres
Publié: (2024)
Panda-70M: Captioning 70M Videos with Multiple Cross-Modality Teachers
par: Chen, Tsai-Shien, et autres
Publié: (2024)
par: Chen, Tsai-Shien, et autres
Publié: (2024)
DreamBeast: Distilling 3D Fantastical Animals with Part-Aware Knowledge Transfer
par: Li, Runjia, et autres
Publié: (2024)
par: Li, Runjia, et autres
Publié: (2024)
Documents similaires
-
Improving Progressive Generation with Decomposable Flow Matching
par: Haji-Ali, Moayed, et autres
Publié: (2025) -
Hierarchical Patch Diffusion Models for High-Resolution Video Generation
par: Skorokhodov, Ivan, et autres
Publié: (2024) -
DenseDPO: Fine-Grained Temporal Preference Optimization for Video Diffusion Models
par: Wu, Ziyi, et autres
Publié: (2025) -
AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation
par: Haji-Ali, Moayed, et autres
Publié: (2024) -
One Model, Many Budgets: Elastic Latent Interfaces for Diffusion Transformers
par: Haji-Ali, Moayed, et autres
Publié: (2026)