EVA: Zero-shot Accurate Attributes and Multi-Object Video Editing
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yang, Xiangpeng, Zhu, Linchao, Fan, Hehe, Yang, Yi |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VideoGrain: Modulating Space-Time Attention for Multi-grained Video Editing
par: Yang, Xiangpeng, et autres
Publié: (2025)
par: Yang, Xiangpeng, et autres
Publié: (2025)
DGL: Dynamic Global-Local Prompt Tuning for Text-Video Retrieval
par: Yang, Xiangpeng, et autres
Publié: (2024)
par: Yang, Xiangpeng, et autres
Publié: (2024)
Knowledge-Enhanced Dual-stream Zero-shot Composed Image Retrieval
par: Suo, Yucheng, et autres
Publié: (2024)
par: Suo, Yucheng, et autres
Publié: (2024)
AudioScenic: Audio-Driven Video Scene Editing
par: Shen, Kaixin, et autres
Publié: (2024)
par: Shen, Kaixin, et autres
Publié: (2024)
Zero-shot Face Editing via ID-Attribute Decoupled Inversion
par: Hou, Yang, et autres
Publié: (2025)
par: Hou, Yang, et autres
Publié: (2025)
BVINet: Unlocking Blind Video Inpainting with Zero Annotations
par: Wu, Zhiliang, et autres
Publié: (2025)
par: Wu, Zhiliang, et autres
Publié: (2025)
TransNormal: Dense Visual Semantics for Diffusion-based Transparent Object Normal Estimation
par: Li, Mingwei, et autres
Publié: (2026)
par: Li, Mingwei, et autres
Publié: (2026)
Adaptive Multi-source Predictor for Zero-shot Video Object Segmentation
par: Zhao, Xiaoqi, et autres
Publié: (2023)
par: Zhao, Xiaoqi, et autres
Publié: (2023)
MC-Bench: A Benchmark for Multi-Context Visual Grounding in the Era of MLLMs
par: Xu, Yunqiu, et autres
Publié: (2024)
par: Xu, Yunqiu, et autres
Publié: (2024)
Zero-1-to-A: Zero-Shot One Image to Animatable Head Avatars Using Video Diffusion
par: Zhou, Zhenglin, et autres
Publié: (2025)
par: Zhou, Zhenglin, et autres
Publié: (2025)
VideoCoF: Unified Video Editing with Temporal Reasoner
par: Yang, Xiangpeng, et autres
Publié: (2025)
par: Yang, Xiangpeng, et autres
Publié: (2025)
FreeLong: Training-Free Long Video Generation with SpectralBlend Temporal Attention
par: Lu, Yu, et autres
Publié: (2024)
par: Lu, Yu, et autres
Publié: (2024)
Test-Time Adaptation with CLIP Reward for Zero-Shot Generalization in Vision-Language Models
par: Zhao, Shuai, et autres
Publié: (2023)
par: Zhao, Shuai, et autres
Publié: (2023)
ZeroMamba: Exploring Visual State Space Model for Zero-Shot Learning
par: Hou, Wenjin, et autres
Publié: (2024)
par: Hou, Wenjin, et autres
Publié: (2024)
Zero-shot Object Counting with Good Exemplars
par: Zhu, Huilin, et autres
Publié: (2024)
par: Zhu, Huilin, et autres
Publié: (2024)
EnergyMoGen: Compositional Human Motion Generation with Energy-Based Diffusion Model in Latent Space
par: Zhang, Jianrong, et autres
Publié: (2024)
par: Zhang, Jianrong, et autres
Publié: (2024)
DeMoGen: Towards Decompositional Human Motion Generation with Energy-Based Diffusion Models
par: Zhang, Jianrong, et autres
Publié: (2025)
par: Zhang, Jianrong, et autres
Publié: (2025)
COMAE: COMprehensive Attribute Exploration for Zero-shot Hashing
par: Li, Yuqi, et autres
Publié: (2024)
par: Li, Yuqi, et autres
Publié: (2024)
Z-Magic: Zero-shot Multiple Attributes Guided Image Creator
par: Deng, Yingying, et autres
Publié: (2025)
par: Deng, Yingying, et autres
Publié: (2025)
AnchorFlow: Training-Free 3D Editing via Latent Anchor-Aligned Flows
par: Zhou, Zhenglin, et autres
Publié: (2025)
par: Zhou, Zhenglin, et autres
Publié: (2025)
VividDreamer: Invariant Score Distillation For Hyper-Realistic Text-to-3D Generation
par: Zhuo, Wenjie, et autres
Publié: (2024)
par: Zhuo, Wenjie, et autres
Publié: (2024)
MTC-VAE: Multi-Level Temporal Compression with Content Awareness
par: Dong, Yubo, et autres
Publié: (2026)
par: Dong, Yubo, et autres
Publié: (2026)
Zero-shot Image Editing with Reference Imitation
par: Chen, Xi, et autres
Publié: (2024)
par: Chen, Xi, et autres
Publié: (2024)
HeadStudio: Text to Animatable Head Avatars with 3D Gaussian Splatting
par: Zhou, Zhenglin, et autres
Publié: (2024)
par: Zhou, Zhenglin, et autres
Publié: (2024)
FlexSelect: Flexible Token Selection for Efficient Long Video Understanding
par: Zhang, Yunzhu, et autres
Publié: (2025)
par: Zhang, Yunzhu, et autres
Publié: (2025)
Incentivizing Generative Zero-Shot Learning via Outcome-Reward Reinforcement Learning with Visual Cues
par: Hou, Wenjin, et autres
Publié: (2026)
par: Hou, Wenjin, et autres
Publié: (2026)
Zero-shot Reconstruction of In-Scene Object Manipulation from Video
par: Lin, Dixuan, et autres
Publié: (2025)
par: Lin, Dixuan, et autres
Publié: (2025)
Prompt-Aware Adapter: Towards Learning Adaptive Visual Tokens for Multimodal Large Language Models
par: Zhang, Yue, et autres
Publié: (2024)
par: Zhang, Yue, et autres
Publié: (2024)
3DID: Direct 3D Inverse Design for Aerodynamics with Physics-Aware Optimization
par: Hao, Yuze, et autres
Publié: (2025)
par: Hao, Yuze, et autres
Publié: (2025)
FREE-Edit: Using Editing-aware Injection in Rectified Flow Models for Zero-shot Image-Driven Video Editing
par: Li, Maomao, et autres
Publié: (2026)
par: Li, Maomao, et autres
Publié: (2026)
MDE-Edit: Masked Dual-Editing for Multi-Object Image Editing via Diffusion Models
par: Zhu, Hongyang, et autres
Publié: (2025)
par: Zhu, Hongyang, et autres
Publié: (2025)
Combating Label Noise With A General Surrogate Model For Sample Selection
par: Liang, Chao, et autres
Publié: (2023)
par: Liang, Chao, et autres
Publié: (2023)
Slimmable Networks for Contrastive Self-supervised Learning
par: Zhao, Shuai, et autres
Publié: (2022)
par: Zhao, Shuai, et autres
Publié: (2022)
CLIP4STR: A Simple Baseline for Scene Text Recognition with Pre-trained Vision-Language Model
par: Zhao, Shuai, et autres
Publié: (2023)
par: Zhao, Shuai, et autres
Publié: (2023)
Collaborative Group: Composed Image Retrieval via Consensus Learning from Noisy Annotations
par: Zhang, Xu, et autres
Publié: (2023)
par: Zhang, Xu, et autres
Publié: (2023)
DFVEdit: Conditional Delta Flow Vector for Zero-shot Video Editing
par: Cai, Lingling, et autres
Publié: (2025)
par: Cai, Lingling, et autres
Publié: (2025)
From Trial to Triumph: Advancing Long Video Understanding via Visual Context Sample Scaling and Self-reward Alignment
par: Suo, Yucheng, et autres
Publié: (2025)
par: Suo, Yucheng, et autres
Publié: (2025)
Depth-aware Test-Time Training for Zero-shot Video Object Segmentation
par: Liu, Weihuang, et autres
Publié: (2024)
par: Liu, Weihuang, et autres
Publié: (2024)
DVAR: Adversarial Multi-Agent Debate for Video Authenticity Detection
par: Qi, Hongyuan, et autres
Publié: (2026)
par: Qi, Hongyuan, et autres
Publié: (2026)
GPD: Guided Progressive Distillation for Fast and High-Quality Video Generation
par: Liang, Xiao, et autres
Publié: (2026)
par: Liang, Xiao, et autres
Publié: (2026)
Documents similaires
-
VideoGrain: Modulating Space-Time Attention for Multi-grained Video Editing
par: Yang, Xiangpeng, et autres
Publié: (2025) -
DGL: Dynamic Global-Local Prompt Tuning for Text-Video Retrieval
par: Yang, Xiangpeng, et autres
Publié: (2024) -
Knowledge-Enhanced Dual-stream Zero-shot Composed Image Retrieval
par: Suo, Yucheng, et autres
Publié: (2024) -
AudioScenic: Audio-Driven Video Scene Editing
par: Shen, Kaixin, et autres
Publié: (2024) -
Zero-shot Face Editing via ID-Attribute Decoupled Inversion
par: Hou, Yang, et autres
Publié: (2025)