OmniEdit: A Training-free framework for Lip Synchronization and Audio-Visual Editing
Fuente:
arXiv
Salvato in:
| Autori principali: | Lin, Lixiang, Jin, Siyuan, Zhang, Jinshan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
OmniEdit: Building Image Editing Generalist Models Through Specialist Supervision
di: Wei, Cong, et al.
Pubblicazione: (2024)
di: Wei, Cong, et al.
Pubblicazione: (2024)
OmniSync: Towards Universal Lip Synchronization via Diffusion Transformers
di: Peng, Ziqiao, et al.
Pubblicazione: (2025)
di: Peng, Ziqiao, et al.
Pubblicazione: (2025)
ConsistEdit: Highly Consistent and Precise Training-free Visual Editing
di: Yin, Zixin, et al.
Pubblicazione: (2025)
di: Yin, Zixin, et al.
Pubblicazione: (2025)
SayAnything: Audio-Driven Lip Synchronization with Conditional Video Diffusion
di: Ma, Junxian, et al.
Pubblicazione: (2025)
di: Ma, Junxian, et al.
Pubblicazione: (2025)
Audio-Synchronized Visual Animation
di: Zhang, Lin, et al.
Pubblicazione: (2024)
di: Zhang, Lin, et al.
Pubblicazione: (2024)
Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm
di: Zhang, Lin, et al.
Pubblicazione: (2025)
di: Zhang, Lin, et al.
Pubblicazione: (2025)
UniEdit-I: Training-free Image Editing for Unified VLM via Iterative Understanding, Editing and Verifying
di: Bai, Chengyu, et al.
Pubblicazione: (2025)
di: Bai, Chengyu, et al.
Pubblicazione: (2025)
Lips Are Lying: Spotting the Temporal Inconsistency between Audio and Visual in Lip-Syncing DeepFakes
di: Liu, Weifeng, et al.
Pubblicazione: (2024)
di: Liu, Weifeng, et al.
Pubblicazione: (2024)
UniSync: Towards Generalizable and High-Fidelity Lip Synchronization for Challenging Scenarios
di: Fan, Ruidi, et al.
Pubblicazione: (2026)
di: Fan, Ruidi, et al.
Pubblicazione: (2026)
KeySync: A Robust Approach for Leakage-free Lip Synchronization in High Resolution
di: Bigata, Antoni, et al.
Pubblicazione: (2025)
di: Bigata, Antoni, et al.
Pubblicazione: (2025)
InteractiveOmni: A Unified Omni-modal Model for Audio-Visual Multi-turn Dialogue
di: Tong, Wenwen, et al.
Pubblicazione: (2025)
di: Tong, Wenwen, et al.
Pubblicazione: (2025)
KV-Edit: Training-Free Image Editing for Precise Background Preservation
di: Zhu, Tianrui, et al.
Pubblicazione: (2025)
di: Zhu, Tianrui, et al.
Pubblicazione: (2025)
AV-Edit: Multimodal Generative Sound Effect Editing via Audio-Visual Semantic Joint Control
di: Guo, Xinyue, et al.
Pubblicazione: (2025)
di: Guo, Xinyue, et al.
Pubblicazione: (2025)
X-Edit: Exact, Explicit, and Explainable Null-Space Editing for Medical Vision Transformers
di: Liu, Yuanye, et al.
Pubblicazione: (2026)
di: Liu, Yuanye, et al.
Pubblicazione: (2026)
Reasoning to Edit: Hypothetical Instruction-Based Image Editing with Visual Reasoning
di: He, Qingdong, et al.
Pubblicazione: (2025)
di: He, Qingdong, et al.
Pubblicazione: (2025)
SpotEdit: Evaluating Visually-Guided Image Editing Methods
di: Ghazanfari, Sara, et al.
Pubblicazione: (2025)
di: Ghazanfari, Sara, et al.
Pubblicazione: (2025)
LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning
di: Dai, Yifan, et al.
Pubblicazione: (2026)
di: Dai, Yifan, et al.
Pubblicazione: (2026)
AVI-Edit: Audio-sync Video Instance Editing with Granularity-Aware Mask Refiner
di: Zheng, Haojie, et al.
Pubblicazione: (2025)
di: Zheng, Haojie, et al.
Pubblicazione: (2025)
SpecEdit: Training-Free Acceleration for Diffusion based Image Editing via Semantic Locking
di: Yan, Zhengan, et al.
Pubblicazione: (2026)
di: Yan, Zhengan, et al.
Pubblicazione: (2026)
DeltaEdit: Exploring Text-free Training for Text-Driven Image Manipulation
di: Lyu, Yueming, et al.
Pubblicazione: (2023)
di: Lyu, Yueming, et al.
Pubblicazione: (2023)
Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing
di: Tian, Zeyue, et al.
Pubblicazione: (2026)
di: Tian, Zeyue, et al.
Pubblicazione: (2026)
A Synchronized Audio-Visual Multi-View Capture System
di: Shi, Xiangwei, et al.
Pubblicazione: (2026)
di: Shi, Xiangwei, et al.
Pubblicazione: (2026)
Edit-Compass & EditReward-Compass: A Unified Benchmark for Image Editing and Reward Modeling
di: Bai, Xuehai, et al.
Pubblicazione: (2026)
di: Bai, Xuehai, et al.
Pubblicazione: (2026)
FusionEdit: Semantic Fusion and Attention Modulation for Training-Free Image Editing
di: Lai, Yongwen, et al.
Pubblicazione: (2026)
di: Lai, Yongwen, et al.
Pubblicazione: (2026)
OphEdit: Training-Free Text-Guided Editing of Ophthalmic Surgical Videos
di: Jangir, Ritul, et al.
Pubblicazione: (2026)
di: Jangir, Ritul, et al.
Pubblicazione: (2026)
Omni-o3: Deep Nested Omnimodal Deduction for Deliberative Audio-Visual Reasoning
di: Zhang, Zhicheng, et al.
Pubblicazione: (2026)
di: Zhang, Zhicheng, et al.
Pubblicazione: (2026)
EditTransfer++: Toward Faithful and Efficient Visual-Prompt-Guided Image Editing
di: Chen, Lan, et al.
Pubblicazione: (2026)
di: Chen, Lan, et al.
Pubblicazione: (2026)
SpatialEdit: Benchmarking Fine-Grained Image Spatial Editing
di: Xiao, Yicheng, et al.
Pubblicazione: (2026)
di: Xiao, Yicheng, et al.
Pubblicazione: (2026)
ImgEdit: A Unified Image Editing Dataset and Benchmark
di: Ye, Yang, et al.
Pubblicazione: (2025)
di: Ye, Yang, et al.
Pubblicazione: (2025)
Omni$^2$: Unifying Omnidirectional Image Generation and Editing in an Omni Model
di: Yang, Liu, et al.
Pubblicazione: (2025)
di: Yang, Liu, et al.
Pubblicazione: (2025)
DreamOmni: Unified Image Generation and Editing
di: Xia, Bin, et al.
Pubblicazione: (2024)
di: Xia, Bin, et al.
Pubblicazione: (2024)
EIRES:Training-free AI-Generated Image Detection via Edit-Induced Reconstruction Error Shift
di: Jiang, Wan, et al.
Pubblicazione: (2025)
di: Jiang, Wan, et al.
Pubblicazione: (2025)
EditCrafter: Tuning-free High-Resolution Image Editing via Pretrained Diffusion Model
di: Kim, Kunho, et al.
Pubblicazione: (2026)
di: Kim, Kunho, et al.
Pubblicazione: (2026)
PartEdit: Fine-Grained Image Editing using Pre-Trained Diffusion Models
di: Cvejic, Aleksandar, et al.
Pubblicazione: (2025)
di: Cvejic, Aleksandar, et al.
Pubblicazione: (2025)
InsightEdit: Towards Better Instruction Following for Image Editing
di: Xu, Yingjing, et al.
Pubblicazione: (2024)
di: Xu, Yingjing, et al.
Pubblicazione: (2024)
HighSync: High-Quality Lip Synchronization via Latent Diffusion Models
di: Daghigh, Saeed Firouzi, et al.
Pubblicazione: (2026)
di: Daghigh, Saeed Firouzi, et al.
Pubblicazione: (2026)
FluentLip: A Phonemes-Based Two-stage Approach for Audio-Driven Lip Synthesis with Optical Flow Consistency
di: Liu, Shiyan, et al.
Pubblicazione: (2025)
di: Liu, Shiyan, et al.
Pubblicazione: (2025)
Training-free Geometric Image Editing on Diffusion Models
di: Zhu, Hanshen, et al.
Pubblicazione: (2025)
di: Zhu, Hanshen, et al.
Pubblicazione: (2025)
Exploiting Temporal Audio-Visual Correlation Embedding for Audio-Driven One-Shot Talking Head Animation
di: Xu, Zhihua, et al.
Pubblicazione: (2025)
di: Xu, Zhihua, et al.
Pubblicazione: (2025)
LipGen: Viseme-Guided Lip Video Generation for Enhancing Visual Speech Recognition
di: Hao, Bowen, et al.
Pubblicazione: (2025)
di: Hao, Bowen, et al.
Pubblicazione: (2025)
Documenti analoghi
-
OmniEdit: Building Image Editing Generalist Models Through Specialist Supervision
di: Wei, Cong, et al.
Pubblicazione: (2024) -
OmniSync: Towards Universal Lip Synchronization via Diffusion Transformers
di: Peng, Ziqiao, et al.
Pubblicazione: (2025) -
ConsistEdit: Highly Consistent and Precise Training-free Visual Editing
di: Yin, Zixin, et al.
Pubblicazione: (2025) -
SayAnything: Audio-Driven Lip Synchronization with Conditional Video Diffusion
di: Ma, Junxian, et al.
Pubblicazione: (2025) -
Audio-Synchronized Visual Animation
di: Zhang, Lin, et al.
Pubblicazione: (2024)