MoCha:End-to-End Video Character Replacement without Structural Guidance
Fuente:
arXiv
Salvato in:
| Autori principali: | Xu, Zhengbo, Ma, Jie, Wang, Ziheng, Peng, Zhan, Liang, Jun, Li, Jing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MoCam: Unified Novel View Synthesis via Structured Denoising Dynamics
di: Liu, Haofeng, et al.
Pubblicazione: (2026)
di: Liu, Haofeng, et al.
Pubblicazione: (2026)
MoCha: Towards Movie-Grade Talking Character Synthesis
di: Wei, Cong, et al.
Pubblicazione: (2025)
di: Wei, Cong, et al.
Pubblicazione: (2025)
Unleashing Generalization of End-to-End Autonomous Driving with Controllable Long Video Generation
di: Ma, Enhui, et al.
Pubblicazione: (2024)
di: Ma, Enhui, et al.
Pubblicazione: (2024)
MoGA: Mixture-of-Groups Attention for End-to-End Long Video Generation
di: Jia, Weinan, et al.
Pubblicazione: (2025)
di: Jia, Weinan, et al.
Pubblicazione: (2025)
Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs
di: Cheng, Dabing, et al.
Pubblicazione: (2025)
di: Cheng, Dabing, et al.
Pubblicazione: (2025)
End-to-End HOI Reconstruction Transformer with Graph-based Encoding
di: Wang, Zhenrong, et al.
Pubblicazione: (2025)
di: Wang, Zhenrong, et al.
Pubblicazione: (2025)
End-to-End Autonomous Driving without Costly Modularization and 3D Manual Annotation
di: Guo, Mingzhe, et al.
Pubblicazione: (2024)
di: Guo, Mingzhe, et al.
Pubblicazione: (2024)
LMVC: An End-to-End Learned Multiview Video Coding Framework
di: Sheng, Xihua, et al.
Pubblicazione: (2025)
di: Sheng, Xihua, et al.
Pubblicazione: (2025)
MoCapAnything V2: End-to-End Motion Capture for Arbitrary Skeletons
di: Gong, Kehong, et al.
Pubblicazione: (2026)
di: Gong, Kehong, et al.
Pubblicazione: (2026)
DriveSafer: End-to-End Autonomous Driving with Safety Guidance
di: Sural, Shounak, et al.
Pubblicazione: (2026)
di: Sural, Shounak, et al.
Pubblicazione: (2026)
End-To-End Underwater Video Enhancement: Dataset and Model
di: Du, Dazhao, et al.
Pubblicazione: (2024)
di: Du, Dazhao, et al.
Pubblicazione: (2024)
Puzzles: Unbounded Video-Depth Augmentation for Scalable End-to-End 3D Reconstruction
di: Ma, Jiahao, et al.
Pubblicazione: (2025)
di: Ma, Jiahao, et al.
Pubblicazione: (2025)
Drive&Gen: Co-Evaluating End-to-End Driving and Video Generation Models
di: Wang, Jiahao, et al.
Pubblicazione: (2025)
di: Wang, Jiahao, et al.
Pubblicazione: (2025)
End-to-End Dense Video Grounding via Parallel Regression
di: Shi, Fengyuan, et al.
Pubblicazione: (2021)
di: Shi, Fengyuan, et al.
Pubblicazione: (2021)
EVE: Towards End-to-End Video Subtitle Extraction with Vision-Language Models
di: Yu, Haiyang, et al.
Pubblicazione: (2025)
di: Yu, Haiyang, et al.
Pubblicazione: (2025)
CLEAR: Context-Aware Learning with End-to-End Mask-Free Inference for Adaptive Video Subtitle Removal
di: He, Qingdong, et al.
Pubblicazione: (2026)
di: He, Qingdong, et al.
Pubblicazione: (2026)
End-to-End Streaming Video Temporal Action Segmentation with Reinforce Learning
di: Zhang, Jinrong, et al.
Pubblicazione: (2023)
di: Zhang, Jinrong, et al.
Pubblicazione: (2023)
End-to-End Vision Tokenizer Tuning
di: Wang, Wenxuan, et al.
Pubblicazione: (2025)
di: Wang, Wenxuan, et al.
Pubblicazione: (2025)
VSD-MOT: End-to-End Multi-Object Tracking in Low-Quality Video Scenes Guided by Visual Semantic Distillation
di: Du, Jun
Pubblicazione: (2026)
di: Du, Jun
Pubblicazione: (2026)
AutoMoT: A Unified Vision-Language-Action Model with Asynchronous Mixture-of-Transformers for End-to-End Autonomous Driving
di: Huang, Wenhui, et al.
Pubblicazione: (2026)
di: Huang, Wenhui, et al.
Pubblicazione: (2026)
End-to-End Facial Expression Detection in Long Videos
di: Fang, Yini, et al.
Pubblicazione: (2025)
di: Fang, Yini, et al.
Pubblicazione: (2025)
MacNet: An End-to-End Manifold-Constrained Adaptive Clustering Network for Interpretable Whole Slide Image Classification
di: Ma, Mingrui, et al.
Pubblicazione: (2026)
di: Ma, Mingrui, et al.
Pubblicazione: (2026)
GaussianMotion: End-to-End Learning of Animatable Gaussian Avatars with Pose Guidance from Text
di: Shim, Gyumin, et al.
Pubblicazione: (2025)
di: Shim, Gyumin, et al.
Pubblicazione: (2025)
Weaver: End-to-End Agentic System Training for Video Interleaved Reasoning
di: Shi, Yudi, et al.
Pubblicazione: (2026)
di: Shi, Yudi, et al.
Pubblicazione: (2026)
End-to-End Video Question Answering with Frame Scoring Mechanisms and Adaptive Sampling
di: Liang, Jianxin, et al.
Pubblicazione: (2024)
di: Liang, Jianxin, et al.
Pubblicazione: (2024)
End-to-End Multi-Person Pose Estimation with Pose-Aware Video Transformer
di: Yu, Yonghui, et al.
Pubblicazione: (2025)
di: Yu, Yonghui, et al.
Pubblicazione: (2025)
An End-to-End Robust Point Cloud Semantic Segmentation Network with Single-Step Conditional Diffusion Models
di: Qu, Wentao, et al.
Pubblicazione: (2024)
di: Qu, Wentao, et al.
Pubblicazione: (2024)
An End-to-End Framework for Video Multi-Person Pose Estimation
di: Wei, Zhihong
Pubblicazione: (2025)
di: Wei, Zhihong
Pubblicazione: (2025)
PAVE: An End-to-End Dataset for Production Autonomous Vehicle Evaluation
di: Li, Xiangyu, et al.
Pubblicazione: (2025)
di: Li, Xiangyu, et al.
Pubblicazione: (2025)
STORM: End-to-End Referring Multi-Object Tracking in Videos
di: Lu, Zijia, et al.
Pubblicazione: (2026)
di: Lu, Zijia, et al.
Pubblicazione: (2026)
EA-RAS: Towards Efficient and Accurate End-to-End Reconstruction of Anatomical Skeleton
di: Peng, Zhiheng, et al.
Pubblicazione: (2024)
di: Peng, Zhiheng, et al.
Pubblicazione: (2024)
SMTrack: End-to-End Trained Spiking Neural Networks for Multi-Object Tracking in RGB Videos
di: Zhong, Pengzhi, et al.
Pubblicazione: (2025)
di: Zhong, Pengzhi, et al.
Pubblicazione: (2025)
S2-Track: A Simple yet Strong Approach for End-to-End 3D Multi-Object Tracking
di: Tang, Tao, et al.
Pubblicazione: (2024)
di: Tang, Tao, et al.
Pubblicazione: (2024)
SDformer: Efficient End-to-End Transformer for Depth Completion
di: Qian, Jian, et al.
Pubblicazione: (2024)
di: Qian, Jian, et al.
Pubblicazione: (2024)
End-to-End Unmixing with Material Prompts for Hyperspectral Object Tracking
di: Han, Xu, et al.
Pubblicazione: (2026)
di: Han, Xu, et al.
Pubblicazione: (2026)
ImmersePro: End-to-End Stereo Video Synthesis Via Implicit Disparity Learning
di: Shi, Jian, et al.
Pubblicazione: (2024)
di: Shi, Jian, et al.
Pubblicazione: (2024)
MoCha-Stereo: Motif Channel Attention Network for Stereo Matching
di: Chen, Ziyang, et al.
Pubblicazione: (2024)
di: Chen, Ziyang, et al.
Pubblicazione: (2024)
Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation
di: Chen, Yuheng, et al.
Pubblicazione: (2026)
di: Chen, Yuheng, et al.
Pubblicazione: (2026)
EF-VI: Enhancing End-Frame Injection for Video Inbetweening
di: Chen, Liuhan, et al.
Pubblicazione: (2025)
di: Chen, Liuhan, et al.
Pubblicazione: (2025)
CFVNet: An End-to-End Cancelable Finger Vein Network for Recognition
di: Wang, Yifan, et al.
Pubblicazione: (2024)
di: Wang, Yifan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
MoCam: Unified Novel View Synthesis via Structured Denoising Dynamics
di: Liu, Haofeng, et al.
Pubblicazione: (2026) -
MoCha: Towards Movie-Grade Talking Character Synthesis
di: Wei, Cong, et al.
Pubblicazione: (2025) -
Unleashing Generalization of End-to-End Autonomous Driving with Controllable Long Video Generation
di: Ma, Enhui, et al.
Pubblicazione: (2024) -
MoGA: Mixture-of-Groups Attention for End-to-End Long Video Generation
di: Jia, Weinan, et al.
Pubblicazione: (2025) -
Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs
di: Cheng, Dabing, et al.
Pubblicazione: (2025)