Guardado en:
| Autores principales: | Zhi, Yihao, Li, Chenghong, Liao, Hongjie, Yang, Xihe, Sun, Zhengwentai, Chang, Jiahao, Cun, Xiaodong, Feng, Wensen, Han, Xiaoguang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2510.07190 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MVHumanNet++: A Large-scale Dataset of Multi-view Daily Dressing Human Captures with Richer Annotations for 3D Human Digitization
por: Li, Chenghong, et al.
Publicado: (2025)
por: Li, Chenghong, et al.
Publicado: (2025)
ReImagine: Rethinking Controllable High-Quality Human Video Generation via Image-First Synthesis
por: Sun, Zhengwentai, et al.
Publicado: (2026)
por: Sun, Zhengwentai, et al.
Publicado: (2026)
Exploring Disentangled and Controllable Human Image Synthesis: From End-to-End to Stage-by-Stage
por: Sun, Zhengwentai, et al.
Publicado: (2025)
por: Sun, Zhengwentai, et al.
Publicado: (2025)
ReconViaGen: Towards Accurate Multi-view 3D Object Reconstruction via Generation
por: Chang, Jiahao, et al.
Publicado: (2025)
por: Chang, Jiahao, et al.
Publicado: (2025)
EasyOmnimatte: Taming Pretrained Inpainting Diffusion Models for End-to-End Video Layered Decomposition
por: Hu, Yihan, et al.
Publicado: (2025)
por: Hu, Yihan, et al.
Publicado: (2025)
ForeHOI: Feed-forward 3D Object Reconstruction from Daily Hand-Object Interaction Videos
por: Chen, Yuantao, et al.
Publicado: (2026)
por: Chen, Yuantao, et al.
Publicado: (2026)
MVImgNet2.0: A Larger-scale Dataset of Multi-view Images
por: Han, Xiaoguang, et al.
Publicado: (2024)
por: Han, Xiaoguang, et al.
Publicado: (2024)
SyncMV4D: Synchronized Multi-view Joint Diffusion of Appearance and Motion for Hand-Object Interaction Synthesis
por: Dang, Lingwei, et al.
Publicado: (2025)
por: Dang, Lingwei, et al.
Publicado: (2025)
GauStudio: A Modular Framework for 3D Gaussian Splatting and Beyond
por: Ye, Chongjie, et al.
Publicado: (2024)
por: Ye, Chongjie, et al.
Publicado: (2024)
GaussReg: Fast 3D Registration with Gaussian Splatting
por: Chang, Jiahao, et al.
Publicado: (2024)
por: Chang, Jiahao, et al.
Publicado: (2024)
4DVD: Cascaded Dense-view Video Diffusion Model for High-quality 4D Content Generation
por: Yang, Shuzhou, et al.
Publicado: (2025)
por: Yang, Shuzhou, et al.
Publicado: (2025)
GSFixer: Improving 3D Gaussian Splatting with Reference-Guided Video Diffusion Priors
por: Yin, Xingyilang, et al.
Publicado: (2025)
por: Yin, Xingyilang, et al.
Publicado: (2025)
PerformSinger: Multimodal Singing Voice Synthesis Leveraging Synchronized Lip Cues from Singing Performance Videos
por: Gu, Ke, et al.
Publicado: (2025)
por: Gu, Ke, et al.
Publicado: (2025)
Sketch Video Synthesis
por: Yudian Zheng, et al.
Publicado: (2024)
por: Yudian Zheng, et al.
Publicado: (2024)
CutClaw: Agentic Hours-Long Video Editing via Music Synchronization
por: Zhao, Shifang, et al.
Publicado: (2026)
por: Zhao, Shifang, et al.
Publicado: (2026)
FairyGen: Storied Cartoon Video from a Single Child-Drawn Character
por: Zheng, Jiayi, et al.
Publicado: (2025)
por: Zheng, Jiayi, et al.
Publicado: (2025)
MLLM-4D: Towards Visual-based Spatial-Temporal Intelligence
por: Yin, Xingyilang, et al.
Publicado: (2026)
por: Yin, Xingyilang, et al.
Publicado: (2026)
Causal-Adapter: Taming Text-to-Image Diffusion for Faithful Counterfactual Generation
por: Tong, Lei, et al.
Publicado: (2025)
por: Tong, Lei, et al.
Publicado: (2025)
Taming Cluster Synchronization
por: Tomaselli, Cinzia, et al.
Publicado: (2024)
por: Tomaselli, Cinzia, et al.
Publicado: (2024)
Animus3D: Text-driven 3D Animation via Motion Score Distillation
por: Sun, Qi, et al.
Publicado: (2025)
por: Sun, Qi, et al.
Publicado: (2025)
ZeroSmooth: Training-free Diffuser Adaptation for High Frame Rate Video Generation
por: Yang, Shaoshu, et al.
Publicado: (2024)
por: Yang, Shaoshu, et al.
Publicado: (2024)
VideoMV: Consistent Multi-View Generation Based on Large Video Generative Model
por: Zuo, Qi, et al.
Publicado: (2024)
por: Zuo, Qi, et al.
Publicado: (2024)
MV-Swin-T: Mammogram Classification with Multi-view Swin Transformer
por: Sarker, Sushmita, et al.
Publicado: (2024)
por: Sarker, Sushmita, et al.
Publicado: (2024)
Stable-Sim2Real: Exploring Simulation of Real-Captured 3D Data with Two-Stage Depth Diffusion
por: Xu, Mutian, et al.
Publicado: (2025)
por: Xu, Mutian, et al.
Publicado: (2025)
MOFA-Video: Controllable Image Animation via Generative Motion Field Adaptions in Frozen Image-to-Video Diffusion Model
por: Niu, Muyao, et al.
Publicado: (2024)
por: Niu, Muyao, et al.
Publicado: (2024)
VideoCrafter2: Overcoming Data Limitations for High-Quality Video Diffusion Models
por: Chen, Haoxin, et al.
Publicado: (2024)
por: Chen, Haoxin, et al.
Publicado: (2024)
HAVE-FUN: Human Avatar Reconstruction from Few-Shot Unconstrained Images
por: Yang, Xihe, et al.
Publicado: (2023)
por: Yang, Xihe, et al.
Publicado: (2023)
GenCompositor: Generative Video Compositing with Diffusion Transformer
por: Yang, Shuzhou, et al.
Publicado: (2025)
por: Yang, Shuzhou, et al.
Publicado: (2025)
Synchronous Faithfulness Monitoring for Trustworthy Retrieval-Augmented Generation
por: Wu, Di, et al.
Publicado: (2024)
por: Wu, Di, et al.
Publicado: (2024)
DiTCtrl: Exploring Attention Control in Multi-Modal Diffusion Transformer for Tuning-Free Multi-Prompt Longer Video Generation
por: Cai, Minghong, et al.
Publicado: (2024)
por: Cai, Minghong, et al.
Publicado: (2024)
MV-SAM: Multi-view Promptable Segmentation using Pointmap Guidance
por: Jeong, Yoonwoo, et al.
Publicado: (2026)
por: Jeong, Yoonwoo, et al.
Publicado: (2026)
MV-Adapter: Multi-view Consistent Image Generation Made Easy
por: Huang, Zehuan, et al.
Publicado: (2024)
por: Huang, Zehuan, et al.
Publicado: (2024)
LightCtrl: Training-free Controllable Video Relighting
por: Peng, Yizuo, et al.
Publicado: (2026)
por: Peng, Yizuo, et al.
Publicado: (2026)
Noise Calibration: Plug-and-play Content-Preserving Video Enhancement using Pre-trained Video Diffusion Models
por: Yang, Qinyu, et al.
Publicado: (2024)
por: Yang, Qinyu, et al.
Publicado: (2024)
BlobCtrl: Taming Controllable Blob for Element-level Image Editing
por: Li, Yaowei, et al.
Publicado: (2025)
por: Li, Yaowei, et al.
Publicado: (2025)
The Gray Zone of Faithfulness: Taming Ambiguity in Unfaithfulness Detection
por: Ding, Qiang, et al.
Publicado: (2025)
por: Ding, Qiang, et al.
Publicado: (2025)
MV-GMN: State Space Model for Multi-View Action Recognition
por: Lin, Yuhui, et al.
Publicado: (2025)
por: Lin, Yuhui, et al.
Publicado: (2025)
VideoMaker: Zero-shot Customized Video Generation with the Inherent Force of Video Diffusion Models
por: Wu, Tao, et al.
Publicado: (2024)
por: Wu, Tao, et al.
Publicado: (2024)
VAU-R1: Advancing Video Anomaly Understanding via Reinforcement Fine-Tuning
por: Zhu, Liyun, et al.
Publicado: (2025)
por: Zhu, Liyun, et al.
Publicado: (2025)
FlowVid: Taming Imperfect Optical Flows for Consistent Video-to-Video Synthesis
por: Liang, Feng, et al.
Publicado: (2023)
por: Liang, Feng, et al.
Publicado: (2023)
Ejemplares similares
-
MVHumanNet++: A Large-scale Dataset of Multi-view Daily Dressing Human Captures with Richer Annotations for 3D Human Digitization
por: Li, Chenghong, et al.
Publicado: (2025) -
ReImagine: Rethinking Controllable High-Quality Human Video Generation via Image-First Synthesis
por: Sun, Zhengwentai, et al.
Publicado: (2026) -
Exploring Disentangled and Controllable Human Image Synthesis: From End-to-End to Stage-by-Stage
por: Sun, Zhengwentai, et al.
Publicado: (2025) -
ReconViaGen: Towards Accurate Multi-view 3D Object Reconstruction via Generation
por: Chang, Jiahao, et al.
Publicado: (2025) -
EasyOmnimatte: Taming Pretrained Inpainting Diffusion Models for End-to-End Video Layered Decomposition
por: Hu, Yihan, et al.
Publicado: (2025)