X-Humanoid: Robotize Human Videos to Generate Humanoid Videos at Scale
Fuente:
arXiv
Salvato in:
| Autori principali: | Yang, Pei, Ci, Hai, Song, Yiren, Shou, Mike Zheng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
OmniHumanoid: Streaming Cross-Embodiment Video Generation with Paired-Free Adaptation
di: Song, Yiren, et al.
Pubblicazione: (2026)
di: Song, Yiren, et al.
Pubblicazione: (2026)
H2R-Grounder: A Paired-Data-Free Paradigm for Translating Human Interaction Videos into Physically Grounded Robot Videos
di: Ci, Hai, et al.
Pubblicazione: (2025)
di: Ci, Hai, et al.
Pubblicazione: (2025)
UENR-600K: A Large-Scale Physically Grounded Dataset for Nighttime Video Deraining
di: Yang, Pei, et al.
Pubblicazione: (2026)
di: Yang, Pei, et al.
Pubblicazione: (2026)
IDProtector: An Adversarial Noise Encoder to Protect Against ID-Preserving Image Generation
di: Song, Yiren, et al.
Pubblicazione: (2024)
di: Song, Yiren, et al.
Pubblicazione: (2024)
Mitty: Diffusion-based Human-to-Robot Video Generation
di: Song, Yiren, et al.
Pubblicazione: (2025)
di: Song, Yiren, et al.
Pubblicazione: (2025)
Steganalysis on Digital Watermarking: Is Your Defense Truly Impervious?
di: Yang, Pei, et al.
Pubblicazione: (2024)
di: Yang, Pei, et al.
Pubblicazione: (2024)
RingID: Rethinking Tree-Ring Watermarking for Enhanced Multi-Key Identification
di: Ci, Hai, et al.
Pubblicazione: (2024)
di: Ci, Hai, et al.
Pubblicazione: (2024)
Impossible Videos
di: Bai, Zechen, et al.
Pubblicazione: (2025)
di: Bai, Zechen, et al.
Pubblicazione: (2025)
StreamingEffect: Real-Time Human-Centric Video Effect Generation
di: Song, Yiren, et al.
Pubblicazione: (2026)
di: Song, Yiren, et al.
Pubblicazione: (2026)
RobotSeg: A Model and Dataset for Segmenting Robots in Image and Video
di: Mei, Haiyang, et al.
Pubblicazione: (2025)
di: Mei, Haiyang, et al.
Pubblicazione: (2025)
WMAdapter: Adding WaterMark Control to Latent Diffusion Models
di: Ci, Hai, et al.
Pubblicazione: (2024)
di: Ci, Hai, et al.
Pubblicazione: (2024)
Anti-Reference: Universal and Immediate Defense Against Reference-Based Generation
di: Song, Yiren, et al.
Pubblicazione: (2024)
di: Song, Yiren, et al.
Pubblicazione: (2024)
WorldWander: Bridging Egocentric and Exocentric Worlds in Video Generation
di: Song, Quanjian, et al.
Pubblicazione: (2025)
di: Song, Quanjian, et al.
Pubblicazione: (2025)
VISTA: Triplet-Supervised Video Style Transfer with Diffusion Transformers
di: Song, Yiren, et al.
Pubblicazione: (2026)
di: Song, Yiren, et al.
Pubblicazione: (2026)
MakeAnything: Harnessing Diffusion Transformers for Multi-Domain Procedural Sequence Generation
di: Song, Yiren, et al.
Pubblicazione: (2025)
di: Song, Yiren, et al.
Pubblicazione: (2025)
DiffSeg30k: A Multi-Turn Diffusion Editing Benchmark for Localized AIGC Detection
di: Ci, Hai, et al.
Pubblicazione: (2025)
di: Ci, Hai, et al.
Pubblicazione: (2025)
Soap2Soap: Long Cinematic Video Remaking via Multi-Agent Collaboration
di: Song, Yiren, et al.
Pubblicazione: (2026)
di: Song, Yiren, et al.
Pubblicazione: (2026)
PAI-Studio: Cinematic Video Background Replacement with Camera-Aware Motion
di: Gao, Heyuan, et al.
Pubblicazione: (2026)
di: Gao, Heyuan, et al.
Pubblicazione: (2026)
Edit2Perceive: Image Editing Diffusion Models Are Strong Dense Perceivers
di: Shi, Yiqing, et al.
Pubblicazione: (2025)
di: Shi, Yiqing, et al.
Pubblicazione: (2025)
OmniConsistency: Learning Style-Agnostic Consistency from Paired Stylization Data
di: Song, Yiren, et al.
Pubblicazione: (2025)
di: Song, Yiren, et al.
Pubblicazione: (2025)
LayerTracer: Cognitive-Aligned Layered SVG Synthesis via Diffusion Transformer
di: Song, Yiren, et al.
Pubblicazione: (2025)
di: Song, Yiren, et al.
Pubblicazione: (2025)
DiffSim: Taming Diffusion Models for Evaluating Visual Similarity
di: Song, Yiren, et al.
Pubblicazione: (2024)
di: Song, Yiren, et al.
Pubblicazione: (2024)
OmniPSD: Layered PSD Generation with Diffusion Transformer
di: Liu, Cheng, et al.
Pubblicazione: (2025)
di: Liu, Cheng, et al.
Pubblicazione: (2025)
VLog: Video-Language Models by Generative Retrieval of Narration Vocabulary
di: Lin, Kevin Qinghong, et al.
Pubblicazione: (2025)
di: Lin, Kevin Qinghong, et al.
Pubblicazione: (2025)
TPDiff: Temporal Pyramid Video Diffusion Model
di: Ran, Lingmin, et al.
Pubblicazione: (2025)
di: Ran, Lingmin, et al.
Pubblicazione: (2025)
FlowAct-R1: Towards Interactive Humanoid Video Generation
di: Wang, Lizhen, et al.
Pubblicazione: (2026)
di: Wang, Lizhen, et al.
Pubblicazione: (2026)
Learning from Massive Human Videos for Universal Humanoid Pose Control
di: Mao, Jiageng, et al.
Pubblicazione: (2024)
di: Mao, Jiageng, et al.
Pubblicazione: (2024)
Humanoid Occupancy: Enabling A Generalized Multimodal Occupancy Perception System on Humanoid Robots
di: Cui, Wei, et al.
Pubblicazione: (2025)
di: Cui, Wei, et al.
Pubblicazione: (2025)
PANDA: Towards Generalist Video Anomaly Detection via Agentic AI Engineer
di: Yang, Zhiwei, et al.
Pubblicazione: (2025)
di: Yang, Zhiwei, et al.
Pubblicazione: (2025)
Image Watermarks are Removable Using Controllable Regeneration from Clean Noise
di: Liu, Yepeng, et al.
Pubblicazione: (2024)
di: Liu, Yepeng, et al.
Pubblicazione: (2024)
ProcessPainter: Learn Painting Process from Sequence Data
di: Song, Yiren, et al.
Pubblicazione: (2024)
di: Song, Yiren, et al.
Pubblicazione: (2024)
Towards Motion Turing Test: Evaluating Human-Likeness in Humanoid Robots
di: Li, Mingzhe, et al.
Pubblicazione: (2026)
di: Li, Mingzhe, et al.
Pubblicazione: (2026)
Animating the Uncaptured: Humanoid Mesh Animation with Video Diffusion Models
di: Millán, Marc Benedí San, et al.
Pubblicazione: (2025)
di: Millán, Marc Benedí San, et al.
Pubblicazione: (2025)
Long-Context Autoregressive Video Modeling with Next-Frame Prediction
di: Gu, Yuchao, et al.
Pubblicazione: (2025)
di: Gu, Yuchao, et al.
Pubblicazione: (2025)
TransAnimate: Taming Layer Diffusion to Generate RGBA Video
di: Chen, Xuewei, et al.
Pubblicazione: (2025)
di: Chen, Xuewei, et al.
Pubblicazione: (2025)
RoboMirror: Understand Before You Imitate for Video to Humanoid Locomotion
di: Li, Zhe, et al.
Pubblicazione: (2025)
di: Li, Zhe, et al.
Pubblicazione: (2025)
Humanoid Policy ~ Human Policy
di: Qiu, Ri-Zhao, et al.
Pubblicazione: (2025)
di: Qiu, Ri-Zhao, et al.
Pubblicazione: (2025)
LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale
di: Chen, Joya, et al.
Pubblicazione: (2025)
di: Chen, Joya, et al.
Pubblicazione: (2025)
SWEET: Sparse World Modeling with Image Editing for Embodied Task Execution
di: Song, Yiren, et al.
Pubblicazione: (2026)
di: Song, Yiren, et al.
Pubblicazione: (2026)
Integrating Persian Lip Reading in Surena-V Humanoid Robot for Human-Robot Interaction
di: Abbasi, Ali Farshian, et al.
Pubblicazione: (2025)
di: Abbasi, Ali Farshian, et al.
Pubblicazione: (2025)
Documenti analoghi
-
OmniHumanoid: Streaming Cross-Embodiment Video Generation with Paired-Free Adaptation
di: Song, Yiren, et al.
Pubblicazione: (2026) -
H2R-Grounder: A Paired-Data-Free Paradigm for Translating Human Interaction Videos into Physically Grounded Robot Videos
di: Ci, Hai, et al.
Pubblicazione: (2025) -
UENR-600K: A Large-Scale Physically Grounded Dataset for Nighttime Video Deraining
di: Yang, Pei, et al.
Pubblicazione: (2026) -
IDProtector: An Adversarial Noise Encoder to Protect Against ID-Preserving Image Generation
di: Song, Yiren, et al.
Pubblicazione: (2024) -
Mitty: Diffusion-based Human-to-Robot Video Generation
di: Song, Yiren, et al.
Pubblicazione: (2025)