OmniHumanoid: Streaming Cross-Embodiment Video Generation with Paired-Free Adaptation
Fuente:
arXiv
Guardado en:
| Autores principales: | Song, Yiren, Deng, Xiyao, Yang, Pei, Wang, Yihan, Shou, Mike Zheng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
X-Humanoid: Robotize Human Videos to Generate Humanoid Videos at Scale
por: Yang, Pei, et al.
Publicado: (2025)
por: Yang, Pei, et al.
Publicado: (2025)
OmniConsistency: Learning Style-Agnostic Consistency from Paired Stylization Data
por: Song, Yiren, et al.
Publicado: (2025)
por: Song, Yiren, et al.
Publicado: (2025)
SWEET: Sparse World Modeling with Image Editing for Embodied Task Execution
por: Song, Yiren, et al.
Publicado: (2026)
por: Song, Yiren, et al.
Publicado: (2026)
OmniPSD: Layered PSD Generation with Diffusion Transformer
por: Liu, Cheng, et al.
Publicado: (2025)
por: Liu, Cheng, et al.
Publicado: (2025)
H2R-Grounder: A Paired-Data-Free Paradigm for Translating Human Interaction Videos into Physically Grounded Robot Videos
por: Ci, Hai, et al.
Publicado: (2025)
por: Ci, Hai, et al.
Publicado: (2025)
StreamingEffect: Real-Time Human-Centric Video Effect Generation
por: Song, Yiren, et al.
Publicado: (2026)
por: Song, Yiren, et al.
Publicado: (2026)
IDProtector: An Adversarial Noise Encoder to Protect Against ID-Preserving Image Generation
por: Song, Yiren, et al.
Publicado: (2024)
por: Song, Yiren, et al.
Publicado: (2024)
Mitty: Diffusion-based Human-to-Robot Video Generation
por: Song, Yiren, et al.
Publicado: (2025)
por: Song, Yiren, et al.
Publicado: (2025)
UENR-600K: A Large-Scale Physically Grounded Dataset for Nighttime Video Deraining
por: Yang, Pei, et al.
Publicado: (2026)
por: Yang, Pei, et al.
Publicado: (2026)
Steganalysis on Digital Watermarking: Is Your Defense Truly Impervious?
por: Yang, Pei, et al.
Publicado: (2024)
por: Yang, Pei, et al.
Publicado: (2024)
RingID: Rethinking Tree-Ring Watermarking for Enhanced Multi-Key Identification
por: Ci, Hai, et al.
Publicado: (2024)
por: Ci, Hai, et al.
Publicado: (2024)
MakeAnything: Harnessing Diffusion Transformers for Multi-Domain Procedural Sequence Generation
por: Song, Yiren, et al.
Publicado: (2025)
por: Song, Yiren, et al.
Publicado: (2025)
WorldWander: Bridging Egocentric and Exocentric Worlds in Video Generation
por: Song, Quanjian, et al.
Publicado: (2025)
por: Song, Quanjian, et al.
Publicado: (2025)
VISTA: Triplet-Supervised Video Style Transfer with Diffusion Transformers
por: Song, Yiren, et al.
Publicado: (2026)
por: Song, Yiren, et al.
Publicado: (2026)
Edit2Perceive: Image Editing Diffusion Models Are Strong Dense Perceivers
por: Shi, Yiqing, et al.
Publicado: (2025)
por: Shi, Yiqing, et al.
Publicado: (2025)
DiffSim: Taming Diffusion Models for Evaluating Visual Similarity
por: Song, Yiren, et al.
Publicado: (2024)
por: Song, Yiren, et al.
Publicado: (2024)
LayerTracer: Cognitive-Aligned Layered SVG Synthesis via Diffusion Transformer
por: Song, Yiren, et al.
Publicado: (2025)
por: Song, Yiren, et al.
Publicado: (2025)
Soap2Soap: Long Cinematic Video Remaking via Multi-Agent Collaboration
por: Song, Yiren, et al.
Publicado: (2026)
por: Song, Yiren, et al.
Publicado: (2026)
Anti-Reference: Universal and Immediate Defense Against Reference-Based Generation
por: Song, Yiren, et al.
Publicado: (2024)
por: Song, Yiren, et al.
Publicado: (2024)
WMAdapter: Adding WaterMark Control to Latent Diffusion Models
por: Ci, Hai, et al.
Publicado: (2024)
por: Ci, Hai, et al.
Publicado: (2024)
PAI-Studio: Cinematic Video Background Replacement with Camera-Aware Motion
por: Gao, Heyuan, et al.
Publicado: (2026)
por: Gao, Heyuan, et al.
Publicado: (2026)
VLog: Video-Language Models by Generative Retrieval of Narration Vocabulary
por: Lin, Kevin Qinghong, et al.
Publicado: (2025)
por: Lin, Kevin Qinghong, et al.
Publicado: (2025)
DoraCycle: Domain-Oriented Adaptation of Unified Generative Model in Multimodal Cycles
por: Zhao, Rui, et al.
Publicado: (2025)
por: Zhao, Rui, et al.
Publicado: (2025)
OmniPro: A Comprehensive Benchmark for Omni-Proactive Streaming Video Understanding
por: Zhao, Ruixiang, et al.
Publicado: (2026)
por: Zhao, Ruixiang, et al.
Publicado: (2026)
TPDiff: Temporal Pyramid Video Diffusion Model
por: Ran, Lingmin, et al.
Publicado: (2025)
por: Ran, Lingmin, et al.
Publicado: (2025)
LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale
por: Chen, Joya, et al.
Publicado: (2025)
por: Chen, Joya, et al.
Publicado: (2025)
Grid: Omni Visual Generation
por: Wan, Cong, et al.
Publicado: (2024)
por: Wan, Cong, et al.
Publicado: (2024)
Personalized Vision via Visual In-Context Learning
por: Jiang, Yuxin, et al.
Publicado: (2025)
por: Jiang, Yuxin, et al.
Publicado: (2025)
PANDA: Towards Generalist Video Anomaly Detection via Agentic AI Engineer
por: Yang, Zhiwei, et al.
Publicado: (2025)
por: Yang, Zhiwei, et al.
Publicado: (2025)
VideoLLM-online: Online Video Large Language Model for Streaming Video
por: Chen, Joya, et al.
Publicado: (2024)
por: Chen, Joya, et al.
Publicado: (2024)
Impossible Videos
por: Bai, Zechen, et al.
Publicado: (2025)
por: Bai, Zechen, et al.
Publicado: (2025)
OmniRefiner: Reinforcement-Guided Local Diffusion Refinement
por: Liu, Yaoli, et al.
Publicado: (2025)
por: Liu, Yaoli, et al.
Publicado: (2025)
The Consistency Critic: Correcting Inconsistencies in Generated Images via Reference-Guided Attentive Alignment
por: Ouyang, Ziheng, et al.
Publicado: (2025)
por: Ouyang, Ziheng, et al.
Publicado: (2025)
OMUDA: Omni-level Masking for Unsupervised Domain Adaptation in Semantic Segmentation
por: Ou, Yang, et al.
Publicado: (2025)
por: Ou, Yang, et al.
Publicado: (2025)
P-Flow: Prompting Visual Effects Generation
por: Zhao, Rui, et al.
Publicado: (2026)
por: Zhao, Rui, et al.
Publicado: (2026)
OmniMMI: A Comprehensive Multi-modal Interaction Benchmark in Streaming Video Contexts
por: Wang, Yuxuan, et al.
Publicado: (2025)
por: Wang, Yuxuan, et al.
Publicado: (2025)
PhotoDoodle: Learning Artistic Image Editing from Few-Shot Pairwise Data
por: Huang, Shijie, et al.
Publicado: (2025)
por: Huang, Shijie, et al.
Publicado: (2025)
Long-Context Autoregressive Video Modeling with Next-Frame Prediction
por: Gu, Yuchao, et al.
Publicado: (2025)
por: Gu, Yuchao, et al.
Publicado: (2025)
TransAnimate: Taming Layer Diffusion to Generate RGBA Video
por: Chen, Xuewei, et al.
Publicado: (2025)
por: Chen, Xuewei, et al.
Publicado: (2025)
StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering
por: Xie, Ming, et al.
Publicado: (2026)
por: Xie, Ming, et al.
Publicado: (2026)
Ejemplares similares
-
X-Humanoid: Robotize Human Videos to Generate Humanoid Videos at Scale
por: Yang, Pei, et al.
Publicado: (2025) -
OmniConsistency: Learning Style-Agnostic Consistency from Paired Stylization Data
por: Song, Yiren, et al.
Publicado: (2025) -
SWEET: Sparse World Modeling with Image Editing for Embodied Task Execution
por: Song, Yiren, et al.
Publicado: (2026) -
OmniPSD: Layered PSD Generation with Diffusion Transformer
por: Liu, Cheng, et al.
Publicado: (2025) -
H2R-Grounder: A Paired-Data-Free Paradigm for Translating Human Interaction Videos into Physically Grounded Robot Videos
por: Ci, Hai, et al.
Publicado: (2025)