Bridging Semantic and Kinematic Conditions with Diffusion-based Discrete Motion Tokenizer
Fuente:
arXiv
Guardado en:
| Autores principales: | Gu, Chenyang, Zhang, Mingyuan, Xie, Haozhe, Cai, Zhongang, Yang, Lei, Liu, Ziwei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CrowdMoGen: Zero-Shot Text-Driven Collective Motion Generation
por: Cao, Yukang, et al.
Publicado: (2024)
por: Cao, Yukang, et al.
Publicado: (2024)
Large Motion Model for Unified Multi-Modal Motion Generation
por: Zhang, Mingyuan, et al.
Publicado: (2024)
por: Zhang, Mingyuan, et al.
Publicado: (2024)
Disco4D: Disentangled 4D Human Generation and Animation from a Single Image
por: Pang, Hui En, et al.
Publicado: (2024)
por: Pang, Hui En, et al.
Publicado: (2024)
Bridging the Gap between Human Motion and Action Semantics via Kinematic Phrases
por: Liu, Xinpeng, et al.
Publicado: (2023)
por: Liu, Xinpeng, et al.
Publicado: (2023)
FreeInit: Bridging Initialization Gap in Video Diffusion Models
por: Wu, Tianxing, et al.
Publicado: (2023)
por: Wu, Tianxing, et al.
Publicado: (2023)
Playing for 3D Human Recovery
por: Cai, Zhongang, et al.
Publicado: (2021)
por: Cai, Zhongang, et al.
Publicado: (2021)
Deblur-Avatar: Animatable Avatars from Motion-Blurred Monocular Videos
por: Luo, Xianrui, et al.
Publicado: (2025)
por: Luo, Xianrui, et al.
Publicado: (2025)
DiMo: Discrete Diffusion Modeling for Motion Generation and Understanding
por: Zhang, Ning, et al.
Publicado: (2026)
por: Zhang, Ning, et al.
Publicado: (2026)
DPoser-X: Diffusion Model as Robust 3D Whole-body Human Pose Prior
por: Lu, Junzhe, et al.
Publicado: (2025)
por: Lu, Junzhe, et al.
Publicado: (2025)
The Quest for Generalizable Motion Generation: Data, Model, and Evaluation
por: Lin, Jing, et al.
Publicado: (2025)
por: Lin, Jing, et al.
Publicado: (2025)
Learning Parallax for Stereo Event-based Motion Deblurring
por: Lin, Mingyuan, et al.
Publicado: (2023)
por: Lin, Mingyuan, et al.
Publicado: (2023)
ADHMR: Aligning Diffusion-based Human Mesh Recovery via Direct Preference Optimization
por: Shen, Wenhao, et al.
Publicado: (2025)
por: Shen, Wenhao, et al.
Publicado: (2025)
SMPLer-X: Scaling Up Expressive Human Pose and Shape Estimation
por: Cai, Zhongang, et al.
Publicado: (2023)
por: Cai, Zhongang, et al.
Publicado: (2023)
Bridging Continuous and Discrete Tokens for Autoregressive Visual Generation
por: Wang, Yuqing, et al.
Publicado: (2025)
por: Wang, Yuqing, et al.
Publicado: (2025)
Rethinking Video Tokenization: A Conditioned Diffusion-based Approach
por: Yang, Nianzu, et al.
Publicado: (2025)
por: Yang, Nianzu, et al.
Publicado: (2025)
VLM-Guided Group Preference Alignment for Diffusion-based Human Mesh Recovery
por: Shen, Wenhao, et al.
Publicado: (2026)
por: Shen, Wenhao, et al.
Publicado: (2026)
CityDreamer: Compositional Generative Model of Unbounded 3D Cities
por: Xie, Haozhe, et al.
Publicado: (2023)
por: Xie, Haozhe, et al.
Publicado: (2023)
Generative Gaussian Splatting for Unbounded 3D City Generation
por: Xie, Haozhe, et al.
Publicado: (2024)
por: Xie, Haozhe, et al.
Publicado: (2024)
Compositional Generative Model of Unbounded 4D Cities
por: Xie, Haozhe, et al.
Publicado: (2025)
por: Xie, Haozhe, et al.
Publicado: (2025)
Adaptive Caching for Faster Video Generation with Diffusion Transformers
por: Kahatapitiya, Kumara, et al.
Publicado: (2024)
por: Kahatapitiya, Kumara, et al.
Publicado: (2024)
FreeMorph: Tuning-Free Generalized Image Morphing with Diffusion Model
por: Cao, Yukang, et al.
Publicado: (2025)
por: Cao, Yukang, et al.
Publicado: (2025)
Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference
por: Liu, Ziyan, et al.
Publicado: (2025)
por: Liu, Ziyan, et al.
Publicado: (2025)
A Comprehensive Study on Visual Token Redundancy for Discrete Diffusion-based Multimodal Large Language Models
por: Li, Duo, et al.
Publicado: (2025)
por: Li, Duo, et al.
Publicado: (2025)
RMD: A Simple Baseline for More General Human Motion Generation via Training-free Retrieval-Augmented Motion Diffuse
por: Liao, Zhouyingcheng, et al.
Publicado: (2024)
por: Liao, Zhouyingcheng, et al.
Publicado: (2024)
Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning
por: Wang, Bohan, et al.
Publicado: (2025)
por: Wang, Bohan, et al.
Publicado: (2025)
SFTok: Bridging the Performance Gap in Discrete Tokenizers
por: Rao, Qihang, et al.
Publicado: (2025)
por: Rao, Qihang, et al.
Publicado: (2025)
Cubic Discrete Diffusion: Discrete Visual Generation on High-Dimensional Representation Tokens
por: Wang, Yuqing, et al.
Publicado: (2026)
por: Wang, Yuqing, et al.
Publicado: (2026)
UltrAvatar: A Realistic Animatable 3D Avatar Diffusion Model with Authenticity Guided Textures
por: Zhou, Mingyuan, et al.
Publicado: (2024)
por: Zhou, Mingyuan, et al.
Publicado: (2024)
Generative Multimodal Pretraining with Discrete Diffusion Timestep Tokens
por: Pan, Kaihang, et al.
Publicado: (2025)
por: Pan, Kaihang, et al.
Publicado: (2025)
LUMA: Low-Dimension Unified Motion Alignment with Dual-Path Anchoring for Text-to-Motion Diffusion Model
por: Jia, Haozhe, et al.
Publicado: (2025)
por: Jia, Haozhe, et al.
Publicado: (2025)
Semantics-Aware Human Motion Generation from Audio Instructions
por: Wang, Zi-An, et al.
Publicado: (2025)
por: Wang, Zi-An, et al.
Publicado: (2025)
3D Scene Generation: A Survey
por: Wen, Beichen, et al.
Publicado: (2025)
por: Wen, Beichen, et al.
Publicado: (2025)
From Tokens to Nodes: Semantic-Guided Motion Control for Dynamic 3D Gaussian Splatting
por: Chen, Jianing, et al.
Publicado: (2025)
por: Chen, Jianing, et al.
Publicado: (2025)
IKMo: Image-Keyframed Motion Generation with Trajectory-Pose Conditioned Motion Diffusion Model
por: Zhao, Yang, et al.
Publicado: (2025)
por: Zhao, Yang, et al.
Publicado: (2025)
MultiMotion: Multi Subject Video Motion Transfer via Video Diffusion Transformer
por: Liu, Penghui, et al.
Publicado: (2025)
por: Liu, Penghui, et al.
Publicado: (2025)
InfiniteDance: Scalable 3D Dance Generation Towards in-the-wild Generalization
por: Li, Ronghui, et al.
Publicado: (2026)
por: Li, Ronghui, et al.
Publicado: (2026)
Demystifying Video Reasoning
por: Wang, Ruisi, et al.
Publicado: (2026)
por: Wang, Ruisi, et al.
Publicado: (2026)
Learning Context-Adaptive Motion Priors for Masked Motion Diffusion Models with Efficient Kinematic Attention Aggregation
por: Jiang, Junkun, et al.
Publicado: (2026)
por: Jiang, Junkun, et al.
Publicado: (2026)
GeoDiffMM: Geometry-Guided Conditional Diffusion for Motion Magnification
por: Liu, Xuedeng, et al.
Publicado: (2025)
por: Liu, Xuedeng, et al.
Publicado: (2025)
MergeTok: Unified Continuous and Discrete Visual Tokenization via Token Merging
por: Zhang, Luyuan, et al.
Publicado: (2026)
por: Zhang, Luyuan, et al.
Publicado: (2026)
Ejemplares similares
-
CrowdMoGen: Zero-Shot Text-Driven Collective Motion Generation
por: Cao, Yukang, et al.
Publicado: (2024) -
Large Motion Model for Unified Multi-Modal Motion Generation
por: Zhang, Mingyuan, et al.
Publicado: (2024) -
Disco4D: Disentangled 4D Human Generation and Animation from a Single Image
por: Pang, Hui En, et al.
Publicado: (2024) -
Bridging the Gap between Human Motion and Action Semantics via Kinematic Phrases
por: Liu, Xinpeng, et al.
Publicado: (2023) -
FreeInit: Bridging Initialization Gap in Video Diffusion Models
por: Wu, Tianxing, et al.
Publicado: (2023)