Towards Robust and Controllable Text-to-Motion via Masked Autoregressive Diffusion
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Zongye, Kong, Bohan, Liu, Qingjie, Wang, Yunhong |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
StyleMM: Stylized 3D Morphable Face Model via Text-Driven Aligned Image Translation
par: Lee, Seungmi, et autres
Publié: (2025)
par: Lee, Seungmi, et autres
Publié: (2025)
StyleID: A Perception-Aware Dataset and Metric for Stylization-Agnostic Facial Identity Recognition
par: Yun, Kwan, et autres
Publié: (2026)
par: Yun, Kwan, et autres
Publié: (2026)
Sketch2Manga: Shaded Manga Screening from Sketch with Diffusion Models
par: Lin, Jian, et autres
Publié: (2024)
par: Lin, Jian, et autres
Publié: (2024)
GSEdit: Efficient Text-Guided Editing of 3D Objects via Gaussian Splatting
par: Palandra, Francesco, et autres
Publié: (2024)
par: Palandra, Francesco, et autres
Publié: (2024)
SkeletonX: Data-Efficient Skeleton-based Action Recognition via Cross-sample Feature Aggregation
par: Zhang, Zongye, et autres
Publié: (2025)
par: Zhang, Zongye, et autres
Publié: (2025)
From Dead Pixels to Editable Slides: Infographic Reconstruction into Native Google Slides via Vision-Language Region Understanding
par: Gonzalez, Leonardo
Publié: (2026)
par: Gonzalez, Leonardo
Publié: (2026)
SHREC 2025: Protein surface shape retrieval including electrostatic potential
par: Yacoub, Taher, et autres
Publié: (2025)
par: Yacoub, Taher, et autres
Publié: (2025)
Quantized FCA: Efficient Zero-Shot Texture Anomaly Detection
par: Ardelean, Andrei-Timotei, et autres
Publié: (2025)
par: Ardelean, Andrei-Timotei, et autres
Publié: (2025)
Patient-Specific Dynamic Digital-Physical Twin for Coronary Intervention Training: An Integrated Mixed Reality Approach
par: Wang, Shuo, et autres
Publié: (2025)
par: Wang, Shuo, et autres
Publié: (2025)
Seeing The Words: Evaluating AI-generated Biblical Art
par: Makimei, Hidde, et autres
Publié: (2025)
par: Makimei, Hidde, et autres
Publié: (2025)
Light Future: Multimodal Action Frame Prediction via InstructPix2Pix
par: Zhong, Zesen, et autres
Publié: (2025)
par: Zhong, Zesen, et autres
Publié: (2025)
A Scalable System for Visual Analysis of Ocean Data
par: Jain, Toshit, et autres
Publié: (2025)
par: Jain, Toshit, et autres
Publié: (2025)
Multi-scale Cycle Tracking in Dynamic Planar Graphs
par: Rasheed, Farhan, et autres
Publié: (2024)
par: Rasheed, Farhan, et autres
Publié: (2024)
TAG-WM: Tamper-Aware Generative Image Watermarking via Diffusion Inversion Sensitivity
par: Chen, Yuzhuo, et autres
Publié: (2025)
par: Chen, Yuzhuo, et autres
Publié: (2025)
Innovative Integration of 4D Cardiovascular Reconstruction and Hologram: A New Visualization Tool for Coronary Artery Bypass Grafting Planning
par: Wang, Shuo, et autres
Publié: (2025)
par: Wang, Shuo, et autres
Publié: (2025)
DeepTaxon: An Interpretable Retrieval-Augmented Multimodal Framework for Unified Species Identification and Discovery
par: Wang, Jiawei, et autres
Publié: (2026)
par: Wang, Jiawei, et autres
Publié: (2026)
Gaussian Splatting: 3D Reconstruction and Novel View Synthesis, a Review
par: Dalal, Anurag, et autres
Publié: (2024)
par: Dalal, Anurag, et autres
Publié: (2024)
FFaceNeRF: Few-shot Face Editing in Neural Radiance Fields
par: Yun, Kwan, et autres
Publié: (2025)
par: Yun, Kwan, et autres
Publié: (2025)
Differentiable Hierarchical Visual Tokenization
par: Aasan, Marius, et autres
Publié: (2025)
par: Aasan, Marius, et autres
Publié: (2025)
Pinching Visuo-haptic Display: Investigating Cross-Modal Effects of Visual Textures on Electrostatic Cloth Tactile Sensations
par: Kitagishi, Takekazu, et autres
Publié: (2025)
par: Kitagishi, Takekazu, et autres
Publié: (2025)
Two-step Authentication: Multi-biometric System Using Voice and Facial Recognition
par: Chen, Kuan Wei, et autres
Publié: (2026)
par: Chen, Kuan Wei, et autres
Publié: (2026)
A Hybrid Deterministic Framework for Named Entity Extraction in Broadcast News Video
par: Lucas, Andrea Filiberto, et autres
Publié: (2026)
par: Lucas, Andrea Filiberto, et autres
Publié: (2026)
StableMoFusion: Towards Robust and Efficient Diffusion-based Motion Generation Framework
par: Huang, Yiheng, et autres
Publié: (2024)
par: Huang, Yiheng, et autres
Publié: (2024)
EditP23: 3D Editing via Propagation of Image Prompts to Multi-View
par: Bar-On, Roi, et autres
Publié: (2025)
par: Bar-On, Roi, et autres
Publié: (2025)
HeadEvolver: Text to Head Avatars via Expressive and Attribute-Preserving Mesh Deformation
par: Wang, Duotun, et autres
Publié: (2024)
par: Wang, Duotun, et autres
Publié: (2024)
Experimental Evaluation of Static Image Sub-Region-Based Search Models Using CLIP
par: Jäckl, Bastian, et autres
Publié: (2025)
par: Jäckl, Bastian, et autres
Publié: (2025)
Text2VDM: Text to Vector Displacement Maps for Expressive and Interactive 3D Sculpting
par: Meng, Hengyu, et autres
Publié: (2025)
par: Meng, Hengyu, et autres
Publié: (2025)
Lens Distortion Encoding System Version 1.0
par: Fober, Jakub Maksymilian
Publié: (2024)
par: Fober, Jakub Maksymilian
Publié: (2024)
Hierarchical Masked Autoregressive Models with Low-Resolution Token Pivots
par: Zheng, Guangting, et autres
Publié: (2025)
par: Zheng, Guangting, et autres
Publié: (2025)
Scene Detection Policies and Keyframe Extraction Strategies for Large-Scale Video Analysis
par: Korolkov, Vasilii
Publié: (2025)
par: Korolkov, Vasilii
Publié: (2025)
Engineering Mythology: A Digital-Physical Framework for Culturally-Inspired Public Art
par: Das, Jnaneshwar, et autres
Publié: (2026)
par: Das, Jnaneshwar, et autres
Publié: (2026)
Implicit Location-Caption Alignment via Complementary Masking for Weakly-Supervised Dense Video Captioning
par: Ge, Shiping, et autres
Publié: (2024)
par: Ge, Shiping, et autres
Publié: (2024)
Understanding Identity Continuity in Thermal Video through Scene-Level Consistency
par: Sun, Wei-Chieh, et autres
Publié: (2026)
par: Sun, Wei-Chieh, et autres
Publié: (2026)
Controllable Complex Human Motion Video Generation via Text-to-Skeleton Cascades
par: Taghipour, Ashkan, et autres
Publié: (2026)
par: Taghipour, Ashkan, et autres
Publié: (2026)
Text-controlled Motion Mamba: Text-Instructed Temporal Grounding of Human Motion
par: Wang, Xinghan, et autres
Publié: (2024)
par: Wang, Xinghan, et autres
Publié: (2024)
Gear-NeRF: Free-Viewpoint Rendering and Tracking with Motion-aware Spatio-Temporal Sampling
par: Liu, Xinhang, et autres
Publié: (2024)
par: Liu, Xinhang, et autres
Publié: (2024)
Model See Model Do: Speech-Driven Facial Animation with Style Control
par: Pan, Yifang, et autres
Publié: (2025)
par: Pan, Yifang, et autres
Publié: (2025)
Motion Attribution for Video Generation
par: Wu, Xindi, et autres
Publié: (2026)
par: Wu, Xindi, et autres
Publié: (2026)
Visual Style Prompt Learning Using Diffusion Models for Blind Face Restoration
par: Lu, Wanglong, et autres
Publié: (2024)
par: Lu, Wanglong, et autres
Publié: (2024)
AnyMoLe: Any Character Motion In-betweening Leveraging Video Diffusion Models
par: Yun, Kwan, et autres
Publié: (2025)
par: Yun, Kwan, et autres
Publié: (2025)
Documents similaires
-
StyleMM: Stylized 3D Morphable Face Model via Text-Driven Aligned Image Translation
par: Lee, Seungmi, et autres
Publié: (2025) -
StyleID: A Perception-Aware Dataset and Metric for Stylization-Agnostic Facial Identity Recognition
par: Yun, Kwan, et autres
Publié: (2026) -
Sketch2Manga: Shaded Manga Screening from Sketch with Diffusion Models
par: Lin, Jian, et autres
Publié: (2024) -
GSEdit: Efficient Text-Guided Editing of 3D Objects via Gaussian Splatting
par: Palandra, Francesco, et autres
Publié: (2024) -
SkeletonX: Data-Efficient Skeleton-based Action Recognition via Cross-sample Feature Aggregation
par: Zhang, Zongye, et autres
Publié: (2025)