Semantics-Aware Human Motion Generation from Audio Instructions
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Zi-An, Zou, Shihao, Yu, Shiyao, Zhang, Mingyuan, Dong, Chao |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation
par: Cheng, Shihao, et autres
Publié: (2026)
par: Cheng, Shihao, et autres
Publié: (2026)
InterActHuman: Multi-Concept Human Animation with Layout-Aligned Audio Conditions
par: Wang, Zhenzhi, et autres
Publié: (2025)
par: Wang, Zhenzhi, et autres
Publié: (2025)
Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space
par: Yu, Shiyao, et autres
Publié: (2025)
par: Yu, Shiyao, et autres
Publié: (2025)
Semantic Audio-Visual Navigation in Continuous Environments
par: Zeng, Yichen, et autres
Publié: (2026)
par: Zeng, Yichen, et autres
Publié: (2026)
AudioStory: Generating Long-Form Narrative Audio with Large Language Models
par: Guo, Yuxin, et autres
Publié: (2025)
par: Guo, Yuxin, et autres
Publié: (2025)
WavFlow: Audio Generation in Waveform Space
par: Zhou, Feiyan, et autres
Publié: (2026)
par: Zhou, Feiyan, et autres
Publié: (2026)
AV-Edit: Multimodal Generative Sound Effect Editing via Audio-Visual Semantic Joint Control
par: Guo, Xinyue, et autres
Publié: (2025)
par: Guo, Xinyue, et autres
Publié: (2025)
Semantic Noise Reduction via Teacher-Guided Dual-Path Audio-Visual Representation Learning
par: Wang, Linge, et autres
Publié: (2026)
par: Wang, Linge, et autres
Publié: (2026)
WAVE: Learning Unified & Versatile Audio-Visual Embeddings with Multimodal LLM
par: Tang, Changli, et autres
Publié: (2025)
par: Tang, Changli, et autres
Publié: (2025)
VABench: A Comprehensive Benchmark for Audio-Video Generation
par: Hua, Daili, et autres
Publié: (2025)
par: Hua, Daili, et autres
Publié: (2025)
MOVA: Towards Scalable and Synchronized Video-Audio Generation
par: OpenMOSS Team, et autres
Publié: (2026)
par: OpenMOSS Team, et autres
Publié: (2026)
Robust Audio-Visual Segmentation via Audio-Guided Visual Convergent Alignment
par: Liu, Chen, et autres
Publié: (2025)
par: Liu, Chen, et autres
Publié: (2025)
MMAudio-LABEL: Audio Event Labeling via Audio Generation for Silent Video
par: Tateishi, Kazuya, et autres
Publié: (2026)
par: Tateishi, Kazuya, et autres
Publié: (2026)
Dynamic Derivation and Elimination: Audio Visual Segmentation with Enhanced Audio Semantics
par: Liu, Chen, et autres
Publié: (2025)
par: Liu, Chen, et autres
Publié: (2025)
Leveraging Audio Representations for Vibration-Based Crowd Monitoring in Stadiums
par: Chang, Yen Cheng, et autres
Publié: (2025)
par: Chang, Yen Cheng, et autres
Publié: (2025)
PAVAS: Physics-Aware Video-to-Audio Synthesis
par: Hyun-Bin, Oh, et autres
Publié: (2025)
par: Hyun-Bin, Oh, et autres
Publié: (2025)
Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation
par: Zhou, Yupeng, et autres
Publié: (2026)
par: Zhou, Yupeng, et autres
Publié: (2026)
Efficient Audio-Visual Speech Separation with Discrete Lip Semantics and Multi-Scale Global-Local Attention
par: Li, Kai, et autres
Publié: (2025)
par: Li, Kai, et autres
Publié: (2025)
Tora3: Trajectory-Guided Audio-Video Generation with Physical Coherence
par: Liao, Junchao, et autres
Publié: (2026)
par: Liao, Junchao, et autres
Publié: (2026)
Synchronized Video-to-Audio Generation via Mel Quantization-Continuum Decomposition
par: Wang, Juncheng, et autres
Publié: (2025)
par: Wang, Juncheng, et autres
Publié: (2025)
DDAVS: Disentangled Audio Semantics and Delayed Bidirectional Alignment for Audio-Visual Segmentation
par: Tian, Jingqi, et autres
Publié: (2025)
par: Tian, Jingqi, et autres
Publié: (2025)
Hierarchical Semantic Correlation-Aware Masked Autoencoder for Unsupervised Audio-Visual Representation Learning
par: Zeng, Donghuo, et autres
Publié: (2026)
par: Zeng, Donghuo, et autres
Publié: (2026)
Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation
par: Chen, Yuheng, et autres
Publié: (2026)
par: Chen, Yuheng, et autres
Publié: (2026)
MultiSoundGen: Video-to-Audio Generation for Multi-Event Scenarios via SlowFast Contrastive Audio-Visual Pretraining and Direct Preference Optimization
par: Yang, Jianxuan, et autres
Publié: (2025)
par: Yang, Jianxuan, et autres
Publié: (2025)
Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation with Asynchronous Dual-Stream and Human-Centric Preference Distillation
par: Li, Chunyu, et autres
Publié: (2026)
par: Li, Chunyu, et autres
Publié: (2026)
Rethinking Audio-Visual Adversarial Vulnerability from Temporal and Modality Perspectives
par: Zhang, Zeliang, et autres
Publié: (2025)
par: Zhang, Zeliang, et autres
Publié: (2025)
Sound Sparks Motion: Audio and Text Tuning for Video Editing
par: Razlighi, AmirHossein Naghi, et autres
Publié: (2026)
par: Razlighi, AmirHossein Naghi, et autres
Publié: (2026)
Speech Audio Generation from dynamic MRI via a Knowledge Enhanced Conditional Variational Autoencoder
par: Li, Yaxuan, et autres
Publié: (2025)
par: Li, Yaxuan, et autres
Publié: (2025)
OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text
par: Pian, Weiguo, et autres
Publié: (2026)
par: Pian, Weiguo, et autres
Publié: (2026)
Draw an Audio: Leveraging Multi-Instruction for Video-to-Audio Synthesis
par: Yang, Qi, et autres
Publié: (2024)
par: Yang, Qi, et autres
Publié: (2024)
JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation
par: Liu, Kai, et autres
Publié: (2026)
par: Liu, Kai, et autres
Publié: (2026)
OmniAudio: Generating Spatial Audio from 360-Degree Video
par: Liu, Huadai, et autres
Publié: (2025)
par: Liu, Huadai, et autres
Publié: (2025)
MIRRORTALK: Forging Personalized Avatars Via Disentangled Style and Hierarchical Motion Control
par: Lu, Renjie, et autres
Publié: (2026)
par: Lu, Renjie, et autres
Publié: (2026)
FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts
par: Li, You, et autres
Publié: (2026)
par: Li, You, et autres
Publié: (2026)
TurboTalk: Progressive Distillation for One-Step Audio-Driven Talking Avatar Generation
par: Liu, Xiangyu, et autres
Publié: (2026)
par: Liu, Xiangyu, et autres
Publié: (2026)
LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV
par: Liu, Tengfei, et autres
Publié: (2026)
par: Liu, Tengfei, et autres
Publié: (2026)
Video-to-Audio Generation with Hidden Alignment
par: Xu, Manjie, et autres
Publié: (2024)
par: Xu, Manjie, et autres
Publié: (2024)
AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models
par: Yang, Jialiang, et autres
Publié: (2026)
par: Yang, Jialiang, et autres
Publié: (2026)
ControlFoley: Unified and Controllable Video-to-Audio Generation with Cross-Modal Conflict Handling
par: Yang, Jianxuan, et autres
Publié: (2026)
par: Yang, Jianxuan, et autres
Publié: (2026)
UniTalking: A Unified Audio-Video Framework for Talking Portrait Generation
par: Li, Hebeizi, et autres
Publié: (2026)
par: Li, Hebeizi, et autres
Publié: (2026)
Documents similaires
-
Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation
par: Cheng, Shihao, et autres
Publié: (2026) -
InterActHuman: Multi-Concept Human Animation with Layout-Aligned Audio Conditions
par: Wang, Zhenzhi, et autres
Publié: (2025) -
Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space
par: Yu, Shiyao, et autres
Publié: (2025) -
Semantic Audio-Visual Navigation in Continuous Environments
par: Zeng, Yichen, et autres
Publié: (2026) -
AudioStory: Generating Long-Form Narrative Audio with Large Language Models
par: Guo, Yuxin, et autres
Publié: (2025)