It Takes Two: Real-time Co-Speech Two-person's Interaction Generation via Reactive Auto-regressive Diffusion Model
Fuente:
arXiv
Salvato in:
| Autori principali: | Shi, Mingyi, Qin, Dafei, Ho, Leo, Liao, Zhouyingcheng, Huang, Yinghao, Yamagishi, Junichi, Komura, Taku |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DanceAnyWay: Synthesizing Beat-Guided 3D Dances with Randomized Temporal Contrastive Learning
di: Bhattacharya, Aneesh, et al.
Pubblicazione: (2023)
di: Bhattacharya, Aneesh, et al.
Pubblicazione: (2023)
MATHDance: Mamba-Transformer Architecture with Uniform Tokenization for High-Quality 3D Dance Generation
di: Yang, Kaixing, et al.
Pubblicazione: (2025)
di: Yang, Kaixing, et al.
Pubblicazione: (2025)
Combining Genre Classification and Harmonic-Percussive Features with Diffusion Models for Music-Video Generation
di: Pina, Leonardo, et al.
Pubblicazione: (2024)
di: Pina, Leonardo, et al.
Pubblicazione: (2024)
MusicScore: A Dataset for Music Score Modeling and Generation
di: Lin, Yuheng, et al.
Pubblicazione: (2024)
di: Lin, Yuheng, et al.
Pubblicazione: (2024)
InterDance:Reactive 3D Dance Generation with Realistic Duet Interactions
di: Li, Ronghui, et al.
Pubblicazione: (2024)
di: Li, Ronghui, et al.
Pubblicazione: (2024)
Audio is all in one: speech-driven gesture synthetics using WavLM pre-trained model
di: Zhang, Fan, et al.
Pubblicazione: (2023)
di: Zhang, Fan, et al.
Pubblicazione: (2023)
PointTalk: Audio-Driven Dynamic Lip Point Cloud for 3D Gaussian-based Talking Head Synthesis
di: Xie, Yifan, et al.
Pubblicazione: (2024)
di: Xie, Yifan, et al.
Pubblicazione: (2024)
Tiny is not small enough: High-quality, low-resource facial animation models through hybrid knowledge distillation
di: Han, Zhen, et al.
Pubblicazione: (2025)
di: Han, Zhen, et al.
Pubblicazione: (2025)
LAV: Audio-Driven Dynamic Visual Generation with Neural Compression and StyleGAN2
di: Jung, Jongmin, et al.
Pubblicazione: (2025)
di: Jung, Jongmin, et al.
Pubblicazione: (2025)
DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2
di: Zhang, Fan, et al.
Pubblicazione: (2024)
di: Zhang, Fan, et al.
Pubblicazione: (2024)
Flowers Revisited: A Preliminary Replication of Flowers et al. 1997
di: Enge, Kajetan, et al.
Pubblicazione: (2024)
di: Enge, Kajetan, et al.
Pubblicazione: (2024)
Hindi audio-video-Deepfake (HAV-DF): A Hindi language-based Audio-video Deepfake Dataset
di: Kaur, Sukhandeep, et al.
Pubblicazione: (2024)
di: Kaur, Sukhandeep, et al.
Pubblicazione: (2024)
NeRF-3DTalker: Neural Radiance Field with 3D Prior Aided Audio Disentanglement for Talking Head Synthesis
di: Liu, Xiaoxing, et al.
Pubblicazione: (2025)
di: Liu, Xiaoxing, et al.
Pubblicazione: (2025)
Sonic: Shifting Focus to Global Audio Perception in Portrait Animation
di: Ji, Xiaozhong, et al.
Pubblicazione: (2024)
di: Ji, Xiaozhong, et al.
Pubblicazione: (2024)
Low-latency Speech Enhancement via Speech Token Generation
di: Xue, Huaying, et al.
Pubblicazione: (2023)
di: Xue, Huaying, et al.
Pubblicazione: (2023)
Efficient Speech Watermarking for Speech Synthesis via Progressive Knowledge Distillation
di: Cui, Yang, et al.
Pubblicazione: (2025)
di: Cui, Yang, et al.
Pubblicazione: (2025)
Speech-to-See: End-to-End Speech-Driven Open-Set Object Detection
di: Lu, Wenhuan, et al.
Pubblicazione: (2025)
di: Lu, Wenhuan, et al.
Pubblicazione: (2025)
Preserving Speaker Information in Direct Speech-to-Speech Translation with Non-Autoregressive Generation and Pretraining
di: Zhou, Rui, et al.
Pubblicazione: (2024)
di: Zhou, Rui, et al.
Pubblicazione: (2024)
Every Breath You Don't Take: Deepfake Speech Detection Using Breath
di: Layton, Seth, et al.
Pubblicazione: (2024)
di: Layton, Seth, et al.
Pubblicazione: (2024)
Conformer-based Ultrasound-to-Speech Conversion
di: Ibrahimov, Ibrahim, et al.
Pubblicazione: (2025)
di: Ibrahimov, Ibrahim, et al.
Pubblicazione: (2025)
Improved symbolic drum style classification with grammar-based hierarchical representations
di: Géré, Léo, et al.
Pubblicazione: (2024)
di: Géré, Léo, et al.
Pubblicazione: (2024)
Audio-Visual Speech Separation via Bottleneck Iterative Network
di: Zhang, Sidong, et al.
Pubblicazione: (2025)
di: Zhang, Sidong, et al.
Pubblicazione: (2025)
VERSA: A Versatile Evaluation Toolkit for Speech, Audio, and Music
di: Shi, Jiatong, et al.
Pubblicazione: (2024)
di: Shi, Jiatong, et al.
Pubblicazione: (2024)
LCB-net: Long-Context Biasing for Audio-Visual Speech Recognition
di: Yu, Fan, et al.
Pubblicazione: (2024)
di: Yu, Fan, et al.
Pubblicazione: (2024)
Listening Between the Lines: Synthetic Speech Detection Disregarding Verbal Content
di: Salvi, Davide, et al.
Pubblicazione: (2024)
di: Salvi, Davide, et al.
Pubblicazione: (2024)
FastTalker: Jointly Generating Speech and Conversational Gestures from Text
di: Guo, Zixin, et al.
Pubblicazione: (2024)
di: Guo, Zixin, et al.
Pubblicazione: (2024)
Human-Inspired Computing for Robust and Efficient Audio-Visual Speech Recognition
di: Liu, Qianhui, et al.
Pubblicazione: (2024)
di: Liu, Qianhui, et al.
Pubblicazione: (2024)
Beyond Video-to-SFX: Video to Audio Synthesis with Environmentally Aware Speech
di: Niu, Xinlei, et al.
Pubblicazione: (2025)
di: Niu, Xinlei, et al.
Pubblicazione: (2025)
REWIND: Speech Time Reversal for Enhancing Speaker Representations in Diffusion-based Voice Conversion
di: Biyani, Ishan D., et al.
Pubblicazione: (2025)
di: Biyani, Ishan D., et al.
Pubblicazione: (2025)
DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis
di: Tian, Wenjie, et al.
Pubblicazione: (2025)
di: Tian, Wenjie, et al.
Pubblicazione: (2025)
Improving Speech Enhancement by Integrating Inter-Channel and Band Features with Dual-branch Conformer
di: Li, Jizhen, et al.
Pubblicazione: (2024)
di: Li, Jizhen, et al.
Pubblicazione: (2024)
ARECHO: Autoregressive Evaluation via Chain-Based Hypothesis Optimization for Speech Multi-Metric Estimation
di: Shi, Jiatong, et al.
Pubblicazione: (2025)
di: Shi, Jiatong, et al.
Pubblicazione: (2025)
MiniMind-O Technical Report: An Open Small-Scale Speech-Native Omni Model
di: Gong, Jingyao
Pubblicazione: (2026)
di: Gong, Jingyao
Pubblicazione: (2026)
RAVSS: Robust Audio-Visual Speech Separation in Multi-Speaker Scenarios with Missing Visual Cues
di: Pan, Tianrui, et al.
Pubblicazione: (2024)
di: Pan, Tianrui, et al.
Pubblicazione: (2024)
M$^{3}$V: A multi-modal multi-view approach for Device-Directed Speech Detection
di: Wang, Anna, et al.
Pubblicazione: (2024)
di: Wang, Anna, et al.
Pubblicazione: (2024)
Robust LLM-based Audio-Visual Speech Recognition with Sparse Modality Alignment and Visual Unit-Guided Refinement
di: Su, Fei, et al.
Pubblicazione: (2026)
di: Su, Fei, et al.
Pubblicazione: (2026)
StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion
di: Li, Fengjin, et al.
Pubblicazione: (2025)
di: Li, Fengjin, et al.
Pubblicazione: (2025)
RVCBench: Benchmarking the Robustness of Voice Cloning Across Modern Audio Generation Models
di: Jin, Ruinan, et al.
Pubblicazione: (2026)
di: Jin, Ruinan, et al.
Pubblicazione: (2026)
NAT: Neural Acoustic Transfer for Interactive Scenes in Real Time
di: Jin, Xutong, et al.
Pubblicazione: (2025)
di: Jin, Xutong, et al.
Pubblicazione: (2025)
Rhythmic Foley: A Framework For Seamless Audio-Visual Alignment In Video-to-Audio Synthesis
di: Huang, Zhiqi, et al.
Pubblicazione: (2024)
di: Huang, Zhiqi, et al.
Pubblicazione: (2024)
Documenti analoghi
-
DanceAnyWay: Synthesizing Beat-Guided 3D Dances with Randomized Temporal Contrastive Learning
di: Bhattacharya, Aneesh, et al.
Pubblicazione: (2023) -
MATHDance: Mamba-Transformer Architecture with Uniform Tokenization for High-Quality 3D Dance Generation
di: Yang, Kaixing, et al.
Pubblicazione: (2025) -
Combining Genre Classification and Harmonic-Percussive Features with Diffusion Models for Music-Video Generation
di: Pina, Leonardo, et al.
Pubblicazione: (2024) -
MusicScore: A Dataset for Music Score Modeling and Generation
di: Lin, Yuheng, et al.
Pubblicazione: (2024) -
InterDance:Reactive 3D Dance Generation with Realistic Duet Interactions
di: Li, Ronghui, et al.
Pubblicazione: (2024)