Learning Co-Speech Gesture Representations in Dialogue through Contrastive Learning: An Intrinsic Evaluation
Fuente:
arXiv
Salvato in:
| Autori principali: | Ghaleb, Esam, Khaertdinov, Bulat, Pouw, Wim, Rasenberg, Marlou, Holler, Judith, Özyürek, Aslı, Fernández, Raquel |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
I see what you mean: Co-Speech Gestures for Reference Resolution in Multimodal Dialogue
di: Ghaleb, Esam, et al.
Pubblicazione: (2025)
di: Ghaleb, Esam, et al.
Pubblicazione: (2025)
Co-Speech Gesture Detection through Multi-Phase Sequence Labeling
di: Ghaleb, Esam, et al.
Pubblicazione: (2023)
di: Ghaleb, Esam, et al.
Pubblicazione: (2023)
Exploring Self-Supervised Multi-view Contrastive Learning for Speech Emotion Recognition with Limited Annotations
di: Khaertdinov, Bulat, et al.
Pubblicazione: (2024)
di: Khaertdinov, Bulat, et al.
Pubblicazione: (2024)
Analysing Cross-Speaker Convergence in Face-to-Face Dialogue through the Lens of Automatically Detected Shared Linguistic Constructions
di: Ghaleb, Esam, et al.
Pubblicazione: (2024)
di: Ghaleb, Esam, et al.
Pubblicazione: (2024)
Leveraging Speech for Gesture Detection in Multimodal Communication
di: Ghaleb, Esam, et al.
Pubblicazione: (2024)
di: Ghaleb, Esam, et al.
Pubblicazione: (2024)
Learning Disentangled Speech Representations with Contrastive Learning and Time-Invariant Retrieval
di: Deng, Yimin, et al.
Pubblicazione: (2024)
di: Deng, Yimin, et al.
Pubblicazione: (2024)
Noise-Aware Speech Separation with Contrastive Learning
di: Zhang, Zizheng, et al.
Pubblicazione: (2023)
di: Zhang, Zizheng, et al.
Pubblicazione: (2023)
DuoGesture: Neuro-Inspired and Biomechanically Informed Dual-Stream Co-Speech Gesture Generation
di: Paar, Ferdinand, et al.
Pubblicazione: (2026)
di: Paar, Ferdinand, et al.
Pubblicazione: (2026)
Enhancing Emotional Text-to-Speech Controllability with Natural Language Guidance through Contrastive Learning and Diffusion Models
di: Jing, Xin, et al.
Pubblicazione: (2024)
di: Jing, Xin, et al.
Pubblicazione: (2024)
Advancing Electrolaryngeal Speech Enhancement Through Speech-Text Representation Learning
di: Ma, Ding, et al.
Pubblicazione: (2026)
di: Ma, Ding, et al.
Pubblicazione: (2026)
Contrastive Learning With Audio Discrimination For Customizable Keyword Spotting In Continuous Speech
di: Xi, Yu, et al.
Pubblicazione: (2024)
di: Xi, Yu, et al.
Pubblicazione: (2024)
Enhancing Dialogue Speech Recognition with Robust Contextual Awareness via Noise Representation Learning
di: Lee, Wonjun, et al.
Pubblicazione: (2024)
di: Lee, Wonjun, et al.
Pubblicazione: (2024)
The Effect of Batch Size on Contrastive Self-Supervised Speech Representation Learning
di: Vaessen, Nik, et al.
Pubblicazione: (2024)
di: Vaessen, Nik, et al.
Pubblicazione: (2024)
Learning Expressive Disentangled Speech Representations with Soft Speech Units and Adversarial Style Augmentation
di: Deng, Yimin, et al.
Pubblicazione: (2024)
di: Deng, Yimin, et al.
Pubblicazione: (2024)
Boosting Multi-Speaker Expressive Speech Synthesis with Semi-supervised Contrastive Learning
di: Zhu, Xinfa, et al.
Pubblicazione: (2023)
di: Zhu, Xinfa, et al.
Pubblicazione: (2023)
Adaptive Speech Emotion Representation Learning Based On Dynamic Graph
di: Gao, Yingxue, et al.
Pubblicazione: (2024)
di: Gao, Yingxue, et al.
Pubblicazione: (2024)
Learning Domain-Robust Bioacoustic Representations for Mosquito Species Classification with Contrastive Learning and Distribution Alignment
di: Hou, Yuanbo, et al.
Pubblicazione: (2025)
di: Hou, Yuanbo, et al.
Pubblicazione: (2025)
Progressive Residual Extraction based Pre-training for Speech Representation Learning
di: Wang, Tianrui, et al.
Pubblicazione: (2024)
di: Wang, Tianrui, et al.
Pubblicazione: (2024)
Emotion-Aware Speech Self-Supervised Representation Learning with Intensity Knowledge
di: Liu, Rui, et al.
Pubblicazione: (2024)
di: Liu, Rui, et al.
Pubblicazione: (2024)
CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning
di: Shi, Jiacheng, et al.
Pubblicazione: (2025)
di: Shi, Jiacheng, et al.
Pubblicazione: (2025)
Quantifying Dimensional Independence in Speech: An Information-Theoretic Framework for Disentangled Representation Learning
di: Kashyap, Bipasha, et al.
Pubblicazione: (2026)
di: Kashyap, Bipasha, et al.
Pubblicazione: (2026)
LL-SDR: Low-Latency Speech enhancement through Discrete Representations
di: Li, Jingyi, et al.
Pubblicazione: (2026)
di: Li, Jingyi, et al.
Pubblicazione: (2026)
Audio-Visual Representation Learning via Knowledge Distillation from Speech Foundation Models
di: Zhang, Jing-Xuan, et al.
Pubblicazione: (2025)
di: Zhang, Jing-Xuan, et al.
Pubblicazione: (2025)
ASRRL-TTS: Agile Speaker Representation Reinforcement Learning for Text-to-Speech Speaker Adaptation
di: Fu, Ruibo, et al.
Pubblicazione: (2024)
di: Fu, Ruibo, et al.
Pubblicazione: (2024)
Rethinking Continual Learning for Speech and Audio: A Representation-Centric Taxonomy and Open Problems
di: Xiao, Yang, et al.
Pubblicazione: (2026)
di: Xiao, Yang, et al.
Pubblicazione: (2026)
MiniMax-Speech: Intrinsic Zero-Shot Text-to-Speech with a Learnable Speaker Encoder
di: Zhang, Bowen, et al.
Pubblicazione: (2025)
di: Zhang, Bowen, et al.
Pubblicazione: (2025)
Learning Disentangled Speech Representations
di: Brima, Yusuf, et al.
Pubblicazione: (2023)
di: Brima, Yusuf, et al.
Pubblicazione: (2023)
Listen through the Sound: Generative Speech Restoration Leveraging Acoustic Context Representation
di: Chung, Soo-Whan, et al.
Pubblicazione: (2025)
di: Chung, Soo-Whan, et al.
Pubblicazione: (2025)
DialoSpeech: Dual-Speaker Dialogue Generation with LLM and Flow Matching
di: Xie, Hanke, et al.
Pubblicazione: (2025)
di: Xie, Hanke, et al.
Pubblicazione: (2025)
Self-supervised Reflective Learning through Self-distillation and Online Clustering for Speaker Representation Learning
di: Cai, Danwei, et al.
Pubblicazione: (2024)
di: Cai, Danwei, et al.
Pubblicazione: (2024)
SCOREQ: Speech Quality Assessment with Contrastive Regression
di: Ragano, Alessandro, et al.
Pubblicazione: (2024)
di: Ragano, Alessandro, et al.
Pubblicazione: (2024)
FastTalker: Jointly Generating Speech and Conversational Gestures from Text
di: Guo, Zixin, et al.
Pubblicazione: (2024)
di: Guo, Zixin, et al.
Pubblicazione: (2024)
SCRAPS: Speech Contrastive Representations of Acoustic and Phonetic Spaces
di: Vallés-Pérez, Ivan, et al.
Pubblicazione: (2023)
di: Vallés-Pérez, Ivan, et al.
Pubblicazione: (2023)
Speech Separation based on Contrastive Learning and Deep Modularization
di: Ochieng, Peter
Pubblicazione: (2023)
di: Ochieng, Peter
Pubblicazione: (2023)
Multichannel AV-wav2vec2: A Framework for Learning Multichannel Multi-Modal Speech Representation
di: Zhu, Qiushi, et al.
Pubblicazione: (2024)
di: Zhu, Qiushi, et al.
Pubblicazione: (2024)
Rate-Aware Learned Speech Compression
di: Xu, Jun, et al.
Pubblicazione: (2025)
di: Xu, Jun, et al.
Pubblicazione: (2025)
Efficient Long-Form Speech Recognition for General Speech In-Context Learning
di: Yen, Hao, et al.
Pubblicazione: (2024)
di: Yen, Hao, et al.
Pubblicazione: (2024)
MMM: Multi-Layer Multi-Residual Multi-Stream Discrete Speech Representation from Self-supervised Learning Model
di: Shi, Jiatong, et al.
Pubblicazione: (2024)
di: Shi, Jiatong, et al.
Pubblicazione: (2024)
Speaker Contrastive Learning for Source Speaker Tracing
di: Wang, Qing, et al.
Pubblicazione: (2024)
di: Wang, Qing, et al.
Pubblicazione: (2024)
Simulating Native Speaker Shadowing for Nonnative Speech Assessment with Latent Speech Representations
di: Geng, Haopeng, et al.
Pubblicazione: (2024)
di: Geng, Haopeng, et al.
Pubblicazione: (2024)
Documenti analoghi
-
I see what you mean: Co-Speech Gestures for Reference Resolution in Multimodal Dialogue
di: Ghaleb, Esam, et al.
Pubblicazione: (2025) -
Co-Speech Gesture Detection through Multi-Phase Sequence Labeling
di: Ghaleb, Esam, et al.
Pubblicazione: (2023) -
Exploring Self-Supervised Multi-view Contrastive Learning for Speech Emotion Recognition with Limited Annotations
di: Khaertdinov, Bulat, et al.
Pubblicazione: (2024) -
Analysing Cross-Speaker Convergence in Face-to-Face Dialogue through the Lens of Automatically Detected Shared Linguistic Constructions
di: Ghaleb, Esam, et al.
Pubblicazione: (2024) -
Leveraging Speech for Gesture Detection in Multimodal Communication
di: Ghaleb, Esam, et al.
Pubblicazione: (2024)