ConcateNet: Dialogue Separation Using Local And Global Feature Concatenation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Halimeh, Mhd Modar, Torcoli, Matteo, Habets, Emanuël |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Navigating PESQ: Up-to-Date Versions and Open Implementations
par: Torcoli, Matteo, et autres
Publié: (2025)
par: Torcoli, Matteo, et autres
Publié: (2025)
On the Relation Between Speech Quality and Quantized Latent Representations of Neural Codecs
par: Halimeh, Mhd Modar, et autres
Publié: (2025)
par: Halimeh, Mhd Modar, et autres
Publié: (2025)
Neural Directional Filtering: Far-Field Directivity Control With a Small Microphone Array
par: Wechsler, Julian, et autres
Publié: (2024)
par: Wechsler, Julian, et autres
Publié: (2024)
Acoustic Teleportation via Disentangled Neural Audio Codec Representations
par: Grundhuber, Philipp, et autres
Publié: (2025)
par: Grundhuber, Philipp, et autres
Publié: (2025)
Robust Speech Activity Detection in the Presence of Singing Voice
par: Grundhuber, Philipp, et autres
Publié: (2025)
par: Grundhuber, Philipp, et autres
Publié: (2025)
ODAQ: Open Dataset of Audio Quality
par: Torcoli, Matteo, et autres
Publié: (2023)
par: Torcoli, Matteo, et autres
Publié: (2023)
Neural Directional Filtering Using a Compact Microphone Array
par: Huang, Weilong, et autres
Publié: (2025)
par: Huang, Weilong, et autres
Publié: (2025)
Speech Loudness in Broadcasting and Streaming
par: Torcoli, Matteo, et autres
Publié: (2024)
par: Torcoli, Matteo, et autres
Publié: (2024)
GAN-Based Speech Enhancement for Low SNR Using Latent Feature Conditioning
par: Shetu, Shrishti Saha, et autres
Publié: (2024)
par: Shetu, Shrishti Saha, et autres
Publié: (2024)
Data-driven Joint Detection and Localization of Acoustic Reflectors
par: Bicer, H. Nazim, et autres
Publié: (2024)
par: Bicer, H. Nazim, et autres
Publié: (2024)
Audio Dialogues: Dialogues dataset for audio and music understanding
par: Goel, Arushi, et autres
Publié: (2024)
par: Goel, Arushi, et autres
Publié: (2024)
Stereo Reproduction in the Presence of Sample Rate Offsets
par: Korse, Srikanth, et autres
Publié: (2025)
par: Korse, Srikanth, et autres
Publié: (2025)
DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset
par: Koudounas, Alkis, et autres
Publié: (2025)
par: Koudounas, Alkis, et autres
Publié: (2025)
J-CHAT: Japanese Large-scale Spoken Dialogue Corpus for Spoken Dialogue Language Modeling
par: Nakata, Wataru, et autres
Publié: (2024)
par: Nakata, Wataru, et autres
Publié: (2024)
Comparative Analysis Of Discriminative Deep Learning-Based Noise Reduction Methods In Low SNR Scenarios
par: Shetu, Shrishti Saha, et autres
Publié: (2024)
par: Shetu, Shrishti Saha, et autres
Publié: (2024)
On the Use of Audio to Improve Dialogue Policies
par: Roncel, Daniel, et autres
Publié: (2024)
par: Roncel, Daniel, et autres
Publié: (2024)
CS-Dialogue: A 104-Hour Dataset of Spontaneous Mandarin-English Code-Switching Dialogues for Speech Recognition
par: Zhou, Jiaming, et autres
Publié: (2025)
par: Zhou, Jiaming, et autres
Publié: (2025)
HEAR: Hearing Enhanced Audio Response for Video-grounded Dialogue
par: Yoon, Sunjae, et autres
Publié: (2023)
par: Yoon, Sunjae, et autres
Publié: (2023)
ESPnet-SDS: Unified Toolkit and Demo for Spoken Dialogue Systems
par: Arora, Siddhant, et autres
Publié: (2025)
par: Arora, Siddhant, et autres
Publié: (2025)
AC/DC: LLM-based Audio Comprehension via Dialogue Continuation
par: Fujita, Yusuke, et autres
Publié: (2025)
par: Fujita, Yusuke, et autres
Publié: (2025)
SD-Eval: A Benchmark Dataset for Spoken Dialogue Understanding Beyond Words
par: Ao, Junyi, et autres
Publié: (2024)
par: Ao, Junyi, et autres
Publié: (2024)
SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation
par: Lu, Haitian, et autres
Publié: (2025)
par: Lu, Haitian, et autres
Publié: (2025)
Chain-of-Thought Training for Open E2E Spoken Dialogue Systems
par: Arora, Siddhant, et autres
Publié: (2025)
par: Arora, Siddhant, et autres
Publié: (2025)
Stream RAG: Instant and Accurate Spoken Dialogue Systems with Streaming Tool Usage
par: Arora, Siddhant, et autres
Publié: (2025)
par: Arora, Siddhant, et autres
Publié: (2025)
Meta Learning Text-to-Speech Synthesis in over 7000 Languages
par: Lux, Florian, et autres
Publié: (2024)
par: Lux, Florian, et autres
Publié: (2024)
Enhancing Dialogue Speech Recognition with Robust Contextual Awareness via Noise Representation Learning
par: Lee, Wonjun, et autres
Publié: (2024)
par: Lee, Wonjun, et autres
Publié: (2024)
Chain-of-Thought Reasoning in Streaming Full-Duplex End-to-End Spoken Dialogue Systems
par: Arora, Siddhant, et autres
Publié: (2025)
par: Arora, Siddhant, et autres
Publié: (2025)
Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking
par: Vendrame, Katia, et autres
Publié: (2025)
par: Vendrame, Katia, et autres
Publié: (2025)
Leveraging Chain of Thought towards Empathetic Spoken Dialogue without Corresponding Question-Answering Data
par: Xie, Jingran, et autres
Publié: (2025)
par: Xie, Jingran, et autres
Publié: (2025)
From Turn-Taking to Synchronous Dialogue: A Survey of Full-Duplex Spoken Language Models
par: Chen, Yuxuan, et autres
Publié: (2025)
par: Chen, Yuxuan, et autres
Publié: (2025)
Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder
par: Shakeel, Muhammad, et autres
Publié: (2025)
par: Shakeel, Muhammad, et autres
Publié: (2025)
Speech Separation based on Contrastive Learning and Deep Modularization
par: Ochieng, Peter
Publié: (2023)
par: Ochieng, Peter
Publié: (2023)
SepALM: Audio Language Models Are Error Correctors for Robust Speech Separation
par: Mu, Zhaoxi, et autres
Publié: (2025)
par: Mu, Zhaoxi, et autres
Publié: (2025)
FlashLabs Chroma 1.0: A Real-Time End-to-End Spoken Dialogue Model with Personalized Voice Cloning
par: Chen, Tanyu, et autres
Publié: (2026)
par: Chen, Tanyu, et autres
Publié: (2026)
Revisiting Acoustic Features for Robust ASR
par: Shah, Muhammad A., et autres
Publié: (2024)
par: Shah, Muhammad A., et autres
Publié: (2024)
Neural Concatenative Singing Voice Conversion: Rethinking Concatenation-Based Approach for One-Shot Singing Voice Conversion
par: Sha, Binzhu, et autres
Publié: (2023)
par: Sha, Binzhu, et autres
Publié: (2023)
Which Prosodic Features Matter Most for Pragmatics?
par: Ward, Nigel G., et autres
Publié: (2024)
par: Ward, Nigel G., et autres
Publié: (2024)
On the Contribution of Lexical Features to Speech Emotion Recognition
par: Combei, David
Publié: (2025)
par: Combei, David
Publié: (2025)
Continual Speech Learning with Fused Speech Features
par: Wang, Guitao, et autres
Publié: (2025)
par: Wang, Guitao, et autres
Publié: (2025)
Automatic speech recognition for the Nepali language using CNN, bidirectional LSTM and ResNet
par: Dhakal, Manish, et autres
Publié: (2024)
par: Dhakal, Manish, et autres
Publié: (2024)
Documents similaires
-
Navigating PESQ: Up-to-Date Versions and Open Implementations
par: Torcoli, Matteo, et autres
Publié: (2025) -
On the Relation Between Speech Quality and Quantized Latent Representations of Neural Codecs
par: Halimeh, Mhd Modar, et autres
Publié: (2025) -
Neural Directional Filtering: Far-Field Directivity Control With a Small Microphone Array
par: Wechsler, Julian, et autres
Publié: (2024) -
Acoustic Teleportation via Disentangled Neural Audio Codec Representations
par: Grundhuber, Philipp, et autres
Publié: (2025) -
Robust Speech Activity Detection in the Presence of Singing Voice
par: Grundhuber, Philipp, et autres
Publié: (2025)