DialogueSidon: Recovering Full-Duplex Dialogue Tracks from In-the-Wild Dialogue Audio
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Nakata, Wataru, Saito, Yuki, Yamauchi, Kazuki, Tsunoo, Emiru, Saruwatari, Hiroshi |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Causal Speech Enhancement with Predicting Semantics based on Quantized Self-supervised Learning Features
par: Tsunoo, Emiru, et autres
Publié: (2024)
par: Tsunoo, Emiru, et autres
Publié: (2024)
Sidon: Fast and Robust Open-Source Multilingual Speech Restoration for Large-scale Dataset Cleansing
par: Nakata, Wataru, et autres
Publié: (2025)
par: Nakata, Wataru, et autres
Publié: (2025)
J-CHAT: Japanese Large-scale Spoken Dialogue Corpus for Spoken Dialogue Language Modeling
par: Nakata, Wataru, et autres
Publié: (2024)
par: Nakata, Wataru, et autres
Publié: (2024)
Chain-of-Thought Reasoning in Streaming Full-Duplex End-to-End Spoken Dialogue Systems
par: Arora, Siddhant, et autres
Publié: (2025)
par: Arora, Siddhant, et autres
Publié: (2025)
Geneses: Unified Generative Speech Enhancement and Separation
par: Asai, Kohei, et autres
Publié: (2026)
par: Asai, Kohei, et autres
Publié: (2026)
Cross-Dialect Text-To-Speech in Pitch-Accent Language Incorporating Multi-Dialect Phoneme-Level BERT
par: Yamauchi, Kazuki, et autres
Publié: (2024)
par: Yamauchi, Kazuki, et autres
Publié: (2024)
UTDUSS: UTokyo-SaruLab System for Interspeech2024 Speech Processing Using Discrete Speech Unit Challenge
par: Nakata, Wataru, et autres
Publié: (2024)
par: Nakata, Wataru, et autres
Publié: (2024)
Building speech corpus with diverse voice characteristics for its prompt-based representation
par: Watanabe, Aya, et autres
Publié: (2024)
par: Watanabe, Aya, et autres
Publié: (2024)
Multi-Sampling-Frequency Naturalness MOS Prediction Using Self-Supervised Learning Model with Sampling-Frequency-Independent Layer
par: Nishikawa, Go, et autres
Publié: (2025)
par: Nishikawa, Go, et autres
Publié: (2025)
The T05 System for The VoiceMOS Challenge 2024: Transfer Learning from Deep Image Classifier to Naturalness MOS Prediction of High-Quality Synthetic Speech
par: Baba, Kaito, et autres
Publié: (2024)
par: Baba, Kaito, et autres
Publié: (2024)
Chain-of-Thought Training for Open E2E Spoken Dialogue Systems
par: Arora, Siddhant, et autres
Publié: (2025)
par: Arora, Siddhant, et autres
Publié: (2025)
ESPnet-SDS: Unified Toolkit and Demo for Spoken Dialogue Systems
par: Arora, Siddhant, et autres
Publié: (2025)
par: Arora, Siddhant, et autres
Publié: (2025)
Audio Dialogues: Dialogues dataset for audio and music understanding
par: Goel, Arushi, et autres
Publié: (2024)
par: Goel, Arushi, et autres
Publié: (2024)
LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control
par: Ohmura, Junki, et autres
Publié: (2025)
par: Ohmura, Junki, et autres
Publié: (2025)
From Turn-Taking to Synchronous Dialogue: A Survey of Full-Duplex Spoken Language Models
par: Chen, Yuxuan, et autres
Publié: (2025)
par: Chen, Yuxuan, et autres
Publié: (2025)
On the Use of Audio to Improve Dialogue Policies
par: Roncel, Daniel, et autres
Publié: (2024)
par: Roncel, Daniel, et autres
Publié: (2024)
Beyond Turn-Based Interfaces: Synchronous LLMs as Full-Duplex Dialogue Agents
par: Veluri, Bandhav, et autres
Publié: (2024)
par: Veluri, Bandhav, et autres
Publié: (2024)
Hyperbolic Embeddings for Order-Aware Classification of Audio Effect Chains
par: Wada, Aogu, et autres
Publié: (2025)
par: Wada, Aogu, et autres
Publié: (2025)
Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training
par: Udupa, Sathvik, et autres
Publié: (2025)
par: Udupa, Sathvik, et autres
Publié: (2025)
RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio
par: Kanamori, Yusuke, et autres
Publié: (2025)
par: Kanamori, Yusuke, et autres
Publié: (2025)
Human-CLAP: Human-perception-based contrastive language-audio pretraining
par: Takano, Taisei, et autres
Publié: (2025)
par: Takano, Taisei, et autres
Publié: (2025)
Differentiable K-means for Fully-optimized Discrete Token-based ASR
par: Onda, Kentaro, et autres
Publié: (2025)
par: Onda, Kentaro, et autres
Publié: (2025)
Decoder-only Architecture for Speech Recognition with CTC Prompts and Text Data Augmentation
par: Tsunoo, Emiru, et autres
Publié: (2023)
par: Tsunoo, Emiru, et autres
Publié: (2023)
SaSLaW: Dialogue Speech Corpus with Audio-visual Egocentric Information Toward Environment-adaptive Dialogue Speech Synthesis
par: Take, Osamu, et autres
Publié: (2024)
par: Take, Osamu, et autres
Publié: (2024)
HEAR: Hearing Enhanced Audio Response for Video-grounded Dialogue
par: Yoon, Sunjae, et autres
Publié: (2023)
par: Yoon, Sunjae, et autres
Publié: (2023)
Spatial Voice Conversion: Voice Conversion Preserving Spatial Information and Non-target Signals
par: Seki, Kentaro, et autres
Publié: (2024)
par: Seki, Kentaro, et autres
Publié: (2024)
JVNV: A Corpus of Japanese Emotional Speech with Verbal Content and Nonverbal Expressions
par: Xin, Detai, et autres
Publié: (2023)
par: Xin, Detai, et autres
Publié: (2023)
LALM-as-a-Judge: Benchmarking Large Audio-Language Models for Safety Evaluation in Multi-Turn Spoken Dialogues
par: Ivry, Amir, et autres
Publié: (2026)
par: Ivry, Amir, et autres
Publié: (2026)
DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset
par: Koudounas, Alkis, et autres
Publié: (2025)
par: Koudounas, Alkis, et autres
Publié: (2025)
AC/DC: LLM-based Audio Comprehension via Dialogue Continuation
par: Fujita, Yusuke, et autres
Publié: (2025)
par: Fujita, Yusuke, et autres
Publié: (2025)
LLM-Enhanced Dialogue Management for Full-Duplex Spoken Dialogue Systems
par: Zhang, Hao, et autres
Publié: (2025)
par: Zhang, Hao, et autres
Publié: (2025)
DialoSpeech: Dual-Speaker Dialogue Generation with LLM and Flow Matching
par: Xie, Hanke, et autres
Publié: (2025)
par: Xie, Hanke, et autres
Publié: (2025)
Noise-Robust Voice Conversion by Conditional Denoising Training Using Latent Variables of Recording Quality and Environment
par: Igarashi, Takuto, et autres
Publié: (2024)
par: Igarashi, Takuto, et autres
Publié: (2024)
SRC4VC: Smartphone-Recorded Corpus for Voice Conversion Benchmark
par: Saito, Yuki, et autres
Publié: (2024)
par: Saito, Yuki, et autres
Publié: (2024)
Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities
par: Kong, Zhifeng, et autres
Publié: (2024)
par: Kong, Zhifeng, et autres
Publié: (2024)
WavRAG: Audio-Integrated Retrieval Augmented Generation for Spoken Dialogue Models
par: Chen, Yifu, et autres
Publié: (2025)
par: Chen, Yifu, et autres
Publié: (2025)
Semantic-Aware Interruption Detection in Spoken Dialogue Systems: Benchmark, Metric, and Model
par: Xia, Kangxiang, et autres
Publié: (2026)
par: Xia, Kangxiang, et autres
Publié: (2026)
E-chat: Emotion-sensitive Spoken Dialogue System with Large Language Models
par: Xue, Hongfei, et autres
Publié: (2023)
par: Xue, Hongfei, et autres
Publié: (2023)
Binaural rendering from microphone array signals of arbitrary geometry
par: Iijima, Naoto, et autres
Publié: (2021)
par: Iijima, Naoto, et autres
Publié: (2021)
Shallow Flow Matching for Coarse-to-Fine Text-to-Speech Synthesis
par: Yang, Dong, et autres
Publié: (2025)
par: Yang, Dong, et autres
Publié: (2025)
Documents similaires
-
Causal Speech Enhancement with Predicting Semantics based on Quantized Self-supervised Learning Features
par: Tsunoo, Emiru, et autres
Publié: (2024) -
Sidon: Fast and Robust Open-Source Multilingual Speech Restoration for Large-scale Dataset Cleansing
par: Nakata, Wataru, et autres
Publié: (2025) -
J-CHAT: Japanese Large-scale Spoken Dialogue Corpus for Spoken Dialogue Language Modeling
par: Nakata, Wataru, et autres
Publié: (2024) -
Chain-of-Thought Reasoning in Streaming Full-Duplex End-to-End Spoken Dialogue Systems
par: Arora, Siddhant, et autres
Publié: (2025) -
Geneses: Unified Generative Speech Enhancement and Separation
par: Asai, Kohei, et autres
Publié: (2026)