DialogGraph-LLM: Graph-Informed LLMs for End-to-End Audio Dialogue Intent Recognition
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, HongYu, Li, Junxin, Guo, Changxi, Chen, Hao, Huang, Yaqian, Guo, Yifu, Yang, Huan, Cai, Lihua |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MSMT-FN: Multi-segment Multi-task Fusion Network for Marketing Audio Classification
par: Liu, HongYu, et autres
Publié: (2025)
par: Liu, HongYu, et autres
Publié: (2025)
VoxMind: An End-to-End Agentic Spoken Dialogue System
par: Liang, Tianle, et autres
Publié: (2026)
par: Liang, Tianle, et autres
Publié: (2026)
Ti-Audio: The First Multi-Dialectal End-to-End Speech LLM for Tibetan
par: Wang, Jialing, et autres
Publié: (2026)
par: Wang, Jialing, et autres
Publié: (2026)
Retrieval Augmented End-to-End Spoken Dialog Models
par: Wang, Mingqiu, et autres
Publié: (2024)
par: Wang, Mingqiu, et autres
Publié: (2024)
OSUM-EChat: Enhancing End-to-End Empathetic Spoken Chatbot via Understanding-Driven Spoken Dialogue
par: Geng, Xuelong, et autres
Publié: (2025)
par: Geng, Xuelong, et autres
Publié: (2025)
Predictive Speech Recognition and End-of-Utterance Detection Towards Spoken Dialog Systems
par: Zink, Oswald, et autres
Publié: (2024)
par: Zink, Oswald, et autres
Publié: (2024)
DGFNet: End-to-End Audio-Visual Source Separation Based on Dynamic Gating Fusion
par: Yu, Yinfeng, et autres
Publié: (2025)
par: Yu, Yinfeng, et autres
Publié: (2025)
End-to-end Acoustic-linguistic Emotion and Intent Recognition Enhanced by Semi-supervised Learning
par: Ren, Zhao, et autres
Publié: (2025)
par: Ren, Zhao, et autres
Publié: (2025)
Joint Learning Global-Local Speaker Classification to Enhance End-to-End Speaker Diarization and Recognition
par: Dai, Yuhang, et autres
Publié: (2026)
par: Dai, Yuhang, et autres
Publié: (2026)
Survey of End-to-End Multi-Speaker Automatic Speech Recognition for Monaural Audio
par: He, Xinlu, et autres
Publié: (2025)
par: He, Xinlu, et autres
Publié: (2025)
Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking
par: Vendrame, Katia, et autres
Publié: (2025)
par: Vendrame, Katia, et autres
Publié: (2025)
Time-Varying Audio Effect Modeling by End-to-End Adversarial Training
par: Bourdin, Yann, et autres
Publié: (2025)
par: Bourdin, Yann, et autres
Publié: (2025)
Reflecting Twice before Speaking with Empathy: Self-Reflective Alternating Inference for Empathy-Aware End-to-End Spoken Dialogue
par: Jia, Yuhang, et autres
Publié: (2026)
par: Jia, Yuhang, et autres
Publié: (2026)
End-to-End Supervised Hierarchical Graph Clustering for Speaker Diarization
par: Singh, Prachi, et autres
Publié: (2024)
par: Singh, Prachi, et autres
Publié: (2024)
A$^2$-LLM: An End-to-end Conversational Audio Avatar Large Language Model
par: Hu, Xiaolin, et autres
Publié: (2026)
par: Hu, Xiaolin, et autres
Publié: (2026)
Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model
par: Huang, Ailin, et autres
Publié: (2025)
par: Huang, Ailin, et autres
Publié: (2025)
UniLS: End-to-End Audio-Driven Avatars for Unified Listening and Speaking
par: Chu, Xuangeng, et autres
Publié: (2025)
par: Chu, Xuangeng, et autres
Publié: (2025)
SpeakerLM: End-to-End Versatile Speaker Diarization and Recognition with Multimodal Large Language Models
par: Yin, Han, et autres
Publié: (2025)
par: Yin, Han, et autres
Publié: (2025)
Diff-SAGe: End-to-End Spatial Audio Generation Using Diffusion Models
par: Kushwaha, Saksham Singh, et autres
Publié: (2024)
par: Kushwaha, Saksham Singh, et autres
Publié: (2024)
Quality-Aware End-to-End Audio-Visual Neural Speaker Diarization
par: He, Mao-Kui, et autres
Publié: (2024)
par: He, Mao-Kui, et autres
Publié: (2024)
RawBMamba: End-to-End Bidirectional State Space Model for Audio Deepfake Detection
par: Chen, Yujie, et autres
Publié: (2024)
par: Chen, Yujie, et autres
Publié: (2024)
audio2chart: End to End Audio Transcription into playable Guitar Hero charts
par: Tripodi, Riccardo
Publié: (2025)
par: Tripodi, Riccardo
Publié: (2025)
Speaker-Smoothed kNN Speaker Adaptation for End-to-End ASR
par: Li, Shaojun, et autres
Publié: (2024)
par: Li, Shaojun, et autres
Publié: (2024)
IKFST: IOO and KOO Algorithms for Accelerated and Precise WFST-based End-to-End Automatic Speech Recognition
par: Zhuang, Zhuoran, et autres
Publié: (2026)
par: Zhuang, Zhuoran, et autres
Publié: (2026)
Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction
par: Li, Tianpeng, et autres
Publié: (2025)
par: Li, Tianpeng, et autres
Publié: (2025)
Meta-Learning in Audio and Speech Processing: An End to End Comprehensive Review
par: Raimon, Athul, et autres
Publié: (2024)
par: Raimon, Athul, et autres
Publié: (2024)
Pushing the Limits of End-to-End Diarization
par: Broughton, Samuel J., et autres
Publié: (2025)
par: Broughton, Samuel J., et autres
Publié: (2025)
AV-Dialog: Spoken Dialogue Models with Audio-Visual Input
par: Chen, Tuochao, et autres
Publié: (2025)
par: Chen, Tuochao, et autres
Publié: (2025)
An End-to-End Speech Summarization Using Large Language Model
par: Shang, Hengchao, et autres
Publié: (2024)
par: Shang, Hengchao, et autres
Publié: (2024)
Chain-of-Thought Reasoning in Streaming Full-Duplex End-to-End Spoken Dialogue Systems
par: Arora, Siddhant, et autres
Publié: (2025)
par: Arora, Siddhant, et autres
Publié: (2025)
Post-decoder Biasing for End-to-End Speech Recognition of Multi-turn Medical Interview
par: Liu, Heyang, et autres
Publié: (2024)
par: Liu, Heyang, et autres
Publié: (2024)
Bridging Biological Hearing and Neuromorphic Computing: End-to-End Time-Domain Audio Signal Processing with Reservoir Computing
par: Sebastian, Rinku, et autres
Publié: (2026)
par: Sebastian, Rinku, et autres
Publié: (2026)
SynthVC: Leveraging Synthetic Data for End-to-End Low Latency Streaming Voice Conversion
par: Guo, Zhao, et autres
Publié: (2025)
par: Guo, Zhao, et autres
Publié: (2025)
Leveraging Synthetic Audio Data for End-to-End Low-Resource Speech Translation
par: Moslem, Yasmin
Publié: (2024)
par: Moslem, Yasmin
Publié: (2024)
FLY-TTS: Fast, Lightweight and High-Quality End-to-End Text-to-Speech Synthesis
par: Guo, Yinlin, et autres
Publié: (2024)
par: Guo, Yinlin, et autres
Publié: (2024)
Neural Scoring: A Refreshed End-to-End Approach for Speaker Recognition in Complex Conditions
par: Lin, Wan, et autres
Publié: (2024)
par: Lin, Wan, et autres
Publié: (2024)
We Can Hear You with mmWave Radar! An End-to-End Eavesdropping System
par: Han, Dachao, et autres
Publié: (2025)
par: Han, Dachao, et autres
Publié: (2025)
Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation
par: Chen, Yuheng, et autres
Publié: (2026)
par: Chen, Yuheng, et autres
Publié: (2026)
End-to-End Real-World Polyphonic Piano Audio-to-Score Transcription with Hierarchical Decoding
par: Zeng, Wei, et autres
Publié: (2024)
par: Zeng, Wei, et autres
Publié: (2024)
AudioJailbreak: Jailbreak Attacks against End-to-End Large Audio-Language Models
par: Chen, Guangke, et autres
Publié: (2025)
par: Chen, Guangke, et autres
Publié: (2025)
Documents similaires
-
MSMT-FN: Multi-segment Multi-task Fusion Network for Marketing Audio Classification
par: Liu, HongYu, et autres
Publié: (2025) -
VoxMind: An End-to-End Agentic Spoken Dialogue System
par: Liang, Tianle, et autres
Publié: (2026) -
Ti-Audio: The First Multi-Dialectal End-to-End Speech LLM for Tibetan
par: Wang, Jialing, et autres
Publié: (2026) -
Retrieval Augmented End-to-End Spoken Dialog Models
par: Wang, Mingqiu, et autres
Publié: (2024) -
OSUM-EChat: Enhancing End-to-End Empathetic Spoken Chatbot via Understanding-Driven Spoken Dialogue
par: Geng, Xuelong, et autres
Publié: (2025)