A Multimodal Approach to Device-Directed Speech Detection with Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wagner, Dominik, Churchill, Alexander, Sigtia, Siddharth, Georgiou, Panayiotis, Mirsamadi, Matt, Mishra, Aarshee, Marchi, Erik |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SELMA: A Speech-Enabled Language Model for Virtual Assistant Interactions
par: Wagner, Dominik, et autres
Publié: (2025)
par: Wagner, Dominik, et autres
Publié: (2025)
Large Language Models for Dysfluency Detection in Stuttered Speech
par: Wagner, Dominik, et autres
Publié: (2024)
par: Wagner, Dominik, et autres
Publié: (2024)
Towards Explainable Spoofed Speech Attribution and Detection:a Probabilistic Approach for Characterizing Speech Synthesizer Components
par: Mishra, Jagabandhu, et autres
Publié: (2025)
par: Mishra, Jagabandhu, et autres
Publié: (2025)
Multimodal Large Language Models with Fusion Low Rank Adaptation for Device Directed Speech Detection
par: Palaskar, Shruti, et autres
Publié: (2024)
par: Palaskar, Shruti, et autres
Publié: (2024)
Adapting Speech Foundation Models for Unified Multimodal Speech Recognition with Large Language Models
par: Zhang, Jing-Xuan, et autres
Publié: (2025)
par: Zhang, Jing-Xuan, et autres
Publié: (2025)
Outlier Reduction with Gated Attention for Improved Post-training Quantization in Large Sequence-to-sequence Speech Foundation Models
par: Wagner, Dominik, et autres
Publié: (2024)
par: Wagner, Dominik, et autres
Publié: (2024)
Vocoder-Free Non-Parallel Conversion of Whispered Speech With Masked Cycle-Consistent Generative Adversarial Networks
par: Wagner, Dominik, et autres
Publié: (2023)
par: Wagner, Dominik, et autres
Publié: (2023)
Adaptive Knowledge Distillation for Device-Directed Speech Detection
par: Chi, Hyung Gun, et autres
Publié: (2025)
par: Chi, Hyung Gun, et autres
Publié: (2025)
Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition
par: Xie, Jiamin, et autres
Publié: (2025)
par: Xie, Jiamin, et autres
Publié: (2025)
Leveraging Large Language Models for Sarcastic Speech Annotation in Sarcasm Detection
par: Li, Zhu, et autres
Publié: (2025)
par: Li, Zhu, et autres
Publié: (2025)
Heterogeneity over Homogeneity: Investigating Multilingual Speech Pre-Trained Models for Detecting Audio Deepfake
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
Device-Directed Speech Detection for Follow-up Conversations Using Large Language Models
par: Ognjen, et autres
Publié: (2024)
par: Ognjen, et autres
Publié: (2024)
Zero-Shot Recognition of Dysarthric Speech Using Commercial Automatic Speech Recognition and Multimodal Large Language Models
par: Alsayegh, Ali, et autres
Publié: (2025)
par: Alsayegh, Ali, et autres
Publié: (2025)
Fairness of Automatic Speech Recognition in Cleft Lip and Palate Speech
par: Bhattacharjee, Susmita, et autres
Publié: (2025)
par: Bhattacharjee, Susmita, et autres
Publié: (2025)
Multimodal Zero-Shot Framework for Deepfake Hate Speech Detection in Low-Resource Languages
par: Ranjan, Rishabh, et autres
Publié: (2025)
par: Ranjan, Rishabh, et autres
Publié: (2025)
Personalized Fine-Tuning with Controllable Synthetic Speech from LLM-Generated Transcripts for Dysarthric Speech Recognition
par: Wagner, Dominik, et autres
Publié: (2025)
par: Wagner, Dominik, et autres
Publié: (2025)
Predicting Cognitive Decline: A Multimodal AI Approach to Dementia Screening from Speech
par: Chi, Lei, et autres
Publié: (2025)
par: Chi, Lei, et autres
Publié: (2025)
A Survey on Speech Large Language Models for Understanding
par: Peng, Jing, et autres
Publié: (2024)
par: Peng, Jing, et autres
Publié: (2024)
Fusion of Modulation Spectrogram and SSL with Multi-head Attention for Fake Speech Detection
par: N, Rishith Sadashiv T, et autres
Publié: (2025)
par: N, Rishith Sadashiv T, et autres
Publié: (2025)
An Explainable Probabilistic Attribute Embedding Approach for Spoofed Speech Characterization
par: Chhibber, Manasi, et autres
Publié: (2024)
par: Chhibber, Manasi, et autres
Publié: (2024)
Leveraging Cascaded Binary Classification and Multimodal Fusion for Dementia Detection through Spontaneous Speech
par: Liu, Yin-Long, et autres
Publié: (2025)
par: Liu, Yin-Long, et autres
Publié: (2025)
M$^{3}$V: A multi-modal multi-view approach for Device-Directed Speech Detection
par: Wang, Anna, et autres
Publié: (2024)
par: Wang, Anna, et autres
Publié: (2024)
Group Relative Policy Optimization for Text-to-Speech with Large Language Models
par: Liu, Chang, et autres
Publié: (2025)
par: Liu, Chang, et autres
Publié: (2025)
Large Language Model Guided Decoding for Self-Supervised Speech Recognition
par: Cohen, Eyal, et autres
Publié: (2025)
par: Cohen, Eyal, et autres
Publié: (2025)
Advancing Zero-Shot Open-Set Speech Deepfake Source Tracing
par: Chhibber, Manasi, et autres
Publié: (2025)
par: Chhibber, Manasi, et autres
Publié: (2025)
Distributed Asynchronous Device Speech Enhancement via Windowed Cross-Attention
par: Yang, Gene-Ping, et autres
Publié: (2025)
par: Yang, Gene-Ping, et autres
Publié: (2025)
Direct Preference Optimization for Speech Autoregressive Diffusion Models
par: Liu, Zhijun, et autres
Publié: (2025)
par: Liu, Zhijun, et autres
Publié: (2025)
RLBR: Reinforcement Learning with Biasing Rewards for Contextual Speech Large Language Models
par: Ren, Bo, et autres
Publié: (2026)
par: Ren, Bo, et autres
Publié: (2026)
ToneUnit: A Speech Discretization Approach for Tonal Language Speech Synthesis
par: Tao, Dehua, et autres
Publié: (2024)
par: Tao, Dehua, et autres
Publié: (2024)
Towards Frame-level Quality Predictions of Synthetic Speech
par: Kuhlmann, Michael, et autres
Publié: (2025)
par: Kuhlmann, Michael, et autres
Publié: (2025)
Spatial Audio Processing with Large Language Model on Wearable Devices
par: Mishra, Ayushi, et autres
Publié: (2025)
par: Mishra, Ayushi, et autres
Publié: (2025)
Joint Training of Speaker Embedding Extractor, Speech and Overlap Detection for Diarization
par: Pálka, Petr, et autres
Publié: (2024)
par: Pálka, Petr, et autres
Publié: (2024)
Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models
par: Lin, Yuke, et autres
Publié: (2025)
par: Lin, Yuke, et autres
Publié: (2025)
Disentangling Pitch and Creak for Speaker Identity Preservation in Speech Synthesis
par: Rautenberg, Frederik, et autres
Publié: (2026)
par: Rautenberg, Frederik, et autres
Publié: (2026)
Device Feature based on Graph Fourier Transformation with Logarithmic Processing For Detection of Replay Speech Attacks
par: He, Mingrui, et autres
Publié: (2024)
par: He, Mingrui, et autres
Publié: (2024)
Speech Quality Embeddings for Improved Detection and Classification of Degradations in Speech Signals
par: Kuhlmann, Michael, et autres
Publié: (2026)
par: Kuhlmann, Michael, et autres
Publié: (2026)
Speech Quality-Based Localization of Low-Quality Speech and Text-to-Speech Synthesis Artefacts
par: Kuhlmann, Michael, et autres
Publié: (2026)
par: Kuhlmann, Michael, et autres
Publié: (2026)
Aligning Speech to Languages to Enhance Code-switching Speech Recognition
par: Liu, Hexin, et autres
Publié: (2024)
par: Liu, Hexin, et autres
Publié: (2024)
Post-training for Deepfake Speech Detection
par: Ge, Wanying, et autres
Publié: (2025)
par: Ge, Wanying, et autres
Publié: (2025)
Multimodal Assessment of Speech Impairment in ALS Using Audio-Visual and Machine Learning Approaches
par: Pierotti, Francesco, et autres
Publié: (2025)
par: Pierotti, Francesco, et autres
Publié: (2025)
Documents similaires
-
SELMA: A Speech-Enabled Language Model for Virtual Assistant Interactions
par: Wagner, Dominik, et autres
Publié: (2025) -
Large Language Models for Dysfluency Detection in Stuttered Speech
par: Wagner, Dominik, et autres
Publié: (2024) -
Towards Explainable Spoofed Speech Attribution and Detection:a Probabilistic Approach for Characterizing Speech Synthesizer Components
par: Mishra, Jagabandhu, et autres
Publié: (2025) -
Multimodal Large Language Models with Fusion Low Rank Adaptation for Device Directed Speech Detection
par: Palaskar, Shruti, et autres
Publié: (2024) -
Adapting Speech Foundation Models for Unified Multimodal Speech Recognition with Large Language Models
par: Zhang, Jing-Xuan, et autres
Publié: (2025)