Multimodal Large Language Models with Fusion Low Rank Adaptation for Device Directed Speech Detection
Fuente:
arXiv
Salvato in:
| Autori principali: | Palaskar, Shruti, Rudovic, Oggi, Dharur, Sameer, Pesce, Florian, Krishna, Gautam, Sivaraman, Aswin, Berkowitz, Jack, Abdelaziz, Ahmed Hussen, Adya, Saurabh, Tewfik, Ahmed |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Device-Directed Speech Detection for Follow-up Conversations Using Large Language Models
di: Ognjen, et al.
Pubblicazione: (2024)
di: Ognjen, et al.
Pubblicazione: (2024)
Adaptive Knowledge Distillation for Device-Directed Speech Detection
di: Chi, Hyung Gun, et al.
Pubblicazione: (2025)
di: Chi, Hyung Gun, et al.
Pubblicazione: (2025)
Comparative Analysis of Personalized Voice Activity Detection Systems: Assessing Real-World Effectiveness
di: Kumar, Satyam, et al.
Pubblicazione: (2024)
di: Kumar, Satyam, et al.
Pubblicazione: (2024)
Streaming Anchor Loss: Augmenting Supervision with Temporal Significance
di: Sarawgi, Utkarsh Oggy, et al.
Pubblicazione: (2023)
di: Sarawgi, Utkarsh Oggy, et al.
Pubblicazione: (2023)
DiceHuBERT: Distilling HuBERT with a Self-Supervised Learning Objective
di: Chi, Hyung Gun, et al.
Pubblicazione: (2025)
di: Chi, Hyung Gun, et al.
Pubblicazione: (2025)
SafetyPairs: Isolating Safety Critical Image Features with Counterfactual Image Generation
di: Helbling, Alec, et al.
Pubblicazione: (2025)
di: Helbling, Alec, et al.
Pubblicazione: (2025)
TalkLoRA: Low-Rank Adaptation for Speech-Driven Animation
di: Saunders, Jack, et al.
Pubblicazione: (2024)
di: Saunders, Jack, et al.
Pubblicazione: (2024)
A Variational Framework for Improving Naturalness in Generative Spoken Language Models
di: Chen, Li-Wei, et al.
Pubblicazione: (2025)
di: Chen, Li-Wei, et al.
Pubblicazione: (2025)
Cross-Attention Fusion of Visual and Geometric Features for Large Vocabulary Arabic Lipreading
di: Daou, Samar, et al.
Pubblicazione: (2024)
di: Daou, Samar, et al.
Pubblicazione: (2024)
Entropy-Aligned Decoding of LMs for Better Writing and Reasoning
di: Ahmed, Kareem, et al.
Pubblicazione: (2026)
di: Ahmed, Kareem, et al.
Pubblicazione: (2026)
DLRMamba: Distilling Low-Rank Mamba for Edge Multispectral Fusion Object Detection
di: Zhang, Qianqian, et al.
Pubblicazione: (2026)
di: Zhang, Qianqian, et al.
Pubblicazione: (2026)
MTLoRA: A Low-Rank Adaptation Approach for Efficient Multi-Task Learning
di: Agiza, Ahmed, et al.
Pubblicazione: (2024)
di: Agiza, Ahmed, et al.
Pubblicazione: (2024)
Navigating Dialectal Bias and Ethical Complexities in Levantine Arabic Hate Speech Detection
di: Ahmed, Ahmed Haj, et al.
Pubblicazione: (2024)
di: Ahmed, Ahmed Haj, et al.
Pubblicazione: (2024)
LLM-to-Speech: A Synthetic Data Pipeline for Training Dialectal Text-to-Speech Models
di: Khamis, Ahmed Khaled, et al.
Pubblicazione: (2026)
di: Khamis, Ahmed Khaled, et al.
Pubblicazione: (2026)
R2 Loss: Range Restriction Loss for Model Compression and Quantization
di: Kundu, Arnav, et al.
Pubblicazione: (2023)
di: Kundu, Arnav, et al.
Pubblicazione: (2023)
Explicit Grammar Semantic Feature Fusion for Robust Text Classification
di: Sultana, Azrin, et al.
Pubblicazione: (2026)
di: Sultana, Azrin, et al.
Pubblicazione: (2026)
StructFusionNet: Structural Feature Fusion in CNNs for Handwritten
di: Loay Alzubaidi, et al.
Pubblicazione: (2026)
di: Loay Alzubaidi, et al.
Pubblicazione: (2026)
GNN-MoE: Context-Aware Patch Routing using GNNs for Parameter-Efficient Domain Generalization
di: Soliman, Mahmoud, et al.
Pubblicazione: (2025)
di: Soliman, Mahmoud, et al.
Pubblicazione: (2025)
Speculative Speech Recognition by Audio-Prefixed Low-Rank Adaptation of Language Models
di: Yusuf, Bolaji, et al.
Pubblicazione: (2024)
di: Yusuf, Bolaji, et al.
Pubblicazione: (2024)
Handling Device Heterogeneity for Deep Learning-based Localization
di: Shokry, Ahmed, et al.
Pubblicazione: (2024)
di: Shokry, Ahmed, et al.
Pubblicazione: (2024)
Bridging Topology and Deep Representation Learning: A TDA-ViT Fusion Model for Four-Class Brain Tumor Classification
di: Ahmed, Faisal
Pubblicazione: (2026)
di: Ahmed, Faisal
Pubblicazione: (2026)
RaSA: Rank-Sharing Low-Rank Adaptation
di: He, Zhiwei, et al.
Pubblicazione: (2025)
di: He, Zhiwei, et al.
Pubblicazione: (2025)
Training Acceleration of Low-Rank Decomposed Networks using Sequential Freezing and Rank Quantization
di: Hajimolahoseini, Habib, et al.
Pubblicazione: (2023)
di: Hajimolahoseini, Habib, et al.
Pubblicazione: (2023)
Hybrid Topological and Deep Feature Fusion for Accurate MRI-Based Alzheimer's Disease Severity Classification
di: Ahmed, Faisal
Pubblicazione: (2026)
di: Ahmed, Faisal
Pubblicazione: (2026)
Investigating Training Strategies and Model Robustness of Low-Rank Adaptation for Language Modeling in Speech Recognition
di: Yu, Yu, et al.
Pubblicazione: (2024)
di: Yu, Yu, et al.
Pubblicazione: (2024)
Articulation-Informed ASR: Integrating Articulatory Features into ASR via Auxiliary Speech Inversion and Cross-Attention Fusion
di: Attia, Ahmed Adel, et al.
Pubblicazione: (2025)
di: Attia, Ahmed Adel, et al.
Pubblicazione: (2025)
VLSU: Mapping the Limits of Joint Multimodal Understanding for AI Safety
di: Palaskar, Shruti, et al.
Pubblicazione: (2025)
di: Palaskar, Shruti, et al.
Pubblicazione: (2025)
Multilingual Extraction and Recognition of Implicit Discourse Relations in Speech and Text
di: Ruby, Ahmed, et al.
Pubblicazione: (2026)
di: Ruby, Ahmed, et al.
Pubblicazione: (2026)
Ranking Manipulation for Conversational Search Engines
di: Pfrommer, Samuel, et al.
Pubblicazione: (2024)
di: Pfrommer, Samuel, et al.
Pubblicazione: (2024)
Controllable Safety Alignment: Inference-Time Adaptation to Diverse Safety Requirements
di: Zhang, Jingyu, et al.
Pubblicazione: (2024)
di: Zhang, Jingyu, et al.
Pubblicazione: (2024)
Computing in complete local equicharacteristic Noetherian rings via topological rewriting on commutative formal power series
di: Musson-Leymarie, Adya
Pubblicazione: (2025)
di: Musson-Leymarie, Adya
Pubblicazione: (2025)
Overcoming Latency Bottlenecks in On-Device Speech Translation: A Cascaded Approach with Alignment-Based Streaming MT
di: Ahmed, Zeeshan, et al.
Pubblicazione: (2025)
di: Ahmed, Zeeshan, et al.
Pubblicazione: (2025)
Speech Recognition Transformers: Topological-lingualism Perspective
di: Singh, Shruti, et al.
Pubblicazione: (2024)
di: Singh, Shruti, et al.
Pubblicazione: (2024)
CoLA: Cross-Modal Low-rank Adaptation for Multimodal Downstream Tasks
di: Suharitdamrong, Wish, et al.
Pubblicazione: (2026)
di: Suharitdamrong, Wish, et al.
Pubblicazione: (2026)
Automated ARAT Scoring Using Multimodal Video Analysis, Multi-View Fusion, and Hierarchical Bayesian Models: A Clinician Study
di: Ahmed, Tamim, et al.
Pubblicazione: (2025)
di: Ahmed, Tamim, et al.
Pubblicazione: (2025)
Accelerating the Low-Rank Decomposed Models
di: Hajimolahoseini, Habib, et al.
Pubblicazione: (2024)
di: Hajimolahoseini, Habib, et al.
Pubblicazione: (2024)
The Energy of Falsehood: Detecting Hallucinations via Diffusion Model Likelihoods
di: Gautam, Arpit Singh, et al.
Pubblicazione: (2026)
di: Gautam, Arpit Singh, et al.
Pubblicazione: (2026)
CRAFT-LoRA: Content-Style Personalization via Rank-Constrained Adaptation and Training-Free Fusion
di: Li, Yu, et al.
Pubblicazione: (2026)
di: Li, Yu, et al.
Pubblicazione: (2026)
Robust Building Damage Detection in Cross-Disaster Settings Using Domain Adaptation
di: Mouradi, Asmae, et al.
Pubblicazione: (2026)
di: Mouradi, Asmae, et al.
Pubblicazione: (2026)
A Lightweight Vision-Language Fusion Framework for Predicting App Ratings from User Interfaces and Metadata
di: Sultana, Azrin, et al.
Pubblicazione: (2026)
di: Sultana, Azrin, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Device-Directed Speech Detection for Follow-up Conversations Using Large Language Models
di: Ognjen, et al.
Pubblicazione: (2024) -
Adaptive Knowledge Distillation for Device-Directed Speech Detection
di: Chi, Hyung Gun, et al.
Pubblicazione: (2025) -
Comparative Analysis of Personalized Voice Activity Detection Systems: Assessing Real-World Effectiveness
di: Kumar, Satyam, et al.
Pubblicazione: (2024) -
Streaming Anchor Loss: Augmenting Supervision with Temporal Significance
di: Sarawgi, Utkarsh Oggy, et al.
Pubblicazione: (2023) -
DiceHuBERT: Distilling HuBERT with a Self-Supervised Learning Objective
di: Chi, Hyung Gun, et al.
Pubblicazione: (2025)