Distilling Conversations: Abstract Compression of Conversational Audio Context for LLM-based ASR
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kumar, Shashi, Villatoro-Tello, Esaú, Burdisso, Sergio, Hacioglu, Kadri, Bañeras-Roux, Thibault, Watawana, Hasindri, Sanchez-Cortes, Dairazalia, Madikeri, Srikanth, Motlicek, Petr, Stolcke, Andreas |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Closing the Speech-Text Gap with Limited Audio for Effective Domain Adaptation in LLM-Based ASR
par: Bañeras-Roux, Thibault, et autres
Publié: (2026)
par: Bañeras-Roux, Thibault, et autres
Publié: (2026)
Node-weighted Graph Convolutional Network for Depression Detection in Transcribed Clinical Interviews
par: Burdisso, Sergio, et autres
Publié: (2023)
par: Burdisso, Sergio, et autres
Publié: (2023)
Text-only adaptation in LLM-based ASR through text denoising
par: Carofilis, Andrés, et autres
Publié: (2026)
par: Carofilis, Andrés, et autres
Publié: (2026)
Reliability Estimation of News Media Sources: Birds of a Feather Flock Together
par: Burdisso, Sergio, et autres
Publié: (2024)
par: Burdisso, Sergio, et autres
Publié: (2024)
Mapping the Media Landscape: Predicting Factual Reporting and Political Bias Through Web Interactions
par: Sánchez-Cortés, Dairazalia, et autres
Publié: (2024)
par: Sánchez-Cortés, Dairazalia, et autres
Publié: (2024)
Reducing Prompt Sensitivity in LLM-based Speech Recognition Through Learnable Projection
par: Burdisso, Sergio, et autres
Publié: (2026)
par: Burdisso, Sergio, et autres
Publié: (2026)
Better Semi-supervised Learning for Multi-domain ASR Through Incremental Retraining and Data Filtering
par: Carofilis, Andres, et autres
Publié: (2025)
par: Carofilis, Andres, et autres
Publié: (2025)
Efficient Data Selection for Domain Adaptation of ASR Using Pseudo-Labels and Multi-Stage Filtering
par: Rangappa, Pradeep, et autres
Publié: (2025)
par: Rangappa, Pradeep, et autres
Publié: (2025)
TokenVerse++: Towards Flexible Multitask Learning with Dynamic Task Activation
par: Kumar, Shashi, et autres
Publié: (2025)
par: Kumar, Shashi, et autres
Publié: (2025)
Performance evaluation of SLAM-ASR: The Good, the Bad, the Ugly, and the Way Forward
par: Kumar, Shashi, et autres
Publié: (2024)
par: Kumar, Shashi, et autres
Publié: (2024)
Unifying Global and Near-Context Biasing in a Single Trie Pass
par: Thorbecke, Iuliia, et autres
Publié: (2024)
par: Thorbecke, Iuliia, et autres
Publié: (2024)
TokenVerse: Towards Unifying Speech and NLP Tasks via Transducer-based ASR
par: Kumar, Shashi, et autres
Publié: (2024)
par: Kumar, Shashi, et autres
Publié: (2024)
Dialog2Flow: Pre-training Soft-Contrastive Action-Driven Sentence Embeddings for Automatic Dialog Flow Extraction
par: Burdisso, Sergio, et autres
Publié: (2024)
par: Burdisso, Sergio, et autres
Publié: (2024)
XLSR-Transducer: Streaming ASR for Self-Supervised Pretrained Models
par: Kumar, Shashi, et autres
Publié: (2024)
par: Kumar, Shashi, et autres
Publié: (2024)
When Consistency Becomes Bias: Interviewer Effects in Semi-Structured Clinical Interviews
par: Watawana, Hasindri, et autres
Publié: (2026)
par: Watawana, Hasindri, et autres
Publié: (2026)
Fast Streaming Transducer ASR Prototyping via Knowledge Distillation with Whisper
par: Thorbecke, Iuliia, et autres
Publié: (2024)
par: Thorbecke, Iuliia, et autres
Publié: (2024)
SDialog: A Python Toolkit for End-to-End Agent Building, User Simulation, Dialog Generation, and Evaluation
par: Burdisso, Sergio, et autres
Publié: (2025)
par: Burdisso, Sergio, et autres
Publié: (2025)
Evaluation of Automatic Speech Recognition Using Generative Large Language Models
par: Bañeras-Roux, Thibault, et autres
Publié: (2026)
par: Bañeras-Roux, Thibault, et autres
Publié: (2026)
SDialog: A Python Toolkit for End-to-End Agent Building, User Simulation, Dialog Generation, and Evaluation
par: Burdisso, Sergio, et autres
Publié: (2025)
par: Burdisso, Sergio, et autres
Publié: (2025)
DAIC-WOZ: On the Validity of Using the Therapist's prompts in Automatic Depression Detection from Clinical Interviews
par: Burdisso, Sergio, et autres
Publié: (2024)
par: Burdisso, Sergio, et autres
Publié: (2024)
IDIAPers @ Causal News Corpus 2022: Efficient Causal Relation Identification Through a Prompt-based Few-shot Approach
par: Burdisso, Sergio, et autres
Publié: (2022)
par: Burdisso, Sergio, et autres
Publié: (2022)
Effectiveness of Text, Acoustic, and Lattice-based representations in Spoken Language Understanding tasks
par: Villatoro-Tello, Esaú, et autres
Publié: (2022)
par: Villatoro-Tello, Esaú, et autres
Publié: (2022)
A Probabilistic Method for Ranking Refinementin Geographic Information Retrieval
par: Esaú Villatoro-Tello
Publié: (2010)
par: Esaú Villatoro-Tello
Publié: (2010)
Adaptive Multimodal Person Recognition: A Robust Framework for Handling Missing Modalities
par: Farhadipour, Aref, et autres
Publié: (2025)
par: Farhadipour, Aref, et autres
Publié: (2025)
SpeechLLMs for Large-scale Contextualized Zero-shot Slot Filling
par: Hacioglu, Kadri, et autres
Publié: (2025)
par: Hacioglu, Kadri, et autres
Publié: (2025)
Slot Filling as a Reasoning Task for SpeechLLMs
par: Hacioglu, Kadri, et autres
Publié: (2025)
par: Hacioglu, Kadri, et autres
Publié: (2025)
Better Pseudo-labeling with Multi-ASR Fusion and Error Correction by SpeechLLM
par: Prakash, Jeena, et autres
Publié: (2025)
par: Prakash, Jeena, et autres
Publié: (2025)
Generating Synthetic Doctor-Patient Conversations for Long-form Audio Summarization
par: Labrak, Yanis, et autres
Publié: (2026)
par: Labrak, Yanis, et autres
Publié: (2026)
Doctor or Patient? Synergizing Diarization and ASR for Code-Switched Hinglish Medical Conditions Extraction
par: Baroudi, Séverin, et autres
Publié: (2026)
par: Baroudi, Séverin, et autres
Publié: (2026)
Improving endpoint detection in end-to-end streaming ASR for conversational speech
par: C, Anandh, et autres
Publié: (2025)
par: C, Anandh, et autres
Publié: (2025)
Estimación de actividad de trabajadores hospitalarios con modelos ocultos de Markov
par: Dairazalia Sánchez Cortés
Publié: (2007)
par: Dairazalia Sánchez Cortés
Publié: (2007)
A Paradigm for Interpreting Metrics and Identifying Critical Errors in Automatic Speech Recognition
par: Bañeras-Roux, Thibault, et autres
Publié: (2026)
par: Bañeras-Roux, Thibault, et autres
Publié: (2026)
A Comprehensive Analysis of Tokenization and Self-Supervised Learning in End-to-End Automatic Speech Recognition applied on French Language
par: Bañeras-Roux, Thibault, et autres
Publié: (2026)
par: Bañeras-Roux, Thibault, et autres
Publié: (2026)
Qualitative Evaluation of Language Model Rescoring in Automatic Speech Recognition
par: Bañeras-Roux, Thibault, et autres
Publié: (2026)
par: Bañeras-Roux, Thibault, et autres
Publié: (2026)
A Differentiable Alignment Framework for Sequence-to-Sequence Modeling via Optimal Transport
par: Kaloga, Yacouba, et autres
Publié: (2025)
par: Kaloga, Yacouba, et autres
Publié: (2025)
HATS: An Open data set Integrating Human Perception Applied to the Evaluation of Automatic Speech Recognition Metrics
par: Roux, Thibault Bañeras, et autres
Publié: (2026)
par: Roux, Thibault Bañeras, et autres
Publié: (2026)
Hierarchical Text-to-Vision Self Supervised Alignment for Improved Histopathology Representation Learning
par: Watawana, Hasindri, et autres
Publié: (2024)
par: Watawana, Hasindri, et autres
Publié: (2024)
Latent Space Factorization in LoRA
par: Kumar, Shashi, et autres
Publié: (2025)
par: Kumar, Shashi, et autres
Publié: (2025)
Geometric Latent Reasoning Induces Shorter Generations in LLMs
par: Kumar, Shashi, et autres
Publié: (2026)
par: Kumar, Shashi, et autres
Publié: (2026)
Temporal fine-tuning for early risk detection
par: Thompson, Horacio, et autres
Publié: (2025)
par: Thompson, Horacio, et autres
Publié: (2025)
Documents similaires
-
Closing the Speech-Text Gap with Limited Audio for Effective Domain Adaptation in LLM-Based ASR
par: Bañeras-Roux, Thibault, et autres
Publié: (2026) -
Node-weighted Graph Convolutional Network for Depression Detection in Transcribed Clinical Interviews
par: Burdisso, Sergio, et autres
Publié: (2023) -
Text-only adaptation in LLM-based ASR through text denoising
par: Carofilis, Andrés, et autres
Publié: (2026) -
Reliability Estimation of News Media Sources: Birds of a Feather Flock Together
par: Burdisso, Sergio, et autres
Publié: (2024) -
Mapping the Media Landscape: Predicting Factual Reporting and Political Bias Through Web Interactions
par: Sánchez-Cortés, Dairazalia, et autres
Publié: (2024)