A Comprehensive Solution to Connect Speech Encoder and Large Language Model for ASR
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Pham, Van Tung, Lin, Yist, Han, Tao, Li, Wei, Zhang, Jun, Lu, Lu, Wang, Yuxuan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Moonshine v2: Ergodic Streaming Encoder ASR for Latency-Critical Speech Applications
par: Kudlur, Manjunath, et autres
Publié: (2026)
par: Kudlur, Manjunath, et autres
Publié: (2026)
Training Large ASR Encoders with Differential Privacy
par: Chauhan, Geeticka, et autres
Publié: (2024)
par: Chauhan, Geeticka, et autres
Publié: (2024)
Contrastive Regularization for Accent-Robust ASR
par: Thai, Van-Phat, et autres
Publié: (2026)
par: Thai, Van-Phat, et autres
Publié: (2026)
Tree-Structured Synergy of Large Language Models and Bayesian Optimization for Efficient CASH
par: Xu, Beicheng, et autres
Publié: (2026)
par: Xu, Beicheng, et autres
Publié: (2026)
SparseEval: Efficient Evaluation of Large Language Models by Sparse Optimization
par: Zhang, Taolin, et autres
Publié: (2026)
par: Zhang, Taolin, et autres
Publié: (2026)
DenseMamba: State Space Models with Dense Hidden Connection for Efficient Large Language Models
par: He, Wei, et autres
Publié: (2024)
par: He, Wei, et autres
Publié: (2024)
In-Sync: Adaptation of Speech Aware Large Language Models for ASR with Word Level Timestamp Predictions
par: Fan, Xulin, et autres
Publié: (2026)
par: Fan, Xulin, et autres
Publié: (2026)
CUPE: Contextless Universal Phoneme Encoder for Language-Agnostic Speech Processing
par: Rehman, Abdul, et autres
Publié: (2025)
par: Rehman, Abdul, et autres
Publié: (2025)
Large Language Model Compression via the Nested Activation-Aware Decomposition
par: Lu, Jun, et autres
Publié: (2025)
par: Lu, Jun, et autres
Publié: (2025)
Protein Large Language Models: A Comprehensive Survey
par: Xiao, Yijia, et autres
Publié: (2025)
par: Xiao, Yijia, et autres
Publié: (2025)
Arabic ASR on the SADA Large-Scale Arabic Speech Corpus with Transformer-Based Models
par: Gerazov, Branislav, et autres
Publié: (2025)
par: Gerazov, Branislav, et autres
Publié: (2025)
Edge-ASR: Towards Low-Bit Quantization of Automatic Speech Recognition Models
par: Feng, Chen, et autres
Publié: (2025)
par: Feng, Chen, et autres
Publié: (2025)
Large Language Models on Graphs: A Comprehensive Survey
par: Jin, Bowen, et autres
Publié: (2023)
par: Jin, Bowen, et autres
Publié: (2023)
Professional Network Matters: Connections Empower Person-Job Fit
par: Chen, Hao, et autres
Publié: (2023)
par: Chen, Hao, et autres
Publié: (2023)
Hypernetworks for Personalizing ASR to Atypical Speech
par: Müller-Eberstein, Max, et autres
Publié: (2024)
par: Müller-Eberstein, Max, et autres
Publié: (2024)
Learning Multiplex Representations on Text-Attributed Graphs with One Language Model Encoder
par: Jin, Bowen, et autres
Publié: (2023)
par: Jin, Bowen, et autres
Publié: (2023)
DecepChain: Inducing Deceptive Reasoning in Large Language Models
par: Shen, Wei, et autres
Publié: (2025)
par: Shen, Wei, et autres
Publié: (2025)
Phi: Preference Hijacking in Multi-modal Large Language Models at Inference Time
par: Lan, Yifan, et autres
Publié: (2025)
par: Lan, Yifan, et autres
Publié: (2025)
Speech Diarization and ASR with GMM
par: Sharma, Aayush Kumar, et autres
Publié: (2023)
par: Sharma, Aayush Kumar, et autres
Publié: (2023)
Uncertainty Quantification for Large Language Model Reward Learning under Heterogeneous Human Feedback
par: Liu, Pangpang, et autres
Publié: (2025)
par: Liu, Pangpang, et autres
Publié: (2025)
Secure Transfer Learning: Training Clean Models Against Backdoor in (Both) Pre-trained Encoders and Downstream Datasets
par: Zhang, Yechao, et autres
Publié: (2025)
par: Zhang, Yechao, et autres
Publié: (2025)
Fine-tuning Large Language Model for Automated Algorithm Design
par: Liu, Fei, et autres
Publié: (2025)
par: Liu, Fei, et autres
Publié: (2025)
ADO-LLM: Analog Design Bayesian Optimization with In-Context Learning of Large Language Models
par: Yin, Yuxuan, et autres
Publié: (2024)
par: Yin, Yuxuan, et autres
Publié: (2024)
Large Language Models Are Overparameterized Text Encoders
par: K, Thennal D, et autres
Publié: (2024)
par: K, Thennal D, et autres
Publié: (2024)
LLM Gesticulator: Leveraging Large Language Models for Scalable and Controllable Co-Speech Gesture Synthesis
par: Pang, Haozhou, et autres
Publié: (2024)
par: Pang, Haozhou, et autres
Publié: (2024)
Predicting Compact Phrasal Rewrites with Large Language Models for ASR Post Editing
par: Zhang, Hao, et autres
Publié: (2025)
par: Zhang, Hao, et autres
Publié: (2025)
Large Language Models as Generalist Policies for Network Optimization
par: Wu, Duo, et autres
Publié: (2025)
par: Wu, Duo, et autres
Publié: (2025)
Confidence Diagram of Nonparametric Ranking for Uncertainty Assessment in Large Language Models Evaluation
par: Wang, Zebin, et autres
Publié: (2024)
par: Wang, Zebin, et autres
Publié: (2024)
Large Language Model Inference Acceleration: A Comprehensive Hardware Perspective
par: Li, Jinhao, et autres
Publié: (2024)
par: Li, Jinhao, et autres
Publié: (2024)
Art and Science of Quantizing Large-Scale Models: A Comprehensive Overview
par: Wang, Yanshu, et autres
Publié: (2024)
par: Wang, Yanshu, et autres
Publié: (2024)
How to Connect Speech Foundation Models and Large Language Models? What Matters and What Does Not
par: Verdini, Francesco, et autres
Publié: (2024)
par: Verdini, Francesco, et autres
Publié: (2024)
Verbalized Graph Representation Learning: A Fully Interpretable Graph Model Based on Large Language Models Throughout the Entire Process
par: Ji, Xingyu, et autres
Publié: (2024)
par: Ji, Xingyu, et autres
Publié: (2024)
Knowledge Boundary Discovery for Large Language Models
par: Wang, Ziquan, et autres
Publié: (2026)
par: Wang, Ziquan, et autres
Publié: (2026)
Goal-Guided Efficient Exploration via Large Language Model in Reinforcement Learning
par: Qi, Yajie, et autres
Publié: (2025)
par: Qi, Yajie, et autres
Publié: (2025)
Character Beyond Speech: Leveraging Role-Playing Evaluation in Audio Large Language Models via Reinforcement Learning
par: Fu, Dongjie, et autres
Publié: (2026)
par: Fu, Dongjie, et autres
Publié: (2026)
Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet
par: Ying, Anyu, et autres
Publié: (2025)
par: Ying, Anyu, et autres
Publié: (2025)
Route Sparse Autoencoder to Interpret Large Language Models
par: Shi, Wei, et autres
Publié: (2025)
par: Shi, Wei, et autres
Publié: (2025)
Discrepancy-Aware Graph Mask Auto-Encoder
par: Zheng, Ziyu, et autres
Publié: (2025)
par: Zheng, Ziyu, et autres
Publié: (2025)
TernaryLLM: Ternarized Large Language Model
par: Chen, Tianqi, et autres
Publié: (2024)
par: Chen, Tianqi, et autres
Publié: (2024)
FedGuCci: Making Local Models More Connected in Landscape for Federated Learning
par: Li, Zexi, et autres
Publié: (2024)
par: Li, Zexi, et autres
Publié: (2024)
Documents similaires
-
Moonshine v2: Ergodic Streaming Encoder ASR for Latency-Critical Speech Applications
par: Kudlur, Manjunath, et autres
Publié: (2026) -
Training Large ASR Encoders with Differential Privacy
par: Chauhan, Geeticka, et autres
Publié: (2024) -
Contrastive Regularization for Accent-Robust ASR
par: Thai, Van-Phat, et autres
Publié: (2026) -
Tree-Structured Synergy of Large Language Models and Bayesian Optimization for Efficient CASH
par: Xu, Beicheng, et autres
Publié: (2026) -
SparseEval: Efficient Evaluation of Large Language Models by Sparse Optimization
par: Zhang, Taolin, et autres
Publié: (2026)