Towards Signal Processing In Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Verma, Prateek, Pilanci, Mert |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Adaptive Large Language Models By Layerwise Attention Shortcuts
par: Verma, Prateek, et autres
Publié: (2024)
par: Verma, Prateek, et autres
Publié: (2024)
Large Language Models Implicitly Learn to See and Hear Just By Reading
par: Verma, Prateek, et autres
Publié: (2025)
par: Verma, Prateek, et autres
Publié: (2025)
Thinking While Listening: Simple Test Time Scaling For Audio Classification
par: Verma, Prateek, et autres
Publié: (2025)
par: Verma, Prateek, et autres
Publié: (2025)
Whisper-GPT: A Hybrid Representation Audio Large Language Model
par: Verma, Prateek
Publié: (2024)
par: Verma, Prateek
Publié: (2024)
Wavelet GPT: Wavelet Inspired Large Language Models
par: Verma, Prateek
Publié: (2024)
par: Verma, Prateek
Publié: (2024)
Diverse Audio Embeddings -- Bringing Features Back Outperforms CLAP!
par: Verma, Prateek
Publié: (2023)
par: Verma, Prateek
Publié: (2023)
Spoken Language Intelligence of Large Language Models for Language Learning
par: Peng, Linkai, et autres
Publié: (2023)
par: Peng, Linkai, et autres
Publié: (2023)
A Language Model With Million Context Length For Raw Audio
par: Verma, Prateek
Publié: (2022)
par: Verma, Prateek
Publié: (2022)
Large Language Models' Internal Perception of Symbolic Music
par: Shin, Andrew, et autres
Publié: (2025)
par: Shin, Andrew, et autres
Publié: (2025)
Simultaneous Interpretation Corpus Construction by Large Language Models in Distant Language Pair
par: Sakai, Yusuke, et autres
Publié: (2024)
par: Sakai, Yusuke, et autres
Publié: (2024)
PhonologyBench: Evaluating Phonological Skills of Large Language Models
par: Suvarna, Ashima, et autres
Publié: (2024)
par: Suvarna, Ashima, et autres
Publié: (2024)
Decoding Poultry Vocalizations -- Natural Language Processing and Transformer Models for Semantic and Emotional Analysis
par: Manikandan, Venkatraman, et autres
Publié: (2024)
par: Manikandan, Venkatraman, et autres
Publié: (2024)
Audio Transformers
par: Verma, Prateek, et autres
Publié: (2021)
par: Verma, Prateek, et autres
Publié: (2021)
Content Adaptive Front End For Audio Classification
par: Verma, Prateek, et autres
Publié: (2023)
par: Verma, Prateek, et autres
Publié: (2023)
Large Language Models are Efficient Learners of Noise-Robust Speech Recognition
par: Hu, Yuchen, et autres
Publié: (2024)
par: Hu, Yuchen, et autres
Publié: (2024)
Turn-taking and Backchannel Prediction with Acoustic and Large Language Model Fusion
par: Wang, Jinhan, et autres
Publié: (2024)
par: Wang, Jinhan, et autres
Publié: (2024)
Towards Controllable Speech Synthesis in the Era of Large Language Models: A Systematic Survey
par: Xie, Tianxin, et autres
Publié: (2024)
par: Xie, Tianxin, et autres
Publié: (2024)
GenTranslate: Large Language Models are Generative Multilingual Speech and Machine Translators
par: Hu, Yuchen, et autres
Publié: (2024)
par: Hu, Yuchen, et autres
Publié: (2024)
SEAL: Speaker Error Correction using Acoustic-conditioned Large Language Models
par: Kumar, Anurag, et autres
Publié: (2025)
par: Kumar, Anurag, et autres
Publié: (2025)
C3LLM: Conditional Multimodal Content Generation Using Large Language Models
par: Wang, Zixuan, et autres
Publié: (2024)
par: Wang, Zixuan, et autres
Publié: (2024)
Generative Speech Recognition Error Correction with Large Language Models and Task-Activating Prompting
par: Yang, Chao-Han Huck, et autres
Publié: (2023)
par: Yang, Chao-Han Huck, et autres
Publié: (2023)
Walking Through Uncertainty: An Empirical Study of Uncertainty Estimation for Audio-Aware Large Language Models
par: Kuan, Chun-Yi, et autres
Publié: (2026)
par: Kuan, Chun-Yi, et autres
Publié: (2026)
Listen Again and Choose the Right Answer: A New Paradigm for Automatic Speech Recognition with Large Language Models
par: Hu, Yuchen, et autres
Publié: (2024)
par: Hu, Yuchen, et autres
Publié: (2024)
Large Language Model Based Generative Error Correction: A Challenge and Baselines for Speech Recognition, Speaker Tagging, and Emotion Recognition
par: Yang, Chao-Han Huck, et autres
Publié: (2024)
par: Yang, Chao-Han Huck, et autres
Publié: (2024)
What Do Language Models Hear? Probing for Auditory Representations in Language Models
par: Ngo, Jerry, et autres
Publié: (2024)
par: Ngo, Jerry, et autres
Publié: (2024)
AdaPTwin: Low-Cost Adaptive Compression of Product Twins in Transformers
par: Biju, Emil, et autres
Publié: (2024)
par: Biju, Emil, et autres
Publié: (2024)
Self-Taught Recognizer: Toward Unsupervised Adaptation for Speech Foundation Models
par: Hu, Yuchen, et autres
Publié: (2024)
par: Hu, Yuchen, et autres
Publié: (2024)
Advancing Speech Understanding in Speech-Aware Language Models with GRPO
par: Elmakies, Avishai, et autres
Publié: (2025)
par: Elmakies, Avishai, et autres
Publié: (2025)
Dynamic ASR Pathways: An Adaptive Masking Approach Towards Efficient Pruning of A Multilingual ASR Model
par: Xie, Jiamin, et autres
Publié: (2023)
par: Xie, Jiamin, et autres
Publié: (2023)
MERT: Acoustic Music Understanding Model with Large-Scale Self-supervised Training
par: Li, Yizhi, et autres
Publié: (2023)
par: Li, Yizhi, et autres
Publié: (2023)
A Variational Framework for Improving Naturalness in Generative Spoken Language Models
par: Chen, Li-Wei, et autres
Publié: (2025)
par: Chen, Li-Wei, et autres
Publié: (2025)
Audio-Reasoner: Improving Reasoning Capability in Large Audio Language Models
par: Xie, Zhifei, et autres
Publié: (2025)
par: Xie, Zhifei, et autres
Publié: (2025)
Imagine to Hear: Auditory Knowledge Generation can be an Effective Assistant for Language Models
par: Yoo, Suho, et autres
Publié: (2025)
par: Yoo, Suho, et autres
Publié: (2025)
Unsupervised Speech Segmentation: A General Approach Using Speech Language Models
par: Elmakies, Avishai, et autres
Publié: (2025)
par: Elmakies, Avishai, et autres
Publié: (2025)
Slamming: Training a Speech Language Model on One GPU in a Day
par: Maimon, Gallil, et autres
Publié: (2025)
par: Maimon, Gallil, et autres
Publié: (2025)
Joint Fine-tuning and Conversion of Pretrained Speech and Language Models towards Linear Complexity
par: He, Mutian, et autres
Publié: (2024)
par: He, Mutian, et autres
Publié: (2024)
Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models
par: Hsiao, Chi-Yuan, et autres
Publié: (2025)
par: Hsiao, Chi-Yuan, et autres
Publié: (2025)
RALL-E: Robust Codec Language Modeling with Chain-of-Thought Prompting for Text-to-Speech Synthesis
par: Xin, Detai, et autres
Publié: (2024)
par: Xin, Detai, et autres
Publié: (2024)
WavLLM: Towards Robust and Adaptive Speech Large Language Model
par: Hu, Shujie, et autres
Publié: (2024)
par: Hu, Shujie, et autres
Publié: (2024)
NGPU-LM: GPU-Accelerated N-Gram Language Model for Context-Biasing in Greedy ASR Decoding
par: Bataev, Vladimir, et autres
Publié: (2025)
par: Bataev, Vladimir, et autres
Publié: (2025)
Documents similaires
-
Adaptive Large Language Models By Layerwise Attention Shortcuts
par: Verma, Prateek, et autres
Publié: (2024) -
Large Language Models Implicitly Learn to See and Hear Just By Reading
par: Verma, Prateek, et autres
Publié: (2025) -
Thinking While Listening: Simple Test Time Scaling For Audio Classification
par: Verma, Prateek, et autres
Publié: (2025) -
Whisper-GPT: A Hybrid Representation Audio Large Language Model
par: Verma, Prateek
Publié: (2024) -
Wavelet GPT: Wavelet Inspired Large Language Models
par: Verma, Prateek
Publié: (2024)