Robust Training of Vector Quantized Bottleneck Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Łańcucki, Adrian, Chorowski, Jan, Sanchez, Guillaume, Marxer, Ricard, Chen, Nanxin, Dolfing, Hans J. G. A., Khurana, Sameer, Alumäe, Tanel, Laurent, Antoine |
|---|---|
| Format: | Preprint |
| Publié: |
2020
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
PixIT: Joint Training of Speaker Diarization and Speech Separation from Real-world Multi-speaker Recordings
par: Kalda, Joonas, et autres
Publié: (2024)
par: Kalda, Joonas, et autres
Publié: (2024)
Comparison of End-to-end Speech Assessment Models for the NOCASA 2025 Challenge
par: Žavoronkov, Aleksei, et autres
Publié: (2025)
par: Žavoronkov, Aleksei, et autres
Publié: (2025)
Estonian Native Large Language Model Benchmark
par: Lillepalu, Helena Grete, et autres
Publié: (2025)
par: Lillepalu, Helena Grete, et autres
Publié: (2025)
Contrastive prediction strategies for unsupervised segmentation and categorization of phonemes and words
par: Cuervo, Santiago, et autres
Publié: (2021)
par: Cuervo, Santiago, et autres
Publié: (2021)
TalTech Systems for the Interspeech 2025 ML-SUPERB 2.0 Challenge
par: Alumäe, Tanel, et autres
Publié: (2025)
par: Alumäe, Tanel, et autres
Publié: (2025)
Multi-Source Evidence Fusion for Audio Question Answering
par: Olev, Aivo, et autres
Publié: (2026)
par: Olev, Aivo, et autres
Publié: (2026)
Optimizing Estonian TV Subtitles with Semi-supervised Learning and LLMs
par: Fedorchenko, Artem, et autres
Publié: (2025)
par: Fedorchenko, Artem, et autres
Publié: (2025)
Finetuning End-to-End Models for Estonian Conversational Spoken Language Translation
par: Sildam, Tiia, et autres
Publié: (2024)
par: Sildam, Tiia, et autres
Publié: (2024)
Late Fusion and Multi-Level Fission Amplify Cross-Modal Transfer in Text-Speech LMs
par: Cuervo, Santiago, et autres
Publié: (2025)
par: Cuervo, Santiago, et autres
Publié: (2025)
Aligning Multimodal Representations through an Information Bottleneck
par: Almudévar, Antonio, et autres
Publié: (2025)
par: Almudévar, Antonio, et autres
Publié: (2025)
TalTech-IRIT-LIS Speaker and Language Diarization Systems for DISPLACE 2024
par: Kalda, Joonas, et autres
Publié: (2024)
par: Kalda, Joonas, et autres
Publié: (2024)
Aligned Contrastive Predictive Coding
par: Chorowski, Jan, et autres
Publié: (2021)
par: Chorowski, Jan, et autres
Publié: (2021)
Information Retrieval for ZeroSpeech 2021: The Submission by University of Wroclaw
par: Chorowski, Jan, et autres
Publié: (2021)
par: Chorowski, Jan, et autres
Publié: (2021)
Scaling Properties of Speech Language Models
par: Cuervo, Santiago, et autres
Publié: (2024)
par: Cuervo, Santiago, et autres
Publié: (2024)
KV Cache Transform Coding for Compact Storage in LLM Inference
par: Staniszewski, Konrad, et autres
Publié: (2025)
par: Staniszewski, Konrad, et autres
Publié: (2025)
Unveiling Audio Deepfake Origins: A Deep Metric learning And Conformer Network Approach With Ensemble Fusion
par: Kulkarni, Ajinkya, et autres
Publié: (2025)
par: Kulkarni, Ajinkya, et autres
Publié: (2025)
Do Compact SSL Backbones Matter for Audio Deepfake Detection? A Controlled Study with RAPTOR
par: Kulkarni, Ajinkya, et autres
Publié: (2026)
par: Kulkarni, Ajinkya, et autres
Publié: (2026)
Symbolic Grounding Reveals Representational Bottlenecks in Abstract Visual Reasoning
par: Vaishnav, Mohit, et autres
Publié: (2026)
par: Vaishnav, Mohit, et autres
Publié: (2026)
Transfer Learning from Whisper for Microscopic Intelligibility Prediction
par: Best, Paul, et autres
Publié: (2024)
par: Best, Paul, et autres
Publié: (2024)
Thermodynamic constraints on the window of opportunity for direct interspecies electron transfer (DIET)
par: Jan Dolfing
Publié: (2024)
par: Jan Dolfing
Publié: (2024)
VQ-Logits: Compressing the Output Bottleneck of Large Language Models via Vector Quantized Logits
par: Shao, Jintian, et autres
Publié: (2025)
par: Shao, Jintian, et autres
Publié: (2025)
Factorized RVQ-GAN For Disentangled Speech Tokenization
par: Khurana, Sameer, et autres
Publié: (2025)
par: Khurana, Sameer, et autres
Publié: (2025)
EstLLM: Enhancing Estonian Capabilities in Multilingual LLMs via Continued Pretraining and Post-Training
par: Dorkin, Aleksei, et autres
Publié: (2026)
par: Dorkin, Aleksei, et autres
Publié: (2026)
Inference-Time Hyper-Scaling with KV Cache Compression
par: Łańcucki, Adrian, et autres
Publié: (2025)
par: Łańcucki, Adrian, et autres
Publié: (2025)
Deep Learning Classification With Noisy Labels
par: Sanchez, Guillaume, et autres
Publié: (2020)
par: Sanchez, Guillaume, et autres
Publié: (2020)
Improved Cross-Lingual Transfer Learning For Automatic Speech Translation
par: Khurana, Sameer, et autres
Publié: (2023)
par: Khurana, Sameer, et autres
Publié: (2023)
Dynamic Memory Compression: Retrofitting LLMs for Accelerated Inference
par: Nawrot, Piotr, et autres
Publié: (2024)
par: Nawrot, Piotr, et autres
Publié: (2024)
ShifaMind: A Multiplicative Concept Bottleneck for Interpretable ICD-10 Coding
par: Syed, Mohammed Sameer, et autres
Publié: (2026)
par: Syed, Mohammed Sameer, et autres
Publié: (2026)
Speech DF Arena: A Leaderboard for Speech DeepFake Detection Models
par: Dowerah, Sandipana, et autres
Publié: (2025)
par: Dowerah, Sandipana, et autres
Publié: (2025)
Speech foundation models on intelligibility prediction for hearing-impaired listeners
par: Cuervo, Santiago, et autres
Publié: (2024)
par: Cuervo, Santiago, et autres
Publié: (2024)
Quantized Embedding Vectors for Controllable Diffusion Language Models
par: Kang, Cheng, et autres
Publié: (2024)
par: Kang, Cheng, et autres
Publié: (2024)
Fair-GPTQ: Bias-Aware Quantization for Large Language Models
par: Proskurina, Irina, et autres
Publié: (2025)
par: Proskurina, Irina, et autres
Publié: (2025)
Translation from the Information Bottleneck Perspective: an Efficiency Analysis of Spatial Prepositions in Bitexts
par: Taroni, Antoine, et autres
Publié: (2026)
par: Taroni, Antoine, et autres
Publié: (2026)
Outlier-Safe Pre-Training for Robust 4-Bit Quantization of Large Language Models
par: Park, Jungwoo, et autres
Publié: (2025)
par: Park, Jungwoo, et autres
Publié: (2025)
RSAVQ: Riemannian Sensitivity-Aware Vector Quantization for Large Language Models
par: Xu, Zukang, et autres
Publié: (2025)
par: Xu, Zukang, et autres
Publié: (2025)
When Quantization Affects Confidence of Large Language Models?
par: Proskurina, Irina, et autres
Publié: (2024)
par: Proskurina, Irina, et autres
Publié: (2024)
Breaking Training Bottlenecks: Effective and Stable Reinforcement Learning for Coding Models
par: Li, Zongqian, et autres
Publié: (2026)
par: Li, Zongqian, et autres
Publié: (2026)
DefVerify: Do Hate Speech Models Reflect Their Dataset's Definition?
par: Khurana, Urja, et autres
Publié: (2024)
par: Khurana, Urja, et autres
Publié: (2024)
Cross-Modal Robustness Transfer (CMRT): Training Robust Speech Translation Models Using Adversarial Text
par: Issam, Abderrahmane, et autres
Publié: (2026)
par: Issam, Abderrahmane, et autres
Publié: (2026)
Revisiting Adaptive Rounding with Vectorized Reparameterization for LLM Quantization
par: Zhou, Yuli, et autres
Publié: (2026)
par: Zhou, Yuli, et autres
Publié: (2026)
Documents similaires
-
PixIT: Joint Training of Speaker Diarization and Speech Separation from Real-world Multi-speaker Recordings
par: Kalda, Joonas, et autres
Publié: (2024) -
Comparison of End-to-end Speech Assessment Models for the NOCASA 2025 Challenge
par: Žavoronkov, Aleksei, et autres
Publié: (2025) -
Estonian Native Large Language Model Benchmark
par: Lillepalu, Helena Grete, et autres
Publié: (2025) -
Contrastive prediction strategies for unsupervised segmentation and categorization of phonemes and words
par: Cuervo, Santiago, et autres
Publié: (2021) -
TalTech Systems for the Interspeech 2025 ML-SUPERB 2.0 Challenge
par: Alumäe, Tanel, et autres
Publié: (2025)