Enregistré dans:
| Auteur principal: | Zolkepli, Husein |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2601.20185 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Multi-Lingual Malaysian Embedding: Leveraging Large Language Models for Semantic Representations
par: Zolkepli, Husein, et autres
Publié: (2024)
par: Zolkepli, Husein, et autres
Publié: (2024)
Attenuation of Sound in Glacier Ice from 2 kHz to 35 kHz
par: Meyer, Alexander, et autres
Publié: (2019)
par: Meyer, Alexander, et autres
Publié: (2019)
U-Codec: Ultra Low Frame-rate Neural Speech Codec for Fast High-fidelity Speech Generation
par: Yang, Xusheng, et autres
Publié: (2025)
par: Yang, Xusheng, et autres
Publié: (2025)
POTSA: A Cross-Lingual Speech Alignment Framework for Speech-to-Text Translation
par: Li, Xuanchen, et autres
Publié: (2025)
par: Li, Xuanchen, et autres
Publié: (2025)
SpeechX: Neural Codec Language Model as a Versatile Speech Transformer
par: Wang, Xiaofei, et autres
Publié: (2023)
par: Wang, Xiaofei, et autres
Publié: (2023)
MMMModal -- Multi-Images Multi-Audio Multi-turn Multi-Modal
par: Zolkepli, Husein, et autres
Publié: (2024)
par: Zolkepli, Husein, et autres
Publié: (2024)
Low Frame-rate Speech Codec: a Codec Designed for Fast High-quality Speech LLM Training and Inference
par: Casanova, Edresson, et autres
Publié: (2024)
par: Casanova, Edresson, et autres
Publié: (2024)
Improving Audio Codec-based Zero-Shot Text-to-Speech Synthesis with Multi-Modal Context and Large Language Model
par: Xue, Jinlong, et autres
Publié: (2024)
par: Xue, Jinlong, et autres
Publié: (2024)
Leveraging Parameter-Efficient Transfer Learning for Multi-Lingual Text-to-Speech Adaptation
par: Li, Yingting, et autres
Publié: (2024)
par: Li, Yingting, et autres
Publié: (2024)
SecoustiCodec: Cross-Modal Aligned Streaming Single-Codecbook Speech Codec
par: Qiang, Chunyu, et autres
Publié: (2025)
par: Qiang, Chunyu, et autres
Publié: (2025)
Cross-Lingual Multi-Granularity Framework for Interpretable Parkinson's Disease Diagnosis from Speech
par: Tougui, Ilias, et autres
Publié: (2025)
par: Tougui, Ilias, et autres
Publié: (2025)
CLiFT-ASR: A Cross-Lingual Fine-Tuning Framework for Low-Resource Taiwanese Hokkien Speech Recognition
par: Sung, Hung-Yang, et autres
Publié: (2025)
par: Sung, Hung-Yang, et autres
Publié: (2025)
DM-Codec: Distilling Multimodal Representations for Speech Tokenization
par: Ahasan, Md Mubtasim, et autres
Publié: (2024)
par: Ahasan, Md Mubtasim, et autres
Publié: (2024)
NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference
par: Casanova, Edresson, et autres
Publié: (2025)
par: Casanova, Edresson, et autres
Publié: (2025)
Low-Rank and Sparse Model Merging for Multi-Lingual Speech Recognition and Translation
par: Zhao, Qiuming, et autres
Publié: (2025)
par: Zhao, Qiuming, et autres
Publié: (2025)
Improving Multilingual Speech Models on ML-SUPERB 2.0: Fine-tuning with Data Augmentation and LID-Aware CTC
par: Wang, Qingzheng, et autres
Publié: (2025)
par: Wang, Qingzheng, et autres
Publié: (2025)
XLAVS-R: Cross-Lingual Audio-Visual Speech Representation Learning for Noise-Robust Speech Perception
par: Han, HyoJung, et autres
Publié: (2024)
par: Han, HyoJung, et autres
Publié: (2024)
Foundation Model-based Evaluation of Neuropsychiatric Disorders: A Lifespan-Inclusive, Multi-Modal, and Multi-Lingual Study
par: Dong, Zhongren, et autres
Publié: (2025)
par: Dong, Zhongren, et autres
Publié: (2025)
VALL-E 2: Neural Codec Language Models are Human Parity Zero-Shot Text to Speech Synthesizers
par: Chen, Sanyuan, et autres
Publié: (2024)
par: Chen, Sanyuan, et autres
Publié: (2024)
MaLLaM -- Malaysia Large Language Model
par: Zolkepli, Husein, et autres
Publié: (2024)
par: Zolkepli, Husein, et autres
Publié: (2024)
Large Malaysian Language Model Based on Mistral for Enhanced Local Language Understanding
par: Zolkepli, Husein, et autres
Publié: (2024)
par: Zolkepli, Husein, et autres
Publié: (2024)
Quantizer-Aware Hierarchical Neural Codec Modeling for Speech Deepfake Detection
par: Wu, Jinyang, et autres
Publié: (2026)
par: Wu, Jinyang, et autres
Publié: (2026)
Investigating Disentanglement in a Phoneme-level Speech Codec for Prosody Modeling
par: Karapiperis, Sotirios, et autres
Publié: (2024)
par: Karapiperis, Sotirios, et autres
Publié: (2024)
Spectrogram Patch Codec: A 2D Block-Quantized VQ-VAE and HiFi-GAN for Neural Speech Coding
par: Chary, Luis Felipe, et autres
Publié: (2025)
par: Chary, Luis Felipe, et autres
Publié: (2025)
Description-based Controllable Text-to-Speech with Cross-Lingual Voice Control
par: Yamamoto, Ryuichi, et autres
Publié: (2024)
par: Yamamoto, Ryuichi, et autres
Publié: (2024)
Speech-to-Text Translation with Phoneme-Augmented CoT: Enhancing Cross-Lingual Transfer in Low-Resource Scenarios
par: Gállego, Gerard I., et autres
Publié: (2025)
par: Gállego, Gerard I., et autres
Publié: (2025)
NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models
par: Ju, Zeqian, et autres
Publié: (2024)
par: Ju, Zeqian, et autres
Publié: (2024)
DementiaBank-Emotion: A Multi-Rater Emotion Annotation Corpus for Alzheimer's Disease Speech (Version 1.0)
par: Jeong, Cheonkam, et autres
Publié: (2026)
par: Jeong, Cheonkam, et autres
Publié: (2026)
ELF: Encoding Speaker-Specific Latent Speech Feature for Speech Synthesis
par: Kong, Jungil, et autres
Publié: (2023)
par: Kong, Jungil, et autres
Publié: (2023)
SALMONN-omni: A Codec-free LLM for Full-duplex Speech Understanding and Generation
par: Yu, Wenyi, et autres
Publié: (2024)
par: Yu, Wenyi, et autres
Publié: (2024)
ML-SUPERB 2.0: Benchmarking Multilingual Speech Models Across Modeling Constraints, Languages, and Datasets
par: Shi, Jiatong, et autres
Publié: (2024)
par: Shi, Jiatong, et autres
Publié: (2024)
Seed LiveInterpret 2.0: End-to-end Simultaneous Speech-to-speech Translation with Your Voice
par: Cheng, Shanbo, et autres
Publié: (2025)
par: Cheng, Shanbo, et autres
Publié: (2025)
FuseCodec: Semantic-Contextual Fusion and Supervision for Neural Codecs
par: Ahasan, Md Mubtasim, et autres
Publié: (2025)
par: Ahasan, Md Mubtasim, et autres
Publié: (2025)
End-to-End Simultaneous Dysarthric Speech Reconstruction with Frame-Level Adaptor and Multiple Wait-k Knowledge Distillation
par: Wu, Minghui, et autres
Publié: (2026)
par: Wu, Minghui, et autres
Publié: (2026)
DELULU: Discriminative Embedding Learning Using Latent Units for Speaker-Aware Self-Trained Speech Foundational Model
par: Baali, Massa, et autres
Publié: (2025)
par: Baali, Massa, et autres
Publié: (2025)
Towards Quantifying and Reducing Language Mismatch Effects in Cross-Lingual Speech Anti-Spoofing
par: Liu, Tianchi, et autres
Publié: (2024)
par: Liu, Tianchi, et autres
Publié: (2024)
Codec Does Matter: Exploring the Semantic Shortcoming of Codec for Audio Language Model
par: Ye, Zhen, et autres
Publié: (2024)
par: Ye, Zhen, et autres
Publié: (2024)
SimpleSpeech 2: Towards Simple and Efficient Text-to-Speech with Flow-based Scalar Latent Transformer Diffusion Models
par: Yang, Dongchao, et autres
Publié: (2024)
par: Yang, Dongchao, et autres
Publié: (2024)
Equipping LLM with Directional Multi-Talker Speech Understanding Capabilities
par: Lin, Ju, et autres
Publié: (2026)
par: Lin, Ju, et autres
Publié: (2026)
Cross-Lingual Speech Emotion Recognition: Humans vs. Self-Supervised Models
par: Han, Zhichen, et autres
Publié: (2024)
par: Han, Zhichen, et autres
Publié: (2024)
Documents similaires
-
Multi-Lingual Malaysian Embedding: Leveraging Large Language Models for Semantic Representations
par: Zolkepli, Husein, et autres
Publié: (2024) -
Attenuation of Sound in Glacier Ice from 2 kHz to 35 kHz
par: Meyer, Alexander, et autres
Publié: (2019) -
U-Codec: Ultra Low Frame-rate Neural Speech Codec for Fast High-fidelity Speech Generation
par: Yang, Xusheng, et autres
Publié: (2025) -
POTSA: A Cross-Lingual Speech Alignment Framework for Speech-to-Text Translation
par: Li, Xuanchen, et autres
Publié: (2025) -
SpeechX: Neural Codec Language Model as a Versatile Speech Transformer
par: Wang, Xiaofei, et autres
Publié: (2023)