ELLA-V: Stable Neural Codec Language Modeling with Alignment-guided Sequence Reordering
Fuente:
arXiv
Salvato in:
| Autori principali: | Song, Yakun, Chen, Zhuo, Wang, Xiaofei, Ma, Ziyang, Chen, Xie |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
TacoLM: GaTed Attention Equipped Codec Language Model are Efficient Zero-Shot Text to Speech Synthesizers
di: Song, Yakun, et al.
Pubblicazione: (2024)
di: Song, Yakun, et al.
Pubblicazione: (2024)
MagiCodec: Simple Masked Gaussian-Injected Codec for High-Fidelity Reconstruction and Generation
di: Song, Yakun, et al.
Pubblicazione: (2025)
di: Song, Yakun, et al.
Pubblicazione: (2025)
Language Model Can Listen While Speaking
di: Ma, Ziyang, et al.
Pubblicazione: (2024)
di: Ma, Ziyang, et al.
Pubblicazione: (2024)
A Comparative Study of LLM-based ASR and Whisper in Low Resource and Code Switching Scenario
di: Song, Zheshu, et al.
Pubblicazione: (2024)
di: Song, Zheshu, et al.
Pubblicazione: (2024)
NDVQ: Robust Neural Audio Codec with Normal Distribution-Based Vector Quantization
di: Niu, Zhikang, et al.
Pubblicazione: (2024)
di: Niu, Zhikang, et al.
Pubblicazione: (2024)
SpeechX: Neural Codec Language Model as a Versatile Speech Transformer
di: Wang, Xiaofei, et al.
Pubblicazione: (2023)
di: Wang, Xiaofei, et al.
Pubblicazione: (2023)
Codec Does Matter: Exploring the Semantic Shortcoming of Codec for Audio Language Model
di: Ye, Zhen, et al.
Pubblicazione: (2024)
di: Ye, Zhen, et al.
Pubblicazione: (2024)
Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Model
di: Ma, Ziyang, et al.
Pubblicazione: (2025)
di: Ma, Ziyang, et al.
Pubblicazione: (2025)
FuseCodec: Semantic-Contextual Fusion and Supervision for Neural Codecs
di: Ahasan, Md Mubtasim, et al.
Pubblicazione: (2025)
di: Ahasan, Md Mubtasim, et al.
Pubblicazione: (2025)
BAT: Learning to Reason about Spatial Sounds with Large Language Models
di: Zheng, Zhisheng, et al.
Pubblicazione: (2024)
di: Zheng, Zhisheng, et al.
Pubblicazione: (2024)
SAC: Neural Speech Codec with Semantic-Acoustic Dual-Stream Quantization
di: Chen, Wenxi, et al.
Pubblicazione: (2025)
di: Chen, Wenxi, et al.
Pubblicazione: (2025)
SecoustiCodec: Cross-Modal Aligned Streaming Single-Codecbook Speech Codec
di: Qiang, Chunyu, et al.
Pubblicazione: (2025)
di: Qiang, Chunyu, et al.
Pubblicazione: (2025)
HH-Codec: High Compression High-fidelity Discrete Neural Codec for Spoken Language Modeling
di: Xue, Rongkun, et al.
Pubblicazione: (2025)
di: Xue, Rongkun, et al.
Pubblicazione: (2025)
Quantizer-Aware Hierarchical Neural Codec Modeling for Speech Deepfake Detection
di: Wu, Jinyang, et al.
Pubblicazione: (2026)
di: Wu, Jinyang, et al.
Pubblicazione: (2026)
Investigating Neural Audio Codecs for Speech Language Model-Based Speech Generation
di: Li, Jiaqi, et al.
Pubblicazione: (2024)
di: Li, Jiaqi, et al.
Pubblicazione: (2024)
VALL-E 2: Neural Codec Language Models are Human Parity Zero-Shot Text to Speech Synthesizers
di: Chen, Sanyuan, et al.
Pubblicazione: (2024)
di: Chen, Sanyuan, et al.
Pubblicazione: (2024)
Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate
di: Zhang, Hanglei, et al.
Pubblicazione: (2025)
di: Zhang, Hanglei, et al.
Pubblicazione: (2025)
Towards Reliable Large Audio Language Model
di: Ma, Ziyang, et al.
Pubblicazione: (2025)
di: Ma, Ziyang, et al.
Pubblicazione: (2025)
Leveraging Speech PTM, Text LLM, and Emotional TTS for Speech Emotion Recognition
di: Ma, Ziyang, et al.
Pubblicazione: (2023)
di: Ma, Ziyang, et al.
Pubblicazione: (2023)
Neural Codec Source Tracing: Toward Comprehensive Attribution in Open-Set Condition
di: Xie, Yuankun, et al.
Pubblicazione: (2025)
di: Xie, Yuankun, et al.
Pubblicazione: (2025)
Language-Codec: Bridging Discrete Codec Representations and Speech Language Models
di: Ji, Shengpeng, et al.
Pubblicazione: (2024)
di: Ji, Shengpeng, et al.
Pubblicazione: (2024)
MIDI-VALLE: Improving Expressive Piano Performance Synthesis Through Neural Codec Language Modelling
di: Tang, Jingjing, et al.
Pubblicazione: (2025)
di: Tang, Jingjing, et al.
Pubblicazione: (2025)
ESPnet-Codec: Comprehensive Training and Evaluation of Neural Codecs for Audio, Music, and Speech
di: Shi, Jiatong, et al.
Pubblicazione: (2024)
di: Shi, Jiatong, et al.
Pubblicazione: (2024)
Codec-Based Deepfake Source Tracing via Neural Audio Codec Taxonomy
di: Chen, Xuanjun, et al.
Pubblicazione: (2025)
di: Chen, Xuanjun, et al.
Pubblicazione: (2025)
SoCodec: A Semantic-Ordered Multi-Stream Speech Codec for Efficient Language Model Based Text-to-Speech Synthesis
di: Guo, Haohan, et al.
Pubblicazione: (2024)
di: Guo, Haohan, et al.
Pubblicazione: (2024)
LSCodec: Low-Bitrate and Speaker-Decoupled Discrete Speech Codec
di: Guo, Yiwei, et al.
Pubblicazione: (2024)
di: Guo, Yiwei, et al.
Pubblicazione: (2024)
ISA-Bench: Benchmarking Instruction Sensitivity for Large Audio Language Models
di: Li, Bohan, et al.
Pubblicazione: (2025)
di: Li, Bohan, et al.
Pubblicazione: (2025)
Exploring Effective Distillation of Self-Supervised Speech Models for Automatic Speech Recognition
di: Wang, Yujin, et al.
Pubblicazione: (2022)
di: Wang, Yujin, et al.
Pubblicazione: (2022)
SALMONN-omni: A Codec-free LLM for Full-duplex Speech Understanding and Generation
di: Yu, Wenyi, et al.
Pubblicazione: (2024)
di: Yu, Wenyi, et al.
Pubblicazione: (2024)
Codec-SUPERB: An In-Depth Analysis of Sound Codec Models
di: Wu, Haibin, et al.
Pubblicazione: (2024)
di: Wu, Haibin, et al.
Pubblicazione: (2024)
DM-Codec: Distilling Multimodal Representations for Speech Tokenization
di: Ahasan, Md Mubtasim, et al.
Pubblicazione: (2024)
di: Ahasan, Md Mubtasim, et al.
Pubblicazione: (2024)
Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling
di: Zheng, Qixi, et al.
Pubblicazione: (2025)
di: Zheng, Qixi, et al.
Pubblicazione: (2025)
Analyzing and Mitigating Inconsistency in Discrete Audio Tokens for Neural Codec Language Models
di: Liu, Wenrui, et al.
Pubblicazione: (2024)
di: Liu, Wenrui, et al.
Pubblicazione: (2024)
Speaking from Coarse to Fine: Improving Neural Codec Language Model via Multi-Scale Speech Coding and Generation
di: Guo, Haohan, et al.
Pubblicazione: (2024)
di: Guo, Haohan, et al.
Pubblicazione: (2024)
GigaSpeech 2: An Evolving, Large-Scale and Multi-domain ASR Corpus for Low-Resource Languages with Automated Crawling, Transcription and Refinement
di: Yang, Yifan, et al.
Pubblicazione: (2024)
di: Yang, Yifan, et al.
Pubblicazione: (2024)
CodecFake+: A Large-Scale Neural Audio Codec-Based Deepfake Speech Dataset
di: Chen, Xuanjun, et al.
Pubblicazione: (2025)
di: Chen, Xuanjun, et al.
Pubblicazione: (2025)
BigCodec: Pushing the Limits of Low-Bitrate Neural Speech Codec
di: Xin, Detai, et al.
Pubblicazione: (2024)
di: Xin, Detai, et al.
Pubblicazione: (2024)
Personalized Neural Speech Codec
di: Jang, Inseon, et al.
Pubblicazione: (2024)
di: Jang, Inseon, et al.
Pubblicazione: (2024)
SpectroStream: A Versatile Neural Codec for General Audio
di: Li, Yunpeng, et al.
Pubblicazione: (2025)
di: Li, Yunpeng, et al.
Pubblicazione: (2025)
Incorporating Class-based Language Model for Named Entity Recognition in Factorized Neural Transducer
di: Wang, Peng, et al.
Pubblicazione: (2023)
di: Wang, Peng, et al.
Pubblicazione: (2023)
Documenti analoghi
-
TacoLM: GaTed Attention Equipped Codec Language Model are Efficient Zero-Shot Text to Speech Synthesizers
di: Song, Yakun, et al.
Pubblicazione: (2024) -
MagiCodec: Simple Masked Gaussian-Injected Codec for High-Fidelity Reconstruction and Generation
di: Song, Yakun, et al.
Pubblicazione: (2025) -
Language Model Can Listen While Speaking
di: Ma, Ziyang, et al.
Pubblicazione: (2024) -
A Comparative Study of LLM-based ASR and Whisper in Low Resource and Code Switching Scenario
di: Song, Zheshu, et al.
Pubblicazione: (2024) -
NDVQ: Robust Neural Audio Codec with Normal Distribution-Based Vector Quantization
di: Niu, Zhikang, et al.
Pubblicazione: (2024)