SpeechAlign: Aligning Speech Generation to Human Preferences
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Dong, Li, Zhaowei, Li, Shimin, Zhang, Xin, Wang, Pengyu, Zhou, Yaqian, Qiu, Xipeng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models
por: Zhang, Xin, et al.
Publicado: (2023)
por: Zhang, Xin, et al.
Publicado: (2023)
SpeechGPT-Gen: Scaling Chain-of-Information Speech Generation
por: Zhang, Dong, et al.
Publicado: (2024)
por: Zhang, Dong, et al.
Publicado: (2024)
AlignCap: Aligning Speech Emotion Captioning to Human Preferences
por: Liang, Ziqi, et al.
Publicado: (2024)
por: Liang, Ziqi, et al.
Publicado: (2024)
InstructTTSEval: Benchmarking Complex Natural-Language Instruction Following in Text-to-Speech Systems
por: Huang, Kexin, et al.
Publicado: (2025)
por: Huang, Kexin, et al.
Publicado: (2025)
Simultaneous Speech-to-Speech Translation Without Aligned Data
por: Labiausse, Tom, et al.
Publicado: (2026)
por: Labiausse, Tom, et al.
Publicado: (2026)
BATON: Aligning Text-to-Audio Model with Human Preference Feedback
por: Liao, Huan, et al.
Publicado: (2024)
por: Liao, Huan, et al.
Publicado: (2024)
FASA: a Flexible and Automatic Speech Aligner for Extracting High-quality Aligned Children Speech Data
por: Liu, Dancheng, et al.
Publicado: (2024)
por: Liu, Dancheng, et al.
Publicado: (2024)
TASTE: Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling
por: Tseng, Liang-Hsuan, et al.
Publicado: (2025)
por: Tseng, Liang-Hsuan, et al.
Publicado: (2025)
LASER: Learning by Aligning Self-supervised Representations of Speech for Improving Content-related Tasks
por: Meghanani, Amit, et al.
Publicado: (2024)
por: Meghanani, Amit, et al.
Publicado: (2024)
UCorrect: An Unsupervised Framework for Automatic Speech Recognition Error Correction
por: Guo, Jiaxin, et al.
Publicado: (2024)
por: Guo, Jiaxin, et al.
Publicado: (2024)
SecoustiCodec: Cross-Modal Aligned Streaming Single-Codecbook Speech Codec
por: Qiang, Chunyu, et al.
Publicado: (2025)
por: Qiang, Chunyu, et al.
Publicado: (2025)
CoSTA: Code-Switched Speech Translation using Aligned Speech-Text Interleaving
por: Shankar, Bhavani, et al.
Publicado: (2024)
por: Shankar, Bhavani, et al.
Publicado: (2024)
Harf-Speech: A Clinically Aligned Framework for Arabic Phoneme-Level Speech Assessment
por: Azad, Asif, et al.
Publicado: (2026)
por: Azad, Asif, et al.
Publicado: (2026)
Joint Automatic Speech Recognition And Structure Learning For Better Speech Understanding
por: Hu, Jiliang, et al.
Publicado: (2025)
por: Hu, Jiliang, et al.
Publicado: (2025)
Adaptive Inner Speech-Text Alignment for LLM-based Speech Translation
por: Liu, Henglyu, et al.
Publicado: (2025)
por: Liu, Henglyu, et al.
Publicado: (2025)
Borderless Long Speech Synthesis
por: Song, Xingchen, et al.
Publicado: (2026)
por: Song, Xingchen, et al.
Publicado: (2026)
LM-SPT: LM-Aligned Semantic Distillation for Speech Tokenization
por: Jo, Daejin, et al.
Publicado: (2025)
por: Jo, Daejin, et al.
Publicado: (2025)
SEAL: Speech Embedding Alignment Learning for Speech Large Language Model with Retrieval-Augmented Generation
por: Sun, Chunyu, et al.
Publicado: (2025)
por: Sun, Chunyu, et al.
Publicado: (2025)
Cross-Utterance Conditioned VAE for Speech Generation
por: Li, Yang, et al.
Publicado: (2023)
por: Li, Yang, et al.
Publicado: (2023)
Modeling Sarcastic Speech: Semantic and Prosodic Cues in a Speech Synthesis Framework
por: Li, Zhu, et al.
Publicado: (2025)
por: Li, Zhu, et al.
Publicado: (2025)
Continuous Speech Tokenizer in Text To Speech
por: Li, Yixing, et al.
Publicado: (2024)
por: Li, Yixing, et al.
Publicado: (2024)
AzeroS: Extending LLM to Speech with Self-Generated Instruction-Free Tuning
por: Shao, Yiwen, et al.
Publicado: (2025)
por: Shao, Yiwen, et al.
Publicado: (2025)
AnimeScore: A Preference-Based Dataset and Framework for Evaluating Anime-Like Speech Style
por: Park, Joonyong, et al.
Publicado: (2026)
por: Park, Joonyong, et al.
Publicado: (2026)
Enhancing Zero-shot Text-to-Speech Synthesis with Human Feedback
por: Chen, Chen, et al.
Publicado: (2024)
por: Chen, Chen, et al.
Publicado: (2024)
Aligning Language Models for Lyric-to-Melody Generation with Rule-Based Musical Constraints
por: Meng, Hao, et al.
Publicado: (2026)
por: Meng, Hao, et al.
Publicado: (2026)
Generative Expressive Conversational Speech Synthesis
por: Liu, Rui, et al.
Publicado: (2024)
por: Liu, Rui, et al.
Publicado: (2024)
Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving
por: Xie, Jingran, et al.
Publicado: (2025)
por: Xie, Jingran, et al.
Publicado: (2025)
XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs
por: Gong, Yitian, et al.
Publicado: (2025)
por: Gong, Yitian, et al.
Publicado: (2025)
CIF-T: A Novel CIF-based Transducer Architecture for Automatic Speech Recognition
por: Zhang, Tian-Hao, et al.
Publicado: (2023)
por: Zhang, Tian-Hao, et al.
Publicado: (2023)
Coarse-to-fine Alignment Makes Better Speech-image Retrieval
por: Zhou, Lifeng, et al.
Publicado: (2024)
por: Zhou, Lifeng, et al.
Publicado: (2024)
Emotional Dimension Control in Language Model-Based Text-to-Speech: Spanning a Broad Spectrum of Human Emotions
por: Zhou, Kun, et al.
Publicado: (2024)
por: Zhou, Kun, et al.
Publicado: (2024)
GOAT-TTS: Expressive and Realistic Speech Generation via A Dual-Branch LLM
por: Song, Yaodong, et al.
Publicado: (2025)
por: Song, Yaodong, et al.
Publicado: (2025)
Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction
por: Li, Tianpeng, et al.
Publicado: (2025)
por: Li, Tianpeng, et al.
Publicado: (2025)
Emilia: A Large-Scale, Extensive, Multilingual, and Diverse Dataset for Speech Generation
por: He, Haorui, et al.
Publicado: (2025)
por: He, Haorui, et al.
Publicado: (2025)
Exploring Effective Distillation of Self-Supervised Speech Models for Automatic Speech Recognition
por: Wang, Yujin, et al.
Publicado: (2022)
por: Wang, Yujin, et al.
Publicado: (2022)
Towards Achieving Human Parity on End-to-end Simultaneous Speech Translation via LLM Agent
por: Cheng, Shanbo, et al.
Publicado: (2024)
por: Cheng, Shanbo, et al.
Publicado: (2024)
BoSS: Beyond-Semantic Speech
por: Wang, Qing, et al.
Publicado: (2025)
por: Wang, Qing, et al.
Publicado: (2025)
S2S-Arena: Evaluating Paralinguistic Instruction Following in Speech-to-Speech Models
por: Jiang, Feng, et al.
Publicado: (2025)
por: Jiang, Feng, et al.
Publicado: (2025)
Re-Parameterization of Lightweight Transformer for On-Device Speech Emotion Recognition
por: Zhang, Zixing, et al.
Publicado: (2024)
por: Zhang, Zixing, et al.
Publicado: (2024)
S2SBench: A Benchmark for Quantifying Intelligence Degradation in Speech-to-Speech Large Language Models
por: Fang, Yuanbo, et al.
Publicado: (2025)
por: Fang, Yuanbo, et al.
Publicado: (2025)
Ejemplares similares
-
SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models
por: Zhang, Xin, et al.
Publicado: (2023) -
SpeechGPT-Gen: Scaling Chain-of-Information Speech Generation
por: Zhang, Dong, et al.
Publicado: (2024) -
AlignCap: Aligning Speech Emotion Captioning to Human Preferences
por: Liang, Ziqi, et al.
Publicado: (2024) -
InstructTTSEval: Benchmarking Complex Natural-Language Instruction Following in Text-to-Speech Systems
por: Huang, Kexin, et al.
Publicado: (2025) -
Simultaneous Speech-to-Speech Translation Without Aligned Data
por: Labiausse, Tom, et al.
Publicado: (2026)