Preference Tuning with Human Feedback on Language, Speech, and Vision Tasks: A Survey
Fuente:
arXiv
Salvato in:
| Autori principali: | Winata, Genta Indra, Zhao, Hanyang, Das, Anirban, Tang, Wenpin, Yao, David D., Zhang, Shi-Xiong, Sahu, Sambit |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
RainbowPO: A Unified Framework for Combining Improvements in Preference Optimization
di: Zhao, Hanyang, et al.
Pubblicazione: (2024)
di: Zhao, Hanyang, et al.
Pubblicazione: (2024)
AlignCap: Aligning Speech Emotion Captioning to Human Preferences
di: Liang, Ziqi, et al.
Pubblicazione: (2024)
di: Liang, Ziqi, et al.
Pubblicazione: (2024)
SpeechAlign: Aligning Speech Generation to Human Preferences
di: Zhang, Dong, et al.
Pubblicazione: (2024)
di: Zhang, Dong, et al.
Pubblicazione: (2024)
BATON: Aligning Text-to-Audio Model with Human Preference Feedback
di: Liao, Huan, et al.
Pubblicazione: (2024)
di: Liao, Huan, et al.
Pubblicazione: (2024)
Enhancing Zero-shot Text-to-Speech Synthesis with Human Feedback
di: Chen, Chen, et al.
Pubblicazione: (2024)
di: Chen, Chen, et al.
Pubblicazione: (2024)
ReHear: Iterative Pseudo-Label Refinement for Semi-Supervised Speech Recognition via Audio Large Language Models
di: Liu, Zefang, et al.
Pubblicazione: (2026)
di: Liu, Zefang, et al.
Pubblicazione: (2026)
Customizing Speech Recognition Model with Large Language Model Feedback
di: Ling, Shaoshi, et al.
Pubblicazione: (2025)
di: Ling, Shaoshi, et al.
Pubblicazione: (2025)
Learning Fine-Grained Controllability on Speech Generation via Efficient Fine-Tuning
di: Chien, Chung-Ming, et al.
Pubblicazione: (2024)
di: Chien, Chung-Ming, et al.
Pubblicazione: (2024)
Recent Advances in Speech Language Models: A Survey
di: Cui, Wenqian, et al.
Pubblicazione: (2024)
di: Cui, Wenqian, et al.
Pubblicazione: (2024)
VoiceTextBlender: Augmenting Large Language Models with Speech Capabilities via Single-Stage Joint Speech-Text Supervised Fine-Tuning
di: Peng, Yifan, et al.
Pubblicazione: (2024)
di: Peng, Yifan, et al.
Pubblicazione: (2024)
Towards Efficient Speech-Text Jointly Decoding within One Speech Language Model
di: Wu, Haibin, et al.
Pubblicazione: (2025)
di: Wu, Haibin, et al.
Pubblicazione: (2025)
DeSTA2: Developing Instruction-Following Speech Language Model Without Speech Instruction-Tuning Data
di: Lu, Ke-Han, et al.
Pubblicazione: (2024)
di: Lu, Ke-Han, et al.
Pubblicazione: (2024)
Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving
di: Xie, Jingran, et al.
Pubblicazione: (2025)
di: Xie, Jingran, et al.
Pubblicazione: (2025)
Quantifying Cross-Lingual Transfer in Paralinguistic Speech Tasks
di: Buitrago, Pol, et al.
Pubblicazione: (2026)
di: Buitrago, Pol, et al.
Pubblicazione: (2026)
Full-text Error Correction for Chinese Speech Recognition with Large Language Model
di: Tang, Zhiyuan, et al.
Pubblicazione: (2024)
di: Tang, Zhiyuan, et al.
Pubblicazione: (2024)
Speech-Copilot: Leveraging Large Language Models for Speech Processing via Task Decomposition, Modularization, and Program Generation
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2024)
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2024)
Chain of Correction for Full-text Speech Recognition with Large Language Models
di: Tang, Zhiyuan, et al.
Pubblicazione: (2025)
di: Tang, Zhiyuan, et al.
Pubblicazione: (2025)
ART: The Alternating Reading Task Corpus for Speech Entrainment and Imitation
di: Yuan, Zheng, et al.
Pubblicazione: (2024)
di: Yuan, Zheng, et al.
Pubblicazione: (2024)
Exploring In-Context Learning of Textless Speech Language Model for Speech Classification Tasks
di: Hsu, Ming-Hao, et al.
Pubblicazione: (2023)
di: Hsu, Ming-Hao, et al.
Pubblicazione: (2023)
When Large Language Models Meet Speech: A Survey on Integration Approaches
di: Yang, Zhengdong, et al.
Pubblicazione: (2025)
di: Yang, Zhengdong, et al.
Pubblicazione: (2025)
VALL-E 2: Neural Codec Language Models are Human Parity Zero-Shot Text to Speech Synthesizers
di: Chen, Sanyuan, et al.
Pubblicazione: (2024)
di: Chen, Sanyuan, et al.
Pubblicazione: (2024)
Direct Speech-to-Speech Neural Machine Translation: A Survey
di: Gupta, Mahendra, et al.
Pubblicazione: (2024)
di: Gupta, Mahendra, et al.
Pubblicazione: (2024)
Unified Pathological Speech Analysis with Prompt Tuning
di: Yang, Fei, et al.
Pubblicazione: (2024)
di: Yang, Fei, et al.
Pubblicazione: (2024)
Estimating the Completeness of Discrete Speech Units
di: Yeh, Sung-Lin, et al.
Pubblicazione: (2024)
di: Yeh, Sung-Lin, et al.
Pubblicazione: (2024)
FASA: a Flexible and Automatic Speech Aligner for Extracting High-quality Aligned Children Speech Data
di: Liu, Dancheng, et al.
Pubblicazione: (2024)
di: Liu, Dancheng, et al.
Pubblicazione: (2024)
Low-Resource Domain Adaptation for Speech LLMs via Text-Only Fine-Tuning
di: Fang, Yangui, et al.
Pubblicazione: (2025)
di: Fang, Yangui, et al.
Pubblicazione: (2025)
Transformers in Speech Processing: A Survey
di: Latif, Siddique, et al.
Pubblicazione: (2023)
di: Latif, Siddique, et al.
Pubblicazione: (2023)
Summarizing Speech: A Comprehensive Survey
di: Retkowski, Fabian, et al.
Pubblicazione: (2025)
di: Retkowski, Fabian, et al.
Pubblicazione: (2025)
Two-stage Framework for Robust Speech Emotion Recognition Using Target Speaker Extraction in Human Speech Noise Conditions
di: Mi, Jinyi, et al.
Pubblicazione: (2024)
di: Mi, Jinyi, et al.
Pubblicazione: (2024)
MELD: Mel-Spectrogram-Based Speech Language Modeling with Discrete Latent Variables
di: Yeh, Sung-Lin, et al.
Pubblicazione: (2026)
di: Yeh, Sung-Lin, et al.
Pubblicazione: (2026)
UtterTune: LoRA-Based Target-Language Pronunciation Edit and Control in Multilingual Text-to-Speech
di: Kato, Shuhei
Pubblicazione: (2025)
di: Kato, Shuhei
Pubblicazione: (2025)
Harnessing the Zero-Shot Power of Instruction-Tuned Large Language Model in End-to-End Speech Recognition
di: Higuchi, Yosuke, et al.
Pubblicazione: (2023)
di: Higuchi, Yosuke, et al.
Pubblicazione: (2023)
A Comparative Study of Discrete Speech Tokens for Semantic-Related Tasks with Large Language Models
di: Wang, Dingdong, et al.
Pubblicazione: (2024)
di: Wang, Dingdong, et al.
Pubblicazione: (2024)
ESPnet-SpeechLM: An Open Speech Language Model Toolkit
di: Tian, Jinchuan, et al.
Pubblicazione: (2025)
di: Tian, Jinchuan, et al.
Pubblicazione: (2025)
OmniVoice: Towards Omnilingual Zero-Shot Text-to-Speech with Diffusion Language Models
di: Zhu, Han, et al.
Pubblicazione: (2026)
di: Zhu, Han, et al.
Pubblicazione: (2026)
Human Feedback Driven Dynamic Speech Emotion Recognition
di: Fedorov, Ilya, et al.
Pubblicazione: (2025)
di: Fedorov, Ilya, et al.
Pubblicazione: (2025)
DeSTA: Enhancing Speech Language Models through Descriptive Speech-Text Alignment
di: Lu, Ke-Han, et al.
Pubblicazione: (2024)
di: Lu, Ke-Han, et al.
Pubblicazione: (2024)
Pseudo2Real: Task Arithmetic for Pseudo-Label Correction in Automatic Speech Recognition
di: Lin, Yi-Cheng, et al.
Pubblicazione: (2025)
di: Lin, Yi-Cheng, et al.
Pubblicazione: (2025)
Transducer Consistency Regularization for Speech to Text Applications
di: Tseng, Cindy, et al.
Pubblicazione: (2024)
di: Tseng, Cindy, et al.
Pubblicazione: (2024)
Learning Speech Representations with Variational Predictive Coding
di: Yeh, Sung-Lin, et al.
Pubblicazione: (2025)
di: Yeh, Sung-Lin, et al.
Pubblicazione: (2025)
Documenti analoghi
-
RainbowPO: A Unified Framework for Combining Improvements in Preference Optimization
di: Zhao, Hanyang, et al.
Pubblicazione: (2024) -
AlignCap: Aligning Speech Emotion Captioning to Human Preferences
di: Liang, Ziqi, et al.
Pubblicazione: (2024) -
SpeechAlign: Aligning Speech Generation to Human Preferences
di: Zhang, Dong, et al.
Pubblicazione: (2024) -
BATON: Aligning Text-to-Audio Model with Human Preference Feedback
di: Liao, Huan, et al.
Pubblicazione: (2024) -
Enhancing Zero-shot Text-to-Speech Synthesis with Human Feedback
di: Chen, Chen, et al.
Pubblicazione: (2024)