T2A-Feedback: Improving Basic Capabilities of Text-to-Audio Generation via Fine-grained AI Feedback
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Zehan, Lei, Ke, Zhu, Chen, Huang, Jiawei, Zhou, Sashuai, Liu, Luping, Cheng, Xize, Ji, Shengpeng, Ye, Zhenhui, Jin, Tao, Zhao, Zhou |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Fine-grained Preference Optimization Improves Zero-shot Text-to-Speech
par: Yao, Jixun, et autres
Publié: (2025)
par: Yao, Jixun, et autres
Publié: (2025)
AudioLCM: Text-to-Audio Generation with Latent Consistency Models
par: Liu, Huadai, et autres
Publié: (2024)
par: Liu, Huadai, et autres
Publié: (2024)
Improving Audio Captioning Models with Fine-grained Audio Features, Text Embedding Supervision, and LLM Mix-up Augmentation
par: Wu, Shih-Lun, et autres
Publié: (2023)
par: Wu, Shih-Lun, et autres
Publié: (2023)
MobileSpeech: A Fast and High-Fidelity Framework for Mobile Zero-Shot Text-to-Speech
par: Ji, Shengpeng, et autres
Publié: (2024)
par: Ji, Shengpeng, et autres
Publié: (2024)
ControlSpeech: Towards Simultaneous and Independent Zero-shot Speaker Cloning and Zero-shot Language Style Control
par: Ji, Shengpeng, et autres
Publié: (2024)
par: Ji, Shengpeng, et autres
Publié: (2024)
Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching
par: Zuo, Jialong, et autres
Publié: (2025)
par: Zuo, Jialong, et autres
Publié: (2025)
The Interspeech 2026 Audio Encoder Capability Challenge for Large Audio Language Models
par: Dinkel, Heinrich, et autres
Publié: (2026)
par: Dinkel, Heinrich, et autres
Publié: (2026)
Video-to-Audio Generation with Fine-grained Temporal Semantics
par: Hu, Yuchen, et autres
Publié: (2024)
par: Hu, Yuchen, et autres
Publié: (2024)
AudioComposer: Towards Fine-grained Audio Generation with Natural Language Descriptions
par: Wang, Yuanyuan, et autres
Publié: (2024)
par: Wang, Yuanyuan, et autres
Publié: (2024)
Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model
par: Zuo, Jialong, et autres
Publié: (2025)
par: Zuo, Jialong, et autres
Publié: (2025)
BATON: Aligning Text-to-Audio Model with Human Preference Feedback
par: Liao, Huan, et autres
Publié: (2024)
par: Liao, Huan, et autres
Publié: (2024)
Mega-TTS 2: Boosting Prompting Mechanisms for Zero-Shot Speech Synthesis
par: Jiang, Ziyue, et autres
Publié: (2023)
par: Jiang, Ziyue, et autres
Publié: (2023)
The ICME 2025 Audio Encoder Capability Challenge
par: Zhang, Junbo, et autres
Publié: (2025)
par: Zhang, Junbo, et autres
Publié: (2025)
Cacophony: An Improved Contrastive Audio-Text Model
par: Zhu, Ge, et autres
Publié: (2024)
par: Zhu, Ge, et autres
Publié: (2024)
MuVi: Video-to-Music Generation with Semantic Alignment and Rhythmic Synchronization
par: Li, Ruiqi, et autres
Publié: (2024)
par: Li, Ruiqi, et autres
Publié: (2024)
OmniSep: Unified Omni-Modality Sound Separation with Query-Mixup
par: Cheng, Xize, et autres
Publié: (2024)
par: Cheng, Xize, et autres
Publié: (2024)
UniCodec: Unified Audio Codec with Single Domain-Adaptive Codebook
par: Jiang, Yidi, et autres
Publié: (2025)
par: Jiang, Yidi, et autres
Publié: (2025)
AudioSpa: Spatializing Sound Events with Text
par: Feng, Linfeng, et autres
Publié: (2025)
par: Feng, Linfeng, et autres
Publié: (2025)
FlashAudio: Rectified Flows for Fast and High-Fidelity Text-to-Audio Generation
par: Liu, Huadai, et autres
Publié: (2024)
par: Liu, Huadai, et autres
Publié: (2024)
CosyAudio: Improving Audio Generation with Confidence Scores and Synthetic Captions
par: Zhu, Xinfa, et autres
Publié: (2025)
par: Zhu, Xinfa, et autres
Publié: (2025)
Room Impulse Response Synthesis via Differentiable Feedback Delay Networks for Efficient Spatial Audio Rendering
par: Gerami, Armin, et autres
Publié: (2025)
par: Gerami, Armin, et autres
Publié: (2025)
Breaking the Barriers of Text-Hungry and Audio-Deficient AI
par: Tembine, Hamidou, et autres
Publié: (2025)
par: Tembine, Hamidou, et autres
Publié: (2025)
WavRAG: Audio-Integrated Retrieval Augmented Generation for Spoken Dialogue Models
par: Chen, Yifu, et autres
Publié: (2025)
par: Chen, Yifu, et autres
Publié: (2025)
Fine-Tuning Text-to-Speech Diffusion Models Using Reinforcement Learning with Human Feedback
par: Chen, Jingyi, et autres
Publié: (2025)
par: Chen, Jingyi, et autres
Publié: (2025)
AudioEval: Automatic Dual-Perspective and Multi-Dimensional Evaluation of Text-to-Audio-Generation
par: Wang, Hui, et autres
Publié: (2025)
par: Wang, Hui, et autres
Publié: (2025)
Improving Language Model-Based Zero-Shot Text-to-Speech Synthesis with Multi-Scale Acoustic Prompts
par: Lei, Shun, et autres
Publié: (2023)
par: Lei, Shun, et autres
Publié: (2023)
FGCL: Fine-grained Contrastive Learning For Mandarin Stuttering Event Detection
par: Jiang, Han, et autres
Publié: (2024)
par: Jiang, Han, et autres
Publié: (2024)
TextrolSpeech: A Text Style Control Speech Corpus With Codec Language Text-to-Speech Models
par: Ji, Shengpeng, et autres
Publié: (2023)
par: Ji, Shengpeng, et autres
Publié: (2023)
In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion
par: Jin, Jiawei, et autres
Publié: (2025)
par: Jin, Jiawei, et autres
Publié: (2025)
The Artist is Present: Traces of Artists Resigind and Spawning in Text-to-Audio AI
par: Coelho, Guilherme
Publié: (2025)
par: Coelho, Guilherme
Publié: (2025)
Language-Codec: Bridging Discrete Codec Representations and Speech Language Models
par: Ji, Shengpeng, et autres
Publié: (2024)
par: Ji, Shengpeng, et autres
Publié: (2024)
PPPR: Portable Plug-in Prompt Refiner for Text to Audio Generation
par: Shi, Shuchen, et autres
Publié: (2024)
par: Shi, Shuchen, et autres
Publié: (2024)
LAFMA: A Latent Flow Matching Model for Text-to-Audio Generation
par: Guan, Wenhao, et autres
Publié: (2024)
par: Guan, Wenhao, et autres
Publié: (2024)
Improving Audio-Text Retrieval via Hierarchical Cross-Modal Interaction and Auxiliary Captions
par: Xin, Yifei, et autres
Publié: (2023)
par: Xin, Yifei, et autres
Publié: (2023)
WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling
par: Ji, Shengpeng, et autres
Publié: (2024)
par: Ji, Shengpeng, et autres
Publié: (2024)
TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models
par: Wang, Hui, et autres
Publié: (2025)
par: Wang, Hui, et autres
Publié: (2025)
TraceableSpeech: Towards Proactively Traceable Text-to-Speech with Watermarking
par: Zhou, Junzuo, et autres
Publié: (2024)
par: Zhou, Junzuo, et autres
Publié: (2024)
Probing Audio-Generation Capabilities of Text-Based Language Models
par: Anbazhagan, Arjun Prasaath, et autres
Publié: (2025)
par: Anbazhagan, Arjun Prasaath, et autres
Publié: (2025)
Semantic and Semiotic Interplays in Text-to-Audio AI: Exploring Cognitive Dynamics and Musical Interactions
par: Coelho, Guilherme
Publié: (2025)
par: Coelho, Guilherme
Publié: (2025)
DOTA-ME-CS: Daily Oriented Text Audio-Mandarin English-Code Switching Dataset
par: Li, Yupei, et autres
Publié: (2025)
par: Li, Yupei, et autres
Publié: (2025)
Documents similaires
-
Fine-grained Preference Optimization Improves Zero-shot Text-to-Speech
par: Yao, Jixun, et autres
Publié: (2025) -
AudioLCM: Text-to-Audio Generation with Latent Consistency Models
par: Liu, Huadai, et autres
Publié: (2024) -
Improving Audio Captioning Models with Fine-grained Audio Features, Text Embedding Supervision, and LLM Mix-up Augmentation
par: Wu, Shih-Lun, et autres
Publié: (2023) -
MobileSpeech: A Fast and High-Fidelity Framework for Mobile Zero-Shot Text-to-Speech
par: Ji, Shengpeng, et autres
Publié: (2024) -
ControlSpeech: Towards Simultaneous and Independent Zero-shot Speaker Cloning and Zero-shot Language Style Control
par: Ji, Shengpeng, et autres
Publié: (2024)