Guided by the Plan: Enhancing Faithful Autoregressive Text-to-Audio Generation with Guided Decoding
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Juncheng, Hu, Zhe, Xu, Chao, Ren, Siyue, Feng, Yuxiang, Liu, Yang, Sun, Baigui, Wang, Shujun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Language Model Based Text-to-Audio Generation: Anti-Causally Aligned Collaborative Residual Transformers
por: Wang, Juncheng, et al.
Publicado: (2025)
por: Wang, Juncheng, et al.
Publicado: (2025)
Synchronized Video-to-Audio Generation via Mel Quantization-Continuum Decomposition
por: Wang, Juncheng, et al.
Publicado: (2025)
por: Wang, Juncheng, et al.
Publicado: (2025)
EzAudio: Enhancing Text-to-Audio Generation with Efficient Diffusion Transformer
por: Hai, Jiarui, et al.
Publicado: (2024)
por: Hai, Jiarui, et al.
Publicado: (2024)
IMPACT: Iterative Mask-based Parallel Decoding for Text-to-Audio Generation with Diffusion Modeling
por: Huang, Kuan-Po, et al.
Publicado: (2025)
por: Huang, Kuan-Po, et al.
Publicado: (2025)
Text2FX: Harnessing CLAP Embeddings for Text-Guided Audio Effects
por: Chu, Annie, et al.
Publicado: (2024)
por: Chu, Annie, et al.
Publicado: (2024)
LAFMA: A Latent Flow Matching Model for Text-to-Audio Generation
por: Guan, Wenhao, et al.
Publicado: (2024)
por: Guan, Wenhao, et al.
Publicado: (2024)
AudioEval: Automatic Dual-Perspective and Multi-Dimensional Evaluation of Text-to-Audio-Generation
por: Wang, Hui, et al.
Publicado: (2025)
por: Wang, Hui, et al.
Publicado: (2025)
Online Audio-Visual Autoregressive Speaker Extraction
por: Pan, Zexu, et al.
Publicado: (2025)
por: Pan, Zexu, et al.
Publicado: (2025)
AudioLCM: Text-to-Audio Generation with Latent Consistency Models
por: Liu, Huadai, et al.
Publicado: (2024)
por: Liu, Huadai, et al.
Publicado: (2024)
Can Audio Large Language Models Verify Speaker Identity?
por: Ren, Yiming, et al.
Publicado: (2025)
por: Ren, Yiming, et al.
Publicado: (2025)
VALL-T: Decoder-Only Generative Transducer for Robust and Decoding-Controllable Text-to-Speech
por: Du, Chenpeng, et al.
Publicado: (2024)
por: Du, Chenpeng, et al.
Publicado: (2024)
FlashAudio: Rectified Flows for Fast and High-Fidelity Text-to-Audio Generation
por: Liu, Huadai, et al.
Publicado: (2024)
por: Liu, Huadai, et al.
Publicado: (2024)
BreathNet: Generalizable Audio Deepfake Detection via Breath-Cue-Guided Feature Refinement
por: Ye, Zhe, et al.
Publicado: (2026)
por: Ye, Zhe, et al.
Publicado: (2026)
Efficient Autoregressive Audio Modeling via Next-Scale Prediction
por: Qiu, Kai, et al.
Publicado: (2024)
por: Qiu, Kai, et al.
Publicado: (2024)
SILA: Signal-to-Language Augmentation for Enhanced Control in Text-to-Audio Generation
por: Kumar, Sonal, et al.
Publicado: (2024)
por: Kumar, Sonal, et al.
Publicado: (2024)
PPPR: Portable Plug-in Prompt Refiner for Text to Audio Generation
por: Shi, Shuchen, et al.
Publicado: (2024)
por: Shi, Shuchen, et al.
Publicado: (2024)
Discrete Audio Representations for Automated Audio Captioning
por: Tian, Jingguang, et al.
Publicado: (2025)
por: Tian, Jingguang, et al.
Publicado: (2025)
Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction
por: Dai, Wang, et al.
Publicado: (2025)
por: Dai, Wang, et al.
Publicado: (2025)
Enhancing Crowdsourced Audio for Text-to-Speech Models
por: Giraldo, José, et al.
Publicado: (2024)
por: Giraldo, José, et al.
Publicado: (2024)
From Contrast to Commonality: Audio Commonality Captioning for Enhanced Audio-Text Cross-modal Understanding in Multimodal LLMs
por: Jia, Yuhang, et al.
Publicado: (2025)
por: Jia, Yuhang, et al.
Publicado: (2025)
Beyond Speaker Identity: Text Guided Target Speech Extraction
por: Huo, Mingyue, et al.
Publicado: (2025)
por: Huo, Mingyue, et al.
Publicado: (2025)
A Practical Guide to Spectrogram Analysis for Audio Signal Processing
por: Khodzhaev, Zulfidin
Publicado: (2024)
por: Khodzhaev, Zulfidin
Publicado: (2024)
FGAS: Fixed Decoder Network-Based Audio Steganography with Adversarial Perturbation Generation
por: Yan, Jialin, et al.
Publicado: (2025)
por: Yan, Jialin, et al.
Publicado: (2025)
LiveSpeech: Low-Latency Zero-shot Text-to-Speech via Autoregressive Modeling of Audio Discrete Codes
por: Dang, Trung, et al.
Publicado: (2024)
por: Dang, Trung, et al.
Publicado: (2024)
EAD-VC: Enhancing Speech Auto-Disentanglement for Voice Conversion with IFUB Estimator and Joint Text-Guided Consistent Learning
por: Liang, Ziqi, et al.
Publicado: (2024)
por: Liang, Ziqi, et al.
Publicado: (2024)
Guiding the underwater acoustic target recognition with interpretable contrastive learning
por: Xie, Yuan, et al.
Publicado: (2024)
por: Xie, Yuan, et al.
Publicado: (2024)
CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation
por: Oh, Hyunwoo, et al.
Publicado: (2025)
por: Oh, Hyunwoo, et al.
Publicado: (2025)
StreamFlow: Streaming Flow Matching with Block-wise Guided Attention Mask for Speech Token Decoding
por: Guo, Dake, et al.
Publicado: (2025)
por: Guo, Dake, et al.
Publicado: (2025)
ASGIR: Audio Spectrogram Transformer Guided Classification And Information Retrieval For Birds
por: Chaudhuri, Yashwardhan, et al.
Publicado: (2024)
por: Chaudhuri, Yashwardhan, et al.
Publicado: (2024)
AudioSpa: Spatializing Sound Events with Text
por: Feng, Linfeng, et al.
Publicado: (2025)
por: Feng, Linfeng, et al.
Publicado: (2025)
Video-Guided Text-to-Music Generation Using Public Domain Movie Collections
por: Kim, Haven, et al.
Publicado: (2025)
por: Kim, Haven, et al.
Publicado: (2025)
Towards Weakly Supervised Text-to-Audio Grounding
por: Xu, Xuenan, et al.
Publicado: (2024)
por: Xu, Xuenan, et al.
Publicado: (2024)
Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation
por: Huang, Kuan-Po, et al.
Publicado: (2026)
por: Huang, Kuan-Po, et al.
Publicado: (2026)
Speech-Aware Neural Diarization with Encoder-Decoder Attractor Guided by Attention Constraints
por: Lee, PeiYing, et al.
Publicado: (2024)
por: Lee, PeiYing, et al.
Publicado: (2024)
Attention-Constrained Inference for Robust Decoder-Only Text-to-Speech
por: Wang, Hankun, et al.
Publicado: (2024)
por: Wang, Hankun, et al.
Publicado: (2024)
Semantic Proximity Alignment: Towards Human Perception-consistent Audio Tagging by Aligning with Label Text Description
por: Liu, Wuyang, et al.
Publicado: (2023)
por: Liu, Wuyang, et al.
Publicado: (2023)
MiDashengLM: Efficient Audio Understanding with General Audio Captions
por: Dinkel, Heinrich, et al.
Publicado: (2025)
por: Dinkel, Heinrich, et al.
Publicado: (2025)
DreamAudio: Customized Text-to-Audio Generation with Diffusion Models
por: Yuan, Yi, et al.
Publicado: (2025)
por: Yuan, Yi, et al.
Publicado: (2025)
TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models
por: Wang, Hui, et al.
Publicado: (2025)
por: Wang, Hui, et al.
Publicado: (2025)
TAME: Temporal Audio-based Mamba for Enhanced Drone Trajectory Estimation and Classification
por: Xiao, Zhenyuan, et al.
Publicado: (2024)
por: Xiao, Zhenyuan, et al.
Publicado: (2024)
Ejemplares similares
-
Language Model Based Text-to-Audio Generation: Anti-Causally Aligned Collaborative Residual Transformers
por: Wang, Juncheng, et al.
Publicado: (2025) -
Synchronized Video-to-Audio Generation via Mel Quantization-Continuum Decomposition
por: Wang, Juncheng, et al.
Publicado: (2025) -
EzAudio: Enhancing Text-to-Audio Generation with Efficient Diffusion Transformer
por: Hai, Jiarui, et al.
Publicado: (2024) -
IMPACT: Iterative Mask-based Parallel Decoding for Text-to-Audio Generation with Diffusion Modeling
por: Huang, Kuan-Po, et al.
Publicado: (2025) -
Text2FX: Harnessing CLAP Embeddings for Text-Guided Audio Effects
por: Chu, Annie, et al.
Publicado: (2024)