Evaluating Semantic Fragility in Text-to-Audio Generation Systems Under Controlled Prompt Perturbations
Fuente:
arXiv
Guardado en:
| Autor principal: | Wu, Jiahui |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MeanAudio: Fast and Faithful Text-to-Audio Generation with Mean Flows
por: Li, Xiquan, et al.
Publicado: (2025)
por: Li, Xiquan, et al.
Publicado: (2025)
Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance
por: Zhang, Yaoyun, et al.
Publicado: (2024)
por: Zhang, Yaoyun, et al.
Publicado: (2024)
Text Prompt is Not Enough: Sound Event Enhanced Prompt Adapter for Target Style Audio Generation
por: Xiong, Chenxu, et al.
Publicado: (2024)
por: Xiong, Chenxu, et al.
Publicado: (2024)
PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation
por: Xie, Tianxin, et al.
Publicado: (2025)
por: Xie, Tianxin, et al.
Publicado: (2025)
AQAScore: Evaluating Semantic Alignment in Text-to-Audio Generation via Audio Question Answering
por: Kuan, Chun-Yi, et al.
Publicado: (2026)
por: Kuan, Chun-Yi, et al.
Publicado: (2026)
Audio Prompt Adapter: Unleashing Music Editing Abilities for Text-to-Music with Lightweight Finetuning
por: Tsai, Fang-Duo, et al.
Publicado: (2024)
por: Tsai, Fang-Duo, et al.
Publicado: (2024)
Generalizable Prompt Tuning for Audio-Language Models via Semantic Expansion
por: Jang, Jaehyuk, et al.
Publicado: (2026)
por: Jang, Jaehyuk, et al.
Publicado: (2026)
SupCLAP: Controlling Optimization Trajectory Drift in Audio-Text Contrastive Learning with Support Vector Regularization
por: Luo, Jiehui, et al.
Publicado: (2025)
por: Luo, Jiehui, et al.
Publicado: (2025)
ATIR: Towards Audio-Text Interleaved Contextual Retrieval
por: Zhao, Tong, et al.
Publicado: (2026)
por: Zhao, Tong, et al.
Publicado: (2026)
AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion
por: Zhao, Junqi, et al.
Publicado: (2025)
por: Zhao, Junqi, et al.
Publicado: (2025)
DreamAudio: Customized Text-to-Audio Generation with Diffusion Models
por: Yuan, Yi, et al.
Publicado: (2025)
por: Yuan, Yi, et al.
Publicado: (2025)
Towards Fine-grained Temporal Perception: Post-Training Large Audio-Language Models with Audio-Side Time Prompt
por: Shi, Yanfeng, et al.
Publicado: (2026)
por: Shi, Yanfeng, et al.
Publicado: (2026)
AudioMotionBench: Evaluating Auditory Motion Perception in Audio LLMs
por: Sun, Zhe, et al.
Publicado: (2025)
por: Sun, Zhe, et al.
Publicado: (2025)
ProAV-DiT: A Projected Latent Diffusion Transformer for Efficient Synchronized Audio-Video Generation
por: Sun, Jiahui, et al.
Publicado: (2025)
por: Sun, Jiahui, et al.
Publicado: (2025)
FreeAudio: Training-Free Timing Planning for Controllable Long-Form Text-to-Audio Generation
por: Jiang, Yuxuan, et al.
Publicado: (2025)
por: Jiang, Yuxuan, et al.
Publicado: (2025)
Break-the-Beat! Controllable MIDI-to-Drum Audio Synthesis
por: Cui, Shuyang, et al.
Publicado: (2026)
por: Cui, Shuyang, et al.
Publicado: (2026)
AudioMoG: Guiding Audio Generation with Mixture-of-Guidance
por: Wang, Junyou, et al.
Publicado: (2025)
por: Wang, Junyou, et al.
Publicado: (2025)
Mind the Prompt: Prompting Strategies in Audio Generations for Improving Sound Classification
por: Ronchini, Francesca, et al.
Publicado: (2025)
por: Ronchini, Francesca, et al.
Publicado: (2025)
DegDiT: Controllable Audio Generation with Dynamic Event Graph Guided Diffusion Transformer
por: Liu, Yisu, et al.
Publicado: (2025)
por: Liu, Yisu, et al.
Publicado: (2025)
Boosting ASR Robustness via Test-Time Reinforcement Learning with Audio-Text Semantic Rewards
por: Fang, Linghan, et al.
Publicado: (2026)
por: Fang, Linghan, et al.
Publicado: (2026)
AudioCapBench: Quick Evaluation on Audio Captioning across Sound, Music, and Speech
por: Qiu, Jielin, et al.
Publicado: (2026)
por: Qiu, Jielin, et al.
Publicado: (2026)
AudioCodecBench: A Comprehensive Benchmark for Audio Codec Evaluation
por: Wang, Lu, et al.
Publicado: (2025)
por: Wang, Lu, et al.
Publicado: (2025)
RFM-Editing: Rectified Flow Matching for Text-guided Audio Editing
por: Gao, Liting, et al.
Publicado: (2025)
por: Gao, Liting, et al.
Publicado: (2025)
Detect All-Type Deepfake Audio: Wavelet Prompt Tuning for Enhanced Auditory Perception
por: Xie, Yuankun, et al.
Publicado: (2025)
por: Xie, Yuankun, et al.
Publicado: (2025)
Language Models as Semantic Teachers: Post-Training Alignment for Medical Audio Understanding
por: Wang, Tsai-Ning, et al.
Publicado: (2025)
por: Wang, Tsai-Ning, et al.
Publicado: (2025)
Retrieval-Augmented Text-to-Audio Generation
por: Yuan, Yi, et al.
Publicado: (2023)
por: Yuan, Yi, et al.
Publicado: (2023)
Evaluation of Audio Language Models for Fairness, Safety, and Security
por: Aloufi, Ranya, et al.
Publicado: (2026)
por: Aloufi, Ranya, et al.
Publicado: (2026)
Audio ControlNet for Fine-Grained Audio Generation and Editing
por: Zhu, Haina, et al.
Publicado: (2026)
por: Zhu, Haina, et al.
Publicado: (2026)
Eureka-Audio: Triggering Audio Intelligence in Compact Language Models
por: Zhang, Dan, et al.
Publicado: (2026)
por: Zhang, Dan, et al.
Publicado: (2026)
TTMBA: Towards Text To Multiple Sources Binaural Audio Generation
por: He, Yuxuan, et al.
Publicado: (2025)
por: He, Yuxuan, et al.
Publicado: (2025)
All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation
por: Foo, Leonardo Haw-Yang, et al.
Publicado: (2026)
por: Foo, Leonardo Haw-Yang, et al.
Publicado: (2026)
LoSATok: Low-dimensional Semantic-Acoustic Tokenizer for Cross-Domain Audio Understanding and Generation
por: Zhang, Zhisheng, et al.
Publicado: (2026)
por: Zhang, Zhisheng, et al.
Publicado: (2026)
Challenge on Sound Scene Synthesis: Evaluating Text-to-Audio Generation
por: Lee, Junwon, et al.
Publicado: (2024)
por: Lee, Junwon, et al.
Publicado: (2024)
AT-ADD: All-Type Audio Deepfake Detection Challenge Evaluation Plan
por: Xie, Yuankun, et al.
Publicado: (2026)
por: Xie, Yuankun, et al.
Publicado: (2026)
Beyond Monologue: Interactive Talking-Listening Avatar Generation with Conversational Audio Context-Aware Kernels
por: Weng, Yuzhe, et al.
Publicado: (2026)
por: Weng, Yuzhe, et al.
Publicado: (2026)
In-the-wild Audio Spatialization with Flexible Text-guided Localization
por: Pan, Tianrui, et al.
Publicado: (2025)
por: Pan, Tianrui, et al.
Publicado: (2025)
AudioGenX: Explainability on Text-to-Audio Generative Models
por: Kang, Hyunju, et al.
Publicado: (2025)
por: Kang, Hyunju, et al.
Publicado: (2025)
ControlAudio: Tackling Text-Guided, Timing-Indicated and Intelligible Audio Generation via Progressive Diffusion Modeling
por: Jiang, Yuxuan, et al.
Publicado: (2025)
por: Jiang, Yuxuan, et al.
Publicado: (2025)
VidAudio-Bench: Benchmarking V2A and VT2A Generation across Four Audio Categories
por: Zhang, Qian, et al.
Publicado: (2026)
por: Zhang, Qian, et al.
Publicado: (2026)
Are Audio-Language Models Listening? Audio-Specialist Heads for Adaptive Audio Steering
por: Glazer, Neta, et al.
Publicado: (2026)
por: Glazer, Neta, et al.
Publicado: (2026)
Ejemplares similares
-
MeanAudio: Fast and Faithful Text-to-Audio Generation with Mean Flows
por: Li, Xiquan, et al.
Publicado: (2025) -
Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance
por: Zhang, Yaoyun, et al.
Publicado: (2024) -
Text Prompt is Not Enough: Sound Event Enhanced Prompt Adapter for Target Style Audio Generation
por: Xiong, Chenxu, et al.
Publicado: (2024) -
PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation
por: Xie, Tianxin, et al.
Publicado: (2025) -
AQAScore: Evaluating Semantic Alignment in Text-to-Audio Generation via Audio Question Answering
por: Kuan, Chun-Yi, et al.
Publicado: (2026)