Expressive Range Characterization of Open Text-to-Audio Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Morse, Jonathan, Naderi, Azadeh, Gaudl, Swen, Cartwright, Mark, Hoover, Amy K., Nelson, Mark J. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DreamAudio: Customized Text-to-Audio Generation with Diffusion Models
por: Yuan, Yi, et al.
Publicado: (2025)
por: Yuan, Yi, et al.
Publicado: (2025)
Compositional Audio Representation Learning
por: Sridhar, Sripathi, et al.
Publicado: (2024)
por: Sridhar, Sripathi, et al.
Publicado: (2024)
AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion
por: Zhao, Junqi, et al.
Publicado: (2025)
por: Zhao, Junqi, et al.
Publicado: (2025)
Retrieval-Augmented Text-to-Audio Generation
por: Yuan, Yi, et al.
Publicado: (2023)
por: Yuan, Yi, et al.
Publicado: (2023)
CTC-aligned Audio-Text Embedding for Streaming Open-vocabulary Keyword Spotting
por: Jin, Sichen, et al.
Publicado: (2024)
por: Jin, Sichen, et al.
Publicado: (2024)
Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models
por: Song, Zirui, et al.
Publicado: (2025)
por: Song, Zirui, et al.
Publicado: (2025)
Stable Audio Open
por: Evans, Zach, et al.
Publicado: (2024)
por: Evans, Zach, et al.
Publicado: (2024)
MultiVerse: Efficient and Expressive Zero-Shot Multi-Task Text-to-Speech
por: Bak, Taejun, et al.
Publicado: (2024)
por: Bak, Taejun, et al.
Publicado: (2024)
NV-Bench: Benchmark of Nonverbal Vocalization Synthesis for Expressive Text-to-Speech Generation
por: Ni, Qinke, et al.
Publicado: (2026)
por: Ni, Qinke, et al.
Publicado: (2026)
OpenSep: Leveraging Large Language Models with Textual Inversion for Open World Audio Separation
por: Mahmud, Tanvir, et al.
Publicado: (2024)
por: Mahmud, Tanvir, et al.
Publicado: (2024)
Reject Threshold Adaptation for Open-Set Model Attribution of Deepfake Audio
por: Yan, Xinrui, et al.
Publicado: (2024)
por: Yan, Xinrui, et al.
Publicado: (2024)
EnCLAP: Combining Neural Audio Codec and Audio-Text Joint Embedding for Automated Audio Captioning
por: Kim, Jaeyeon, et al.
Publicado: (2024)
por: Kim, Jaeyeon, et al.
Publicado: (2024)
The Sounds of Home: A Speech-Removed Residential Audio Dataset for Sound Event Detection
por: Bibbó, Gabriel, et al.
Publicado: (2024)
por: Bibbó, Gabriel, et al.
Publicado: (2024)
A Framework for Synthetic Audio Conversations Generation using Large Language Models
por: Kyaw, Kaung Myat, et al.
Publicado: (2024)
por: Kyaw, Kaung Myat, et al.
Publicado: (2024)
GOAT: A Large Dataset of Paired Guitar Audio Recordings and Tablatures
por: Loth, Jackson, et al.
Publicado: (2025)
por: Loth, Jackson, et al.
Publicado: (2025)
In-the-wild Audio Spatialization with Flexible Text-guided Localization
por: Pan, Tianrui, et al.
Publicado: (2025)
por: Pan, Tianrui, et al.
Publicado: (2025)
Universal Sound Separation with Self-Supervised Audio Masked Autoencoder
por: Zhao, Junqi, et al.
Publicado: (2024)
por: Zhao, Junqi, et al.
Publicado: (2024)
Domain Adaptation Method and Modality Gap Impact in Audio-Text Models for Prototypical Sound Classification
por: Acevedo, Emiliano, et al.
Publicado: (2025)
por: Acevedo, Emiliano, et al.
Publicado: (2025)
Audio Mamba: Pretrained Audio State Space Model For Audio Tagging
por: Lin, Jiaju, et al.
Publicado: (2024)
por: Lin, Jiaju, et al.
Publicado: (2024)
TTMBA: Towards Text To Multiple Sources Binaural Audio Generation
por: He, Yuxuan, et al.
Publicado: (2025)
por: He, Yuxuan, et al.
Publicado: (2025)
Audio Deepfake Detection in the Age of Advanced Text-to-Speech models
por: Singh, Robin, et al.
Publicado: (2026)
por: Singh, Robin, et al.
Publicado: (2026)
Revisiting Deep Audio-Text Retrieval Through the Lens of Transportation
por: Luong, Manh, et al.
Publicado: (2024)
por: Luong, Manh, et al.
Publicado: (2024)
Embedding Alignment in Code Generation for Audio
por: Kouteili, Sam, et al.
Publicado: (2025)
por: Kouteili, Sam, et al.
Publicado: (2025)
Sommelier: Scalable Open Multi-turn Audio Pre-processing for Full-duplex Speech Language Models
por: Jung, Kyudan, et al.
Publicado: (2026)
por: Jung, Kyudan, et al.
Publicado: (2026)
Prior-agnostic Multi-scale Contrastive Text-Audio Pre-training for Parallelized TTS Frontend Modeling
por: Wang, Quanxiu, et al.
Publicado: (2024)
por: Wang, Quanxiu, et al.
Publicado: (2024)
Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech
por: Kim, Nam-Gyu, et al.
Publicado: (2025)
por: Kim, Nam-Gyu, et al.
Publicado: (2025)
Compressing Quaternion Convolutional Neural Networks for Audio Classification
por: Singh, Arshdeep, et al.
Publicado: (2025)
por: Singh, Arshdeep, et al.
Publicado: (2025)
DiffCSS: Diverse and Expressive Conversational Speech Synthesis with Diffusion Models
por: wu, Weihao, et al.
Publicado: (2025)
por: wu, Weihao, et al.
Publicado: (2025)
Neural-Enhanced Dynamic Range Compression Inversion: A Hybrid Approach for Restoring Audio Dynamics
por: Sun, Haoran, et al.
Publicado: (2024)
por: Sun, Haoran, et al.
Publicado: (2024)
Expressive Music Data Processing and Generation
por: Liu, Jingwei
Publicado: (2025)
por: Liu, Jingwei
Publicado: (2025)
Audio Mamba: Bidirectional State Space Model for Audio Representation Learning
por: Erol, Mehmet Hamza, et al.
Publicado: (2024)
por: Erol, Mehmet Hamza, et al.
Publicado: (2024)
Expressive MIDI-format Piano Performance Generation
por: Liu, Jingwei
Publicado: (2024)
por: Liu, Jingwei
Publicado: (2024)
Audio Prompt Adapter: Unleashing Music Editing Abilities for Text-to-Music with Lightweight Finetuning
por: Tsai, Fang-Duo, et al.
Publicado: (2024)
por: Tsai, Fang-Duo, et al.
Publicado: (2024)
ATRI: Mitigating Multilingual Audio Text Retrieval Inconsistencies by Reducing Data Distribution Errors
por: Yin, Yuguo, et al.
Publicado: (2025)
por: Yin, Yuguo, et al.
Publicado: (2025)
Integrating IP Broadcasting with Audio Tags: Workflow and Challenges
por: Burchett-Vass, Rhys, et al.
Publicado: (2024)
por: Burchett-Vass, Rhys, et al.
Publicado: (2024)
CORD: Bridging the Audio-Text Reasoning Gap via Weighted On-policy Cross-modal Distillation
por: Hu, Jing, et al.
Publicado: (2026)
por: Hu, Jing, et al.
Publicado: (2026)
Text Prompt is Not Enough: Sound Event Enhanced Prompt Adapter for Target Style Audio Generation
por: Xiong, Chenxu, et al.
Publicado: (2024)
por: Xiong, Chenxu, et al.
Publicado: (2024)
MIDI-VALLE: Improving Expressive Piano Performance Synthesis Through Neural Codec Language Modelling
por: Tang, Jingjing, et al.
Publicado: (2025)
por: Tang, Jingjing, et al.
Publicado: (2025)
UltraEval-Audio: A Unified Framework for Comprehensive Evaluation of Audio Foundation Models
por: Shi, Qundong, et al.
Publicado: (2026)
por: Shi, Qundong, et al.
Publicado: (2026)
Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models
por: Yang, Wanqi, et al.
Publicado: (2024)
por: Yang, Wanqi, et al.
Publicado: (2024)
Ejemplares similares
-
DreamAudio: Customized Text-to-Audio Generation with Diffusion Models
por: Yuan, Yi, et al.
Publicado: (2025) -
Compositional Audio Representation Learning
por: Sridhar, Sripathi, et al.
Publicado: (2024) -
AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion
por: Zhao, Junqi, et al.
Publicado: (2025) -
Retrieval-Augmented Text-to-Audio Generation
por: Yuan, Yi, et al.
Publicado: (2023) -
CTC-aligned Audio-Text Embedding for Streaming Open-vocabulary Keyword Spotting
por: Jin, Sichen, et al.
Publicado: (2024)