Enregistré dans:
| Auteur principal: | Coelho, Guilherme |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2511.17404 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Semantic and Semiotic Interplays in Text-to-Audio AI: Exploring Cognitive Dynamics and Musical Interactions
par: Coelho, Guilherme
Publié: (2025)
par: Coelho, Guilherme
Publié: (2025)
CAFA: a Controllable Automatic Foley Artist
par: Benita, Roi, et autres
Publié: (2025)
par: Benita, Roi, et autres
Publié: (2025)
AI in Music and Sound: Pedagogical Reflections, Post-Structuralist Approaches and Creative Outcomes in Seminar Practice
par: Coelho, Guilherme
Publié: (2025)
par: Coelho, Guilherme
Publié: (2025)
Music Era Recognition Using Supervised Contrastive Learning and Artist Information
par: He, Qiqi, et autres
Publié: (2024)
par: He, Qiqi, et autres
Publié: (2024)
Breaking the Barriers of Text-Hungry and Audio-Deficient AI
par: Tembine, Hamidou, et autres
Publié: (2025)
par: Tembine, Hamidou, et autres
Publié: (2025)
Source Tracing of Audio Deepfake Systems
par: Klein, Nicholas, et autres
Publié: (2024)
par: Klein, Nicholas, et autres
Publié: (2024)
Past, Present, and Future of Spatial Audio and Room Acoustics
par: Koyama, Shoichi, et autres
Publié: (2025)
par: Koyama, Shoichi, et autres
Publié: (2025)
Open-Set Source Tracing of Audio Deepfake Systems
par: Klein, Nicholas, et autres
Publié: (2025)
par: Klein, Nicholas, et autres
Publié: (2025)
AudioLCM: Text-to-Audio Generation with Latent Consistency Models
par: Liu, Huadai, et autres
Publié: (2024)
par: Liu, Huadai, et autres
Publié: (2024)
EzAudio: Enhancing Text-to-Audio Generation with Efficient Diffusion Transformer
par: Hai, Jiarui, et autres
Publié: (2024)
par: Hai, Jiarui, et autres
Publié: (2024)
FlashAudio: Rectified Flows for Fast and High-Fidelity Text-to-Audio Generation
par: Liu, Huadai, et autres
Publié: (2024)
par: Liu, Huadai, et autres
Publié: (2024)
RPRA-ADD: Forgery Trace Enhancement-Driven Audio Deepfake Detection
par: Fu, Ruibo, et autres
Publié: (2025)
par: Fu, Ruibo, et autres
Publié: (2025)
AudioSpa: Spatializing Sound Events with Text
par: Feng, Linfeng, et autres
Publié: (2025)
par: Feng, Linfeng, et autres
Publié: (2025)
Cacophony: An Improved Contrastive Audio-Text Model
par: Zhu, Ge, et autres
Publié: (2024)
par: Zhu, Ge, et autres
Publié: (2024)
Enhancing Crowdsourced Audio for Text-to-Speech Models
par: Giraldo, José, et autres
Publié: (2024)
par: Giraldo, José, et autres
Publié: (2024)
Towards Weakly Supervised Text-to-Audio Grounding
par: Xu, Xuenan, et autres
Publié: (2024)
par: Xu, Xuenan, et autres
Publié: (2024)
AudioEval: Automatic Dual-Perspective and Multi-Dimensional Evaluation of Text-to-Audio-Generation
par: Wang, Hui, et autres
Publié: (2025)
par: Wang, Hui, et autres
Publié: (2025)
Refining Knowledge Transfer on Audio-Image Temporal Agreement for Audio-Text Cross Retrieval
par: Tsubaki, Shunsuke, et autres
Publié: (2024)
par: Tsubaki, Shunsuke, et autres
Publié: (2024)
PAT: Parameter-Free Audio-Text Aligner to Boost Zero-Shot Audio Classification
par: Seth, Ashish, et autres
Publié: (2024)
par: Seth, Ashish, et autres
Publié: (2024)
Text2FX: Harnessing CLAP Embeddings for Text-Guided Audio Effects
par: Chu, Annie, et autres
Publié: (2024)
par: Chu, Annie, et autres
Publié: (2024)
T2A-Feedback: Improving Basic Capabilities of Text-to-Audio Generation via Fine-grained AI Feedback
par: Wang, Zehan, et autres
Publié: (2025)
par: Wang, Zehan, et autres
Publié: (2025)
Codec-Based Deepfake Source Tracing via Neural Audio Codec Taxonomy
par: Chen, Xuanjun, et autres
Publié: (2025)
par: Chen, Xuanjun, et autres
Publié: (2025)
AudioGAN: A Compact and Efficient Framework for Real-Time High-Fidelity Text-to-Audio Generation
par: Chung, HaeChun
Publié: (2025)
par: Chung, HaeChun
Publié: (2025)
MATS: An Audio Language Model under Text-only Supervision
par: Wang, Wen, et autres
Publié: (2025)
par: Wang, Wen, et autres
Publié: (2025)
PPPR: Portable Plug-in Prompt Refiner for Text to Audio Generation
par: Shi, Shuchen, et autres
Publié: (2024)
par: Shi, Shuchen, et autres
Publié: (2024)
From Contrast to Commonality: Audio Commonality Captioning for Enhanced Audio-Text Cross-modal Understanding in Multimodal LLMs
par: Jia, Yuhang, et autres
Publié: (2025)
par: Jia, Yuhang, et autres
Publié: (2025)
Improving Audio Captioning Models with Fine-grained Audio Features, Text Embedding Supervision, and LLM Mix-up Augmentation
par: Wu, Shih-Lun, et autres
Publié: (2023)
par: Wu, Shih-Lun, et autres
Publié: (2023)
TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models
par: Wang, Hui, et autres
Publié: (2025)
par: Wang, Hui, et autres
Publié: (2025)
Comparative Evaluation of Text and Audio Simplification: A Methodological Replication Study
par: Barai, Prosanta, et autres
Publié: (2025)
par: Barai, Prosanta, et autres
Publié: (2025)
Leveraging Audio-Only Data for Text-Queried Target Sound Extraction
par: Saijo, Kohei, et autres
Publié: (2024)
par: Saijo, Kohei, et autres
Publié: (2024)
Joint Audio and Symbolic Conditioning for Temporally Controlled Text-to-Music Generation
par: Tal, Or, et autres
Publié: (2024)
par: Tal, Or, et autres
Publié: (2024)
SILA: Signal-to-Language Augmentation for Enhanced Control in Text-to-Audio Generation
par: Kumar, Sonal, et autres
Publié: (2024)
par: Kumar, Sonal, et autres
Publié: (2024)
LAFMA: A Latent Flow Matching Model for Text-to-Audio Generation
par: Guan, Wenhao, et autres
Publié: (2024)
par: Guan, Wenhao, et autres
Publié: (2024)
Exploring Text-Queried Sound Event Detection with Audio Source Separation
par: Yin, Han, et autres
Publié: (2024)
par: Yin, Han, et autres
Publié: (2024)
DAIEN-TTS: Disentangled Audio Infilling for Environment-Aware Text-to-Speech Synthesis
par: Lu, Ye-Xin, et autres
Publié: (2025)
par: Lu, Ye-Xin, et autres
Publié: (2025)
IMPACT: Iterative Mask-based Parallel Decoding for Text-to-Audio Generation with Diffusion Modeling
par: Huang, Kuan-Po, et autres
Publié: (2025)
par: Huang, Kuan-Po, et autres
Publié: (2025)
Improving Audio-Text Retrieval via Hierarchical Cross-Modal Interaction and Auxiliary Captions
par: Xin, Yifei, et autres
Publié: (2023)
par: Xin, Yifei, et autres
Publié: (2023)
Investigating Group Relative Policy Optimization for Diffusion Transformer based Text-to-Audio Generation
par: Gu, Yi, et autres
Publié: (2026)
par: Gu, Yi, et autres
Publié: (2026)
A Detailed Audio-Text Data Simulation Pipeline using Single-Event Sounds
par: Xu, Xuenan, et autres
Publié: (2024)
par: Xu, Xuenan, et autres
Publié: (2024)
DOTA-ME-CS: Daily Oriented Text Audio-Mandarin English-Code Switching Dataset
par: Li, Yupei, et autres
Publié: (2025)
par: Li, Yupei, et autres
Publié: (2025)
Documents similaires
-
Semantic and Semiotic Interplays in Text-to-Audio AI: Exploring Cognitive Dynamics and Musical Interactions
par: Coelho, Guilherme
Publié: (2025) -
CAFA: a Controllable Automatic Foley Artist
par: Benita, Roi, et autres
Publié: (2025) -
AI in Music and Sound: Pedagogical Reflections, Post-Structuralist Approaches and Creative Outcomes in Seminar Practice
par: Coelho, Guilherme
Publié: (2025) -
Music Era Recognition Using Supervised Contrastive Learning and Artist Information
par: He, Qiqi, et autres
Publié: (2024) -
Breaking the Barriers of Text-Hungry and Audio-Deficient AI
par: Tembine, Hamidou, et autres
Publié: (2025)