Semantic and Semiotic Interplays in Text-to-Audio AI: Exploring Cognitive Dynamics and Musical Interactions
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Coelho, Guilherme |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
The Artist is Present: Traces of Artists Resigind and Spawning in Text-to-Audio AI
par: Coelho, Guilherme
Publié: (2025)
par: Coelho, Guilherme
Publié: (2025)
AI in Music and Sound: Pedagogical Reflections, Post-Structuralist Approaches and Creative Outcomes in Seminar Practice
par: Coelho, Guilherme
Publié: (2025)
par: Coelho, Guilherme
Publié: (2025)
Joint Audio and Symbolic Conditioning for Temporally Controlled Text-to-Music Generation
par: Tal, Or, et autres
Publié: (2024)
par: Tal, Or, et autres
Publié: (2024)
MusicSem: A Semantically Rich Language--Audio Dataset of Natural Music Descriptions
par: Salganik, Rebecca, et autres
Publié: (2026)
par: Salganik, Rebecca, et autres
Publié: (2026)
Breaking the Barriers of Text-Hungry and Audio-Deficient AI
par: Tembine, Hamidou, et autres
Publié: (2025)
par: Tembine, Hamidou, et autres
Publié: (2025)
SemanticAudio: Audio Generation and Editing in Semantic Space
par: Dai, Zheqi, et autres
Publié: (2026)
par: Dai, Zheqi, et autres
Publié: (2026)
From Audio Deepfake Detection to AI-Generated Music Detection -- A Pathway and Overview
par: Li, Yupei, et autres
Publié: (2024)
par: Li, Yupei, et autres
Publié: (2024)
Exploring Text-Queried Sound Event Detection with Audio Source Separation
par: Yin, Han, et autres
Publié: (2024)
par: Yin, Han, et autres
Publié: (2024)
Enhancing Neural Audio Fingerprint Robustness to Audio Degradation for Music Identification
par: Araz, R. Oguz, et autres
Publié: (2025)
par: Araz, R. Oguz, et autres
Publié: (2025)
Improving Audio-Text Retrieval via Hierarchical Cross-Modal Interaction and Auxiliary Captions
par: Xin, Yifei, et autres
Publié: (2023)
par: Xin, Yifei, et autres
Publié: (2023)
MusicEval: A Generative Music Dataset with Expert Ratings for Automatic Text-to-Music Evaluation
par: Liu, Cheng, et autres
Publié: (2025)
par: Liu, Cheng, et autres
Publié: (2025)
Audio Conditioning for Music Generation via Discrete Bottleneck Features
par: Rouard, Simon, et autres
Publié: (2024)
par: Rouard, Simon, et autres
Publié: (2024)
Amphion: An Open-Source Audio, Music and Speech Generation Toolkit
par: Zhang, Xueyao, et autres
Publié: (2023)
par: Zhang, Xueyao, et autres
Publié: (2023)
Semantic Proximity Alignment: Towards Human Perception-consistent Audio Tagging by Aligning with Label Text Description
par: Liu, Wuyang, et autres
Publié: (2023)
par: Liu, Wuyang, et autres
Publié: (2023)
AudioLCM: Text-to-Audio Generation with Latent Consistency Models
par: Liu, Huadai, et autres
Publié: (2024)
par: Liu, Huadai, et autres
Publié: (2024)
Audio Prompt Adapter: Unleashing Music Editing Abilities for Text-to-Music with Lightweight Finetuning
par: Tsai, Fang-Duo, et autres
Publié: (2024)
par: Tsai, Fang-Duo, et autres
Publié: (2024)
FakeMusicCaps: a Dataset for Detection and Attribution of Synthetic Music Generated via Text-to-Music Models
par: Comanducci, Luca, et autres
Publié: (2024)
par: Comanducci, Luca, et autres
Publié: (2024)
Self-Supervised Multi-View Learning for Disentangled Music Audio Representations
par: Wilkins, Julia, et autres
Publié: (2024)
par: Wilkins, Julia, et autres
Publié: (2024)
MuseAgent-1: Interactive Grounded Multimodal Understanding of Music Scores and Performance Audio
par: Zhao, Qihao, et autres
Publié: (2026)
par: Zhao, Qihao, et autres
Publié: (2026)
EzAudio: Enhancing Text-to-Audio Generation with Efficient Diffusion Transformer
par: Hai, Jiarui, et autres
Publié: (2024)
par: Hai, Jiarui, et autres
Publié: (2024)
FlashAudio: Rectified Flows for Fast and High-Fidelity Text-to-Audio Generation
par: Liu, Huadai, et autres
Publié: (2024)
par: Liu, Huadai, et autres
Publié: (2024)
SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding
par: Guinot, Julien, et autres
Publié: (2025)
par: Guinot, Julien, et autres
Publié: (2025)
ESPnet-Codec: Comprehensive Training and Evaluation of Neural Codecs for Audio, Music, and Speech
par: Shi, Jiatong, et autres
Publié: (2024)
par: Shi, Jiatong, et autres
Publié: (2024)
Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning
par: Zhang, Jisi, et autres
Publié: (2025)
par: Zhang, Jisi, et autres
Publié: (2025)
AudioSpa: Spatializing Sound Events with Text
par: Feng, Linfeng, et autres
Publié: (2025)
par: Feng, Linfeng, et autres
Publié: (2025)
Cacophony: An Improved Contrastive Audio-Text Model
par: Zhu, Ge, et autres
Publié: (2024)
par: Zhu, Ge, et autres
Publié: (2024)
Enhancing Crowdsourced Audio for Text-to-Speech Models
par: Giraldo, José, et autres
Publié: (2024)
par: Giraldo, José, et autres
Publié: (2024)
Towards Weakly Supervised Text-to-Audio Grounding
par: Xu, Xuenan, et autres
Publié: (2024)
par: Xu, Xuenan, et autres
Publié: (2024)
AudioEval: Automatic Dual-Perspective and Multi-Dimensional Evaluation of Text-to-Audio-Generation
par: Wang, Hui, et autres
Publié: (2025)
par: Wang, Hui, et autres
Publié: (2025)
Refining Knowledge Transfer on Audio-Image Temporal Agreement for Audio-Text Cross Retrieval
par: Tsubaki, Shunsuke, et autres
Publié: (2024)
par: Tsubaki, Shunsuke, et autres
Publié: (2024)
PAT: Parameter-Free Audio-Text Aligner to Boost Zero-Shot Audio Classification
par: Seth, Ashish, et autres
Publié: (2024)
par: Seth, Ashish, et autres
Publié: (2024)
ITO-Master: Inference-Time Optimization for Audio Effects Modeling of Music Mastering Processors
par: Koo, Junghyun, et autres
Publié: (2025)
par: Koo, Junghyun, et autres
Publié: (2025)
Network Modulation Synthesis: New Algorithms for Generating Musical Audio Using Autoencoder Networks
par: Hyrkas, Jeremy
Publié: (2021)
par: Hyrkas, Jeremy
Publié: (2021)
Can Audio Reveal Music Performance Difficulty? Insights from the Piano Syllabus Dataset
par: Ramoneda, Pedro, et autres
Publié: (2024)
par: Ramoneda, Pedro, et autres
Publié: (2024)
CoPlay: Audio-agnostic Cognitive Scaling for Acoustic Sensing
par: Li, Yin, et autres
Publié: (2024)
par: Li, Yin, et autres
Publié: (2024)
T2A-Feedback: Improving Basic Capabilities of Text-to-Audio Generation via Fine-grained AI Feedback
par: Wang, Zehan, et autres
Publié: (2025)
par: Wang, Zehan, et autres
Publié: (2025)
Video-to-Audio Generation with Fine-grained Temporal Semantics
par: Hu, Yuchen, et autres
Publié: (2024)
par: Hu, Yuchen, et autres
Publié: (2024)
Text2FX: Harnessing CLAP Embeddings for Text-Guided Audio Effects
par: Chu, Annie, et autres
Publié: (2024)
par: Chu, Annie, et autres
Publié: (2024)
Exploring Musical Roots: Applying Audio Embeddings to Empower Influence Attribution for a Generative Music Model
par: Barnett, Julia, et autres
Publié: (2024)
par: Barnett, Julia, et autres
Publié: (2024)
Improving Controllability and Editability for Pretrained Text-to-Music Generation Models
par: Zhang, Yixiao
Publié: (2024)
par: Zhang, Yixiao
Publié: (2024)
Documents similaires
-
The Artist is Present: Traces of Artists Resigind and Spawning in Text-to-Audio AI
par: Coelho, Guilherme
Publié: (2025) -
AI in Music and Sound: Pedagogical Reflections, Post-Structuralist Approaches and Creative Outcomes in Seminar Practice
par: Coelho, Guilherme
Publié: (2025) -
Joint Audio and Symbolic Conditioning for Temporally Controlled Text-to-Music Generation
par: Tal, Or, et autres
Publié: (2024) -
MusicSem: A Semantically Rich Language--Audio Dataset of Natural Music Descriptions
par: Salganik, Rebecca, et autres
Publié: (2026) -
Breaking the Barriers of Text-Hungry and Audio-Deficient AI
par: Tembine, Hamidou, et autres
Publié: (2025)