A Multi-Agent AI Framework for Immersive Audiobook Production through Spatial Audio and Neural Narration
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Selvamani, Shaja Arul, Ganapathy, Nia D'Souza |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Revival: Collaborative Artistic Creation through Human-AI Interactions in Musical Creativity
par: Lee, Keon Ju M., et autres
Publié: (2025)
par: Lee, Keon Ju M., et autres
Publié: (2025)
Dopamine Audiobook: A Training-free MLLM Agent for Emotional and Immersive Audiobook Generation
par: Rong, Yan, et autres
Publié: (2025)
par: Rong, Yan, et autres
Publié: (2025)
AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation
par: Rong, Yan, et autres
Publié: (2025)
par: Rong, Yan, et autres
Publié: (2025)
MR-DAW: Towards Collaborative Digital Audio Workstations in Mixed Reality
par: Hopkins, Torin, et autres
Publié: (2026)
par: Hopkins, Torin, et autres
Publié: (2026)
AVE Speech: A Comprehensive Multi-Modal Dataset for Speech Recognition Integrating Audio, Visual, and Electromyographic Signals
par: Zhou, Dongliang, et autres
Publié: (2025)
par: Zhou, Dongliang, et autres
Publié: (2025)
Capturing Cancer as Music: Cancer Mechanisms Expressed through Musification
par: Hnatyshyn, Rostyslav, et autres
Publié: (2024)
par: Hnatyshyn, Rostyslav, et autres
Publié: (2024)
Towards Reliable Large Audio Language Model
par: Ma, Ziyang, et autres
Publié: (2025)
par: Ma, Ziyang, et autres
Publié: (2025)
Real-Time Word-Level Temporal Segmentation in Streaming Speech Recognition
par: Nishida, Naoto, et autres
Publié: (2025)
par: Nishida, Naoto, et autres
Publié: (2025)
Assessing the Viability of Wave Field Synthesis in VR-Based Cognitive Research
par: Kahl, Benjamin
Publié: (2025)
par: Kahl, Benjamin
Publié: (2025)
Creating Aesthetic Sonifications on the Web with SIREN
par: Peng, Tristan, et autres
Publié: (2024)
par: Peng, Tristan, et autres
Publié: (2024)
Robust Dual-Modal Speech Keyword Spotting for XR Headsets
par: Cai, Zhuojiang, et autres
Publié: (2024)
par: Cai, Zhuojiang, et autres
Publié: (2024)
VidTune: Creating Video Soundtracks with Generative Music and Contextual Thumbnails
par: Huh, Mina, et autres
Publié: (2026)
par: Huh, Mina, et autres
Publié: (2026)
NeoLightning: A Modern Reimagination of Gesture-Based Sound Design
par: Kim, Yonghyun, et autres
Publié: (2025)
par: Kim, Yonghyun, et autres
Publié: (2025)
An Agent-Based Framework for Automated Higher-Voice Harmony Generation
par: Ganapathy, Nia D'Souza, et autres
Publié: (2025)
par: Ganapathy, Nia D'Souza, et autres
Publié: (2025)
Sonic4D: Spatial Audio Generation for Immersive 4D Scene Exploration
par: Xie, Siyi, et autres
Publié: (2025)
par: Xie, Siyi, et autres
Publié: (2025)
ISDrama: Immersive Spatial Drama Generation through Multimodal Prompting
par: Zhang, Yu, et autres
Publié: (2025)
par: Zhang, Yu, et autres
Publié: (2025)
PodAgent: A Comprehensive Framework for Podcast Generation
par: Xiao, Yujia, et autres
Publié: (2025)
par: Xiao, Yujia, et autres
Publié: (2025)
Flowers Revisited: A Preliminary Replication of Flowers et al. 1997
par: Enge, Kajetan, et autres
Publié: (2024)
par: Enge, Kajetan, et autres
Publié: (2024)
Proceedings of The second international workshop on eXplainable AI for the Arts (XAIxArts)
par: Bryan-Kinns, Nick, et autres
Publié: (2024)
par: Bryan-Kinns, Nick, et autres
Publié: (2024)
AI TrackMate: Finally, Someone Who Will Give Your Music More Than Just "Sounds Great!"
par: Jiang, Yi-Lin, et autres
Publié: (2024)
par: Jiang, Yi-Lin, et autres
Publié: (2024)
MetaBGM: Dynamic Soundtrack Transformation For Continuous Multi-Scene Experiences With Ambient Awareness And Personalization
par: Liu, Haoxuan, et autres
Publié: (2024)
par: Liu, Haoxuan, et autres
Publié: (2024)
Workflow-Based Evaluation of Music Generation Systems
par: Dadman, Shayan, et autres
Publié: (2025)
par: Dadman, Shayan, et autres
Publié: (2025)
Freetalker: Controllable Speech and Text-Driven Gesture Generation Based on Diffusion Models for Enhanced Speaker Naturalness
par: Yang, Sicheng, et autres
Publié: (2024)
par: Yang, Sicheng, et autres
Publié: (2024)
G-STAR: End-to-End Global Speaker-Tracking Attributed Recognition
par: Peng, Jing, et autres
Publié: (2026)
par: Peng, Jing, et autres
Publié: (2026)
Musical Agent Systems: MACAT and MACataRT
par: Lee, Keon Ju M., et autres
Publié: (2025)
par: Lee, Keon Ju M., et autres
Publié: (2025)
HiCMAE: Hierarchical Contrastive Masked Autoencoder for Self-Supervised Audio-Visual Emotion Recognition
par: Sun, Licai, et autres
Publié: (2024)
par: Sun, Licai, et autres
Publié: (2024)
Think Before You Segment: An Object-aware Reasoning Agent for Referring Audio-Visual Segmentation
par: Zhou, Jinxing, et autres
Publié: (2025)
par: Zhou, Jinxing, et autres
Publié: (2025)
SAVGBench: Benchmarking Spatially Aligned Audio-Video Generation
par: Shimada, Kazuki, et autres
Publié: (2024)
par: Shimada, Kazuki, et autres
Publié: (2024)
Acoustic Wave Modeling Using 2D FDTD: Applications in Unreal Engine For Dynamic Sound Rendering
par: Samsurya, Bilkent
Publié: (2025)
par: Samsurya, Bilkent
Publié: (2025)
DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2
par: Zhang, Fan, et autres
Publié: (2024)
par: Zhang, Fan, et autres
Publié: (2024)
Rhythmic Foley: A Framework For Seamless Audio-Visual Alignment In Video-to-Audio Synthesis
par: Huang, Zhiqi, et autres
Publié: (2024)
par: Huang, Zhiqi, et autres
Publié: (2024)
Towards Streaming Synchronized Spatial Audio Generation via Autoregressive Diffusion Transformer
par: Lei, Ke, et autres
Publié: (2026)
par: Lei, Ke, et autres
Publié: (2026)
Quality-Aware End-to-End Audio-Visual Neural Speaker Diarization
par: He, Mao-Kui, et autres
Publié: (2024)
par: He, Mao-Kui, et autres
Publié: (2024)
MuseAgent-1: Interactive Grounded Multimodal Understanding of Music Scores and Performance Audio
par: Zhao, Qihao, et autres
Publié: (2026)
par: Zhao, Qihao, et autres
Publié: (2026)
MIST: Multimodal Interactive Speech-based Tool-calling Conversational Assistants for Smart Homes
par: Chen, Maximillian, et autres
Publié: (2026)
par: Chen, Maximillian, et autres
Publié: (2026)
Soundify: Matching Sound Effects to Video
par: Lin, David Chuan-En, et autres
Publié: (2021)
par: Lin, David Chuan-En, et autres
Publié: (2021)
Audio-Language Models for Audio-Centric Tasks: A Systematic Survey
par: Su, Yi, et autres
Publié: (2025)
par: Su, Yi, et autres
Publié: (2025)
A Framework for AI assisted Musical Devices
par: Civit, Miguel, et autres
Publié: (2024)
par: Civit, Miguel, et autres
Publié: (2024)
Building Audio-Visual Digital Twins with Smartphones
par: Lan, Zitong, et autres
Publié: (2025)
par: Lan, Zitong, et autres
Publié: (2025)
Trusted Fake Audio Detection Based on Dirichlet Distribution
par: Ding, Chi, et autres
Publié: (2025)
par: Ding, Chi, et autres
Publié: (2025)
Documents similaires
-
Revival: Collaborative Artistic Creation through Human-AI Interactions in Musical Creativity
par: Lee, Keon Ju M., et autres
Publié: (2025) -
Dopamine Audiobook: A Training-free MLLM Agent for Emotional and Immersive Audiobook Generation
par: Rong, Yan, et autres
Publié: (2025) -
AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation
par: Rong, Yan, et autres
Publié: (2025) -
MR-DAW: Towards Collaborative Digital Audio Workstations in Mixed Reality
par: Hopkins, Torin, et autres
Publié: (2026) -
AVE Speech: A Comprehensive Multi-Modal Dataset for Speech Recognition Integrating Audio, Visual, and Electromyographic Signals
par: Zhou, Dongliang, et autres
Publié: (2025)