AudioScene: Integrating Object-Event Audio into 3D Scenes
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yuan, Shuaihang, Wen, Congcong, Shafique, Muhammad, Tzes, Anthony, Fang, Yi |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Audio-Language Datasets of Scenes and Events: A Survey
par: Wijngaard, Gijs, et autres
Publié: (2024)
par: Wijngaard, Gijs, et autres
Publié: (2024)
DreamAudio: Customized Text-to-Audio Generation with Diffusion Models
par: Yuan, Yi, et autres
Publié: (2025)
par: Yuan, Yi, et autres
Publié: (2025)
AudioCIL: A Python Toolbox for Audio Class-Incremental Learning with Multiple Scenes
par: Xu, Qisheng, et autres
Publié: (2024)
par: Xu, Qisheng, et autres
Publié: (2024)
Audio Mamba: Pretrained Audio State Space Model For Audio Tagging
par: Lin, Jiaju, et autres
Publié: (2024)
par: Lin, Jiaju, et autres
Publié: (2024)
Does Current Deepfake Audio Detection Model Effectively Detect ALM-based Deepfake Audio?
par: Xie, Yuankun, et autres
Publié: (2024)
par: Xie, Yuankun, et autres
Publié: (2024)
Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models
par: Yang, Wanqi, et autres
Publié: (2024)
par: Yang, Wanqi, et autres
Publié: (2024)
Audio Atlas: Visualizing and Exploring Audio Datasets
par: Lanzendörfer, Luca A., et autres
Publié: (2024)
par: Lanzendörfer, Luca A., et autres
Publié: (2024)
Text Prompt is Not Enough: Sound Event Enhanced Prompt Adapter for Target Style Audio Generation
par: Xiong, Chenxu, et autres
Publié: (2024)
par: Xiong, Chenxu, et autres
Publié: (2024)
The Codecfake Dataset and Countermeasures for the Universally Detection of Deepfake Audio
par: Xie, Yuankun, et autres
Publié: (2024)
par: Xie, Yuankun, et autres
Publié: (2024)
Representation-Regularized Convolutional Audio Transformer for Audio Understanding
par: Han, Bing, et autres
Publié: (2026)
par: Han, Bing, et autres
Publié: (2026)
Audio Spatially-Guided Fusion for Audio-Visual Navigation
par: Zhou, Xinyu, et autres
Publié: (2026)
par: Zhou, Xinyu, et autres
Publié: (2026)
EnCLAP: Combining Neural Audio Codec and Audio-Text Joint Embedding for Automated Audio Captioning
par: Kim, Jaeyeon, et autres
Publié: (2024)
par: Kim, Jaeyeon, et autres
Publié: (2024)
AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion
par: Zhao, Junqi, et autres
Publié: (2025)
par: Zhao, Junqi, et autres
Publié: (2025)
Universal Sound Separation with Self-Supervised Audio Masked Autoencoder
par: Zhao, Junqi, et autres
Publié: (2024)
par: Zhao, Junqi, et autres
Publié: (2024)
Challenge on Sound Scene Synthesis: Evaluating Text-to-Audio Generation
par: Lee, Junwon, et autres
Publié: (2024)
par: Lee, Junwon, et autres
Publié: (2024)
Audio Deepfake Attribution: An Initial Dataset and Investigation
par: Yan, Xinrui, et autres
Publié: (2022)
par: Yan, Xinrui, et autres
Publié: (2022)
Audio Mamba: Bidirectional State Space Model for Audio Representation Learning
par: Erol, Mehmet Hamza, et autres
Publié: (2024)
par: Erol, Mehmet Hamza, et autres
Publié: (2024)
Audio Mamba: Selective State Spaces for Self-Supervised Audio Representations
par: Yadav, Sarthak, et autres
Publié: (2024)
par: Yadav, Sarthak, et autres
Publié: (2024)
Prototype based Masked Audio Model for Self-Supervised Learning of Sound Event Detection
par: Cai, Pengfei, et autres
Publié: (2024)
par: Cai, Pengfei, et autres
Publié: (2024)
The Sounds of Home: A Speech-Removed Residential Audio Dataset for Sound Event Detection
par: Bibbó, Gabriel, et autres
Publié: (2024)
par: Bibbó, Gabriel, et autres
Publié: (2024)
Apollo: Band-sequence Modeling for High-Quality Audio Restoration
par: Li, Kai, et autres
Publié: (2024)
par: Li, Kai, et autres
Publié: (2024)
Efficient Video to Audio Mapper with Visual Scene Detection
par: Yi, Mingjing, et autres
Publié: (2024)
par: Yi, Mingjing, et autres
Publié: (2024)
LiteFocus: Accelerated Diffusion Inference for Long Audio Synthesis
par: Tan, Zhenxiong, et autres
Publié: (2024)
par: Tan, Zhenxiong, et autres
Publié: (2024)
Stable Audio Open
par: Evans, Zach, et autres
Publié: (2024)
par: Evans, Zach, et autres
Publié: (2024)
Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models
par: Song, Zirui, et autres
Publié: (2025)
par: Song, Zirui, et autres
Publié: (2025)
Retrieval-Augmented Text-to-Audio Generation
par: Yuan, Yi, et autres
Publié: (2023)
par: Yuan, Yi, et autres
Publié: (2023)
Codecfake: An Initial Dataset for Detecting LLM-based Deepfake Audio
par: Lu, Yi, et autres
Publié: (2024)
par: Lu, Yi, et autres
Publié: (2024)
SceneFake: An Initial Dataset and Benchmarks for Scene Fake Audio Detection
par: Yi, Jiangyan, et autres
Publié: (2022)
par: Yi, Jiangyan, et autres
Publié: (2022)
Deep Space Separable Distillation for Lightweight Acoustic Scene Classification
par: Ye, ShuQi, et autres
Publié: (2024)
par: Ye, ShuQi, et autres
Publié: (2024)
SLAP: Scalable Language-Audio Pretraining with Variable-Duration Audio and Multi-Objective Training
par: Mei, Xinhao, et autres
Publié: (2026)
par: Mei, Xinhao, et autres
Publié: (2026)
AudioRouter: Data Efficient Audio Understanding via RL based Dual Reasoning
par: Chen, Liyang, et autres
Publié: (2026)
par: Chen, Liyang, et autres
Publié: (2026)
UltraEval-Audio: A Unified Framework for Comprehensive Evaluation of Audio Foundation Models
par: Shi, Qundong, et autres
Publié: (2026)
par: Shi, Qundong, et autres
Publié: (2026)
WavRAG: Audio-Integrated Retrieval Augmented Generation for Spoken Dialogue Models
par: Chen, Yifu, et autres
Publié: (2025)
par: Chen, Yifu, et autres
Publié: (2025)
Region-Based Optimization in Continual Learning for Audio Deepfake Detection
par: Chen, Yujie, et autres
Publié: (2024)
par: Chen, Yujie, et autres
Publié: (2024)
Zero-Shot Parkinson's Disease Detection from Speech: Comparing Large Audio and Language Models
par: Kabir, Muhammad Ashad, et autres
Publié: (2026)
par: Kabir, Muhammad Ashad, et autres
Publié: (2026)
AudioRole: An Audio Dataset for Character Role-Playing in Large Language Models
par: Li, Wenyu, et autres
Publié: (2025)
par: Li, Wenyu, et autres
Publié: (2025)
Audio Prompt Adapter: Unleashing Music Editing Abilities for Text-to-Music with Lightweight Finetuning
par: Tsai, Fang-Duo, et autres
Publié: (2024)
par: Tsai, Fang-Duo, et autres
Publié: (2024)
Enhancing Partially Spoofed Audio Localization with Boundary-aware Attention Mechanism
par: Zhong, Jiafeng, et autres
Publié: (2024)
par: Zhong, Jiafeng, et autres
Publié: (2024)
Unified Audio Event Detection
par: Jiang, Yidi, et autres
Publié: (2024)
par: Jiang, Yidi, et autres
Publié: (2024)
Estimating Musical Surprisal in Audio
par: Bjare, Mathias Rose, et autres
Publié: (2025)
par: Bjare, Mathias Rose, et autres
Publié: (2025)
Documents similaires
-
Audio-Language Datasets of Scenes and Events: A Survey
par: Wijngaard, Gijs, et autres
Publié: (2024) -
DreamAudio: Customized Text-to-Audio Generation with Diffusion Models
par: Yuan, Yi, et autres
Publié: (2025) -
AudioCIL: A Python Toolbox for Audio Class-Incremental Learning with Multiple Scenes
par: Xu, Qisheng, et autres
Publié: (2024) -
Audio Mamba: Pretrained Audio State Space Model For Audio Tagging
par: Lin, Jiaju, et autres
Publié: (2024) -
Does Current Deepfake Audio Detection Model Effectively Detect ALM-based Deepfake Audio?
par: Xie, Yuankun, et autres
Publié: (2024)