Salvato in:
| Autori principali: | Li, Kai, Luo, Yi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2409.08514 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
TDFNet: An Efficient Audio-Visual Speech Separation Model with Top-down Fusion
di: Pegg, Samuel, et al.
Pubblicazione: (2024)
di: Pegg, Samuel, et al.
Pubblicazione: (2024)
DreamAudio: Customized Text-to-Audio Generation with Diffusion Models
di: Yuan, Yi, et al.
Pubblicazione: (2025)
di: Yuan, Yi, et al.
Pubblicazione: (2025)
AHAMask: Reliable Task Specification for Large Audio Language Models without Instructions
di: Guo, Yiwei, et al.
Pubblicazione: (2025)
di: Guo, Yiwei, et al.
Pubblicazione: (2025)
Efficient Autoregressive Audio Modeling via Next-Scale Prediction
di: Qiu, Kai, et al.
Pubblicazione: (2024)
di: Qiu, Kai, et al.
Pubblicazione: (2024)
Does Current Deepfake Audio Detection Model Effectively Detect ALM-based Deepfake Audio?
di: Xie, Yuankun, et al.
Pubblicazione: (2024)
di: Xie, Yuankun, et al.
Pubblicazione: (2024)
Neural-Enhanced Dynamic Range Compression Inversion: A Hybrid Approach for Restoring Audio Dynamics
di: Sun, Haoran, et al.
Pubblicazione: (2024)
di: Sun, Haoran, et al.
Pubblicazione: (2024)
UltraEval-Audio: A Unified Framework for Comprehensive Evaluation of Audio Foundation Models
di: Shi, Qundong, et al.
Pubblicazione: (2026)
di: Shi, Qundong, et al.
Pubblicazione: (2026)
Audio Mamba: Pretrained Audio State Space Model For Audio Tagging
di: Lin, Jiaju, et al.
Pubblicazione: (2024)
di: Lin, Jiaju, et al.
Pubblicazione: (2024)
AudioRole: An Audio Dataset for Character Role-Playing in Large Language Models
di: Li, Wenyu, et al.
Pubblicazione: (2025)
di: Li, Wenyu, et al.
Pubblicazione: (2025)
AudioScene: Integrating Object-Event Audio into 3D Scenes
di: Yuan, Shuaihang, et al.
Pubblicazione: (2025)
di: Yuan, Shuaihang, et al.
Pubblicazione: (2025)
Enhancing Partially Spoofed Audio Localization with Boundary-aware Attention Mechanism
di: Zhong, Jiafeng, et al.
Pubblicazione: (2024)
di: Zhong, Jiafeng, et al.
Pubblicazione: (2024)
SLIM: Style-Linguistics Mismatch Model for Generalized Audio Deepfake Detection
di: Zhu, Yi, et al.
Pubblicazione: (2024)
di: Zhu, Yi, et al.
Pubblicazione: (2024)
Reject Threshold Adaptation for Open-Set Model Attribution of Deepfake Audio
di: Yan, Xinrui, et al.
Pubblicazione: (2024)
di: Yan, Xinrui, et al.
Pubblicazione: (2024)
Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models
di: Song, Zirui, et al.
Pubblicazione: (2025)
di: Song, Zirui, et al.
Pubblicazione: (2025)
Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models
di: Yang, Wanqi, et al.
Pubblicazione: (2024)
di: Yang, Wanqi, et al.
Pubblicazione: (2024)
HyperPotter: Spell the Charm of High-Order Interactions in Audio Deepfake Detection
di: Wen, Qing, et al.
Pubblicazione: (2026)
di: Wen, Qing, et al.
Pubblicazione: (2026)
AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models
di: Yang, Chih-Kai, et al.
Pubblicazione: (2025)
di: Yang, Chih-Kai, et al.
Pubblicazione: (2025)
Audio Mamba: Bidirectional State Space Model for Audio Representation Learning
di: Erol, Mehmet Hamza, et al.
Pubblicazione: (2024)
di: Erol, Mehmet Hamza, et al.
Pubblicazione: (2024)
Audio Deepfake Attribution: An Initial Dataset and Investigation
di: Yan, Xinrui, et al.
Pubblicazione: (2022)
di: Yan, Xinrui, et al.
Pubblicazione: (2022)
Representation-Regularized Convolutional Audio Transformer for Audio Understanding
di: Han, Bing, et al.
Pubblicazione: (2026)
di: Han, Bing, et al.
Pubblicazione: (2026)
Robust Generative Audio Quality Assessment: Disentangling Quality from Spurious Correlations
di: Huang, Kuan-Tang, et al.
Pubblicazione: (2026)
di: Huang, Kuan-Tang, et al.
Pubblicazione: (2026)
How Do Neural Spoofing Countermeasures Detect Partially Spoofed Audio?
di: Liu, Tianchi, et al.
Pubblicazione: (2024)
di: Liu, Tianchi, et al.
Pubblicazione: (2024)
The Codecfake Dataset and Countermeasures for the Universally Detection of Deepfake Audio
di: Xie, Yuankun, et al.
Pubblicazione: (2024)
di: Xie, Yuankun, et al.
Pubblicazione: (2024)
FunAudioLLM: Voice Understanding and Generation Foundation Models for Natural Interaction Between Humans and LLMs
di: An, Keyu, et al.
Pubblicazione: (2024)
di: An, Keyu, et al.
Pubblicazione: (2024)
Kling-Foley: Multimodal Diffusion Transformer for High-Quality Video-to-Audio Generation
di: Wang, Jun, et al.
Pubblicazione: (2025)
di: Wang, Jun, et al.
Pubblicazione: (2025)
LHQ-SVC: Lightweight and High Quality Singing Voice Conversion Modeling
di: Huang, Yubo, et al.
Pubblicazione: (2024)
di: Huang, Yubo, et al.
Pubblicazione: (2024)
Audio Explanation Synthesis with Generative Foundation Models
di: Akman, Alican, et al.
Pubblicazione: (2024)
di: Akman, Alican, et al.
Pubblicazione: (2024)
Audio Atlas: Visualizing and Exploring Audio Datasets
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2024)
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2024)
AudioRouter: Data Efficient Audio Understanding via RL based Dual Reasoning
di: Chen, Liyang, et al.
Pubblicazione: (2026)
di: Chen, Liyang, et al.
Pubblicazione: (2026)
MoE Adapter for Large Audio Language Models: Sparsity, Disentanglement, and Gradient-Conflict-Free
di: Lei, Yishu, et al.
Pubblicazione: (2026)
di: Lei, Yishu, et al.
Pubblicazione: (2026)
Decoding Ambiguous Emotions with Test-Time Scaling in Audio-Language Models
di: Jia, Hong, et al.
Pubblicazione: (2026)
di: Jia, Hong, et al.
Pubblicazione: (2026)
Codecfake: An Initial Dataset for Detecting LLM-based Deepfake Audio
di: Lu, Yi, et al.
Pubblicazione: (2024)
di: Lu, Yi, et al.
Pubblicazione: (2024)
Audio Spatially-Guided Fusion for Audio-Visual Navigation
di: Zhou, Xinyu, et al.
Pubblicazione: (2026)
di: Zhou, Xinyu, et al.
Pubblicazione: (2026)
EnCLAP: Combining Neural Audio Codec and Audio-Text Joint Embedding for Automated Audio Captioning
di: Kim, Jaeyeon, et al.
Pubblicazione: (2024)
di: Kim, Jaeyeon, et al.
Pubblicazione: (2024)
AND: Audio Network Dissection for Interpreting Deep Acoustic Models
di: Wu, Tung-Yu, et al.
Pubblicazione: (2024)
di: Wu, Tung-Yu, et al.
Pubblicazione: (2024)
FoleyBench: A Benchmark For Video-to-Audio Models
di: Dixit, Satvik, et al.
Pubblicazione: (2025)
di: Dixit, Satvik, et al.
Pubblicazione: (2025)
Expressive Range Characterization of Open Text-to-Audio Models
di: Morse, Jonathan, et al.
Pubblicazione: (2025)
di: Morse, Jonathan, et al.
Pubblicazione: (2025)
Universal Sound Separation with Self-Supervised Audio Masked Autoencoder
di: Zhao, Junqi, et al.
Pubblicazione: (2024)
di: Zhao, Junqi, et al.
Pubblicazione: (2024)
OmniCustom: Sync Audio-Video Customization Via Joint Audio-Video Generation Model
di: Li, Maomao, et al.
Pubblicazione: (2026)
di: Li, Maomao, et al.
Pubblicazione: (2026)
AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion
di: Zhao, Junqi, et al.
Pubblicazione: (2025)
di: Zhao, Junqi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
TDFNet: An Efficient Audio-Visual Speech Separation Model with Top-down Fusion
di: Pegg, Samuel, et al.
Pubblicazione: (2024) -
DreamAudio: Customized Text-to-Audio Generation with Diffusion Models
di: Yuan, Yi, et al.
Pubblicazione: (2025) -
AHAMask: Reliable Task Specification for Large Audio Language Models without Instructions
di: Guo, Yiwei, et al.
Pubblicazione: (2025) -
Efficient Autoregressive Audio Modeling via Next-Scale Prediction
di: Qiu, Kai, et al.
Pubblicazione: (2024) -
Does Current Deepfake Audio Detection Model Effectively Detect ALM-based Deepfake Audio?
di: Xie, Yuankun, et al.
Pubblicazione: (2024)