Salvato in:
| Autori principali: | Zhang, Xuanhao, Li, Chang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2605.04547 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Prompt-aware classifier free guidance for diffusion models
di: Zhang, Xuanhao, et al.
Pubblicazione: (2025)
di: Zhang, Xuanhao, et al.
Pubblicazione: (2025)
Making deep neural networks work for medical audio: representation, compression and domain adaptation
di: Onu, Charles C
Pubblicazione: (2025)
di: Onu, Charles C
Pubblicazione: (2025)
Keep what you need : extracting efficient subnetworks from large audio representation models
di: Genova, David, et al.
Pubblicazione: (2025)
di: Genova, David, et al.
Pubblicazione: (2025)
SS-DPPN: A self-supervised dual-path foundation model for the generalizable cardiac audio representation
di: Muna, Ummy Maria, et al.
Pubblicazione: (2025)
di: Muna, Ummy Maria, et al.
Pubblicazione: (2025)
Sustaining model performance for covid-19 detection from dynamic audio data: Development and evaluation of a comprehensive drift-adaptive framework
di: Ganitidis, Theofanis, et al.
Pubblicazione: (2024)
di: Ganitidis, Theofanis, et al.
Pubblicazione: (2024)
Mellow: a small audio language model for reasoning
di: Deshmukh, Soham, et al.
Pubblicazione: (2025)
di: Deshmukh, Soham, et al.
Pubblicazione: (2025)
Multi-layer attentive probing improves transfer of audio representations for bioacoustics
di: Miron, Marius, et al.
Pubblicazione: (2026)
di: Miron, Marius, et al.
Pubblicazione: (2026)
Where are we in audio deepfake detection? A systematic analysis over generative and detection models
di: Li, Xiang, et al.
Pubblicazione: (2024)
di: Li, Xiang, et al.
Pubblicazione: (2024)
Switchcodec: Adaptive residual-expert sparse quantization for high-fidelity neural audio coding
di: Wang, Xiangbo, et al.
Pubblicazione: (2026)
di: Wang, Xiangbo, et al.
Pubblicazione: (2026)
GRAM: Spatial general-purpose audio representation models for real-world applications
di: Yuksel, Goksenin, et al.
Pubblicazione: (2025)
di: Yuksel, Goksenin, et al.
Pubblicazione: (2025)
DualSpec: Text-to-spatial-audio Generation via Dual-Spectrogram Guided Diffusion Model
di: Zhao, Lei, et al.
Pubblicazione: (2025)
di: Zhao, Lei, et al.
Pubblicazione: (2025)
ADIFF: Explaining audio difference using natural language
di: Deshmukh, Soham, et al.
Pubblicazione: (2025)
di: Deshmukh, Soham, et al.
Pubblicazione: (2025)
AudioMAE++: learning better masked audio representations with SwiGLU FFNs
di: Yadav, Sarthak, et al.
Pubblicazione: (2025)
di: Yadav, Sarthak, et al.
Pubblicazione: (2025)
SongGen: A Single Stage Auto-regressive Transformer for Text-to-Song Generation
di: Liu, Zihan, et al.
Pubblicazione: (2025)
di: Liu, Zihan, et al.
Pubblicazione: (2025)
Learning to reconstruct from saturated data: audio declipping and high-dynamic range imaging
di: Sechaud, Victor, et al.
Pubblicazione: (2026)
di: Sechaud, Victor, et al.
Pubblicazione: (2026)
An overview of neural architectures for self-supervised audio representation learning from masked spectrograms
di: Yadav, Sarthak, et al.
Pubblicazione: (2025)
di: Yadav, Sarthak, et al.
Pubblicazione: (2025)
AISTAT lab system for DCASE2025 Task6: Language-based audio retrieval
di: Kim, Hyun Jun, et al.
Pubblicazione: (2025)
di: Kim, Hyun Jun, et al.
Pubblicazione: (2025)
Enhanced Sound Event Localization and Detection in Real 360-degree audio-visual soundscapes
di: Roman, Adrian S., et al.
Pubblicazione: (2024)
di: Roman, Adrian S., et al.
Pubblicazione: (2024)
Recomposer: Event-roll-guided generative audio editing
di: Ellis, Daniel P. W., et al.
Pubblicazione: (2025)
di: Ellis, Daniel P. W., et al.
Pubblicazione: (2025)
DAST: A Dual-Stream Voice Anonymization Attacker with Staged Training
di: Arefeen, Ridwan, et al.
Pubblicazione: (2026)
di: Arefeen, Ridwan, et al.
Pubblicazione: (2026)
Forensic deepfake audio detection using segmental speech features
di: Yang, Tianle, et al.
Pubblicazione: (2025)
di: Yang, Tianle, et al.
Pubblicazione: (2025)
NatureLM-audio: an Audio-Language Foundation Model for Bioacoustics
di: Robinson, David, et al.
Pubblicazione: (2024)
di: Robinson, David, et al.
Pubblicazione: (2024)
Omni-CLST: Error-aware Curriculum Learning with guided Selective chain-of-Thought for audio question answering
di: Zhao, Jinghua, et al.
Pubblicazione: (2025)
di: Zhao, Jinghua, et al.
Pubblicazione: (2025)
A sound description: Exploring prompt templates and class descriptions to enhance zero-shot audio classification
di: Olvera, Michel, et al.
Pubblicazione: (2024)
di: Olvera, Michel, et al.
Pubblicazione: (2024)
Exploring bat song syllable representations in self-supervised audio encoders
di: Kloots, Marianne de Heer, et al.
Pubblicazione: (2024)
di: Kloots, Marianne de Heer, et al.
Pubblicazione: (2024)
Mask2Flow-TSE: Two-Stage Target Speaker Extraction with Masking and Flow Matching
di: Moon, Junwon, et al.
Pubblicazione: (2026)
di: Moon, Junwon, et al.
Pubblicazione: (2026)
Improving Anomalous Sound Detection with Attribute-aware Representation from Domain-adaptive Pre-training
di: Fang, Xin, et al.
Pubblicazione: (2025)
di: Fang, Xin, et al.
Pubblicazione: (2025)
Joint sentiment analysis of lyrics and audio in music
di: Schaab, Lea, et al.
Pubblicazione: (2024)
di: Schaab, Lea, et al.
Pubblicazione: (2024)
MUGEN: Evaluating and Improving Multi-audio Understanding of Large Audio-Language Models
di: Yang, Chih-Kai, et al.
Pubblicazione: (2026)
di: Yang, Chih-Kai, et al.
Pubblicazione: (2026)
Stage-Adaptive Reliability Modeling for Continuous Valence-Arousal Estimation
di: Lee, Yubeen, et al.
Pubblicazione: (2026)
di: Lee, Yubeen, et al.
Pubblicazione: (2026)
Discriminating real and synthetic super-resolved audio samples using embedding-based classifiers
di: Silaev, Mikhail, et al.
Pubblicazione: (2026)
di: Silaev, Mikhail, et al.
Pubblicazione: (2026)
Discriminant audio properties in deep learning based respiratory insufficiency detection in Brazilian Portuguese
di: Gauy, Marcelo Matheus, et al.
Pubblicazione: (2024)
di: Gauy, Marcelo Matheus, et al.
Pubblicazione: (2024)
Supervised contrastive learning from weakly-labeled audio segments for musical version matching
di: Serrà, Joan, et al.
Pubblicazione: (2025)
di: Serrà, Joan, et al.
Pubblicazione: (2025)
AudioMoG: Guiding Audio Generation with Mixture-of-Guidance
di: Wang, Junyou, et al.
Pubblicazione: (2025)
di: Wang, Junyou, et al.
Pubblicazione: (2025)
End-to-end audio-visual learning for cochlear implant sound coding simulations in noisy environments
di: Lin, Meng-Ping, et al.
Pubblicazione: (2025)
di: Lin, Meng-Ping, et al.
Pubblicazione: (2025)
A Two-Stage Hierarchical Deep Filtering Framework for Real-Time Speech Enhancement
di: Lu, Shenghui, et al.
Pubblicazione: (2025)
di: Lu, Shenghui, et al.
Pubblicazione: (2025)
Eliminating stability hallucinations in llm-based tts models via attention guidance
di: Wang, ShiMing, et al.
Pubblicazione: (2025)
di: Wang, ShiMing, et al.
Pubblicazione: (2025)
Rebellion: Noise-Robust Reasoning Training for Audio Reasoning Models
di: Huang, Tiansheng, et al.
Pubblicazione: (2025)
di: Huang, Tiansheng, et al.
Pubblicazione: (2025)
Hardware-accelerated graph neural networks: an alternative approach for neuromorphic event-based audio classification and keyword spotting on SoC FPGA
di: Jeziorek, Kamil, et al.
Pubblicazione: (2026)
di: Jeziorek, Kamil, et al.
Pubblicazione: (2026)
Stage-Wise and Prior-Aware Neural Speech Phase Prediction
di: Liu, Fei, et al.
Pubblicazione: (2024)
di: Liu, Fei, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Prompt-aware classifier free guidance for diffusion models
di: Zhang, Xuanhao, et al.
Pubblicazione: (2025) -
Making deep neural networks work for medical audio: representation, compression and domain adaptation
di: Onu, Charles C
Pubblicazione: (2025) -
Keep what you need : extracting efficient subnetworks from large audio representation models
di: Genova, David, et al.
Pubblicazione: (2025) -
SS-DPPN: A self-supervised dual-path foundation model for the generalizable cardiac audio representation
di: Muna, Ummy Maria, et al.
Pubblicazione: (2025) -
Sustaining model performance for covid-19 detection from dynamic audio data: Development and evaluation of a comprehensive drift-adaptive framework
di: Ganitidis, Theofanis, et al.
Pubblicazione: (2024)