Guardado en:
| Autores principales: | Häuser, Luise, Jäger, Gerhard, Rama, Taraka, List, Johann-Mattis, Stamatakis, Alexandros |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2402.02807 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ReCLAP: Improving Zero Shot Audio Classification by Describing Sounds
por: Ghosh, Sreyan, et al.
Publicado: (2024)
por: Ghosh, Sreyan, et al.
Publicado: (2024)
The Sound of Healthcare: Improving Medical Transcription ASR Accuracy with Large Language Models
por: Adedeji, Ayo, et al.
Publicado: (2024)
por: Adedeji, Ayo, et al.
Publicado: (2024)
You Sound a Little Tense: L2 Tailored Clear TTS Using Durational Vowel Properties
por: Tuttösí, Paige, et al.
Publicado: (2025)
por: Tuttösí, Paige, et al.
Publicado: (2025)
SoundMind: RL-Incentivized Logic Reasoning for Audio-Language Models
por: Diao, Xingjian, et al.
Publicado: (2025)
por: Diao, Xingjian, et al.
Publicado: (2025)
Boundary-Informed Sound Field Reconstruction
por: Sundström, David, et al.
Publicado: (2025)
por: Sundström, David, et al.
Publicado: (2025)
MSDA: Combining Pseudo-labeling and Self-Supervision for Unsupervised Domain Adaptation in ASR
por: Damianos, Dimitrios, et al.
Publicado: (2025)
por: Damianos, Dimitrios, et al.
Publicado: (2025)
Sounding Out Reconstruction Error-Based Evaluation of Generative Models of Expressive Performance
por: Peter, Silvan David, et al.
Publicado: (2023)
por: Peter, Silvan David, et al.
Publicado: (2023)
Improving Accented Speech Recognition using Data Augmentation based on Unsupervised Text-to-Speech Synthesis
por: Do, Cong-Thanh, et al.
Publicado: (2024)
por: Do, Cong-Thanh, et al.
Publicado: (2024)
ISPA: Inter-Species Phonetic Alphabet for Transcribing Animal Sounds
por: Hagiwara, Masato, et al.
Publicado: (2024)
por: Hagiwara, Masato, et al.
Publicado: (2024)
TAU: A Benchmark for Cultural Sound Understanding Beyond Semantics
por: Lin, Yi-Cheng, et al.
Publicado: (2025)
por: Lin, Yi-Cheng, et al.
Publicado: (2025)
BAT: Learning to Reason about Spatial Sounds with Large Language Models
por: Zheng, Zhisheng, et al.
Publicado: (2024)
por: Zheng, Zhisheng, et al.
Publicado: (2024)
The Sound of Syntax: Finetuning and Comprehensive Evaluation of Language Models for Speech Pathology
por: Patel, Fagun, et al.
Publicado: (2025)
por: Patel, Fagun, et al.
Publicado: (2025)
CryCeleb: A Speaker Verification Dataset Based on Infant Cry Sounds
por: Budaghyan, David, et al.
Publicado: (2023)
por: Budaghyan, David, et al.
Publicado: (2023)
Understanding Sounds, Missing the Questions: The Challenge of Object Hallucination in Large Audio-Language Models
por: Kuan, Chun-Yi, et al.
Publicado: (2024)
por: Kuan, Chun-Yi, et al.
Publicado: (2024)
Efficient Sound Field Reconstruction with Conditional Invertible Neural Networks
por: Karakonstantis, Xenofon, et al.
Publicado: (2024)
por: Karakonstantis, Xenofon, et al.
Publicado: (2024)
UniSonate: A Unified Model for Speech, Music, and Sound Effect Generation with Text Instructions
por: Qiang, Chunyu, et al.
Publicado: (2026)
por: Qiang, Chunyu, et al.
Publicado: (2026)
Audio Flamingo Next: Next-Generation Open Audio-Language Models for Speech, Sound, and Music
por: Ghosh, Sreyan, et al.
Publicado: (2026)
por: Ghosh, Sreyan, et al.
Publicado: (2026)
Measuring Sound Symbolism in Audio-visual Models
por: Tseng, Wei-Cheng, et al.
Publicado: (2024)
por: Tseng, Wei-Cheng, et al.
Publicado: (2024)
Leveraging Sound Source Trajectories for Universal Sound Separation
por: Wu, Donghang, et al.
Publicado: (2024)
por: Wu, Donghang, et al.
Publicado: (2024)
Sound Zone Control Robust To Sound Speed Change
por: Bhattacharjee, Sankha Subhra, et al.
Publicado: (2024)
por: Bhattacharjee, Sankha Subhra, et al.
Publicado: (2024)
SightSound-R1: Cross-Modal Reasoning Distillation from Vision to Audio Language Models
por: Wang, Qiaolin, et al.
Publicado: (2025)
por: Wang, Qiaolin, et al.
Publicado: (2025)
Evaluating Sound Similarity Metrics for Differentiable, Iterative Sound-Matching
por: Salimi, Amir, et al.
Publicado: (2025)
por: Salimi, Amir, et al.
Publicado: (2025)
Sound Field Reconstruction Using a Compact Acoustics-informed Neural Network
por: Ma, Fei, et al.
Publicado: (2024)
por: Ma, Fei, et al.
Publicado: (2024)
Unifying Symbolic Music Arrangement: Track-Aware Reconstruction and Structured Tokenization
por: Ou, Longshen, et al.
Publicado: (2024)
por: Ou, Longshen, et al.
Publicado: (2024)
Effective Pre-Training of Audio Transformers for Sound Event Detection
por: Schmid, Florian, et al.
Publicado: (2024)
por: Schmid, Florian, et al.
Publicado: (2024)
UNIT-DSR: Dysarthric Speech Reconstruction System Using Speech Unit Normalization
por: Wang, Yuejiao, et al.
Publicado: (2024)
por: Wang, Yuejiao, et al.
Publicado: (2024)
Automatic Speech Recognition (ASR) for the Diagnosis of pronunciation of Speech Sound Disorders in Korean children
por: Ahn, Taekyung, et al.
Publicado: (2024)
por: Ahn, Taekyung, et al.
Publicado: (2024)
DiffSound: Differentiable Modal Sound Rendering and Inverse Rendering for Diverse Inference Tasks
por: Jin, Xutong, et al.
Publicado: (2024)
por: Jin, Xutong, et al.
Publicado: (2024)
Noise-Robust Sound Event Detection and Counting via Language-Queried Sound Separation
por: Chen, Yuanjian, et al.
Publicado: (2025)
por: Chen, Yuanjian, et al.
Publicado: (2025)
Sound Event Detection with Boundary-Aware Optimization and Inference
por: Schmid, Florian, et al.
Publicado: (2026)
por: Schmid, Florian, et al.
Publicado: (2026)
Dual Knowledge Distillation for Efficient Sound Event Detection
por: Xiao, Yang, et al.
Publicado: (2024)
por: Xiao, Yang, et al.
Publicado: (2024)
Diffuse Sound Field Synthesis
por: Zotter, Franz, et al.
Publicado: (2024)
por: Zotter, Franz, et al.
Publicado: (2024)
Sound Event Bounding Boxes
por: Ebbers, Janek, et al.
Publicado: (2024)
por: Ebbers, Janek, et al.
Publicado: (2024)
Fractional Fourier Sound Synthesis
por: Gutiérrez, Esteban, et al.
Publicado: (2025)
por: Gutiérrez, Esteban, et al.
Publicado: (2025)
JiTTER: Jigsaw Temporal Transformer for Event Reconstruction for Self-Supervised Sound Event Detection
por: Nam, Hyeonuk, et al.
Publicado: (2025)
por: Nam, Hyeonuk, et al.
Publicado: (2025)
Improving Audio Spectrogram Transformers for Sound Event Detection Through Multi-Stage Training
por: Schmid, Florian, et al.
Publicado: (2024)
por: Schmid, Florian, et al.
Publicado: (2024)
SoundBeam meets M2D: Target Sound Extraction with Audio Foundation Model
por: Hernandez-Olivan, Carlos, et al.
Publicado: (2024)
por: Hernandez-Olivan, Carlos, et al.
Publicado: (2024)
SoundShift: Exploring Sound Manipulations for Accessible Mixed-Reality Awareness
por: Chang, Ruei-Che, et al.
Publicado: (2024)
por: Chang, Ruei-Che, et al.
Publicado: (2024)
SoundLoCD: An Efficient Conditional Discrete Contrastive Latent Diffusion Model for Text-to-Sound Generation
por: Niu, Xinlei, et al.
Publicado: (2024)
por: Niu, Xinlei, et al.
Publicado: (2024)
Physics-Informed Transfer Learning for Data-Driven Sound Source Reconstruction in Near-Field Acoustic Holography
por: Luan, Xinmeng, et al.
Publicado: (2025)
por: Luan, Xinmeng, et al.
Publicado: (2025)
Ejemplares similares
-
ReCLAP: Improving Zero Shot Audio Classification by Describing Sounds
por: Ghosh, Sreyan, et al.
Publicado: (2024) -
The Sound of Healthcare: Improving Medical Transcription ASR Accuracy with Large Language Models
por: Adedeji, Ayo, et al.
Publicado: (2024) -
You Sound a Little Tense: L2 Tailored Clear TTS Using Durational Vowel Properties
por: Tuttösí, Paige, et al.
Publicado: (2025) -
SoundMind: RL-Incentivized Logic Reasoning for Audio-Language Models
por: Diao, Xingjian, et al.
Publicado: (2025) -
Boundary-Informed Sound Field Reconstruction
por: Sundström, David, et al.
Publicado: (2025)