CATSE: A Context-Aware Framework for Causal Target Sound Extraction
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Baligar, Shrishail, Kegler, Mikolaj, Irvin, Bryce, Stamenovic, Marko, Newsam, Shawn |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
PAS-SE: Personalized Auxiliary-Sensor Speech Enhancement for Voice Pickup in Hearables
par: Ohlenbusch, Mattes, et autres
Publié: (2025)
par: Ohlenbusch, Mattes, et autres
Publié: (2025)
Latent CLAP Loss for Better Foley Sound Synthesis
par: Karchkhadze, Tornike, et autres
Publié: (2024)
par: Karchkhadze, Tornike, et autres
Publié: (2024)
FSD50K-Solo: Automated Curation of Single-Source Sound Events
par: Yang, Ningyuan, et autres
Publié: (2026)
par: Yang, Ningyuan, et autres
Publié: (2026)
Multichannel-to-Multichannel Target Sound Extraction Using Direction and Timestamp Clues
par: Choi, Dayun, et autres
Publié: (2024)
par: Choi, Dayun, et autres
Publié: (2024)
SoundCompass: Navigating Target Sound Extraction With Effective Directional Clue Integration In Complex Acoustic Scenes
par: Choi, Dayun, et autres
Publié: (2025)
par: Choi, Dayun, et autres
Publié: (2025)
Shared Representation Learning for Reference-Guided Targeted Sound Detection
par: Gupta, Shubham, et autres
Publié: (2026)
par: Gupta, Shubham, et autres
Publié: (2026)
EGGCodec: A Robust Neural Encodec Framework for EGG Reconstruction and F0 Extraction
par: Feng, Rui, et autres
Publié: (2025)
par: Feng, Rui, et autres
Publié: (2025)
Context-Aware Query Refinement for Target Sound Extraction: Handling Partially Matched Queries
par: Sato, Ryo, et autres
Publié: (2025)
par: Sato, Ryo, et autres
Publié: (2025)
Target Speaker Extraction through Comparing Noisy Positive and Negative Audio Enrollments
par: Xu, Shitong, et autres
Publié: (2025)
par: Xu, Shitong, et autres
Publié: (2025)
Text Prompt is Not Enough: Sound Event Enhanced Prompt Adapter for Target Style Audio Generation
par: Xiong, Chenxu, et autres
Publié: (2024)
par: Xiong, Chenxu, et autres
Publié: (2024)
Mitigating Stethoscope-Induced Shortcuts in Respiratory Sound Classification under Federated Domain Generalization with Causality-Inspired Interventions
par: Koo, Heejoon, et autres
Publié: (2026)
par: Koo, Heejoon, et autres
Publié: (2026)
SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline
par: Wang, Helin, et autres
Publié: (2025)
par: Wang, Helin, et autres
Publié: (2025)
TLDiffGAN: A Latent Diffusion-GAN Framework with Temporal Information Fusion for Anomalous Sound Detection
par: Ma, Chengyuan, et autres
Publié: (2026)
par: Ma, Chengyuan, et autres
Publié: (2026)
The Sounds of Home: A Speech-Removed Residential Audio Dataset for Sound Event Detection
par: Bibbó, Gabriel, et autres
Publié: (2024)
par: Bibbó, Gabriel, et autres
Publié: (2024)
CycleGuardian: A Framework for Automatic RespiratorySound classification Based on Improved Deep clustering and Contrastive Learning
par: Chu, Yun, et autres
Publié: (2025)
par: Chu, Yun, et autres
Publié: (2025)
Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech
par: Kim, Nam-Gyu, et autres
Publié: (2025)
par: Kim, Nam-Gyu, et autres
Publié: (2025)
BTS: Bridging Text and Sound Modalities for Metadata-Aided Respiratory Sound Classification
par: Kim, June-Woo, et autres
Publié: (2024)
par: Kim, June-Woo, et autres
Publié: (2024)
A Holistic Evaluation of Piano Sound Quality
par: Zhou, Monan, et autres
Publié: (2023)
par: Zhou, Monan, et autres
Publié: (2023)
Detect Any Sound: Open-Vocabulary Sound Event Detection with Multi-Modal Queries
par: Cai, Pengfei, et autres
Publié: (2025)
par: Cai, Pengfei, et autres
Publié: (2025)
BERT-APC: A Reference-free Framework for Automatic Pitch Correction via Musical Context Inference
par: Kim, Sungjae, et autres
Publié: (2025)
par: Kim, Sungjae, et autres
Publié: (2025)
Sound Classification of Four Insect Classes
par: Wang, Yinxuan, et autres
Publié: (2024)
par: Wang, Yinxuan, et autres
Publié: (2024)
Teaching Physical Awareness to LLMs through Sounds
par: Wang, Weiguo, et autres
Publié: (2025)
par: Wang, Weiguo, et autres
Publié: (2025)
GenTSE: Enhancing Target Speaker Extraction via a Coarse-to-Fine Generative Language Model
par: Li, Haoyang, et autres
Publié: (2025)
par: Li, Haoyang, et autres
Publié: (2025)
Joint Learning of Emotions in Music and Generalized Sounds
par: Simonetta, Federico, et autres
Publié: (2024)
par: Simonetta, Federico, et autres
Publié: (2024)
Auditory Intelligence: Understanding the World Through Sound
par: Nam, Hyeonuk
Publié: (2025)
par: Nam, Hyeonuk
Publié: (2025)
Sound Scene Synthesis at the DCASE 2024 Challenge
par: Lagrange, Mathieu, et autres
Publié: (2025)
par: Lagrange, Mathieu, et autres
Publié: (2025)
Abstract Sound Fusion with Unconditional Inversion Models
par: Liu, Jing, et autres
Publié: (2025)
par: Liu, Jing, et autres
Publié: (2025)
DEFORMER: Coupling Deformed Localized Patterns with Global Context for Robust End-to-end Speech Recognition
par: Xie, Jiamin, et autres
Publié: (2022)
par: Xie, Jiamin, et autres
Publié: (2022)
HuPER: A Human-Inspired Framework for Phonetic Perception
par: Guo, Chenxu, et autres
Publié: (2026)
par: Guo, Chenxu, et autres
Publié: (2026)
Heart Sound Segmentation Using Deep Learning Techniques
par: Madine, Manas
Publié: (2024)
par: Madine, Manas
Publié: (2024)
Heterogeneous sound classification with the Broad Sound Taxonomy and Dataset
par: Anastasopoulou, Panagiota, et autres
Publié: (2024)
par: Anastasopoulou, Panagiota, et autres
Publié: (2024)
ASD-Diffusion: Anomalous Sound Detection with Diffusion Models
par: Zhang, Fengrun, et autres
Publié: (2024)
par: Zhang, Fengrun, et autres
Publié: (2024)
EnvSDD: Benchmarking Environmental Sound Deepfake Detection
par: Yin, Han, et autres
Publié: (2025)
par: Yin, Han, et autres
Publié: (2025)
Leveraging Language Model Capabilities for Sound Event Detection
par: Wang, Hualei, et autres
Publié: (2023)
par: Wang, Hualei, et autres
Publié: (2023)
LAPS-Diff: A Diffusion-Based Framework for Singing Voice Synthesis With Language Aware Prosody-Style Guided Learning
par: Dhar, Sandipan, et autres
Publié: (2025)
par: Dhar, Sandipan, et autres
Publié: (2025)
DAME: Duration-Aware Matryoshka Embedding for Duration-Robust Speaker Verification
par: Jung, Youngmoon, et autres
Publié: (2026)
par: Jung, Youngmoon, et autres
Publié: (2026)
Gesture-Aware Zero-Shot Speech Recognition for Patients with Language Disorders
par: Kim, Seungbae, et autres
Publié: (2025)
par: Kim, Seungbae, et autres
Publié: (2025)
Self-Guided Target Sound Extraction and Classification Through Universal Sound Separation Model and Multiple Clues
par: Kwon, Younghoo, et autres
Publié: (2025)
par: Kwon, Younghoo, et autres
Publié: (2025)
Online Similarity-and-Independence-Aware Beamformer for Low-latency Target Sound Extraction
par: Hiroe, Atsuo
Publié: (2023)
par: Hiroe, Atsuo
Publié: (2023)
AS-ASR: A Lightweight Framework for Aphasia-Specific Automatic Speech Recognition
par: Bao, Chen, et autres
Publié: (2025)
par: Bao, Chen, et autres
Publié: (2025)
Documents similaires
-
PAS-SE: Personalized Auxiliary-Sensor Speech Enhancement for Voice Pickup in Hearables
par: Ohlenbusch, Mattes, et autres
Publié: (2025) -
Latent CLAP Loss for Better Foley Sound Synthesis
par: Karchkhadze, Tornike, et autres
Publié: (2024) -
FSD50K-Solo: Automated Curation of Single-Source Sound Events
par: Yang, Ningyuan, et autres
Publié: (2026) -
Multichannel-to-Multichannel Target Sound Extraction Using Direction and Timestamp Clues
par: Choi, Dayun, et autres
Publié: (2024) -
SoundCompass: Navigating Target Sound Extraction With Effective Directional Clue Integration In Complex Acoustic Scenes
par: Choi, Dayun, et autres
Publié: (2025)