Do Audio-Visual Segmentation Models Truly Segment Sounding Objects?
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Jia, Zhao, Wenjie, Huang, Ziru, Guo, Yunhui, Tian, Yapeng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Continual Audio-Visual Sound Separation
di: Pian, Weiguo, et al.
Pubblicazione: (2024)
di: Pian, Weiguo, et al.
Pubblicazione: (2024)
DOA-Aware Audio-Visual Self-Supervised Learning for Sound Event Localization and Detection
di: Fujita, Yoto, et al.
Pubblicazione: (2024)
di: Fujita, Yoto, et al.
Pubblicazione: (2024)
Learning What To Hear: Boosting Sound-Source Association For Robust Audiovisual Instance Segmentation
di: Seo, Jinbae, et al.
Pubblicazione: (2025)
di: Seo, Jinbae, et al.
Pubblicazione: (2025)
Challenge on Sound Scene Synthesis: Evaluating Text-to-Audio Generation
di: Lee, Junwon, et al.
Pubblicazione: (2024)
di: Lee, Junwon, et al.
Pubblicazione: (2024)
Unveiling Visual Biases in Audio-Visual Localization Benchmarks
di: Chen, Liangyu, et al.
Pubblicazione: (2024)
di: Chen, Liangyu, et al.
Pubblicazione: (2024)
AudioRole: An Audio Dataset for Character Role-Playing in Large Language Models
di: Li, Wenyu, et al.
Pubblicazione: (2025)
di: Li, Wenyu, et al.
Pubblicazione: (2025)
Leveraging Pre-trained AudioLDM for Sound Generation: A Benchmark Study
di: Yuan, Yi, et al.
Pubblicazione: (2023)
di: Yuan, Yi, et al.
Pubblicazione: (2023)
SHMamba: Structured Hyperbolic State Space Model for Audio-Visual Question Answering
di: Yang, Zhe, et al.
Pubblicazione: (2024)
di: Yang, Zhe, et al.
Pubblicazione: (2024)
LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport
di: Rho, Kyeongha, et al.
Pubblicazione: (2025)
di: Rho, Kyeongha, et al.
Pubblicazione: (2025)
Sound-VECaps: Improving Audio Generation with Visual Enhanced Captions
di: Yuan, Yi, et al.
Pubblicazione: (2024)
di: Yuan, Yi, et al.
Pubblicazione: (2024)
Listening and Seeing Again: Generative Error Correction for Audio-Visual Speech Recognition
di: Liu, Rui, et al.
Pubblicazione: (2025)
di: Liu, Rui, et al.
Pubblicazione: (2025)
Segment-Factorized Full-Song Generation on Symbolic Piano Music
di: Chen, Ping-Yi, et al.
Pubblicazione: (2025)
di: Chen, Ping-Yi, et al.
Pubblicazione: (2025)
Text-to-Audio Generation Synchronized with Videos
di: Mo, Shentong, et al.
Pubblicazione: (2024)
di: Mo, Shentong, et al.
Pubblicazione: (2024)
OmniCustom: Sync Audio-Video Customization Via Joint Audio-Video Generation Model
di: Li, Maomao, et al.
Pubblicazione: (2026)
di: Li, Maomao, et al.
Pubblicazione: (2026)
Jailbreak-AudioBench: In-Depth Evaluation and Analysis of Jailbreak Threats for Large Audio Language Models
di: Cheng, Hao, et al.
Pubblicazione: (2025)
di: Cheng, Hao, et al.
Pubblicazione: (2025)
A Multi-Stream Fusion Approach with One-Class Learning for Audio-Visual Deepfake Detection
di: Lee, Kyungbok, et al.
Pubblicazione: (2024)
di: Lee, Kyungbok, et al.
Pubblicazione: (2024)
Retrieval-Augmented Text-to-Audio Generation
di: Yuan, Yi, et al.
Pubblicazione: (2023)
di: Yuan, Yi, et al.
Pubblicazione: (2023)
Purification Before Fusion: Toward Mask-Free Speech Enhancement for Robust Audio-Visual Speech Recognition
di: Wu, Linzhi, et al.
Pubblicazione: (2026)
di: Wu, Linzhi, et al.
Pubblicazione: (2026)
Audio Transformers
di: Verma, Prateek, et al.
Pubblicazione: (2021)
di: Verma, Prateek, et al.
Pubblicazione: (2021)
Audio-Visual Segmentation via Unlabeled Frame Exploitation
di: Liu, Jinxiang, et al.
Pubblicazione: (2024)
di: Liu, Jinxiang, et al.
Pubblicazione: (2024)
FreeAudio: Training-Free Timing Planning for Controllable Long-Form Text-to-Audio Generation
di: Jiang, Yuxuan, et al.
Pubblicazione: (2025)
di: Jiang, Yuxuan, et al.
Pubblicazione: (2025)
SemantiCodec: An Ultra Low Bitrate Semantic Audio Codec for General Sound
di: Liu, Haohe, et al.
Pubblicazione: (2024)
di: Liu, Haohe, et al.
Pubblicazione: (2024)
Generative AI for Music and Audio
di: Dong, Hao-Wen
Pubblicazione: (2024)
di: Dong, Hao-Wen
Pubblicazione: (2024)
$\texttt{AVROBUSTBENCH}$: Benchmarking the Robustness of Audio-Visual Recognition Models at Test-Time
di: Maharana, Sarthak Kumar, et al.
Pubblicazione: (2025)
di: Maharana, Sarthak Kumar, et al.
Pubblicazione: (2025)
Audit After Segmentation: Reference-Free Mask Quality Assessment for Language-Referred Audio-Visual Segmentation
di: Zhou, Jinxing, et al.
Pubblicazione: (2026)
di: Zhou, Jinxing, et al.
Pubblicazione: (2026)
Neural Style Transfer for Audio Spectograms
di: Verma, Prateek, et al.
Pubblicazione: (2018)
di: Verma, Prateek, et al.
Pubblicazione: (2018)
Embedding Alignment in Code Generation for Audio
di: Kouteili, Sam, et al.
Pubblicazione: (2025)
di: Kouteili, Sam, et al.
Pubblicazione: (2025)
Model-Guided Dual-Role Alignment for High-Fidelity Open-Domain Video-to-Audio Generation
di: Zhang, Kang, et al.
Pubblicazione: (2025)
di: Zhang, Kang, et al.
Pubblicazione: (2025)
Content Adaptive Front End For Audio Classification
di: Verma, Prateek, et al.
Pubblicazione: (2023)
di: Verma, Prateek, et al.
Pubblicazione: (2023)
Integrating IP Broadcasting with Audio Tags: Workflow and Challenges
di: Burchett-Vass, Rhys, et al.
Pubblicazione: (2024)
di: Burchett-Vass, Rhys, et al.
Pubblicazione: (2024)
LM2D: Lyrics- and Music-Driven Dance Synthesis
di: Yin, Wenjie, et al.
Pubblicazione: (2024)
di: Yin, Wenjie, et al.
Pubblicazione: (2024)
Fast Text-to-Audio Generation with Adversarial Post-Training
di: Novack, Zachary, et al.
Pubblicazione: (2025)
di: Novack, Zachary, et al.
Pubblicazione: (2025)
Towards Generating Diverse Audio Captions via Adversarial Training
di: Mei, Xinhao, et al.
Pubblicazione: (2022)
di: Mei, Xinhao, et al.
Pubblicazione: (2022)
PIAST: A Multimodal Piano Dataset with Audio, Symbolic and Text
di: Bang, Hayeon, et al.
Pubblicazione: (2024)
di: Bang, Hayeon, et al.
Pubblicazione: (2024)
From Sound to Sight: Towards AI-authored Music Videos
di: Vitasovic, Leo, et al.
Pubblicazione: (2025)
di: Vitasovic, Leo, et al.
Pubblicazione: (2025)
LauraGPT: Listen, Attend, Understand, and Regenerate Audio with GPT
di: Du, Zhihao, et al.
Pubblicazione: (2023)
di: Du, Zhihao, et al.
Pubblicazione: (2023)
Diverse Audio Embeddings -- Bringing Features Back Outperforms CLAP!
di: Verma, Prateek
Pubblicazione: (2023)
di: Verma, Prateek
Pubblicazione: (2023)
Leveraging Pre-Trained Autoencoders for Interpretable Prototype Learning of Music Audio
di: Alonso-Jiménez, Pablo, et al.
Pubblicazione: (2024)
di: Alonso-Jiménez, Pablo, et al.
Pubblicazione: (2024)
DeepFake Doctor: Diagnosing and Treating Audio-Video Fake Detection
di: Klemt, Marcel, et al.
Pubblicazione: (2025)
di: Klemt, Marcel, et al.
Pubblicazione: (2025)
Prompting Segmentation with Sound Is Generalizable Audio-Visual Source Localizer
di: Wang, Yaoting, et al.
Pubblicazione: (2023)
di: Wang, Yaoting, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Continual Audio-Visual Sound Separation
di: Pian, Weiguo, et al.
Pubblicazione: (2024) -
DOA-Aware Audio-Visual Self-Supervised Learning for Sound Event Localization and Detection
di: Fujita, Yoto, et al.
Pubblicazione: (2024) -
Learning What To Hear: Boosting Sound-Source Association For Robust Audiovisual Instance Segmentation
di: Seo, Jinbae, et al.
Pubblicazione: (2025) -
Challenge on Sound Scene Synthesis: Evaluating Text-to-Audio Generation
di: Lee, Junwon, et al.
Pubblicazione: (2024) -
Unveiling Visual Biases in Audio-Visual Localization Benchmarks
di: Chen, Liangyu, et al.
Pubblicazione: (2024)