Enhancing Sound Source Localization via False Negative Elimination
Fuente:
arXiv
Salvato in:
| Autori principali: | Song, Zengjie, Zhang, Jiangshe, Wang, Yuxi, Fan, Junsong, Zhang, Zhaoxiang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
HLG: Comprehensive 3D Room Construction via Hierarchical Layout Generation
di: Wang, Xiping, et al.
Pubblicazione: (2025)
di: Wang, Xiping, et al.
Pubblicazione: (2025)
Using Unreliable Pseudo-Labels for Label-Efficient Semantic Segmentation
di: Wang, Haochen, et al.
Pubblicazione: (2023)
di: Wang, Haochen, et al.
Pubblicazione: (2023)
SAGD: Boundary-Enhanced Segment Anything in 3D Gaussian via Gaussian Decomposition
di: Hu, Xu, et al.
Pubblicazione: (2024)
di: Hu, Xu, et al.
Pubblicazione: (2024)
A Curriculum-style Self-training Approach for Source-Free Semantic Segmentation
di: Wang, Yuxi, et al.
Pubblicazione: (2021)
di: Wang, Yuxi, et al.
Pubblicazione: (2021)
Continual Forgetting for Pre-trained Vision Models
di: Zhao, Hongbo, et al.
Pubblicazione: (2024)
di: Zhao, Hongbo, et al.
Pubblicazione: (2024)
General Geometry-aware Weakly Supervised 3D Object Detection
di: Zhang, Guowen, et al.
Pubblicazione: (2024)
di: Zhang, Guowen, et al.
Pubblicazione: (2024)
EmoDiffusion: Enhancing Emotional 3D Facial Animation with Latent Diffusion Models
di: Zhang, Yixuan, et al.
Pubblicazione: (2025)
di: Zhang, Yixuan, et al.
Pubblicazione: (2025)
Pulling Target to Source: A New Perspective on Domain Adaptive Semantic Segmentation
di: Wang, Haochen, et al.
Pubblicazione: (2023)
di: Wang, Haochen, et al.
Pubblicazione: (2023)
Open Vocabulary 3D Scene Understanding via Geometry Guided Self-Distillation
di: Wang, Pengfei, et al.
Pubblicazione: (2024)
di: Wang, Pengfei, et al.
Pubblicazione: (2024)
RoomCraft: Controllable and Complete 3D Indoor Scene Generation
di: Zhou, Mengqi, et al.
Pubblicazione: (2025)
di: Zhou, Mengqi, et al.
Pubblicazione: (2025)
OOD-HOI: Text-Driven 3D Whole-Body Human-Object Interactions Generation Beyond Training Domains
di: Zhang, Yixuan, et al.
Pubblicazione: (2024)
di: Zhang, Yixuan, et al.
Pubblicazione: (2024)
Object-aware Sound Source Localization via Audio-Visual Scene Understanding
di: Um, Sung Jin, et al.
Pubblicazione: (2025)
di: Um, Sung Jin, et al.
Pubblicazione: (2025)
NeoVerse: Enhancing 4D World Model with in-the-wild Monocular Videos
di: Yang, Yuxue, et al.
Pubblicazione: (2026)
di: Yang, Yuxue, et al.
Pubblicazione: (2026)
Improving Sound Source Localization with Joint Slot Attention on Image and Audio
di: Kim, Inho, et al.
Pubblicazione: (2025)
di: Kim, Inho, et al.
Pubblicazione: (2025)
False Negative Reduction in Video Instance Segmentation using Uncertainty Estimates
di: Maag, Kira
Pubblicazione: (2021)
di: Maag, Kira
Pubblicazione: (2021)
A Label-Free High-Precision Residual Moveout Picking Method for Travel Time Tomography based on Deep Learning
di: Wang, Hongtao, et al.
Pubblicazione: (2025)
di: Wang, Hongtao, et al.
Pubblicazione: (2025)
FreeSim: Toward Free-viewpoint Camera Simulation in Driving Scenes
di: Fan, Lue, et al.
Pubblicazione: (2024)
di: Fan, Lue, et al.
Pubblicazione: (2024)
End-to-End Driving with Online Trajectory Evaluation via BEV World Model
di: Li, Yingyan, et al.
Pubblicazione: (2025)
di: Li, Yingyan, et al.
Pubblicazione: (2025)
ECCV Caption: Correcting False Negatives by Collecting Machine-and-Human-verified Image-Caption Associations for MS-COCO
di: Chun, Sanghyuk, et al.
Pubblicazione: (2022)
di: Chun, Sanghyuk, et al.
Pubblicazione: (2022)
A Critical Assessment of Visual Sound Source Localization Models Including Negative Audio
di: Juanola, Xavier, et al.
Pubblicazione: (2024)
di: Juanola, Xavier, et al.
Pubblicazione: (2024)
Bootstrap Fine-Grained Vision-Language Alignment for Unified Zero-Shot Anomaly Localization
di: Deng, Hanqiu, et al.
Pubblicazione: (2023)
di: Deng, Hanqiu, et al.
Pubblicazione: (2023)
Generate, Analyze, and Refine: Training-Free Sound Source Localization via MLLM Meta-Reasoning
di: Park, Subin, et al.
Pubblicazione: (2026)
di: Park, Subin, et al.
Pubblicazione: (2026)
Enhancing End-to-End Autonomous Driving with Latent World Model
di: Li, Yingyan, et al.
Pubblicazione: (2024)
di: Li, Yingyan, et al.
Pubblicazione: (2024)
MixSup: Mixed-grained Supervision for Label-efficient LiDAR-based 3D Object Detection
di: Yang, Yuxue, et al.
Pubblicazione: (2024)
di: Yang, Yuxue, et al.
Pubblicazione: (2024)
Deep Unfolding Multi-modal Image Fusion Network via Attribution Analysis
di: Bai, Haowen, et al.
Pubblicazione: (2025)
di: Bai, Haowen, et al.
Pubblicazione: (2025)
ElimPCL: Eliminating Noise Accumulation with Progressive Curriculum Labeling for Source-Free Domain Adaptation
di: Cheng, Jie, et al.
Pubblicazione: (2025)
di: Cheng, Jie, et al.
Pubblicazione: (2025)
Polar R-CNN: End-to-End Lane Detection with Fewer Anchors
di: Wang, Shengqi, et al.
Pubblicazione: (2024)
di: Wang, Shengqi, et al.
Pubblicazione: (2024)
Forecasting Future Videos from Novel Views via Disentangled 3D Scene Representation
di: Yarram, Sudhir, et al.
Pubblicazione: (2024)
di: Yarram, Sudhir, et al.
Pubblicazione: (2024)
Dual-Image Enhanced CLIP for Zero-Shot Anomaly Detection
di: Zhang, Zhaoxiang, et al.
Pubblicazione: (2024)
di: Zhang, Zhaoxiang, et al.
Pubblicazione: (2024)
FaNe: Towards Fine-Grained Cross-Modal Contrast with False-Negative Reduction and Text-Conditioned Sparse Attention
di: Zhang, Peng, et al.
Pubblicazione: (2025)
di: Zhang, Peng, et al.
Pubblicazione: (2025)
FreeVS: Generative View Synthesis on Free Driving Trajectory
di: Wang, Qitai, et al.
Pubblicazione: (2024)
di: Wang, Qitai, et al.
Pubblicazione: (2024)
FALCON: False-Negative Aware Learning of Contrastive Negatives in Vision-Language Alignment
di: Kim, Myunsoo, et al.
Pubblicazione: (2025)
di: Kim, Myunsoo, et al.
Pubblicazione: (2025)
FurniScene: A Large-scale 3D Room Dataset with Intricate Furnishing Scenes
di: Zhang, Genghao, et al.
Pubblicazione: (2024)
di: Zhang, Genghao, et al.
Pubblicazione: (2024)
RePer-360: Releasing Perspective Priors for 360$^\circ$ Depth Estimation via Self-Modulation
di: Guan, Cheng, et al.
Pubblicazione: (2026)
di: Guan, Cheng, et al.
Pubblicazione: (2026)
DrivingGPT: Unifying Driving World Modeling and Planning with Multi-modal Autoregressive Transformers
di: Chen, Yuntao, et al.
Pubblicazione: (2024)
di: Chen, Yuntao, et al.
Pubblicazione: (2024)
LayerAnimate: Layer-level Control for Animation
di: Yang, Yuxue, et al.
Pubblicazione: (2025)
di: Yang, Yuxue, et al.
Pubblicazione: (2025)
False Negative Reduction in Semantic Segmentation under Domain Shift using Depth Estimation
di: Maag, Kira, et al.
Pubblicazione: (2022)
di: Maag, Kira, et al.
Pubblicazione: (2022)
Image Fusion via Vision-Language Model
di: Zhao, Zixiang, et al.
Pubblicazione: (2024)
di: Zhao, Zixiang, et al.
Pubblicazione: (2024)
UPNet: Uncertainty-based Picking Deep Learning Network for Robust First Break Picking
di: Wang, Hongtao, et al.
Pubblicazione: (2023)
di: Wang, Hongtao, et al.
Pubblicazione: (2023)
Discovering Global False Negatives On the Fly for Self-supervised Contrastive Learning
di: Balmaseda, Vicente, et al.
Pubblicazione: (2025)
di: Balmaseda, Vicente, et al.
Pubblicazione: (2025)
Documenti analoghi
-
HLG: Comprehensive 3D Room Construction via Hierarchical Layout Generation
di: Wang, Xiping, et al.
Pubblicazione: (2025) -
Using Unreliable Pseudo-Labels for Label-Efficient Semantic Segmentation
di: Wang, Haochen, et al.
Pubblicazione: (2023) -
SAGD: Boundary-Enhanced Segment Anything in 3D Gaussian via Gaussian Decomposition
di: Hu, Xu, et al.
Pubblicazione: (2024) -
A Curriculum-style Self-training Approach for Source-Free Semantic Segmentation
di: Wang, Yuxi, et al.
Pubblicazione: (2021) -
Continual Forgetting for Pre-trained Vision Models
di: Zhao, Hongbo, et al.
Pubblicazione: (2024)