PRIMED: Adaptive Modality Suppression for Referring Audio-Visual Segmentation via Biased Competition
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | He, Yuchen, Zhang, Jing |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Selective Noise Suppression and Discriminative Mutual Interaction for Robust Audio-Visual Segmentation
von: Peng, Kai, et al.
Veröffentlicht: (2026)
von: Peng, Kai, et al.
Veröffentlicht: (2026)
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation
von: Ying, Kaining, et al.
Veröffentlicht: (2025)
von: Ying, Kaining, et al.
Veröffentlicht: (2025)
LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing
von: Wang, Langyu, et al.
Veröffentlicht: (2024)
von: Wang, Langyu, et al.
Veröffentlicht: (2024)
Unsupervised Audio-Visual Segmentation with Modality Alignment
von: Bhosale, Swapnil, et al.
Veröffentlicht: (2024)
von: Bhosale, Swapnil, et al.
Veröffentlicht: (2024)
SimToken: A Simple Baseline for Referring Audio-Visual Segmentation
von: Jin, Dian, et al.
Veröffentlicht: (2025)
von: Jin, Dian, et al.
Veröffentlicht: (2025)
AURORA:Augmented Understanding via Structured Reasoning and Reinforcement Learning for Reference Audio-Visual Segmentation
von: Luo, Ziyang, et al.
Veröffentlicht: (2025)
von: Luo, Ziyang, et al.
Veröffentlicht: (2025)
CM-MaskSD: Cross-Modality Masked Self-Distillation for Referring Image Segmentation
von: Wang, Wenxuan, et al.
Veröffentlicht: (2023)
von: Wang, Wenxuan, et al.
Veröffentlicht: (2023)
Ref-AVS: Refer and Segment Objects in Audio-Visual Scenes
von: Wang, Yaoting, et al.
Veröffentlicht: (2024)
von: Wang, Yaoting, et al.
Veröffentlicht: (2024)
Taming Modality Entanglement in Continual Audio-Visual Segmentation
von: Hong, Yuyang, et al.
Veröffentlicht: (2025)
von: Hong, Yuyang, et al.
Veröffentlicht: (2025)
Robust Audio-Visual Segmentation via Audio-Guided Visual Convergent Alignment
von: Liu, Chen, et al.
Veröffentlicht: (2025)
von: Liu, Chen, et al.
Veröffentlicht: (2025)
Complementary and Contrastive Learning for Audio-Visual Segmentation
von: Gong, Sitong, et al.
Veröffentlicht: (2025)
von: Gong, Sitong, et al.
Veröffentlicht: (2025)
EchoingPixels: Cross-Modal Adaptive Token Reduction for Efficient Audio-Visual LLMs
von: Gong, Chao, et al.
Veröffentlicht: (2025)
von: Gong, Chao, et al.
Veröffentlicht: (2025)
Towards Unified Referring Expression Segmentation Across Omni-Level Visual Target Granularities
von: Liu, Jing, et al.
Veröffentlicht: (2025)
von: Liu, Jing, et al.
Veröffentlicht: (2025)
Unveiling and Mitigating Bias in Audio Visual Segmentation
von: Sun, Peiwen, et al.
Veröffentlicht: (2024)
von: Sun, Peiwen, et al.
Veröffentlicht: (2024)
Semi-MedRef: Semi-Supervised Medical Referring Image Segmentation with Cross-Modal Alignment
von: Li, Yuchen, et al.
Veröffentlicht: (2026)
von: Li, Yuchen, et al.
Veröffentlicht: (2026)
ReferDINO: Referring Video Object Segmentation with Visual Grounding Foundations
von: Liang, Tianming, et al.
Veröffentlicht: (2025)
von: Liang, Tianming, et al.
Veröffentlicht: (2025)
Revisiting Audio-Visual Segmentation with Vision-Centric Transformer
von: Huang, Shaofei, et al.
Veröffentlicht: (2025)
von: Huang, Shaofei, et al.
Veröffentlicht: (2025)
Robust Egocentric Referring Video Object Segmentation via Dual-Modal Causal Intervention
von: Liu, Haijing, et al.
Veröffentlicht: (2025)
von: Liu, Haijing, et al.
Veröffentlicht: (2025)
Vision-Motion-Reference Alignment for Referring Multi-Object Tracking via Multi-Modal Large Language Models
von: Lv, Weiyi, et al.
Veröffentlicht: (2025)
von: Lv, Weiyi, et al.
Veröffentlicht: (2025)
LightAVSeg: Lightweight Audio-Visual Segmentation
von: Zhong, Qing, et al.
Veröffentlicht: (2026)
von: Zhong, Qing, et al.
Veröffentlicht: (2026)
Implicit Counterfactual Learning for Audio-Visual Segmentation
von: Zha, Mingfeng, et al.
Veröffentlicht: (2025)
von: Zha, Mingfeng, et al.
Veröffentlicht: (2025)
CAE-AV: Improving Audio-Visual Learning via Cross-modal Interactive Enrichment
von: Hu, Yunzuo, et al.
Veröffentlicht: (2026)
von: Hu, Yunzuo, et al.
Veröffentlicht: (2026)
MeViS: A Multi-Modal Dataset for Referring Motion Expression Video Segmentation
von: Ding, Henghui, et al.
Veröffentlicht: (2025)
von: Ding, Henghui, et al.
Veröffentlicht: (2025)
Referring Video Object Segmentation with Cross-Modality Proxy Queries
von: Sun, Baoli, et al.
Veröffentlicht: (2025)
von: Sun, Baoli, et al.
Veröffentlicht: (2025)
Audio-Guided Visual Editing with Complex Multi-Modal Prompts
von: Kim, Hyeonyu, et al.
Veröffentlicht: (2025)
von: Kim, Hyeonyu, et al.
Veröffentlicht: (2025)
Frequency-Domain Decomposition and Recomposition for Robust Audio-Visual Segmentation
von: Shen, Yunzhe, et al.
Veröffentlicht: (2025)
von: Shen, Yunzhe, et al.
Veröffentlicht: (2025)
AugRefer: Advancing 3D Visual Grounding via Cross-Modal Augmentation and Spatial Relation-based Referring
von: Wang, Xinyi, et al.
Veröffentlicht: (2025)
von: Wang, Xinyi, et al.
Veröffentlicht: (2025)
EAVL: Explicitly Align Vision and Language for Referring Image Segmentation
von: Yan, Yichen, et al.
Veröffentlicht: (2023)
von: Yan, Yichen, et al.
Veröffentlicht: (2023)
Segment Beyond View: Handling Partially Missing Modality for Audio-Visual Semantic Segmentation
von: Wu, Renjie, et al.
Veröffentlicht: (2023)
von: Wu, Renjie, et al.
Veröffentlicht: (2023)
LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning
von: Dai, Yifan, et al.
Veröffentlicht: (2026)
von: Dai, Yifan, et al.
Veröffentlicht: (2026)
ProSAM: Enhancing the Robustness of SAM-based Visual Reference Segmentation with Probabilistic Prompts
von: Wang, Xiaoqi, et al.
Veröffentlicht: (2025)
von: Wang, Xiaoqi, et al.
Veröffentlicht: (2025)
Progressive Prompt-Guided Cross-Modal Reasoning for Referring Image Segmentation
von: Li, Jiachen, et al.
Veröffentlicht: (2026)
von: Li, Jiachen, et al.
Veröffentlicht: (2026)
Enhancing Visual Place Recognition via Fast and Slow Adaptive Biasing in Event Cameras
von: Nair, Gokul B., et al.
Veröffentlicht: (2024)
von: Nair, Gokul B., et al.
Veröffentlicht: (2024)
Rethinking Audio-Visual Adversarial Vulnerability from Temporal and Modality Perspectives
von: Zhang, Zeliang, et al.
Veröffentlicht: (2025)
von: Zhang, Zeliang, et al.
Veröffentlicht: (2025)
Enhancing Audio-Visual Spiking Neural Networks through Semantic-Alignment and Cross-Modal Residual Learning
von: He, Xiang, et al.
Veröffentlicht: (2025)
von: He, Xiang, et al.
Veröffentlicht: (2025)
Extending Segment Anything Model into Auditory and Temporal Dimensions for Audio-Visual Segmentation
von: Seon, Juhyeong, et al.
Veröffentlicht: (2024)
von: Seon, Juhyeong, et al.
Veröffentlicht: (2024)
AVS-Mamba: Exploring Temporal and Multi-modal Mamba for Audio-Visual Segmentation
von: Gong, Sitong, et al.
Veröffentlicht: (2025)
von: Gong, Sitong, et al.
Veröffentlicht: (2025)
Fuse4Seg: Image Fusion for Multi-Modal Medical Segmentation via Bi-level Optimization
von: Guo, Yuchen, et al.
Veröffentlicht: (2024)
von: Guo, Yuchen, et al.
Veröffentlicht: (2024)
FusionSAM: Visual Multi-Modal Learning with Segment Anything
von: Li, Daixun, et al.
Veröffentlicht: (2024)
von: Li, Daixun, et al.
Veröffentlicht: (2024)
TAVP: Task-Adaptive Visual Prompt for Cross-domain Few-shot Segmentation
von: Yang, Jiaqi, et al.
Veröffentlicht: (2024)
von: Yang, Jiaqi, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Selective Noise Suppression and Discriminative Mutual Interaction for Robust Audio-Visual Segmentation
von: Peng, Kai, et al.
Veröffentlicht: (2026) -
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation
von: Ying, Kaining, et al.
Veröffentlicht: (2025) -
LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing
von: Wang, Langyu, et al.
Veröffentlicht: (2024) -
Unsupervised Audio-Visual Segmentation with Modality Alignment
von: Bhosale, Swapnil, et al.
Veröffentlicht: (2024) -
SimToken: A Simple Baseline for Referring Audio-Visual Segmentation
von: Jin, Dian, et al.
Veröffentlicht: (2025)