MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Langyu, Zhu, Bingke, Chen, Yingying, Zhang, Yiyuan, Tang, Ming, Wang, Jinqiao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing
por: Wang, Langyu, et al.
Publicado: (2024)
por: Wang, Langyu, et al.
Publicado: (2024)
Semantic Noise Reduction via Teacher-Guided Dual-Path Audio-Visual Representation Learning
por: Wang, Linge, et al.
Publicado: (2026)
por: Wang, Linge, et al.
Publicado: (2026)
UniVAD: A Training-free Unified Model for Few-shot Visual Anomaly Detection
por: Gu, Zhaopeng, et al.
Publicado: (2024)
por: Gu, Zhaopeng, et al.
Publicado: (2024)
Advancing Weakly-Supervised Audio-Visual Video Parsing via Segment-wise Pseudo Labeling
por: Zhou, Jinxing, et al.
Publicado: (2024)
por: Zhou, Jinxing, et al.
Publicado: (2024)
AnomalyMoE: Towards a Language-free Generalist Model for Unified Visual Anomaly Detection
por: Gu, Zhaopeng, et al.
Publicado: (2025)
por: Gu, Zhaopeng, et al.
Publicado: (2025)
Teacher-Guided Pseudo Supervision and Cross-Modal Alignment for Audio-Visual Video Parsing
por: Chen, Yaru, et al.
Publicado: (2025)
por: Chen, Yaru, et al.
Publicado: (2025)
Label-anticipated Event Disentanglement for Audio-Visual Video Parsing
por: Zhou, Jinxing, et al.
Publicado: (2024)
por: Zhou, Jinxing, et al.
Publicado: (2024)
Reinforced Label Denoising for Weakly-Supervised Audio-Visual Video Parsing
por: Gao, Yongbiao, et al.
Publicado: (2024)
por: Gao, Yongbiao, et al.
Publicado: (2024)
Quality-Aware Language-Conditioned Local Auto-Regressive Anomaly Synthesis and Detection
por: Qian, Long, et al.
Publicado: (2025)
por: Qian, Long, et al.
Publicado: (2025)
MathPhys-Guided Coarse-to-Fine Anomaly Synthesis with SQE-Driven Bi-Level Optimization for Anomaly Detection
por: Qian, Long, et al.
Publicado: (2025)
por: Qian, Long, et al.
Publicado: (2025)
Optimization of Prompt Learning via Multi-Knowledge Representation for Vision-Language Models
por: Zhang, Enming, et al.
Publicado: (2024)
por: Zhang, Enming, et al.
Publicado: (2024)
FiLo++: Zero-/Few-Shot Anomaly Detection by Fused Fine-Grained Descriptions and Deformable Localization
por: Gu, Zhaopeng, et al.
Publicado: (2025)
por: Gu, Zhaopeng, et al.
Publicado: (2025)
Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing
por: Zhao, Pengcheng, et al.
Publicado: (2024)
por: Zhao, Pengcheng, et al.
Publicado: (2024)
MROVSeg: Breaking the Resolution Curse of Vision-Language Models in Open-Vocabulary Image Segmentation
por: Zhu, Yuanbing, et al.
Publicado: (2024)
por: Zhu, Yuanbing, et al.
Publicado: (2024)
AVS-Mamba: Exploring Temporal and Multi-modal Mamba for Audio-Visual Segmentation
por: Gong, Sitong, et al.
Publicado: (2025)
por: Gong, Sitong, et al.
Publicado: (2025)
EAR: Enhancing Uni-Modal Representations for Weakly Supervised Audio-Visual Video Parsing
por: Li, Huilai, et al.
Publicado: (2026)
por: Li, Huilai, et al.
Publicado: (2026)
Empowering LLMs with Pseudo-Untrimmed Videos for Audio-Visual Temporal Understanding
por: Tang, Yolo Yunlong, et al.
Publicado: (2024)
por: Tang, Yolo Yunlong, et al.
Publicado: (2024)
FiLo: Zero-Shot Anomaly Detection by Fine-Grained Description and High-Quality Localization
por: Gu, Zhaopeng, et al.
Publicado: (2024)
por: Gu, Zhaopeng, et al.
Publicado: (2024)
UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing
por: Lai, Yung-Hsuan, et al.
Publicado: (2025)
por: Lai, Yung-Hsuan, et al.
Publicado: (2025)
TEn-CATG:Text-Enriched Audio-Visual Video Parsing with Multi-Scale Category-Aware Temporal Graph
por: Chen, Yaru, et al.
Publicado: (2025)
por: Chen, Yaru, et al.
Publicado: (2025)
Hierarchical Augmentation and Distillation for Class Incremental Audio-Visual Video Recognition
por: Zuo, Yukun, et al.
Publicado: (2024)
por: Zuo, Yukun, et al.
Publicado: (2024)
AV-DiT: Efficient Audio-Visual Diffusion Transformer for Joint Audio and Video Generation
por: Wang, Kai, et al.
Publicado: (2024)
por: Wang, Kai, et al.
Publicado: (2024)
CoLeaF: A Contrastive-Collaborative Learning Framework for Weakly Supervised Audio-Visual Video Parsing
por: Sardari, Faegheh, et al.
Publicado: (2024)
por: Sardari, Faegheh, et al.
Publicado: (2024)
Robust Audio-Visual Segmentation via Audio-Guided Visual Convergent Alignment
por: Liu, Chen, et al.
Publicado: (2025)
por: Liu, Chen, et al.
Publicado: (2025)
Cross Pseudo-Labeling for Semi-Supervised Audio-Visual Source Localization
por: Guo, Yuxin, et al.
Publicado: (2024)
por: Guo, Yuxin, et al.
Publicado: (2024)
PreFM: Online Audio-Visual Event Parsing via Predictive Future Modeling
por: Yu, Xiao, et al.
Publicado: (2025)
por: Yu, Xiao, et al.
Publicado: (2025)
Learning Visual Affordance from Audio
por: Lu, Lidong, et al.
Publicado: (2025)
por: Lu, Lidong, et al.
Publicado: (2025)
Efficient Audio-Visual Fusion for Video Classification
por: Awan, Mahrukh, et al.
Publicado: (2024)
por: Awan, Mahrukh, et al.
Publicado: (2024)
How Does Audio Influence Visual Attention in Omnidirectional Videos? Database and Model
por: Zhu, Yuxin, et al.
Publicado: (2024)
por: Zhu, Yuxin, et al.
Publicado: (2024)
Native Audio-Visual Alignment for Generation
por: Ji, Longbin, et al.
Publicado: (2026)
por: Ji, Longbin, et al.
Publicado: (2026)
Audio-Guided Visual Perception for Audio-Visual Navigation
por: Wang, Yi, et al.
Publicado: (2025)
por: Wang, Yi, et al.
Publicado: (2025)
Audio-Synchronized Visual Animation
por: Zhang, Lin, et al.
Publicado: (2024)
por: Zhang, Lin, et al.
Publicado: (2024)
Cosh-DiT: Co-Speech Gesture Video Synthesis via Hybrid Audio-Visual Diffusion Transformers
por: Sun, Yasheng, et al.
Publicado: (2025)
por: Sun, Yasheng, et al.
Publicado: (2025)
Scalable Audio-Visual Masked Autoencoders for Efficient Affective Video Facial Analysis
por: Wu, Xuecheng, et al.
Publicado: (2025)
por: Wu, Xuecheng, et al.
Publicado: (2025)
D-ORCA: Dialogue-Centric Optimization for Robust Audio-Visual Captioning
por: Tang, Changli, et al.
Publicado: (2026)
por: Tang, Changli, et al.
Publicado: (2026)
A Survey on Visual Mamba
por: Zhang, Hanwei, et al.
Publicado: (2024)
por: Zhang, Hanwei, et al.
Publicado: (2024)
HAVT-IVD: Heterogeneity-Aware Cross-Modal Network for Audio-Visual Surveillance: Idling Vehicles Detection With Multichannel Audio and Multiscale Visual Cues
por: Li, Xiwen, et al.
Publicado: (2025)
por: Li, Xiwen, et al.
Publicado: (2025)
Don't Let the Video Speak: Audio-Contrastive Preference Optimization for Audio-Visual Language Models
por: Baid, Ami, et al.
Publicado: (2026)
por: Baid, Ami, et al.
Publicado: (2026)
MobileMamba: Lightweight Multi-Receptive Visual Mamba Network
por: He, Haoyang, et al.
Publicado: (2024)
por: He, Haoyang, et al.
Publicado: (2024)
KeyVID: Keyframe-Aware Video Diffusion for Audio-Synchronized Visual Animation
por: Wang, Xingrui, et al.
Publicado: (2025)
por: Wang, Xingrui, et al.
Publicado: (2025)
Ejemplares similares
-
LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing
por: Wang, Langyu, et al.
Publicado: (2024) -
Semantic Noise Reduction via Teacher-Guided Dual-Path Audio-Visual Representation Learning
por: Wang, Linge, et al.
Publicado: (2026) -
UniVAD: A Training-free Unified Model for Few-shot Visual Anomaly Detection
por: Gu, Zhaopeng, et al.
Publicado: (2024) -
Advancing Weakly-Supervised Audio-Visual Video Parsing via Segment-wise Pseudo Labeling
por: Zhou, Jinxing, et al.
Publicado: (2024) -
AnomalyMoE: Towards a Language-free Generalist Model for Unified Visual Anomaly Detection
por: Gu, Zhaopeng, et al.
Publicado: (2025)