Audio-Visual Segmentation via Unlabeled Frame Exploitation
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Jinxiang, Liu, Yikun, Zhang, Fei, Ju, Chen, Zhang, Ya, Wang, Yanfeng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
3D Audio-Visual Segmentation
di: Sokolov, Artem, et al.
Pubblicazione: (2024)
di: Sokolov, Artem, et al.
Pubblicazione: (2024)
Multifaceted Evaluation of Audio-Visual Capability for MLLMs: Effectiveness, Efficiency, Generalizability and Robustness
di: Zhao, Yusheng, et al.
Pubblicazione: (2025)
di: Zhao, Yusheng, et al.
Pubblicazione: (2025)
AlignVSR: Audio-Visual Cross-Modal Alignment for Visual Speech Recognition
di: Liu, Zehua, et al.
Pubblicazione: (2024)
di: Liu, Zehua, et al.
Pubblicazione: (2024)
Pilot-guided Multimodal Semantic Communication for Audio-Visual Event Localization
di: Yu, Fei, et al.
Pubblicazione: (2024)
di: Yu, Fei, et al.
Pubblicazione: (2024)
AD-AVSR: Asymmetric Dual-stream Enhancement for Robust Audio-Visual Speech Recognition
di: Xue, Junxiao, et al.
Pubblicazione: (2025)
di: Xue, Junxiao, et al.
Pubblicazione: (2025)
SAV-SE: Scene-aware Audio-Visual Speech Enhancement with Selective State Space Model
di: Qian, Xinyuan, et al.
Pubblicazione: (2024)
di: Qian, Xinyuan, et al.
Pubblicazione: (2024)
Contrastive Conditional Latent Diffusion for Audio-visual Segmentation
di: Mao, Yuxin, et al.
Pubblicazione: (2023)
di: Mao, Yuxin, et al.
Pubblicazione: (2023)
Audio-Visual Instance Segmentation
di: Guo, Ruohao, et al.
Pubblicazione: (2023)
di: Guo, Ruohao, et al.
Pubblicazione: (2023)
Audio-Visual Speech Enhancement In Complex Scenarios With Separation And Dereverberation Joint Modeling
di: Du, Jiarong, et al.
Pubblicazione: (2025)
di: Du, Jiarong, et al.
Pubblicazione: (2025)
Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator
di: Kang, Minjae, et al.
Pubblicazione: (2025)
di: Kang, Minjae, et al.
Pubblicazione: (2025)
Object-AVEdit: An Object-level Audio-Visual Editing Model
di: Fu, Youquan, et al.
Pubblicazione: (2025)
di: Fu, Youquan, et al.
Pubblicazione: (2025)
Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning
di: Xu, Le, et al.
Pubblicazione: (2025)
di: Xu, Le, et al.
Pubblicazione: (2025)
Adaptive Audio-Visual Speech Recognition via Matryoshka-Based Multimodal LLMs
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2025)
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2025)
MAVERIX: Multimodal Audio-Visual Evaluation and Recognition IndeX
di: Xie, Liuyue, et al.
Pubblicazione: (2025)
di: Xie, Liuyue, et al.
Pubblicazione: (2025)
Sounding Highlights: Dual-Pathway Audio Encoders for Audio-Visual Video Highlight Detection
di: Joo, Seohyun, et al.
Pubblicazione: (2026)
di: Joo, Seohyun, et al.
Pubblicazione: (2026)
VGGSounder: Audio-Visual Evaluations for Foundation Models
di: Zverev, Daniil, et al.
Pubblicazione: (2025)
di: Zverev, Daniil, et al.
Pubblicazione: (2025)
Music Audio-Visual Question Answering Requires Specialized Multimodal Designs
di: You, Wenhao, et al.
Pubblicazione: (2025)
di: You, Wenhao, et al.
Pubblicazione: (2025)
Nexus: An Omni-Perceptive And -Interactive Model for Language, Audio, And Vision
di: Liu, Che, et al.
Pubblicazione: (2025)
di: Liu, Che, et al.
Pubblicazione: (2025)
UniAV: Unified Audio-Visual Perception for Multi-Task Video Event Localization
di: Geng, Tiantian, et al.
Pubblicazione: (2024)
di: Geng, Tiantian, et al.
Pubblicazione: (2024)
AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation
di: Wang, Le, et al.
Pubblicazione: (2025)
di: Wang, Le, et al.
Pubblicazione: (2025)
Real Acoustic Fields: An Audio-Visual Room Acoustics Dataset and Benchmark
di: Chen, Ziyang, et al.
Pubblicazione: (2024)
di: Chen, Ziyang, et al.
Pubblicazione: (2024)
Large Language Models are Strong Audio-Visual Speech Recognition Learners
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2024)
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2024)
Seeing and Hearing: Open-domain Visual-Audio Generation with Diffusion Latent Aligners
di: Xing, Yazhou, et al.
Pubblicazione: (2024)
di: Xing, Yazhou, et al.
Pubblicazione: (2024)
Prompting Segmentation with Sound Is Generalizable Audio-Visual Source Localizer
di: Wang, Yaoting, et al.
Pubblicazione: (2023)
di: Wang, Yaoting, et al.
Pubblicazione: (2023)
Aligned Better, Listen Better for Audio-Visual Large Language Models
di: Guo, Yuxin, et al.
Pubblicazione: (2025)
di: Guo, Yuxin, et al.
Pubblicazione: (2025)
Benchmarking Cross-Domain Audio-Visual Deception Detection
di: Guo, Xiaobao, et al.
Pubblicazione: (2024)
di: Guo, Xiaobao, et al.
Pubblicazione: (2024)
Detecting Audio-Visual Deepfakes with Fine-Grained Inconsistencies
di: Astrid, Marcella, et al.
Pubblicazione: (2024)
di: Astrid, Marcella, et al.
Pubblicazione: (2024)
AV-SUPERB: A Multi-Task Evaluation Benchmark for Audio-Visual Representation Models
di: Tseng, Yuan, et al.
Pubblicazione: (2023)
di: Tseng, Yuan, et al.
Pubblicazione: (2023)
CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment
di: Araujo, Edson, et al.
Pubblicazione: (2025)
di: Araujo, Edson, et al.
Pubblicazione: (2025)
Audio-Assisted Face Video Restoration with Temporal and Identity Complementary Learning
di: Cao, Yuqin, et al.
Pubblicazione: (2025)
di: Cao, Yuqin, et al.
Pubblicazione: (2025)
RT-LA-VocE: Real-Time Low-SNR Audio-Visual Speech Enhancement
di: Chen, Honglie, et al.
Pubblicazione: (2024)
di: Chen, Honglie, et al.
Pubblicazione: (2024)
Learning Self-Supervised Audio-Visual Representations for Sound Recommendations
di: Krishnamurthy, Sudha
Pubblicazione: (2024)
di: Krishnamurthy, Sudha
Pubblicazione: (2024)
DETECLAP: Enhancing Audio-Visual Representation Learning with Object Information
di: Nakada, Shota, et al.
Pubblicazione: (2024)
di: Nakada, Shota, et al.
Pubblicazione: (2024)
AVFF: Audio-Visual Feature Fusion for Video Deepfake Detection
di: Oorloff, Trevine, et al.
Pubblicazione: (2024)
di: Oorloff, Trevine, et al.
Pubblicazione: (2024)
AISHELL6-whisper: A Chinese Mandarin Audio-visual Whisper Speech Dataset with Speech Recognition Baselines
di: Li, Cancan, et al.
Pubblicazione: (2025)
di: Li, Cancan, et al.
Pubblicazione: (2025)
Contextual Cross-Modal Attention for Audio-Visual Deepfake Detection and Localization
di: Katamneni, Vinaya Sree, et al.
Pubblicazione: (2024)
di: Katamneni, Vinaya Sree, et al.
Pubblicazione: (2024)
Spiking Tucker Fusion Transformer for Audio-Visual Zero-Shot Learning
di: Li, Wenrui, et al.
Pubblicazione: (2024)
di: Li, Wenrui, et al.
Pubblicazione: (2024)
MA-AVT: Modality Alignment for Parameter-Efficient Audio-Visual Transformers
di: Mahmud, Tanvir, et al.
Pubblicazione: (2024)
di: Mahmud, Tanvir, et al.
Pubblicazione: (2024)
Classifying Shelf Life Quality of Pineapples by Combining Audio and Visual Features
di: Jiang, Yi-Lu, et al.
Pubblicazione: (2025)
di: Jiang, Yi-Lu, et al.
Pubblicazione: (2025)
Cross Pseudo-Labeling for Semi-Supervised Audio-Visual Source Localization
di: Guo, Yuxin, et al.
Pubblicazione: (2024)
di: Guo, Yuxin, et al.
Pubblicazione: (2024)
Documenti analoghi
-
3D Audio-Visual Segmentation
di: Sokolov, Artem, et al.
Pubblicazione: (2024) -
Multifaceted Evaluation of Audio-Visual Capability for MLLMs: Effectiveness, Efficiency, Generalizability and Robustness
di: Zhao, Yusheng, et al.
Pubblicazione: (2025) -
AlignVSR: Audio-Visual Cross-Modal Alignment for Visual Speech Recognition
di: Liu, Zehua, et al.
Pubblicazione: (2024) -
Pilot-guided Multimodal Semantic Communication for Audio-Visual Event Localization
di: Yu, Fei, et al.
Pubblicazione: (2024) -
AD-AVSR: Asymmetric Dual-stream Enhancement for Robust Audio-Visual Speech Recognition
di: Xue, Junxiao, et al.
Pubblicazione: (2025)