Hierarchical Semantic Correlation-Aware Masked Autoencoder for Unsupervised Audio-Visual Representation Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Zeng, Donghuo, Niu, Hao, Taya, Masato |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Learning Audio-Visual Embeddings with Inferred Latent Interaction Graphs
di: Zeng, Donghuo, et al.
Pubblicazione: (2026)
di: Zeng, Donghuo, et al.
Pubblicazione: (2026)
Metric Learning with Progressive Self-Distillation for Audio-Visual Embedding Learning
di: Zeng, Donghuo, et al.
Pubblicazione: (2025)
di: Zeng, Donghuo, et al.
Pubblicazione: (2025)
Audio-Guided Visual Perception for Audio-Visual Navigation
di: Wang, Yi, et al.
Pubblicazione: (2025)
di: Wang, Yi, et al.
Pubblicazione: (2025)
SeeingSounds: Learning Audio-to-Visual Alignment via Text
di: Carnemolla, Simone, et al.
Pubblicazione: (2025)
di: Carnemolla, Simone, et al.
Pubblicazione: (2025)
DASH: Dynamic Audio-Driven Semantic Chunking for Efficient Omnimodal Token Compression
di: Li, Bingzhou, et al.
Pubblicazione: (2026)
di: Li, Bingzhou, et al.
Pubblicazione: (2026)
Apollo: Unified Multi-Task Audio-Video Joint Generation
di: Wang, Jun, et al.
Pubblicazione: (2026)
di: Wang, Jun, et al.
Pubblicazione: (2026)
A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning
di: Vilaca, Luis, et al.
Pubblicazione: (2024)
di: Vilaca, Luis, et al.
Pubblicazione: (2024)
FlowPortrait: Reinforcement Learning for Audio-Driven Portrait Video Generation
di: Tan, Weiting, et al.
Pubblicazione: (2026)
di: Tan, Weiting, et al.
Pubblicazione: (2026)
Do Joint Audio-Video Generation Models Understand Physics?
di: Cui, Zijun, et al.
Pubblicazione: (2026)
di: Cui, Zijun, et al.
Pubblicazione: (2026)
Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing
di: Tian, Zeyue, et al.
Pubblicazione: (2026)
di: Tian, Zeyue, et al.
Pubblicazione: (2026)
Diffusion Models for Joint Audio-Video Generation
di: La Torre, Alejandro Paredes
Pubblicazione: (2026)
di: La Torre, Alejandro Paredes
Pubblicazione: (2026)
AV-Dialog: Spoken Dialogue Models with Audio-Visual Input
di: Chen, Tuochao, et al.
Pubblicazione: (2025)
di: Chen, Tuochao, et al.
Pubblicazione: (2025)
TalkVerse: Democratizing Minute-Long Audio-Driven Video Generation
di: Wang, Zhenzhi, et al.
Pubblicazione: (2025)
di: Wang, Zhenzhi, et al.
Pubblicazione: (2025)
AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models
di: Yang, Jialiang, et al.
Pubblicazione: (2026)
di: Yang, Jialiang, et al.
Pubblicazione: (2026)
SAVe: Self-Supervised Audio-visual Deepfake Detection Exploiting Visual Artifacts and Audio-visual Misalignment
di: Shahzad, Sahibzada Adil, et al.
Pubblicazione: (2026)
di: Shahzad, Sahibzada Adil, et al.
Pubblicazione: (2026)
Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator
di: Kang, Minjae, et al.
Pubblicazione: (2025)
di: Kang, Minjae, et al.
Pubblicazione: (2025)
HiCMAE: Hierarchical Contrastive Masked Autoencoder for Self-Supervised Audio-Visual Emotion Recognition
di: Sun, Licai, et al.
Pubblicazione: (2024)
di: Sun, Licai, et al.
Pubblicazione: (2024)
Towards Unified Co-Speech Gesture Generation via Hierarchical Implicit Periodicity Learning
di: Guo, Xin, et al.
Pubblicazione: (2025)
di: Guo, Xin, et al.
Pubblicazione: (2025)
MAVERIX: Multimodal Audio-Visual Evaluation and Recognition IndeX
di: Xie, Liuyue, et al.
Pubblicazione: (2025)
di: Xie, Liuyue, et al.
Pubblicazione: (2025)
Schrodinger Audio-Visual Editor: Object-Level Audiovisual Removal
di: Xu, Weihan, et al.
Pubblicazione: (2025)
di: Xu, Weihan, et al.
Pubblicazione: (2025)
SoundVista: Novel-View Ambient Sound Synthesis via Visual-Acoustic Binding
di: Chen, Mingfei, et al.
Pubblicazione: (2025)
di: Chen, Mingfei, et al.
Pubblicazione: (2025)
Sounding Highlights: Dual-Pathway Audio Encoders for Audio-Visual Video Highlight Detection
di: Joo, Seohyun, et al.
Pubblicazione: (2026)
di: Joo, Seohyun, et al.
Pubblicazione: (2026)
VGGSounder: Audio-Visual Evaluations for Foundation Models
di: Zverev, Daniil, et al.
Pubblicazione: (2025)
di: Zverev, Daniil, et al.
Pubblicazione: (2025)
Aligning Audio-Visual Joint Representations with an Agentic Workflow
di: Mo, Shentong, et al.
Pubblicazione: (2024)
di: Mo, Shentong, et al.
Pubblicazione: (2024)
CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment
di: Araujo, Edson, et al.
Pubblicazione: (2025)
di: Araujo, Edson, et al.
Pubblicazione: (2025)
Audio-Visual Segmentation via Unlabeled Frame Exploitation
di: Liu, Jinxiang, et al.
Pubblicazione: (2024)
di: Liu, Jinxiang, et al.
Pubblicazione: (2024)
AV-Edit: Multimodal Generative Sound Effect Editing via Audio-Visual Semantic Joint Control
di: Guo, Xinyue, et al.
Pubblicazione: (2025)
di: Guo, Xinyue, et al.
Pubblicazione: (2025)
Object-AVEdit: An Object-level Audio-Visual Editing Model
di: Fu, Youquan, et al.
Pubblicazione: (2025)
di: Fu, Youquan, et al.
Pubblicazione: (2025)
Contextual Cross-Modal Attention for Audio-Visual Deepfake Detection and Localization
di: Katamneni, Vinaya Sree, et al.
Pubblicazione: (2024)
di: Katamneni, Vinaya Sree, et al.
Pubblicazione: (2024)
Audit After Segmentation: Reference-Free Mask Quality Assessment for Language-Referred Audio-Visual Segmentation
di: Zhou, Jinxing, et al.
Pubblicazione: (2026)
di: Zhou, Jinxing, et al.
Pubblicazione: (2026)
Efficient Selective Audio Masked Multimodal Bottleneck Transformer for Audio-Video Classification
di: Zhu, Wentao
Pubblicazione: (2024)
di: Zhu, Wentao
Pubblicazione: (2024)
What's Making That Sound Right Now? Video-centric Audio-Visual Localization
di: Choi, Hahyeon, et al.
Pubblicazione: (2025)
di: Choi, Hahyeon, et al.
Pubblicazione: (2025)
Multilingual Audio-Visual Speech Recognition with Hybrid CTC/RNN-T Fast Conformer
di: Burchi, Maxime, et al.
Pubblicazione: (2024)
di: Burchi, Maxime, et al.
Pubblicazione: (2024)
MoLT: Mixture of Layer-Wise Tokens for Efficient Audio-Visual Learning
di: Rho, Kyeongha, et al.
Pubblicazione: (2025)
di: Rho, Kyeongha, et al.
Pubblicazione: (2025)
PAVAS: Physics-Aware Video-to-Audio Synthesis
di: Hyun-Bin, Oh, et al.
Pubblicazione: (2025)
di: Hyun-Bin, Oh, et al.
Pubblicazione: (2025)
OLKAVS: An Open Large-Scale Korean Audio-Visual Speech Dataset
di: Park, Jeongkyun, et al.
Pubblicazione: (2023)
di: Park, Jeongkyun, et al.
Pubblicazione: (2023)
SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing
di: Chen, Mingfei, et al.
Pubblicazione: (2025)
di: Chen, Mingfei, et al.
Pubblicazione: (2025)
SAV-SE: Scene-aware Audio-Visual Speech Enhancement with Selective State Space Model
di: Qian, Xinyuan, et al.
Pubblicazione: (2024)
di: Qian, Xinyuan, et al.
Pubblicazione: (2024)
Boosting Audio Visual Question Answering via Key Semantic-Aware Cues
di: Li, Guangyao, et al.
Pubblicazione: (2024)
di: Li, Guangyao, et al.
Pubblicazione: (2024)
Enhancing Lie Detection Accuracy: A Comparative Study of Classic ML, CNN, and GCN Models using Audio-Visual Features
di: Abdelwahab, Abdelrahman, et al.
Pubblicazione: (2024)
di: Abdelwahab, Abdelrahman, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Learning Audio-Visual Embeddings with Inferred Latent Interaction Graphs
di: Zeng, Donghuo, et al.
Pubblicazione: (2026) -
Metric Learning with Progressive Self-Distillation for Audio-Visual Embedding Learning
di: Zeng, Donghuo, et al.
Pubblicazione: (2025) -
Audio-Guided Visual Perception for Audio-Visual Navigation
di: Wang, Yi, et al.
Pubblicazione: (2025) -
SeeingSounds: Learning Audio-to-Visual Alignment via Text
di: Carnemolla, Simone, et al.
Pubblicazione: (2025) -
DASH: Dynamic Audio-Driven Semantic Chunking for Efficient Omnimodal Token Compression
di: Li, Bingzhou, et al.
Pubblicazione: (2026)