Audio-Guided Visual Perception for Audio-Visual Navigation
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Yi, Yu, Yinfeng, Sun, Fuchun, Wang, Liejun, Zheng, Wendong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Iterative Residual Cross-Attention Mechanism: An Integrated Approach for Audio-Visual Navigation Tasks
por: Zhang, Hailong, et al.
Publicado: (2025)
por: Zhang, Hailong, et al.
Publicado: (2025)
Audio-Guided Dynamic Modality Fusion with Stereo-Aware Attention for Audio-Visual Navigation
por: Li, Jia, et al.
Publicado: (2025)
por: Li, Jia, et al.
Publicado: (2025)
SeeingSounds: Learning Audio-to-Visual Alignment via Text
por: Carnemolla, Simone, et al.
Publicado: (2025)
por: Carnemolla, Simone, et al.
Publicado: (2025)
SAVe: Self-Supervised Audio-visual Deepfake Detection Exploiting Visual Artifacts and Audio-visual Misalignment
por: Shahzad, Sahibzada Adil, et al.
Publicado: (2026)
por: Shahzad, Sahibzada Adil, et al.
Publicado: (2026)
Hierarchical Semantic Correlation-Aware Masked Autoencoder for Unsupervised Audio-Visual Representation Learning
por: Zeng, Donghuo, et al.
Publicado: (2026)
por: Zeng, Donghuo, et al.
Publicado: (2026)
Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator
por: Kang, Minjae, et al.
Publicado: (2025)
por: Kang, Minjae, et al.
Publicado: (2025)
AV-Dialog: Spoken Dialogue Models with Audio-Visual Input
por: Chen, Tuochao, et al.
Publicado: (2025)
por: Chen, Tuochao, et al.
Publicado: (2025)
A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning
por: Vilaca, Luis, et al.
Publicado: (2024)
por: Vilaca, Luis, et al.
Publicado: (2024)
Object-AVEdit: An Object-level Audio-Visual Editing Model
por: Fu, Youquan, et al.
Publicado: (2025)
por: Fu, Youquan, et al.
Publicado: (2025)
Audio-Visual Segmentation via Unlabeled Frame Exploitation
por: Liu, Jinxiang, et al.
Publicado: (2024)
por: Liu, Jinxiang, et al.
Publicado: (2024)
Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing
por: Tian, Zeyue, et al.
Publicado: (2026)
por: Tian, Zeyue, et al.
Publicado: (2026)
Apollo: Unified Multi-Task Audio-Video Joint Generation
por: Wang, Jun, et al.
Publicado: (2026)
por: Wang, Jun, et al.
Publicado: (2026)
IIANet: An Intra- and Inter-Modality Attention Network for Audio-Visual Speech Separation
por: Li, Kai, et al.
Publicado: (2023)
por: Li, Kai, et al.
Publicado: (2023)
TalkVerse: Democratizing Minute-Long Audio-Driven Video Generation
por: Wang, Zhenzhi, et al.
Publicado: (2025)
por: Wang, Zhenzhi, et al.
Publicado: (2025)
Audio-Visual World Models: Towards Multisensory Imagination in Sight and Sound
por: Wang, Jiahua, et al.
Publicado: (2025)
por: Wang, Jiahua, et al.
Publicado: (2025)
Sounding Highlights: Dual-Pathway Audio Encoders for Audio-Visual Video Highlight Detection
por: Joo, Seohyun, et al.
Publicado: (2026)
por: Joo, Seohyun, et al.
Publicado: (2026)
VGGSounder: Audio-Visual Evaluations for Foundation Models
por: Zverev, Daniil, et al.
Publicado: (2025)
por: Zverev, Daniil, et al.
Publicado: (2025)
MAVERIX: Multimodal Audio-Visual Evaluation and Recognition IndeX
por: Xie, Liuyue, et al.
Publicado: (2025)
por: Xie, Liuyue, et al.
Publicado: (2025)
Diffusion Models for Joint Audio-Video Generation
por: La Torre, Alejandro Paredes
Publicado: (2026)
por: La Torre, Alejandro Paredes
Publicado: (2026)
AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models
por: Yang, Jialiang, et al.
Publicado: (2026)
por: Yang, Jialiang, et al.
Publicado: (2026)
Do Joint Audio-Video Generation Models Understand Physics?
por: Cui, Zijun, et al.
Publicado: (2026)
por: Cui, Zijun, et al.
Publicado: (2026)
Contextual Cross-Modal Attention for Audio-Visual Deepfake Detection and Localization
por: Katamneni, Vinaya Sree, et al.
Publicado: (2024)
por: Katamneni, Vinaya Sree, et al.
Publicado: (2024)
FlowPortrait: Reinforcement Learning for Audio-Driven Portrait Video Generation
por: Tan, Weiting, et al.
Publicado: (2026)
por: Tan, Weiting, et al.
Publicado: (2026)
Schrodinger Audio-Visual Editor: Object-Level Audiovisual Removal
por: Xu, Weihan, et al.
Publicado: (2025)
por: Xu, Weihan, et al.
Publicado: (2025)
DASH: Dynamic Audio-Driven Semantic Chunking for Efficient Omnimodal Token Compression
por: Li, Bingzhou, et al.
Publicado: (2026)
por: Li, Bingzhou, et al.
Publicado: (2026)
What's Making That Sound Right Now? Video-centric Audio-Visual Localization
por: Choi, Hahyeon, et al.
Publicado: (2025)
por: Choi, Hahyeon, et al.
Publicado: (2025)
Multilingual Audio-Visual Speech Recognition with Hybrid CTC/RNN-T Fast Conformer
por: Burchi, Maxime, et al.
Publicado: (2024)
por: Burchi, Maxime, et al.
Publicado: (2024)
OLKAVS: An Open Large-Scale Korean Audio-Visual Speech Dataset
por: Park, Jeongkyun, et al.
Publicado: (2023)
por: Park, Jeongkyun, et al.
Publicado: (2023)
Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning
por: Xu, Le, et al.
Publicado: (2025)
por: Xu, Le, et al.
Publicado: (2025)
MultiSoundGen: Video-to-Audio Generation for Multi-Event Scenarios via SlowFast Contrastive Audio-Visual Pretraining and Direct Preference Optimization
por: Yang, Jianxuan, et al.
Publicado: (2025)
por: Yang, Jianxuan, et al.
Publicado: (2025)
SAV-SE: Scene-aware Audio-Visual Speech Enhancement with Selective State Space Model
por: Qian, Xinyuan, et al.
Publicado: (2024)
por: Qian, Xinyuan, et al.
Publicado: (2024)
AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers
por: Araujo, Edson, et al.
Publicado: (2026)
por: Araujo, Edson, et al.
Publicado: (2026)
OmniForcing: Unleashing Real-time Joint Audio-Visual Generation
por: Su, Yaofeng, et al.
Publicado: (2026)
por: Su, Yaofeng, et al.
Publicado: (2026)
UniAV: Unified Audio-Visual Perception for Multi-Task Video Event Localization
por: Geng, Tiantian, et al.
Publicado: (2024)
por: Geng, Tiantian, et al.
Publicado: (2024)
Aligning Audio-Visual Joint Representations with an Agentic Workflow
por: Mo, Shentong, et al.
Publicado: (2024)
por: Mo, Shentong, et al.
Publicado: (2024)
AV-Odyssey Bench: Can Your Multimodal LLMs Really Understand Audio-Visual Information?
por: Gong, Kaixiong, et al.
Publicado: (2024)
por: Gong, Kaixiong, et al.
Publicado: (2024)
AV-Edit: Multimodal Generative Sound Effect Editing via Audio-Visual Semantic Joint Control
por: Guo, Xinyue, et al.
Publicado: (2025)
por: Guo, Xinyue, et al.
Publicado: (2025)
MoLT: Mixture of Layer-Wise Tokens for Efficient Audio-Visual Learning
por: Rho, Kyeongha, et al.
Publicado: (2025)
por: Rho, Kyeongha, et al.
Publicado: (2025)
SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing
por: Chen, Mingfei, et al.
Publicado: (2025)
por: Chen, Mingfei, et al.
Publicado: (2025)
READ-Net: Clarifying Emotional Ambiguity via Adaptive Feature Recalibration for Audio-Visual Depression Detection
por: Chen, Chenglizhao, et al.
Publicado: (2026)
por: Chen, Chenglizhao, et al.
Publicado: (2026)
Ejemplares similares
-
Iterative Residual Cross-Attention Mechanism: An Integrated Approach for Audio-Visual Navigation Tasks
por: Zhang, Hailong, et al.
Publicado: (2025) -
Audio-Guided Dynamic Modality Fusion with Stereo-Aware Attention for Audio-Visual Navigation
por: Li, Jia, et al.
Publicado: (2025) -
SeeingSounds: Learning Audio-to-Visual Alignment via Text
por: Carnemolla, Simone, et al.
Publicado: (2025) -
SAVe: Self-Supervised Audio-visual Deepfake Detection Exploiting Visual Artifacts and Audio-visual Misalignment
por: Shahzad, Sahibzada Adil, et al.
Publicado: (2026) -
Hierarchical Semantic Correlation-Aware Masked Autoencoder for Unsupervised Audio-Visual Representation Learning
por: Zeng, Donghuo, et al.
Publicado: (2026)