Salvato in:
| Autori principali: | Yin, Yongkang, Li, Xu, Shan, Ying, Zou, Yuexian |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2312.05730 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction
di: Wang, Jiadong, et al.
Pubblicazione: (2026)
di: Wang, Jiadong, et al.
Pubblicazione: (2026)
Quality-Aware End-to-End Audio-Visual Neural Speaker Diarization
di: He, Mao-Kui, et al.
Pubblicazione: (2024)
di: He, Mao-Kui, et al.
Pubblicazione: (2024)
Audio-Visual Speaker Diarization: Current Databases, Approaches and Challenges
di: Mingote, Victoria, et al.
Pubblicazione: (2024)
di: Mingote, Victoria, et al.
Pubblicazione: (2024)
Landmark-Guided Cross-Speaker Lip Reading with Mutual Information Regularization
di: Wu, Linzhi, et al.
Pubblicazione: (2024)
di: Wu, Linzhi, et al.
Pubblicazione: (2024)
Cross-Modality and Within-Modality Regularization for Audio-Visual DeepFake Detection
di: Zou, Heqing, et al.
Pubblicazione: (2024)
di: Zou, Heqing, et al.
Pubblicazione: (2024)
A Toolkit for Joint Speaker Diarization and Identification with Application to Speaker-Attributed ASR
di: Morrone, Giovanni, et al.
Pubblicazione: (2024)
di: Morrone, Giovanni, et al.
Pubblicazione: (2024)
SyncLipMAE: Contrastive Masked Pretraining for Audio-Visual Talking-Face Representation
di: Ling, Zeyu, et al.
Pubblicazione: (2025)
di: Ling, Zeyu, et al.
Pubblicazione: (2025)
StyleSpeaker: Audio-Enhanced Fine-Grained Style Modeling for Speech-Driven 3D Facial Animation
di: Yang, An, et al.
Pubblicazione: (2025)
di: Yang, An, et al.
Pubblicazione: (2025)
EMID: An Emotional Aligned Dataset in Audio-Visual Modality
di: Zou, Jialing, et al.
Pubblicazione: (2023)
di: Zou, Jialing, et al.
Pubblicazione: (2023)
Audio-Visual Cross-Modal Compression for Generative Face Video Coding
di: Xu, Youmin, et al.
Pubblicazione: (2025)
di: Xu, Youmin, et al.
Pubblicazione: (2025)
LPIPS-AttnWav2Lip: Generic Audio-Driven lip synchronization for Talking Head Generation in the Wild
di: Chen, Zhipeng, et al.
Pubblicazione: (2026)
di: Chen, Zhipeng, et al.
Pubblicazione: (2026)
M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset
di: Wu, Shilong
Pubblicazione: (2025)
di: Wu, Shilong
Pubblicazione: (2025)
Towards Accurate Lip-to-Speech Synthesis in-the-Wild
di: Hegde, Sindhu, et al.
Pubblicazione: (2024)
di: Hegde, Sindhu, et al.
Pubblicazione: (2024)
LipGen: Viseme-Guided Lip Video Generation for Enhancing Visual Speech Recognition
di: Hao, Bowen, et al.
Pubblicazione: (2025)
di: Hao, Bowen, et al.
Pubblicazione: (2025)
Robust Wake Word Spotting With Frame-Level Cross-Modal Attention Based Audio-Visual Conformer
di: Wang, Haoxu, et al.
Pubblicazione: (2024)
di: Wang, Haoxu, et al.
Pubblicazione: (2024)
Image Conductor: Precision Control for Interactive Video Synthesis
di: Li, Yaowei, et al.
Pubblicazione: (2024)
di: Li, Yaowei, et al.
Pubblicazione: (2024)
ESG-Net: Event-Aware Semantic Guided Network for Dense Audio-Visual Event Localization
di: Li, Huilai, et al.
Pubblicazione: (2025)
di: Li, Huilai, et al.
Pubblicazione: (2025)
EAR: Enhancing Uni-Modal Representations for Weakly Supervised Audio-Visual Video Parsing
di: Li, Huilai, et al.
Pubblicazione: (2026)
di: Li, Huilai, et al.
Pubblicazione: (2026)
Style-Preserving Lip Sync via Audio-Aware Style Reference
di: Zhong, Weizhi, et al.
Pubblicazione: (2024)
di: Zhong, Weizhi, et al.
Pubblicazione: (2024)
BlobCtrl: Taming Controllable Blob for Element-level Image Editing
di: Li, Yaowei, et al.
Pubblicazione: (2025)
di: Li, Yaowei, et al.
Pubblicazione: (2025)
AudioStory: Generating Long-Form Narrative Audio with Large Language Models
di: Guo, Yuxin, et al.
Pubblicazione: (2025)
di: Guo, Yuxin, et al.
Pubblicazione: (2025)
WavCaps: A ChatGPT-Assisted Weakly-Labelled Audio Captioning Dataset for Audio-Language Multimodal Research
di: Mei, Xinhao, et al.
Pubblicazione: (2023)
di: Mei, Xinhao, et al.
Pubblicazione: (2023)
Target Speech Diarization with Multimodal Prompts
di: Jiang, Yidi, et al.
Pubblicazione: (2024)
di: Jiang, Yidi, et al.
Pubblicazione: (2024)
RAVSS: Robust Audio-Visual Speech Separation in Multi-Speaker Scenarios with Missing Visual Cues
di: Pan, Tianrui, et al.
Pubblicazione: (2024)
di: Pan, Tianrui, et al.
Pubblicazione: (2024)
Audio-Visual Speaker Tracking: Progress, Challenges, and Future Directions
di: Zhao, Jinzheng, et al.
Pubblicazione: (2023)
di: Zhao, Jinzheng, et al.
Pubblicazione: (2023)
MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions
di: Li, Junjie, et al.
Pubblicazione: (2025)
di: Li, Junjie, et al.
Pubblicazione: (2025)
AVID: A Benchmark for Omni-Modal Audio-Visual Inconsistency Understanding via Agent-Driven Construction
di: Chen, Zixuan, et al.
Pubblicazione: (2026)
di: Chen, Zixuan, et al.
Pubblicazione: (2026)
Cross-domain Multi-step Thinking: Zero-shot Fine-grained Traffic Sign Recognition in the Wild
di: Gan, Yaozong, et al.
Pubblicazione: (2024)
di: Gan, Yaozong, et al.
Pubblicazione: (2024)
Teacher-Guided Pseudo Supervision and Cross-Modal Alignment for Audio-Visual Video Parsing
di: Chen, Yaru, et al.
Pubblicazione: (2025)
di: Chen, Yaru, et al.
Pubblicazione: (2025)
EgoAdapt: Enhancing Robustness in Egocentric Interactive Speaker Detection Under Missing Modalities
di: Qian, Xinyuan, et al.
Pubblicazione: (2026)
di: Qian, Xinyuan, et al.
Pubblicazione: (2026)
Mixture of Disentangled Experts with Missing Modalities for Robust Multimodal Sentiment Analysis
di: Li, Xiang, et al.
Pubblicazione: (2026)
di: Li, Xiang, et al.
Pubblicazione: (2026)
SpeakerLLM: A Speaker-Specialized Audio-LLM for Speaker Understanding and Verification Reasoning
di: Nam, KiHyun, et al.
Pubblicazione: (2026)
di: Nam, KiHyun, et al.
Pubblicazione: (2026)
Speaker Embedding Informed Audiovisual Active Speaker Detection for Egocentric Recordings
di: Clarke, Jason, et al.
Pubblicazione: (2025)
di: Clarke, Jason, et al.
Pubblicazione: (2025)
A Survey on Cross-Modal Interaction Between Music and Multimodal Data
di: Li, Sifei, et al.
Pubblicazione: (2025)
di: Li, Sifei, et al.
Pubblicazione: (2025)
Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries
di: Kim, Minyoung, et al.
Pubblicazione: (2025)
di: Kim, Minyoung, et al.
Pubblicazione: (2025)
CineAGI: Character-Consistent Movie Creation through LLM-Orchestrated Multi-Modal Generation and Cross-Scene Integration
di: Xie, Tianyidan, et al.
Pubblicazione: (2026)
di: Xie, Tianyidan, et al.
Pubblicazione: (2026)
Robust LLM-based Audio-Visual Speech Recognition with Sparse Modality Alignment and Visual Unit-Guided Refinement
di: Su, Fei, et al.
Pubblicazione: (2026)
di: Su, Fei, et al.
Pubblicazione: (2026)
HDA-SELD: Hierarchical Cross-Modal Distillation with Multi-Level Data Augmentation for Low-Resource Audio-Visual Sound Event Localization and Detection
di: Wang, Qing, et al.
Pubblicazione: (2025)
di: Wang, Qing, et al.
Pubblicazione: (2025)
Audio ControlNet for Fine-Grained Audio Generation and Editing
di: Zhu, Haina, et al.
Pubblicazione: (2026)
di: Zhu, Haina, et al.
Pubblicazione: (2026)
Pay More Attention To Audio: Mitigating Imbalance of Cross-Modal Attention in Large Audio Language Models
di: Wang, Junyu, et al.
Pubblicazione: (2025)
di: Wang, Junyu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction
di: Wang, Jiadong, et al.
Pubblicazione: (2026) -
Quality-Aware End-to-End Audio-Visual Neural Speaker Diarization
di: He, Mao-Kui, et al.
Pubblicazione: (2024) -
Audio-Visual Speaker Diarization: Current Databases, Approaches and Challenges
di: Mingote, Victoria, et al.
Pubblicazione: (2024) -
Landmark-Guided Cross-Speaker Lip Reading with Mutual Information Regularization
di: Wu, Linzhi, et al.
Pubblicazione: (2024) -
Cross-Modality and Within-Modality Regularization for Audio-Visual DeepFake Detection
di: Zou, Heqing, et al.
Pubblicazione: (2024)