SpeakerVid-5M: A Large-Scale High-Quality Dataset for Audio-Visual Dyadic Interactive Human Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Youliang, Li, Zhaoyang, Wang, Duomin, Zhang, Jiahe, Zhou, Deyu, Yin, Zixin, Dai, Xili, Yu, Gang, Li, Xiu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation
di: Zhang, Jing-Xuan, et al.
Pubblicazione: (2025)
di: Zhang, Jing-Xuan, et al.
Pubblicazione: (2025)
Breaking the Pair: Evaluating Dyadic Interaction via Speaker Switching
di: Nilabh, Nishchay, et al.
Pubblicazione: (2026)
di: Nilabh, Nishchay, et al.
Pubblicazione: (2026)
Multi-View Based Audio Visual Target Speaker Extraction
di: Yang, Peijun, et al.
Pubblicazione: (2026)
di: Yang, Peijun, et al.
Pubblicazione: (2026)
Online Audio-Visual Autoregressive Speaker Extraction
di: Pan, Zexu, et al.
Pubblicazione: (2025)
di: Pan, Zexu, et al.
Pubblicazione: (2025)
AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning
di: Zhang, Daning, et al.
Pubblicazione: (2025)
di: Zhang, Daning, et al.
Pubblicazione: (2025)
Multi-Input Multi-Output Target-Speaker Voice Activity Detection For Unified, Flexible, and Robust Audio-Visual Speaker Diarization
di: Cheng, Ming, et al.
Pubblicazione: (2024)
di: Cheng, Ming, et al.
Pubblicazione: (2024)
VidMusician: Video-to-Music Generation with Semantic-Rhythmic Alignment via Hierarchical Visual Features
di: Li, Sifei, et al.
Pubblicazione: (2024)
di: Li, Sifei, et al.
Pubblicazione: (2024)
Audio-Visual Target Speaker Extraction with Reverse Selective Auditory Attention
di: Tao, Ruijie, et al.
Pubblicazione: (2024)
di: Tao, Ruijie, et al.
Pubblicazione: (2024)
Quality-Aware End-to-End Audio-Visual Neural Speaker Diarization
di: He, Mao-Kui, et al.
Pubblicazione: (2024)
di: He, Mao-Kui, et al.
Pubblicazione: (2024)
Two-stage Audio-Visual Target Speaker Extraction System for Real-Time Processing On Edge Device
di: Li, Zixuan, et al.
Pubblicazione: (2025)
di: Li, Zixuan, et al.
Pubblicazione: (2025)
ODAQ: Open Dataset of Audio Quality
di: Torcoli, Matteo, et al.
Pubblicazione: (2023)
di: Torcoli, Matteo, et al.
Pubblicazione: (2023)
Can Audio Large Language Models Verify Speaker Identity?
di: Ren, Yiming, et al.
Pubblicazione: (2025)
di: Ren, Yiming, et al.
Pubblicazione: (2025)
Egocentric Speaker Classification in Child-Adult Dyadic Interactions: From Sensing to Computational Modeling
di: Feng, Tiantian, et al.
Pubblicazione: (2024)
di: Feng, Tiantian, et al.
Pubblicazione: (2024)
Robust Audio-Visual Target Speaker Extraction with Emotion-Aware Multiple Enrollment Fusion
di: Jin, Zhan, et al.
Pubblicazione: (2025)
di: Jin, Zhan, et al.
Pubblicazione: (2025)
Expanding and Analyzing ODAQ -- the Open Dataset of Audio Quality
di: Dick, Sascha, et al.
Pubblicazione: (2025)
di: Dick, Sascha, et al.
Pubblicazione: (2025)
Exploring Speech Foundation Models for Speaker Diarization in Child-Adult Dyadic Interactions
di: Xu, Anfeng, et al.
Pubblicazione: (2024)
di: Xu, Anfeng, et al.
Pubblicazione: (2024)
MT2KD: Towards A General-Purpose Encoder for Speech, Speaker, and Audio Events
di: Yang, Xiaoyu, et al.
Pubblicazione: (2024)
di: Yang, Xiaoyu, et al.
Pubblicazione: (2024)
Utilizing Speaker Profiles for Impersonation Audio Detection
di: Gu, Hao, et al.
Pubblicazione: (2024)
di: Gu, Hao, et al.
Pubblicazione: (2024)
Voice Conversion Augmentation for Speaker Recognition on Defective Datasets
di: Tao, Ruijie, et al.
Pubblicazione: (2024)
di: Tao, Ruijie, et al.
Pubblicazione: (2024)
Audio-Visual Speaker Tracking: Progress, Challenges, and Future Directions
di: Zhao, Jinzheng, et al.
Pubblicazione: (2023)
di: Zhao, Jinzheng, et al.
Pubblicazione: (2023)
Exploring Perceptual Audio Quality Measurement on Stereo Processing Using the Open Dataset of Audio Quality
di: Delgado, Pablo M., et al.
Pubblicazione: (2025)
di: Delgado, Pablo M., et al.
Pubblicazione: (2025)
HiddenSpeaker: Generate Imperceptible Unlearnable Audios for Speaker Verification System
di: Zhang, Zhisheng, et al.
Pubblicazione: (2024)
di: Zhang, Zhisheng, et al.
Pubblicazione: (2024)
CoPlay: Audio-agnostic Cognitive Scaling for Acoustic Sensing
di: Li, Yin, et al.
Pubblicazione: (2024)
di: Li, Yin, et al.
Pubblicazione: (2024)
Review of MEMS Speakers for Audio Applications
di: Wittek, Nils, et al.
Pubblicazione: (2025)
di: Wittek, Nils, et al.
Pubblicazione: (2025)
A Comprehensive Investigation on Speaker Augmentation for Speaker Recognition
di: Zhou, Zhenyu, et al.
Pubblicazione: (2024)
di: Zhou, Zhenyu, et al.
Pubblicazione: (2024)
Descriptor:: Extended-Length Audio Dataset for Synthetic Voice Detection and Speaker Recognition (ELAD-SVDSR)
di: Vijaykumar, Rahul, et al.
Pubblicazione: (2025)
di: Vijaykumar, Rahul, et al.
Pubblicazione: (2025)
Audio-Visual Approach For Multimodal Concurrent Speaker Detection
di: Eliav, Amit, et al.
Pubblicazione: (2024)
di: Eliav, Amit, et al.
Pubblicazione: (2024)
VoxBlink2: A 100K+ Speaker Recognition Corpus and the Open-Set Speaker-Identification Benchmark
di: Lin, Yuke, et al.
Pubblicazione: (2024)
di: Lin, Yuke, et al.
Pubblicazione: (2024)
Multi-Level Speaker Representation for Target Speaker Extraction
di: Zhang, Ke, et al.
Pubblicazione: (2024)
di: Zhang, Ke, et al.
Pubblicazione: (2024)
Speaker-Reasoner: Scaling Interaction Turns and Reasoning Patterns for Timestamped Speaker-Attributed ASR
di: Lin, Zhennan, et al.
Pubblicazione: (2026)
di: Lin, Zhennan, et al.
Pubblicazione: (2026)
HearFit+: Personalized Fitness Monitoring via Audio Signals on Smart Speakers
di: Xie, Yadong, et al.
Pubblicazione: (2025)
di: Xie, Yadong, et al.
Pubblicazione: (2025)
Active Listener: Continuous Generation of Listener's Head Motion Response in Dyadic Interactions
di: Ghosh, Bishal, et al.
Pubblicazione: (2024)
di: Ghosh, Bishal, et al.
Pubblicazione: (2024)
RAVSS: Robust Audio-Visual Speech Separation in Multi-Speaker Scenarios with Missing Visual Cues
di: Pan, Tianrui, et al.
Pubblicazione: (2024)
di: Pan, Tianrui, et al.
Pubblicazione: (2024)
AISHELL-5: The First Open-Source In-Car Multi-Channel Multi-Speaker Speech Dataset for Automatic Speech Diarization and Recognition
di: Dai, Yuhang, et al.
Pubblicazione: (2025)
di: Dai, Yuhang, et al.
Pubblicazione: (2025)
Joint Speaker Features Learning for Audio-visual Multichannel Speech Separation and Recognition
di: Li, Guinan, et al.
Pubblicazione: (2024)
di: Li, Guinan, et al.
Pubblicazione: (2024)
Scale This, Not That: Investigating Key Dataset Attributes for Efficient Speech Enhancement Scaling
di: Zhang, Leying, et al.
Pubblicazione: (2024)
di: Zhang, Leying, et al.
Pubblicazione: (2024)
SemanticAudio: Audio Generation and Editing in Semantic Space
di: Dai, Zheqi, et al.
Pubblicazione: (2026)
di: Dai, Zheqi, et al.
Pubblicazione: (2026)
Plug-and-Steer: Decoupling Separation and Selection in Audio-Visual Target Speaker Extraction
di: Kwak, Doyeop, et al.
Pubblicazione: (2026)
di: Kwak, Doyeop, et al.
Pubblicazione: (2026)
Plug-and-Play Co-Occurring Face Attention for Robust Audio-Visual Speaker Extraction
di: Pan, Zexu, et al.
Pubblicazione: (2025)
di: Pan, Zexu, et al.
Pubblicazione: (2025)
AdvSV: An Over-the-Air Adversarial Attack Dataset for Speaker Verification
di: Wang, Li, et al.
Pubblicazione: (2023)
di: Wang, Li, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation
di: Zhang, Jing-Xuan, et al.
Pubblicazione: (2025) -
Breaking the Pair: Evaluating Dyadic Interaction via Speaker Switching
di: Nilabh, Nishchay, et al.
Pubblicazione: (2026) -
Multi-View Based Audio Visual Target Speaker Extraction
di: Yang, Peijun, et al.
Pubblicazione: (2026) -
Online Audio-Visual Autoregressive Speaker Extraction
di: Pan, Zexu, et al.
Pubblicazione: (2025) -
AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning
di: Zhang, Daning, et al.
Pubblicazione: (2025)