SpeakerLLM: A Speaker-Specialized Audio-LLM for Speaker Understanding and Verification Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Nam, KiHyun, Heo, Jungwoo, Bae, Siu, Yu, Ha-Jin, Chung, Joon Son |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Disentangled Representation Learning for Environment-agnostic Speaker Recognition
di: Nam, KiHyun, et al.
Pubblicazione: (2024)
di: Nam, KiHyun, et al.
Pubblicazione: (2024)
Plug-and-Steer: Decoupling Separation and Selection in Audio-Visual Target Speaker Extraction
di: Kwak, Doyeop, et al.
Pubblicazione: (2026)
di: Kwak, Doyeop, et al.
Pubblicazione: (2026)
Noise-Conditioned Mixture-of-Experts Framework for Robust Speaker Verification
di: Gu, Bin, et al.
Pubblicazione: (2025)
di: Gu, Bin, et al.
Pubblicazione: (2025)
Audio-Visual Speaker Tracking: Progress, Challenges, and Future Directions
di: Zhao, Jinzheng, et al.
Pubblicazione: (2023)
di: Zhao, Jinzheng, et al.
Pubblicazione: (2023)
Quality-Aware End-to-End Audio-Visual Neural Speaker Diarization
di: He, Mao-Kui, et al.
Pubblicazione: (2024)
di: He, Mao-Kui, et al.
Pubblicazione: (2024)
SEED: Speaker Embedding Enhancement Diffusion Model
di: Nam, KiHyun, et al.
Pubblicazione: (2025)
di: Nam, KiHyun, et al.
Pubblicazione: (2025)
RAVSS: Robust Audio-Visual Speech Separation in Multi-Speaker Scenarios with Missing Visual Cues
di: Pan, Tianrui, et al.
Pubblicazione: (2024)
di: Pan, Tianrui, et al.
Pubblicazione: (2024)
Diffusion-Link: Diffusion Probabilistic Model for Bridging the Audio-Text Modality Gap
di: Nam, KiHyun, et al.
Pubblicazione: (2025)
di: Nam, KiHyun, et al.
Pubblicazione: (2025)
Who is Authentic Speaker
di: Huang, Qiang
Pubblicazione: (2024)
di: Huang, Qiang
Pubblicazione: (2024)
LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport
di: Rho, Kyeongha, et al.
Pubblicazione: (2025)
di: Rho, Kyeongha, et al.
Pubblicazione: (2025)
Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings
di: Clarke, Jason, et al.
Pubblicazione: (2025)
di: Clarke, Jason, et al.
Pubblicazione: (2025)
pTSE-T: Presentation Target Speaker Extraction using Unaligned Text Cues
di: Jiang, Ziyang, et al.
Pubblicazione: (2024)
di: Jiang, Ziyang, et al.
Pubblicazione: (2024)
Cinematic Audio Source Separation Using Visual Cues
di: Zhang, Kang, et al.
Pubblicazione: (2026)
di: Zhang, Kang, et al.
Pubblicazione: (2026)
Audio-Visual Speaker Diarization: Current Databases, Approaches and Challenges
di: Mingote, Victoria, et al.
Pubblicazione: (2024)
di: Mingote, Victoria, et al.
Pubblicazione: (2024)
REWIND: Speech Time Reversal for Enhancing Speaker Representations in Diffusion-based Voice Conversion
di: Biyani, Ishan D., et al.
Pubblicazione: (2025)
di: Biyani, Ishan D., et al.
Pubblicazione: (2025)
Preserving Speaker Information in Direct Speech-to-Speech Translation with Non-Autoregressive Generation and Pretraining
di: Zhou, Rui, et al.
Pubblicazione: (2024)
di: Zhou, Rui, et al.
Pubblicazione: (2024)
$C^2$AV-TSE: Context and Confidence-aware Audio Visual Target Speaker Extraction
di: Wu, Wenxuan, et al.
Pubblicazione: (2025)
di: Wu, Wenxuan, et al.
Pubblicazione: (2025)
Spectron: Target Speaker Extraction using Conditional Transformer with Adversarial Refinement
di: Bandyopadhyay, Tathagata
Pubblicazione: (2024)
di: Bandyopadhyay, Tathagata
Pubblicazione: (2024)
LRS-VoxMM: A benchmark for in-the-wild audio-visual speech recognition
di: Kwak, Doyeop, et al.
Pubblicazione: (2026)
di: Kwak, Doyeop, et al.
Pubblicazione: (2026)
Learning Emotion-Invariant Speaker Representations for Speaker Verification
di: Tian, Jingguang, et al.
Pubblicazione: (2025)
di: Tian, Jingguang, et al.
Pubblicazione: (2025)
Robust Active Speaker Detection in Noisy Environments
di: Vasireddy, Siva Sai Nagender, et al.
Pubblicazione: (2024)
di: Vasireddy, Siva Sai Nagender, et al.
Pubblicazione: (2024)
Getting More for Less: Using Weak Labels and AV-Mixup for Robust Audio-Visual Speaker Verification
di: Selvakumar, Anith, et al.
Pubblicazione: (2023)
di: Selvakumar, Anith, et al.
Pubblicazione: (2023)
HiddenSpeaker: Generate Imperceptible Unlearnable Audios for Speaker Verification System
di: Zhang, Zhisheng, et al.
Pubblicazione: (2024)
di: Zhang, Zhisheng, et al.
Pubblicazione: (2024)
Adversarial Speaker Distillation for Countermeasure Model on Automatic Speaker Verification
di: Liao, Yen-Lun, et al.
Pubblicazione: (2022)
di: Liao, Yen-Lun, et al.
Pubblicazione: (2022)
Adversarial Reweighting for Speaker Verification Fairness
di: Jin, Minho, et al.
Pubblicazione: (2022)
di: Jin, Minho, et al.
Pubblicazione: (2022)
InaGVAD : a Challenging French TV and Radio Corpus Annotated for Speech Activity Detection and Speaker Gender Segmentation
di: Doukhan, David, et al.
Pubblicazione: (2024)
di: Doukhan, David, et al.
Pubblicazione: (2024)
NeXt-TDNN: Modernizing Multi-Scale Temporal Convolution Backbone for Speaker Verification
di: Heo, Hyun-Jun, et al.
Pubblicazione: (2023)
di: Heo, Hyun-Jun, et al.
Pubblicazione: (2023)
A Toolkit for Joint Speaker Diarization and Identification with Application to Speaker-Attributed ASR
di: Morrone, Giovanni, et al.
Pubblicazione: (2024)
di: Morrone, Giovanni, et al.
Pubblicazione: (2024)
Emphasized Non-Target Speaker Knowledge in Knowledge Distillation for Automatic Speaker Verification
di: Truong, Duc-Tuan, et al.
Pubblicazione: (2023)
di: Truong, Duc-Tuan, et al.
Pubblicazione: (2023)
Model-Guided Dual-Role Alignment for High-Fidelity Open-Domain Video-to-Audio Generation
di: Zhang, Kang, et al.
Pubblicazione: (2025)
di: Zhang, Kang, et al.
Pubblicazione: (2025)
Robust LLM-based Audio-Visual Speech Recognition with Sparse Modality Alignment and Visual Unit-Guided Refinement
di: Su, Fei, et al.
Pubblicazione: (2026)
di: Su, Fei, et al.
Pubblicazione: (2026)
NanoVoice: Efficient Speaker-Adaptive Text-to-Speech for Multiple Speakers
di: Park, Nohil, et al.
Pubblicazione: (2024)
di: Park, Nohil, et al.
Pubblicazione: (2024)
Aligning Sight and Sound: Advanced Sound Source Localization Through Audio-Visual Alignment
di: Senocak, Arda, et al.
Pubblicazione: (2024)
di: Senocak, Arda, et al.
Pubblicazione: (2024)
Review of MEMS Speakers for Audio Applications
di: Wittek, Nils, et al.
Pubblicazione: (2025)
di: Wittek, Nils, et al.
Pubblicazione: (2025)
Analysis of Speaker Verification Performance Trade-offs with Neural Audio Codec Transmission
di: Thakur, Nirmalya Mallick, et al.
Pubblicazione: (2025)
di: Thakur, Nirmalya Mallick, et al.
Pubblicazione: (2025)
G-STAR: End-to-End Global Speaker-Tracking Attributed Recognition
di: Peng, Jing, et al.
Pubblicazione: (2026)
di: Peng, Jing, et al.
Pubblicazione: (2026)
Speaker Contrastive Learning for Source Speaker Tracing
di: Wang, Qing, et al.
Pubblicazione: (2024)
di: Wang, Qing, et al.
Pubblicazione: (2024)
Can Large Language Models Predict Audio Effects Parameters from Natural Language?
di: Doh, Seungheon, et al.
Pubblicazione: (2025)
di: Doh, Seungheon, et al.
Pubblicazione: (2025)
MuseAgent-1: Interactive Grounded Multimodal Understanding of Music Scores and Performance Audio
di: Zhao, Qihao, et al.
Pubblicazione: (2026)
di: Zhao, Qihao, et al.
Pubblicazione: (2026)
Diffusion-Based Adversarial Purification for Speaker Verification
di: Bai, Yibo, et al.
Pubblicazione: (2023)
di: Bai, Yibo, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Disentangled Representation Learning for Environment-agnostic Speaker Recognition
di: Nam, KiHyun, et al.
Pubblicazione: (2024) -
Plug-and-Steer: Decoupling Separation and Selection in Audio-Visual Target Speaker Extraction
di: Kwak, Doyeop, et al.
Pubblicazione: (2026) -
Noise-Conditioned Mixture-of-Experts Framework for Robust Speaker Verification
di: Gu, Bin, et al.
Pubblicazione: (2025) -
Audio-Visual Speaker Tracking: Progress, Challenges, and Future Directions
di: Zhao, Jinzheng, et al.
Pubblicazione: (2023) -
Quality-Aware End-to-End Audio-Visual Neural Speaker Diarization
di: He, Mao-Kui, et al.
Pubblicazione: (2024)