VerLM: Explaining Face Verification Using Natural Language
Fuente:
arXiv
Salvato in:
| Autori principali: | Hannan, Syed Abdul, Bukhari, Hazim, Cantalapiedra, Thomas, Ansar, Eman, Baali, Massa, Singh, Rita, Raj, Bhiksha |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DELULU: Discriminative Embedding Learning Using Latent Units for Speaker-Aware Self-Trained Speech Foundational Model
di: Baali, Massa, et al.
Pubblicazione: (2025)
di: Baali, Massa, et al.
Pubblicazione: (2025)
CAARMA: Class Augmentation with Adversarial Mixup Regularization
di: Baali, Massa, et al.
Pubblicazione: (2025)
di: Baali, Massa, et al.
Pubblicazione: (2025)
What and When to Learn: CURriculum Ranking Loss for Large-Scale Speaker Verification
di: Baali, Massa, et al.
Pubblicazione: (2026)
di: Baali, Massa, et al.
Pubblicazione: (2026)
Improving Speaker Representations Using Contrastive Losses on Multi-scale Features
di: Dixit, Satvik, et al.
Pubblicazione: (2024)
di: Dixit, Satvik, et al.
Pubblicazione: (2024)
CoLMbo: Speaker Language Model for Descriptive Profiling
di: Baali, Massa, et al.
Pubblicazione: (2025)
di: Baali, Massa, et al.
Pubblicazione: (2025)
PDAF: A Phonetic Debiasing Attention Framework For Speaker Verification
di: Baali, Massa, et al.
Pubblicazione: (2024)
di: Baali, Massa, et al.
Pubblicazione: (2024)
SVeritas: Benchmark for Robust Speaker Verification under Diverse Conditions
di: Baali, Massa, et al.
Pubblicazione: (2025)
di: Baali, Massa, et al.
Pubblicazione: (2025)
SELM: Enhancing Speech Emotion Recognition for Out-of-Domain Scenarios
di: Bukhari, Hazim, et al.
Pubblicazione: (2024)
di: Bukhari, Hazim, et al.
Pubblicazione: (2024)
Audio Language Model for Deepfake Detection Grounded in Acoustic Chain-of-Thought
di: Chen, Runkun, et al.
Pubblicazione: (2026)
di: Chen, Runkun, et al.
Pubblicazione: (2026)
Audio Entailment: Assessing Deductive Reasoning for Audio Understanding
di: Deshmukh, Soham, et al.
Pubblicazione: (2024)
di: Deshmukh, Soham, et al.
Pubblicazione: (2024)
RFOP: Rethinking Fusion and Orthogonal Projection for Face-Voice Association
di: Hannan, Abdul, et al.
Pubblicazione: (2025)
di: Hannan, Abdul, et al.
Pubblicazione: (2025)
ADIFF: Explaining audio difference using natural language
di: Deshmukh, Soham, et al.
Pubblicazione: (2025)
di: Deshmukh, Soham, et al.
Pubblicazione: (2025)
ADIFF: Explaining audio difference using natural language
di: Deshmukh, Soham, et al.
Pubblicazione: (2025)
di: Deshmukh, Soham, et al.
Pubblicazione: (2025)
Human Voice is Unique
di: Singh, Rita, et al.
Pubblicazione: (2025)
di: Singh, Rita, et al.
Pubblicazione: (2025)
Domain Adaptation for Contrastive Audio-Language Models
di: Deshmukh, Soham, et al.
Pubblicazione: (2024)
di: Deshmukh, Soham, et al.
Pubblicazione: (2024)
Assessing the Use of Face Swapping Methods as Face Anonymizers in Videos
di: Muştu, Mustafa İzzet, et al.
Pubblicazione: (2025)
di: Muştu, Mustafa İzzet, et al.
Pubblicazione: (2025)
Impact of Face Alignment on Face Image Quality
di: Onaran, Eren, et al.
Pubblicazione: (2024)
di: Onaran, Eren, et al.
Pubblicazione: (2024)
On the Robust Approximation of ASR Metrics
di: Waheed, Abdul, et al.
Pubblicazione: (2025)
di: Waheed, Abdul, et al.
Pubblicazione: (2025)
What Do Speech Foundation Models Not Learn About Speech?
di: Waheed, Abdul, et al.
Pubblicazione: (2024)
di: Waheed, Abdul, et al.
Pubblicazione: (2024)
Analyzing the Effect of Combined Degradations on Face Recognition
di: Sarıtaş, Erdi, et al.
Pubblicazione: (2024)
di: Sarıtaş, Erdi, et al.
Pubblicazione: (2024)
Analyzing the Feature Extractor Networks for Face Image Synthesis
di: Sarıtaş, Erdi, et al.
Pubblicazione: (2024)
di: Sarıtaş, Erdi, et al.
Pubblicazione: (2024)
Employing Vision-Language Models for Face Image Quality Assessment
di: Sarıtaş, Erdi, et al.
Pubblicazione: (2026)
di: Sarıtaş, Erdi, et al.
Pubblicazione: (2026)
Real-time Traffic Object Detection for Autonomous Driving
di: Khan, Abdul Hannan, et al.
Pubblicazione: (2024)
di: Khan, Abdul Hannan, et al.
Pubblicazione: (2024)
VideoJudge: Bootstrapping Enables Scalable Supervision of MLLM-as-a-Judge for Video Understanding
di: Waheed, Abdul, et al.
Pubblicazione: (2025)
di: Waheed, Abdul, et al.
Pubblicazione: (2025)
QDFormer: Towards Robust Audiovisual Segmentation in Complex Environments with Quantization-based Semantic Decomposition
di: Li, Xiang, et al.
Pubblicazione: (2023)
di: Li, Xiang, et al.
Pubblicazione: (2023)
ControlVAR: Exploring Controllable Visual Autoregressive Modeling
di: Li, Xiang, et al.
Pubblicazione: (2024)
di: Li, Xiang, et al.
Pubblicazione: (2024)
Lost in Transcription, Found in Distribution Shift: Demystifying Hallucination in Speech Foundation Models
di: Atwany, Hanin, et al.
Pubblicazione: (2025)
di: Atwany, Hanin, et al.
Pubblicazione: (2025)
FaceScore: Benchmarking and Enhancing Face Quality in Human Generation
di: Liao, Zhenyi, et al.
Pubblicazione: (2024)
di: Liao, Zhenyi, et al.
Pubblicazione: (2024)
Facial Attribute Based Text Guided Face Anonymization
di: Muştu, Mustafa İzzet, et al.
Pubblicazione: (2025)
di: Muştu, Mustafa İzzet, et al.
Pubblicazione: (2025)
PAEFF: Precise Alignment and Enhanced Gated Feature Fusion for Face-Voice Association
di: Hannan, Abdul, et al.
Pubblicazione: (2025)
di: Hannan, Abdul, et al.
Pubblicazione: (2025)
ED-SAM: An Efficient Diffusion Sampling Approach to Domain Generalization in Vision-Language Foundation Models
di: Truong, Thanh-Dat, et al.
Pubblicazione: (2024)
di: Truong, Thanh-Dat, et al.
Pubblicazione: (2024)
oTTC: Object Time-to-Contact for Motion Estimation in Autonomous Driving
di: Khan, Abdul Hannan, et al.
Pubblicazione: (2024)
di: Khan, Abdul Hannan, et al.
Pubblicazione: (2024)
Bias-Aware Face Mask Detection Dataset
di: Kantarcı, Alperen, et al.
Pubblicazione: (2022)
di: Kantarcı, Alperen, et al.
Pubblicazione: (2022)
$\text{R}^2$-Bench: Benchmarking the Robustness of Referring Perception Models under Perturbations
di: Li, Xiang, et al.
Pubblicazione: (2024)
di: Li, Xiang, et al.
Pubblicazione: (2024)
Input Conditioned Layer Dropping in Speech Foundation Models
di: Hannan, Abdul, et al.
Pubblicazione: (2025)
di: Hannan, Abdul, et al.
Pubblicazione: (2025)
Audio-driven Talking Face Generation with Stabilized Synchronization Loss
di: Yaman, Dogucan, et al.
Pubblicazione: (2023)
di: Yaman, Dogucan, et al.
Pubblicazione: (2023)
Deciphering GunType Hierarchy through Acoustic Analysis of Gunshot Recordings
di: Shah, Ankit, et al.
Pubblicazione: (2025)
di: Shah, Ankit, et al.
Pubblicazione: (2025)
Tessellated Linear Model for Age Prediction from Voice
di: Alharthi, Dareen, et al.
Pubblicazione: (2025)
di: Alharthi, Dareen, et al.
Pubblicazione: (2025)
Mellow: a small audio language model for reasoning
di: Deshmukh, Soham, et al.
Pubblicazione: (2025)
di: Deshmukh, Soham, et al.
Pubblicazione: (2025)
Completing Visual Objects via Bridging Generation and Segmentation
di: Li, Xiang, et al.
Pubblicazione: (2023)
di: Li, Xiang, et al.
Pubblicazione: (2023)
Documenti analoghi
-
DELULU: Discriminative Embedding Learning Using Latent Units for Speaker-Aware Self-Trained Speech Foundational Model
di: Baali, Massa, et al.
Pubblicazione: (2025) -
CAARMA: Class Augmentation with Adversarial Mixup Regularization
di: Baali, Massa, et al.
Pubblicazione: (2025) -
What and When to Learn: CURriculum Ranking Loss for Large-Scale Speaker Verification
di: Baali, Massa, et al.
Pubblicazione: (2026) -
Improving Speaker Representations Using Contrastive Losses on Multi-scale Features
di: Dixit, Satvik, et al.
Pubblicazione: (2024) -
CoLMbo: Speaker Language Model for Descriptive Profiling
di: Baali, Massa, et al.
Pubblicazione: (2025)