Synthetic Speech Source Tracing using Metric Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Koutsianos, Dimitrios, Zacharopoulos, Stavros, Panagakis, Yannis, Stafylakis, Themos |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Alpha Divergence Losses for Biometric Verification
di: Koutsianos, Dimitrios, et al.
Pubblicazione: (2025)
di: Koutsianos, Dimitrios, et al.
Pubblicazione: (2025)
Automatic Speech Recognition for Greek Medical Dictation
di: Georgilas, Vardis, et al.
Pubblicazione: (2025)
di: Georgilas, Vardis, et al.
Pubblicazione: (2025)
Multilingual Source Tracing of Speech Deepfakes: A First Benchmark
di: Xuan, Xi, et al.
Pubblicazione: (2025)
di: Xuan, Xi, et al.
Pubblicazione: (2025)
DiaPer: End-to-End Neural Diarization with Perceiver-Based Attractors
di: Landini, Federico, et al.
Pubblicazione: (2023)
di: Landini, Federico, et al.
Pubblicazione: (2023)
LabelBuddy: An Open Source Music and Audio Language Annotation Tagging Tool Using AI Assistance
di: Prokopiou, Ioannis, et al.
Pubblicazione: (2026)
di: Prokopiou, Ioannis, et al.
Pubblicazione: (2026)
Comparing Data Augmentation Methods for End-to-End Task-Oriented Dialog Systems
di: Vlachos, Christos, et al.
Pubblicazione: (2024)
di: Vlachos, Christos, et al.
Pubblicazione: (2024)
Audio-visual video-to-speech synthesis with synthesized input audio
di: Kefalas, Triantafyllos, et al.
Pubblicazione: (2023)
di: Kefalas, Triantafyllos, et al.
Pubblicazione: (2023)
Large-scale unsupervised audio pre-training for video-to-speech synthesis
di: Kefalas, Triantafyllos, et al.
Pubblicazione: (2023)
di: Kefalas, Triantafyllos, et al.
Pubblicazione: (2023)
The TTS-STT Flywheel: Synthetic Entity-Dense Audio Closes the Indic ASR Gap Where Commercial and Open-Source Systems Fail
di: Menta, Venkata Pushpak Teja
Pubblicazione: (2026)
di: Menta, Venkata Pushpak Teja
Pubblicazione: (2026)
Pushing the Performance of Synthetic Speech Detection with Kolmogorov-Arnold Networks and Self-Supervised Learning Models
di: Phuong, Tuan Dat, et al.
Pubblicazione: (2025)
di: Phuong, Tuan Dat, et al.
Pubblicazione: (2025)
SpeechT: Findings of the First Mentorship in Speech Translation
di: Moslem, Yasmin, et al.
Pubblicazione: (2025)
di: Moslem, Yasmin, et al.
Pubblicazione: (2025)
Disentangling Speaker Traits for Deepfake Source Verification via Chebyshev Polynomial and Riemannian Metric Learning
di: Xuan, Xi, et al.
Pubblicazione: (2026)
di: Xuan, Xi, et al.
Pubblicazione: (2026)
VOX-KRIKRI: Unifying Speech and Language through Continuous Fusion
di: Damianos, Dimitrios, et al.
Pubblicazione: (2025)
di: Damianos, Dimitrios, et al.
Pubblicazione: (2025)
Scaling Speech-Text Pre-training with Synthetic Interleaved Data
di: Zeng, Aohan, et al.
Pubblicazione: (2024)
di: Zeng, Aohan, et al.
Pubblicazione: (2024)
XLSR-Kanformer: A KAN-Intergrated model for Synthetic Speech Detection
di: Dat, Phuong Tuan, et al.
Pubblicazione: (2025)
di: Dat, Phuong Tuan, et al.
Pubblicazione: (2025)
Learning More with Less: Self-Supervised Approaches for Low-Resource Speech Emotion Recognition
di: Gong, Ziwei, et al.
Pubblicazione: (2025)
di: Gong, Ziwei, et al.
Pubblicazione: (2025)
Listening or Reading? Evaluating Speech Awareness in Chain-of-Thought Speech-to-Text Translation
di: Romero-Díaz, Jacobo, et al.
Pubblicazione: (2025)
di: Romero-Díaz, Jacobo, et al.
Pubblicazione: (2025)
POTSA: A Cross-Lingual Speech Alignment Framework for Speech-to-Text Translation
di: Li, Xuanchen, et al.
Pubblicazione: (2025)
di: Li, Xuanchen, et al.
Pubblicazione: (2025)
Speech-Worthy Alignment for Japanese SpeechLLMs via Direct Preference Optimization
di: Zhao, Mengjie, et al.
Pubblicazione: (2026)
di: Zhao, Mengjie, et al.
Pubblicazione: (2026)
Dynamic Data Pruning for Automatic Speech Recognition
di: Xiao, Qiao, et al.
Pubblicazione: (2024)
di: Xiao, Qiao, et al.
Pubblicazione: (2024)
StableToken: A Noise-Robust Semantic Speech Tokenizer for Resilient SpeechLLMs
di: Song, Yuhan, et al.
Pubblicazione: (2025)
di: Song, Yuhan, et al.
Pubblicazione: (2025)
Do End-to-End Neural Diarization Attractors Need to Encode Speaker Characteristic Information?
di: Zhang, Lin, et al.
Pubblicazione: (2024)
di: Zhang, Lin, et al.
Pubblicazione: (2024)
On the Effects of Heterogeneous Data Sources on Speech-to-Text Foundation Models
di: Tian, Jinchuan, et al.
Pubblicazione: (2024)
di: Tian, Jinchuan, et al.
Pubblicazione: (2024)
Revisiting Direct Speech-to-Text Translation with Speech LLMs: Better Scaling than CoT Prompting?
di: Pareras, Oriol, et al.
Pubblicazione: (2025)
di: Pareras, Oriol, et al.
Pubblicazione: (2025)
Zipper-LoRA: Dynamic Parameter Decoupling for Speech-LLM based Multilingual Speech Recognition
di: Mei, Yuxiang, et al.
Pubblicazione: (2026)
di: Mei, Yuxiang, et al.
Pubblicazione: (2026)
Leveraging Synthetic Audio Data for End-to-End Low-Resource Speech Translation
di: Moslem, Yasmin
Pubblicazione: (2024)
di: Moslem, Yasmin
Pubblicazione: (2024)
WenetSpeech-Chuan: A Large-Scale Sichuanese Corpus with Rich Annotation for Dialectal Speech Processing
di: Dai, Yuhang, et al.
Pubblicazione: (2025)
di: Dai, Yuhang, et al.
Pubblicazione: (2025)
Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs
di: Wang, Dingdong, et al.
Pubblicazione: (2025)
di: Wang, Dingdong, et al.
Pubblicazione: (2025)
DELULU: Discriminative Embedding Learning Using Latent Units for Speaker-Aware Self-Trained Speech Foundational Model
di: Baali, Massa, et al.
Pubblicazione: (2025)
di: Baali, Massa, et al.
Pubblicazione: (2025)
Sagalee: an Open Source Automatic Speech Recognition Dataset for Oromo Language
di: Abu, Turi, et al.
Pubblicazione: (2025)
di: Abu, Turi, et al.
Pubblicazione: (2025)
SLAM-LLM: A Modular, Open-Source Multimodal Large Language Model Framework and Best Practice for Speech, Language, Audio and Music Processing
di: Ma, Ziyang, et al.
Pubblicazione: (2026)
di: Ma, Ziyang, et al.
Pubblicazione: (2026)
Causal Tracing of Audio-Text Fusion in Large Audio Language Models
di: Chen, Wei-Chih, et al.
Pubblicazione: (2026)
di: Chen, Wei-Chih, et al.
Pubblicazione: (2026)
Continual Speech Learning with Fused Speech Features
di: Wang, Guitao, et al.
Pubblicazione: (2025)
di: Wang, Guitao, et al.
Pubblicazione: (2025)
Cocktail-Party Audio-Visual Speech Recognition
di: Nguyen, Thai-Binh, et al.
Pubblicazione: (2025)
di: Nguyen, Thai-Binh, et al.
Pubblicazione: (2025)
Optimizing Speech Language Models for Acoustic Consistency
di: Rohanian, Morteza, et al.
Pubblicazione: (2025)
di: Rohanian, Morteza, et al.
Pubblicazione: (2025)
Automatic Restoration of Diacritics for Speech Data Sets
di: Shatnawi, Sara, et al.
Pubblicazione: (2023)
di: Shatnawi, Sara, et al.
Pubblicazione: (2023)
Habibi: Laying the Open-Source Foundation of Unified-Dialectal Arabic Speech Synthesis
di: Chen, Yushen, et al.
Pubblicazione: (2026)
di: Chen, Yushen, et al.
Pubblicazione: (2026)
Contextualized Token Discrimination for Speech Search Query Correction
di: Lu, Junyu, et al.
Pubblicazione: (2025)
di: Lu, Junyu, et al.
Pubblicazione: (2025)
PRiSM: Benchmarking Phone Realization in Speech Models
di: Bharadwaj, Shikhar, et al.
Pubblicazione: (2026)
di: Bharadwaj, Shikhar, et al.
Pubblicazione: (2026)
Prototype-Based Disentanglement for Controllable Dysarthric Speech Synthesis
di: Wang, Haoshen, et al.
Pubblicazione: (2026)
di: Wang, Haoshen, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Alpha Divergence Losses for Biometric Verification
di: Koutsianos, Dimitrios, et al.
Pubblicazione: (2025) -
Automatic Speech Recognition for Greek Medical Dictation
di: Georgilas, Vardis, et al.
Pubblicazione: (2025) -
Multilingual Source Tracing of Speech Deepfakes: A First Benchmark
di: Xuan, Xi, et al.
Pubblicazione: (2025) -
DiaPer: End-to-End Neural Diarization with Perceiver-Based Attractors
di: Landini, Federico, et al.
Pubblicazione: (2023) -
LabelBuddy: An Open Source Music and Audio Language Annotation Tagging Tool Using AI Assistance
di: Prokopiou, Ioannis, et al.
Pubblicazione: (2026)