Robust CAPTCHA Using Audio Illusions in the Era of Large Language Models: from Evaluation to Advances
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Ding, Ziqi, Wan, Yunfeng, Song, Wei, Liu, Yi, Deng, Gelei, Sun, Nan, Mo, Huadong, Xue, Jingling, Pan, Shidong, Li, Yuekang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Advancing Continual Learning for Robust Deepfake Audio Classification
von: Dong, Feiyi, et al.
Veröffentlicht: (2024)
von: Dong, Feiyi, et al.
Veröffentlicht: (2024)
LongCat-Audio-Codec: An Audio Tokenizer and Detokenizer Solution Designed for Speech Large Language Models
von: Zhao, Xiaohan, et al.
Veröffentlicht: (2025)
von: Zhao, Xiaohan, et al.
Veröffentlicht: (2025)
ASAudio: A Survey of Advanced Spatial Audio Research
von: Zhu, Zhiyuan, et al.
Veröffentlicht: (2025)
von: Zhu, Zhiyuan, et al.
Veröffentlicht: (2025)
Audio Avatar Fingerprinting: An Approach for Authorized Use of Voice Cloning in the Era of Synthetic Audio
von: Gerstner, Candice R.
Veröffentlicht: (2026)
von: Gerstner, Candice R.
Veröffentlicht: (2026)
Weighted-Sampling Audio Adversarial Example Attack
von: Liu, Xiaolei, et al.
Veröffentlicht: (2019)
von: Liu, Xiaolei, et al.
Veröffentlicht: (2019)
QuarkAudio Technical Report
von: Liu, Chengwei, et al.
Veröffentlicht: (2025)
von: Liu, Chengwei, et al.
Veröffentlicht: (2025)
The TEA-ASLP System for Multilingual Conversational Speech Recognition and Speech Diarization in MLC-SLM 2025 Challenge
von: Xue, Hongfei, et al.
Veröffentlicht: (2025)
von: Xue, Hongfei, et al.
Veröffentlicht: (2025)
Robust Audio-Visual Speech Enhancement: Correcting Misassignments in Complex Environments with Advanced Post-Processing
von: Ren, Wenze, et al.
Veröffentlicht: (2024)
von: Ren, Wenze, et al.
Veröffentlicht: (2024)
Retrieval Augmented Generation in Prompt-based Text-to-Speech Synthesis with Context-Aware Contrastive Language-Audio Pretraining
von: Xue, Jinlong, et al.
Veröffentlicht: (2024)
von: Xue, Jinlong, et al.
Veröffentlicht: (2024)
Enhancing Neural Audio Fingerprint Robustness to Audio Degradation for Music Identification
von: Araz, R. Oguz, et al.
Veröffentlicht: (2025)
von: Araz, R. Oguz, et al.
Veröffentlicht: (2025)
MACE: Leveraging Audio for Evaluating Audio Captioning Systems
von: Dixit, Satvik, et al.
Veröffentlicht: (2024)
von: Dixit, Satvik, et al.
Veröffentlicht: (2024)
Robust Lossy Audio Compression Identification
von: Koops, Hendrik Vincent, et al.
Veröffentlicht: (2024)
von: Koops, Hendrik Vincent, et al.
Veröffentlicht: (2024)
Trusted Fake Audio Detection Based on Dirichlet Distribution
von: Ding, Chi, et al.
Veröffentlicht: (2025)
von: Ding, Chi, et al.
Veröffentlicht: (2025)
D-CAPTCHA++: A Study of Resilience of Deepfake CAPTCHA under Transferable Imperceptible Adversarial Attack
von: Nguyen-Le, Hong-Hanh, et al.
Veröffentlicht: (2024)
von: Nguyen-Le, Hong-Hanh, et al.
Veröffentlicht: (2024)
ESPnet-Codec: Comprehensive Training and Evaluation of Neural Codecs for Audio, Music, and Speech
von: Shi, Jiatong, et al.
Veröffentlicht: (2024)
von: Shi, Jiatong, et al.
Veröffentlicht: (2024)
Online Single-Channel Audio-Based Sound Speed Estimation for Robust Multi-Channel Audio Control
von: Fuglsig, Andreas Jonas, et al.
Veröffentlicht: (2026)
von: Fuglsig, Andreas Jonas, et al.
Veröffentlicht: (2026)
FlashAudio: Rectified Flows for Fast and High-Fidelity Text-to-Audio Generation
von: Liu, Huadai, et al.
Veröffentlicht: (2024)
von: Liu, Huadai, et al.
Veröffentlicht: (2024)
AudioEval: Automatic Dual-Perspective and Multi-Dimensional Evaluation of Text-to-Audio-Generation
von: Wang, Hui, et al.
Veröffentlicht: (2025)
von: Wang, Hui, et al.
Veröffentlicht: (2025)
Synthetic Audio Forensics Evaluation (SAFE) Challenge
von: Trapeznikov, Kirill, et al.
Veröffentlicht: (2025)
von: Trapeznikov, Kirill, et al.
Veröffentlicht: (2025)
Robust Audio Tagging under Class-wise Supervision Unreliability
von: Hou, Yuanbo, et al.
Veröffentlicht: (2026)
von: Hou, Yuanbo, et al.
Veröffentlicht: (2026)
Human-Inspired Computing for Robust and Efficient Audio-Visual Speech Recognition
von: Liu, Qianhui, et al.
Veröffentlicht: (2024)
von: Liu, Qianhui, et al.
Veröffentlicht: (2024)
AudioBERTScore: Objective Evaluation of Environmental Sound Synthesis Based on Similarity of Audio embedding Sequences
von: Kishi, Minoru, et al.
Veröffentlicht: (2025)
von: Kishi, Minoru, et al.
Veröffentlicht: (2025)
Trade-offs Between Capacity and Robustness in Neural Audio Codecs for Adversarially Robust Speech Recognition
von: Prescott, Jordan, et al.
Veröffentlicht: (2026)
von: Prescott, Jordan, et al.
Veröffentlicht: (2026)
An Intra-BRNN and GB-RVQ Based END-TO-END Neural Audio Codec
von: Xu, Linping, et al.
Veröffentlicht: (2024)
von: Xu, Linping, et al.
Veröffentlicht: (2024)
RAVSS: Robust Audio-Visual Speech Separation in Multi-Speaker Scenarios with Missing Visual Cues
von: Pan, Tianrui, et al.
Veröffentlicht: (2024)
von: Pan, Tianrui, et al.
Veröffentlicht: (2024)
Towards Robust Audio Deepfake Detection: A Evolving Benchmark for Continual Learning
von: Zhang, Xiaohui, et al.
Veröffentlicht: (2024)
von: Zhang, Xiaohui, et al.
Veröffentlicht: (2024)
NDVQ: Robust Neural Audio Codec with Normal Distribution-Based Vector Quantization
von: Niu, Zhikang, et al.
Veröffentlicht: (2024)
von: Niu, Zhikang, et al.
Veröffentlicht: (2024)
ACES: Evaluating Automated Audio Captioning Models on the Semantics of Sounds
von: Wijngaard, Gijs, et al.
Veröffentlicht: (2024)
von: Wijngaard, Gijs, et al.
Veröffentlicht: (2024)
OpenACE: An Open Benchmark for Evaluating Audio Coding Performance
von: Coldenhoff, Jozef, et al.
Veröffentlicht: (2024)
von: Coldenhoff, Jozef, et al.
Veröffentlicht: (2024)
Online Audio-Visual Autoregressive Speaker Extraction
von: Pan, Zexu, et al.
Veröffentlicht: (2025)
von: Pan, Zexu, et al.
Veröffentlicht: (2025)
Audio-Visual Representation Learning via Knowledge Distillation from Speech Foundation Models
von: Zhang, Jing-Xuan, et al.
Veröffentlicht: (2025)
von: Zhang, Jing-Xuan, et al.
Veröffentlicht: (2025)
Self-Supervised Multi-View Learning for Disentangled Music Audio Representations
von: Wilkins, Julia, et al.
Veröffentlicht: (2024)
von: Wilkins, Julia, et al.
Veröffentlicht: (2024)
Robust Audio-Visual Target Speaker Extraction with Emotion-Aware Multiple Enrollment Fusion
von: Jin, Zhan, et al.
Veröffentlicht: (2025)
von: Jin, Zhan, et al.
Veröffentlicht: (2025)
DeepFense: A Unified, Modular, and Extensible Framework for Robust Deepfake Audio Detection
von: Kheir, Yassine El, et al.
Veröffentlicht: (2026)
von: Kheir, Yassine El, et al.
Veröffentlicht: (2026)
TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models
von: Wang, Hui, et al.
Veröffentlicht: (2025)
von: Wang, Hui, et al.
Veröffentlicht: (2025)
Comparative Evaluation of Text and Audio Simplification: A Methodological Replication Study
von: Barai, Prosanta, et al.
Veröffentlicht: (2025)
von: Barai, Prosanta, et al.
Veröffentlicht: (2025)
UniAudio: An Audio Foundation Model Toward Universal Audio Generation
von: Yang, Dongchao, et al.
Veröffentlicht: (2023)
von: Yang, Dongchao, et al.
Veröffentlicht: (2023)
MSR-86K: An Evolving, Multilingual Corpus with 86,300 Hours of Transcribed Audio for Speech Recognition Research
von: Li, Song, et al.
Veröffentlicht: (2024)
von: Li, Song, et al.
Veröffentlicht: (2024)
MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models
von: Gong, Yitian, et al.
Veröffentlicht: (2026)
von: Gong, Yitian, et al.
Veröffentlicht: (2026)
A Transcription Prompt-based Efficient Audio Large Language Model for Robust Speech Recognition
von: Li, Yangze, et al.
Veröffentlicht: (2024)
von: Li, Yangze, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Advancing Continual Learning for Robust Deepfake Audio Classification
von: Dong, Feiyi, et al.
Veröffentlicht: (2024) -
LongCat-Audio-Codec: An Audio Tokenizer and Detokenizer Solution Designed for Speech Large Language Models
von: Zhao, Xiaohan, et al.
Veröffentlicht: (2025) -
ASAudio: A Survey of Advanced Spatial Audio Research
von: Zhu, Zhiyuan, et al.
Veröffentlicht: (2025) -
Audio Avatar Fingerprinting: An Approach for Authorized Use of Voice Cloning in the Era of Synthetic Audio
von: Gerstner, Candice R.
Veröffentlicht: (2026) -
Weighted-Sampling Audio Adversarial Example Attack
von: Liu, Xiaolei, et al.
Veröffentlicht: (2019)