Few-Shot Contrastive Adaptation for Audio Abuse Detection in Low-Resource Indic Languages
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Sankaran, Aditya Narayan, Farahbakhsh, Reza, Crespi, Noel |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Towards Cross-Lingual Audio Abuse Detection in Low-Resource Settings with Few-Shot Learning
von: Sankaran, Aditya Narayan, et al.
Veröffentlicht: (2024)
von: Sankaran, Aditya Narayan, et al.
Veröffentlicht: (2024)
Global Beats, Local Tongue: Studying Code Switching in K-pop Hits on Billboard Charts
von: Sankaran, Aditya Narayan, et al.
Veröffentlicht: (2025)
von: Sankaran, Aditya Narayan, et al.
Veröffentlicht: (2025)
MiMo-Audio: Audio Language Models are Few-Shot Learners
von: Core Team, et al.
Veröffentlicht: (2025)
von: Core Team, et al.
Veröffentlicht: (2025)
Toxicity Detection Should Measure Contextual Harm, Not Text-Intrinsic Badness
von: Berezin, Sergei, et al.
Veröffentlicht: (2025)
von: Berezin, Sergei, et al.
Veröffentlicht: (2025)
Evading Toxicity Detection with ASCII-art: A Benchmark of Spatial Attacks on Moderation Systems
von: Berezin, Sergey, et al.
Veröffentlicht: (2024)
von: Berezin, Sergey, et al.
Veröffentlicht: (2024)
The TTS-STT Flywheel: Synthetic Entity-Dense Audio Closes the Indic ASR Gap Where Commercial and Open-Source Systems Fail
von: Menta, Venkata Pushpak Teja
Veröffentlicht: (2026)
von: Menta, Venkata Pushpak Teja
Veröffentlicht: (2026)
Tibetan-TTS:Low-Resource Tibetan Speech Synthesis with Large Model Adaptation
von: He, Jiaxu, et al.
Veröffentlicht: (2026)
von: He, Jiaxu, et al.
Veröffentlicht: (2026)
PSP: An Interpretable Per-Dimension Accent Benchmark for Indic Text-to-Speech
von: Menta, Venkata Pushpak Teja
Veröffentlicht: (2026)
von: Menta, Venkata Pushpak Teja
Veröffentlicht: (2026)
The TIP of the Iceberg: Revealing a Hidden Class of Task-in-Prompt Adversarial Attacks on LLMs
von: Berezin, Sergey, et al.
Veröffentlicht: (2025)
von: Berezin, Sergey, et al.
Veröffentlicht: (2025)
Adaptive Test-Time Scaling for Zero-Shot Respiratory Audio Classification
von: Wang, Tsai-Ning, et al.
Veröffentlicht: (2026)
von: Wang, Tsai-Ning, et al.
Veröffentlicht: (2026)
Enhancing Low-Resource Language and Instruction Following Capabilities of Audio Language Models
von: Manakul, Potsawee, et al.
Veröffentlicht: (2024)
von: Manakul, Potsawee, et al.
Veröffentlicht: (2024)
LASE: Language-Adversarial Speaker Encoding for Indic Cross-Script Identity Preservation
von: Menta, Venkata Pushpak Teja
Veröffentlicht: (2026)
von: Menta, Venkata Pushpak Teja
Veröffentlicht: (2026)
How Contrastive Decoding Enhances Large Audio Language Models?
von: Lin, Tzu-Quan, et al.
Veröffentlicht: (2026)
von: Lin, Tzu-Quan, et al.
Veröffentlicht: (2026)
Causal Tracing of Audio-Text Fusion in Large Audio Language Models
von: Chen, Wei-Chih, et al.
Veröffentlicht: (2026)
von: Chen, Wei-Chih, et al.
Veröffentlicht: (2026)
Words at Play: Benchmarking Audio Pun Understanding in Large Audio-Language Models
von: Su, Yuchen, et al.
Veröffentlicht: (2026)
von: Su, Yuchen, et al.
Veröffentlicht: (2026)
Melody or Machine: Detecting Synthetic Music with Dual-Stream Contrastive Learning
von: Batra, Arnesh, et al.
Veröffentlicht: (2025)
von: Batra, Arnesh, et al.
Veröffentlicht: (2025)
Adapting Where It Matters: Depth-Aware Adaptation for Efficient Multilingual Speech Recognition in Low-Resource Languages
von: Xiao, Yang, et al.
Veröffentlicht: (2026)
von: Xiao, Yang, et al.
Veröffentlicht: (2026)
Leveraging Synthetic Audio Data for End-to-End Low-Resource Speech Translation
von: Moslem, Yasmin
Veröffentlicht: (2024)
von: Moslem, Yasmin
Veröffentlicht: (2024)
Thinking with Sound: Audio Chain-of-Thought Enables Multimodal Reasoning in Large Audio-Language Models
von: Xiong, Zhen, et al.
Veröffentlicht: (2025)
von: Xiong, Zhen, et al.
Veröffentlicht: (2025)
When Silence Matters: The Impact of Irrelevant Audio on Text Reasoning in Large Audio-Language Models
von: Li, Chen-An, et al.
Veröffentlicht: (2025)
von: Li, Chen-An, et al.
Veröffentlicht: (2025)
AccentFold: A Journey through African Accents for Zero-Shot ASR Adaptation to Target Accents
von: Owodunni, Abraham Toluwase, et al.
Veröffentlicht: (2024)
von: Owodunni, Abraham Toluwase, et al.
Veröffentlicht: (2024)
Overview of the 2023 ICON Shared Task on Gendered Abuse Detection in Indic Languages
von: Vaidya, Aatman, et al.
Veröffentlicht: (2024)
von: Vaidya, Aatman, et al.
Veröffentlicht: (2024)
HeadRouter: Dynamic Head-Weight Routing for Task-Adaptive Audio Token Pruning in Large Audio Language Models
von: He, Peize, et al.
Veröffentlicht: (2026)
von: He, Peize, et al.
Veröffentlicht: (2026)
T-CLAP: Temporal-Enhanced Contrastive Language-Audio Pretraining
von: Yuan, Yi, et al.
Veröffentlicht: (2024)
von: Yuan, Yi, et al.
Veröffentlicht: (2024)
Praxy Voice: Voice-Prompt Recovery + BUPS for Commercial-Class Indic TTS from a Frozen Non-Indic Base at Zero Commercial-Training-Data Cost
von: Menta, Venkata Pushpak Teja
Veröffentlicht: (2026)
von: Menta, Venkata Pushpak Teja
Veröffentlicht: (2026)
Relic: Enhancing Reward Model Generalization for Low-Resource Indic Languages with Few-Shot Examples
von: Ghosal, Soumya Suvra, et al.
Veröffentlicht: (2025)
von: Ghosal, Soumya Suvra, et al.
Veröffentlicht: (2025)
Audio-DeepThinker: Progressive Reasoning-Aware Reinforcement Learning for High-Quality Chain-of-Thought Emergence in Audio Language Models
von: He, Xiang, et al.
Veröffentlicht: (2026)
von: He, Xiang, et al.
Veröffentlicht: (2026)
PARSA-Bench: A Comprehensive Persian Audio-Language Model Benchmark
von: Kalahroodi, Mohammad Javad Ranjbar, et al.
Veröffentlicht: (2026)
von: Kalahroodi, Mohammad Javad Ranjbar, et al.
Veröffentlicht: (2026)
Hearing the Order: Investigating Position Bias in Large Audio-Language Models
von: Lin, Yu-Xiang, et al.
Veröffentlicht: (2025)
von: Lin, Yu-Xiang, et al.
Veröffentlicht: (2025)
ALLM4ADD: Unlocking the Capabilities of Audio Large Language Models for Audio Deepfake Detection
von: Gu, Hao, et al.
Veröffentlicht: (2025)
von: Gu, Hao, et al.
Veröffentlicht: (2025)
Noise Supervised Contrastive Learning and Feature-Perturbed for Anomalous Sound Detection
von: Huang, Shun, et al.
Veröffentlicht: (2025)
von: Huang, Shun, et al.
Veröffentlicht: (2025)
SonicBench: Dissecting the Physical Perception Bottleneck in Large Audio Language Models
von: Sun, Yirong, et al.
Veröffentlicht: (2026)
von: Sun, Yirong, et al.
Veröffentlicht: (2026)
Effects of Speaker Count, Duration, and Accent Diversity on Zero-Shot Accent Robustness in Low-Resource ASR
von: Yong, Zheng-Xin, et al.
Veröffentlicht: (2025)
von: Yong, Zheng-Xin, et al.
Veröffentlicht: (2025)
CantoASR: Prosody-Aware ASR-LALM Collaboration for Low-Resource Cantonese
von: Chen, Dazhong, et al.
Veröffentlicht: (2025)
von: Chen, Dazhong, et al.
Veröffentlicht: (2025)
DIFFA-2: A Practical Diffusion Large Language Model for General Audio Understanding
von: Zhou, Jiaming, et al.
Veröffentlicht: (2026)
von: Zhou, Jiaming, et al.
Veröffentlicht: (2026)
VCB Bench: An Evaluation Benchmark for Audio-Grounded Large Language Model Conversational Agents
von: Hu, Jiliang, et al.
Veröffentlicht: (2025)
von: Hu, Jiliang, et al.
Veröffentlicht: (2025)
Beyond Transcription: Unified Audio Schema for Perception-Aware AudioLLMs
von: Zhang, Linhao, et al.
Veröffentlicht: (2026)
von: Zhang, Linhao, et al.
Veröffentlicht: (2026)
WhisperPipe: A Resource-Efficient Streaming Architecture for Real-Time Automatic Speech Recognition
von: Ramezani, Erfan, et al.
Veröffentlicht: (2026)
von: Ramezani, Erfan, et al.
Veröffentlicht: (2026)
MI-Fuse: Label Fusion for Unsupervised Domain Adaptation with Closed-Source Large-Audio Language Model
von: Huang, Hsiao-Ying, et al.
Veröffentlicht: (2025)
von: Huang, Hsiao-Ying, et al.
Veröffentlicht: (2025)
Learning More with Less: Self-Supervised Approaches for Low-Resource Speech Emotion Recognition
von: Gong, Ziwei, et al.
Veröffentlicht: (2025)
von: Gong, Ziwei, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Towards Cross-Lingual Audio Abuse Detection in Low-Resource Settings with Few-Shot Learning
von: Sankaran, Aditya Narayan, et al.
Veröffentlicht: (2024) -
Global Beats, Local Tongue: Studying Code Switching in K-pop Hits on Billboard Charts
von: Sankaran, Aditya Narayan, et al.
Veröffentlicht: (2025) -
MiMo-Audio: Audio Language Models are Few-Shot Learners
von: Core Team, et al.
Veröffentlicht: (2025) -
Toxicity Detection Should Measure Contextual Harm, Not Text-Intrinsic Badness
von: Berezin, Sergei, et al.
Veröffentlicht: (2025) -
Evading Toxicity Detection with ASCII-art: A Benchmark of Spatial Attacks on Moderation Systems
von: Berezin, Sergey, et al.
Veröffentlicht: (2024)