Cascaded Cross-Modal Transformer for Audio-Textual Classification
Fuente:
arXiv
Salvato in:
| Autori principali: | Ristea, Nicolae-Catalin, Anghel, Andrei, Ionescu, Radu Tudor |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
RoDia: A New Dataset for Romanian Dialect Identification from Speech
di: Rotaru, Codrut, et al.
Pubblicazione: (2023)
di: Rotaru, Codrut, et al.
Pubblicazione: (2023)
XMAD-Bench: Cross-Domain Multilingual Audio Deepfake Benchmark
di: Ciobanu, Ioan-Paul, et al.
Pubblicazione: (2025)
di: Ciobanu, Ioan-Paul, et al.
Pubblicazione: (2025)
Multiple-Instance, Cascaded Classification for Keyword Spotting in Narrow-Band Audio
di: AbdulKader, Ahmad, et al.
Pubblicazione: (2017)
di: AbdulKader, Ahmad, et al.
Pubblicazione: (2017)
Deepfake Media Generation and Detection in the Generative AI Era: A Survey and Outlook
di: Croitoru, Florinel-Alin, et al.
Pubblicazione: (2024)
di: Croitoru, Florinel-Alin, et al.
Pubblicazione: (2024)
Textually Pretrained Speech Language Models
di: Hassid, Michael, et al.
Pubblicazione: (2023)
di: Hassid, Michael, et al.
Pubblicazione: (2023)
Disentangling Textual and Acoustic Features of Neural Speech Representations
di: Mohebbi, Hosein, et al.
Pubblicazione: (2024)
di: Mohebbi, Hosein, et al.
Pubblicazione: (2024)
Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities
di: Ghosh, Sreyan, et al.
Pubblicazione: (2025)
di: Ghosh, Sreyan, et al.
Pubblicazione: (2025)
This Paper Had the Smartest Reviewers -- Flattery Detection Utilising an Audio-Textual Transformer-Based Approach
di: Christ, Lukas, et al.
Pubblicazione: (2024)
di: Christ, Lukas, et al.
Pubblicazione: (2024)
ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs
di: Eren, Eray, et al.
Pubblicazione: (2025)
di: Eren, Eray, et al.
Pubblicazione: (2025)
ChipChat: Low-Latency Cascaded Conversational Agent in MLX
di: Likhomanenko, Tatiana, et al.
Pubblicazione: (2025)
di: Likhomanenko, Tatiana, et al.
Pubblicazione: (2025)
Improving Text-To-Audio Models with Synthetic Captions
di: Kong, Zhifeng, et al.
Pubblicazione: (2024)
di: Kong, Zhifeng, et al.
Pubblicazione: (2024)
ETTA: Elucidating the Design Space of Text-to-Audio Models
di: Lee, Sang-gil, et al.
Pubblicazione: (2024)
di: Lee, Sang-gil, et al.
Pubblicazione: (2024)
T-CLAP: Temporal-Enhanced Contrastive Language-Audio Pretraining
di: Yuan, Yi, et al.
Pubblicazione: (2024)
di: Yuan, Yi, et al.
Pubblicazione: (2024)
Audio-to-Score Conversion Model Based on Whisper methodology
di: Zhang, Hongyao, et al.
Pubblicazione: (2024)
di: Zhang, Hongyao, et al.
Pubblicazione: (2024)
AVCap: Leveraging Audio-Visual Features as Text Tokens for Captioning
di: Kim, Jongsuk, et al.
Pubblicazione: (2024)
di: Kim, Jongsuk, et al.
Pubblicazione: (2024)
tinyCLAP: Distilling Constrastive Language-Audio Pretrained Models
di: Paissan, Francesco, et al.
Pubblicazione: (2023)
di: Paissan, Francesco, et al.
Pubblicazione: (2023)
When Audio-LLMs Don't Listen: A Cross-Linguistic Study of Modality Arbitration
di: Billa, Jayadev
Pubblicazione: (2026)
di: Billa, Jayadev
Pubblicazione: (2026)
AIR-Bench: Benchmarking Large Audio-Language Models via Generative Comprehension
di: Yang, Qian, et al.
Pubblicazione: (2024)
di: Yang, Qian, et al.
Pubblicazione: (2024)
DeSTA2.5-Audio: Toward General-Purpose Large Audio Language Model with Self-Generated Cross-Modal Alignment
di: Lu, Ke-Han, et al.
Pubblicazione: (2025)
di: Lu, Ke-Han, et al.
Pubblicazione: (2025)
Understanding Sounds, Missing the Questions: The Challenge of Object Hallucination in Large Audio-Language Models
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2024)
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2024)
Remastering Divide and Remaster: A Cinematic Audio Source Separation Dataset with Multilingual Support
di: Watcharasupat, Karn N., et al.
Pubblicazione: (2024)
di: Watcharasupat, Karn N., et al.
Pubblicazione: (2024)
Diffusion-Link: Diffusion Probabilistic Model for Bridging the Audio-Text Modality Gap
di: Nam, KiHyun, et al.
Pubblicazione: (2025)
di: Nam, KiHyun, et al.
Pubblicazione: (2025)
RUMAA: Repeat-Aware Unified Music Audio Analysis for Score-Performance Alignment, Transcription, and Mistake Detection
di: Chang, Sungkyun, et al.
Pubblicazione: (2025)
di: Chang, Sungkyun, et al.
Pubblicazione: (2025)
AlignAtt: Using Attention-based Audio-Translation Alignments as a Guide for Simultaneous Speech Translation
di: Papi, Sara, et al.
Pubblicazione: (2023)
di: Papi, Sara, et al.
Pubblicazione: (2023)
Exploring Fine-Tuning of Large Audio Language Models for Spoken Language Understanding under Limited Speech Data
di: Choi, Youngwon, et al.
Pubblicazione: (2025)
di: Choi, Youngwon, et al.
Pubblicazione: (2025)
Patch-Mix Contrastive Learning with Audio Spectrogram Transformer on Respiratory Sound Classification
di: Bae, Sangmin, et al.
Pubblicazione: (2023)
di: Bae, Sangmin, et al.
Pubblicazione: (2023)
ResidualTransformer: Residual Low-Rank Learning with Weight-Sharing for Transformer Layers
di: Wang, Yiming, et al.
Pubblicazione: (2023)
di: Wang, Yiming, et al.
Pubblicazione: (2023)
COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings
di: Zhu, Yonggang, et al.
Pubblicazione: (2026)
di: Zhu, Yonggang, et al.
Pubblicazione: (2026)
LinTO Audio and Textual Datasets to Train and Evaluate Automatic Speech Recognition in Tunisian Arabic Dialect
di: Naouara, Hedi, et al.
Pubblicazione: (2025)
di: Naouara, Hedi, et al.
Pubblicazione: (2025)
EAT: Self-Supervised Pre-Training with Efficient Audio Transformer
di: Chen, Wenxi, et al.
Pubblicazione: (2024)
di: Chen, Wenxi, et al.
Pubblicazione: (2024)
Pay More Attention To Audio: Mitigating Imbalance of Cross-Modal Attention in Large Audio Language Models
di: Wang, Junyu, et al.
Pubblicazione: (2025)
di: Wang, Junyu, et al.
Pubblicazione: (2025)
Unsupervised ASR via Cross-Lingual Pseudo-Labeling
di: Likhomanenko, Tatiana, et al.
Pubblicazione: (2023)
di: Likhomanenko, Tatiana, et al.
Pubblicazione: (2023)
Evaluation of Google's Voice Recognition and Sentence Classification for Health Care Applications
di: Uddin, Majbah, et al.
Pubblicazione: (2024)
di: Uddin, Majbah, et al.
Pubblicazione: (2024)
Property Neurons in Self-Supervised Speech Transformers
di: Lin, Tzu-Quan, et al.
Pubblicazione: (2024)
di: Lin, Tzu-Quan, et al.
Pubblicazione: (2024)
TSPE: Task-Specific Prompt Ensemble for Improved Zero-Shot Audio Classification
di: Anand, Nishit, et al.
Pubblicazione: (2024)
di: Anand, Nishit, et al.
Pubblicazione: (2024)
Breathing and Semantic Pause Detection and Exertion-Level Classification in Post-Exercise Speech
di: Wang, Yuyu, et al.
Pubblicazione: (2025)
di: Wang, Yuyu, et al.
Pubblicazione: (2025)
Cross-utterance ASR Rescoring with Graph-based Label Propagation
di: Tankasala, Srinath, et al.
Pubblicazione: (2023)
di: Tankasala, Srinath, et al.
Pubblicazione: (2023)
How Redundant Is the Transformer Stack in Speech Representation Models?
di: Dorszewski, Teresa, et al.
Pubblicazione: (2024)
di: Dorszewski, Teresa, et al.
Pubblicazione: (2024)
Description-based Controllable Text-to-Speech with Cross-Lingual Voice Control
di: Yamamoto, Ryuichi, et al.
Pubblicazione: (2024)
di: Yamamoto, Ryuichi, et al.
Pubblicazione: (2024)
Universal Robust Speech Adaptation for Cross-Domain Speech Recognition and Enhancement
di: Wang, Chien-Chun, et al.
Pubblicazione: (2026)
di: Wang, Chien-Chun, et al.
Pubblicazione: (2026)
Documenti analoghi
-
RoDia: A New Dataset for Romanian Dialect Identification from Speech
di: Rotaru, Codrut, et al.
Pubblicazione: (2023) -
XMAD-Bench: Cross-Domain Multilingual Audio Deepfake Benchmark
di: Ciobanu, Ioan-Paul, et al.
Pubblicazione: (2025) -
Multiple-Instance, Cascaded Classification for Keyword Spotting in Narrow-Band Audio
di: AbdulKader, Ahmad, et al.
Pubblicazione: (2017) -
Deepfake Media Generation and Detection in the Generative AI Era: A Survey and Outlook
di: Croitoru, Florinel-Alin, et al.
Pubblicazione: (2024) -
Textually Pretrained Speech Language Models
di: Hassid, Michael, et al.
Pubblicazione: (2023)