Multimodal Proposal for an AI-Based Tool to Increase Cross-Assessment of Messages
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Castro, Alejandro Álvarez, Ordieres-Meré, Joaquín |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
CBF-AFA: Chunk-Based Multi-SSL Fusion for Automatic Fluency Assessment
von: Wade, Papa Séga, et al.
Veröffentlicht: (2025)
von: Wade, Papa Séga, et al.
Veröffentlicht: (2025)
MMMOS: Multi-domain Multi-axis Audio Quality Assessment
von: Lin, Yi-Cheng, et al.
Veröffentlicht: (2025)
von: Lin, Yi-Cheng, et al.
Veröffentlicht: (2025)
Natural Language-based Assessment of L2 Oral Proficiency using LLMs
von: Bannò, Stefano, et al.
Veröffentlicht: (2025)
von: Bannò, Stefano, et al.
Veröffentlicht: (2025)
ViDove: A Translation Agent System with Multimodal Context and Memory-Augmented Reasoning
von: Lu, Yichen, et al.
Veröffentlicht: (2025)
von: Lu, Yichen, et al.
Veröffentlicht: (2025)
When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition
von: Moure, Pehuén, et al.
Veröffentlicht: (2026)
von: Moure, Pehuén, et al.
Veröffentlicht: (2026)
X-OPD: Cross-Modal On-Policy Distillation for Capability Alignment in Speech LLMs
von: Cao, Di, et al.
Veröffentlicht: (2026)
von: Cao, Di, et al.
Veröffentlicht: (2026)
Late Fusion and Multi-Level Fission Amplify Cross-Modal Transfer in Text-Speech LMs
von: Cuervo, Santiago, et al.
Veröffentlicht: (2025)
von: Cuervo, Santiago, et al.
Veröffentlicht: (2025)
Enhancing nonnative speech perception and production through an AI-powered application
von: Georgiou, Georgios P.
Veröffentlicht: (2025)
von: Georgiou, Georgios P.
Veröffentlicht: (2025)
KAME: Tandem Architecture for Enhancing Knowledge in Real-Time Speech-to-Speech Conversational AI
von: Kuroki, So, et al.
Veröffentlicht: (2025)
von: Kuroki, So, et al.
Veröffentlicht: (2025)
Exploring ASR-Based Wav2Vec2 for Automated Speech Disorder Assessment: Insights and Analysis
von: Nguyen, Tuan, et al.
Veröffentlicht: (2024)
von: Nguyen, Tuan, et al.
Veröffentlicht: (2024)
Task-Lens: Cross-Task Utility Based Speech Dataset Profiling for Low-Resource Indian Languages
von: Sharma, Swati, et al.
Veröffentlicht: (2026)
von: Sharma, Swati, et al.
Veröffentlicht: (2026)
CTC-Assisted LLM-Based Contextual ASR
von: Yang, Guanrou, et al.
Veröffentlicht: (2024)
von: Yang, Guanrou, et al.
Veröffentlicht: (2024)
Improving Audio-Visual Speech Recognition by Lip-Subword Correlation Based Visual Pre-training and Cross-Modal Fusion Encoder
von: Dai, Yusheng, et al.
Veröffentlicht: (2023)
von: Dai, Yusheng, et al.
Veröffentlicht: (2023)
Double Entendre: Robust Audio-Based AI-Generated Lyrics Detection via Multi-View Fusion
von: Frohmann, Markus, et al.
Veröffentlicht: (2025)
von: Frohmann, Markus, et al.
Veröffentlicht: (2025)
LLM-Driven Multimodal Opinion Expression Identification
von: Jia, Bonian, et al.
Veröffentlicht: (2024)
von: Jia, Bonian, et al.
Veröffentlicht: (2024)
Speech-Based Cognitive Screening: A Systematic Evaluation of LLM Adaptation Strategies
von: Taherinezhad, Fatemeh, et al.
Veröffentlicht: (2025)
von: Taherinezhad, Fatemeh, et al.
Veröffentlicht: (2025)
CoVoSwitch: Machine Translation of Synthetic Code-Switched Text Based on Intonation Units
von: Kang, Yeeun
Veröffentlicht: (2024)
von: Kang, Yeeun
Veröffentlicht: (2024)
DM-Codec: Distilling Multimodal Representations for Speech Tokenization
von: Ahasan, Md Mubtasim, et al.
Veröffentlicht: (2024)
von: Ahasan, Md Mubtasim, et al.
Veröffentlicht: (2024)
Improved Cross-Lingual Transfer Learning For Automatic Speech Translation
von: Khurana, Sameer, et al.
Veröffentlicht: (2023)
von: Khurana, Sameer, et al.
Veröffentlicht: (2023)
Style-Talker: Finetuning Audio Language Model and Style-Based Text-to-Speech Model for Fast Spoken Dialogue Generation
von: Li, Yinghao Aaron, et al.
Veröffentlicht: (2024)
von: Li, Yinghao Aaron, et al.
Veröffentlicht: (2024)
Acoustic Feature Mixup for Balanced Multi-aspect Pronunciation Assessment
von: Do, Heejin, et al.
Veröffentlicht: (2024)
von: Do, Heejin, et al.
Veröffentlicht: (2024)
Cross-Speaker Encoding Network for Multi-Talker Speech Recognition
von: Kang, Jiawen, et al.
Veröffentlicht: (2024)
von: Kang, Jiawen, et al.
Veröffentlicht: (2024)
Kling-Foley: Multimodal Diffusion Transformer for High-Quality Video-to-Audio Generation
von: Wang, Jun, et al.
Veröffentlicht: (2025)
von: Wang, Jun, et al.
Veröffentlicht: (2025)
A Human-in-the-Loop Approach to Improving Cross-Text Prosody Transfer
von: Maurya, Himanshu, et al.
Veröffentlicht: (2024)
von: Maurya, Himanshu, et al.
Veröffentlicht: (2024)
AIMDiT: Modality Augmentation and Interaction via Multimodal Dimension Transformation for Emotion Recognition in Conversations
von: Wu, Sheng, et al.
Veröffentlicht: (2024)
von: Wu, Sheng, et al.
Veröffentlicht: (2024)
Probing the Hidden Talent of ASR Foundation Models for L2 English Oral Assessment
von: Chao, Fu-An, et al.
Veröffentlicht: (2025)
von: Chao, Fu-An, et al.
Veröffentlicht: (2025)
QualiSpeech: A Speech Quality Assessment Dataset with Natural Language Reasoning and Descriptions
von: Wang, Siyin, et al.
Veröffentlicht: (2025)
von: Wang, Siyin, et al.
Veröffentlicht: (2025)
Harf-Speech: A Clinically Aligned Framework for Arabic Phoneme-Level Speech Assessment
von: Azad, Asif, et al.
Veröffentlicht: (2026)
von: Azad, Asif, et al.
Veröffentlicht: (2026)
SecoustiCodec: Cross-Modal Aligned Streaming Single-Codecbook Speech Codec
von: Qiang, Chunyu, et al.
Veröffentlicht: (2025)
von: Qiang, Chunyu, et al.
Veröffentlicht: (2025)
Optimizing Automatic Speech Assessment: W-RankSim Regularization and Hybrid Feature Fusion Strategies
von: Wu, Chung-Wen, et al.
Veröffentlicht: (2024)
von: Wu, Chung-Wen, et al.
Veröffentlicht: (2024)
Towards Quantifying and Reducing Language Mismatch Effects in Cross-Lingual Speech Anti-Spoofing
von: Liu, Tianchi, et al.
Veröffentlicht: (2024)
von: Liu, Tianchi, et al.
Veröffentlicht: (2024)
VQ-CTAP: Cross-Modal Fine-Grained Sequence Representation Learning for Speech Processing
von: Qiang, Chunyu, et al.
Veröffentlicht: (2024)
von: Qiang, Chunyu, et al.
Veröffentlicht: (2024)
Speech ReaLLM -- Real-time Streaming Speech Recognition with Multimodal LLMs by Teaching the Flow of Time
von: Seide, Frank, et al.
Veröffentlicht: (2024)
von: Seide, Frank, et al.
Veröffentlicht: (2024)
Jointly Fine-Tuning "BERT-like" Self Supervised Models to Improve Multimodal Speech Emotion Recognition
von: Siriwardhana, Shamane, et al.
Veröffentlicht: (2020)
von: Siriwardhana, Shamane, et al.
Veröffentlicht: (2020)
Temporal Order Preserved Optimal Transport-based Cross-modal Knowledge Transfer Learning for ASR
von: Lu, Xugang, et al.
Veröffentlicht: (2024)
von: Lu, Xugang, et al.
Veröffentlicht: (2024)
RECA-PD: A Robust Explainable Cross-Attention Method for Speech-based Parkinson's Disease Classification
von: Zhong, Terry Yi, et al.
Veröffentlicht: (2025)
von: Zhong, Terry Yi, et al.
Veröffentlicht: (2025)
SightSound-R1: Cross-Modal Reasoning Distillation from Vision to Audio Language Models
von: Wang, Qiaolin, et al.
Veröffentlicht: (2025)
von: Wang, Qiaolin, et al.
Veröffentlicht: (2025)
PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding
von: He, Jiajun, et al.
Veröffentlicht: (2025)
von: He, Jiajun, et al.
Veröffentlicht: (2025)
Rubric-Guided Fine-tuning of SpeechLLMs for Multi-Aspect, Multi-Rater L2 Reading-Speech Assessment
von: Parikh, Aditya Kamlesh, et al.
Veröffentlicht: (2026)
von: Parikh, Aditya Kamlesh, et al.
Veröffentlicht: (2026)
Articulation-Informed ASR: Integrating Articulatory Features into ASR via Auxiliary Speech Inversion and Cross-Attention Fusion
von: Attia, Ahmed Adel, et al.
Veröffentlicht: (2025)
von: Attia, Ahmed Adel, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
CBF-AFA: Chunk-Based Multi-SSL Fusion for Automatic Fluency Assessment
von: Wade, Papa Séga, et al.
Veröffentlicht: (2025) -
MMMOS: Multi-domain Multi-axis Audio Quality Assessment
von: Lin, Yi-Cheng, et al.
Veröffentlicht: (2025) -
Natural Language-based Assessment of L2 Oral Proficiency using LLMs
von: Bannò, Stefano, et al.
Veröffentlicht: (2025) -
ViDove: A Translation Agent System with Multimodal Context and Memory-Augmented Reasoning
von: Lu, Yichen, et al.
Veröffentlicht: (2025) -
When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition
von: Moure, Pehuén, et al.
Veröffentlicht: (2026)