Multimodal Proposal for an AI-Based Tool to Increase Cross-Assessment of Messages
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Castro, Alejandro Álvarez, Ordieres-Meré, Joaquín |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CBF-AFA: Chunk-Based Multi-SSL Fusion for Automatic Fluency Assessment
par: Wade, Papa Séga, et autres
Publié: (2025)
par: Wade, Papa Séga, et autres
Publié: (2025)
MMMOS: Multi-domain Multi-axis Audio Quality Assessment
par: Lin, Yi-Cheng, et autres
Publié: (2025)
par: Lin, Yi-Cheng, et autres
Publié: (2025)
Natural Language-based Assessment of L2 Oral Proficiency using LLMs
par: Bannò, Stefano, et autres
Publié: (2025)
par: Bannò, Stefano, et autres
Publié: (2025)
ViDove: A Translation Agent System with Multimodal Context and Memory-Augmented Reasoning
par: Lu, Yichen, et autres
Publié: (2025)
par: Lu, Yichen, et autres
Publié: (2025)
When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition
par: Moure, Pehuén, et autres
Publié: (2026)
par: Moure, Pehuén, et autres
Publié: (2026)
X-OPD: Cross-Modal On-Policy Distillation for Capability Alignment in Speech LLMs
par: Cao, Di, et autres
Publié: (2026)
par: Cao, Di, et autres
Publié: (2026)
Late Fusion and Multi-Level Fission Amplify Cross-Modal Transfer in Text-Speech LMs
par: Cuervo, Santiago, et autres
Publié: (2025)
par: Cuervo, Santiago, et autres
Publié: (2025)
Enhancing nonnative speech perception and production through an AI-powered application
par: Georgiou, Georgios P.
Publié: (2025)
par: Georgiou, Georgios P.
Publié: (2025)
KAME: Tandem Architecture for Enhancing Knowledge in Real-Time Speech-to-Speech Conversational AI
par: Kuroki, So, et autres
Publié: (2025)
par: Kuroki, So, et autres
Publié: (2025)
Exploring ASR-Based Wav2Vec2 for Automated Speech Disorder Assessment: Insights and Analysis
par: Nguyen, Tuan, et autres
Publié: (2024)
par: Nguyen, Tuan, et autres
Publié: (2024)
Task-Lens: Cross-Task Utility Based Speech Dataset Profiling for Low-Resource Indian Languages
par: Sharma, Swati, et autres
Publié: (2026)
par: Sharma, Swati, et autres
Publié: (2026)
CTC-Assisted LLM-Based Contextual ASR
par: Yang, Guanrou, et autres
Publié: (2024)
par: Yang, Guanrou, et autres
Publié: (2024)
Improving Audio-Visual Speech Recognition by Lip-Subword Correlation Based Visual Pre-training and Cross-Modal Fusion Encoder
par: Dai, Yusheng, et autres
Publié: (2023)
par: Dai, Yusheng, et autres
Publié: (2023)
Double Entendre: Robust Audio-Based AI-Generated Lyrics Detection via Multi-View Fusion
par: Frohmann, Markus, et autres
Publié: (2025)
par: Frohmann, Markus, et autres
Publié: (2025)
LLM-Driven Multimodal Opinion Expression Identification
par: Jia, Bonian, et autres
Publié: (2024)
par: Jia, Bonian, et autres
Publié: (2024)
Speech-Based Cognitive Screening: A Systematic Evaluation of LLM Adaptation Strategies
par: Taherinezhad, Fatemeh, et autres
Publié: (2025)
par: Taherinezhad, Fatemeh, et autres
Publié: (2025)
CoVoSwitch: Machine Translation of Synthetic Code-Switched Text Based on Intonation Units
par: Kang, Yeeun
Publié: (2024)
par: Kang, Yeeun
Publié: (2024)
DM-Codec: Distilling Multimodal Representations for Speech Tokenization
par: Ahasan, Md Mubtasim, et autres
Publié: (2024)
par: Ahasan, Md Mubtasim, et autres
Publié: (2024)
Improved Cross-Lingual Transfer Learning For Automatic Speech Translation
par: Khurana, Sameer, et autres
Publié: (2023)
par: Khurana, Sameer, et autres
Publié: (2023)
Style-Talker: Finetuning Audio Language Model and Style-Based Text-to-Speech Model for Fast Spoken Dialogue Generation
par: Li, Yinghao Aaron, et autres
Publié: (2024)
par: Li, Yinghao Aaron, et autres
Publié: (2024)
Acoustic Feature Mixup for Balanced Multi-aspect Pronunciation Assessment
par: Do, Heejin, et autres
Publié: (2024)
par: Do, Heejin, et autres
Publié: (2024)
Cross-Speaker Encoding Network for Multi-Talker Speech Recognition
par: Kang, Jiawen, et autres
Publié: (2024)
par: Kang, Jiawen, et autres
Publié: (2024)
Kling-Foley: Multimodal Diffusion Transformer for High-Quality Video-to-Audio Generation
par: Wang, Jun, et autres
Publié: (2025)
par: Wang, Jun, et autres
Publié: (2025)
A Human-in-the-Loop Approach to Improving Cross-Text Prosody Transfer
par: Maurya, Himanshu, et autres
Publié: (2024)
par: Maurya, Himanshu, et autres
Publié: (2024)
AIMDiT: Modality Augmentation and Interaction via Multimodal Dimension Transformation for Emotion Recognition in Conversations
par: Wu, Sheng, et autres
Publié: (2024)
par: Wu, Sheng, et autres
Publié: (2024)
Probing the Hidden Talent of ASR Foundation Models for L2 English Oral Assessment
par: Chao, Fu-An, et autres
Publié: (2025)
par: Chao, Fu-An, et autres
Publié: (2025)
QualiSpeech: A Speech Quality Assessment Dataset with Natural Language Reasoning and Descriptions
par: Wang, Siyin, et autres
Publié: (2025)
par: Wang, Siyin, et autres
Publié: (2025)
Harf-Speech: A Clinically Aligned Framework for Arabic Phoneme-Level Speech Assessment
par: Azad, Asif, et autres
Publié: (2026)
par: Azad, Asif, et autres
Publié: (2026)
SecoustiCodec: Cross-Modal Aligned Streaming Single-Codecbook Speech Codec
par: Qiang, Chunyu, et autres
Publié: (2025)
par: Qiang, Chunyu, et autres
Publié: (2025)
Optimizing Automatic Speech Assessment: W-RankSim Regularization and Hybrid Feature Fusion Strategies
par: Wu, Chung-Wen, et autres
Publié: (2024)
par: Wu, Chung-Wen, et autres
Publié: (2024)
Towards Quantifying and Reducing Language Mismatch Effects in Cross-Lingual Speech Anti-Spoofing
par: Liu, Tianchi, et autres
Publié: (2024)
par: Liu, Tianchi, et autres
Publié: (2024)
VQ-CTAP: Cross-Modal Fine-Grained Sequence Representation Learning for Speech Processing
par: Qiang, Chunyu, et autres
Publié: (2024)
par: Qiang, Chunyu, et autres
Publié: (2024)
Speech ReaLLM -- Real-time Streaming Speech Recognition with Multimodal LLMs by Teaching the Flow of Time
par: Seide, Frank, et autres
Publié: (2024)
par: Seide, Frank, et autres
Publié: (2024)
Jointly Fine-Tuning "BERT-like" Self Supervised Models to Improve Multimodal Speech Emotion Recognition
par: Siriwardhana, Shamane, et autres
Publié: (2020)
par: Siriwardhana, Shamane, et autres
Publié: (2020)
Temporal Order Preserved Optimal Transport-based Cross-modal Knowledge Transfer Learning for ASR
par: Lu, Xugang, et autres
Publié: (2024)
par: Lu, Xugang, et autres
Publié: (2024)
RECA-PD: A Robust Explainable Cross-Attention Method for Speech-based Parkinson's Disease Classification
par: Zhong, Terry Yi, et autres
Publié: (2025)
par: Zhong, Terry Yi, et autres
Publié: (2025)
SightSound-R1: Cross-Modal Reasoning Distillation from Vision to Audio Language Models
par: Wang, Qiaolin, et autres
Publié: (2025)
par: Wang, Qiaolin, et autres
Publié: (2025)
PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding
par: He, Jiajun, et autres
Publié: (2025)
par: He, Jiajun, et autres
Publié: (2025)
Rubric-Guided Fine-tuning of SpeechLLMs for Multi-Aspect, Multi-Rater L2 Reading-Speech Assessment
par: Parikh, Aditya Kamlesh, et autres
Publié: (2026)
par: Parikh, Aditya Kamlesh, et autres
Publié: (2026)
Articulation-Informed ASR: Integrating Articulatory Features into ASR via Auxiliary Speech Inversion and Cross-Attention Fusion
par: Attia, Ahmed Adel, et autres
Publié: (2025)
par: Attia, Ahmed Adel, et autres
Publié: (2025)
Documents similaires
-
CBF-AFA: Chunk-Based Multi-SSL Fusion for Automatic Fluency Assessment
par: Wade, Papa Séga, et autres
Publié: (2025) -
MMMOS: Multi-domain Multi-axis Audio Quality Assessment
par: Lin, Yi-Cheng, et autres
Publié: (2025) -
Natural Language-based Assessment of L2 Oral Proficiency using LLMs
par: Bannò, Stefano, et autres
Publié: (2025) -
ViDove: A Translation Agent System with Multimodal Context and Memory-Augmented Reasoning
par: Lu, Yichen, et autres
Publié: (2025) -
When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition
par: Moure, Pehuén, et autres
Publié: (2026)