SVLA: A Unified Speech-Vision-Language Assistant with Multimodal Reasoning and Speech Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Huynh, Ngoc Dung, Bouadjenek, Mohamed Reda, Razzak, Imran, Hacid, Hakim, Aryal, Sunil |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Visual question answering: from early developments to recent advances -- a survey
par: Huynh, Ngoc Dung, et autres
Publié: (2025)
par: Huynh, Ngoc Dung, et autres
Publié: (2025)
SimpsonsVQA: Enhancing Inquiry-Based Learning with a Tailored Dataset
par: Huynh, Ngoc Dung, et autres
Publié: (2024)
par: Huynh, Ngoc Dung, et autres
Publié: (2024)
Rolling Ball Optimizer: Learning by ironing out loss landscape wrinkles
par: Belgoumri, Mohammed Djameleddine, et autres
Publié: (2025)
par: Belgoumri, Mohammed Djameleddine, et autres
Publié: (2025)
Training Machine Learning models at the Edge: A Survey
par: Khouas, Aymen Rayane, et autres
Publié: (2024)
par: Khouas, Aymen Rayane, et autres
Publié: (2024)
Data Quality in Edge Machine Learning: A State-of-the-Art Survey
par: Belgoumri, Mohammed Djameleddine, et autres
Publié: (2024)
par: Belgoumri, Mohammed Djameleddine, et autres
Publié: (2024)
Far From Sight, Far From Mind: Inverse Distance Weighting for Graph Federated Recommendation
par: Khouas, Aymen Rayane, et autres
Publié: (2025)
par: Khouas, Aymen Rayane, et autres
Publié: (2025)
Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark
par: Zhang, Han, et autres
Publié: (2025)
par: Zhang, Han, et autres
Publié: (2025)
UMETTS: A Unified Framework for Emotional Text-to-Speech Synthesis with Multimodal Prompts
par: Cheng, Zhi-Qi, et autres
Publié: (2024)
par: Cheng, Zhi-Qi, et autres
Publié: (2024)
VSpeechLM: A Visual Speech Language Model for Visual Text-to-Speech Task
par: Wang, Yuyue, et autres
Publié: (2025)
par: Wang, Yuyue, et autres
Publié: (2025)
UniPath: Adaptive Coordination of Understanding and Generation for Unified Multimodal Reasoning
par: Bai, Hayes, et autres
Publié: (2026)
par: Bai, Hayes, et autres
Publié: (2026)
Leveraging Taxonomy and LLMs for Improved Multimodal Hierarchical Classification
par: Chen, Shijing, et autres
Publié: (2025)
par: Chen, Shijing, et autres
Publié: (2025)
SpeechEE: A Novel Benchmark for Speech Event Extraction
par: Wang, Bin, et autres
Publié: (2024)
par: Wang, Bin, et autres
Publié: (2024)
SpeechCraft: A Fine-grained Expressive Speech Dataset with Natural Language Description
par: Jin, Zeyu, et autres
Publié: (2024)
par: Jin, Zeyu, et autres
Publié: (2024)
Target Speech Diarization with Multimodal Prompts
par: Jiang, Yidi, et autres
Publié: (2024)
par: Jiang, Yidi, et autres
Publié: (2024)
MissMecha: An All-in-One Python Package for Studying Missing Data Mechanisms
par: Zhou, Youran, et autres
Publié: (2025)
par: Zhou, Youran, et autres
Publié: (2025)
Developing robust methods to handle missing data in real-world applications effectively
par: Zhou, Youran, et autres
Publié: (2025)
par: Zhou, Youran, et autres
Publié: (2025)
MissHDD: Hybrid Deterministic Diffusion for Hetrogeneous Incomplete Data Imputation
par: Zhou, Youran, et autres
Publié: (2025)
par: Zhou, Youran, et autres
Publié: (2025)
MissDDIM: Deterministic and Efficient Conditional Diffusion for Tabular Data Imputation
par: Zhou, Youran, et autres
Publié: (2025)
par: Zhou, Youran, et autres
Publié: (2025)
IVGAE: Handling Incomplete Heterogeneous Data with a Variational Graph Autoencoder
par: Zhou, Youran, et autres
Publié: (2025)
par: Zhou, Youran, et autres
Publié: (2025)
Review for Handling Missing Data with special missing mechanism
par: Zhou, Youran, et autres
Publié: (2024)
par: Zhou, Youran, et autres
Publié: (2024)
Speak the Art: A Direct Speech to Image Generation Framework
par: Saeed, Mariam, et autres
Publié: (2025)
par: Saeed, Mariam, et autres
Publié: (2025)
The Pursuit of Fairness in Artificial Intelligence Models: A Survey
par: Kheya, Tahsin Alamgir, et autres
Publié: (2024)
par: Kheya, Tahsin Alamgir, et autres
Publié: (2024)
Low-latency Speech Enhancement via Speech Token Generation
par: Xue, Huaying, et autres
Publié: (2023)
par: Xue, Huaying, et autres
Publié: (2023)
MMoFusion: Multi-modal Co-Speech Motion Generation with Diffusion Model
par: Wang, Sen, et autres
Publié: (2024)
par: Wang, Sen, et autres
Publié: (2024)
Speech2AffectiveGestures: Synthesizing Co-Speech Gestures with Generative Adversarial Affective Expression Learning
par: Bhattacharya, Uttaran, et autres
Publié: (2021)
par: Bhattacharya, Uttaran, et autres
Publié: (2021)
Bias vs Bias -- Dawn of Justice: A Fair Fight in Recommendation Systems
par: Kheya, Tahsin Alamgir, et autres
Publié: (2025)
par: Kheya, Tahsin Alamgir, et autres
Publié: (2025)
HOP: Heterogeneous Topology-based Multimodal Entanglement for Co-Speech Gesture Generation
par: Cheng, Hongye, et autres
Publié: (2025)
par: Cheng, Hongye, et autres
Publié: (2025)
TalkSketch: Multimodal Generative AI for Real-time Sketch Ideation with Speech
par: Shi, Weiyan, et autres
Publié: (2025)
par: Shi, Weiyan, et autres
Publié: (2025)
Unmasking Gender Bias in Recommendation Systems and Enhancing Category-Aware Fairness
par: Kheya, Tahsin Alamgir, et autres
Publié: (2025)
par: Kheya, Tahsin Alamgir, et autres
Publié: (2025)
AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation
par: Wang, Le, et autres
Publié: (2025)
par: Wang, Le, et autres
Publié: (2025)
MIST: Multimodal Interactive Speech-based Tool-calling Conversational Assistants for Smart Homes
par: Chen, Maximillian, et autres
Publié: (2026)
par: Chen, Maximillian, et autres
Publié: (2026)
Can We Hear from Events? Generating Speech from Event Camera
par: Fang, Jingping, et autres
Publié: (2026)
par: Fang, Jingping, et autres
Publié: (2026)
Preserving Speaker Information in Direct Speech-to-Speech Translation with Non-Autoregressive Generation and Pretraining
par: Zhou, Rui, et autres
Publié: (2024)
par: Zhou, Rui, et autres
Publié: (2024)
MM-InstructEval: Zero-Shot Evaluation of (Multimodal) Large Language Models on Multimodal Reasoning Tasks
par: Yang, Xiaocui, et autres
Publié: (2024)
par: Yang, Xiaocui, et autres
Publié: (2024)
AlignDiT: Multimodal Aligned Diffusion Transformer for Synchronized Speech Generation
par: Choi, Jeongsoo, et autres
Publié: (2025)
par: Choi, Jeongsoo, et autres
Publié: (2025)
SLAM-LLM: A Modular, Open-Source Multimodal Large Language Model Framework and Best Practice for Speech, Language, Audio and Music Processing
par: Ma, Ziyang, et autres
Publié: (2026)
par: Ma, Ziyang, et autres
Publié: (2026)
TraveLLaMA: A Multimodal Travel Assistant with Large-Scale Dataset and Structured Reasoning
par: Chu, Meng, et autres
Publié: (2025)
par: Chu, Meng, et autres
Publié: (2025)
Hierarchical Vision-Language Reasoning for Multimodal Multiple-Choice Question Answering
par: Zhou, Ao, et autres
Publié: (2025)
par: Zhou, Ao, et autres
Publié: (2025)
Speech as a Multimodal Digital Phenotype for Multi-Task LLM-based Mental Health Prediction
par: Ali, Mai, et autres
Publié: (2025)
par: Ali, Mai, et autres
Publié: (2025)
A Simple Method to Enhance Pre-trained Language Models with Speech Tokens for Classification
par: Calbucura, Nicolas, et autres
Publié: (2025)
par: Calbucura, Nicolas, et autres
Publié: (2025)
Documents similaires
-
Visual question answering: from early developments to recent advances -- a survey
par: Huynh, Ngoc Dung, et autres
Publié: (2025) -
SimpsonsVQA: Enhancing Inquiry-Based Learning with a Tailored Dataset
par: Huynh, Ngoc Dung, et autres
Publié: (2024) -
Rolling Ball Optimizer: Learning by ironing out loss landscape wrinkles
par: Belgoumri, Mohammed Djameleddine, et autres
Publié: (2025) -
Training Machine Learning models at the Edge: A Survey
par: Khouas, Aymen Rayane, et autres
Publié: (2024) -
Data Quality in Edge Machine Learning: A State-of-the-Art Survey
par: Belgoumri, Mohammed Djameleddine, et autres
Publié: (2024)