VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction
Fuente:
arXiv
Salvato in:
| Autori principali: | Fu, Chaoyou, Lin, Haojia, Wang, Xiong, Zhang, Yi-Fan, Shen, Yunhang, Liu, Xiaoyu, Cao, Haoyu, Long, Zuwei, Gao, Heting, Li, Ke, Ma, Long, Zheng, Xiawu, Ji, Rongrong, Sun, Xing, Shan, Caifeng, He, Ran |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LUCY: Linguistic Understanding and Control Yielding Early Stage of Her
di: Gao, Heting, et al.
Pubblicazione: (2025)
di: Gao, Heting, et al.
Pubblicazione: (2025)
Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM
di: Wang, Xiong, et al.
Pubblicazione: (2024)
di: Wang, Xiong, et al.
Pubblicazione: (2024)
Parallel GPT: Harmonizing the Independence and Interdependence of Acoustic and Semantic Information for Zero-Shot Text-to-Speech
di: Xing, Jingyuan, et al.
Pubblicazione: (2025)
di: Xing, Jingyuan, et al.
Pubblicazione: (2025)
VITA: Towards Open-Source Interactive Omni Multimodal LLM
di: Fu, Chaoyou, et al.
Pubblicazione: (2024)
di: Fu, Chaoyou, et al.
Pubblicazione: (2024)
Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement
di: Huang, Ziling, et al.
Pubblicazione: (2025)
di: Huang, Ziling, et al.
Pubblicazione: (2025)
FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications
di: Guo, Hao-Han, et al.
Pubblicazione: (2024)
di: Guo, Hao-Han, et al.
Pubblicazione: (2024)
Enroll-on-Wakeup: A First Comparative Study of Target Speech Extraction for Seamless Interaction in Real Noisy Human-Machine Dialogue Scenarios
di: Yang, Yiming, et al.
Pubblicazione: (2026)
di: Yang, Yiming, et al.
Pubblicazione: (2026)
A Transcription Prompt-based Efficient Audio Large Language Model for Robust Speech Recognition
di: Li, Yangze, et al.
Pubblicazione: (2024)
di: Li, Yangze, et al.
Pubblicazione: (2024)
Leveraging Multimodal Methods and Spontaneous Speech for Alzheimer's Disease Identification
di: Gao, Yifan, et al.
Pubblicazione: (2024)
di: Gao, Yifan, et al.
Pubblicazione: (2024)
Omni-Diffusion: Unified Multimodal Understanding and Generation with Masked Discrete Diffusion
di: Li, Lijiang, et al.
Pubblicazione: (2026)
di: Li, Lijiang, et al.
Pubblicazione: (2026)
k2SSL: A Faster and Better Framework for Self-Supervised Speech Representation Learning
di: Yang, Yifan, et al.
Pubblicazione: (2024)
di: Yang, Yifan, et al.
Pubblicazione: (2024)
Speech-Omni-Lite: Portable Speech Interfaces for Vision-Language Models
di: Tao, Dehua, et al.
Pubblicazione: (2026)
di: Tao, Dehua, et al.
Pubblicazione: (2026)
A Survey on Speech Large Language Models for Understanding
di: Peng, Jing, et al.
Pubblicazione: (2024)
di: Peng, Jing, et al.
Pubblicazione: (2024)
Full-Duplex-Bench v1.5: Evaluating Overlap Handling for Full-Duplex Speech Models
di: Lin, Guan-Ting, et al.
Pubblicazione: (2025)
di: Lin, Guan-Ting, et al.
Pubblicazione: (2025)
Clever Hans Effect Found in Automatic Detection of Alzheimer's Disease through Speech
di: Liu, Yin-Long, et al.
Pubblicazione: (2024)
di: Liu, Yin-Long, et al.
Pubblicazione: (2024)
AS-Speech: Adaptive Style For Speech Synthesis
di: Li, Zhipeng, et al.
Pubblicazione: (2024)
di: Li, Zhipeng, et al.
Pubblicazione: (2024)
Word-Level Emotional Expression Control in Zero-Shot Text-to-Speech Synthesis
di: Wang, Tianrui, et al.
Pubblicazione: (2025)
di: Wang, Tianrui, et al.
Pubblicazione: (2025)
Towards Unsupervised Speech Recognition Without Pronunciation Models
di: Ni, Junrui, et al.
Pubblicazione: (2024)
di: Ni, Junrui, et al.
Pubblicazione: (2024)
Noisy Disentanglement with Tri-stage Training for Noise-Robust Speech Recognition
di: Chen, Shuangyuan, et al.
Pubblicazione: (2025)
di: Chen, Shuangyuan, et al.
Pubblicazione: (2025)
iMiGUE-Speech: A Spontaneous Speech Dataset for Affective Analysis
di: Kakouros, Sofoklis, et al.
Pubblicazione: (2026)
di: Kakouros, Sofoklis, et al.
Pubblicazione: (2026)
Modeling Multi-Level Hearing Loss for Speech Intelligibility Prediction
di: Zhou, Xiajie, et al.
Pubblicazione: (2025)
di: Zhou, Xiajie, et al.
Pubblicazione: (2025)
Text-aware Speech Separation for Multi-talker Keyword Spotting
di: Li, Haoyu, et al.
Pubblicazione: (2024)
di: Li, Haoyu, et al.
Pubblicazione: (2024)
Speech Emotion Recognition Via CNN-Transformer and Multidimensional Attention Mechanism
di: Tang, Xiaoyu, et al.
Pubblicazione: (2024)
di: Tang, Xiaoyu, et al.
Pubblicazione: (2024)
A Multi-Stage Framework for Multimodal Controllable Speech Synthesis
di: Niu, Rui, et al.
Pubblicazione: (2025)
di: Niu, Rui, et al.
Pubblicazione: (2025)
Exploring In-Context Learning Capabilities of ChatGPT for Pathological Speech Detection
di: Amiri, Mahdi, et al.
Pubblicazione: (2025)
di: Amiri, Mahdi, et al.
Pubblicazione: (2025)
VITA-Audio: Fast Interleaved Cross-Modal Token Generation for Efficient Large Speech-Language Model
di: Long, Zuwei, et al.
Pubblicazione: (2025)
di: Long, Zuwei, et al.
Pubblicazione: (2025)
SEF-PNet: Speaker Encoder-Free Personalized Speech Enhancement with Local and Global Contexts Aggregation
di: Huang, Ziling, et al.
Pubblicazione: (2025)
di: Huang, Ziling, et al.
Pubblicazione: (2025)
Towards Real-Time Generative Speech Restoration with Flow-Matching
di: Hsieh, Tsun-An, et al.
Pubblicazione: (2025)
di: Hsieh, Tsun-An, et al.
Pubblicazione: (2025)
Exploiting Foundation Models and Speech Enhancement for Parkinson's Disease Detection from Speech in Real-World Operative Conditions
di: La Quatra, Moreno, et al.
Pubblicazione: (2024)
di: La Quatra, Moreno, et al.
Pubblicazione: (2024)
DrawSpeech: Expressive Speech Synthesis Using Prosodic Sketches as Control Conditions
di: Chen, Weidong, et al.
Pubblicazione: (2025)
di: Chen, Weidong, et al.
Pubblicazione: (2025)
Enhancing Speech Large Language Models with Prompt-Aware Mixture of Audio Encoders
di: Shan, Weiqiao, et al.
Pubblicazione: (2025)
di: Shan, Weiqiao, et al.
Pubblicazione: (2025)
Real-time Speech Restoration using Data Prediction Mean Flows
di: Braun, Sebastian
Pubblicazione: (2026)
di: Braun, Sebastian
Pubblicazione: (2026)
Beyond Manual Transcripts: The Potential of Automated Speech Recognition Errors in Improving Alzheimer's Disease Detection
di: Liu, Yin-Long, et al.
Pubblicazione: (2025)
di: Liu, Yin-Long, et al.
Pubblicazione: (2025)
Joint decoding method for controllable contextual speech recognition based on Speech LLM
di: Fang, Yangui, et al.
Pubblicazione: (2025)
di: Fang, Yangui, et al.
Pubblicazione: (2025)
Binaural Unmasking in Practical Use: Perceived Level of Phase-inverted Speech in Environmental Noise
di: Kotani, Rina, et al.
Pubblicazione: (2025)
di: Kotani, Rina, et al.
Pubblicazione: (2025)
SpeechGPT-Gen: Scaling Chain-of-Information Speech Generation
di: Zhang, Dong, et al.
Pubblicazione: (2024)
di: Zhang, Dong, et al.
Pubblicazione: (2024)
Towards Fine-Grained and Multi-Granular Contrastive Language-Speech Pre-training
di: Yang, Yifan, et al.
Pubblicazione: (2026)
di: Yang, Yifan, et al.
Pubblicazione: (2026)
SPEAR: A Unified SSL Framework for Learning Speech and Audio Representations
di: Yang, Xiaoyu, et al.
Pubblicazione: (2025)
di: Yang, Xiaoyu, et al.
Pubblicazione: (2025)
Multi-Scale Temporal Transformer For Speech Emotion Recognition
di: Li, Zhipeng, et al.
Pubblicazione: (2024)
di: Li, Zhipeng, et al.
Pubblicazione: (2024)
FleSpeech: Flexibly Controllable Speech Generation with Various Prompts
di: Li, Hanzhao, et al.
Pubblicazione: (2025)
di: Li, Hanzhao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
LUCY: Linguistic Understanding and Control Yielding Early Stage of Her
di: Gao, Heting, et al.
Pubblicazione: (2025) -
Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM
di: Wang, Xiong, et al.
Pubblicazione: (2024) -
Parallel GPT: Harmonizing the Independence and Interdependence of Acoustic and Semantic Information for Zero-Shot Text-to-Speech
di: Xing, Jingyuan, et al.
Pubblicazione: (2025) -
VITA: Towards Open-Source Interactive Omni Multimodal LLM
di: Fu, Chaoyou, et al.
Pubblicazione: (2024) -
Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement
di: Huang, Ziling, et al.
Pubblicazione: (2025)