VITA: Towards Open-Source Interactive Omni Multimodal LLM
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Fu, Chaoyou, Lin, Haojia, Long, Zuwei, Shen, Yunhang, Dai, Yuhang, Zhao, Meng, Zhang, Yi-Fan, Dong, Shaoqi, Li, Yangze, Wang, Xiong, Cao, Haoyu, Yin, Di, Ma, Long, Zheng, Xiawu, Ji, Rongrong, Wu, Yunsheng, He, Ran, Shan, Caifeng, Sun, Xing |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction
von: Fu, Chaoyou, et al.
Veröffentlicht: (2025)
von: Fu, Chaoyou, et al.
Veröffentlicht: (2025)
Omni-Diffusion: Unified Multimodal Understanding and Generation with Masked Discrete Diffusion
von: Li, Lijiang, et al.
Veröffentlicht: (2026)
von: Li, Lijiang, et al.
Veröffentlicht: (2026)
Long-VITA: Scaling Large Multi-modal Models to 1 Million Tokens with Leading Short-Context Accuracy
von: Shen, Yunhang, et al.
Veröffentlicht: (2025)
von: Shen, Yunhang, et al.
Veröffentlicht: (2025)
VITA-E: Natural Embodied Interaction with Concurrent Seeing, Hearing, Speaking, and Acting
von: Liu, Xiaoyu, et al.
Veröffentlicht: (2025)
von: Liu, Xiaoyu, et al.
Veröffentlicht: (2025)
VITA-VLA: Efficiently Teaching Vision-Language Models to Act via Action Expert Distillation
von: Dong, Shaoqi, et al.
Veröffentlicht: (2025)
von: Dong, Shaoqi, et al.
Veröffentlicht: (2025)
VITA-Audio: Fast Interleaved Cross-Modal Token Generation for Efficient Large Speech-Language Model
von: Long, Zuwei, et al.
Veröffentlicht: (2025)
von: Long, Zuwei, et al.
Veröffentlicht: (2025)
Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM
von: Wang, Xiong, et al.
Veröffentlicht: (2024)
von: Wang, Xiong, et al.
Veröffentlicht: (2024)
MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models
von: Fu, Chaoyou, et al.
Veröffentlicht: (2023)
von: Fu, Chaoyou, et al.
Veröffentlicht: (2023)
DeepOmni: Towards Seamless and Smart Speech Interaction with Adaptive Modality-Specific MoE
von: Shao, Hang, et al.
Veröffentlicht: (2025)
von: Shao, Hang, et al.
Veröffentlicht: (2025)
VEGA: Learning Interleaved Image-Text Comprehension in Vision-Language Large Models
von: Zhou, Chenyu, et al.
Veröffentlicht: (2024)
von: Zhou, Chenyu, et al.
Veröffentlicht: (2024)
Cantor: Inspiring Multimodal Chain-of-Thought of MLLM
von: Gao, Timin, et al.
Veröffentlicht: (2024)
von: Gao, Timin, et al.
Veröffentlicht: (2024)
PersonaVLM: Long-Term Personalized Multimodal LLMs
von: Nie, Chang, et al.
Veröffentlicht: (2026)
von: Nie, Chang, et al.
Veröffentlicht: (2026)
Video-MME-v2: Towards the Next Stage in Benchmarks for Comprehensive Video Understanding
von: Fu, Chaoyou, et al.
Veröffentlicht: (2026)
von: Fu, Chaoyou, et al.
Veröffentlicht: (2026)
LUCY: Linguistic Understanding and Control Yielding Early Stage of Her
von: Gao, Heting, et al.
Veröffentlicht: (2025)
von: Gao, Heting, et al.
Veröffentlicht: (2025)
VideoDetective: Clue Hunting via both Extrinsic Query and Intrinsic Relevance for Long Video Understanding
von: Yang, Ruoliu, et al.
Veröffentlicht: (2026)
von: Yang, Ruoliu, et al.
Veröffentlicht: (2026)
Omni-Referring Image Segmentation
von: Zheng, Qiancheng, et al.
Veröffentlicht: (2025)
von: Zheng, Qiancheng, et al.
Veröffentlicht: (2025)
Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs
von: Li, Xudong, et al.
Veröffentlicht: (2025)
von: Li, Xudong, et al.
Veröffentlicht: (2025)
SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning
von: Huang, Haoyu, et al.
Veröffentlicht: (2026)
von: Huang, Haoyu, et al.
Veröffentlicht: (2026)
Benchmarking Abstract and Reasoning Abilities Through A Theoretical Perspective
von: Ma, Qingchuan, et al.
Veröffentlicht: (2025)
von: Ma, Qingchuan, et al.
Veröffentlicht: (2025)
MME-Survey: A Comprehensive Survey on Evaluation of Multimodal LLMs
von: Fu, Chaoyou, et al.
Veröffentlicht: (2024)
von: Fu, Chaoyou, et al.
Veröffentlicht: (2024)
QuoTA: Query-oriented Token Assignment via CoT Query Decouple for Long Video Comprehension
von: Luo, Yongdong, et al.
Veröffentlicht: (2025)
von: Luo, Yongdong, et al.
Veröffentlicht: (2025)
Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis
von: Fu, Chaoyou, et al.
Veröffentlicht: (2024)
von: Fu, Chaoyou, et al.
Veröffentlicht: (2024)
Video-RAG: Visually-aligned Retrieval-Augmented Long Video Comprehension
von: Luo, Yongdong, et al.
Veröffentlicht: (2024)
von: Luo, Yongdong, et al.
Veröffentlicht: (2024)
Training-Free Multimodal Large Language Model Orchestration
von: Xie, Tianyu, et al.
Veröffentlicht: (2025)
von: Xie, Tianyu, et al.
Veröffentlicht: (2025)
Woodpecker: Hallucination Correction for Multimodal Large Language Models
von: Yin, Shukang, et al.
Veröffentlicht: (2023)
von: Yin, Shukang, et al.
Veröffentlicht: (2023)
OpenOmni: A Collaborative Open Source Tool for Building Future-Ready Multimodal Conversational Agents
von: Sun, Qiang, et al.
Veröffentlicht: (2024)
von: Sun, Qiang, et al.
Veröffentlicht: (2024)
Few-Shot Image Quality Assessment via Adaptation of Vision-Language Models
von: Li, Xudong, et al.
Veröffentlicht: (2024)
von: Li, Xudong, et al.
Veröffentlicht: (2024)
Unveiling the Potential of LLM-Based ASR on Chinese Open-Source Datasets
von: Geng, Xuelong, et al.
Veröffentlicht: (2024)
von: Geng, Xuelong, et al.
Veröffentlicht: (2024)
OpenOmni: Advancing Open-Source Omnimodal Large Language Models with Progressive Multimodal Alignment and Real-Time Self-Aware Emotional Speech Synthesis
von: Luo, Run, et al.
Veröffentlicht: (2025)
von: Luo, Run, et al.
Veröffentlicht: (2025)
SpeechParaling-Bench: A Comprehensive Benchmark for Paralinguistic-Aware Speech Generation
von: Liu, Ruohan, et al.
Veröffentlicht: (2026)
von: Liu, Ruohan, et al.
Veröffentlicht: (2026)
From Objects to Events: Unlocking Complex Visual Understanding in Object Detectors via LLM-guided Symbolic Reasoning
von: Zeng, Yuhui, et al.
Veröffentlicht: (2025)
von: Zeng, Yuhui, et al.
Veröffentlicht: (2025)
Sparrow: Data-Efficient Video-LLM with Text-to-Image Augmentation
von: Yin, Shukang, et al.
Veröffentlicht: (2024)
von: Yin, Shukang, et al.
Veröffentlicht: (2024)
Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models
von: Luo, Gen, et al.
Veröffentlicht: (2024)
von: Luo, Gen, et al.
Veröffentlicht: (2024)
An Effective End-to-End Solution for Multimodal Action Recognition
von: Wang, Songping, et al.
Veröffentlicht: (2025)
von: Wang, Songping, et al.
Veröffentlicht: (2025)
Feature Denoising Diffusion Model for Blind Image Quality Assessment
von: Li, Xudong, et al.
Veröffentlicht: (2024)
von: Li, Xudong, et al.
Veröffentlicht: (2024)
Rethinking 3D Dense Caption and Visual Grounding in A Unified Framework through Prompt-based Localization
von: Luo, Yongdong, et al.
Veröffentlicht: (2024)
von: Luo, Yongdong, et al.
Veröffentlicht: (2024)
Can Unified Generation and Understanding Models Maintain Semantic Equivalence Across Different Output Modalities?
von: Jiang, Hongbo, et al.
Veröffentlicht: (2026)
von: Jiang, Hongbo, et al.
Veröffentlicht: (2026)
Adaptive Feature Selection for No-Reference Image Quality Assessment by Mitigating Semantic Noise Sensitivity
von: Li, Xudong, et al.
Veröffentlicht: (2023)
von: Li, Xudong, et al.
Veröffentlicht: (2023)
FlexiReID: Adaptive Mixture of Expert for Multi-Modal Person Re-Identification
von: Sun, Zhen, et al.
Veröffentlicht: (2025)
von: Sun, Zhen, et al.
Veröffentlicht: (2025)
ROMA: Real-time Omni-Multimodal Assistant with Interactive Streaming Understanding
von: Tian, Xueyun, et al.
Veröffentlicht: (2026)
von: Tian, Xueyun, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction
von: Fu, Chaoyou, et al.
Veröffentlicht: (2025) -
Omni-Diffusion: Unified Multimodal Understanding and Generation with Masked Discrete Diffusion
von: Li, Lijiang, et al.
Veröffentlicht: (2026) -
Long-VITA: Scaling Large Multi-modal Models to 1 Million Tokens with Leading Short-Context Accuracy
von: Shen, Yunhang, et al.
Veröffentlicht: (2025) -
VITA-E: Natural Embodied Interaction with Concurrent Seeing, Hearing, Speaking, and Acting
von: Liu, Xiaoyu, et al.
Veröffentlicht: (2025) -
VITA-VLA: Efficiently Teaching Vision-Language Models to Act via Action Expert Distillation
von: Dong, Shaoqi, et al.
Veröffentlicht: (2025)