Long-VITA: Scaling Large Multi-modal Models to 1 Million Tokens with Leading Short-Context Accuracy
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Shen, Yunhang, Fu, Chaoyou, Dong, Shaoqi, Wang, Xiong, Zhang, Yi-Fan, Chen, Peixian, Zhang, Mengdan, Cao, Haoyu, Li, Ke, Lin, Shaohui, Zheng, Xiawu, Zhang, Yan, Zhou, Yiyi, He, Ran, Shan, Caifeng, Ji, Rongrong, Sun, Xing |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
VITA-Audio: Fast Interleaved Cross-Modal Token Generation for Efficient Large Speech-Language Model
von: Long, Zuwei, et al.
Veröffentlicht: (2025)
von: Long, Zuwei, et al.
Veröffentlicht: (2025)
VEGA: Learning Interleaved Image-Text Comprehension in Vision-Language Large Models
von: Zhou, Chenyu, et al.
Veröffentlicht: (2024)
von: Zhou, Chenyu, et al.
Veröffentlicht: (2024)
Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs
von: Li, Xudong, et al.
Veröffentlicht: (2025)
von: Li, Xudong, et al.
Veröffentlicht: (2025)
VITA: Towards Open-Source Interactive Omni Multimodal LLM
von: Fu, Chaoyou, et al.
Veröffentlicht: (2024)
von: Fu, Chaoyou, et al.
Veröffentlicht: (2024)
VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction
von: Fu, Chaoyou, et al.
Veröffentlicht: (2025)
von: Fu, Chaoyou, et al.
Veröffentlicht: (2025)
MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models
von: Fu, Chaoyou, et al.
Veröffentlicht: (2023)
von: Fu, Chaoyou, et al.
Veröffentlicht: (2023)
Cantor: Inspiring Multimodal Chain-of-Thought of MLLM
von: Gao, Timin, et al.
Veröffentlicht: (2024)
von: Gao, Timin, et al.
Veröffentlicht: (2024)
VITA-VLA: Efficiently Teaching Vision-Language Models to Act via Action Expert Distillation
von: Dong, Shaoqi, et al.
Veröffentlicht: (2025)
von: Dong, Shaoqi, et al.
Veröffentlicht: (2025)
Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis
von: Fu, Chaoyou, et al.
Veröffentlicht: (2024)
von: Fu, Chaoyou, et al.
Veröffentlicht: (2024)
VITA-E: Natural Embodied Interaction with Concurrent Seeing, Hearing, Speaking, and Acting
von: Liu, Xiaoyu, et al.
Veröffentlicht: (2025)
von: Liu, Xiaoyu, et al.
Veröffentlicht: (2025)
Omni-Diffusion: Unified Multimodal Understanding and Generation with Masked Discrete Diffusion
von: Li, Lijiang, et al.
Veröffentlicht: (2026)
von: Li, Lijiang, et al.
Veröffentlicht: (2026)
VideoDetective: Clue Hunting via both Extrinsic Query and Intrinsic Relevance for Long Video Understanding
von: Yang, Ruoliu, et al.
Veröffentlicht: (2026)
von: Yang, Ruoliu, et al.
Veröffentlicht: (2026)
A General and Efficient Training for Transformer via Token Expansion
von: Huang, Wenxuan, et al.
Veröffentlicht: (2024)
von: Huang, Wenxuan, et al.
Veröffentlicht: (2024)
Streaming Video Instruction Tuning
von: Xia, Jiaer, et al.
Veröffentlicht: (2025)
von: Xia, Jiaer, et al.
Veröffentlicht: (2025)
PersonaVLM: Long-Term Personalized Multimodal LLMs
von: Nie, Chang, et al.
Veröffentlicht: (2026)
von: Nie, Chang, et al.
Veröffentlicht: (2026)
Few-Shot Image Quality Assessment via Adaptation of Vision-Language Models
von: Li, Xudong, et al.
Veröffentlicht: (2024)
von: Li, Xudong, et al.
Veröffentlicht: (2024)
Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models
von: Luo, Gen, et al.
Veröffentlicht: (2024)
von: Luo, Gen, et al.
Veröffentlicht: (2024)
Video-MME-v2: Towards the Next Stage in Benchmarks for Comprehensive Video Understanding
von: Fu, Chaoyou, et al.
Veröffentlicht: (2026)
von: Fu, Chaoyou, et al.
Veröffentlicht: (2026)
Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM
von: Wang, Xiong, et al.
Veröffentlicht: (2024)
von: Wang, Xiong, et al.
Veröffentlicht: (2024)
Fusion-Mamba for Cross-modality Object Detection
von: Dong, Wenhao, et al.
Veröffentlicht: (2024)
von: Dong, Wenhao, et al.
Veröffentlicht: (2024)
Out of the Memory Barrier: A Highly Memory Efficient Training System for LLMs with Million-Token Contexts
von: Li, Wenhao, et al.
Veröffentlicht: (2026)
von: Li, Wenhao, et al.
Veröffentlicht: (2026)
Routing Experts: Learning to Route Dynamic Experts in Multi-modal Large Language Models
von: Wu, Qiong, et al.
Veröffentlicht: (2024)
von: Wu, Qiong, et al.
Veröffentlicht: (2024)
GroupGPT: A Token-efficient and Privacy-preserving Agentic Framework for Multi-User Chat Assistant
von: Shen, Zhuokang, et al.
Veröffentlicht: (2026)
von: Shen, Zhuokang, et al.
Veröffentlicht: (2026)
SpeechParaling-Bench: A Comprehensive Benchmark for Paralinguistic-Aware Speech Generation
von: Liu, Ruohan, et al.
Veröffentlicht: (2026)
von: Liu, Ruohan, et al.
Veröffentlicht: (2026)
LUCY: Linguistic Understanding and Control Yielding Early Stage of Her
von: Gao, Heting, et al.
Veröffentlicht: (2025)
von: Gao, Heting, et al.
Veröffentlicht: (2025)
QuoTA: Query-oriented Token Assignment via CoT Query Decouple for Long Video Comprehension
von: Luo, Yongdong, et al.
Veröffentlicht: (2025)
von: Luo, Yongdong, et al.
Veröffentlicht: (2025)
Feature Denoising Diffusion Model for Blind Image Quality Assessment
von: Li, Xudong, et al.
Veröffentlicht: (2024)
von: Li, Xudong, et al.
Veröffentlicht: (2024)
Context Parallelism for Scalable Million-Token Inference
von: Yang, Amy, et al.
Veröffentlicht: (2024)
von: Yang, Amy, et al.
Veröffentlicht: (2024)
LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens
von: Ding, Yiran, et al.
Veröffentlicht: (2024)
von: Ding, Yiran, et al.
Veröffentlicht: (2024)
FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression
von: Tong, Bo, et al.
Veröffentlicht: (2024)
von: Tong, Bo, et al.
Veröffentlicht: (2024)
Omni-Referring Image Segmentation
von: Zheng, Qiancheng, et al.
Veröffentlicht: (2025)
von: Zheng, Qiancheng, et al.
Veröffentlicht: (2025)
SDPose: Tokenized Pose Estimation via Circulation-Guide Self-Distillation
von: Chen, Sichen, et al.
Veröffentlicht: (2024)
von: Chen, Sichen, et al.
Veröffentlicht: (2024)
Adaptive Feature Selection for No-Reference Image Quality Assessment by Mitigating Semantic Noise Sensitivity
von: Li, Xudong, et al.
Veröffentlicht: (2023)
von: Li, Xudong, et al.
Veröffentlicht: (2023)
Multi-Modal Prompt Learning on Blind Image Quality Assessment
von: Pan, Wensheng, et al.
Veröffentlicht: (2024)
von: Pan, Wensheng, et al.
Veröffentlicht: (2024)
Probability-density-aware Semi-supervised Learning
von: Liu, Shuyang, et al.
Veröffentlicht: (2024)
von: Liu, Shuyang, et al.
Veröffentlicht: (2024)
HUWSOD: Holistic Self-training for Unified Weakly Supervised Object Detection
von: Cao, Liujuan, et al.
Veröffentlicht: (2024)
von: Cao, Liujuan, et al.
Veröffentlicht: (2024)
Scaling Instruction-Tuned LLMs to Million-Token Contexts via Hierarchical Synthetic Data Generation
von: He, Linda, et al.
Veröffentlicht: (2025)
von: He, Linda, et al.
Veröffentlicht: (2025)
Towards Efficient Automatic Self-Pruning of Large Language Models
von: Huang, Weizhong, et al.
Veröffentlicht: (2025)
von: Huang, Weizhong, et al.
Veröffentlicht: (2025)
Determining Layer-wise Sparsity for Large Language Models Through a Theoretical Perspective
von: Huang, Weizhong, et al.
Veröffentlicht: (2025)
von: Huang, Weizhong, et al.
Veröffentlicht: (2025)
SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning
von: Huang, Haoyu, et al.
Veröffentlicht: (2026)
von: Huang, Haoyu, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
VITA-Audio: Fast Interleaved Cross-Modal Token Generation for Efficient Large Speech-Language Model
von: Long, Zuwei, et al.
Veröffentlicht: (2025) -
VEGA: Learning Interleaved Image-Text Comprehension in Vision-Language Large Models
von: Zhou, Chenyu, et al.
Veröffentlicht: (2024) -
Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs
von: Li, Xudong, et al.
Veröffentlicht: (2025) -
VITA: Towards Open-Source Interactive Omni Multimodal LLM
von: Fu, Chaoyou, et al.
Veröffentlicht: (2024) -
VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction
von: Fu, Chaoyou, et al.
Veröffentlicht: (2025)