SPHINX-X: Scaling Data and Parameters for a Family of Multi-modal Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Dongyang, Zhang, Renrui, Qiu, Longtian, Huang, Siyuan, Lin, Weifeng, Zhao, Shitian, Geng, Shijie, Lin, Ziyi, Jin, Peng, Zhang, Kaipeng, Shao, Wenqi, Xu, Chao, He, Conghui, He, Junjun, Shao, Hao, Lu, Pan, Li, Hongsheng, Qiao, Yu, Gao, Peng |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
PixWizard: Versatile Image-to-Image Visual Assistant with Open-Language Instructions
par: Lin, Weifeng, et autres
Publié: (2024)
par: Lin, Weifeng, et autres
Publié: (2024)
Unleashing the Potentials of Likelihood Composition for Multi-modal Language Models
par: Zhao, Shitian, et autres
Publié: (2024)
par: Zhao, Shitian, et autres
Publié: (2024)
Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers
par: Gao, Peng, et autres
Publié: (2024)
par: Gao, Peng, et autres
Publié: (2024)
CLIP-Adapter: Better Vision-Language Models with Feature Adapters
par: Gao, Peng, et autres
Publié: (2021)
par: Gao, Peng, et autres
Publié: (2021)
Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining
par: Liu, Dongyang, et autres
Publié: (2024)
par: Liu, Dongyang, et autres
Publié: (2024)
BESA: Pruning Large Language Models with Blockwise Parameter-Efficient Sparsity Allocation
par: Xu, Peng, et autres
Publié: (2024)
par: Xu, Peng, et autres
Publié: (2024)
TinyLVLM-eHub: Towards Comprehensive and Efficient Evaluation for Large Vision-Language Models
par: Shao, Wenqi, et autres
Publié: (2023)
par: Shao, Wenqi, et autres
Publié: (2023)
TP-Eval: Tap Multimodal LLMs' Potential in Evaluation by Customizing Prompts
par: Xie, Yuxuan, et autres
Publié: (2024)
par: Xie, Yuxuan, et autres
Publié: (2024)
ChartAssisstant: A Universal Chart Multimodal Language Model via Chart-to-Table Pre-training and Multitask Instruction Tuning
par: Meng, Fanqing, et autres
Publié: (2024)
par: Meng, Fanqing, et autres
Publié: (2024)
PyVision-RL: Forging Open Agentic Vision Models via RL
par: Zhao, Shitian, et autres
Publié: (2026)
par: Zhao, Shitian, et autres
Publié: (2026)
LeX-Art: Rethinking Text Generation via Scalable High-Quality Data Synthesis
par: Zhao, Shitian, et autres
Publié: (2025)
par: Zhao, Shitian, et autres
Publié: (2025)
SPP: Sparsity-Preserved Parameter-Efficient Fine-Tuning for Large Language Models
par: Lu, Xudong, et autres
Publié: (2024)
par: Lu, Xudong, et autres
Publié: (2024)
EfficientQAT: Efficient Quantization-Aware Training for Large Language Models
par: Chen, Mengzhao, et autres
Publié: (2024)
par: Chen, Mengzhao, et autres
Publié: (2024)
SAMRefiner: Taming Segment Anything Model for Universal Mask Refinement
par: Lin, Yuqi, et autres
Publié: (2025)
par: Lin, Yuqi, et autres
Publié: (2025)
OmniQuant: Omnidirectionally Calibrated Quantization for Large Language Models
par: Shao, Wenqi, et autres
Publié: (2023)
par: Shao, Wenqi, et autres
Publié: (2023)
MINT-CoT: Enabling Interleaved Visual Tokens in Mathematical Chain-of-Thought Reasoning
par: Chen, Xinyan, et autres
Publié: (2025)
par: Chen, Xinyan, et autres
Publié: (2025)
PyVision: Agentic Vision with Dynamic Tooling
par: Zhao, Shitian, et autres
Publié: (2025)
par: Zhao, Shitian, et autres
Publié: (2025)
IMAGINE-E: Image Generation Intelligence Evaluation of State-of-the-art Text-to-Image Models
par: Lei, Jiayi, et autres
Publié: (2025)
par: Lei, Jiayi, et autres
Publié: (2025)
MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?
par: Zhang, Renrui, et autres
Publié: (2024)
par: Zhang, Renrui, et autres
Publié: (2024)
ZipVL: Efficient Large Vision-Language Models with Dynamic Token Sparsification
par: He, Yefei, et autres
Publié: (2024)
par: He, Yefei, et autres
Publié: (2024)
OmniMedVQA: A New Large-Scale Comprehensive Evaluation Benchmark for Medical LVLM
par: Hu, Yutao, et autres
Publié: (2024)
par: Hu, Yutao, et autres
Publié: (2024)
Efficient High-Resolution Visual Representation Learning with State Space Model for Human Pose Estimation
par: Zhang, Hao, et autres
Publié: (2024)
par: Zhang, Hao, et autres
Publié: (2024)
Position: Towards Implicit Prompt For Text-To-Image Models
par: Yang, Yue, et autres
Publié: (2024)
par: Yang, Yue, et autres
Publié: (2024)
DiffAgent: Fast and Accurate Text-to-Image API Selection with Large Language Model
par: Zhao, Lirui, et autres
Publié: (2024)
par: Zhao, Lirui, et autres
Publié: (2024)
Open-Vocabulary Animal Keypoint Detection with Semantic-feature Matching
par: Zhang, Hao, et autres
Publié: (2023)
par: Zhang, Hao, et autres
Publié: (2023)
Draw-and-Understand: Leveraging Visual Prompts to Enable MLLMs to Comprehend What You Want
par: Lin, Weifeng, et autres
Publié: (2024)
par: Lin, Weifeng, et autres
Publié: (2024)
Perceive Anything: Recognize, Explain, Caption, and Segment Anything in Images and Videos
par: Lin, Weifeng, et autres
Publié: (2025)
par: Lin, Weifeng, et autres
Publié: (2025)
B-AVIBench: Towards Evaluating the Robustness of Large Vision-Language Model on Black-box Adversarial Visual-Instructions
par: Zhang, Hao, et autres
Publié: (2024)
par: Zhang, Hao, et autres
Publié: (2024)
Diffree: Text-Guided Shape Free Object Inpainting with Diffusion Model
par: Zhao, Lirui, et autres
Publié: (2024)
par: Zhao, Lirui, et autres
Publié: (2024)
Analyzing and Boosting the Power of Fine-Grained Visual Recognition for Multi-modal Large Language Models
par: He, Hulingxiao, et autres
Publié: (2025)
par: He, Hulingxiao, et autres
Publié: (2025)
MMT-Bench: A Comprehensive Multimodal Benchmark for Evaluating Large Vision-Language Models Towards Multitask AGI
par: Ying, Kaining, et autres
Publié: (2024)
par: Ying, Kaining, et autres
Publié: (2024)
MLLMs-Augmented Visual-Language Representation Learning
par: Liu, Yanqing, et autres
Publié: (2023)
par: Liu, Yanqing, et autres
Publié: (2023)
TerDiT: Ternary Diffusion Models with Transformers
par: Lu, Xudong, et autres
Publié: (2024)
par: Lu, Xudong, et autres
Publié: (2024)
Fine-R1: Make Multi-modal LLMs Excel in Fine-Grained Visual Recognition by Chain-of-Thought Reasoning
par: He, Hulingxiao, et autres
Publié: (2026)
par: He, Hulingxiao, et autres
Publié: (2026)
Dynamic Multimodal Evaluation with Flexible Complexity by Vision-Language Bootstrapping
par: Yang, Yue, et autres
Publié: (2024)
par: Yang, Yue, et autres
Publié: (2024)
MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning
par: Meng, Fanqing, et autres
Publié: (2025)
par: Meng, Fanqing, et autres
Publié: (2025)
Data Adaptive Traceback for Vision-Language Foundation Models in Image Classification
par: Peng, Wenshuo, et autres
Publié: (2024)
par: Peng, Wenshuo, et autres
Publié: (2024)
Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum
par: Ning, Shan, et autres
Publié: (2026)
par: Ning, Shan, et autres
Publié: (2026)
TIR-Bench: A Comprehensive Benchmark for Agentic Thinking-with-Images Reasoning
par: Li, Ming, et autres
Publié: (2025)
par: Li, Ming, et autres
Publié: (2025)
DSVM-UNet : Enhancing VM-UNet with Dual Self-distillation for Medical Image Segmentation
par: Shao, Renrong, et autres
Publié: (2026)
par: Shao, Renrong, et autres
Publié: (2026)
Documents similaires
-
PixWizard: Versatile Image-to-Image Visual Assistant with Open-Language Instructions
par: Lin, Weifeng, et autres
Publié: (2024) -
Unleashing the Potentials of Likelihood Composition for Multi-modal Language Models
par: Zhao, Shitian, et autres
Publié: (2024) -
Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers
par: Gao, Peng, et autres
Publié: (2024) -
CLIP-Adapter: Better Vision-Language Models with Feature Adapters
par: Gao, Peng, et autres
Publié: (2021) -
Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining
par: Liu, Dongyang, et autres
Publié: (2024)