ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Chen, Guiming Hardy, Chen, Shunian, Zhang, Ruifei, Chen, Junying, Wu, Xiangbo, Zhang, Zhiyi, Chen, Zhihong, Li, Jianquan, Wan, Xiang, Wang, Benyou |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale
by: Chen, Junying, et al.
Published: (2024)
by: Chen, Junying, et al.
Published: (2024)
MileBench: Benchmarking MLLMs in Long Context
by: Song, Dingjie, et al.
Published: (2024)
by: Song, Dingjie, et al.
Published: (2024)
Humans or LLMs as the Judge? A Study on Judgement Biases
by: Chen, Guiming Hardy, et al.
Published: (2024)
by: Chen, Guiming Hardy, et al.
Published: (2024)
MLLM-Bench: Evaluating Multimodal LLMs with Per-sample Criteria
by: Ge, Wentao, et al.
Published: (2023)
by: Ge, Wentao, et al.
Published: (2023)
CMB: A Comprehensive Medical Benchmark in Chinese
by: Wang, Xidong, et al.
Published: (2023)
by: Wang, Xidong, et al.
Published: (2023)
ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation
by: Chen, Junying, et al.
Published: (2025)
by: Chen, Junying, et al.
Published: (2025)
HuatuoGPT-II, One-stage Training for Medical Adaption of LLMs
by: Chen, Junying, et al.
Published: (2023)
by: Chen, Junying, et al.
Published: (2023)
AceGPT, Localizing Large Language Models in Arabic
by: Huang, Huang, et al.
Published: (2023)
by: Huang, Huang, et al.
Published: (2023)
Online Training of Large Language Models: Learn while chatting
by: Liang, Juhao, et al.
Published: (2024)
by: Liang, Juhao, et al.
Published: (2024)
Large Multimodal Agents: A Survey
by: Xie, Junlin, et al.
Published: (2024)
by: Xie, Junlin, et al.
Published: (2024)
MedGen: Unlocking Medical Video Generation by Scaling Granularly-annotated Medical Videos
by: Wang, Rongsheng, et al.
Published: (2025)
by: Wang, Rongsheng, et al.
Published: (2025)
LongLLaVA: Scaling Multi-modal LLMs to 1000 Images Efficiently via a Hybrid Architecture
by: Wang, Xidong, et al.
Published: (2024)
by: Wang, Xidong, et al.
Published: (2024)
Harnessing the Power of Local Representations for Few-Shot Classification
by: Tang, Shi, et al.
Published: (2024)
by: Tang, Shi, et al.
Published: (2024)
A Comprehensive Analysis for Visual Object Hallucination in Large Vision-Language Models
by: Jing, Liqiang, et al.
Published: (2025)
by: Jing, Liqiang, et al.
Published: (2025)
Both Text and Images Leaked! A Systematic Analysis of Data Contamination in Multimodal LLM
by: Song, Dingjie, et al.
Published: (2024)
by: Song, Dingjie, et al.
Published: (2024)
From Lossy to Verified: A Provenance-Aware Tiered Memory for Agents
by: Zhu, Qiming, et al.
Published: (2026)
by: Zhu, Qiming, et al.
Published: (2026)
LLMs Could Autonomously Learn Without External Supervision
by: Ji, Ke, et al.
Published: (2024)
by: Ji, Ke, et al.
Published: (2024)
VLFeedback: A Large-Scale AI Feedback Dataset for Large Vision-Language Models Alignment
by: Li, Lei, et al.
Published: (2024)
by: Li, Lei, et al.
Published: (2024)
AdaDrive: Self-Adaptive Slow-Fast System for Language-Grounded Autonomous Driving
by: Zhang, Ruifei, et al.
Published: (2025)
by: Zhang, Ruifei, et al.
Published: (2025)
VLDrive: Vision-Augmented Lightweight MLLMs for Efficient Language-grounded Autonomous Driving
by: Zhang, Ruifei, et al.
Published: (2025)
by: Zhang, Ruifei, et al.
Published: (2025)
CoD, Towards an Interpretable Medical Agent using Chain of Diagnosis
by: Chen, Junying, et al.
Published: (2024)
by: Chen, Junying, et al.
Published: (2024)
Less is More: A Simple yet Effective Token Reduction Method for Efficient Multi-modal LLMs
by: Song, Dingjie, et al.
Published: (2024)
by: Song, Dingjie, et al.
Published: (2024)
EvA: An Evidence-First Audio Understanding Paradigm for LALMs
by: Xie, Xinyuan, et al.
Published: (2026)
by: Xie, Xinyuan, et al.
Published: (2026)
ALLaM: Large Language Models for Arabic and English
by: Bari, M Saiful, et al.
Published: (2024)
by: Bari, M Saiful, et al.
Published: (2024)
HuatuoGPT-o1, Towards Medical Complex Reasoning with LLMs
by: Chen, Junying, et al.
Published: (2024)
by: Chen, Junying, et al.
Published: (2024)
Speech-Omni-Lite: Portable Speech Interfaces for Vision-Language Models
by: Tao, Dehua, et al.
Published: (2026)
by: Tao, Dehua, et al.
Published: (2026)
RAG-Instruct: Boosting LLMs with Diverse Retrieval-Augmented Instructions
by: Liu, Wanlong, et al.
Published: (2024)
by: Liu, Wanlong, et al.
Published: (2024)
FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion
by: Chen, Shunian, et al.
Published: (2025)
by: Chen, Shunian, et al.
Published: (2025)
ShizhenGPT: Towards Multimodal LLMs for Traditional Chinese Medicine
by: Chen, Junying, et al.
Published: (2025)
by: Chen, Junying, et al.
Published: (2025)
TalkVid: A Large-Scale Diversified Dataset for Audio-Driven Talking Head Synthesis
by: Chen, Shunian, et al.
Published: (2025)
by: Chen, Shunian, et al.
Published: (2025)
AME: Aligned Manifold Entropy for Robust Vision-Language Distillation
by: Cao, Guiming, et al.
Published: (2025)
by: Cao, Guiming, et al.
Published: (2025)
GPT4SGG: Synthesizing Scene Graphs from Holistic and Region-specific Narratives
by: Chen, Zuyao, et al.
Published: (2023)
by: Chen, Zuyao, et al.
Published: (2023)
BlenderLLM: Training Large Language Models for Computer-Aided Design with Self-improvement
by: Du, Yuhao, et al.
Published: (2024)
by: Du, Yuhao, et al.
Published: (2024)
LiteGPT: Large Vision-Language Model for Joint Chest X-ray Localization and Classification Task
by: Le-Duc, Khai, et al.
Published: (2024)
by: Le-Duc, Khai, et al.
Published: (2024)
Apollo: A Lightweight Multilingual Medical LLM towards Democratizing Medical AI to 6B People
by: Wang, Xidong, et al.
Published: (2024)
by: Wang, Xidong, et al.
Published: (2024)
DentalGPT: Incentivizing Multimodal Complex Reasoning in Dentistry
by: Cai, Zhenyang, et al.
Published: (2025)
by: Cai, Zhenyang, et al.
Published: (2025)
From Large to Small: Transferring CUDA Optimization Expertise via Reasoning Graph
by: Gong, Junfeng, et al.
Published: (2025)
by: Gong, Junfeng, et al.
Published: (2025)
Methodological Considerations on the Association Between FIB ‐4 and Malignancy Risk
by: Jiawei Zhang, et al.
Published: (2025)
by: Jiawei Zhang, et al.
Published: (2025)
Exploring Compositional Generalization of Multimodal LLMs for Medical Imaging
by: Cai, Zhenyang, et al.
Published: (2024)
by: Cai, Zhenyang, et al.
Published: (2024)
PlanGPT-VL: Enhancing Urban Planning with Domain-Specific Vision-Language Models
by: Zhu, He, et al.
Published: (2025)
by: Zhu, He, et al.
Published: (2025)
Similar Items
-
HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale
by: Chen, Junying, et al.
Published: (2024) -
MileBench: Benchmarking MLLMs in Long Context
by: Song, Dingjie, et al.
Published: (2024) -
Humans or LLMs as the Judge? A Study on Judgement Biases
by: Chen, Guiming Hardy, et al.
Published: (2024) -
MLLM-Bench: Evaluating Multimodal LLMs with Per-sample Criteria
by: Ge, Wentao, et al.
Published: (2023) -
CMB: A Comprehensive Medical Benchmark in Chinese
by: Wang, Xidong, et al.
Published: (2023)