ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Guiming Hardy, Chen, Shunian, Zhang, Ruifei, Chen, Junying, Wu, Xiangbo, Zhang, Zhiyi, Chen, Zhihong, Li, Jianquan, Wan, Xiang, Wang, Benyou |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale
par: Chen, Junying, et autres
Publié: (2024)
par: Chen, Junying, et autres
Publié: (2024)
MileBench: Benchmarking MLLMs in Long Context
par: Song, Dingjie, et autres
Publié: (2024)
par: Song, Dingjie, et autres
Publié: (2024)
Humans or LLMs as the Judge? A Study on Judgement Biases
par: Chen, Guiming Hardy, et autres
Publié: (2024)
par: Chen, Guiming Hardy, et autres
Publié: (2024)
MLLM-Bench: Evaluating Multimodal LLMs with Per-sample Criteria
par: Ge, Wentao, et autres
Publié: (2023)
par: Ge, Wentao, et autres
Publié: (2023)
CMB: A Comprehensive Medical Benchmark in Chinese
par: Wang, Xidong, et autres
Publié: (2023)
par: Wang, Xidong, et autres
Publié: (2023)
ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation
par: Chen, Junying, et autres
Publié: (2025)
par: Chen, Junying, et autres
Publié: (2025)
HuatuoGPT-II, One-stage Training for Medical Adaption of LLMs
par: Chen, Junying, et autres
Publié: (2023)
par: Chen, Junying, et autres
Publié: (2023)
AceGPT, Localizing Large Language Models in Arabic
par: Huang, Huang, et autres
Publié: (2023)
par: Huang, Huang, et autres
Publié: (2023)
Online Training of Large Language Models: Learn while chatting
par: Liang, Juhao, et autres
Publié: (2024)
par: Liang, Juhao, et autres
Publié: (2024)
Large Multimodal Agents: A Survey
par: Xie, Junlin, et autres
Publié: (2024)
par: Xie, Junlin, et autres
Publié: (2024)
MedGen: Unlocking Medical Video Generation by Scaling Granularly-annotated Medical Videos
par: Wang, Rongsheng, et autres
Publié: (2025)
par: Wang, Rongsheng, et autres
Publié: (2025)
LongLLaVA: Scaling Multi-modal LLMs to 1000 Images Efficiently via a Hybrid Architecture
par: Wang, Xidong, et autres
Publié: (2024)
par: Wang, Xidong, et autres
Publié: (2024)
Harnessing the Power of Local Representations for Few-Shot Classification
par: Tang, Shi, et autres
Publié: (2024)
par: Tang, Shi, et autres
Publié: (2024)
A Comprehensive Analysis for Visual Object Hallucination in Large Vision-Language Models
par: Jing, Liqiang, et autres
Publié: (2025)
par: Jing, Liqiang, et autres
Publié: (2025)
Both Text and Images Leaked! A Systematic Analysis of Data Contamination in Multimodal LLM
par: Song, Dingjie, et autres
Publié: (2024)
par: Song, Dingjie, et autres
Publié: (2024)
From Lossy to Verified: A Provenance-Aware Tiered Memory for Agents
par: Zhu, Qiming, et autres
Publié: (2026)
par: Zhu, Qiming, et autres
Publié: (2026)
LLMs Could Autonomously Learn Without External Supervision
par: Ji, Ke, et autres
Publié: (2024)
par: Ji, Ke, et autres
Publié: (2024)
VLFeedback: A Large-Scale AI Feedback Dataset for Large Vision-Language Models Alignment
par: Li, Lei, et autres
Publié: (2024)
par: Li, Lei, et autres
Publié: (2024)
AdaDrive: Self-Adaptive Slow-Fast System for Language-Grounded Autonomous Driving
par: Zhang, Ruifei, et autres
Publié: (2025)
par: Zhang, Ruifei, et autres
Publié: (2025)
VLDrive: Vision-Augmented Lightweight MLLMs for Efficient Language-grounded Autonomous Driving
par: Zhang, Ruifei, et autres
Publié: (2025)
par: Zhang, Ruifei, et autres
Publié: (2025)
CoD, Towards an Interpretable Medical Agent using Chain of Diagnosis
par: Chen, Junying, et autres
Publié: (2024)
par: Chen, Junying, et autres
Publié: (2024)
Less is More: A Simple yet Effective Token Reduction Method for Efficient Multi-modal LLMs
par: Song, Dingjie, et autres
Publié: (2024)
par: Song, Dingjie, et autres
Publié: (2024)
EvA: An Evidence-First Audio Understanding Paradigm for LALMs
par: Xie, Xinyuan, et autres
Publié: (2026)
par: Xie, Xinyuan, et autres
Publié: (2026)
ALLaM: Large Language Models for Arabic and English
par: Bari, M Saiful, et autres
Publié: (2024)
par: Bari, M Saiful, et autres
Publié: (2024)
HuatuoGPT-o1, Towards Medical Complex Reasoning with LLMs
par: Chen, Junying, et autres
Publié: (2024)
par: Chen, Junying, et autres
Publié: (2024)
Speech-Omni-Lite: Portable Speech Interfaces for Vision-Language Models
par: Tao, Dehua, et autres
Publié: (2026)
par: Tao, Dehua, et autres
Publié: (2026)
RAG-Instruct: Boosting LLMs with Diverse Retrieval-Augmented Instructions
par: Liu, Wanlong, et autres
Publié: (2024)
par: Liu, Wanlong, et autres
Publié: (2024)
FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion
par: Chen, Shunian, et autres
Publié: (2025)
par: Chen, Shunian, et autres
Publié: (2025)
ShizhenGPT: Towards Multimodal LLMs for Traditional Chinese Medicine
par: Chen, Junying, et autres
Publié: (2025)
par: Chen, Junying, et autres
Publié: (2025)
TalkVid: A Large-Scale Diversified Dataset for Audio-Driven Talking Head Synthesis
par: Chen, Shunian, et autres
Publié: (2025)
par: Chen, Shunian, et autres
Publié: (2025)
AME: Aligned Manifold Entropy for Robust Vision-Language Distillation
par: Cao, Guiming, et autres
Publié: (2025)
par: Cao, Guiming, et autres
Publié: (2025)
GPT4SGG: Synthesizing Scene Graphs from Holistic and Region-specific Narratives
par: Chen, Zuyao, et autres
Publié: (2023)
par: Chen, Zuyao, et autres
Publié: (2023)
BlenderLLM: Training Large Language Models for Computer-Aided Design with Self-improvement
par: Du, Yuhao, et autres
Publié: (2024)
par: Du, Yuhao, et autres
Publié: (2024)
LiteGPT: Large Vision-Language Model for Joint Chest X-ray Localization and Classification Task
par: Le-Duc, Khai, et autres
Publié: (2024)
par: Le-Duc, Khai, et autres
Publié: (2024)
Apollo: A Lightweight Multilingual Medical LLM towards Democratizing Medical AI to 6B People
par: Wang, Xidong, et autres
Publié: (2024)
par: Wang, Xidong, et autres
Publié: (2024)
DentalGPT: Incentivizing Multimodal Complex Reasoning in Dentistry
par: Cai, Zhenyang, et autres
Publié: (2025)
par: Cai, Zhenyang, et autres
Publié: (2025)
From Large to Small: Transferring CUDA Optimization Expertise via Reasoning Graph
par: Gong, Junfeng, et autres
Publié: (2025)
par: Gong, Junfeng, et autres
Publié: (2025)
Methodological Considerations on the Association Between FIB ‐4 and Malignancy Risk
par: Jiawei Zhang, et autres
Publié: (2025)
par: Jiawei Zhang, et autres
Publié: (2025)
Exploring Compositional Generalization of Multimodal LLMs for Medical Imaging
par: Cai, Zhenyang, et autres
Publié: (2024)
par: Cai, Zhenyang, et autres
Publié: (2024)
PlanGPT-VL: Enhancing Urban Planning with Domain-Specific Vision-Language Models
par: Zhu, He, et autres
Publié: (2025)
par: Zhu, He, et autres
Publié: (2025)
Documents similaires
-
HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale
par: Chen, Junying, et autres
Publié: (2024) -
MileBench: Benchmarking MLLMs in Long Context
par: Song, Dingjie, et autres
Publié: (2024) -
Humans or LLMs as the Judge? A Study on Judgement Biases
par: Chen, Guiming Hardy, et autres
Publié: (2024) -
MLLM-Bench: Evaluating Multimodal LLMs with Per-sample Criteria
par: Ge, Wentao, et autres
Publié: (2023) -
CMB: A Comprehensive Medical Benchmark in Chinese
par: Wang, Xidong, et autres
Publié: (2023)