Math-LLaVA: Bootstrapping Mathematical Reasoning for Multimodal Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Shi, Wenhao, Hu, Zhiqiang, Bin, Yi, Liu, Junhua, Yang, Yang, Ng, See-Kiong, Bing, Lidong, Lee, Roy Ka-Wei |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Multimodal Mathematical Reasoning with Diverse Solving Perspective
par: Shi, Wenhao, et autres
Publié: (2025)
par: Shi, Wenhao, et autres
Publié: (2025)
PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning
par: Xu, Lin, et autres
Publié: (2024)
par: Xu, Lin, et autres
Publié: (2024)
GalleryGPT: Analyzing Paintings with Large Multimodal Models
par: Bin, Yi, et autres
Publié: (2024)
par: Bin, Yi, et autres
Publié: (2024)
LLaVA-Ultra: Large Chinese Language and Vision Assistant for Ultrasound
par: Guo, Xuechen, et autres
Publié: (2024)
par: Guo, Xuechen, et autres
Publié: (2024)
TG-LLaVA: Text Guided LLaVA via Learnable Latent Embeddings
par: Yan, Dawei, et autres
Publié: (2024)
par: Yan, Dawei, et autres
Publié: (2024)
LLaVA-FA: Learning Fourier Approximation for Compressing Large Multimodal Models
par: Zheng, Pengcheng, et autres
Publié: (2026)
par: Zheng, Pengcheng, et autres
Publié: (2026)
LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token
par: Zhang, Shaolei, et autres
Publié: (2025)
par: Zhang, Shaolei, et autres
Publié: (2025)
Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models
par: Zhang, Yi-Fan, et autres
Publié: (2024)
par: Zhang, Yi-Fan, et autres
Publié: (2024)
SQ-LLaVA: Self-Questioning for Large Vision-Language Assistant
par: Sun, Guohao, et autres
Publié: (2024)
par: Sun, Guohao, et autres
Publié: (2024)
Cosmos-LLaVA: Chatting with the Visual Cosmos-LLaVA: Görselle Sohbet Etmek
par: Zeer, Ahmed, et autres
Publié: (2024)
par: Zeer, Ahmed, et autres
Publié: (2024)
Agri-LLaVA: Knowledge-Infused Large Multimodal Assistant on Agricultural Pests and Diseases
par: Wang, Liqiong, et autres
Publié: (2024)
par: Wang, Liqiong, et autres
Publié: (2024)
Geo-LLaVA: A Large Multi-Modal Model for Solving Geometry Math Problems with Meta In-Context Learning
par: Xu, Shihao, et autres
Publié: (2024)
par: Xu, Shihao, et autres
Publié: (2024)
LLaVA-MoD: Making LLaVA Tiny via MoE Knowledge Distillation
par: Shu, Fangxun, et autres
Publié: (2024)
par: Shu, Fangxun, et autres
Publié: (2024)
LLaVA-Critic: Learning to Evaluate Multimodal Models
par: Xiong, Tianyi, et autres
Publié: (2024)
par: Xiong, Tianyi, et autres
Publié: (2024)
MLLM-LLaVA-FL: Multimodal Large Language Model Assisted Federated Learning
par: Zhang, Jianyi, et autres
Publié: (2024)
par: Zhang, Jianyi, et autres
Publié: (2024)
LLaVA-PruMerge: Adaptive Token Reduction for Efficient Large Multimodal Models
par: Shang, Yuzhang, et autres
Publié: (2024)
par: Shang, Yuzhang, et autres
Publié: (2024)
WSI-LLaVA: A Multimodal Large Language Model for Whole Slide Image
par: Liang, Yuci, et autres
Publié: (2024)
par: Liang, Yuci, et autres
Publié: (2024)
Causal-LLaVA: Causal Disentanglement for Mitigating Hallucination in Multimodal Large Language Models
par: Hu, Xinmiao, et autres
Publié: (2025)
par: Hu, Xinmiao, et autres
Publié: (2025)
LLaVAC: Fine-tuning LLaVA as a Multimodal Sentiment Classifier
par: Chay-intr, T., et autres
Publié: (2025)
par: Chay-intr, T., et autres
Publié: (2025)
Amharic LLaMA and LLaVA: Multimodal LLMs for Low Resource Languages
par: Andersland, Michael
Publié: (2024)
par: Andersland, Michael
Publié: (2024)
Purrfessor: A Fine-tuned Multimodal LLaVA Diet Health Chatbot
par: Lu, Linqi, et autres
Publié: (2024)
par: Lu, Linqi, et autres
Publié: (2024)
MoE-LLaVA: Mixture of Experts for Large Vision-Language Models
par: Lin, Bin, et autres
Publié: (2024)
par: Lin, Bin, et autres
Publié: (2024)
AVG-LLaVA: An Efficient Large Multimodal Model with Adaptive Visual Granularity
par: Lan, Zhibin, et autres
Publié: (2024)
par: Lan, Zhibin, et autres
Publié: (2024)
LLaVA-KD: A Framework of Distilling Multimodal Large Language Models
par: Cai, Yuxuan, et autres
Publié: (2024)
par: Cai, Yuxuan, et autres
Publié: (2024)
Video-LLaVA: Learning United Visual Representation by Alignment Before Projection
par: Lin, Bin, et autres
Publié: (2023)
par: Lin, Bin, et autres
Publié: (2023)
ViP-LLaVA: Making Large Multimodal Models Understand Arbitrary Visual Prompts
par: Cai, Mu, et autres
Publié: (2023)
par: Cai, Mu, et autres
Publié: (2023)
LLaVA-Docent: Instruction Tuning with Multimodal Large Language Model to Support Art Appreciation Education
par: Lee, Unggi, et autres
Publié: (2024)
par: Lee, Unggi, et autres
Publié: (2024)
u-LLaVA: Unifying Multi-Modal Tasks via Large Language Model
par: Xu, Jinjin, et autres
Publié: (2023)
par: Xu, Jinjin, et autres
Publié: (2023)
Enhance Image-to-Image Generation with LLaVA-generated Prompts
par: Ding, Zhicheng, et autres
Publié: (2024)
par: Ding, Zhicheng, et autres
Publié: (2024)
Wiki-LLaVA: Hierarchical Retrieval-Augmented Generation for Multimodal LLMs
par: Caffagni, Davide, et autres
Publié: (2024)
par: Caffagni, Davide, et autres
Publié: (2024)
LLaVA-Read: Enhancing Reading Ability of Multimodal Language Models
par: Zhang, Ruiyi, et autres
Publié: (2024)
par: Zhang, Ruiyi, et autres
Publié: (2024)
LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training
par: An, Xiang, et autres
Publié: (2025)
par: An, Xiang, et autres
Publié: (2025)
ReGraP-LLaVA: Reasoning enabled Graph-based Personalized Large Language and Vision Assistant
par: Xiang, Yifan, et autres
Publié: (2025)
par: Xiang, Yifan, et autres
Publié: (2025)
LLaVA-RE: Binary Image-Text Relevancy Evaluation with Multimodal Large Language Model
par: Sun, Tao, et autres
Publié: (2025)
par: Sun, Tao, et autres
Publié: (2025)
INF-LLaVA: Dual-perspective Perception for High-Resolution Multimodal Large Language Model
par: Ma, Yiwei, et autres
Publié: (2024)
par: Ma, Yiwei, et autres
Publié: (2024)
LLaVA-VSD: Large Language-and-Vision Assistant for Visual Spatial Description
par: Jin, Yizhang, et autres
Publié: (2024)
par: Jin, Yizhang, et autres
Publié: (2024)
Power-LLaVA: Large Language and Vision Assistant for Power Transmission Line Inspection
par: Wang, Jiahao, et autres
Publié: (2024)
par: Wang, Jiahao, et autres
Publié: (2024)
LLaVA-LE: Large Language-and-Vision Assistant for Lunar Exploration
par: Inal, Gokce, et autres
Publié: (2026)
par: Inal, Gokce, et autres
Publié: (2026)
X-LLaVA: Optimizing Bilingual Large Vision-Language Alignment
par: Shin, Dongjae, et autres
Publié: (2024)
par: Shin, Dongjae, et autres
Publié: (2024)
Dynamic-LLaVA: Efficient Multimodal Large Language Models via Dynamic Vision-language Context Sparsification
par: Huang, Wenxuan, et autres
Publié: (2024)
par: Huang, Wenxuan, et autres
Publié: (2024)
Documents similaires
-
Multimodal Mathematical Reasoning with Diverse Solving Perspective
par: Shi, Wenhao, et autres
Publié: (2025) -
PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning
par: Xu, Lin, et autres
Publié: (2024) -
GalleryGPT: Analyzing Paintings with Large Multimodal Models
par: Bin, Yi, et autres
Publié: (2024) -
LLaVA-Ultra: Large Chinese Language and Vision Assistant for Ultrasound
par: Guo, Xuechen, et autres
Publié: (2024) -
TG-LLaVA: Text Guided LLaVA via Learnable Latent Embeddings
par: Yan, Dawei, et autres
Publié: (2024)