MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale
Fuente:
arXiv
Salvato in:
| Autori principali: | Guo, Jarvis, Zheng, Tuney, Bai, Yuelin, Li, Bo, Wang, Yubo, Zhu, King, Li, Yizhi, Neubig, Graham, Chen, Wenhu, Yue, Xiang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MAmmoTH2: Scaling Instructions from the Web
di: Yue, Xiang, et al.
Pubblicazione: (2024)
di: Yue, Xiang, et al.
Pubblicazione: (2024)
Critique Fine-Tuning: Learning to Critique is More Effective than Learning to Imitate
di: Wang, Yubo, et al.
Pubblicazione: (2025)
di: Wang, Yubo, et al.
Pubblicazione: (2025)
VisualWebInstruct: Scaling up Multimodal Instruction Data through Web Search
di: Jia, Yiming, et al.
Pubblicazione: (2025)
di: Jia, Yiming, et al.
Pubblicazione: (2025)
Does Math Reasoning Improve General LLM Capabilities? Understanding Transferability of LLM Reasoning
di: Huan, Maggie, et al.
Pubblicazione: (2025)
di: Huan, Maggie, et al.
Pubblicazione: (2025)
On the Interplay of Pre-Training, Mid-Training, and RL on Reasoning Language Models
di: Zhang, Charlie, et al.
Pubblicazione: (2025)
di: Zhang, Charlie, et al.
Pubblicazione: (2025)
VisualPuzzles: Decoupling Multimodal Reasoning Evaluation from Domain Knowledge
di: Song, Yueqi, et al.
Pubblicazione: (2025)
di: Song, Yueqi, et al.
Pubblicazione: (2025)
S1-VL: Scientific Multimodal Reasoning Model with Thinking-with-Images
di: Li, Qingxiao, et al.
Pubblicazione: (2026)
di: Li, Qingxiao, et al.
Pubblicazione: (2026)
MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark
di: Yue, Xiang, et al.
Pubblicazione: (2024)
di: Yue, Xiang, et al.
Pubblicazione: (2024)
An Incomplete Loop: Instruction Inference, Instruction Following, and In-context Learning in Language Models
di: Liu, Emmy, et al.
Pubblicazione: (2024)
di: Liu, Emmy, et al.
Pubblicazione: (2024)
Demystifying Long Chain-of-Thought Reasoning in LLMs
di: Yeo, Edward, et al.
Pubblicazione: (2025)
di: Yeo, Edward, et al.
Pubblicazione: (2025)
Unleashing the Reasoning Potential of Pre-trained LLMs by Critique Fine-Tuning on One Problem
di: Wang, Yubo, et al.
Pubblicazione: (2025)
di: Wang, Yubo, et al.
Pubblicazione: (2025)
Teach Multimodal LLMs to Comprehend Electrocardiographic Images
di: Liu, Ruoqi, et al.
Pubblicazione: (2024)
di: Liu, Ruoqi, et al.
Pubblicazione: (2024)
Harnessing Webpage UIs for Text-Rich Visual Understanding
di: Liu, Junpeng, et al.
Pubblicazione: (2024)
di: Liu, Junpeng, et al.
Pubblicazione: (2024)
What Is Missing in Multilingual Visual Reasoning and How to Fix It
di: Song, Yueqi, et al.
Pubblicazione: (2024)
di: Song, Yueqi, et al.
Pubblicazione: (2024)
VL-Cogito: Progressive Curriculum Reinforcement Learning for Advanced Multimodal Reasoning
di: Yuan, Ruifeng, et al.
Pubblicazione: (2025)
di: Yuan, Ruifeng, et al.
Pubblicazione: (2025)
Scaling Evaluation-time Compute with Reasoning Models as Evaluators
di: Kim, Seungone, et al.
Pubblicazione: (2025)
di: Kim, Seungone, et al.
Pubblicazione: (2025)
Fleming-VL: Towards Universal Medical Visual Reasoning with Multimodal LLMs
di: Shu, Yan, et al.
Pubblicazione: (2025)
di: Shu, Yan, et al.
Pubblicazione: (2025)
MathCoder-VL: Bridging Vision and Code for Enhanced Multimodal Mathematical Reasoning
di: Wang, Ke, et al.
Pubblicazione: (2025)
di: Wang, Ke, et al.
Pubblicazione: (2025)
VisualWebBench: How Far Have Multimodal LLMs Evolved in Web Page Understanding and Grounding?
di: Liu, Junpeng, et al.
Pubblicazione: (2024)
di: Liu, Junpeng, et al.
Pubblicazione: (2024)
Latent Sketchpad: Sketching Visual Thoughts to Elicit Multimodal Reasoning in MLLMs
di: Zhang, Huanyu, et al.
Pubblicazione: (2025)
di: Zhang, Huanyu, et al.
Pubblicazione: (2025)
ZINA: Multimodal Fine-grained Hallucination Detection and Editing
di: Wada, Yuiga, et al.
Pubblicazione: (2025)
di: Wada, Yuiga, et al.
Pubblicazione: (2025)
MANTIS: Interleaved Multi-Image Instruction Tuning
di: Jiang, Dongfu, et al.
Pubblicazione: (2024)
di: Jiang, Dongfu, et al.
Pubblicazione: (2024)
Prompt-MII: Meta-Learning Instruction Induction for LLMs
di: Xiao, Emily, et al.
Pubblicazione: (2025)
di: Xiao, Emily, et al.
Pubblicazione: (2025)
Coding Agents with Multimodal Browsing are Generalist Problem Solvers
di: Soni, Aditya Bharat, et al.
Pubblicazione: (2025)
di: Soni, Aditya Bharat, et al.
Pubblicazione: (2025)
Enhancing Multimodal Continual Instruction Tuning with BranchLoRA
di: Zhang, Duzhen, et al.
Pubblicazione: (2025)
di: Zhang, Duzhen, et al.
Pubblicazione: (2025)
Qwen3-VL-Embedding and Qwen3-VL-Reranker: A Unified Framework for State-of-the-Art Multimodal Retrieval and Ranking
di: Li, Mingxin, et al.
Pubblicazione: (2026)
di: Li, Mingxin, et al.
Pubblicazione: (2026)
Overtrained Language Models Are Harder to Fine-Tune
di: Springer, Jacob Mitchell, et al.
Pubblicazione: (2025)
di: Springer, Jacob Mitchell, et al.
Pubblicazione: (2025)
CoMMIT: Coordinated Multimodal Instruction Tuning
di: Li, Xintong, et al.
Pubblicazione: (2024)
di: Li, Xintong, et al.
Pubblicazione: (2024)
JMMMU: A Japanese Massive Multi-discipline Multimodal Understanding Benchmark for Culture-aware Evaluation
di: Onohara, Shota, et al.
Pubblicazione: (2024)
di: Onohara, Shota, et al.
Pubblicazione: (2024)
MathScale: Scaling Instruction Tuning for Mathematical Reasoning
di: Tang, Zhengyang, et al.
Pubblicazione: (2024)
di: Tang, Zhengyang, et al.
Pubblicazione: (2024)
Instruction Tuning-free Visual Token Complement for Multimodal LLMs
di: Wang, Dongsheng, et al.
Pubblicazione: (2024)
di: Wang, Dongsheng, et al.
Pubblicazione: (2024)
Go-Browse: Training Web Agents with Structured Exploration
di: Gandhi, Apurva, et al.
Pubblicazione: (2025)
di: Gandhi, Apurva, et al.
Pubblicazione: (2025)
BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models
di: Tjuatja, Lindia, et al.
Pubblicazione: (2025)
di: Tjuatja, Lindia, et al.
Pubblicazione: (2025)
EVIT: Event-Oriented Instruction Tuning for Event Reasoning
di: Tao, Zhengwei, et al.
Pubblicazione: (2024)
di: Tao, Zhengwei, et al.
Pubblicazione: (2024)
GMAI-VL-R1: Harnessing Reinforcement Learning for Multimodal Medical Reasoning
di: Su, Yanzhou, et al.
Pubblicazione: (2025)
di: Su, Yanzhou, et al.
Pubblicazione: (2025)
Augmenting Black-box LLMs with Medical Textbooks for Biomedical Question Answering
di: Wang, Yubo, et al.
Pubblicazione: (2023)
di: Wang, Yubo, et al.
Pubblicazione: (2023)
LinguaLIFT: An Effective Two-stage Instruction Tuning Framework for Low-Resource Language Reasoning
di: Zhang, Hongbin, et al.
Pubblicazione: (2024)
di: Zhang, Hongbin, et al.
Pubblicazione: (2024)
Skywork-VL Reward: An Effective Reward Model for Multimodal Understanding and Reasoning
di: Wang, Xiaokun, et al.
Pubblicazione: (2025)
di: Wang, Xiaokun, et al.
Pubblicazione: (2025)
VL-Trojan: Multimodal Instruction Backdoor Attacks against Autoregressive Visual Language Models
di: Liang, Jiawei, et al.
Pubblicazione: (2024)
di: Liang, Jiawei, et al.
Pubblicazione: (2024)
Eliciting Thinking Hierarchy without a Prior
di: Kong, Yuqing, et al.
Pubblicazione: (2021)
di: Kong, Yuqing, et al.
Pubblicazione: (2021)
Documenti analoghi
-
MAmmoTH2: Scaling Instructions from the Web
di: Yue, Xiang, et al.
Pubblicazione: (2024) -
Critique Fine-Tuning: Learning to Critique is More Effective than Learning to Imitate
di: Wang, Yubo, et al.
Pubblicazione: (2025) -
VisualWebInstruct: Scaling up Multimodal Instruction Data through Web Search
di: Jia, Yiming, et al.
Pubblicazione: (2025) -
Does Math Reasoning Improve General LLM Capabilities? Understanding Transferability of LLM Reasoning
di: Huan, Maggie, et al.
Pubblicazione: (2025) -
On the Interplay of Pre-Training, Mid-Training, and RL on Reasoning Language Models
di: Zhang, Charlie, et al.
Pubblicazione: (2025)