FlipVQA: Scaling Multi-modal Instruction Tuning via Textbook-to-Knowledge Synthesis
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wong, Zhen Hao, Deng, Jingwen, Wang, Yuzhao, Yu, Wenkai, Huang, Jihao, He, Runming, Shen, Chengyu, Liang, Hao, Zhang, Wentao |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LogicPuzzleRL: Cultivating Robust Mathematical Reasoning in LLMs via Reinforcement Learning
par: Wong, Zhen Hao, et autres
Publié: (2025)
par: Wong, Zhen Hao, et autres
Publié: (2025)
Learning What Reinforcement Learning Can't: Interleaved Online Fine-Tuning for Hardest Questions
par: Ma, Lu, et autres
Publié: (2025)
par: Ma, Lu, et autres
Publié: (2025)
One-Eval: An Agentic System for Automated and Traceable LLM Evaluation
par: Shen, Chengyu, et autres
Publié: (2026)
par: Shen, Chengyu, et autres
Publié: (2026)
Let's Verify Math Questions Step by Step
par: Shen, Chengyu, et autres
Publié: (2025)
par: Shen, Chengyu, et autres
Publié: (2025)
Performance Analysis of Traditional VQA Models Under Limited Computational Resources
par: Gu, Jihao
Publié: (2025)
par: Gu, Jihao
Publié: (2025)
Multi-modal Instruction Tuned LLMs with Fine-grained Visual Perception
par: He, Junwen, et autres
Publié: (2024)
par: He, Junwen, et autres
Publié: (2024)
Facilitating Multi-turn Function Calling for LLMs via Compositional Instruction Tuning
par: Chen, Mingyang, et autres
Publié: (2024)
par: Chen, Mingyang, et autres
Publié: (2024)
Gradual Learning: Optimizing Fine-Tuning with Partially Mastered Knowledge in Large Language Models
par: Li, Bozhou, et autres
Publié: (2024)
par: Li, Bozhou, et autres
Publié: (2024)
BloomVQA: Assessing Hierarchical Multi-modal Comprehension
par: Gong, Yunye, et autres
Publié: (2023)
par: Gong, Yunye, et autres
Publié: (2023)
Progressive Multi-modal Conditional Prompt Tuning
par: Qiu, Xiaoyu, et autres
Publié: (2024)
par: Qiu, Xiaoyu, et autres
Publié: (2024)
K12-KGraph: A Curriculum-Aligned Knowledge Graph for Benchmarking and Training Educational LLMs
par: Liang, Hao, et autres
Publié: (2026)
par: Liang, Hao, et autres
Publié: (2026)
Federated Data-Efficient Instruction Tuning for Large Language Models
par: Qin, Zhen, et autres
Publié: (2024)
par: Qin, Zhen, et autres
Publié: (2024)
Knowledge Condensation and Reasoning for Knowledge-based VQA
par: Hao, Dongze, et autres
Publié: (2024)
par: Hao, Dongze, et autres
Publié: (2024)
DARO: Difficulty-Aware Reweighting Policy Optimization
par: Zhou, Jingyu, et autres
Publié: (2025)
par: Zhou, Jingyu, et autres
Publié: (2025)
PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering
par: Zhang, Xiaoman, et autres
Publié: (2023)
par: Zhang, Xiaoman, et autres
Publié: (2023)
ANDES: Agent Native Data Evolving Synthesis Tool for Autonomous Instruction Alignment
par: Zhao, Zhengyang, et autres
Publié: (2026)
par: Zhao, Zhengyang, et autres
Publié: (2026)
TextSquare: Scaling up Text-Centric Visual Instruction Tuning
par: Tang, Jingqun, et autres
Publié: (2024)
par: Tang, Jingqun, et autres
Publié: (2024)
UNK-VQA: A Dataset and a Probe into the Abstention Ability of Multi-modal Large Models
par: Guo, Yangyang, et autres
Publié: (2023)
par: Guo, Yangyang, et autres
Publié: (2023)
DataFlow: An LLM-Driven Framework for Unified Data Preparation and Workflow Automation in the Era of Data-Centric AI
par: Liang, Hao, et autres
Publié: (2025)
par: Liang, Hao, et autres
Publié: (2025)
OmniBooth: Learning Latent Control for Image Synthesis with Multi-modal Instruction
par: Li, Leheng, et autres
Publié: (2024)
par: Li, Leheng, et autres
Publié: (2024)
Facial Affective Behavior Analysis with Instruction Tuning
par: Li, Yifan, et autres
Publié: (2024)
par: Li, Yifan, et autres
Publié: (2024)
Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models
par: Shi, Wentao, et autres
Publié: (2025)
par: Shi, Wentao, et autres
Publié: (2025)
Why Not Use Your Textbook? Knowledge-Enhanced Procedure Planning of Instructional Videos
par: Nagasinghe, Kumaranage Ravindu Yasas, et autres
Publié: (2024)
par: Nagasinghe, Kumaranage Ravindu Yasas, et autres
Publié: (2024)
3DMIT: 3D Multi-modal Instruction Tuning for Scene Understanding
par: Li, Zeju, et autres
Publié: (2024)
par: Li, Zeju, et autres
Publié: (2024)
LoCa: Logit Calibration for Knowledge Distillation
par: Yang, Runming, et autres
Publié: (2024)
par: Yang, Runming, et autres
Publié: (2024)
Large deviations principle for the cubic NLS equation with slowly decaying data
par: Liang, Rui, et autres
Publié: (2025)
par: Liang, Rui, et autres
Publié: (2025)
Gibbs dynamics for fractional nonlinear Schrödinger equations with weak dispersion
par: Liang, Rui, et autres
Publié: (2023)
par: Liang, Rui, et autres
Publié: (2023)
Flipping the Classroom for Information Literacy Instruction: Considerations towards Personalisation and Collaborative Learning
par: Jing Shen
Publié: (2018)
par: Jing Shen
Publié: (2018)
Low-Resource Fine-Tuning for Multi-Task Structured Information Extraction with a Billion-Parameter Instruction-Tuned Model
par: Chih, Yu Cheng, et autres
Publié: (2025)
par: Chih, Yu Cheng, et autres
Publié: (2025)
CYCLE-INSTRUCT: Fully Seed-Free Instruction Tuning via Dual Self-Training and Cycle Consistency
par: Shen, Zhanming, et autres
Publié: (2025)
par: Shen, Zhanming, et autres
Publié: (2025)
Building Accurate Translation-Tailored LLMs with Language Aware Instruction Tuning
par: Zan, Changtong, et autres
Publié: (2024)
par: Zan, Changtong, et autres
Publié: (2024)
AgenticRAGTracer: A Hop-Aware Benchmark for Diagnosing Multi-Step Retrieval Reasoning in Agentic RAG
par: You, Qijie, et autres
Publié: (2026)
par: You, Qijie, et autres
Publié: (2026)
Rethinking Kullback-Leibler Divergence in Knowledge Distillation for Large Language Models
par: Wu, Taiqiang, et autres
Publié: (2024)
par: Wu, Taiqiang, et autres
Publié: (2024)
Multi-modal Preference Alignment Remedies Degradation of Visual Instruction Tuning on Language Models
par: Li, Shengzhi, et autres
Publié: (2024)
par: Li, Shengzhi, et autres
Publié: (2024)
The Best Instruction-Tuning Data are Those That Fit
par: Zhang, Dylan, et autres
Publié: (2025)
par: Zhang, Dylan, et autres
Publié: (2025)
Automating Skill Acquisition through Large-Scale Mining of Open-Source Agentic Repositories: A Framework for Multi-Agent Procedural Knowledge Extraction
par: Bi, Shuzhen, et autres
Publié: (2026)
par: Bi, Shuzhen, et autres
Publié: (2026)
Guidelines for the Review and Selection of Textbooks and Instructional Materials.
Publié: (1976)
Publié: (1976)
Prism: A Plug-in Reproducible Infrastructure for Scalable Multimodal Continual Instruction Tuning
par: Tang, Jun-Tao, et autres
Publié: (2026)
par: Tang, Jun-Tao, et autres
Publié: (2026)
CRAM: Centroid-Routing and Adaptive MoE for Multimodal Continual Instruction Tuning
par: Tang, Jun-Tao, et autres
Publié: (2026)
par: Tang, Jun-Tao, et autres
Publié: (2026)
PhotoFramer: Multi-modal Image Composition Instruction
par: You, Zhiyuan, et autres
Publié: (2025)
par: You, Zhiyuan, et autres
Publié: (2025)
Documents similaires
-
LogicPuzzleRL: Cultivating Robust Mathematical Reasoning in LLMs via Reinforcement Learning
par: Wong, Zhen Hao, et autres
Publié: (2025) -
Learning What Reinforcement Learning Can't: Interleaved Online Fine-Tuning for Hardest Questions
par: Ma, Lu, et autres
Publié: (2025) -
One-Eval: An Agentic System for Automated and Traceable LLM Evaluation
par: Shen, Chengyu, et autres
Publié: (2026) -
Let's Verify Math Questions Step by Step
par: Shen, Chengyu, et autres
Publié: (2025) -
Performance Analysis of Traditional VQA Models Under Limited Computational Resources
par: Gu, Jihao
Publié: (2025)