MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning
Fuente:
arXiv
Salvato in:
| Autori principali: | Gao, Tianhong, Fu, Yannian, Wu, Weiqun, Yue, Haixiao, Liu, Shanshan, Zhang, Gang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Interpretable Face Anti-Spoofing: Enhancing Generalization with Multimodal Large Language Models
di: Zhang, Guosheng, et al.
Pubblicazione: (2025)
di: Zhang, Guosheng, et al.
Pubblicazione: (2025)
Combating Visual Neglect and Semantic Drift in Large Multimodal Models for Enhanced Cross-Modal Retrieval
di: Zhang, Guosheng, et al.
Pubblicazione: (2026)
di: Zhang, Guosheng, et al.
Pubblicazione: (2026)
Weather-R1: Logically Consistent Reinforcement Fine-Tuning for Multimodal Reasoning in Meteorology
di: Wu, Kaiyu, et al.
Pubblicazione: (2026)
di: Wu, Kaiyu, et al.
Pubblicazione: (2026)
MedTrinity-25M: A Large-scale Multimodal Dataset with Multigranular Annotations for Medicine
di: Xie, Yunfei, et al.
Pubblicazione: (2024)
di: Xie, Yunfei, et al.
Pubblicazione: (2024)
MedDiff-FM: A Diffusion-based Foundation Model for Versatile Medical Image Applications
di: Yu, Yongrui, et al.
Pubblicazione: (2024)
di: Yu, Yongrui, et al.
Pubblicazione: (2024)
UAV-VL-R1: Generalizing Vision-Language Models via Supervised Fine-Tuning and Multi-Stage GRPO for UAV Visual Reasoning
di: Guan, Jiajin, et al.
Pubblicazione: (2025)
di: Guan, Jiajin, et al.
Pubblicazione: (2025)
Boosting Reasoning in Large Multimodal Models via Activation Replay
di: Xing, Yun, et al.
Pubblicazione: (2025)
di: Xing, Yun, et al.
Pubblicazione: (2025)
Learning Trajectory-Aware Multimodal Large Language Models for Video Reasoning Segmentation
di: Luo, Jingnan, et al.
Pubblicazione: (2026)
di: Luo, Jingnan, et al.
Pubblicazione: (2026)
Echo-α: Large Agentic Multimodal Reasoning Model for Ultrasound Interpretation
di: Zhang, Jing, et al.
Pubblicazione: (2026)
di: Zhang, Jing, et al.
Pubblicazione: (2026)
OracleAgent: A Multimodal Reasoning Agent for Oracle Bone Script Research
di: Li, Caoshuo, et al.
Pubblicazione: (2025)
di: Li, Caoshuo, et al.
Pubblicazione: (2025)
Iterative Tool Usage Exploration for Multimodal Agents via Step-wise Preference Tuning
di: Li, Pengxiang, et al.
Pubblicazione: (2025)
di: Li, Pengxiang, et al.
Pubblicazione: (2025)
BasketHAR: A Multimodal Dataset for Human Activity Recognition and Sport Analysis in Basketball Training Scenarios
di: Gao, Xian, et al.
Pubblicazione: (2026)
di: Gao, Xian, et al.
Pubblicazione: (2026)
VideoAgent: A Memory-augmented Multimodal Agent for Video Understanding
di: Fan, Yue, et al.
Pubblicazione: (2024)
di: Fan, Yue, et al.
Pubblicazione: (2024)
HOIGen-1M: A Large-scale Dataset for Human-Object Interaction Video Generation
di: Liu, Kun, et al.
Pubblicazione: (2025)
di: Liu, Kun, et al.
Pubblicazione: (2025)
VisReason: A Large-Scale Dataset for Visual Chain-of-Thought Reasoning
di: Li, Lingxiao, et al.
Pubblicazione: (2025)
di: Li, Lingxiao, et al.
Pubblicazione: (2025)
Fine-T2I: An Open, Large-Scale, and Diverse Dataset for High-Quality T2I Fine-Tuning
di: Ma, Xu, et al.
Pubblicazione: (2026)
di: Ma, Xu, et al.
Pubblicazione: (2026)
Motion-X++: A Large-Scale Multimodal 3D Whole-body Human Motion Dataset
di: Zhang, Yuhong, et al.
Pubblicazione: (2025)
di: Zhang, Yuhong, et al.
Pubblicazione: (2025)
LMOD: A Large Multimodal Ophthalmology Dataset and Benchmark for Large Vision-Language Models
di: Qin, Zhenyue, et al.
Pubblicazione: (2024)
di: Qin, Zhenyue, et al.
Pubblicazione: (2024)
AdaptMMBench: Benchmarking Adaptive Multimodal Reasoning for Mode Selection and Reasoning Process
di: Zhang, Xintong, et al.
Pubblicazione: (2026)
di: Zhang, Xintong, et al.
Pubblicazione: (2026)
MATRIX: Multimodal Agent Tuning for Robust Tool-Use Reasoning
di: Ashraf, Tajamul, et al.
Pubblicazione: (2025)
di: Ashraf, Tajamul, et al.
Pubblicazione: (2025)
PixelLM: Pixel Reasoning with Large Multimodal Model
di: Ren, Zhongwei, et al.
Pubblicazione: (2023)
di: Ren, Zhongwei, et al.
Pubblicazione: (2023)
Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models
di: Sun, Haoyuan, et al.
Pubblicazione: (2025)
di: Sun, Haoyuan, et al.
Pubblicazione: (2025)
MuSEAgent: A Multimodal Reasoning Agent with Stateful Experiences
di: Wang, Shijian, et al.
Pubblicazione: (2026)
di: Wang, Shijian, et al.
Pubblicazione: (2026)
DR-MMSearchAgent: Deepening Reasoning in Multimodal Search Agents
di: Wang, Shengqin, et al.
Pubblicazione: (2026)
di: Wang, Shengqin, et al.
Pubblicazione: (2026)
Parameter-Efficient Fine-Tuning Medical Multimodal Large Language Models for Medical Visual Grounding
di: He, Jinlong, et al.
Pubblicazione: (2024)
di: He, Jinlong, et al.
Pubblicazione: (2024)
MIRROR: Multimodal Iterative Reasoning via Reflection on Visual Regions
di: Zhang, Haoyu, et al.
Pubblicazione: (2026)
di: Zhang, Haoyu, et al.
Pubblicazione: (2026)
KD-DETR: Knowledge Distillation for Detection Transformer with Consistent Distillation Points Sampling
di: Wang, Yu, et al.
Pubblicazione: (2022)
di: Wang, Yu, et al.
Pubblicazione: (2022)
MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale
di: Guo, Jarvis, et al.
Pubblicazione: (2024)
di: Guo, Jarvis, et al.
Pubblicazione: (2024)
LMOD+: A Comprehensive Multimodal Dataset and Benchmark for Developing and Evaluating Multimodal Large Language Models in Ophthalmology
di: Qin, Zhenyue, et al.
Pubblicazione: (2025)
di: Qin, Zhenyue, et al.
Pubblicazione: (2025)
A Large-Scale Multimodal Dataset and Benchmarks for Human Activity Scene Understanding and Reasoning
di: Jiang, Siyang, et al.
Pubblicazione: (2025)
di: Jiang, Siyang, et al.
Pubblicazione: (2025)
Can Large Multimodal Models Inspect Buildings? A Hierarchical Benchmark for Structural Pathology Reasoning
di: Zhong, Hui, et al.
Pubblicazione: (2026)
di: Zhong, Hui, et al.
Pubblicazione: (2026)
GEMeX-RMCoT: An Enhanced Med-VQA Dataset for Region-Aware Multimodal Chain-of-Thought Reasoning
di: Liu, Bo, et al.
Pubblicazione: (2025)
di: Liu, Bo, et al.
Pubblicazione: (2025)
Towards Open-Vocabulary Industrial Defect Understanding with a Large-Scale Multimodal Dataset
di: Ni, TsaiChing, et al.
Pubblicazione: (2025)
di: Ni, TsaiChing, et al.
Pubblicazione: (2025)
Image-of-Thought Prompting for Visual Reasoning Refinement in Multimodal Large Language Models
di: Zhou, Qiji, et al.
Pubblicazione: (2024)
di: Zhou, Qiji, et al.
Pubblicazione: (2024)
AffectAgent: Collaborative Multi-Agent Reasoning for Retrieval-Augmented Multimodal Emotion Recognition
di: Wang, Zeheng, et al.
Pubblicazione: (2026)
di: Wang, Zeheng, et al.
Pubblicazione: (2026)
SkinCaRe: A Multimodal Dermatology Dataset Annotated with Medical Caption and Chain-of-Thought Reasoning
di: Shen, Yuhao, et al.
Pubblicazione: (2024)
di: Shen, Yuhao, et al.
Pubblicazione: (2024)
Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization
di: Wang, Weiyun, et al.
Pubblicazione: (2024)
di: Wang, Weiyun, et al.
Pubblicazione: (2024)
Parameter-efficient Tuning of Large-scale Multimodal Foundation Model
di: Wang, Haixin, et al.
Pubblicazione: (2023)
di: Wang, Haixin, et al.
Pubblicazione: (2023)
AgentVista: Evaluating Multimodal Agents in Ultra-Challenging Realistic Visual Scenarios
di: Su, Zhaochen, et al.
Pubblicazione: (2026)
di: Su, Zhaochen, et al.
Pubblicazione: (2026)
Thinking in Dynamics: How Multimodal Large Language Models Perceive, Track, and Reason Dynamics in Physical 4D World
di: Huang, Yuzhi, et al.
Pubblicazione: (2026)
di: Huang, Yuzhi, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Interpretable Face Anti-Spoofing: Enhancing Generalization with Multimodal Large Language Models
di: Zhang, Guosheng, et al.
Pubblicazione: (2025) -
Combating Visual Neglect and Semantic Drift in Large Multimodal Models for Enhanced Cross-Modal Retrieval
di: Zhang, Guosheng, et al.
Pubblicazione: (2026) -
Weather-R1: Logically Consistent Reinforcement Fine-Tuning for Multimodal Reasoning in Meteorology
di: Wu, Kaiyu, et al.
Pubblicazione: (2026) -
MedTrinity-25M: A Large-scale Multimodal Dataset with Multigranular Annotations for Medicine
di: Xie, Yunfei, et al.
Pubblicazione: (2024) -
MedDiff-FM: A Diffusion-based Foundation Model for Versatile Medical Image Applications
di: Yu, Yongrui, et al.
Pubblicazione: (2024)