MM-Doc-R1: Training Agents for Long Document Visual Question Answering through Multi-turn Reinforcement Learning
Fuente:
arXiv
Guardado en:
| Autores principales: | Lin, Jiahang, Hu, Kai, Wang, Binghai, Zhou, Yuhao, Xi, Zhiheng, Guo, Honglin, Liu, Shichun, Wang, Junzhe, Dou, Shihan, Zhou, Enyu, Yan, Hang, Han, Zhenhua, Gui, Tao, Zhang, Qi, Huang, Xuanjing |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses
por: Lin, Jiahang, et al.
Publicado: (2026)
por: Lin, Jiahang, et al.
Publicado: (2026)
EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training
por: Pan, Chengjun, et al.
Publicado: (2026)
por: Pan, Chengjun, et al.
Publicado: (2026)
Steering LLMs via Scalable Interactive Oversight
por: Zhou, Enyu, et al.
Publicado: (2026)
por: Zhou, Enyu, et al.
Publicado: (2026)
Training Large Language Models for Reasoning through Reverse Curriculum Reinforcement Learning
por: Xi, Zhiheng, et al.
Publicado: (2024)
por: Xi, Zhiheng, et al.
Publicado: (2024)
RMB: Comprehensively Benchmarking Reward Models in LLM Alignment
por: Zhou, Enyu, et al.
Publicado: (2024)
por: Zhou, Enyu, et al.
Publicado: (2024)
Enhancing LLM-based Search Agents via Contribution Weighted Group Relative Policy Optimization
por: Wang, Junzhe, et al.
Publicado: (2026)
por: Wang, Junzhe, et al.
Publicado: (2026)
StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback
por: Dou, Shihan, et al.
Publicado: (2024)
por: Dou, Shihan, et al.
Publicado: (2024)
DocTabQA: Answering Questions from Long Documents Using Tables
por: Wang, Haochen, et al.
Publicado: (2024)
por: Wang, Haochen, et al.
Publicado: (2024)
Subspace Defense: Discarding Adversarial Perturbations by Learning a Subspace for Clean Signals
por: Zheng, Rui, et al.
Publicado: (2024)
por: Zheng, Rui, et al.
Publicado: (2024)
JFTA-Bench: Evaluate LLM's Ability of Tracking and Analyzing Malfunctions Using Fault Trees
por: Wang, Yuhui, et al.
Publicado: (2026)
por: Wang, Yuhui, et al.
Publicado: (2026)
LoRAMoE: Alleviate World Knowledge Forgetting in Large Language Models via MoE-Style Plugin
por: Dou, Shihan, et al.
Publicado: (2023)
por: Dou, Shihan, et al.
Publicado: (2023)
Pre-Trained Policy Discriminators are General Reward Models
por: Dou, Shihan, et al.
Publicado: (2025)
por: Dou, Shihan, et al.
Publicado: (2025)
OctoBench: Benchmarking Scaffold-Aware Instruction Following in Repository-Grounded Agentic Coding
por: Ding, Deming, et al.
Publicado: (2026)
por: Ding, Deming, et al.
Publicado: (2026)
DocVXQA: Context-Aware Visual Explanations for Document Question Answering
por: Souibgui, Mohamed Ali, et al.
Publicado: (2025)
por: Souibgui, Mohamed Ali, et al.
Publicado: (2025)
Why Reinforcement Fine-Tuning Enables MLLMs Preserve Prior Knowledge Better: A Data Perspective
por: Zhang, Zhihao, et al.
Publicado: (2025)
por: Zhang, Zhihao, et al.
Publicado: (2025)
AdaDocVQA: Adaptive Framework for Long Document Visual Question Answering in Low-Resource Settings
por: Li, Haoxuan, et al.
Publicado: (2025)
por: Li, Haoxuan, et al.
Publicado: (2025)
DocVideoQA: Towards Comprehensive Understanding of Document-Centric Videos through Question Answering
por: Wang, Haochen, et al.
Publicado: (2025)
por: Wang, Haochen, et al.
Publicado: (2025)
DocFusion: A Unified Framework for Document Parsing Tasks
por: Chai, Mingxu, et al.
Publicado: (2024)
por: Chai, Mingxu, et al.
Publicado: (2024)
BoundingDocs: a Unified Dataset for Document Question Answering with Spatial Annotations
por: Giovannini, Simone, et al.
Publicado: (2025)
por: Giovannini, Simone, et al.
Publicado: (2025)
Self-Polish: Enhance Reasoning in Large Language Models via Problem Refinement
por: Xi, Zhiheng, et al.
Publicado: (2023)
por: Xi, Zhiheng, et al.
Publicado: (2023)
Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control
por: Zhang, Jiazheng, et al.
Publicado: (2026)
por: Zhang, Jiazheng, et al.
Publicado: (2026)
DocPrune:Efficient Document Question Answering via Background, Question, and Comprehension-aware Token Pruning
por: Choi, Joonmyung, et al.
Publicado: (2026)
por: Choi, Joonmyung, et al.
Publicado: (2026)
DocSage: An Information Structuring Agent for Multi-Doc Multi-Entity Question Answering
por: Lin, Teng, et al.
Publicado: (2026)
por: Lin, Teng, et al.
Publicado: (2026)
Self-Demos: Eliciting Out-of-Demonstration Generalizability in Large Language Models
por: He, Wei, et al.
Publicado: (2024)
por: He, Wei, et al.
Publicado: (2024)
Secrets of RLHF in Large Language Models Part II: Reward Modeling
por: Wang, Binghai, et al.
Publicado: (2024)
por: Wang, Binghai, et al.
Publicado: (2024)
MM-PhyRLHF: Reinforcement Learning Framework for Multimodal Physics Question-Answering
por: Kapuriya, Janak, et al.
Publicado: (2024)
por: Kapuriya, Janak, et al.
Publicado: (2024)
Zero-Shot Complex Question-Answering on Long Scientific Documents
por: Wang, Wanting
Publicado: (2025)
por: Wang, Wanting
Publicado: (2025)
60 Data Points are Sufficient to Fine-Tune LLMs for Question-Answering
por: Ye, Junjie, et al.
Publicado: (2024)
por: Ye, Junjie, et al.
Publicado: (2024)
MetaRM: Shifted Distributions Alignment via Meta-Learning
por: Dou, Shihan, et al.
Publicado: (2024)
por: Dou, Shihan, et al.
Publicado: (2024)
LLMEval-Med: A Real-world Clinical Benchmark for Medical LLMs with Physician Validation
por: Zhang, Ming, et al.
Publicado: (2025)
por: Zhang, Ming, et al.
Publicado: (2025)
VRPO: Rethinking Value Modeling for Robust RL Training under Noisy Supervision
por: Zhu, Dingwei, et al.
Publicado: (2025)
por: Zhu, Dingwei, et al.
Publicado: (2025)
BAPO: Stabilizing Off-Policy Reinforcement Learning for LLMs via Balanced Policy Optimization with Adaptive Clipping
por: Xi, Zhiheng, et al.
Publicado: (2025)
por: Xi, Zhiheng, et al.
Publicado: (2025)
ASTRA-QA: A Benchmark for Abstract Question Answering over Documents
por: Wang, Shu, et al.
Publicado: (2026)
por: Wang, Shu, et al.
Publicado: (2026)
DocScope: Benchmarking Verifiable Reasoning for Trustworthy Long-Document Understanding
por: Feng, Xiang, et al.
Publicado: (2026)
por: Feng, Xiang, et al.
Publicado: (2026)
AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress
por: Xi, Zhiheng, et al.
Publicado: (2025)
por: Xi, Zhiheng, et al.
Publicado: (2025)
SafeAligner: Safety Alignment against Jailbreak Attacks via Response Disparity Guidance
por: Huang, Caishuang, et al.
Publicado: (2024)
por: Huang, Caishuang, et al.
Publicado: (2024)
MovieChat+: Question-aware Sparse Memory for Long Video Question Answering
por: Song, Enxin, et al.
Publicado: (2024)
por: Song, Enxin, et al.
Publicado: (2024)
LLMEval-Fair: A Large-Scale Longitudinal Study on Robust and Fair Evaluation of Large Language Models
por: Zhang, Ming, et al.
Publicado: (2025)
por: Zhang, Ming, et al.
Publicado: (2025)
Improving RL Exploration for LLM Reasoning through Retrospective Replay
por: Dou, Shihan, et al.
Publicado: (2025)
por: Dou, Shihan, et al.
Publicado: (2025)
DVPO: Distributional Value Modeling-based Policy Optimization for LLM Post-Training
por: Zhu, Dingwei, et al.
Publicado: (2025)
por: Zhu, Dingwei, et al.
Publicado: (2025)
Ejemplares similares
-
Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses
por: Lin, Jiahang, et al.
Publicado: (2026) -
EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training
por: Pan, Chengjun, et al.
Publicado: (2026) -
Steering LLMs via Scalable Interactive Oversight
por: Zhou, Enyu, et al.
Publicado: (2026) -
Training Large Language Models for Reasoning through Reverse Curriculum Reinforcement Learning
por: Xi, Zhiheng, et al.
Publicado: (2024) -
RMB: Comprehensively Benchmarking Reward Models in LLM Alignment
por: Zhou, Enyu, et al.
Publicado: (2024)