ATP-Bench: Towards Agentic Tool Planning for MLLM Interleaved Generation
Fuente:
arXiv
Saved in:
| Main Authors: | Liu, Yinuo, Qian, Zi, Zhou, Heng, Zhang, Jiahao, Zhang, Yajie, Li, Zhihang, Zhou, Mengyu, Zhao, Erchao, Jiang, Xiaoxi, Jiang, Guanjun |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Rationale Matters: Learning Transferable Rubrics via Proxy-Guided Critique for VLM Reward Models
by: Qiu, Weijie, et al.
Published: (2026)
by: Qiu, Weijie, et al.
Published: (2026)
Grounding the Score: Explicit Visual Premise Verification for Reliable Vision-Language Process Reward Models
by: Wang, Junxin, et al.
Published: (2026)
by: Wang, Junxin, et al.
Published: (2026)
Bringing Stability to Diffusion: Decomposing and Reducing Variance of Training Masked Diffusion Models
by: Jia, Mengni, et al.
Published: (2025)
by: Jia, Mengni, et al.
Published: (2025)
Trace2Skill: Distill Trajectory-Local Lessons into Transferable Agent Skills
by: Ni, Jingwei, et al.
Published: (2026)
by: Ni, Jingwei, et al.
Published: (2026)
MARCH: Multi-Agent Reinforced Self-Check for LLM Hallucination
by: Li, Zhuo, et al.
Published: (2026)
by: Li, Zhuo, et al.
Published: (2026)
Eliminating Inductive Bias in Reward Models with Information-Theoretic Guidance
by: Li, Zhuo, et al.
Published: (2025)
by: Li, Zhuo, et al.
Published: (2025)
Open Rubric System: Scaling Reinforcement Learning with Pairwise Adaptive Rubric
by: Jia, Ruipeng, et al.
Published: (2026)
by: Jia, Ruipeng, et al.
Published: (2026)
Fill the GAP: A Granular Alignment Paradigm for Visual Reasoning in Multimodal Large Language Models
by: Miao, Yanting, et al.
Published: (2026)
by: Miao, Yanting, et al.
Published: (2026)
Molecular Lead Optimization via Agentic Tool Planning
by: Li, Lingxiao, et al.
Published: (2026)
by: Li, Lingxiao, et al.
Published: (2026)
Interleaved LLM and Motion Planning for Generalized Multi-Object Collection in Large Scene Graphs
by: Yang, Ruochu, et al.
Published: (2025)
by: Yang, Ruochu, et al.
Published: (2025)
GenAgent: Scaling Text-to-Image Generation via Agentic Multimodal Reasoning
by: Jiang, Kaixun, et al.
Published: (2026)
by: Jiang, Kaixun, et al.
Published: (2026)
CLIPO: Contrastive Learning in Policy Optimization Generalizes RLVR
by: Cui, Sijia, et al.
Published: (2026)
by: Cui, Sijia, et al.
Published: (2026)
MLLM-as-a-Judge: Assessing Multimodal LLM-as-a-Judge with Vision-Language Benchmark
by: Chen, Dongping, et al.
Published: (2024)
by: Chen, Dongping, et al.
Published: (2024)
M^3-Bench: Multi-Modal, Multi-Hop, Multi-Threaded Tool-Using MLLM Agent Benchmark
by: Zhou, Yang, et al.
Published: (2025)
by: Zhou, Yang, et al.
Published: (2025)
GeoMind: An Agentic Workflow for Lithology Classification with Reasoned Tool Invocation
by: Zhou, Yitong, et al.
Published: (2026)
by: Zhou, Yitong, et al.
Published: (2026)
VTC-Bench: Evaluating Agentic Multimodal Models via Compositional Visual Tool Chaining
by: Zhu, Xuanyu, et al.
Published: (2026)
by: Zhu, Xuanyu, et al.
Published: (2026)
Reinforcement Learning for Tool-Integrated Interleaved Thinking towards Cross-Domain Generalization
by: Chen, Zhengyu, et al.
Published: (2025)
by: Chen, Zhengyu, et al.
Published: (2025)
AIR-Bench: Benchmarking Large Audio-Language Models via Generative Comprehension
by: Yang, Qian, et al.
Published: (2024)
by: Yang, Qian, et al.
Published: (2024)
An Evaluation of Interleaved Instruction Tuning on Semantic Reasoning Performance in an Audio MLLM
by: Liu, Jiawei, et al.
Published: (2025)
by: Liu, Jiawei, et al.
Published: (2025)
From Secure Agentic AI to Secure Agentic Web: Challenges, Threats, and Future Directions
by: Deng, Zhihang, et al.
Published: (2026)
by: Deng, Zhihang, et al.
Published: (2026)
REI-Bench: Can Embodied Agents Understand Vague Human Instructions in Task Planning?
by: Jiang, Chenxi, et al.
Published: (2025)
by: Jiang, Chenxi, et al.
Published: (2025)
Enhanced Ag–Nb 2 O 5 /SiC wetting and brazing by SiC pre‐oxidation: Experiments and first‐principles study
by: Zhang Xiangzhao, et al.
Published: (2025)
by: Zhang Xiangzhao, et al.
Published: (2025)
Agentic Privacy-Preserving Machine Learning
by: Zhang, Mengyu, et al.
Published: (2025)
by: Zhang, Mengyu, et al.
Published: (2025)
Interleaved Scene Graphs for Interleaved Text-and-Image Generation Assessment
by: Chen, Dongping, et al.
Published: (2024)
by: Chen, Dongping, et al.
Published: (2024)
In-the-Flow Agentic System Optimization for Effective Planning and Tool Use
by: Li, Zhuofeng, et al.
Published: (2025)
by: Li, Zhuofeng, et al.
Published: (2025)
Echo: Towards Advanced Audio Comprehension via Audio-Interleaved Reasoning
by: Wu, Daiqing, et al.
Published: (2026)
by: Wu, Daiqing, et al.
Published: (2026)
Lego-Edit: A General Image Editing Framework with Model-Level Bricks and MLLM Builder
by: Jia, Qifei, et al.
Published: (2025)
by: Jia, Qifei, et al.
Published: (2025)
Towards Verifiable Multimodal Deep Research: A Multi-Agent Harness for Interleaved Report Generation
by: Zhang, Chenghao, et al.
Published: (2026)
by: Zhang, Chenghao, et al.
Published: (2026)
Skywork-R1V4: Toward Agentic Multimodal Intelligence through Interleaved Thinking with Images and DeepResearch
by: Zhang, Yifan, et al.
Published: (2025)
by: Zhang, Yifan, et al.
Published: (2025)
Weaver: End-to-End Agentic System Training for Video Interleaved Reasoning
by: Shi, Yudi, et al.
Published: (2026)
by: Shi, Yudi, et al.
Published: (2026)
ConfProBench: A Confidence Evaluation Benchmark for MLLM-Based Process Judges
by: Zhou, Yue, et al.
Published: (2025)
by: Zhou, Yue, et al.
Published: (2025)
Towards Text-Image Interleaved Retrieval
by: Zhang, Xin, et al.
Published: (2025)
by: Zhang, Xin, et al.
Published: (2025)
InstructX: Towards Unified Visual Editing with MLLM Guidance
by: Mou, Chong, et al.
Published: (2025)
by: Mou, Chong, et al.
Published: (2025)
ATIR: Towards Audio-Text Interleaved Contextual Retrieval
by: Zhao, Tong, et al.
Published: (2026)
by: Zhao, Tong, et al.
Published: (2026)
VerlTool: Towards Holistic Agentic Reinforcement Learning with Tool Use
by: Jiang, Dongfu, et al.
Published: (2025)
by: Jiang, Dongfu, et al.
Published: (2025)
Nonlinear Stability of the Rayleigh-Taylor Problem in Quantum Navier-Stokes Equations
by: Jiang, Fei, et al.
Published: (2025)
by: Jiang, Fei, et al.
Published: (2025)
Images in Sentences: Scaling Interleaved Instructions for Unified Visual Generation
by: Zhang, Yabo, et al.
Published: (2026)
by: Zhang, Yabo, et al.
Published: (2026)
Towards a Mathematical Theory of Adaptive Memory: From Time-Varying to Responsive Fractional Brownian Motion
by: Jiang, Jiahao
Published: (2025)
by: Jiang, Jiahao
Published: (2025)
Interleaved Tool-Call Reasoning for Protein Function Understanding
by: Fan, Chuanliu, et al.
Published: (2026)
by: Fan, Chuanliu, et al.
Published: (2026)
AutoMedBench: Towards Medical AutoResearch with Agentic AI Models
by: Liu, Junqi, et al.
Published: (2026)
by: Liu, Junqi, et al.
Published: (2026)
Similar Items
-
Rationale Matters: Learning Transferable Rubrics via Proxy-Guided Critique for VLM Reward Models
by: Qiu, Weijie, et al.
Published: (2026) -
Grounding the Score: Explicit Visual Premise Verification for Reliable Vision-Language Process Reward Models
by: Wang, Junxin, et al.
Published: (2026) -
Bringing Stability to Diffusion: Decomposing and Reducing Variance of Training Masked Diffusion Models
by: Jia, Mengni, et al.
Published: (2025) -
Trace2Skill: Distill Trajectory-Local Lessons into Transferable Agent Skills
by: Ni, Jingwei, et al.
Published: (2026) -
MARCH: Multi-Agent Reinforced Self-Check for LLM Hallucination
by: Li, Zhuo, et al.
Published: (2026)