Act Wisely: Cultivating Meta-Cognitive Tool Use in Agentic Multimodal Models
Fuente:
arXiv
Saved in:
| Main Authors: | Yan, Shilin, Tong, Jintao, Xue, Hongwei, Tang, Xiaojun, Wang, Yangyang, Shi, Kunyu, Zhang, Guannan, Li, Ruixuan, Zou, Yixiong |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
SwimBird: Eliciting Switchable Reasoning Mode in Hybrid Autoregressive MLLMs
by: Tong, Jintao, et al.
Published: (2026)
by: Tong, Jintao, et al.
Published: (2026)
Lightweight Frequency Masker for Cross-Domain Few-Shot Semantic Segmentation
by: Tong, Jintao, et al.
Published: (2024)
by: Tong, Jintao, et al.
Published: (2024)
Self-Disentanglement and Re-Composition for Cross-Domain Few-Shot Segmentation
by: Tong, Jintao, et al.
Published: (2025)
by: Tong, Jintao, et al.
Published: (2025)
Beyond Scattered Acceptance: Fast and Coherent Inference for DLMs via Longest Stable Prefixes
by: Li, Pengxiang, et al.
Published: (2026)
by: Li, Pengxiang, et al.
Published: (2026)
MM-CondChain: A Programmatically Verified Benchmark for Visually Grounded Deep Compositional Reasoning
by: Shen, Haozhan, et al.
Published: (2026)
by: Shen, Haozhan, et al.
Published: (2026)
Adapter Naturally Serves as Decoupler for Cross-Domain Few-Shot Semantic Segmentation
by: Tong, Jintao, et al.
Published: (2025)
by: Tong, Jintao, et al.
Published: (2025)
Sketch-in-Latents: Eliciting Unified Reasoning in MLLMs
by: Tong, Jintao, et al.
Published: (2025)
by: Tong, Jintao, et al.
Published: (2025)
Addressing Exacerbated Attention Sink for Source-Free Cross-Domain Few-Shot Learning
by: Yi, Shuai, et al.
Published: (2026)
by: Yi, Shuai, et al.
Published: (2026)
Revisiting Continuity of Image Tokens for Cross-domain Few-shot Learning
by: Yi, Shuai, et al.
Published: (2025)
by: Yi, Shuai, et al.
Published: (2025)
Revisiting Pool-based Prompt Learning for Few-shot Class-incremental Learning
by: Jiang, Yongwei, et al.
Published: (2025)
by: Jiang, Yongwei, et al.
Published: (2025)
Reconstruction Target Matters in Masked Image Modeling for Cross-Domain Few-Shot Learning
by: Ma, Ran, et al.
Published: (2024)
by: Ma, Ran, et al.
Published: (2024)
Random Registers for Cross-Domain Few-Shot Learning
by: Yi, Shuai, et al.
Published: (2025)
by: Yi, Shuai, et al.
Published: (2025)
Remedying Target-Domain Astigmatism for Cross-Domain Few-Shot Object Detection
by: Jiang, Yongwei, et al.
Published: (2026)
by: Jiang, Yongwei, et al.
Published: (2026)
Improving CLIP Adaptation by Breaking Tail Alignment for Source-Free Cross-Domain Few-Shot Learning
by: Yi, Shuai, et al.
Published: (2026)
by: Yi, Shuai, et al.
Published: (2026)
FlowCut: Rethinking Redundancy via Information Flow for Efficient Vision-Language Models
by: Tong, Jintao, et al.
Published: (2025)
by: Tong, Jintao, et al.
Published: (2025)
The Devil is in Low-Level Features for Cross-Domain Few-Shot Segmentation
by: Liu, Yuhan, et al.
Published: (2025)
by: Liu, Yuhan, et al.
Published: (2025)
Interpretable Cross-Domain Few-Shot Learning with Rectified Target-Domain Local Alignment
by: Zhao, Yaze, et al.
Published: (2026)
by: Zhao, Yaze, et al.
Published: (2026)
Learning Unknowns from Unknowns: Diversified Negative Prototypes Generator for Few-Shot Open-Set Recognition
by: Zhang, Zhenyu, et al.
Published: (2024)
by: Zhang, Zhenyu, et al.
Published: (2024)
Mind the Discriminability Trap in Source-Free Cross-domain Few-shot Learning
by: Zhang, Zhenyu, et al.
Published: (2026)
by: Zhang, Zhenyu, et al.
Published: (2026)
Flatten Long-Range Loss Landscapes for Cross-Domain Few-Shot Learning
by: Zou, Yixiong, et al.
Published: (2024)
by: Zou, Yixiong, et al.
Published: (2024)
Delve into Base-Novel Confusion: Redundancy Exploration for Few-Shot Class-Incremental Learning
by: Zhou, Haichen, et al.
Published: (2024)
by: Zhou, Haichen, et al.
Published: (2024)
Compositional Few-Shot Class-Incremental Learning
by: Zou, Yixiong, et al.
Published: (2024)
by: Zou, Yixiong, et al.
Published: (2024)
Reviving In-domain Fine-tuning Methods for Source-Free Cross-domain Few-shot Learning
by: Zhao, Yaze, et al.
Published: (2026)
by: Zhao, Yaze, et al.
Published: (2026)
ActFER: Agentic Facial Expression Recognition via Active Tool-Augmented Visual Reasoning
by: Liu, Shifeng, et al.
Published: (2026)
by: Liu, Shifeng, et al.
Published: (2026)
MICM: Rethinking Unsupervised Pretraining for Enhanced Few-shot Learning
by: Zhang, Zhenyu, et al.
Published: (2024)
by: Zhang, Zhenyu, et al.
Published: (2024)
Start Small, Think Big: Curriculum-based Relative Policy Optimization for Visual Grounding
by: Yan, Qingyang, et al.
Published: (2025)
by: Yan, Qingyang, et al.
Published: (2025)
VerlTool: Towards Holistic Agentic Reinforcement Learning with Tool Use
by: Jiang, Dongfu, et al.
Published: (2025)
by: Jiang, Dongfu, et al.
Published: (2025)
Connecting the Dots: Training-Free Visual Grounding via Agentic Reasoning
by: Luo, Liqin, et al.
Published: (2025)
by: Luo, Liqin, et al.
Published: (2025)
ARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual Reasoning
by: Ding, Shengyuan, et al.
Published: (2025)
by: Ding, Shengyuan, et al.
Published: (2025)
GAMBIT: A Gamified Jailbreak Framework for Multimodal Large Language Models
by: Hu, Xiangdong, et al.
Published: (2026)
by: Hu, Xiangdong, et al.
Published: (2026)
Towards Meta-Cognitive Knowledge Editing for Multimodal LLMs
by: Fan, Zhaoyu, et al.
Published: (2025)
by: Fan, Zhaoyu, et al.
Published: (2025)
WiseEdit: Benchmarking Cognition- and Creativity-Informed Image Editing
by: Pan, Kaihang, et al.
Published: (2025)
by: Pan, Kaihang, et al.
Published: (2025)
Tool-R1: Sample-Efficient Reinforcement Learning for Agentic Tool Use
by: Zhang, Yabo, et al.
Published: (2025)
by: Zhang, Yabo, et al.
Published: (2025)
DeepTumorVQA: A Hierarchical 3D CT Benchmark for Stage-Wise Evaluation of Medical VLMs and Tool-Augmented Agents
by: Chen, Yixiong, et al.
Published: (2026)
by: Chen, Yixiong, et al.
Published: (2026)
Learning Relighting and Intrinsic Decomposition in Neural Radiance Fields
by: Yang, Yixiong, et al.
Published: (2024)
by: Yang, Yixiong, et al.
Published: (2024)
MLI-NeRF: Multi-Light Intrinsic-Aware Neural Radiance Fields
by: Yang, Yixiong, et al.
Published: (2024)
by: Yang, Yixiong, et al.
Published: (2024)
ParaVT: Taming the Tool Prior Paradox for Parallel Tool Use in Agentic Video Reinforcement Learning
by: Yang, Zuhao, et al.
Published: (2026)
by: Yang, Zuhao, et al.
Published: (2026)
Deep Video Discovery: Agentic Search with Tool Use for Long-form Video Understanding
by: Zhang, Xiaoyi, et al.
Published: (2025)
by: Zhang, Xiaoyi, et al.
Published: (2025)
OctoTools: An Agentic Framework with Extensible Tools for Complex Reasoning
by: Lu, Pan, et al.
Published: (2025)
by: Lu, Pan, et al.
Published: (2025)
Hybrid Reward Normalization for Process-supervised Non-verifiable Agentic Tasks
by: Xu, Peiran, et al.
Published: (2025)
by: Xu, Peiran, et al.
Published: (2025)
Similar Items
-
SwimBird: Eliciting Switchable Reasoning Mode in Hybrid Autoregressive MLLMs
by: Tong, Jintao, et al.
Published: (2026) -
Lightweight Frequency Masker for Cross-Domain Few-Shot Semantic Segmentation
by: Tong, Jintao, et al.
Published: (2024) -
Self-Disentanglement and Re-Composition for Cross-Domain Few-Shot Segmentation
by: Tong, Jintao, et al.
Published: (2025) -
Beyond Scattered Acceptance: Fast and Coherent Inference for DLMs via Longest Stable Prefixes
by: Li, Pengxiang, et al.
Published: (2026) -
MM-CondChain: A Programmatically Verified Benchmark for Visually Grounded Deep Compositional Reasoning
by: Shen, Haozhan, et al.
Published: (2026)