Act Wisely: Cultivating Meta-Cognitive Tool Use in Agentic Multimodal Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Yan, Shilin, Tong, Jintao, Xue, Hongwei, Tang, Xiaojun, Wang, Yangyang, Shi, Kunyu, Zhang, Guannan, Li, Ruixuan, Zou, Yixiong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SwimBird: Eliciting Switchable Reasoning Mode in Hybrid Autoregressive MLLMs
por: Tong, Jintao, et al.
Publicado: (2026)
por: Tong, Jintao, et al.
Publicado: (2026)
Lightweight Frequency Masker for Cross-Domain Few-Shot Semantic Segmentation
por: Tong, Jintao, et al.
Publicado: (2024)
por: Tong, Jintao, et al.
Publicado: (2024)
Self-Disentanglement and Re-Composition for Cross-Domain Few-Shot Segmentation
por: Tong, Jintao, et al.
Publicado: (2025)
por: Tong, Jintao, et al.
Publicado: (2025)
Beyond Scattered Acceptance: Fast and Coherent Inference for DLMs via Longest Stable Prefixes
por: Li, Pengxiang, et al.
Publicado: (2026)
por: Li, Pengxiang, et al.
Publicado: (2026)
MM-CondChain: A Programmatically Verified Benchmark for Visually Grounded Deep Compositional Reasoning
por: Shen, Haozhan, et al.
Publicado: (2026)
por: Shen, Haozhan, et al.
Publicado: (2026)
Adapter Naturally Serves as Decoupler for Cross-Domain Few-Shot Semantic Segmentation
por: Tong, Jintao, et al.
Publicado: (2025)
por: Tong, Jintao, et al.
Publicado: (2025)
Sketch-in-Latents: Eliciting Unified Reasoning in MLLMs
por: Tong, Jintao, et al.
Publicado: (2025)
por: Tong, Jintao, et al.
Publicado: (2025)
Addressing Exacerbated Attention Sink for Source-Free Cross-Domain Few-Shot Learning
por: Yi, Shuai, et al.
Publicado: (2026)
por: Yi, Shuai, et al.
Publicado: (2026)
Revisiting Continuity of Image Tokens for Cross-domain Few-shot Learning
por: Yi, Shuai, et al.
Publicado: (2025)
por: Yi, Shuai, et al.
Publicado: (2025)
Revisiting Pool-based Prompt Learning for Few-shot Class-incremental Learning
por: Jiang, Yongwei, et al.
Publicado: (2025)
por: Jiang, Yongwei, et al.
Publicado: (2025)
Reconstruction Target Matters in Masked Image Modeling for Cross-Domain Few-Shot Learning
por: Ma, Ran, et al.
Publicado: (2024)
por: Ma, Ran, et al.
Publicado: (2024)
Random Registers for Cross-Domain Few-Shot Learning
por: Yi, Shuai, et al.
Publicado: (2025)
por: Yi, Shuai, et al.
Publicado: (2025)
Remedying Target-Domain Astigmatism for Cross-Domain Few-Shot Object Detection
por: Jiang, Yongwei, et al.
Publicado: (2026)
por: Jiang, Yongwei, et al.
Publicado: (2026)
Improving CLIP Adaptation by Breaking Tail Alignment for Source-Free Cross-Domain Few-Shot Learning
por: Yi, Shuai, et al.
Publicado: (2026)
por: Yi, Shuai, et al.
Publicado: (2026)
FlowCut: Rethinking Redundancy via Information Flow for Efficient Vision-Language Models
por: Tong, Jintao, et al.
Publicado: (2025)
por: Tong, Jintao, et al.
Publicado: (2025)
The Devil is in Low-Level Features for Cross-Domain Few-Shot Segmentation
por: Liu, Yuhan, et al.
Publicado: (2025)
por: Liu, Yuhan, et al.
Publicado: (2025)
Interpretable Cross-Domain Few-Shot Learning with Rectified Target-Domain Local Alignment
por: Zhao, Yaze, et al.
Publicado: (2026)
por: Zhao, Yaze, et al.
Publicado: (2026)
Learning Unknowns from Unknowns: Diversified Negative Prototypes Generator for Few-Shot Open-Set Recognition
por: Zhang, Zhenyu, et al.
Publicado: (2024)
por: Zhang, Zhenyu, et al.
Publicado: (2024)
Mind the Discriminability Trap in Source-Free Cross-domain Few-shot Learning
por: Zhang, Zhenyu, et al.
Publicado: (2026)
por: Zhang, Zhenyu, et al.
Publicado: (2026)
Flatten Long-Range Loss Landscapes for Cross-Domain Few-Shot Learning
por: Zou, Yixiong, et al.
Publicado: (2024)
por: Zou, Yixiong, et al.
Publicado: (2024)
Delve into Base-Novel Confusion: Redundancy Exploration for Few-Shot Class-Incremental Learning
por: Zhou, Haichen, et al.
Publicado: (2024)
por: Zhou, Haichen, et al.
Publicado: (2024)
Compositional Few-Shot Class-Incremental Learning
por: Zou, Yixiong, et al.
Publicado: (2024)
por: Zou, Yixiong, et al.
Publicado: (2024)
Reviving In-domain Fine-tuning Methods for Source-Free Cross-domain Few-shot Learning
por: Zhao, Yaze, et al.
Publicado: (2026)
por: Zhao, Yaze, et al.
Publicado: (2026)
ActFER: Agentic Facial Expression Recognition via Active Tool-Augmented Visual Reasoning
por: Liu, Shifeng, et al.
Publicado: (2026)
por: Liu, Shifeng, et al.
Publicado: (2026)
MICM: Rethinking Unsupervised Pretraining for Enhanced Few-shot Learning
por: Zhang, Zhenyu, et al.
Publicado: (2024)
por: Zhang, Zhenyu, et al.
Publicado: (2024)
Start Small, Think Big: Curriculum-based Relative Policy Optimization for Visual Grounding
por: Yan, Qingyang, et al.
Publicado: (2025)
por: Yan, Qingyang, et al.
Publicado: (2025)
VerlTool: Towards Holistic Agentic Reinforcement Learning with Tool Use
por: Jiang, Dongfu, et al.
Publicado: (2025)
por: Jiang, Dongfu, et al.
Publicado: (2025)
Connecting the Dots: Training-Free Visual Grounding via Agentic Reasoning
por: Luo, Liqin, et al.
Publicado: (2025)
por: Luo, Liqin, et al.
Publicado: (2025)
ARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual Reasoning
por: Ding, Shengyuan, et al.
Publicado: (2025)
por: Ding, Shengyuan, et al.
Publicado: (2025)
GAMBIT: A Gamified Jailbreak Framework for Multimodal Large Language Models
por: Hu, Xiangdong, et al.
Publicado: (2026)
por: Hu, Xiangdong, et al.
Publicado: (2026)
Towards Meta-Cognitive Knowledge Editing for Multimodal LLMs
por: Fan, Zhaoyu, et al.
Publicado: (2025)
por: Fan, Zhaoyu, et al.
Publicado: (2025)
WiseEdit: Benchmarking Cognition- and Creativity-Informed Image Editing
por: Pan, Kaihang, et al.
Publicado: (2025)
por: Pan, Kaihang, et al.
Publicado: (2025)
Tool-R1: Sample-Efficient Reinforcement Learning for Agentic Tool Use
por: Zhang, Yabo, et al.
Publicado: (2025)
por: Zhang, Yabo, et al.
Publicado: (2025)
DeepTumorVQA: A Hierarchical 3D CT Benchmark for Stage-Wise Evaluation of Medical VLMs and Tool-Augmented Agents
por: Chen, Yixiong, et al.
Publicado: (2026)
por: Chen, Yixiong, et al.
Publicado: (2026)
Learning Relighting and Intrinsic Decomposition in Neural Radiance Fields
por: Yang, Yixiong, et al.
Publicado: (2024)
por: Yang, Yixiong, et al.
Publicado: (2024)
MLI-NeRF: Multi-Light Intrinsic-Aware Neural Radiance Fields
por: Yang, Yixiong, et al.
Publicado: (2024)
por: Yang, Yixiong, et al.
Publicado: (2024)
ParaVT: Taming the Tool Prior Paradox for Parallel Tool Use in Agentic Video Reinforcement Learning
por: Yang, Zuhao, et al.
Publicado: (2026)
por: Yang, Zuhao, et al.
Publicado: (2026)
Deep Video Discovery: Agentic Search with Tool Use for Long-form Video Understanding
por: Zhang, Xiaoyi, et al.
Publicado: (2025)
por: Zhang, Xiaoyi, et al.
Publicado: (2025)
OctoTools: An Agentic Framework with Extensible Tools for Complex Reasoning
por: Lu, Pan, et al.
Publicado: (2025)
por: Lu, Pan, et al.
Publicado: (2025)
Hybrid Reward Normalization for Process-supervised Non-verifiable Agentic Tasks
por: Xu, Peiran, et al.
Publicado: (2025)
por: Xu, Peiran, et al.
Publicado: (2025)
Ejemplares similares
-
SwimBird: Eliciting Switchable Reasoning Mode in Hybrid Autoregressive MLLMs
por: Tong, Jintao, et al.
Publicado: (2026) -
Lightweight Frequency Masker for Cross-Domain Few-Shot Semantic Segmentation
por: Tong, Jintao, et al.
Publicado: (2024) -
Self-Disentanglement and Re-Composition for Cross-Domain Few-Shot Segmentation
por: Tong, Jintao, et al.
Publicado: (2025) -
Beyond Scattered Acceptance: Fast and Coherent Inference for DLMs via Longest Stable Prefixes
por: Li, Pengxiang, et al.
Publicado: (2026) -
MM-CondChain: A Programmatically Verified Benchmark for Visually Grounded Deep Compositional Reasoning
por: Shen, Haozhan, et al.
Publicado: (2026)