AdaTIR: Adaptive Tool-Integrated Reasoning via Difficulty-Aware Policy Optimization
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Fang, Zhaiyu, Sun, Ruipeng |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
AdaCtrl: Towards Adaptive and Controllable Reasoning via Difficulty-Aware Budgeting
von: Huang, Shijue, et al.
Veröffentlicht: (2025)
von: Huang, Shijue, et al.
Veröffentlicht: (2025)
AutoTIR: Autonomous Tools Integrated Reasoning via Reinforcement Learning
von: Wei, Yifan, et al.
Veröffentlicht: (2025)
von: Wei, Yifan, et al.
Veröffentlicht: (2025)
MatchTIR: Fine-Grained Supervision for Tool-Integrated Reasoning via Bipartite Matching
von: Qu, Changle, et al.
Veröffentlicht: (2026)
von: Qu, Changle, et al.
Veröffentlicht: (2026)
PruneTIR: Inference-Time Tool Call Pruning for Effective yet Efficient Tool-Integrated Reasoning
von: Zhang, Luan, et al.
Veröffentlicht: (2026)
von: Zhang, Luan, et al.
Veröffentlicht: (2026)
DARO: Difficulty-Aware Reweighting Policy Optimization
von: Zhou, Jingyu, et al.
Veröffentlicht: (2025)
von: Zhou, Jingyu, et al.
Veröffentlicht: (2025)
CODA: Difficulty-Aware Compute Allocation for Adaptive Reasoning
von: Wu, Siye, et al.
Veröffentlicht: (2026)
von: Wu, Siye, et al.
Veröffentlicht: (2026)
ARES: Multimodal Adaptive Reasoning via Difficulty-Aware Token-Level Entropy Shaping
von: Chen, Shuang, et al.
Veröffentlicht: (2025)
von: Chen, Shuang, et al.
Veröffentlicht: (2025)
PORTool: Importance-Aware Policy Optimization with Rewarded Tree for Multi-Tool-Integrated Reasoning
von: Wu, Feijie, et al.
Veröffentlicht: (2025)
von: Wu, Feijie, et al.
Veröffentlicht: (2025)
Adaptive Multi-Expert Reasoning via Difficulty-Aware Routing and Uncertainty-Guided Aggregation
von: Ehab, Mohamed, et al.
Veröffentlicht: (2026)
von: Ehab, Mohamed, et al.
Veröffentlicht: (2026)
Ada-R1: Hybrid-CoT via Bi-Level Adaptive Reasoning Optimization
von: Luo, Haotian, et al.
Veröffentlicht: (2025)
von: Luo, Haotian, et al.
Veröffentlicht: (2025)
AdaReasoner: Dynamic Tool Orchestration for Iterative Visual Reasoning
von: Song, Mingyang, et al.
Veröffentlicht: (2026)
von: Song, Mingyang, et al.
Veröffentlicht: (2026)
Learning from the Irrecoverable: Error-Localized Policy Optimization for Tool-Integrated LLM Reasoning
von: Liang, Qiao, et al.
Veröffentlicht: (2026)
von: Liang, Qiao, et al.
Veröffentlicht: (2026)
Multi-Agent Tool-Integrated Policy Optimization
von: Mo, Zhanfeng, et al.
Veröffentlicht: (2025)
von: Mo, Zhanfeng, et al.
Veröffentlicht: (2025)
When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning
von: Xu, Ruotao, et al.
Veröffentlicht: (2026)
von: Xu, Ruotao, et al.
Veröffentlicht: (2026)
PACE: Prefix-Protected and Difficulty-Aware Compression for Efficient Reasoning
von: Feng, Ruixiang, et al.
Veröffentlicht: (2026)
von: Feng, Ruixiang, et al.
Veröffentlicht: (2026)
Perception-Aware Policy Optimization for Multimodal Reasoning
von: Wang, Zhenhailong, et al.
Veröffentlicht: (2025)
von: Wang, Zhenhailong, et al.
Veröffentlicht: (2025)
Less is More Tokens: Efficient Math Reasoning via Difficulty-Aware Chain-of-Thought Distillation
von: Waheed, Abdul, et al.
Veröffentlicht: (2025)
von: Waheed, Abdul, et al.
Veröffentlicht: (2025)
THOR: Tool-Integrated Hierarchical Optimization via RL for Mathematical Reasoning
von: Chang, Qikai, et al.
Veröffentlicht: (2025)
von: Chang, Qikai, et al.
Veröffentlicht: (2025)
DiffAdapt: Difficulty-Adaptive Reasoning for Token-Efficient LLM Inference
von: Liu, Xiang, et al.
Veröffentlicht: (2025)
von: Liu, Xiang, et al.
Veröffentlicht: (2025)
Empowering Multi-Turn Tool-Integrated Agentic Reasoning with Group Turn Policy Optimization
von: Ding, Yifeng, et al.
Veröffentlicht: (2025)
von: Ding, Yifeng, et al.
Veröffentlicht: (2025)
AdaRec: Adaptive Recommendation with LLMs via Narrative Profiling and Dual-Channel Reasoning
von: Wang, Meiyun, et al.
Veröffentlicht: (2025)
von: Wang, Meiyun, et al.
Veröffentlicht: (2025)
LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization
von: Wu, Xingyu, et al.
Veröffentlicht: (2025)
von: Wu, Xingyu, et al.
Veröffentlicht: (2025)
AdaEAGLE: Optimizing Speculative Decoding via Explicit Modeling of Adaptive Draft Structures
von: Zhang, Situo, et al.
Veröffentlicht: (2024)
von: Zhang, Situo, et al.
Veröffentlicht: (2024)
Balancing the Reasoning Load: Difficulty-Differentiated Policy Optimization with Length Redistribution for Efficient and Robust Reinforcement Learning
von: Xia, Yinan, et al.
Veröffentlicht: (2026)
von: Xia, Yinan, et al.
Veröffentlicht: (2026)
Hierarchical Budget Policy Optimization for Adaptive Reasoning
von: Lyu, Shangke, et al.
Veröffentlicht: (2025)
von: Lyu, Shangke, et al.
Veröffentlicht: (2025)
AdaLomo: Low-memory Optimization with Adaptive Learning Rate
von: Lv, Kai, et al.
Veröffentlicht: (2023)
von: Lv, Kai, et al.
Veröffentlicht: (2023)
Learning How to Use Tools, Not Just When: Pattern-Aware Tool-Integrated Reasoning
von: Xu, Ningning, et al.
Veröffentlicht: (2025)
von: Xu, Ningning, et al.
Veröffentlicht: (2025)
AdaEvolve: Adaptive LLM Driven Zeroth-Order Optimization
von: Cemri, Mert, et al.
Veröffentlicht: (2026)
von: Cemri, Mert, et al.
Veröffentlicht: (2026)
DeReason: A Difficulty-Aware Curriculum Improves Decoupled SFT-then-RL Training for General Reasoning
von: Hu, Hanxu, et al.
Veröffentlicht: (2026)
von: Hu, Hanxu, et al.
Veröffentlicht: (2026)
AdaSpec: Adaptive Speculative Decoding for Fast, SLO-Aware Large Language Model Serving
von: Huang, Kaiyu, et al.
Veröffentlicht: (2025)
von: Huang, Kaiyu, et al.
Veröffentlicht: (2025)
Harder Is Better: Boosting Mathematical Reasoning via Difficulty-Aware GRPO and Multi-Aspect Question Reformulation
von: Dai, Yanqi, et al.
Veröffentlicht: (2026)
von: Dai, Yanqi, et al.
Veröffentlicht: (2026)
Harmony in Diversity: Multi-domain Contrastive Policy Optimization for Large Reasoning Models
von: Yu, Zongji, et al.
Veröffentlicht: (2026)
von: Yu, Zongji, et al.
Veröffentlicht: (2026)
Discovery and Reinforcement of Tool-Integrated Reasoning Chains via Rollout Trees
von: Li, Kun, et al.
Veröffentlicht: (2026)
von: Li, Kun, et al.
Veröffentlicht: (2026)
AWPO: Enhancing Tool-Use of Large Language Models through Adaptive Integration of Reasoning Rewards
von: Lin, Zihan, et al.
Veröffentlicht: (2025)
von: Lin, Zihan, et al.
Veröffentlicht: (2025)
VideoTIR: Accurate Understanding for Long Videos with Efficient Tool-Integrated Reasoning
von: Gao, Zhe, et al.
Veröffentlicht: (2026)
von: Gao, Zhe, et al.
Veröffentlicht: (2026)
AdaDPO: Self-Adaptive Direct Preference Optimization with Balanced Gradient Updates
von: Chen, Shaolong, et al.
Veröffentlicht: (2026)
von: Chen, Shaolong, et al.
Veröffentlicht: (2026)
Adaptive Group Policy Optimization: Towards Stable Training and Token-Efficient Reasoning
von: Li, Chen, et al.
Veröffentlicht: (2025)
von: Li, Chen, et al.
Veröffentlicht: (2025)
Optimizing Anytime Reasoning via Budget Relative Policy Optimization
von: Qi, Penghui, et al.
Veröffentlicht: (2025)
von: Qi, Penghui, et al.
Veröffentlicht: (2025)
IAPO: Information-Aware Policy Optimization for Token-Efficient Reasoning
von: He, Yinhan, et al.
Veröffentlicht: (2026)
von: He, Yinhan, et al.
Veröffentlicht: (2026)
AdaGReS:Adaptive Greedy Context Selection via Redundancy-Aware Scoring for Token-Budgeted RAG
von: Peng, Chao, et al.
Veröffentlicht: (2025)
von: Peng, Chao, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
AdaCtrl: Towards Adaptive and Controllable Reasoning via Difficulty-Aware Budgeting
von: Huang, Shijue, et al.
Veröffentlicht: (2025) -
AutoTIR: Autonomous Tools Integrated Reasoning via Reinforcement Learning
von: Wei, Yifan, et al.
Veröffentlicht: (2025) -
MatchTIR: Fine-Grained Supervision for Tool-Integrated Reasoning via Bipartite Matching
von: Qu, Changle, et al.
Veröffentlicht: (2026) -
PruneTIR: Inference-Time Tool Call Pruning for Effective yet Efficient Tool-Integrated Reasoning
von: Zhang, Luan, et al.
Veröffentlicht: (2026) -
DARO: Difficulty-Aware Reweighting Policy Optimization
von: Zhou, Jingyu, et al.
Veröffentlicht: (2025)