Salvato in:
| Autori principali: | Fang, Zhaiyu, Sun, Ruipeng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2601.14696 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
AdaCtrl: Towards Adaptive and Controllable Reasoning via Difficulty-Aware Budgeting
di: Huang, Shijue, et al.
Pubblicazione: (2025)
di: Huang, Shijue, et al.
Pubblicazione: (2025)
AutoTIR: Autonomous Tools Integrated Reasoning via Reinforcement Learning
di: Wei, Yifan, et al.
Pubblicazione: (2025)
di: Wei, Yifan, et al.
Pubblicazione: (2025)
MatchTIR: Fine-Grained Supervision for Tool-Integrated Reasoning via Bipartite Matching
di: Qu, Changle, et al.
Pubblicazione: (2026)
di: Qu, Changle, et al.
Pubblicazione: (2026)
PruneTIR: Inference-Time Tool Call Pruning for Effective yet Efficient Tool-Integrated Reasoning
di: Zhang, Luan, et al.
Pubblicazione: (2026)
di: Zhang, Luan, et al.
Pubblicazione: (2026)
DARO: Difficulty-Aware Reweighting Policy Optimization
di: Zhou, Jingyu, et al.
Pubblicazione: (2025)
di: Zhou, Jingyu, et al.
Pubblicazione: (2025)
CODA: Difficulty-Aware Compute Allocation for Adaptive Reasoning
di: Wu, Siye, et al.
Pubblicazione: (2026)
di: Wu, Siye, et al.
Pubblicazione: (2026)
ARES: Multimodal Adaptive Reasoning via Difficulty-Aware Token-Level Entropy Shaping
di: Chen, Shuang, et al.
Pubblicazione: (2025)
di: Chen, Shuang, et al.
Pubblicazione: (2025)
AdaReasoner: Dynamic Tool Orchestration for Iterative Visual Reasoning
di: Song, Mingyang, et al.
Pubblicazione: (2026)
di: Song, Mingyang, et al.
Pubblicazione: (2026)
PORTool: Importance-Aware Policy Optimization with Rewarded Tree for Multi-Tool-Integrated Reasoning
di: Wu, Feijie, et al.
Pubblicazione: (2025)
di: Wu, Feijie, et al.
Pubblicazione: (2025)
Ada-R1: Hybrid-CoT via Bi-Level Adaptive Reasoning Optimization
di: Luo, Haotian, et al.
Pubblicazione: (2025)
di: Luo, Haotian, et al.
Pubblicazione: (2025)
Adaptive Multi-Expert Reasoning via Difficulty-Aware Routing and Uncertainty-Guided Aggregation
di: Ehab, Mohamed, et al.
Pubblicazione: (2026)
di: Ehab, Mohamed, et al.
Pubblicazione: (2026)
Learning from the Irrecoverable: Error-Localized Policy Optimization for Tool-Integrated LLM Reasoning
di: Liang, Qiao, et al.
Pubblicazione: (2026)
di: Liang, Qiao, et al.
Pubblicazione: (2026)
Multi-Agent Tool-Integrated Policy Optimization
di: Mo, Zhanfeng, et al.
Pubblicazione: (2025)
di: Mo, Zhanfeng, et al.
Pubblicazione: (2025)
When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning
di: Xu, Ruotao, et al.
Pubblicazione: (2026)
di: Xu, Ruotao, et al.
Pubblicazione: (2026)
PACE: Prefix-Protected and Difficulty-Aware Compression for Efficient Reasoning
di: Feng, Ruixiang, et al.
Pubblicazione: (2026)
di: Feng, Ruixiang, et al.
Pubblicazione: (2026)
Perception-Aware Policy Optimization for Multimodal Reasoning
di: Wang, Zhenhailong, et al.
Pubblicazione: (2025)
di: Wang, Zhenhailong, et al.
Pubblicazione: (2025)
THOR: Tool-Integrated Hierarchical Optimization via RL for Mathematical Reasoning
di: Chang, Qikai, et al.
Pubblicazione: (2025)
di: Chang, Qikai, et al.
Pubblicazione: (2025)
Less is More Tokens: Efficient Math Reasoning via Difficulty-Aware Chain-of-Thought Distillation
di: Waheed, Abdul, et al.
Pubblicazione: (2025)
di: Waheed, Abdul, et al.
Pubblicazione: (2025)
AdaRec: Adaptive Recommendation with LLMs via Narrative Profiling and Dual-Channel Reasoning
di: Wang, Meiyun, et al.
Pubblicazione: (2025)
di: Wang, Meiyun, et al.
Pubblicazione: (2025)
Empowering Multi-Turn Tool-Integrated Agentic Reasoning with Group Turn Policy Optimization
di: Ding, Yifeng, et al.
Pubblicazione: (2025)
di: Ding, Yifeng, et al.
Pubblicazione: (2025)
DiffAdapt: Difficulty-Adaptive Reasoning for Token-Efficient LLM Inference
di: Liu, Xiang, et al.
Pubblicazione: (2025)
di: Liu, Xiang, et al.
Pubblicazione: (2025)
Balancing the Reasoning Load: Difficulty-Differentiated Policy Optimization with Length Redistribution for Efficient and Robust Reinforcement Learning
di: Xia, Yinan, et al.
Pubblicazione: (2026)
di: Xia, Yinan, et al.
Pubblicazione: (2026)
AdaEAGLE: Optimizing Speculative Decoding via Explicit Modeling of Adaptive Draft Structures
di: Zhang, Situo, et al.
Pubblicazione: (2024)
di: Zhang, Situo, et al.
Pubblicazione: (2024)
LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization
di: Wu, Xingyu, et al.
Pubblicazione: (2025)
di: Wu, Xingyu, et al.
Pubblicazione: (2025)
AdaLomo: Low-memory Optimization with Adaptive Learning Rate
di: Lv, Kai, et al.
Pubblicazione: (2023)
di: Lv, Kai, et al.
Pubblicazione: (2023)
Hierarchical Budget Policy Optimization for Adaptive Reasoning
di: Lyu, Shangke, et al.
Pubblicazione: (2025)
di: Lyu, Shangke, et al.
Pubblicazione: (2025)
AdaEvolve: Adaptive LLM Driven Zeroth-Order Optimization
di: Cemri, Mert, et al.
Pubblicazione: (2026)
di: Cemri, Mert, et al.
Pubblicazione: (2026)
Learning How to Use Tools, Not Just When: Pattern-Aware Tool-Integrated Reasoning
di: Xu, Ningning, et al.
Pubblicazione: (2025)
di: Xu, Ningning, et al.
Pubblicazione: (2025)
DeReason: A Difficulty-Aware Curriculum Improves Decoupled SFT-then-RL Training for General Reasoning
di: Hu, Hanxu, et al.
Pubblicazione: (2026)
di: Hu, Hanxu, et al.
Pubblicazione: (2026)
AdaSpec: Adaptive Speculative Decoding for Fast, SLO-Aware Large Language Model Serving
di: Huang, Kaiyu, et al.
Pubblicazione: (2025)
di: Huang, Kaiyu, et al.
Pubblicazione: (2025)
VideoTIR: Accurate Understanding for Long Videos with Efficient Tool-Integrated Reasoning
di: Gao, Zhe, et al.
Pubblicazione: (2026)
di: Gao, Zhe, et al.
Pubblicazione: (2026)
Harder Is Better: Boosting Mathematical Reasoning via Difficulty-Aware GRPO and Multi-Aspect Question Reformulation
di: Dai, Yanqi, et al.
Pubblicazione: (2026)
di: Dai, Yanqi, et al.
Pubblicazione: (2026)
Harmony in Diversity: Multi-domain Contrastive Policy Optimization for Large Reasoning Models
di: Yu, Zongji, et al.
Pubblicazione: (2026)
di: Yu, Zongji, et al.
Pubblicazione: (2026)
Optimizing Anytime Reasoning via Budget Relative Policy Optimization
di: Qi, Penghui, et al.
Pubblicazione: (2025)
di: Qi, Penghui, et al.
Pubblicazione: (2025)
AdaGReS:Adaptive Greedy Context Selection via Redundancy-Aware Scoring for Token-Budgeted RAG
di: Peng, Chao, et al.
Pubblicazione: (2025)
di: Peng, Chao, et al.
Pubblicazione: (2025)
AdaDPO: Self-Adaptive Direct Preference Optimization with Balanced Gradient Updates
di: Chen, Shaolong, et al.
Pubblicazione: (2026)
di: Chen, Shaolong, et al.
Pubblicazione: (2026)
AdaSTaR: Adaptive Data Sampling for Training Self-Taught Reasoners
di: Koh, Woosung, et al.
Pubblicazione: (2025)
di: Koh, Woosung, et al.
Pubblicazione: (2025)
IAPO: Information-Aware Policy Optimization for Token-Efficient Reasoning
di: He, Yinhan, et al.
Pubblicazione: (2026)
di: He, Yinhan, et al.
Pubblicazione: (2026)
Discovery and Reinforcement of Tool-Integrated Reasoning Chains via Rollout Trees
di: Li, Kun, et al.
Pubblicazione: (2026)
di: Li, Kun, et al.
Pubblicazione: (2026)
AWPO: Enhancing Tool-Use of Large Language Models through Adaptive Integration of Reasoning Rewards
di: Lin, Zihan, et al.
Pubblicazione: (2025)
di: Lin, Zihan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
AdaCtrl: Towards Adaptive and Controllable Reasoning via Difficulty-Aware Budgeting
di: Huang, Shijue, et al.
Pubblicazione: (2025) -
AutoTIR: Autonomous Tools Integrated Reasoning via Reinforcement Learning
di: Wei, Yifan, et al.
Pubblicazione: (2025) -
MatchTIR: Fine-Grained Supervision for Tool-Integrated Reasoning via Bipartite Matching
di: Qu, Changle, et al.
Pubblicazione: (2026) -
PruneTIR: Inference-Time Tool Call Pruning for Effective yet Efficient Tool-Integrated Reasoning
di: Zhang, Luan, et al.
Pubblicazione: (2026) -
DARO: Difficulty-Aware Reweighting Policy Optimization
di: Zhou, Jingyu, et al.
Pubblicazione: (2025)