Reasoning with Reinforced Functional Token Tuning
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Kongcheng, Yao, Qi, Lai, Baisheng, Huang, Jiaxing, Fang, Wenkai, Tao, Dacheng, Song, Mingli, Liu, Shunyu |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning
by: Zhang, Kongcheng, et al.
Published: (2025)
by: Zhang, Kongcheng, et al.
Published: (2025)
Replay Failures as Successes: Sample-Efficient Reinforcement Learning for Instruction Following
by: Zhang, Kongcheng, et al.
Published: (2025)
by: Zhang, Kongcheng, et al.
Published: (2025)
SeRL: Self-Play Reinforcement Learning for Large Language Models with Limited Data
by: Fang, Wenkai, et al.
Published: (2025)
by: Fang, Wenkai, et al.
Published: (2025)
Experience is the Best Teacher: Motivating Effective Exploration in Reinforcement Learning for LLMs
by: Zhang, Wenjian, et al.
Published: (2026)
by: Zhang, Wenjian, et al.
Published: (2026)
Odyssey: Empowering Minecraft Agents with Open-World Skills
by: Liu, Shunyu, et al.
Published: (2024)
by: Liu, Shunyu, et al.
Published: (2024)
Breaking the Exploration Bottleneck: Rubric-Scaffolded Reinforcement Learning for General LLM Reasoning
by: Zhou, Yang, et al.
Published: (2025)
by: Zhou, Yang, et al.
Published: (2025)
A Simple "Motivation" Can Enhance Reinforcement Finetuning of Large Reasoning Models
by: Zhang, Junjie, et al.
Published: (2025)
by: Zhang, Junjie, et al.
Published: (2025)
R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization
by: Zhang, Jingyi, et al.
Published: (2025)
by: Zhang, Jingyi, et al.
Published: (2025)
Reinforced Model Merging
by: Han, Jiaqi, et al.
Published: (2025)
by: Han, Jiaqi, et al.
Published: (2025)
CoVeR: Conformal Calibration for Versatile and Reliable Autoregressive Next-Token Prediction
by: Chen, Yuzhu, et al.
Published: (2025)
by: Chen, Yuzhu, et al.
Published: (2025)
Improving Large Language Models with Concept-Aware Fine-Tuning
by: Chen, Michael K., et al.
Published: (2025)
by: Chen, Michael K., et al.
Published: (2025)
Mulberry: Empowering MLLM with o1-like Reasoning and Reflection via Collective Monte Carlo Tree Search
by: Yao, Huanjin, et al.
Published: (2024)
by: Yao, Huanjin, et al.
Published: (2024)
A Survey on Explainable Reinforcement Learning: Concepts, Algorithms, Challenges
by: Qing, Yunpeng, et al.
Published: (2022)
by: Qing, Yunpeng, et al.
Published: (2022)
GraphScout: Empowering Large Language Models with Intrinsic Exploration Ability for Agentic Graph Reasoning
by: Ying, Yuchen, et al.
Published: (2026)
by: Ying, Yuchen, et al.
Published: (2026)
Parallelized Planning-Acting for Efficient LLM-based Multi-Agent Systems in Minecraft
by: Li, Yaoru, et al.
Published: (2025)
by: Li, Yaoru, et al.
Published: (2025)
Bi-level Mean Field: Dynamic Grouping for Large-Scale MARL
by: Zheng, Yuxuan, et al.
Published: (2025)
by: Zheng, Yuxuan, et al.
Published: (2025)
Interaction Pattern Disentangling for Multi-Agent Reinforcement Learning
by: Liu, Shunyu, et al.
Published: (2022)
by: Liu, Shunyu, et al.
Published: (2022)
A2PO: Towards Effective Offline Reinforcement Learning from an Advantage-aware Perspective
by: Qing, Yunpeng, et al.
Published: (2024)
by: Qing, Yunpeng, et al.
Published: (2024)
A Survey on Agentic Multimodal Large Language Models
by: Yao, Huanjin, et al.
Published: (2025)
by: Yao, Huanjin, et al.
Published: (2025)
Unveiling Global Interactive Patterns across Graphs: Towards Interpretable Graph Neural Networks
by: Wang, Yuwen, et al.
Published: (2024)
by: Wang, Yuwen, et al.
Published: (2024)
COLA: Cross-city Mobility Transformer for Human Trajectory Simulation
by: Wang, Yu, et al.
Published: (2024)
by: Wang, Yu, et al.
Published: (2024)
Ask-AC: An Initiative Advisor-in-the-Loop Actor-Critic Framework
by: Liu, Shunyu, et al.
Published: (2022)
by: Liu, Shunyu, et al.
Published: (2022)
Revisiting Catastrophic Forgetting in Large Language Model Tuning
by: Li, Hongyu, et al.
Published: (2024)
by: Li, Hongyu, et al.
Published: (2024)
Transmission Interface Power Flow Adjustment: A Deep Reinforcement Learning Approach based on Multi-task Attribution Map
by: Liu, Shunyu, et al.
Published: (2024)
by: Liu, Shunyu, et al.
Published: (2024)
Dynamic Parallel Tree Search for Efficient LLM Reasoning
by: Ding, Yifu, et al.
Published: (2025)
by: Ding, Yifu, et al.
Published: (2025)
Temporal Prototype-Aware Learning for Active Voltage Control on Power Distribution Networks
by: Xu, Feiyang, et al.
Published: (2024)
by: Xu, Feiyang, et al.
Published: (2024)
R1-SyntheticVL: Is Synthetic Data from Generative Models Ready for Multimodal Large Language Model?
by: Zhang, Jingyi, et al.
Published: (2026)
by: Zhang, Jingyi, et al.
Published: (2026)
A Survey of Direct Preference Optimization
by: Liu, Shunyu, et al.
Published: (2025)
by: Liu, Shunyu, et al.
Published: (2025)
Solving a Rubik's Cube Using its Local Graph Structure
by: Yao, Shunyu, et al.
Published: (2024)
by: Yao, Shunyu, et al.
Published: (2024)
MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI
by: Yao, Huanjin, et al.
Published: (2025)
by: Yao, Huanjin, et al.
Published: (2025)
Spatiotemporal-Augmented Graph Neural Networks for Human Mobility Simulation
by: Wang, Yu, et al.
Published: (2023)
by: Wang, Yu, et al.
Published: (2023)
Simple Graph Condensation
by: Xiao, Zhenbang, et al.
Published: (2024)
by: Xiao, Zhenbang, et al.
Published: (2024)
Is Centralized Training with Decentralized Execution Framework Centralized Enough for MARL?
by: Zhou, Yihe, et al.
Published: (2023)
by: Zhou, Yihe, et al.
Published: (2023)
Rethinking Token Reduction for Large Vision-Language Models
by: Wang, Yi, et al.
Published: (2026)
by: Wang, Yi, et al.
Published: (2026)
Panacea: Mitigating Harmful Fine-tuning for Large Language Models via Post-fine-tuning Perturbation
by: Wang, Yibo, et al.
Published: (2025)
by: Wang, Yibo, et al.
Published: (2025)
Revisiting LLM Reasoning via Information Bottleneck
by: Lei, Shiye, et al.
Published: (2025)
by: Lei, Shiye, et al.
Published: (2025)
Continual Learning on Graphs: Challenges, Solutions, and Opportunities
by: Zhang, Xikun, et al.
Published: (2024)
by: Zhang, Xikun, et al.
Published: (2024)
Orcust: Stepwise-Feedback Reinforcement Learning for GUI Agent
by: Lu, Junyu, et al.
Published: (2025)
by: Lu, Junyu, et al.
Published: (2025)
Large Language Models as an Indirect Reasoner: Contrapositive and Contradiction for Automated Reasoning
by: Zhang, Yanfang, et al.
Published: (2024)
by: Zhang, Yanfang, et al.
Published: (2024)
Efficient Reinforcement Learning with Semantic and Token Entropy for LLM Reasoning
by: Cao, Hongye, et al.
Published: (2025)
by: Cao, Hongye, et al.
Published: (2025)
Similar Items
-
Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning
by: Zhang, Kongcheng, et al.
Published: (2025) -
Replay Failures as Successes: Sample-Efficient Reinforcement Learning for Instruction Following
by: Zhang, Kongcheng, et al.
Published: (2025) -
SeRL: Self-Play Reinforcement Learning for Large Language Models with Limited Data
by: Fang, Wenkai, et al.
Published: (2025) -
Experience is the Best Teacher: Motivating Effective Exploration in Reinforcement Learning for LLMs
by: Zhang, Wenjian, et al.
Published: (2026) -
Odyssey: Empowering Minecraft Agents with Open-World Skills
by: Liu, Shunyu, et al.
Published: (2024)