SATURN: SAT-based Reinforcement Learning to Unleash LLMs Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Huanyu, Li, Ge, Li, Jia, Zhu, Hao, Zhang, Kechi, Dong, Yihong |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Detecting Data Contamination from Reinforcement Learning Post-training for Large Language Models
par: Tao, Yongding, et autres
Publié: (2025)
par: Tao, Yongding, et autres
Publié: (2025)
Reasoning is Periodicity? Improving Large Language Models Through Effective Periodicity Modeling
par: Dong, Yihong, et autres
Publié: (2025)
par: Dong, Yihong, et autres
Publié: (2025)
Do Transformers Have the Ability for Periodicity Generalization?
par: Liu, Huanyu, et autres
Publié: (2026)
par: Liu, Huanyu, et autres
Publié: (2026)
RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization
par: Dong, Yihong, et autres
Publié: (2025)
par: Dong, Yihong, et autres
Publié: (2025)
A Survey on Code Generation with LLM-based Agents
par: Dong, Yihong, et autres
Publié: (2025)
par: Dong, Yihong, et autres
Publié: (2025)
Evaluating the Formal Reasoning Capabilities of Large Language Models through Chomsky Hierarchy
par: Dong, Yihong, et autres
Publié: (2026)
par: Dong, Yihong, et autres
Publié: (2026)
FAN: Fourier Analysis Networks
par: Dong, Yihong, et autres
Publié: (2024)
par: Dong, Yihong, et autres
Publié: (2024)
A Reinforcement Learning based Reset Policy for CDCL SAT Solvers
par: Li, Chunxiao, et autres
Publié: (2024)
par: Li, Chunxiao, et autres
Publié: (2024)
Rethinking Repetition Problems of LLMs in Code Generation
par: Dong, Yihong, et autres
Publié: (2025)
par: Dong, Yihong, et autres
Publié: (2025)
G1: Teaching LLMs to Reason on Graphs with Reinforcement Learning
par: Guo, Xiaojun, et autres
Publié: (2025)
par: Guo, Xiaojun, et autres
Publié: (2025)
TimeMaster: Training Time-Series Multimodal LLMs to Reason via Reinforcement Learning
par: Zhang, Junru, et autres
Publié: (2025)
par: Zhang, Junru, et autres
Publié: (2025)
Reinforcement Learning Fine-Tuning Enhances Activation Intensity and Diversity in the Internal Circuitry of LLMs
par: Zhang, Honglin, et autres
Publié: (2025)
par: Zhang, Honglin, et autres
Publié: (2025)
KOCO-BENCH: Can Large Language Models Leverage Domain Knowledge in Software Development?
par: Jiang, Xue, et autres
Publié: (2026)
par: Jiang, Xue, et autres
Publié: (2026)
Pentest-R1: Towards Autonomous Penetration Testing Reasoning Optimized via Two-Stage Reinforcement Learning
par: Kong, He, et autres
Publié: (2025)
par: Kong, He, et autres
Publié: (2025)
Can LLMs Guide Their Own Exploration? Gradient-Guided Reinforcement Learning for LLM Reasoning
par: Liang, Zhenwen, et autres
Publié: (2025)
par: Liang, Zhenwen, et autres
Publié: (2025)
Generalization or Memorization: Data Contamination and Trustworthy Evaluation for Large Language Models
par: Dong, Yihong, et autres
Publié: (2024)
par: Dong, Yihong, et autres
Publié: (2024)
Schema-Adaptive Tabular Representation Learning with LLMs for Generalizable Multimodal Clinical Reasoning
par: Mao, Hongxi, et autres
Publié: (2026)
par: Mao, Hongxi, et autres
Publié: (2026)
Kimi k1.5: Scaling Reinforcement Learning with LLMs
par: Kimi Team, et autres
Publié: (2025)
par: Kimi Team, et autres
Publié: (2025)
AnomSeer: Reinforcing Multimodal LLMs to Reason for Time-Series Anomaly Detection
par: Zhang, Junru, et autres
Publié: (2026)
par: Zhang, Junru, et autres
Publié: (2026)
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
par: DeepSeek-AI, et autres
Publié: (2025)
par: DeepSeek-AI, et autres
Publié: (2025)
OledFL: Unleashing the Potential of Decentralized Federated Learning via Opposite Lookahead Enhancement
par: Li, Qinglun, et autres
Publié: (2024)
par: Li, Qinglun, et autres
Publié: (2024)
RLAE: Reinforcement Learning-Assisted Ensemble for LLMs
par: Fu, Yuqian, et autres
Publié: (2025)
par: Fu, Yuqian, et autres
Publié: (2025)
MLCopilot: Unleashing the Power of Large Language Models in Solving Machine Learning Tasks
par: Zhang, Lei, et autres
Publié: (2023)
par: Zhang, Lei, et autres
Publié: (2023)
MOBODY: Model Based Off-Dynamics Offline Reinforcement Learning
par: Guo, Yihong, et autres
Publié: (2025)
par: Guo, Yihong, et autres
Publié: (2025)
KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning
par: Xu, Hongling, et autres
Publié: (2025)
par: Xu, Hongling, et autres
Publié: (2025)
FedRG: Unleashing the Representation Geometry for Federated Learning with Noisy Clients
par: Wen, Tian, et autres
Publié: (2026)
par: Wen, Tian, et autres
Publié: (2026)
A Survey of Reinforcement Learning for Large Reasoning Models
par: Zhang, Kaiyan, et autres
Publié: (2025)
par: Zhang, Kaiyan, et autres
Publié: (2025)
Offline Reinforcement Learning for LLM Multi-Step Reasoning
par: Wang, Huaijie, et autres
Publié: (2024)
par: Wang, Huaijie, et autres
Publié: (2024)
GoT-R1: Unleashing Reasoning Capability of MLLM for Visual Generation with Reinforcement Learning
par: Duan, Chengqi, et autres
Publié: (2025)
par: Duan, Chengqi, et autres
Publié: (2025)
Incentivizing Consistent, Effective and Scalable Reasoning Capability in Audio LLMs via Reasoning Process Rewards
par: Fan, Jiajun, et autres
Publié: (2025)
par: Fan, Jiajun, et autres
Publié: (2025)
Prompted Policy Search: Reinforcement Learning through Linguistic and Numerical Reasoning in LLMs
par: Zhou, Yifan, et autres
Publié: (2025)
par: Zhou, Yifan, et autres
Publié: (2025)
W2SAT: Learning to generate SAT instances from Weighted Literal Incidence Graphs
par: Wen, Weihuang, et autres
Publié: (2023)
par: Wen, Weihuang, et autres
Publié: (2023)
WST: Weak-to-Strong Knowledge Transfer via Reinforcement Learning
par: Ge, Haosen, et autres
Publié: (2025)
par: Ge, Haosen, et autres
Publié: (2025)
Step-wise Adaptive Integration of Supervised Fine-tuning and Reinforcement Learning for Task-Specific LLMs
par: Chen, Jack, et autres
Publié: (2025)
par: Chen, Jack, et autres
Publié: (2025)
RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents
par: Zhang, Zijing, et autres
Publié: (2025)
par: Zhang, Zijing, et autres
Publié: (2025)
DiffStitch: Boosting Offline Reinforcement Learning with Diffusion-based Trajectory Stitching
par: Li, Guanghe, et autres
Publié: (2024)
par: Li, Guanghe, et autres
Publié: (2024)
Can LLMs Learn to Reason Robustly under Noisy Supervision?
par: Yang, Shenzhi, et autres
Publié: (2026)
par: Yang, Shenzhi, et autres
Publié: (2026)
Latent-Space Contrastive Reinforcement Learning for Stable and Efficient LLM Reasoning
par: Shan, Lianlei, et autres
Publié: (2026)
par: Shan, Lianlei, et autres
Publié: (2026)
Stable Reinforcement Learning for Efficient Reasoning
par: Dai, Muzhi, et autres
Publié: (2025)
par: Dai, Muzhi, et autres
Publié: (2025)
Failure-Aware RL: Reliable Offline-to-Online Reinforcement Learning with Self-Recovery for Real-World Manipulation
par: Li, Huanyu, et autres
Publié: (2026)
par: Li, Huanyu, et autres
Publié: (2026)
Documents similaires
-
Detecting Data Contamination from Reinforcement Learning Post-training for Large Language Models
par: Tao, Yongding, et autres
Publié: (2025) -
Reasoning is Periodicity? Improving Large Language Models Through Effective Periodicity Modeling
par: Dong, Yihong, et autres
Publié: (2025) -
Do Transformers Have the Ability for Periodicity Generalization?
par: Liu, Huanyu, et autres
Publié: (2026) -
RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization
par: Dong, Yihong, et autres
Publié: (2025) -
A Survey on Code Generation with LLM-based Agents
par: Dong, Yihong, et autres
Publié: (2025)