Self-Evolved Preference Optimization for Enhancing Mathematical Reasoning in Small Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Singh, Joykirat, Chakraborty, Tanmoy, Nambi, Akshay |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Exposing the Achilles' Heel: Evaluating LLMs Ability to Handle Mistakes in Mathematical Reasoning
von: Singh, Joykirat, et al.
Veröffentlicht: (2024)
von: Singh, Joykirat, et al.
Veröffentlicht: (2024)
PromptWizard: Task-Aware Prompt Optimization Framework
von: Agarwal, Eshaan, et al.
Veröffentlicht: (2024)
von: Agarwal, Eshaan, et al.
Veröffentlicht: (2024)
Mechanistic Behavior Editing of Language Models
von: Singh, Joykirat, et al.
Veröffentlicht: (2024)
von: Singh, Joykirat, et al.
Veröffentlicht: (2024)
Think Right: Learning to Mitigate Under-Over Thinking via Adaptive, Attentive Compression
von: Singh, Joykirat, et al.
Veröffentlicht: (2025)
von: Singh, Joykirat, et al.
Veröffentlicht: (2025)
Waking Up Blind: Cold-Start Optimization of Supervision-Free Agentic Trajectories for Grounded Visual Perception
von: Bajpai, Ashutosh, et al.
Veröffentlicht: (2026)
von: Bajpai, Ashutosh, et al.
Veröffentlicht: (2026)
SpatialMath: Spatial Comprehension-Infused Symbolic Reasoning for Mathematical Problem-Solving
von: Bajpai, Ashutosh, et al.
Veröffentlicht: (2026)
von: Bajpai, Ashutosh, et al.
Veröffentlicht: (2026)
Auto-Evolve: Enhancing Large Language Model's Performance via Self-Reasoning Framework
von: Aswani, Krishna, et al.
Veröffentlicht: (2024)
von: Aswani, Krishna, et al.
Veröffentlicht: (2024)
How to think step-by-step: A mechanistic understanding of chain-of-thought reasoning
von: Dutta, Subhabrata, et al.
Veröffentlicht: (2024)
von: Dutta, Subhabrata, et al.
Veröffentlicht: (2024)
MMCTAgent: Multi-modal Critical Thinking Agent Framework for Complex Visual Reasoning
von: Kumar, Somnath, et al.
Veröffentlicht: (2024)
von: Kumar, Somnath, et al.
Veröffentlicht: (2024)
Stepwise Self-Consistent Mathematical Reasoning with Large Language Models
von: Zhao, Zilong, et al.
Veröffentlicht: (2024)
von: Zhao, Zilong, et al.
Veröffentlicht: (2024)
Self-Play Preference Optimization for Language Model Alignment
von: Wu, Yue, et al.
Veröffentlicht: (2024)
von: Wu, Yue, et al.
Veröffentlicht: (2024)
PARAMANU-GANITA: Can Small Math Language Models Rival with Large Language Models on Mathematical Reasoning?
von: Niyogi, Mitodru, et al.
Veröffentlicht: (2024)
von: Niyogi, Mitodru, et al.
Veröffentlicht: (2024)
Multilingual LLMs Inherently Reward In-Language Time-Sensitive Semantic Alignment for Low-Resource Languages
von: Bajpai, Ashutosh, et al.
Veröffentlicht: (2024)
von: Bajpai, Ashutosh, et al.
Veröffentlicht: (2024)
POSIX: A Prompt Sensitivity Index For Large Language Models
von: Chatterjee, Anwoy, et al.
Veröffentlicht: (2024)
von: Chatterjee, Anwoy, et al.
Veröffentlicht: (2024)
Cog-DRIFT: Exploration on Adaptively Reformulated Instances Enables Learning from Hard Reasoning Problems
von: Chen, Justin Chih-Yao, et al.
Veröffentlicht: (2026)
von: Chen, Justin Chih-Yao, et al.
Veröffentlicht: (2026)
Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences
von: Rosset, Corby, et al.
Veröffentlicht: (2024)
von: Rosset, Corby, et al.
Veröffentlicht: (2024)
Schoenfeld's Anatomy of Mathematical Reasoning by Language Models
von: Li, Ming, et al.
Veröffentlicht: (2025)
von: Li, Ming, et al.
Veröffentlicht: (2025)
Self-Evolving Critique Abilities in Large Language Models
von: Tang, Zhengyang, et al.
Veröffentlicht: (2025)
von: Tang, Zhengyang, et al.
Veröffentlicht: (2025)
Self-Consistency Preference Optimization
von: Prasad, Archiki, et al.
Veröffentlicht: (2024)
von: Prasad, Archiki, et al.
Veröffentlicht: (2024)
DISPO: Enhancing Training Efficiency and Stability in Reinforcement Learning for Large Language Model Mathematical Reasoning
von: Karaman, Batuhan K., et al.
Veröffentlicht: (2026)
von: Karaman, Batuhan K., et al.
Veröffentlicht: (2026)
A Post-Training Enhanced Optimization Approach for Small Language Models
von: Zhai, Keke
Veröffentlicht: (2024)
von: Zhai, Keke
Veröffentlicht: (2024)
Agentic Reasoning and Tool Integration for LLMs via Reinforcement Learning
von: Singh, Joykirat, et al.
Veröffentlicht: (2025)
von: Singh, Joykirat, et al.
Veröffentlicht: (2025)
Active Preference Optimization for Sample Efficient RLHF
von: Das, Nirjhar, et al.
Veröffentlicht: (2024)
von: Das, Nirjhar, et al.
Veröffentlicht: (2024)
Duel-Evolve: Reward-Free Test-Time Scaling via LLM Self-Preferences
von: Karlekar, Sweta, et al.
Veröffentlicht: (2026)
von: Karlekar, Sweta, et al.
Veröffentlicht: (2026)
Safe: Enhancing Mathematical Reasoning in Large Language Models via Retrospective Step-aware Formal Verification
von: Liu, Chengwu, et al.
Veröffentlicht: (2025)
von: Liu, Chengwu, et al.
Veröffentlicht: (2025)
Towards Reasoning Ability of Small Language Models
von: Srivastava, Gaurav, et al.
Veröffentlicht: (2025)
von: Srivastava, Gaurav, et al.
Veröffentlicht: (2025)
Forward-Backward Reasoning in Large Language Models for Mathematical Verification
von: Jiang, Weisen, et al.
Veröffentlicht: (2023)
von: Jiang, Weisen, et al.
Veröffentlicht: (2023)
Agentic Context Engineering: Evolving Contexts for Self-Improving Language Models
von: Zhang, Qizheng, et al.
Veröffentlicht: (2025)
von: Zhang, Qizheng, et al.
Veröffentlicht: (2025)
AdapThink: Adaptive Thinking Preferences for Reasoning Language Model
von: Wan, Xu, et al.
Veröffentlicht: (2025)
von: Wan, Xu, et al.
Veröffentlicht: (2025)
Active Preference Inference using Language Models and Probabilistic Reasoning
von: Piriyakulkij, Wasu Top, et al.
Veröffentlicht: (2023)
von: Piriyakulkij, Wasu Top, et al.
Veröffentlicht: (2023)
ROPO: Robust Preference Optimization for Large Language Models
von: Liang, Xize, et al.
Veröffentlicht: (2024)
von: Liang, Xize, et al.
Veröffentlicht: (2024)
Accelerated Preference Optimization for Large Language Model Alignment
von: He, Jiafan, et al.
Veröffentlicht: (2024)
von: He, Jiafan, et al.
Veröffentlicht: (2024)
R-Zero: Self-Evolving Reasoning LLM from Zero Data
von: Huang, Chengsong, et al.
Veröffentlicht: (2025)
von: Huang, Chengsong, et al.
Veröffentlicht: (2025)
AMPO: Active Multi-Preference Optimization for Self-play Preference Selection
von: Gupta, Taneesh, et al.
Veröffentlicht: (2025)
von: Gupta, Taneesh, et al.
Veröffentlicht: (2025)
Stabilizing Reasoning in Medical LLMs with Continued Pretraining and Reasoning Preference Optimization
von: Kawakami, Wataru, et al.
Veröffentlicht: (2025)
von: Kawakami, Wataru, et al.
Veröffentlicht: (2025)
PREMISE: Scalable and Strategic Prompt Optimization for Efficient Mathematical Reasoning in Large Models
von: Yu, Ye, et al.
Veröffentlicht: (2025)
von: Yu, Ye, et al.
Veröffentlicht: (2025)
TSO: Self-Training with Scaled Preference Optimization
von: Chen, Kaihui, et al.
Veröffentlicht: (2024)
von: Chen, Kaihui, et al.
Veröffentlicht: (2024)
Exploratory Preference Optimization: Harnessing Implicit Q*-Approximation for Sample-Efficient RLHF
von: Xie, Tengyang, et al.
Veröffentlicht: (2024)
von: Xie, Tengyang, et al.
Veröffentlicht: (2024)
SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning
von: Chen, Jiaqi, et al.
Veröffentlicht: (2025)
von: Chen, Jiaqi, et al.
Veröffentlicht: (2025)
DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
von: Shao, Zhihong, et al.
Veröffentlicht: (2024)
von: Shao, Zhihong, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Exposing the Achilles' Heel: Evaluating LLMs Ability to Handle Mistakes in Mathematical Reasoning
von: Singh, Joykirat, et al.
Veröffentlicht: (2024) -
PromptWizard: Task-Aware Prompt Optimization Framework
von: Agarwal, Eshaan, et al.
Veröffentlicht: (2024) -
Mechanistic Behavior Editing of Language Models
von: Singh, Joykirat, et al.
Veröffentlicht: (2024) -
Think Right: Learning to Mitigate Under-Over Thinking via Adaptive, Attentive Compression
von: Singh, Joykirat, et al.
Veröffentlicht: (2025) -
Waking Up Blind: Cold-Start Optimization of Supervision-Free Agentic Trajectories for Grounded Visual Perception
von: Bajpai, Ashutosh, et al.
Veröffentlicht: (2026)