PrAg-PO: Prompt Augmented Policy Optimization for Robust and Diverse Mathematical Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Lu, Wenquan, Huang, Hai, Liu, Enqi, Balestriero, Randall |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Latent Chain-of-Thought? Decoding the Depth-Recurrent Transformer
di: Lu, Wenquan, et al.
Pubblicazione: (2025)
di: Lu, Wenquan, et al.
Pubblicazione: (2025)
ALLoRA: Adaptive Learning Rate Mitigates LoRA Fatal Flaws
di: Huang, Hai, et al.
Pubblicazione: (2024)
di: Huang, Hai, et al.
Pubblicazione: (2024)
Ditch the Denoiser: Emergence of Noise Robustness in Self-Supervised Learning from Data Curriculum
di: Lu, Wenquan, et al.
Pubblicazione: (2025)
di: Lu, Wenquan, et al.
Pubblicazione: (2025)
LoRA Users Beware: A Few Spurious Tokens Can Manipulate Your Finetuned Model
di: Salles, Marcel Mateos, et al.
Pubblicazione: (2025)
di: Salles, Marcel Mateos, et al.
Pubblicazione: (2025)
Characterizing Large Language Model Geometry Helps Solve Toxicity Detection and Generation
di: Balestriero, Randall, et al.
Pubblicazione: (2023)
di: Balestriero, Randall, et al.
Pubblicazione: (2023)
The Fair Language Model Paradox
di: Pinto, Andrea, et al.
Pubblicazione: (2024)
di: Pinto, Andrea, et al.
Pubblicazione: (2024)
RePO: Replay-Enhanced Policy Optimization
di: Li, Siheng, et al.
Pubblicazione: (2025)
di: Li, Siheng, et al.
Pubblicazione: (2025)
PREMISE: Scalable and Strategic Prompt Optimization for Efficient Mathematical Reasoning in Large Models
di: Yu, Ye, et al.
Pubblicazione: (2025)
di: Yu, Ye, et al.
Pubblicazione: (2025)
Relative Preference Optimization: Enhancing LLM Alignment through Contrasting Responses across Identical and Diverse Prompts
di: Yin, Yueqin, et al.
Pubblicazione: (2024)
di: Yin, Yueqin, et al.
Pubblicazione: (2024)
SeqPO-SiMT: Sequential Policy Optimization for Simultaneous Machine Translation
di: Xu, Ting, et al.
Pubblicazione: (2025)
di: Xu, Ting, et al.
Pubblicazione: (2025)
Task Priors: Enhancing Model Evaluation by Considering the Entire Space of Downstream Tasks
di: Patel, Niket, et al.
Pubblicazione: (2025)
di: Patel, Niket, et al.
Pubblicazione: (2025)
No Location Left Behind: Measuring and Improving the Fairness of Implicit Representations for Earth Data
di: Cai, Daniel, et al.
Pubblicazione: (2025)
di: Cai, Daniel, et al.
Pubblicazione: (2025)
SAFE: A Novel Approach to AI Weather Evaluation through Stratified Assessments of Forecasts over Earth
di: Masi, Nick, et al.
Pubblicazione: (2025)
di: Masi, Nick, et al.
Pubblicazione: (2025)
GFlowPO: Generative Flow Network as a Language Model Prompt Optimizer
di: Cho, Junmo, et al.
Pubblicazione: (2026)
di: Cho, Junmo, et al.
Pubblicazione: (2026)
Evaluating Robustness of Reward Models for Mathematical Reasoning
di: Kim, Sunghwan, et al.
Pubblicazione: (2024)
di: Kim, Sunghwan, et al.
Pubblicazione: (2024)
An Investigation of Robustness of LLMs in Mathematical Reasoning: Benchmarking with Mathematically-Equivalent Transformation of Advanced Mathematical Problems
di: Hao, Yuren, et al.
Pubblicazione: (2025)
di: Hao, Yuren, et al.
Pubblicazione: (2025)
Fast and Exact Enumeration of Deep Networks Partitions Regions
di: Balestriero, Randall, et al.
Pubblicazione: (2024)
di: Balestriero, Randall, et al.
Pubblicazione: (2024)
From Accuracy to Robustness: A Study of Rule- and Model-based Verifiers in Mathematical Reasoning
di: Huang, Yuzhen, et al.
Pubblicazione: (2025)
di: Huang, Yuzhen, et al.
Pubblicazione: (2025)
ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization
di: Yoon, Hee Suk, et al.
Pubblicazione: (2025)
di: Yoon, Hee Suk, et al.
Pubblicazione: (2025)
Optimizing Anytime Reasoning via Budget Relative Policy Optimization
di: Qi, Penghui, et al.
Pubblicazione: (2025)
di: Qi, Penghui, et al.
Pubblicazione: (2025)
LLM-JEPA: Large Language Models Meet Joint Embedding Predictive Architectures
di: Huang, Hai, et al.
Pubblicazione: (2025)
di: Huang, Hai, et al.
Pubblicazione: (2025)
Klear-Reasoner: Advancing Reasoning Capability via Gradient-Preserving Clipping Policy Optimization
di: Su, Zhenpeng, et al.
Pubblicazione: (2025)
di: Su, Zhenpeng, et al.
Pubblicazione: (2025)
PromptCoT: Synthesizing Olympiad-level Problems for Mathematical Reasoning in Large Language Models
di: Zhao, Xueliang, et al.
Pubblicazione: (2025)
di: Zhao, Xueliang, et al.
Pubblicazione: (2025)
Reasoning Paths Optimization: Learning to Reason and Explore From Diverse Paths
di: Chia, Yew Ken, et al.
Pubblicazione: (2024)
di: Chia, Yew Ken, et al.
Pubblicazione: (2024)
One Example Shown, Many Concepts Known! Counterexample-Driven Conceptual Reasoning in Mathematical LLMs
di: Li, Yinghui, et al.
Pubblicazione: (2025)
di: Li, Yinghui, et al.
Pubblicazione: (2025)
ProcessBench: Identifying Process Errors in Mathematical Reasoning
di: Zheng, Chujie, et al.
Pubblicazione: (2024)
di: Zheng, Chujie, et al.
Pubblicazione: (2024)
Occam's Razor for Self Supervised Learning: What is Sufficient to Learn Good Representations?
di: Ibrahim, Mark, et al.
Pubblicazione: (2024)
di: Ibrahim, Mark, et al.
Pubblicazione: (2024)
Prompting Test-Time Scaling Is A Strong LLM Reasoning Data Augmentation
di: Bsharat, Sondos Mahmoud, et al.
Pubblicazione: (2025)
di: Bsharat, Sondos Mahmoud, et al.
Pubblicazione: (2025)
C-3PO: Compact Plug-and-Play Proxy Optimization to Achieve Human-like Retrieval-Augmented Generation
di: Chen, Guoxin, et al.
Pubblicazione: (2025)
di: Chen, Guoxin, et al.
Pubblicazione: (2025)
AgentMath: Empowering Mathematical Reasoning for Large Language Models via Tool-Augmented Agent
di: Luo, Haipeng, et al.
Pubblicazione: (2025)
di: Luo, Haipeng, et al.
Pubblicazione: (2025)
HAPO: Training Language Models to Reason Concisely via History-Aware Policy Optimization
di: Huang, Chengyu, et al.
Pubblicazione: (2025)
di: Huang, Chengyu, et al.
Pubblicazione: (2025)
Self-Evolved Preference Optimization for Enhancing Mathematical Reasoning in Small Language Models
di: Singh, Joykirat, et al.
Pubblicazione: (2025)
di: Singh, Joykirat, et al.
Pubblicazione: (2025)
REAL-Prover: Retrieval Augmented Lean Prover for Mathematical Reasoning
di: Shen, Ziju, et al.
Pubblicazione: (2025)
di: Shen, Ziju, et al.
Pubblicazione: (2025)
PerPO: Perceptual Preference Optimization via Discriminative Rewarding
di: Zhu, Zining, et al.
Pubblicazione: (2025)
di: Zhu, Zining, et al.
Pubblicazione: (2025)
Nonsense Helps: Prompt Space Perturbation Broadens Reasoning Exploration
di: Huang, Langlin, et al.
Pubblicazione: (2026)
di: Huang, Langlin, et al.
Pubblicazione: (2026)
Assessing the Impact of Prompting Methods on ChatGPT's Mathematical Capabilities
di: Chen, Yuhao, et al.
Pubblicazione: (2023)
di: Chen, Yuhao, et al.
Pubblicazione: (2023)
Dipper: Diversity in Prompts for Producing Large Language Model Ensembles in Reasoning tasks
di: Lau, Gregory Kang Ruey, et al.
Pubblicazione: (2024)
di: Lau, Gregory Kang Ruey, et al.
Pubblicazione: (2024)
PMPO: Probabilistic Metric Prompt Optimization for Small and Large Language Models
di: Zhao, Chenzhuo, et al.
Pubblicazione: (2025)
di: Zhao, Chenzhuo, et al.
Pubblicazione: (2025)
The Lessons of Developing Process Reward Models in Mathematical Reasoning
di: Zhang, Zhenru, et al.
Pubblicazione: (2025)
di: Zhang, Zhenru, et al.
Pubblicazione: (2025)
Diversity-oriented Data Augmentation with Large Language Models
di: Wang, Zaitian, et al.
Pubblicazione: (2025)
di: Wang, Zaitian, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Latent Chain-of-Thought? Decoding the Depth-Recurrent Transformer
di: Lu, Wenquan, et al.
Pubblicazione: (2025) -
ALLoRA: Adaptive Learning Rate Mitigates LoRA Fatal Flaws
di: Huang, Hai, et al.
Pubblicazione: (2024) -
Ditch the Denoiser: Emergence of Noise Robustness in Self-Supervised Learning from Data Curriculum
di: Lu, Wenquan, et al.
Pubblicazione: (2025) -
LoRA Users Beware: A Few Spurious Tokens Can Manipulate Your Finetuned Model
di: Salles, Marcel Mateos, et al.
Pubblicazione: (2025) -
Characterizing Large Language Model Geometry Helps Solve Toxicity Detection and Generation
di: Balestriero, Randall, et al.
Pubblicazione: (2023)