Self-Aligned Reward: Towards Effective and Efficient Reasoners
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Han, Peixuan, Krishnan, Adit, Friedland, Gerald, You, Jiaxuan, Kong, Chris |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Classifier Language Models: Unifying Sparse Finetuning and Adaptive Tokenization for Specialized Classification Tasks
von: Krishnan, Adit, et al.
Veröffentlicht: (2025)
von: Krishnan, Adit, et al.
Veröffentlicht: (2025)
Time-R1: Towards Comprehensive Temporal Reasoning in LLMs
von: Liu, Zijia, et al.
Veröffentlicht: (2025)
von: Liu, Zijia, et al.
Veröffentlicht: (2025)
DRPG (Decompose, Retrieve, Plan, Generate): An Agentic Framework for Academic Rebuttal
von: Han, Peixuan, et al.
Veröffentlicht: (2026)
von: Han, Peixuan, et al.
Veröffentlicht: (2026)
Effects of Feature Correlations on Associative Memory Capacity
von: Bielmeier, Stefan, et al.
Veröffentlicht: (2025)
von: Bielmeier, Stefan, et al.
Veröffentlicht: (2025)
CEV-LM: Controlled Edit Vector Language Model for Shaping Natural Language Generations
von: Moorjani, Samraj, et al.
Veröffentlicht: (2024)
von: Moorjani, Samraj, et al.
Veröffentlicht: (2024)
On Designing Effective RL Reward at Training Time for LLM Reasoning
von: Gao, Jiaxuan, et al.
Veröffentlicht: (2024)
von: Gao, Jiaxuan, et al.
Veröffentlicht: (2024)
Learning to Reason with Mixture of Tokens
von: Jain, Adit, et al.
Veröffentlicht: (2025)
von: Jain, Adit, et al.
Veröffentlicht: (2025)
Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data
von: Tang, Zhiqiang, et al.
Veröffentlicht: (2024)
von: Tang, Zhiqiang, et al.
Veröffentlicht: (2024)
MemReward: Graph-Based Experience Memory for LLM Reward Prediction with Limited Labels
von: Luo, Tianyang, et al.
Veröffentlicht: (2026)
von: Luo, Tianyang, et al.
Veröffentlicht: (2026)
Real-World Benchmarks Make Membership Inference Attacks Fail on Diffusion Models
von: Liang, Chumeng, et al.
Veröffentlicht: (2024)
von: Liang, Chumeng, et al.
Veröffentlicht: (2024)
R2IF: Aligning Reasoning with Decisions via Composite Rewards for Interpretable LLM Function Calling
von: Cheng, Aijia, et al.
Veröffentlicht: (2026)
von: Cheng, Aijia, et al.
Veröffentlicht: (2026)
Towards Cost-Effective Reward Guided Text Generation
von: Rashid, Ahmad, et al.
Veröffentlicht: (2025)
von: Rashid, Ahmad, et al.
Veröffentlicht: (2025)
Aligning LLMs with Domain Invariant Reward Models
von: Wu, David, et al.
Veröffentlicht: (2025)
von: Wu, David, et al.
Veröffentlicht: (2025)
Structured Reinforcement Learning for Incentivized Stochastic Covert Optimization
von: Jain, Adit, et al.
Veröffentlicht: (2024)
von: Jain, Adit, et al.
Veröffentlicht: (2024)
Self-Rewarding PPO: Aligning Large Language Models with Demonstrations Only
von: Zhang, Qingru, et al.
Veröffentlicht: (2025)
von: Zhang, Qingru, et al.
Veröffentlicht: (2025)
GRAM-R$^2$: Self-Training Generative Foundation Reward Models for Reward Reasoning
von: Wang, Chenglong, et al.
Veröffentlicht: (2025)
von: Wang, Chenglong, et al.
Veröffentlicht: (2025)
GraphEval: A Lightweight Graph-Based LLM Framework for Idea Evaluation
von: Feng, Tao, et al.
Veröffentlicht: (2025)
von: Feng, Tao, et al.
Veröffentlicht: (2025)
PersonalizedRouter: Personalized LLM Routing via Graph-based User Preference Modeling
von: Dai, Zhongjie, et al.
Veröffentlicht: (2025)
von: Dai, Zhongjie, et al.
Veröffentlicht: (2025)
Incentivizing Consistent, Effective and Scalable Reasoning Capability in Audio LLMs via Reasoning Process Rewards
von: Fan, Jiajun, et al.
Veröffentlicht: (2025)
von: Fan, Jiajun, et al.
Veröffentlicht: (2025)
Personalized RewardBench: Evaluating Reward Models with Human Aligned Personalization
von: Ma, Qiyao, et al.
Veröffentlicht: (2026)
von: Ma, Qiyao, et al.
Veröffentlicht: (2026)
Bridging Internal Probability and Self-Consistency for Effective and Efficient LLM Reasoning
von: Zhou, Zhi, et al.
Veröffentlicht: (2025)
von: Zhou, Zhi, et al.
Veröffentlicht: (2025)
Self-Rewarding Rubric-Based Reinforcement Learning for Open-Ended Reasoning
von: Ye, Zhiling, et al.
Veröffentlicht: (2025)
von: Ye, Zhiling, et al.
Veröffentlicht: (2025)
DRPO: Efficient Reasoning via Decoupled Reward Policy Optimization
von: Li, Gang, et al.
Veröffentlicht: (2025)
von: Li, Gang, et al.
Veröffentlicht: (2025)
Towards Understanding Self-play for LLM Reasoning
von: Chae, Justin Yang, et al.
Veröffentlicht: (2025)
von: Chae, Justin Yang, et al.
Veröffentlicht: (2025)
Semi-Supervised Reward Modeling via Iterative Self-Training
von: He, Yifei, et al.
Veröffentlicht: (2024)
von: He, Yifei, et al.
Veröffentlicht: (2024)
Towards Time Series Reasoning with LLMs
von: Chow, Winnie, et al.
Veröffentlicht: (2024)
von: Chow, Winnie, et al.
Veröffentlicht: (2024)
AcademicEval: Live Long-Context LLM Benchmark
von: Zhang, Haozhen, et al.
Veröffentlicht: (2025)
von: Zhang, Haozhen, et al.
Veröffentlicht: (2025)
Highly Efficient Self-Adaptive Reward Shaping for Reinforcement Learning
von: Ma, Haozhe, et al.
Veröffentlicht: (2024)
von: Ma, Haozhe, et al.
Veröffentlicht: (2024)
Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning
von: Zabounidis, Renos, et al.
Veröffentlicht: (2025)
von: Zabounidis, Renos, et al.
Veröffentlicht: (2025)
Entropy-Guided Data-Efficient Training for Multimodal Reasoning Reward Models
von: Yang, Shidong, et al.
Veröffentlicht: (2026)
von: Yang, Shidong, et al.
Veröffentlicht: (2026)
Spectral Evolution Search: Efficient Inference-Time Scaling for Reward-Aligned Image Generation
von: Ye, Jinyan, et al.
Veröffentlicht: (2026)
von: Ye, Jinyan, et al.
Veröffentlicht: (2026)
Effective Reward Specification in Deep Reinforcement Learning
von: Roy, Julien
Veröffentlicht: (2024)
von: Roy, Julien
Veröffentlicht: (2024)
MYCROFT: Towards Effective and Efficient External Data Augmentation
von: Sarwar, Zain, et al.
Veröffentlicht: (2024)
von: Sarwar, Zain, et al.
Veröffentlicht: (2024)
Towards Effective Code-Integrated Reasoning
von: Bai, Fei, et al.
Veröffentlicht: (2025)
von: Bai, Fei, et al.
Veröffentlicht: (2025)
Towards Trustworthy Multimodal Moderation via Policy-Aligned Reasoning and Hierarchical Labeling
von: Li, Anqi, et al.
Veröffentlicht: (2025)
von: Li, Anqi, et al.
Veröffentlicht: (2025)
ReMax: A Simple, Effective, and Efficient Reinforcement Learning Method for Aligning Large Language Models
von: Li, Ziniu, et al.
Veröffentlicht: (2023)
von: Li, Ziniu, et al.
Veröffentlicht: (2023)
Graph World Model
von: Feng, Tao, et al.
Veröffentlicht: (2025)
von: Feng, Tao, et al.
Veröffentlicht: (2025)
Rank and Align: Towards Effective Source-free Graph Domain Adaptation
von: Luo, Junyu, et al.
Veröffentlicht: (2024)
von: Luo, Junyu, et al.
Veröffentlicht: (2024)
Bridged Clustering: Semi-Supervised Sparse Bridging
von: Ye, Patrick Peixuan, et al.
Veröffentlicht: (2025)
von: Ye, Patrick Peixuan, et al.
Veröffentlicht: (2025)
GUIDE: Towards Scalable Advising for Research Ideas
von: Liu, Yaowenqi, et al.
Veröffentlicht: (2025)
von: Liu, Yaowenqi, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Classifier Language Models: Unifying Sparse Finetuning and Adaptive Tokenization for Specialized Classification Tasks
von: Krishnan, Adit, et al.
Veröffentlicht: (2025) -
Time-R1: Towards Comprehensive Temporal Reasoning in LLMs
von: Liu, Zijia, et al.
Veröffentlicht: (2025) -
DRPG (Decompose, Retrieve, Plan, Generate): An Agentic Framework for Academic Rebuttal
von: Han, Peixuan, et al.
Veröffentlicht: (2026) -
Effects of Feature Correlations on Associative Memory Capacity
von: Bielmeier, Stefan, et al.
Veröffentlicht: (2025) -
CEV-LM: Controlled Edit Vector Language Model for Shaping Natural Language Generations
von: Moorjani, Samraj, et al.
Veröffentlicht: (2024)