Sparse Reward Subsystem in Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xu, Guowei, Yuksekgonul, Mert, Zou, James |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
metaTextGrad: Automatically optimizing language model optimizers
par: Xu, Guowei, et autres
Publié: (2025)
par: Xu, Guowei, et autres
Publié: (2025)
Cost-of-Pass: An Economic Framework for Evaluating Language Models
par: Erol, Mehmet Hamza, et autres
Publié: (2025)
par: Erol, Mehmet Hamza, et autres
Publié: (2025)
Dynamic Cheatsheet: Test-Time Learning with Adaptive Memory
par: Suzgun, Mirac, et autres
Publié: (2025)
par: Suzgun, Mirac, et autres
Publié: (2025)
How Well Can LLMs Negotiate? NegotiationArena Platform and Analysis
par: Bianchi, Federico, et autres
Publié: (2024)
par: Bianchi, Federico, et autres
Publié: (2024)
TextGrad: Automatic "Differentiation" via Text
par: Yuksekgonul, Mert, et autres
Publié: (2024)
par: Yuksekgonul, Mert, et autres
Publié: (2024)
Diversity of Thought Improves Reasoning Abilities of LLMs
par: Naik, Ranjita, et autres
Publié: (2023)
par: Naik, Ranjita, et autres
Publié: (2023)
Attention Satisfies: A Constraint-Satisfaction Lens on Factual Errors of Language Models
par: Yuksekgonul, Mert, et autres
Publié: (2023)
par: Yuksekgonul, Mert, et autres
Publié: (2023)
Can LLM feedback enhance review quality? A randomized study of 20K reviews at ICLR 2025
par: Thakkar, Nitya, et autres
Publié: (2025)
par: Thakkar, Nitya, et autres
Publié: (2025)
Generalist Reward Models: Found Inside Large Language Models
par: Li, Yi-Chen, et autres
Publié: (2025)
par: Li, Yi-Chen, et autres
Publié: (2025)
Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey
par: Liu, Qiyuan, et autres
Publié: (2025)
par: Liu, Qiyuan, et autres
Publié: (2025)
GIFT: Guided Importance-Aware Fine-Tuning for Diffusion Language Models
par: Xu, Guowei, et autres
Publié: (2025)
par: Xu, Guowei, et autres
Publié: (2025)
Inefficiencies of Meta Agents for Agent Design
par: El, Batu, et autres
Publié: (2025)
par: El, Batu, et autres
Publié: (2025)
PERM: Psychology-grounded Empathetic Reward Modeling for Large Language Models
par: Wang, Chengbing, et autres
Publié: (2026)
par: Wang, Chengbing, et autres
Publié: (2026)
Sparse Subnetwork Enhancement for Underrepresented Languages in Large Language Models
par: Gurgurov, Daniil, et autres
Publié: (2025)
par: Gurgurov, Daniil, et autres
Publié: (2025)
Large Language Models are Vulnerable to Bait-and-Switch Attacks for Generating Harmful Content
par: Bianchi, Federico, et autres
Publié: (2024)
par: Bianchi, Federico, et autres
Publié: (2024)
SteerRM: Debiasing Reward Models via Sparse Autoencoders
par: Sun, Mengyuan, et autres
Publié: (2026)
par: Sun, Mengyuan, et autres
Publié: (2026)
Sparse Matrix in Large Language Model Fine-tuning
par: He, Haoze, et autres
Publié: (2024)
par: He, Haoze, et autres
Publié: (2024)
Mixture-of-Agents Enhances Large Language Model Capabilities
par: Wang, Junlin, et autres
Publié: (2024)
par: Wang, Junlin, et autres
Publié: (2024)
ToolRM: Outcome Reward Models for Tool-Calling Large Language Models
par: Agarwal, Mayank, et autres
Publié: (2025)
par: Agarwal, Mayank, et autres
Publié: (2025)
Prior Constraints-based Reward Model Training for Aligning Large Language Models
par: Zhou, Hang, et autres
Publié: (2024)
par: Zhou, Hang, et autres
Publié: (2024)
Towards Signal Processing In Large Language Models
par: Verma, Prateek, et autres
Publié: (2024)
par: Verma, Prateek, et autres
Publié: (2024)
Evaluating Large Language Models with Psychometrics
par: Li, Yuan, et autres
Publié: (2024)
par: Li, Yuan, et autres
Publié: (2024)
Beyond Sparse Rewards: Enhancing Reinforcement Learning with Language Model Critique in Text Generation
par: Cao, Meng, et autres
Publié: (2024)
par: Cao, Meng, et autres
Publié: (2024)
Improving Data and Reward Design for Scientific Reasoning in Large Language Models
par: Chen, Zijie, et autres
Publié: (2026)
par: Chen, Zijie, et autres
Publié: (2026)
Robustness of Prompting: Enhancing Robustness of Large Language Models Against Prompting Attacks
par: Mu, Lin, et autres
Publié: (2025)
par: Mu, Lin, et autres
Publié: (2025)
Self-Rewarding Language Models
par: Yuan, Weizhe, et autres
Publié: (2024)
par: Yuan, Weizhe, et autres
Publié: (2024)
SparseEval: Efficient Evaluation of Large Language Models by Sparse Optimization
par: Zhang, Taolin, et autres
Publié: (2026)
par: Zhang, Taolin, et autres
Publié: (2026)
Adaptive Large Language Models By Layerwise Attention Shortcuts
par: Verma, Prateek, et autres
Publié: (2024)
par: Verma, Prateek, et autres
Publié: (2024)
SAFER: Probing Safety in Reward Models with Sparse Autoencoder
par: Shi, Wei, et autres
Publié: (2025)
par: Shi, Wei, et autres
Publié: (2025)
MemoryRewardBench: Benchmarking Reward Models for Long-Term Memory Management in Large Language Models
par: Tang, Zecheng, et autres
Publié: (2026)
par: Tang, Zecheng, et autres
Publié: (2026)
Unveiling Language-Specific Features in Large Language Models via Sparse Autoencoders
par: Deng, Boyi, et autres
Publié: (2025)
par: Deng, Boyi, et autres
Publié: (2025)
The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models
par: Xu, Xingcheng
Publié: (2025)
par: Xu, Xingcheng
Publié: (2025)
Detoxifying Large Language Models via Autoregressive Reward Guided Representation Editing
par: Xiao, Yisong, et autres
Publié: (2025)
par: Xiao, Yisong, et autres
Publié: (2025)
Talking Nonsense: Probing Large Language Models' Understanding of Adversarial Gibberish Inputs
par: Cherepanova, Valeriia, et autres
Publié: (2024)
par: Cherepanova, Valeriia, et autres
Publié: (2024)
Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models
par: Ding, Meidan, et autres
Publié: (2025)
par: Ding, Meidan, et autres
Publié: (2025)
Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models
par: Denison, Carson, et autres
Publié: (2024)
par: Denison, Carson, et autres
Publié: (2024)
Q-Sparse: All Large Language Models can be Fully Sparsely-Activated
par: Wang, Hongyu, et autres
Publié: (2024)
par: Wang, Hongyu, et autres
Publié: (2024)
VerifyBench: Benchmarking Reference-based Reward Systems for Large Language Models
par: Yan, Yuchen, et autres
Publié: (2025)
par: Yan, Yuchen, et autres
Publié: (2025)
RFG: Test-Time Scaling for Diffusion Large Language Model Reasoning with Reward-Free Guidance
par: Chen, Tianlang, et autres
Publié: (2025)
par: Chen, Tianlang, et autres
Publié: (2025)
Punctuation-aware Hybrid Trainable Sparse Attention for Large Language Models
par: Qiu, Junxiang, et autres
Publié: (2026)
par: Qiu, Junxiang, et autres
Publié: (2026)
Documents similaires
-
metaTextGrad: Automatically optimizing language model optimizers
par: Xu, Guowei, et autres
Publié: (2025) -
Cost-of-Pass: An Economic Framework for Evaluating Language Models
par: Erol, Mehmet Hamza, et autres
Publié: (2025) -
Dynamic Cheatsheet: Test-Time Learning with Adaptive Memory
par: Suzgun, Mirac, et autres
Publié: (2025) -
How Well Can LLMs Negotiate? NegotiationArena Platform and Analysis
par: Bianchi, Federico, et autres
Publié: (2024) -
TextGrad: Automatic "Differentiation" via Text
par: Yuksekgonul, Mert, et autres
Publié: (2024)