Learning Goal-Conditioned Representations for Language Reward Models
Fuente:
arXiv
Saved in:
| Main Authors: | Nath, Vaskar, Slack, Dylan, Da, Jeff, Ma, Yuntao, Zhang, Hugh, Whitehead, Spencer, Hendryx, Sean |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Revisiting the Superficial Alignment Hypothesis
by: Raghavendra, Mohit, et al.
Published: (2024)
by: Raghavendra, Mohit, et al.
Published: (2024)
ToolComp: A Multi-Tool Reasoning & Process Supervision Benchmark
by: Nath, Vaskar, et al.
Published: (2025)
by: Nath, Vaskar, et al.
Published: (2025)
Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards
by: Da, Jeff, et al.
Published: (2025)
by: Da, Jeff, et al.
Published: (2025)
Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains
by: Gunjal, Anisha, et al.
Published: (2025)
by: Gunjal, Anisha, et al.
Published: (2025)
Pre-Training Multimodal Hallucination Detectors with Corrupted Grounding Data
by: Whitehead, Spencer, et al.
Published: (2024)
by: Whitehead, Spencer, et al.
Published: (2024)
Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models
by: Nath, Vaskar, et al.
Published: (2025)
by: Nath, Vaskar, et al.
Published: (2025)
Planning In Natural Language Improves LLM Search For Code Generation
by: Wang, Evan, et al.
Published: (2024)
by: Wang, Evan, et al.
Published: (2024)
A Careful Examination of Large Language Model Performance on Grade School Arithmetic
by: Zhang, Hugh, et al.
Published: (2024)
by: Zhang, Hugh, et al.
Published: (2024)
Progress over Points: Reframing LM Benchmarks Around Scientific Objectives
by: Jin, Alwin, et al.
Published: (2025)
by: Jin, Alwin, et al.
Published: (2025)
A Baseline Analysis of Reward Models' Ability To Accurately Analyze Foundation Models Under Distribution Shift
by: LeVine, Will, et al.
Published: (2023)
by: LeVine, Will, et al.
Published: (2023)
Simultaneous Reward Distillation and Preference Learning: Get You a Language Model Who Can Do Both
by: Nath, Abhijnan, et al.
Published: (2024)
by: Nath, Abhijnan, et al.
Published: (2024)
Detoxifying Large Language Models via Autoregressive Reward Guided Representation Editing
by: Xiao, Yisong, et al.
Published: (2025)
by: Xiao, Yisong, et al.
Published: (2025)
Efficient Safety Alignment of Large Language Models via Preference Re-ranking and Representation-based Reward Modeling
by: Deng, Qiyuan, et al.
Published: (2025)
by: Deng, Qiyuan, et al.
Published: (2025)
Parameter-Efficient Tuning Large Language Models for Graph Representation Learning
by: Zhu, Qi, et al.
Published: (2024)
by: Zhu, Qi, et al.
Published: (2024)
UserLM-R1: Modeling Human Reasoning in User Language Models with Multi-Reward Reinforcement Learning
by: Zhang, Feng, et al.
Published: (2026)
by: Zhang, Feng, et al.
Published: (2026)
Entropy-Regularized Process Reward Model
by: Zhang, Hanning, et al.
Published: (2024)
by: Zhang, Hanning, et al.
Published: (2024)
A Behavioural and Representational Evaluation of Goal-Directedness in Language Model Agents
by: Arghal, Raghu, et al.
Published: (2026)
by: Arghal, Raghu, et al.
Published: (2026)
Going 3D with Technology: An Overarching Approach for Language Teachers
by: Jason D. Hendryx
Published: (2016)
by: Jason D. Hendryx
Published: (2016)
Checklists Are Better Than Reward Models For Aligning Language Models
by: Viswanathan, Vijay, et al.
Published: (2025)
by: Viswanathan, Vijay, et al.
Published: (2025)
Probing Preference Representations: A Multi-Dimensional Evaluation and Analysis Method for Reward Models
by: Wang, Chenglong, et al.
Published: (2025)
by: Wang, Chenglong, et al.
Published: (2025)
Compositional Automata Embeddings for Goal-Conditioned Reinforcement Learning
by: Yalcinkaya, Beyazit, et al.
Published: (2024)
by: Yalcinkaya, Beyazit, et al.
Published: (2024)
Adversarial Representation with Intra-Modal and Inter-Modal Graph Contrastive Learning for Multimodal Emotion Recognition
by: Shou, Yuntao, et al.
Published: (2023)
by: Shou, Yuntao, et al.
Published: (2023)
Just Do It!? Computer-Use Agents Exhibit Blind Goal-Directedness
by: Shayegani, Erfan, et al.
Published: (2025)
by: Shayegani, Erfan, et al.
Published: (2025)
Conditional Language Learning with Context
by: Zhang, Xiao, et al.
Published: (2024)
by: Zhang, Xiao, et al.
Published: (2024)
Reinforcement Learning with Conditional Expectation Reward
by: Xiao, Changyi, et al.
Published: (2026)
by: Xiao, Changyi, et al.
Published: (2026)
Constraint-aware Path Planning from Natural Language Instructions Using Large Language Models
by: Shim, Dylan, et al.
Published: (2026)
by: Shim, Dylan, et al.
Published: (2026)
Reward Modeling with Weak Supervision for Language Models
by: Hauptvogel, Ben, et al.
Published: (2024)
by: Hauptvogel, Ben, et al.
Published: (2024)
Reward Modeling from Natural Language Human Feedback
by: Wang, Zongqi, et al.
Published: (2026)
by: Wang, Zongqi, et al.
Published: (2026)
Flexible Agent Alignment with Goal Inference from Open-Ended Dialog
by: Ma, Rachel, et al.
Published: (2025)
by: Ma, Rachel, et al.
Published: (2025)
Multimodal Large Language Models Meet Multimodal Emotion Recognition and Reasoning: A Survey
by: Shou, Yuntao, et al.
Published: (2025)
by: Shou, Yuntao, et al.
Published: (2025)
Generalist Reward Models: Found Inside Large Language Models
by: Li, Yi-Chen, et al.
Published: (2025)
by: Li, Yi-Chen, et al.
Published: (2025)
Early Detection and Reduction of Memorisation for Domain Adaptation and Instruction Tuning
by: Slack, Dean L., et al.
Published: (2025)
by: Slack, Dean L., et al.
Published: (2025)
Process-based Self-Rewarding Language Models
by: Zhang, Shimao, et al.
Published: (2025)
by: Zhang, Shimao, et al.
Published: (2025)
Universal Adversarial Suffixes for Language Models Using Reinforcement Learning with Calibrated Reward
by: Soor, Sampriti, et al.
Published: (2025)
by: Soor, Sampriti, et al.
Published: (2025)
Sailing by the Stars: A Survey on Reward Models and Learning Strategies for Learning from Rewards
by: Wu, Xiaobao
Published: (2025)
by: Wu, Xiaobao
Published: (2025)
Search-R3: Unifying Reasoning and Embedding in Large Language Models
by: Gui, Yuntao, et al.
Published: (2025)
by: Gui, Yuntao, et al.
Published: (2025)
Revisiting Multi-modal Emotion Learning with Broad State Space Models and Probability-guidance Fusion
by: Shou, Yuntao, et al.
Published: (2024)
by: Shou, Yuntao, et al.
Published: (2024)
PERM: Psychology-grounded Empathetic Reward Modeling for Large Language Models
by: Wang, Chengbing, et al.
Published: (2026)
by: Wang, Chengbing, et al.
Published: (2026)
Defending Large Language Models Against Jailbreaking Attacks Through Goal Prioritization
by: Zhang, Zhexin, et al.
Published: (2023)
by: Zhang, Zhexin, et al.
Published: (2023)
Sparse Reward Subsystem in Large Language Models
by: Xu, Guowei, et al.
Published: (2026)
by: Xu, Guowei, et al.
Published: (2026)
Similar Items
-
Revisiting the Superficial Alignment Hypothesis
by: Raghavendra, Mohit, et al.
Published: (2024) -
ToolComp: A Multi-Tool Reasoning & Process Supervision Benchmark
by: Nath, Vaskar, et al.
Published: (2025) -
Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards
by: Da, Jeff, et al.
Published: (2025) -
Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains
by: Gunjal, Anisha, et al.
Published: (2025) -
Pre-Training Multimodal Hallucination Detectors with Corrupted Grounding Data
by: Whitehead, Spencer, et al.
Published: (2024)