LongRM: Revealing and Unlocking the Context Boundary of Reward Modeling
Fuente:
arXiv
Salvato in:
| Autori principali: | Tang, Zecheng, Ji, Baibei, Qiu, Quantong, Wang, Haitian, Liang, Xiaobo, Li, Juntao, Zhang, Min |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Revisiting Long-context Modeling from Context Denoising Perspective
di: Tang, Zecheng, et al.
Pubblicazione: (2025)
di: Tang, Zecheng, et al.
Pubblicazione: (2025)
MemoryRewardBench: Benchmarking Reward Models for Long-Term Memory Management in Large Language Models
di: Tang, Zecheng, et al.
Pubblicazione: (2026)
di: Tang, Zecheng, et al.
Pubblicazione: (2026)
MemReread: Enhancing Agentic Long-Context Reasoning via Memory-Guided Rereading
di: Ji, Baibei, et al.
Pubblicazione: (2026)
di: Ji, Baibei, et al.
Pubblicazione: (2026)
LOOM-Scope: a comprehensive and efficient LOng-cOntext Model evaluation framework
di: Tang, Zecheng, et al.
Pubblicazione: (2025)
di: Tang, Zecheng, et al.
Pubblicazione: (2025)
L-CiteEval: Do Long-Context Models Truly Leverage Context for Responding?
di: Tang, Zecheng, et al.
Pubblicazione: (2024)
di: Tang, Zecheng, et al.
Pubblicazione: (2024)
MemLong: Memory-Augmented Retrieval for Long Text Modeling
di: Liu, Weijie, et al.
Pubblicazione: (2024)
di: Liu, Weijie, et al.
Pubblicazione: (2024)
Revealing and Mitigating the Local Pattern Shortcuts of Mamba
di: You, Wangjie, et al.
Pubblicazione: (2024)
di: You, Wangjie, et al.
Pubblicazione: (2024)
Elastic Attention: Test-time Adaptive Sparsity Ratios for Efficient Transformers
di: Tang, Zecheng, et al.
Pubblicazione: (2026)
di: Tang, Zecheng, et al.
Pubblicazione: (2026)
Unlocking Recursive Thinking of LLMs: Alignment via Refinement
di: Zhang, Haoke, et al.
Pubblicazione: (2025)
di: Zhang, Haoke, et al.
Pubblicazione: (2025)
Revealing and Mitigating Over-Attention in Knowledge Editing
di: Wang, Pinzheng, et al.
Pubblicazione: (2025)
di: Wang, Pinzheng, et al.
Pubblicazione: (2025)
LOGO -- Long cOntext aliGnment via efficient preference Optimization
di: Tang, Zecheng, et al.
Pubblicazione: (2024)
di: Tang, Zecheng, et al.
Pubblicazione: (2024)
RM-R1: Reward Modeling as Reasoning
di: Chen, Xiusi, et al.
Pubblicazione: (2025)
di: Chen, Xiusi, et al.
Pubblicazione: (2025)
ToolRM: Towards Agentic Tool-Use Reward Modeling
di: Li, Renhao, et al.
Pubblicazione: (2025)
di: Li, Renhao, et al.
Pubblicazione: (2025)
Fennec: Fine-grained Language Model Evaluation and Correction Extended through Branching and Bridging
di: Liang, Xiaobo, et al.
Pubblicazione: (2024)
di: Liang, Xiaobo, et al.
Pubblicazione: (2024)
Sequence to Sequence Reward Modeling: Improving RLHF by Language Feedback
di: Zhou, Jiayi, et al.
Pubblicazione: (2024)
di: Zhou, Jiayi, et al.
Pubblicazione: (2024)
AgentRM: Enhancing Agent Generalization with Reward Modeling
di: Xia, Yu, et al.
Pubblicazione: (2025)
di: Xia, Yu, et al.
Pubblicazione: (2025)
Flux Attention: Context-Aware Hybrid Attention for Efficient LLMs Inference
di: Qiu, Quantong, et al.
Pubblicazione: (2026)
di: Qiu, Quantong, et al.
Pubblicazione: (2026)
ConsistRM: Improving Generative Reward Models via Consistency-Aware Self-Training
di: Liang, Yu, et al.
Pubblicazione: (2026)
di: Liang, Yu, et al.
Pubblicazione: (2026)
ReflectRM: Boosting Generative Reward Models via Self-Reflection within a Unified Judgment Framework
di: Qin, Kai, et al.
Pubblicazione: (2026)
di: Qin, Kai, et al.
Pubblicazione: (2026)
Unleashing LLM Reasoning Capability via Scalable Question Synthesis from Scratch
di: Ding, Yuyang, et al.
Pubblicazione: (2024)
di: Ding, Yuyang, et al.
Pubblicazione: (2024)
SoLoPO: Unlocking Long-Context Capabilities in LLMs via Short-to-Long Preference Optimization
di: Sun, Huashan, et al.
Pubblicazione: (2025)
di: Sun, Huashan, et al.
Pubblicazione: (2025)
ImplicitRM: Unbiased Reward Modeling from Implicit Preference Data for LLM alignment
di: Wang, Hao, et al.
Pubblicazione: (2026)
di: Wang, Hao, et al.
Pubblicazione: (2026)
ALaRM: Align Language Models via Hierarchical Rewards Modeling
di: Lai, Yuhang, et al.
Pubblicazione: (2024)
di: Lai, Yuhang, et al.
Pubblicazione: (2024)
ProgRM: Build Better GUI Agents with Progress Rewards
di: Zhang, Danyang, et al.
Pubblicazione: (2025)
di: Zhang, Danyang, et al.
Pubblicazione: (2025)
Adaptive Ability Decomposing for Unlocking Large Reasoning Model Effective Reinforcement Learning
di: Chen, Zhipeng, et al.
Pubblicazione: (2026)
di: Chen, Zhipeng, et al.
Pubblicazione: (2026)
CausalRM: Causal-Theoretic Reward Modeling for RLHF from Observational User Feedbacks
di: Wang, Hao, et al.
Pubblicazione: (2026)
di: Wang, Hao, et al.
Pubblicazione: (2026)
LooGLE: Can Long-Context Language Models Understand Long Contexts?
di: Li, Jiaqi, et al.
Pubblicazione: (2023)
di: Li, Jiaqi, et al.
Pubblicazione: (2023)
Evidence-Augmented Policy Optimization with Reward Co-Evolution for Long-Context Reasoning
di: Guan, Xin, et al.
Pubblicazione: (2026)
di: Guan, Xin, et al.
Pubblicazione: (2026)
Improving Rationality in the Reasoning Process of Language Models through Self-playing Game
di: Wang, Pinzheng, et al.
Pubblicazione: (2025)
di: Wang, Pinzheng, et al.
Pubblicazione: (2025)
SparseRM: A Lightweight Preference Modeling with Sparse Autoencoder
di: Liu, Dengcan, et al.
Pubblicazione: (2025)
di: Liu, Dengcan, et al.
Pubblicazione: (2025)
On the Transformations across Reward Model, Parameter Update, and In-Context Prompt
di: Cai, Deng, et al.
Pubblicazione: (2024)
di: Cai, Deng, et al.
Pubblicazione: (2024)
Unlocking Instructive In-Context Learning with Tabular Prompting for Relational Triple Extraction
di: Li, Guozheng, et al.
Pubblicazione: (2024)
di: Li, Guozheng, et al.
Pubblicazione: (2024)
DiffuSpec: Unlocking Diffusion Language Models for Speculative Decoding
di: Li, Guanghao, et al.
Pubblicazione: (2025)
di: Li, Guanghao, et al.
Pubblicazione: (2025)
LongSafety: Evaluating Long-Context Safety of Large Language Models
di: Lu, Yida, et al.
Pubblicazione: (2025)
di: Lu, Yida, et al.
Pubblicazione: (2025)
From General to Targeted Rewards: Surpassing GPT-4 in Open-Ended Long-Context Generation
di: Guo, Zhihan, et al.
Pubblicazione: (2025)
di: Guo, Zhihan, et al.
Pubblicazione: (2025)
RC-GRPO: Reward-Conditioned Group Relative Policy Optimization for Multi-Turn Tool Calling Agents
di: Zhong, Haitian, et al.
Pubblicazione: (2026)
di: Zhong, Haitian, et al.
Pubblicazione: (2026)
Unlocking Multimodal Mathematical Reasoning via Process Reward Model
di: Luo, Ruilin, et al.
Pubblicazione: (2025)
di: Luo, Ruilin, et al.
Pubblicazione: (2025)
Dynamic Long Context Reasoning over Compressed Memory via End-to-End Reinforcement Learning
di: Chen, Zhuoen, et al.
Pubblicazione: (2026)
di: Chen, Zhuoen, et al.
Pubblicazione: (2026)
Rewards-in-Context: Multi-objective Alignment of Foundation Models with Dynamic Preference Adjustment
di: Yang, Rui, et al.
Pubblicazione: (2024)
di: Yang, Rui, et al.
Pubblicazione: (2024)
Every Token Counts: Generalizing 16M Ultra-Long Context in Large Language Models
di: Hu, Xiang, et al.
Pubblicazione: (2025)
di: Hu, Xiang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Revisiting Long-context Modeling from Context Denoising Perspective
di: Tang, Zecheng, et al.
Pubblicazione: (2025) -
MemoryRewardBench: Benchmarking Reward Models for Long-Term Memory Management in Large Language Models
di: Tang, Zecheng, et al.
Pubblicazione: (2026) -
MemReread: Enhancing Agentic Long-Context Reasoning via Memory-Guided Rereading
di: Ji, Baibei, et al.
Pubblicazione: (2026) -
LOOM-Scope: a comprehensive and efficient LOng-cOntext Model evaluation framework
di: Tang, Zecheng, et al.
Pubblicazione: (2025) -
L-CiteEval: Do Long-Context Models Truly Leverage Context for Responding?
di: Tang, Zecheng, et al.
Pubblicazione: (2024)