APR: Penalizing Structural Redundancy in Large Reasoning Models via Anchor-based Process Rewards
Fuente:
arXiv
Salvato in:
| Autori principali: | Chang, Kaiyan, Zhu, Chenwei, Luo, Yingfeng, Huo, Yifu, Wang, Chenglong, Liu, Xiaoqian, He, Qiaozhi, Xiao, Tong, Yu, Zhengtao, Zhu, Jingbo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Efficient Prompting Methods for Large Language Models: A Survey
di: Chang, Kaiyan, et al.
Pubblicazione: (2024)
di: Chang, Kaiyan, et al.
Pubblicazione: (2024)
SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models
di: Huo, Yifu, et al.
Pubblicazione: (2026)
di: Huo, Yifu, et al.
Pubblicazione: (2026)
GRAM: A Generative Foundation Reward Model for Reward Generalization
di: Wang, Chenglong, et al.
Pubblicazione: (2025)
di: Wang, Chenglong, et al.
Pubblicazione: (2025)
Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models
di: Chang, Kaiyan, et al.
Pubblicazione: (2025)
di: Chang, Kaiyan, et al.
Pubblicazione: (2025)
When Scaling Fails: Mitigating Audio Perception Decay of LALMs via Multi-Step Perception-Aware Reasoning
di: Mao, Ruixiang, et al.
Pubblicazione: (2026)
di: Mao, Ruixiang, et al.
Pubblicazione: (2026)
Probing Preference Representations: A Multi-Dimensional Evaluation and Analysis Method for Reward Models
di: Wang, Chenglong, et al.
Pubblicazione: (2025)
di: Wang, Chenglong, et al.
Pubblicazione: (2025)
MSRL: Scaling Generative Multimodal Reward Modeling via Multi-Stage Reinforcement Learning
di: Wang, Chenglong, et al.
Pubblicazione: (2026)
di: Wang, Chenglong, et al.
Pubblicazione: (2026)
Boosting Text-To-Image Generation via Multilingual Prompting in Large Multimodal Models
di: Mu, Yongyu, et al.
Pubblicazione: (2025)
di: Mu, Yongyu, et al.
Pubblicazione: (2025)
RoVRM: A Robust Visual Reward Model Optimized via Auxiliary Textual Preference Data
di: Wang, Chenglong, et al.
Pubblicazione: (2024)
di: Wang, Chenglong, et al.
Pubblicazione: (2024)
RouteLMT: Learned Sample Routing for Hybrid LLM Translation Deployment
di: Luo, Yingfeng, et al.
Pubblicazione: (2026)
di: Luo, Yingfeng, et al.
Pubblicazione: (2026)
LRHP: Learning Representations for Human Preferences via Preference Pairs
di: Wang, Chenglong, et al.
Pubblicazione: (2024)
di: Wang, Chenglong, et al.
Pubblicazione: (2024)
GRAM-R$^2$: Self-Training Generative Foundation Reward Models for Reward Reasoning
di: Wang, Chenglong, et al.
Pubblicazione: (2025)
di: Wang, Chenglong, et al.
Pubblicazione: (2025)
SERM: Self-Evolving Relevance Model with Agent-Driven Learning from Massive Query Streams
di: Wang, Chenglong, et al.
Pubblicazione: (2026)
di: Wang, Chenglong, et al.
Pubblicazione: (2026)
One Size Does Not Fit All: A Distribution-Aware Sparsification for More Precise Model Merging
di: Luo, Yingfeng, et al.
Pubblicazione: (2025)
di: Luo, Yingfeng, et al.
Pubblicazione: (2025)
Hybrid Alignment Training for Large Language Models
di: Wang, Chenglong, et al.
Pubblicazione: (2024)
di: Wang, Chenglong, et al.
Pubblicazione: (2024)
Recent Advances in End-to-End Simultaneous Speech Translation
di: Liu, Xiaoqian, et al.
Pubblicazione: (2024)
di: Liu, Xiaoqian, et al.
Pubblicazione: (2024)
Prior Constraints-based Reward Model Training for Aligning Large Language Models
di: Zhou, Hang, et al.
Pubblicazione: (2024)
di: Zhou, Hang, et al.
Pubblicazione: (2024)
Learning Evaluation Models from Large Language Models for Sequence Generation
di: Wang, Chenglong, et al.
Pubblicazione: (2023)
di: Wang, Chenglong, et al.
Pubblicazione: (2023)
EfficientGraph-RAG: Structured Retrieval-State Management for Cross-Task Retrieval-Augmented Generation
di: Niu, Miaohe, et al.
Pubblicazione: (2026)
di: Niu, Miaohe, et al.
Pubblicazione: (2026)
MRO: Enhancing Reasoning in Diffusion Language Models via Multi-Reward Optimization
di: Wang, Chenglong, et al.
Pubblicazione: (2025)
di: Wang, Chenglong, et al.
Pubblicazione: (2025)
ChartAnchor: Chart Grounding with Structural-Semantic Fidelity
di: Li, Xinhang, et al.
Pubblicazione: (2025)
di: Li, Xinhang, et al.
Pubblicazione: (2025)
LaTeXTrans: Structured LaTeX Translation with Multi-Agent Coordination
di: Zhu, Ziming, et al.
Pubblicazione: (2025)
di: Zhu, Ziming, et al.
Pubblicazione: (2025)
Autoencoding-Free Context Compression for LLMs via Contextual Semantic Anchors
di: Liu, Xin, et al.
Pubblicazione: (2025)
di: Liu, Xin, et al.
Pubblicazione: (2025)
Beyond Decoder-only: Large Language Models Can be Good Encoders for Machine Translation
di: Luo, Yingfeng, et al.
Pubblicazione: (2025)
di: Luo, Yingfeng, et al.
Pubblicazione: (2025)
Foundations of Large Language Models
di: Xiao, Tong, et al.
Pubblicazione: (2025)
di: Xiao, Tong, et al.
Pubblicazione: (2025)
Reconsidering Overthinking: Penalizing Internal and External Redundancy in CoT Reasoning
di: Hong, Jialiang, et al.
Pubblicazione: (2025)
di: Hong, Jialiang, et al.
Pubblicazione: (2025)
FLEXI: Benchmarking Full-duplex Human-LLM Speech Interaction
di: Ge, Yuan, et al.
Pubblicazione: (2025)
di: Ge, Yuan, et al.
Pubblicazione: (2025)
NiuTrans.LMT: Toward Inclusive and Scalable Multilingual Machine Translation with LLMs
di: Luo, Yingfeng, et al.
Pubblicazione: (2025)
di: Luo, Yingfeng, et al.
Pubblicazione: (2025)
DaPT: A Dual-Path Framework for Multilingual Multi-hop Question Answering
di: Wang, Yilin, et al.
Pubblicazione: (2026)
di: Wang, Yilin, et al.
Pubblicazione: (2026)
Cross-layer Attention Sharing for Pre-trained Large Language Models
di: Mu, Yongyu, et al.
Pubblicazione: (2024)
di: Mu, Yongyu, et al.
Pubblicazione: (2024)
HEAL: A Hypothesis-Based Preference-Aware Analysis Framework
di: Huo, Yifu, et al.
Pubblicazione: (2025)
di: Huo, Yifu, et al.
Pubblicazione: (2025)
Early Exit Is a Natural Capability in Transformer-based Models: An Empirical Study on Early Exit without Joint Optimization
di: Shan, Weiqiao, et al.
Pubblicazione: (2024)
di: Shan, Weiqiao, et al.
Pubblicazione: (2024)
MTP-S2UT: Enhancing Speech-to-Speech Translation Quality with Multi-token Prediction
di: Wang, Jianjin, et al.
Pubblicazione: (2025)
di: Wang, Jianjin, et al.
Pubblicazione: (2025)
On the Emotion Understanding of Synthesized Speech
di: Ge, Yuan, et al.
Pubblicazione: (2026)
di: Ge, Yuan, et al.
Pubblicazione: (2026)
SUBQRAG: Sub-Question Driven Dynamic Graph RAG
di: Li, Jiaoyang, et al.
Pubblicazione: (2025)
di: Li, Jiaoyang, et al.
Pubblicazione: (2025)
SageLM: A Multi-aspect and Explainable Large Language Model for Speech Judgement
di: Ge, Yuan, et al.
Pubblicazione: (2025)
di: Ge, Yuan, et al.
Pubblicazione: (2025)
Enhancing Speech Large Language Models with Prompt-Aware Mixture of Audio Encoders
di: Shan, Weiqiao, et al.
Pubblicazione: (2025)
di: Shan, Weiqiao, et al.
Pubblicazione: (2025)
Exploring Scaling Laws for Local SGD in Large Language Model Training
di: He, Qiaozhi, et al.
Pubblicazione: (2024)
di: He, Qiaozhi, et al.
Pubblicazione: (2024)
MemoSight: Unifying Context Compression and Multi Token Prediction for Reasoning Acceleration
di: Liu, Xinyu, et al.
Pubblicazione: (2026)
di: Liu, Xinyu, et al.
Pubblicazione: (2026)
HR-APR: APR-agnostic Framework with Uncertainty Estimation and Hierarchical Refinement for Camera Relocalisation
di: Liu, Changkun, et al.
Pubblicazione: (2024)
di: Liu, Changkun, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Efficient Prompting Methods for Large Language Models: A Survey
di: Chang, Kaiyan, et al.
Pubblicazione: (2024) -
SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models
di: Huo, Yifu, et al.
Pubblicazione: (2026) -
GRAM: A Generative Foundation Reward Model for Reward Generalization
di: Wang, Chenglong, et al.
Pubblicazione: (2025) -
Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models
di: Chang, Kaiyan, et al.
Pubblicazione: (2025) -
When Scaling Fails: Mitigating Audio Perception Decay of LALMs via Multi-Step Perception-Aware Reasoning
di: Mao, Ruixiang, et al.
Pubblicazione: (2026)