Mitigating Think-Answer Mismatch in LLM Reasoning Through Noise-Aware Advantage Reweighting
Fuente:
arXiv
Guardado en:
| Autores principales: | Shen, Si, Shen, Peijun, Zhao, Wenhua, Zhu, Danhao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
RevOrder: A Novel Method for Enhanced Arithmetic in Language Models
por: Shen, Si, et al.
Publicado: (2024)
por: Shen, Si, et al.
Publicado: (2024)
LLM-Metrics: Measuring Research Impact Through Large Language Model Memory
por: Shen, Si, et al.
Publicado: (2026)
por: Shen, Si, et al.
Publicado: (2026)
CurveRL: Principled Distribution-Aware Context Reweighting for LLM Reasoning
por: Sun, Ke, et al.
Publicado: (2026)
por: Sun, Ke, et al.
Publicado: (2026)
GEAR: Granularity-Adaptive Advantage Reweighting for LLM Agents via Self-Distillation
por: Li, Sijia, et al.
Publicado: (2026)
por: Li, Sijia, et al.
Publicado: (2026)
TIAR: Trajectory-Informed Advantage Reweighting for LLM Abstention Learning
por: Pan, Muyu, et al.
Publicado: (2026)
por: Pan, Muyu, et al.
Publicado: (2026)
Taming Extreme Tokens: Covariance-Aware GRPO with Gaussian-Kernel Advantage Reweighting
por: Wang, Cheng, et al.
Publicado: (2026)
por: Wang, Cheng, et al.
Publicado: (2026)
Uncertainty-Aware Answer Selection for Improved Reasoning in Multi-LLM Systems
por: Agrawal, Aakriti, et al.
Publicado: (2025)
por: Agrawal, Aakriti, et al.
Publicado: (2025)
Kernelized Advantage Estimation: From Nonparametric Statistics to LLM Reasoning
por: Gong, Shijin, et al.
Publicado: (2026)
por: Gong, Shijin, et al.
Publicado: (2026)
Learn to Think: Bootstrapping LLM Reasoning Capability Through Graph Representation Learning
por: Gao, Hang, et al.
Publicado: (2025)
por: Gao, Hang, et al.
Publicado: (2025)
Think Dense, Not Long: Dynamic Decoupled Conditional Advantage for Efficient Reasoning
por: Peng, Keqin, et al.
Publicado: (2026)
por: Peng, Keqin, et al.
Publicado: (2026)
Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization
por: Zhang, Qingyang, et al.
Publicado: (2025)
por: Zhang, Qingyang, et al.
Publicado: (2025)
Thinking with Knowledge Graphs: Enhancing LLM Reasoning Through Structured Data
por: Wu, Xue, et al.
Publicado: (2024)
por: Wu, Xue, et al.
Publicado: (2024)
Policy Filtration for RLHF to Mitigate Noise in Reward Models
por: Zhang, Chuheng, et al.
Publicado: (2024)
por: Zhang, Chuheng, et al.
Publicado: (2024)
Efficient Reasoning with Hidden Thinking
por: Shen, Xuan, et al.
Publicado: (2025)
por: Shen, Xuan, et al.
Publicado: (2025)
Topology-Aware Dynamic Reweighting for Distribution Shifts on Graph
por: Zheng, Weihuang, et al.
Publicado: (2024)
por: Zheng, Weihuang, et al.
Publicado: (2024)
Mitigating the Noise Shift for Denoising Generative Models via Noise Awareness Guidance
por: Zhong, Jincheng, et al.
Publicado: (2025)
por: Zhong, Jincheng, et al.
Publicado: (2025)
Accelerating RL for LLM Reasoning with Optimal Advantage Regression
por: Brantley, Kianté, et al.
Publicado: (2025)
por: Brantley, Kianté, et al.
Publicado: (2025)
Quantile Advantage Estimation: Stabilizing RLVR for LLM Reasoning
por: Wu, Junkang, et al.
Publicado: (2025)
por: Wu, Junkang, et al.
Publicado: (2025)
Flow-of-Options: Diversified and Improved LLM Reasoning by Thinking Through Options
por: Nair, Lakshmi, et al.
Publicado: (2025)
por: Nair, Lakshmi, et al.
Publicado: (2025)
Individual Fairness Through Reweighting and Tuning
por: Mahamadou, Abdoul Jalil Djiberou, et al.
Publicado: (2024)
por: Mahamadou, Abdoul Jalil Djiberou, et al.
Publicado: (2024)
Stable Adaptive Thinking via Advantage Shaping and Length-Aware Gradient Regulation
por: Xu, Zihang, et al.
Publicado: (2026)
por: Xu, Zihang, et al.
Publicado: (2026)
ThinkEdit: Interpretable Weight Editing to Mitigate Overly Short Thinking in Reasoning Models
por: Sun, Chung-En, et al.
Publicado: (2025)
por: Sun, Chung-En, et al.
Publicado: (2025)
Arbitrage: Efficient Reasoning via Advantage-Aware Speculation
por: Maheswaran, Monishwaran, et al.
Publicado: (2025)
por: Maheswaran, Monishwaran, et al.
Publicado: (2025)
Mitigating the Language Mismatch and Repetition Issues in LLM-based Machine Translation via Model Editing
por: Wang, Weichuan, et al.
Publicado: (2024)
por: Wang, Weichuan, et al.
Publicado: (2024)
Mitigating Individual Skin Tone Bias in Skin Lesion Classification through Distribution-Aware Reweighting
por: Paxton, Kuniko, et al.
Publicado: (2025)
por: Paxton, Kuniko, et al.
Publicado: (2025)
Thinking Short and Right Over Thinking Long: Serving LLM Reasoning Efficiently and Accurately
por: Wang, Yuhang, et al.
Publicado: (2025)
por: Wang, Yuhang, et al.
Publicado: (2025)
Exploring Criteria of Loss Reweighting to Enhance LLM Unlearning
por: Yang, Puning, et al.
Publicado: (2025)
por: Yang, Puning, et al.
Publicado: (2025)
Enhancing Adversarial Training via Reweighting Optimization Trajectory
por: Huang, Tianjin, et al.
Publicado: (2023)
por: Huang, Tianjin, et al.
Publicado: (2023)
Beyond the Last Answer: Your Reasoning Trace Uncovers More than You Think
por: Hammoud, Hasan Abed Al Kader, et al.
Publicado: (2025)
por: Hammoud, Hasan Abed Al Kader, et al.
Publicado: (2025)
Mitigating Mismatch within Reference-based Preference Optimization
por: Yuan, Suqin, et al.
Publicado: (2026)
por: Yuan, Suqin, et al.
Publicado: (2026)
BASIS: Batchwise Advantage Estimation from Single-Rollout Information Sharing for LLM Reasoning
por: Gong, Shijin, et al.
Publicado: (2026)
por: Gong, Shijin, et al.
Publicado: (2026)
Think-Augmented Function Calling: Improving LLM Parameter Accuracy Through Embedded Reasoning
por: Wei, Lei, et al.
Publicado: (2026)
por: Wei, Lei, et al.
Publicado: (2026)
Vulnerability-Aware Alignment: Mitigating Uneven Forgetting in Harmful Fine-Tuning
por: Chen, Liang, et al.
Publicado: (2025)
por: Chen, Liang, et al.
Publicado: (2025)
LAD: Learning Advantage Distribution for Reasoning
por: Li, Wendi, et al.
Publicado: (2026)
por: Li, Wendi, et al.
Publicado: (2026)
Classical Verification of Quantum Learning Advantages with Noises
por: Ma, Yinghao, et al.
Publicado: (2024)
por: Ma, Yinghao, et al.
Publicado: (2024)
Mitigating the Backdoor Effect for Multi-Task Model Merging via Safety-Aware Subspace
por: Yang, Jinluan, et al.
Publicado: (2024)
por: Yang, Jinluan, et al.
Publicado: (2024)
DAJ: Data-Reweighted LLM Judge for Test-Time Scaling in Code Generation
por: Qin, Peijia, et al.
Publicado: (2026)
por: Qin, Peijia, et al.
Publicado: (2026)
Group & Reweight: A Novel Cost-Sensitive Approach to Mitigating Class Imbalance in Network Traffic Classification
por: Du, Wumei, et al.
Publicado: (2024)
por: Du, Wumei, et al.
Publicado: (2024)
DFedReweighting: A Unified Framework for Objective-Oriented Reweighting in Decentralized Federated Learning
por: Zhang, Kaichuang, et al.
Publicado: (2025)
por: Zhang, Kaichuang, et al.
Publicado: (2025)
Differential Smoothing Mitigates Sharpening and Improves LLM Reasoning
por: Gai, Jingchu, et al.
Publicado: (2025)
por: Gai, Jingchu, et al.
Publicado: (2025)
Ejemplares similares
-
RevOrder: A Novel Method for Enhanced Arithmetic in Language Models
por: Shen, Si, et al.
Publicado: (2024) -
LLM-Metrics: Measuring Research Impact Through Large Language Model Memory
por: Shen, Si, et al.
Publicado: (2026) -
CurveRL: Principled Distribution-Aware Context Reweighting for LLM Reasoning
por: Sun, Ke, et al.
Publicado: (2026) -
GEAR: Granularity-Adaptive Advantage Reweighting for LLM Agents via Self-Distillation
por: Li, Sijia, et al.
Publicado: (2026) -
TIAR: Trajectory-Informed Advantage Reweighting for LLM Abstention Learning
por: Pan, Muyu, et al.
Publicado: (2026)