Think Twice: Branch-and-Rethink Reasoning Reward Model
Fuente:
arXiv
Guardado en:
| Autores principales: | Jiao, Yizhu, Zeng, Jiaqi, Vialard, Julien Veron, Kuchaiev, Oleksii, Han, Jiawei, Delalleau, Olivier |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
RLBFF: Binary Flexible Feedback to bridge between Human Feedback & Verifiable Rewards
por: Wang, Zhilin, et al.
Publicado: (2025)
por: Wang, Zhilin, et al.
Publicado: (2025)
HelpSteer2-Preference: Complementing Ratings with Preferences
por: Wang, Zhilin, et al.
Publicado: (2024)
por: Wang, Zhilin, et al.
Publicado: (2024)
GPT vs RETRO: Exploring the Intersection of Retrieval and Parameter-Efficient Fine-Tuning
por: Ficek, Aleksander, et al.
Publicado: (2024)
por: Ficek, Aleksander, et al.
Publicado: (2024)
Reward-aware Preference Optimization: A Unified Mathematical Framework for Model Alignment
por: Sun, Shengyang, et al.
Publicado: (2025)
por: Sun, Shengyang, et al.
Publicado: (2025)
HelpSteer3: Human-Annotated Feedback and Edit Data to Empower Inference-Time Scaling in Open-Ended General-Domain Tasks
por: Wang, Zhilin, et al.
Publicado: (2025)
por: Wang, Zhilin, et al.
Publicado: (2025)
HelpSteer3-Preference: Open Human-Annotated Preference Data across Diverse Tasks and Languages
por: Wang, Zhilin, et al.
Publicado: (2025)
por: Wang, Zhilin, et al.
Publicado: (2025)
HelpSteer2: Open-source dataset for training top-performing reward models
por: Wang, Zhilin, et al.
Publicado: (2024)
por: Wang, Zhilin, et al.
Publicado: (2024)
Think Twice: Enhancing LLM Reasoning by Scaling Multi-round Test-time Thinking
por: Tian, Xiaoyu, et al.
Publicado: (2025)
por: Tian, Xiaoyu, et al.
Publicado: (2025)
NeMo-Aligner: Scalable Toolkit for Efficient Model Alignment
por: Shen, Gerald, et al.
Publicado: (2024)
por: Shen, Gerald, et al.
Publicado: (2024)
Tied-Lora: Enhancing parameter efficiency of LoRA with weight tying
por: Renduchintala, Adithya, et al.
Publicado: (2023)
por: Renduchintala, Adithya, et al.
Publicado: (2023)
TEXT2DB: Integration-Aware Information Extraction with Large Language Model Agents
por: Jiao, Yizhu, et al.
Publicado: (2025)
por: Jiao, Yizhu, et al.
Publicado: (2025)
Don't Think Twice! Over-Reasoning Impairs Confidence Calibration
por: Lacombe, Romain, et al.
Publicado: (2025)
por: Lacombe, Romain, et al.
Publicado: (2025)
Establishing Knowledge Preference in Language Models
por: Zhou, Sizhe, et al.
Publicado: (2024)
por: Zhou, Sizhe, et al.
Publicado: (2024)
Synergizing Unsupervised Episode Detection with LLMs for Large-Scale News Events
por: Kargupta, Priyanka, et al.
Publicado: (2024)
por: Kargupta, Priyanka, et al.
Publicado: (2024)
A Survey on Retrieval And Structuring Augmented Generation with Large Language Models
por: Jiang, Pengcheng, et al.
Publicado: (2025)
por: Jiang, Pengcheng, et al.
Publicado: (2025)
Rewarding How Models Think Pedagogically: Integrating Pedagogical Reasoning and Thinking Rewards for LLMs in Education
por: Lee, Unggi, et al.
Publicado: (2026)
por: Lee, Unggi, et al.
Publicado: (2026)
Think Twice Before You Judge: Mixture of Dual Reasoning Experts for Multimodal Sarcasm Detection
por: Jana, Soumyadeep, et al.
Publicado: (2025)
por: Jana, Soumyadeep, et al.
Publicado: (2025)
Adversarial Training of Reward Models
por: Bukharin, Alexander, et al.
Publicado: (2025)
por: Bukharin, Alexander, et al.
Publicado: (2025)
Think Twice Before You Write -- an Entropy-based Decoding Strategy to Enhance LLM Reasoning
por: He, Jiashu, et al.
Publicado: (2026)
por: He, Jiashu, et al.
Publicado: (2026)
Think Twice: Measuring the Efficiency of Eliminating Prediction Shortcuts of Question Answering Models
por: Mikula, Lukáš, et al.
Publicado: (2023)
por: Mikula, Lukáš, et al.
Publicado: (2023)
Think Twice, Generate Once: Safeguarding by Progressive Self-Reflection
por: Phan, Hoang, et al.
Publicado: (2025)
por: Phan, Hoang, et al.
Publicado: (2025)
Do not be greedy, Think Twice: Sampling and Selection for Document-level Information Extraction
por: Zubillaga, Mikel, et al.
Publicado: (2026)
por: Zubillaga, Mikel, et al.
Publicado: (2026)
Think Twice Before Trusting: Self-Detection for Large Language Models through Comprehensive Answer Reflection
por: Li, Moxin, et al.
Publicado: (2024)
por: Li, Moxin, et al.
Publicado: (2024)
Primal Generation, Dual Judgment: Self-Training from Test-Time Scaling
por: Jiao, Yizhu, et al.
Publicado: (2026)
por: Jiao, Yizhu, et al.
Publicado: (2026)
Thinking Fast and Right: Balancing Accuracy and Reasoning Length with Adaptive Rewards
por: Su, Jinyan, et al.
Publicado: (2025)
por: Su, Jinyan, et al.
Publicado: (2025)
Think Twice: A Human-like Two-stage Conversational Agent for Emotional Response Generation
por: Qian, Yushan, et al.
Publicado: (2023)
por: Qian, Yushan, et al.
Publicado: (2023)
Investigating Instruction Tuning Large Language Models on Graphs
por: Zhu, Kerui, et al.
Publicado: (2024)
por: Zhu, Kerui, et al.
Publicado: (2024)
Rethinking the Reranker: Boundary-Aware Evidence Selection for Robust Retrieval-Augmented Generation
por: Sun, Jiashuo, et al.
Publicado: (2026)
por: Sun, Jiashuo, et al.
Publicado: (2026)
Reward Reasoning Model
por: Guo, Jiaxin, et al.
Publicado: (2025)
por: Guo, Jiaxin, et al.
Publicado: (2025)
Thinking with DistilQwen: A Tale of Four Distilled Reasoning and Reward Model Series
por: Cai, Wenrui, et al.
Publicado: (2025)
por: Cai, Wenrui, et al.
Publicado: (2025)
Multiplex Thinking: Reasoning via Token-wise Branch-and-Merge
por: Tang, Yao, et al.
Publicado: (2026)
por: Tang, Yao, et al.
Publicado: (2026)
Libra: Assessing and Improving Reward Model by Learning to Think
por: Zhou, Meng, et al.
Publicado: (2025)
por: Zhou, Meng, et al.
Publicado: (2025)
Think Twice, Click Once: Enhancing GUI Grounding via Fast and Slow Systems
por: Tang, Fei, et al.
Publicado: (2025)
por: Tang, Fei, et al.
Publicado: (2025)
Process Reward Models That Think
por: Khalifa, Muhammad, et al.
Publicado: (2025)
por: Khalifa, Muhammad, et al.
Publicado: (2025)
Is It Thinking or Cheating? Detecting Implicit Reward Hacking by Measuring Reasoning Effort
por: Wang, Xinpeng, et al.
Publicado: (2025)
por: Wang, Xinpeng, et al.
Publicado: (2025)
Latent Thinking Optimization: Your Latent Reasoning Language Model Secretly Encodes Reward Signals in Its Latent Thoughts
por: Du, Hanwen, et al.
Publicado: (2025)
por: Du, Hanwen, et al.
Publicado: (2025)
Thinking Out Loud: Do Reasoning Models Know When They're Right?
por: Zeng, Qingcheng, et al.
Publicado: (2025)
por: Zeng, Qingcheng, et al.
Publicado: (2025)
Rethinking External Slow-Thinking: From Snowball Errors to Probability of Correct Reasoning
por: Gan, Zeyu, et al.
Publicado: (2025)
por: Gan, Zeyu, et al.
Publicado: (2025)
ReLoop: "Seeing Twice and Thinking Backwards" via Closed-loop Training to Mitigate Hallucinations in Multimodal understanding
por: Yang, Jianjiang, et al.
Publicado: (2025)
por: Yang, Jianjiang, et al.
Publicado: (2025)
Rethinking Reward Model Evaluation Through the Lens of Reward Overoptimization
por: Kim, Sunghwan, et al.
Publicado: (2025)
por: Kim, Sunghwan, et al.
Publicado: (2025)
Ejemplares similares
-
RLBFF: Binary Flexible Feedback to bridge between Human Feedback & Verifiable Rewards
por: Wang, Zhilin, et al.
Publicado: (2025) -
HelpSteer2-Preference: Complementing Ratings with Preferences
por: Wang, Zhilin, et al.
Publicado: (2024) -
GPT vs RETRO: Exploring the Intersection of Retrieval and Parameter-Efficient Fine-Tuning
por: Ficek, Aleksander, et al.
Publicado: (2024) -
Reward-aware Preference Optimization: A Unified Mathematical Framework for Model Alignment
por: Sun, Shengyang, et al.
Publicado: (2025) -
HelpSteer3: Human-Annotated Feedback and Edit Data to Empower Inference-Time Scaling in Open-Ended General-Domain Tasks
por: Wang, Zhilin, et al.
Publicado: (2025)