DARL: Encouraging Diverse Answers for General Reasoning without Verifiers
Fuente:
arXiv
Saved in:
| Main Authors: | Huang, Chongxuan, Lin, Lei, Shi, Xiaodong, Hu, Wenping, Tang, Ruiming |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Reinforcing General Reasoning without Verifiers
by: Zhou, Xiangxin, et al.
Published: (2025)
by: Zhou, Xiangxin, et al.
Published: (2025)
xVerify: Efficient Answer Verifier for Reasoning Model Evaluations
by: Chen, Ding, et al.
Published: (2025)
by: Chen, Ding, et al.
Published: (2025)
How Well Do Large Reasoning Models Translate? A Comprehensive Evaluation for Multi-Domain Machine Translation
by: Ye, Yongshi, et al.
Published: (2025)
by: Ye, Yongshi, et al.
Published: (2025)
From Neurons to Semantics: Evaluating Cross-Linguistic Alignment Capabilities of Large Language Models via Neurons Alignment
by: Huang, Chongxuan, et al.
Published: (2025)
by: Huang, Chongxuan, et al.
Published: (2025)
From Tags to Trees: Structuring Fine-Grained Knowledge for Controllable Data Selection in LLM Instruction Tuning
by: Niu, Zihan, et al.
Published: (2026)
by: Niu, Zihan, et al.
Published: (2026)
Scientific QA System with Verifiable Answers
by: Ljajić, Adela, et al.
Published: (2024)
by: Ljajić, Adela, et al.
Published: (2024)
ReverseMath: Answer Inversion for Scalable and Verifiable Mathematical Problem Generation
by: Zhao, Raoyuan, et al.
Published: (2026)
by: Zhao, Raoyuan, et al.
Published: (2026)
Correct Answers from Sound Reasoning: Verifiable Process Supervision for Language Models
by: Kim, Kyuyoung, et al.
Published: (2026)
by: Kim, Kyuyoung, et al.
Published: (2026)
SED-SFT: Selectively Encouraging Diversity in Supervised Fine-Tuning
by: Chen, Yijie, et al.
Published: (2026)
by: Chen, Yijie, et al.
Published: (2026)
ShredBench: Evaluating the Semantic Reasoning Capabilities of Multimodal LLMs in Document Reconstruction
by: Guo, Zichun, et al.
Published: (2026)
by: Guo, Zichun, et al.
Published: (2026)
Recon, Answer, Verify: Agents in Search of Truth
by: Shukla, Satyam, et al.
Published: (2025)
by: Shukla, Satyam, et al.
Published: (2025)
TRE: Encouraging Exploration in the Trust Region
by: Huang, Chao, et al.
Published: (2026)
by: Huang, Chao, et al.
Published: (2026)
Attention as a Compass: Efficient Exploration for Process-Supervised RL in Reasoning Models
by: Liu, Runze, et al.
Published: (2025)
by: Liu, Runze, et al.
Published: (2025)
SWE-QA: Can Language Models Answer Repository-level Code Questions?
by: Peng, Weihan, et al.
Published: (2025)
by: Peng, Weihan, et al.
Published: (2025)
From Reasoning Chains to Verifiable Subproblems: Curriculum Reinforcement Learning Enables Credit Assignment for LLM Reasoning
by: Jiang, Xitai, et al.
Published: (2026)
by: Jiang, Xitai, et al.
Published: (2026)
Can We Verify Step by Step for Incorrect Answer Detection?
by: Xu, Xin, et al.
Published: (2024)
by: Xu, Xin, et al.
Published: (2024)
Sandwich Reasoning: An Answer-Reasoning-Answer Approach for Low-Latency Query Correction
by: Zhang, Chen, et al.
Published: (2026)
by: Zhang, Chen, et al.
Published: (2026)
GeneralThinker: Domain-General Reasoning through Likelihood-Guided Answer-Conditioned Optimization
by: Piao, Shengmin, et al.
Published: (2026)
by: Piao, Shengmin, et al.
Published: (2026)
Performance Law of Large Language Models
by: Wu, Chuhan, et al.
Published: (2024)
by: Wu, Chuhan, et al.
Published: (2024)
Reason and Verify: A Framework for Faithful Retrieval-Augmented Generation
by: Khan, Eeham, et al.
Published: (2026)
by: Khan, Eeham, et al.
Published: (2026)
Entropy Ratio Clipping as a Soft Global Constraint for Stable Reinforcement Learning
by: Su, Zhenpeng, et al.
Published: (2025)
by: Su, Zhenpeng, et al.
Published: (2025)
Multimodal Mathematical Reasoning with Diverse Solving Perspective
by: Shi, Wenhao, et al.
Published: (2025)
by: Shi, Wenhao, et al.
Published: (2025)
From Answers to Rationales: Self-Aligning Multimodal Reasoning with Answer-Oriented Chain-of-Thought
by: Tan, Wentao, et al.
Published: (2025)
by: Tan, Wentao, et al.
Published: (2025)
RLPR: Extrapolating RLVR to General Domains without Verifiers
by: Yu, Tianyu, et al.
Published: (2025)
by: Yu, Tianyu, et al.
Published: (2025)
SynLogic: Synthesizing Verifiable Reasoning Data at Scale for Learning Logical Reasoning and Beyond
by: Liu, Junteng, et al.
Published: (2025)
by: Liu, Junteng, et al.
Published: (2025)
Learning to Generate Answers with Citations via Factual Consistency Models
by: Aly, Rami, et al.
Published: (2024)
by: Aly, Rami, et al.
Published: (2024)
When Safety Fails Before the Answer: Benchmarking Harmful Behavior Detection in Reasoning Chains
by: Kakkar, Ishita, et al.
Published: (2026)
by: Kakkar, Ishita, et al.
Published: (2026)
Leveraging Reasoning Model Answers to Enhance Non-Reasoning Model Capability
by: Wang, Haotian, et al.
Published: (2025)
by: Wang, Haotian, et al.
Published: (2025)
SymCode: A Neurosymbolic Approach to Mathematical Reasoning via Verifiable Code Generation
by: Nezhad, Sina Bagheri, et al.
Published: (2025)
by: Nezhad, Sina Bagheri, et al.
Published: (2025)
Prompt Space Optimizing Few-shot Reasoning Success with Large Language Models
by: Shi, Fobo, et al.
Published: (2023)
by: Shi, Fobo, et al.
Published: (2023)
Generative Universal Verifier as Multimodal Meta-Reasoner
by: Zhang, Xinchen, et al.
Published: (2025)
by: Zhang, Xinchen, et al.
Published: (2025)
Generalizing Verifiable Instruction Following
by: Pyatkin, Valentina, et al.
Published: (2025)
by: Pyatkin, Valentina, et al.
Published: (2025)
Bridging Relevance and Reasoning: Rationale Distillation in Retrieval-Augmented Generation
by: Jia, Pengyue, et al.
Published: (2024)
by: Jia, Pengyue, et al.
Published: (2024)
Surrogate Signals from Format and Length: Reinforcement Learning for Solving Mathematical Problems without Ground Truth Answers
by: Xin, Rihui, et al.
Published: (2025)
by: Xin, Rihui, et al.
Published: (2025)
Answer Convergence as a Signal for Early Stopping in Reasoning
by: Liu, Xin, et al.
Published: (2025)
by: Liu, Xin, et al.
Published: (2025)
Reason Like a Radiologist: Chain-of-Thought and Reinforcement Learning for Verifiable Report Generation
by: Jing, Peiyuan, et al.
Published: (2025)
by: Jing, Peiyuan, et al.
Published: (2025)
DocScope: Benchmarking Verifiable Reasoning for Trustworthy Long-Document Understanding
by: Feng, Xiang, et al.
Published: (2026)
by: Feng, Xiang, et al.
Published: (2026)
Joint Evaluation of Answer and Reasoning Consistency for Hallucination Detection in Large Reasoning Models
by: Wang, Changyue, et al.
Published: (2025)
by: Wang, Changyue, et al.
Published: (2025)
Automatic Feedback Generation for Short Answer Questions using Answer Diagnostic Graphs
by: Furuhashi, Momoka, et al.
Published: (2025)
by: Furuhashi, Momoka, et al.
Published: (2025)
Refining Answer Distributions for Improved Large Language Model Reasoning
by: Pal, Soumyasundar, et al.
Published: (2024)
by: Pal, Soumyasundar, et al.
Published: (2024)
Similar Items
-
Reinforcing General Reasoning without Verifiers
by: Zhou, Xiangxin, et al.
Published: (2025) -
xVerify: Efficient Answer Verifier for Reasoning Model Evaluations
by: Chen, Ding, et al.
Published: (2025) -
How Well Do Large Reasoning Models Translate? A Comprehensive Evaluation for Multi-Domain Machine Translation
by: Ye, Yongshi, et al.
Published: (2025) -
From Neurons to Semantics: Evaluating Cross-Linguistic Alignment Capabilities of Large Language Models via Neurons Alignment
by: Huang, Chongxuan, et al.
Published: (2025) -
From Tags to Trees: Structuring Fine-Grained Knowledge for Controllable Data Selection in LLM Instruction Tuning
by: Niu, Zihan, et al.
Published: (2026)