xVerify: Efficient Answer Verifier for Reasoning Model Evaluations
Fuente:
arXiv
Saved in:
| Main Authors: | Chen, Ding, Yu, Qingchen, Wang, Pengyuan, Hu, Mengting, Zhang, Wentao, Wang, Zhengren, Tang, Bo, Xiong, Feiyu, Li, Xinchi, Wang, Chao, Yang, Minchuan, Li, Zhiyu |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
xFinder: Large Language Models as Automated Evaluators for Reliable Evaluation
by: Yu, Qingchen, et al.
Published: (2024)
by: Yu, Qingchen, et al.
Published: (2024)
GuessArena: Guess Who I Am? A Self-Adaptive Framework for Evaluating LLMs in Domain-Specific Knowledge and Reasoning
by: Yu, Qingchen, et al.
Published: (2025)
by: Yu, Qingchen, et al.
Published: (2025)
HopRAG: Multi-Hop Reasoning for Logic-Aware Retrieval-Augmented Generation
by: Liu, Hao, et al.
Published: (2025)
by: Liu, Hao, et al.
Published: (2025)
VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains
by: Li, Xuzhao, et al.
Published: (2025)
by: Li, Xuzhao, et al.
Published: (2025)
Grimoire is All You Need for Enhancing Large Language Models
by: Chen, Ding, et al.
Published: (2024)
by: Chen, Ding, et al.
Published: (2024)
RARE: Retrieval-Augmented Reasoning Modeling
by: Wang, Zhengren, et al.
Published: (2025)
by: Wang, Zhengren, et al.
Published: (2025)
MaintainCoder: Maintainable Code Generation Under Dynamic Requirements
by: Wang, Zhengren, et al.
Published: (2025)
by: Wang, Zhengren, et al.
Published: (2025)
CodeFlowBench: A Multi-turn, Iterative Benchmark for Complex Code Generation
by: Wang, Sizhe, et al.
Published: (2025)
by: Wang, Sizhe, et al.
Published: (2025)
Incentivizing LLMs to Self-Verify Their Answers
by: Zhang, Fuxiang, et al.
Published: (2025)
by: Zhang, Fuxiang, et al.
Published: (2025)
DARL: Encouraging Diverse Answers for General Reasoning without Verifiers
by: Huang, Chongxuan, et al.
Published: (2026)
by: Huang, Chongxuan, et al.
Published: (2026)
HaluMem: Evaluating Hallucinations in Memory Systems of Agents
by: Chen, Ding, et al.
Published: (2025)
by: Chen, Ding, et al.
Published: (2025)
Text2VectorSQL: Towards a Unified Interface for Vector Search and SQL Queries
by: Wang, Zhengren, et al.
Published: (2025)
by: Wang, Zhengren, et al.
Published: (2025)
QAEncoder: Towards Aligned Representation Learning in Question Answering Systems
by: Wang, Zhengren, et al.
Published: (2024)
by: Wang, Zhengren, et al.
Published: (2024)
Controlled Text Generation for Large Language Model with Dynamic Attribute Graphs
by: Liang, Xun, et al.
Published: (2024)
by: Liang, Xun, et al.
Published: (2024)
Verifiable Process Rewards for Agentic Reasoning
by: Yuan, Huining, et al.
Published: (2026)
by: Yuan, Huining, et al.
Published: (2026)
Reinforcing General Reasoning without Verifiers
by: Zhou, Xiangxin, et al.
Published: (2025)
by: Zhou, Xiangxin, et al.
Published: (2025)
Inside Out: Evolving User-Centric Core Memory Trees for Long-Term Personalized Dialogue Systems
by: Zhao, Jihao, et al.
Published: (2026)
by: Zhao, Jihao, et al.
Published: (2026)
Correct Answers from Sound Reasoning: Verifiable Process Supervision for Language Models
by: Kim, Kyuyoung, et al.
Published: (2026)
by: Kim, Kyuyoung, et al.
Published: (2026)
Scaling Flaws of Verifier-Guided Search in Mathematical Reasoning
by: Yu, Fei, et al.
Published: (2025)
by: Yu, Fei, et al.
Published: (2025)
VeriThinker: Learning to Verify Makes Reasoning Model Efficient
by: Chen, Zigeng, et al.
Published: (2025)
by: Chen, Zigeng, et al.
Published: (2025)
Can We Verify Step by Step for Incorrect Answer Detection?
by: Xu, Xin, et al.
Published: (2024)
by: Xu, Xin, et al.
Published: (2024)
Scientific QA System with Verifiable Answers
by: Ljajić, Adela, et al.
Published: (2024)
by: Ljajić, Adela, et al.
Published: (2024)
Self-Verifying Reflection Helps Transformers with CoT Reasoning
by: Yu, Zhongwei, et al.
Published: (2025)
by: Yu, Zhongwei, et al.
Published: (2025)
MemReader: From Passive to Active Extraction for Long-Term Agent Memory
by: Kang, Jingyi, et al.
Published: (2026)
by: Kang, Jingyi, et al.
Published: (2026)
MM-Verify: Enhancing Multimodal Reasoning with Chain-of-Thought Verification
by: Sun, Linzhuang, et al.
Published: (2025)
by: Sun, Linzhuang, et al.
Published: (2025)
Evidence-Based Actor-Verifier Reasoning for Echocardiographic Agents
by: Huang, Peng, et al.
Published: (2026)
by: Huang, Peng, et al.
Published: (2026)
MemFactory: Unified Inference & Training Framework for Agent Memory
by: Guo, Ziliang, et al.
Published: (2026)
by: Guo, Ziliang, et al.
Published: (2026)
Logic-Regularized Verifier Elicits Reasoning from LLMs
by: Wang, Xinyu, et al.
Published: (2026)
by: Wang, Xinyu, et al.
Published: (2026)
From Answers to Rationales: Self-Aligning Multimodal Reasoning with Answer-Oriented Chain-of-Thought
by: Tan, Wentao, et al.
Published: (2025)
by: Tan, Wentao, et al.
Published: (2025)
Action Draft and Verify: A Self-Verifying Framework for Vision-Language-Action Model
by: Zhao, Chen, et al.
Published: (2026)
by: Zhao, Chen, et al.
Published: (2026)
Recon, Answer, Verify: Agents in Search of Truth
by: Shukla, Satyam, et al.
Published: (2025)
by: Shukla, Satyam, et al.
Published: (2025)
Train at Moving Edge: Online-Verified Prompt Selection for Efficient RL Training of Large Reasoning Model
by: Wu, Jiahao, et al.
Published: (2026)
by: Wu, Jiahao, et al.
Published: (2026)
MemReranker: Reasoning-Aware Reranking for Agent Memory Retrieval
by: Li, Chunyu, et al.
Published: (2026)
by: Li, Chunyu, et al.
Published: (2026)
Grounding Generative Planners in Verifiable Logic: A Hybrid Architecture for Trustworthy Embodied AI
by: Wu, Feiyu, et al.
Published: (2026)
by: Wu, Feiyu, et al.
Published: (2026)
Verifiable Reasoning for LLM-based Generative Recommendation
by: Lin, Xinyu, et al.
Published: (2026)
by: Lin, Xinyu, et al.
Published: (2026)
Multimodal Fact-Level Attribution for Verifiable Reasoning
by: Wan, David, et al.
Published: (2026)
by: Wan, David, et al.
Published: (2026)
Critique to Verify: Accurate and Honest Test-Time Scaling with RL-Trained Verifiers
by: Yang, Zhicheng, et al.
Published: (2025)
by: Yang, Zhicheng, et al.
Published: (2025)
ShieldAgent: Shielding Agents via Verifiable Safety Policy Reasoning
by: Chen, Zhaorun, et al.
Published: (2025)
by: Chen, Zhaorun, et al.
Published: (2025)
Examining Reasoning LLMs-as-Judges in Non-Verifiable LLM Post-Training
by: Liu, Yixin, et al.
Published: (2026)
by: Liu, Yixin, et al.
Published: (2026)
Select, Hypothesize and Verify: Towards Verified Neuron Concept Interpretation
by: Ji, ZeBin, et al.
Published: (2026)
by: Ji, ZeBin, et al.
Published: (2026)
Similar Items
-
xFinder: Large Language Models as Automated Evaluators for Reliable Evaluation
by: Yu, Qingchen, et al.
Published: (2024) -
GuessArena: Guess Who I Am? A Self-Adaptive Framework for Evaluating LLMs in Domain-Specific Knowledge and Reasoning
by: Yu, Qingchen, et al.
Published: (2025) -
HopRAG: Multi-Hop Reasoning for Logic-Aware Retrieval-Augmented Generation
by: Liu, Hao, et al.
Published: (2025) -
VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains
by: Li, Xuzhao, et al.
Published: (2025) -
Grimoire is All You Need for Enhancing Large Language Models
by: Chen, Ding, et al.
Published: (2024)