BeyondBench: Contamination-Resistant Evaluation of Reasoning in Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Srivastava, Gaurav, Hussain, Aafiya, Bi, Zhenyu, Roy, Swastik, Pitre, Priya, Lu, Meng, Ziyadi, Morteza, Wang, Xuan |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
JudgeBoard: Benchmarking and Enhancing Small Language Models for Reasoning Evaluation
by: Bi, Zhenyu, et al.
Published: (2025)
by: Bi, Zhenyu, et al.
Published: (2025)
Do LLMs Overthink Basic Math Reasoning? Benchmarking the Accuracy-Efficiency Tradeoff in Language Models
by: Srivastava, Gaurav, et al.
Published: (2025)
by: Srivastava, Gaurav, et al.
Published: (2025)
DEBATE, TRAIN, EVOLVE: Self Evolution of Language Model Reasoning
by: Srivastava, Gaurav, et al.
Published: (2025)
by: Srivastava, Gaurav, et al.
Published: (2025)
OPTAGENT: Optimizing Multi-Agent LLM Interactions Through Verbal Reinforcement Learning for Enhanced Reasoning
by: Bi, Zhenyu, et al.
Published: (2025)
by: Bi, Zhenyu, et al.
Published: (2025)
EffGen: Enabling Small Language Models as Capable Autonomous Agents
by: Srivastava, Gaurav, et al.
Published: (2026)
by: Srivastava, Gaurav, et al.
Published: (2026)
SoundBreak: A Systematic Study of Audio-Only Adversarial Attacks on Trimodal Models
by: Hussain, Aafiya, et al.
Published: (2026)
by: Hussain, Aafiya, et al.
Published: (2026)
Towards Reasoning Ability of Small Language Models
by: Srivastava, Gaurav, et al.
Published: (2025)
by: Srivastava, Gaurav, et al.
Published: (2025)
ArguMentor: Augmenting User Experiences with Counter-Perspectives
by: Pitre, Priya, et al.
Published: (2024)
by: Pitre, Priya, et al.
Published: (2024)
Do Multilingual VLMs Reason Equally? A Cross-Lingual Visual Reasoning Audit for Indian Languages
by: R, Swastik
Published: (2026)
by: R, Swastik
Published: (2026)
C-MORAL: Controllable Multi-Objective Molecular Optimization with Reinforcement Alignment for LLMs
by: Gao, Rui, et al.
Published: (2026)
by: Gao, Rui, et al.
Published: (2026)
AI for Biomedicine in the Era of Large Language Models
by: Bi, Zhenyu, et al.
Published: (2024)
by: Bi, Zhenyu, et al.
Published: (2024)
Towards Contamination Resistant Benchmarks
by: Musawi, Rahmatullah, et al.
Published: (2025)
by: Musawi, Rahmatullah, et al.
Published: (2025)
Market-Bench: Evaluating Large Language Models on Introductory Quantitative Trading and Market Dynamics
by: Srivastava, Abhay, et al.
Published: (2025)
by: Srivastava, Abhay, et al.
Published: (2025)
Clean Evaluations on Contaminated Visual Language Models
by: Lu, Hongyuan, et al.
Published: (2024)
by: Lu, Hongyuan, et al.
Published: (2024)
E-Bench: Towards Evaluating the Ease-of-Use of Large Language Models
by: Zhang, Zhenyu, et al.
Published: (2024)
by: Zhang, Zhenyu, et al.
Published: (2024)
LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code
by: Jain, Naman, et al.
Published: (2024)
by: Jain, Naman, et al.
Published: (2024)
RARE: Retrieval-Aware Robustness Evaluation for Retrieval-Augmented Generation Systems
by: Zeng, Yixiao, et al.
Published: (2025)
by: Zeng, Yixiao, et al.
Published: (2025)
"Mirror" Language AI Models of Depression are Criterion-Contaminated
by: Li, Tong, et al.
Published: (2025)
by: Li, Tong, et al.
Published: (2025)
CLEAN-EVAL: Clean Evaluation on Contaminated Large Language Models
by: Zhu, Wenhong, et al.
Published: (2023)
by: Zhu, Wenhong, et al.
Published: (2023)
CounterBench: Evaluating and Improving Counterfactual Reasoning in Large Language Models
by: Chen, Yuefei, et al.
Published: (2025)
by: Chen, Yuefei, et al.
Published: (2025)
LNE-Blocking: An Efficient Framework for Contamination Mitigation Evaluation on Large Language Models
by: Hou, Ruijie, et al.
Published: (2025)
by: Hou, Ruijie, et al.
Published: (2025)
RAGPPI: RAG Benchmark for Protein-Protein Interactions in Drug Discovery
by: Jeon, Youngseung, et al.
Published: (2025)
by: Jeon, Youngseung, et al.
Published: (2025)
EffiReason-Bench: A Unified Benchmark for Evaluating and Advancing Efficient Reasoning in Large Language Models
by: Huang, Junquan, et al.
Published: (2025)
by: Huang, Junquan, et al.
Published: (2025)
L0-Reasoning Bench: Evaluating Procedural Correctness in Language Models via Simple Program Execution
by: Sun, Simeng, et al.
Published: (2025)
by: Sun, Simeng, et al.
Published: (2025)
STOC-TOT: Stochastic Tree-of-Thought with Constrained Decoding for Complex Reasoning in Multi-Hop Question Answering
by: Bi, Zhenyu, et al.
Published: (2024)
by: Bi, Zhenyu, et al.
Published: (2024)
MET-Bench: Multimodal Entity Tracking for Evaluating the Limitations of Vision-Language and Reasoning Models
by: Cohen, Vanya, et al.
Published: (2025)
by: Cohen, Vanya, et al.
Published: (2025)
Reasoning Beyond Language: A Comprehensive Survey on Latent Chain-of-Thought Reasoning
by: Chen, Xinghao, et al.
Published: (2025)
by: Chen, Xinghao, et al.
Published: (2025)
PRIME: Policy-Reinforced Iterative Multi-agent Execution for Algorithmic Reasoning in Large Language Models
by: Xu, Jiawei, et al.
Published: (2026)
by: Xu, Jiawei, et al.
Published: (2026)
BenchCLAMP: A Benchmark for Evaluating Language Models on Syntactic and Semantic Parsing
by: Roy, Subhro, et al.
Published: (2022)
by: Roy, Subhro, et al.
Published: (2022)
CArtBench: Evaluating Vision-Language Models on Chinese Art Understanding, Interpretation, and Authenticity
by: Wei, Xuefeng, et al.
Published: (2026)
by: Wei, Xuefeng, et al.
Published: (2026)
LogicBench: Towards Systematic Evaluation of Logical Reasoning Ability of Large Language Models
by: Parmar, Mihir, et al.
Published: (2024)
by: Parmar, Mihir, et al.
Published: (2024)
TimeBench: A Comprehensive Evaluation of Temporal Reasoning Abilities in Large Language Models
by: Chu, Zheng, et al.
Published: (2023)
by: Chu, Zheng, et al.
Published: (2023)
FactBench: A Dynamic Benchmark for In-the-Wild Language Model Factuality Evaluation
by: Bayat, Farima Fatahi, et al.
Published: (2024)
by: Bayat, Farima Fatahi, et al.
Published: (2024)
Beyond Perplexity: Character Distribution Signatures and the MDTA Benchmark for AI Text Detection
by: Narayanasamy, Priyadarshan, et al.
Published: (2026)
by: Narayanasamy, Priyadarshan, et al.
Published: (2026)
Learn Beyond The Answer: Training Language Models with Reflection for Mathematical Reasoning
by: Zhang, Zhihan, et al.
Published: (2024)
by: Zhang, Zhihan, et al.
Published: (2024)
C$^2$LEVA: Toward Comprehensive and Contamination-Free Language Model Evaluation
by: Li, Yanyang, et al.
Published: (2024)
by: Li, Yanyang, et al.
Published: (2024)
The Point of No Return: Counterfactual Localization of Deceptive Commitment in Language-Model Reasoning
by: Merrill, Scott, et al.
Published: (2026)
by: Merrill, Scott, et al.
Published: (2026)
VLegal-Bench: Cognitively Grounded Benchmark for Vietnamese Legal Reasoning of Large Language Models
by: Dong, Nguyen Tien, et al.
Published: (2025)
by: Dong, Nguyen Tien, et al.
Published: (2025)
TemMed-Bench: Evaluating Temporal Medical Image Reasoning in Vision-Language Models
by: Zhang, Junyi, et al.
Published: (2025)
by: Zhang, Junyi, et al.
Published: (2025)
NoveltyBench: Evaluating Language Models for Humanlike Diversity
by: Zhang, Yiming, et al.
Published: (2025)
by: Zhang, Yiming, et al.
Published: (2025)
Similar Items
-
JudgeBoard: Benchmarking and Enhancing Small Language Models for Reasoning Evaluation
by: Bi, Zhenyu, et al.
Published: (2025) -
Do LLMs Overthink Basic Math Reasoning? Benchmarking the Accuracy-Efficiency Tradeoff in Language Models
by: Srivastava, Gaurav, et al.
Published: (2025) -
DEBATE, TRAIN, EVOLVE: Self Evolution of Language Model Reasoning
by: Srivastava, Gaurav, et al.
Published: (2025) -
OPTAGENT: Optimizing Multi-Agent LLM Interactions Through Verbal Reinforcement Learning for Enhanced Reasoning
by: Bi, Zhenyu, et al.
Published: (2025) -
EffGen: Enabling Small Language Models as Capable Autonomous Agents
by: Srivastava, Gaurav, et al.
Published: (2026)