Benchmarking Reasoning Robustness in Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Yu, Tong, Jing, Yongcheng, Zhang, Xikun, Jiang, Wentao, Wu, Wenjie, Wang, Yingjie, Hu, Wenbin, Du, Bo, Tao, Dacheng |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Graph-Augmented Reasoning: Evolving Step-by-Step Knowledge Graph Retrieval for LLM Reasoning
by: Wu, Wenjie, et al.
Published: (2025)
by: Wu, Wenjie, et al.
Published: (2025)
JustLogic: A Comprehensive Benchmark for Evaluating Deductive Reasoning in Large Language Models
by: Chen, Michael K., et al.
Published: (2025)
by: Chen, Michael K., et al.
Published: (2025)
Dynamic Parallel Tree Search for Efficient LLM Reasoning
by: Ding, Yifu, et al.
Published: (2025)
by: Ding, Yifu, et al.
Published: (2025)
MedCoG: Maximizing LLM Inference Density in Medical Reasoning via Meta-Cognitive Regulation
by: Zhao, Yu, et al.
Published: (2026)
by: Zhao, Yu, et al.
Published: (2026)
Improving Large Language Models with Concept-Aware Fine-Tuning
by: Chen, Michael K., et al.
Published: (2025)
by: Chen, Michael K., et al.
Published: (2025)
CoVeR: Conformal Calibration for Versatile and Reliable Autoregressive Next-Token Prediction
by: Chen, Yuzhu, et al.
Published: (2025)
by: Chen, Yuzhu, et al.
Published: (2025)
EchoBench: Benchmarking Sycophancy in Medical Large Vision-Language Models
by: Yuan, Botai, et al.
Published: (2025)
by: Yuan, Botai, et al.
Published: (2025)
Continual Learning on Graphs: Challenges, Solutions, and Opportunities
by: Zhang, Xikun, et al.
Published: (2024)
by: Zhang, Xikun, et al.
Published: (2024)
R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization
by: Zhang, Jingyi, et al.
Published: (2025)
by: Zhang, Jingyi, et al.
Published: (2025)
Large Language Models as an Indirect Reasoner: Contrapositive and Contradiction for Automated Reasoning
by: Zhang, Yanfang, et al.
Published: (2024)
by: Zhang, Yanfang, et al.
Published: (2024)
PoseBench: Benchmarking the Robustness of Pose Estimation Models under Corruptions
by: Ma, Sihan, et al.
Published: (2024)
by: Ma, Sihan, et al.
Published: (2024)
Distillation Traps and Guards: A Calibration Knob for LLM Distillability
by: Zhan, Weixiao, et al.
Published: (2026)
by: Zhan, Weixiao, et al.
Published: (2026)
Why Self-Rewarding Works: Theoretical Guarantees for Iterative Alignment of Language Models
by: Fu, Shi, et al.
Published: (2026)
by: Fu, Shi, et al.
Published: (2026)
Learning System Dynamics without Forgetting
by: Zhang, Xikun, et al.
Published: (2024)
by: Zhang, Xikun, et al.
Published: (2024)
A Survey on Agentic Multimodal Large Language Models
by: Yao, Huanjin, et al.
Published: (2025)
by: Yao, Huanjin, et al.
Published: (2025)
MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI
by: Yao, Huanjin, et al.
Published: (2025)
by: Yao, Huanjin, et al.
Published: (2025)
SPA-Cache: Singular Proxies for Adaptive Caching in Diffusion Language Models
by: Sun, Wenhao, et al.
Published: (2026)
by: Sun, Wenhao, et al.
Published: (2026)
Large Language Models Play StarCraft II: Benchmarks and A Chain of Summarization Approach
by: Ma, Weiyu, et al.
Published: (2023)
by: Ma, Weiyu, et al.
Published: (2023)
Rethinking and Benchmarking Large Language Models for Graph Reasoning
by: Hu, Yuwei, et al.
Published: (2025)
by: Hu, Yuwei, et al.
Published: (2025)
Benchmarking Large Language Models for Personalized Guidance in AI-Enhanced Learning
by: Yuan, Bo, et al.
Published: (2025)
by: Yuan, Bo, et al.
Published: (2025)
Reasoning in a Combinatorial and Constrained World: Benchmarking LLMs on Natural-Language Combinatorial Optimization
by: Jiang, Xia, et al.
Published: (2026)
by: Jiang, Xia, et al.
Published: (2026)
SimdBench: Benchmarking Large Language Models for SIMD-Intrinsic Code Generation
by: He, Yibo, et al.
Published: (2025)
by: He, Yibo, et al.
Published: (2025)
A Theoretical Survey on Foundation Models
by: Fu, Shi, et al.
Published: (2024)
by: Fu, Shi, et al.
Published: (2024)
VLRS-Bench: A Vision-Language Reasoning Benchmark for Remote Sensing
by: Luo, Zhiming, et al.
Published: (2026)
by: Luo, Zhiming, et al.
Published: (2026)
FusionBench: A Unified Library and Comprehensive Benchmark for Deep Model Fusion
by: Tang, Anke, et al.
Published: (2024)
by: Tang, Anke, et al.
Published: (2024)
Reasoning-Augmented Conversation for Multi-Turn Jailbreak Attacks on Large Language Models
by: Ying, Zonghao, et al.
Published: (2025)
by: Ying, Zonghao, et al.
Published: (2025)
Mixture of Reasonings: Teach Large Language Models to Reason with Adaptive Strategies
by: Xiong, Tao, et al.
Published: (2025)
by: Xiong, Tao, et al.
Published: (2025)
Review of Hallucination Understanding in Large Language and Vision Models
by: Ho, Zhengyi, et al.
Published: (2025)
by: Ho, Zhengyi, et al.
Published: (2025)
Towards Theoretical Understandings of Self-Consuming Generative Models
by: Fu, Shi, et al.
Published: (2024)
by: Fu, Shi, et al.
Published: (2024)
GTool: Graph Enhanced Tool Planning with Large Language Model
by: Chen, Wenjie, et al.
Published: (2025)
by: Chen, Wenjie, et al.
Published: (2025)
Revisiting Catastrophic Forgetting in Large Language Model Tuning
by: Li, Hongyu, et al.
Published: (2024)
by: Li, Hongyu, et al.
Published: (2024)
CPSDBench: A Large Language Model Evaluation Benchmark and Baseline for Chinese Public Security Domain
by: Tong, Xin, et al.
Published: (2024)
by: Tong, Xin, et al.
Published: (2024)
ELBA-Bench: An Efficient Learning Backdoor Attacks Benchmark for Large Language Models
by: Liu, Xuxu, et al.
Published: (2025)
by: Liu, Xuxu, et al.
Published: (2025)
RoboDriveVLM: A Novel Benchmark and Baseline towards Robust Vision-Language Models for Autonomous Driving
by: Liao, Dacheng, et al.
Published: (2025)
by: Liao, Dacheng, et al.
Published: (2025)
Learn from Downstream and Be Yourself in Multimodal Large Language Model Fine-Tuning
by: Huang, Wenke, et al.
Published: (2024)
by: Huang, Wenke, et al.
Published: (2024)
LLMC: Benchmarking Large Language Model Quantization with a Versatile Compression Toolkit
by: Gong, Ruihao, et al.
Published: (2024)
by: Gong, Ruihao, et al.
Published: (2024)
Adaptive Defense against Harmful Fine-Tuning for Large Language Models via Bayesian Data Scheduler
by: Hu, Zixuan, et al.
Published: (2025)
by: Hu, Zixuan, et al.
Published: (2025)
Debiasing Large Language Models via Adaptive Causal Prompting with Sketch-of-Thought
by: Li, Bowen, et al.
Published: (2026)
by: Li, Bowen, et al.
Published: (2026)
ICU-Bench:Benchmarking Continual Unlearning in Multimodal Large Language Models
by: Wang, Yuhang, et al.
Published: (2026)
by: Wang, Yuhang, et al.
Published: (2026)
CodePMP: Scalable Preference Model Pretraining for Large Language Model Reasoning
by: Yu, Huimu, et al.
Published: (2024)
by: Yu, Huimu, et al.
Published: (2024)
Similar Items
-
Graph-Augmented Reasoning: Evolving Step-by-Step Knowledge Graph Retrieval for LLM Reasoning
by: Wu, Wenjie, et al.
Published: (2025) -
JustLogic: A Comprehensive Benchmark for Evaluating Deductive Reasoning in Large Language Models
by: Chen, Michael K., et al.
Published: (2025) -
Dynamic Parallel Tree Search for Efficient LLM Reasoning
by: Ding, Yifu, et al.
Published: (2025) -
MedCoG: Maximizing LLM Inference Density in Medical Reasoning via Meta-Cognitive Regulation
by: Zhao, Yu, et al.
Published: (2026) -
Improving Large Language Models with Concept-Aware Fine-Tuning
by: Chen, Michael K., et al.
Published: (2025)