LR^2Bench: Evaluating Long-chain Reflective Reasoning Capabilities of Large Language Models via Constraint Satisfaction Problems
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Chen, Jianghao, Wei, Zhenlin, Ren, Zhenjiang, Li, Ziyong, Zhang, Jiajun |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
HelloBench: Evaluating Long Text Generation Capabilities of Large Language Models
von: Que, Haoran, et al.
Veröffentlicht: (2024)
von: Que, Haoran, et al.
Veröffentlicht: (2024)
ACE-RL: Adaptive Constraint-Enhanced Reward for Long-form Generation Reinforcement Learning
von: Chen, Jianghao, et al.
Veröffentlicht: (2025)
von: Chen, Jianghao, et al.
Veröffentlicht: (2025)
Hit the Sweet Spot! Span-Level Ensemble for Large Language Models
von: Xu, Yangyifan, et al.
Veröffentlicht: (2024)
von: Xu, Yangyifan, et al.
Veröffentlicht: (2024)
FoundaBench: Evaluating Chinese Fundamental Knowledge Capabilities of Large Language Models
von: Li, Wei, et al.
Veröffentlicht: (2024)
von: Li, Wei, et al.
Veröffentlicht: (2024)
Evaluating Accounting Reasoning Capabilities of Large Language Models
von: Zhou, Jie, et al.
Veröffentlicht: (2026)
von: Zhou, Jie, et al.
Veröffentlicht: (2026)
RAD-Bench: Evaluating Large Language Models Capabilities in Retrieval Augmented Dialogues
von: Kuo, Tzu-Lin, et al.
Veröffentlicht: (2024)
von: Kuo, Tzu-Lin, et al.
Veröffentlicht: (2024)
DebugBench: Evaluating Debugging Capability of Large Language Models
von: Tian, Runchu, et al.
Veröffentlicht: (2024)
von: Tian, Runchu, et al.
Veröffentlicht: (2024)
RefineBench: Evaluating Refinement Capability of Language Models via Checklists
von: Lee, Young-Jun, et al.
Veröffentlicht: (2025)
von: Lee, Young-Jun, et al.
Veröffentlicht: (2025)
CounterBench: Evaluating and Improving Counterfactual Reasoning in Large Language Models
von: Chen, Yuefei, et al.
Veröffentlicht: (2025)
von: Chen, Yuefei, et al.
Veröffentlicht: (2025)
Can LLMs Think Like Consumers? Benchmarking Crowd-Level Reaction Reconstruction with ConsumerSimBench
von: Wang, Tianyu, et al.
Veröffentlicht: (2026)
von: Wang, Tianyu, et al.
Veröffentlicht: (2026)
Evaluating Consistency and Reasoning Capabilities of Large Language Models
von: Saxena, Yash, et al.
Veröffentlicht: (2024)
von: Saxena, Yash, et al.
Veröffentlicht: (2024)
A Reality Check of Language Models as Formalizers on Constraint Satisfaction Problems
von: Amonkar, Rikhil, et al.
Veröffentlicht: (2025)
von: Amonkar, Rikhil, et al.
Veröffentlicht: (2025)
CityBench: Evaluating the Capabilities of Large Language Models for Urban Tasks
von: Feng, Jie, et al.
Veröffentlicht: (2024)
von: Feng, Jie, et al.
Veröffentlicht: (2024)
LADM: Long-context Training Data Selection with Attention-based Dependency Measurement for LLMs
von: Chen, Jianghao, et al.
Veröffentlicht: (2025)
von: Chen, Jianghao, et al.
Veröffentlicht: (2025)
DrawingBench: Evaluating Spatial Reasoning and UI Interaction Capabilities of Large Language Models through Mouse-Based Drawing Tasks
von: Kim, Hyunjun, et al.
Veröffentlicht: (2025)
von: Kim, Hyunjun, et al.
Veröffentlicht: (2025)
Unlocking General Long Chain-of-Thought Reasoning Capabilities of Large Language Models via Representation Engineering
von: Tang, Xinyu, et al.
Veröffentlicht: (2025)
von: Tang, Xinyu, et al.
Veröffentlicht: (2025)
Evaluating Interventional Reasoning Capabilities of Large Language Models
von: Kasetty, Tejas, et al.
Veröffentlicht: (2024)
von: Kasetty, Tejas, et al.
Veröffentlicht: (2024)
Instruct-of-Reflection: Enhancing Large Language Models Iterative Reflection Capabilities via Dynamic-Meta Instruction
von: Liu, Liping, et al.
Veröffentlicht: (2025)
von: Liu, Liping, et al.
Veröffentlicht: (2025)
CodeEditorBench: Evaluating Code Editing Capability of Large Language Models
von: Guo, Jiawei, et al.
Veröffentlicht: (2024)
von: Guo, Jiawei, et al.
Veröffentlicht: (2024)
OralMLLM-Bench: Evaluating Cognitive Capabilities of Multimodal Large Language Models in Dental Practice
von: Wang, Rongyang, et al.
Veröffentlicht: (2026)
von: Wang, Rongyang, et al.
Veröffentlicht: (2026)
Orthographic Constraint Satisfaction and Human Difficulty Alignment in Large Language Models
von: Tuck, Bryan E., et al.
Veröffentlicht: (2025)
von: Tuck, Bryan E., et al.
Veröffentlicht: (2025)
TurnBench-MS: A Benchmark for Evaluating Multi-Turn, Multi-Step Reasoning in Large Language Models
von: Zhang, Yiran, et al.
Veröffentlicht: (2025)
von: Zhang, Yiran, et al.
Veröffentlicht: (2025)
TimeBench: A Comprehensive Evaluation of Temporal Reasoning Abilities in Large Language Models
von: Chu, Zheng, et al.
Veröffentlicht: (2023)
von: Chu, Zheng, et al.
Veröffentlicht: (2023)
Reasoning Capabilities and Invariability of Large Language Models
von: Raganato, Alessandro, et al.
Veröffentlicht: (2025)
von: Raganato, Alessandro, et al.
Veröffentlicht: (2025)
Evaluating the Generalization Capabilities of Large Language Models on Code Reasoning
von: Yang, Rem, et al.
Veröffentlicht: (2025)
von: Yang, Rem, et al.
Veröffentlicht: (2025)
MentalBench: A DSM-Grounded Benchmark for Evaluating Psychiatric Diagnostic Capability of Large Language Models
von: Song, Hoyun, et al.
Veröffentlicht: (2026)
von: Song, Hoyun, et al.
Veröffentlicht: (2026)
Plug-and-Play Grounding of Reasoning in Multimodal Large Language Models
von: Chen, Jiaxing, et al.
Veröffentlicht: (2024)
von: Chen, Jiaxing, et al.
Veröffentlicht: (2024)
CARL-GT: Evaluating Causal Reasoning Capabilities of Large Language Models
von: Tu, Ruibo, et al.
Veröffentlicht: (2024)
von: Tu, Ruibo, et al.
Veröffentlicht: (2024)
Medical Reasoning with Large Language Models: A Survey and MR-Bench
von: Ren, Xiaohan, et al.
Veröffentlicht: (2026)
von: Ren, Xiaohan, et al.
Veröffentlicht: (2026)
MuBench: Assessment of Multilingual Capabilities of Large Language Models Across 61 Languages
von: Han, Wenhan, et al.
Veröffentlicht: (2025)
von: Han, Wenhan, et al.
Veröffentlicht: (2025)
DebateBench: A Challenging Long Context Reasoning Benchmark For Large Language Models
von: Tiwari, Utkarsh, et al.
Veröffentlicht: (2025)
von: Tiwari, Utkarsh, et al.
Veröffentlicht: (2025)
EffiReason-Bench: A Unified Benchmark for Evaluating and Advancing Efficient Reasoning in Large Language Models
von: Huang, Junquan, et al.
Veröffentlicht: (2025)
von: Huang, Junquan, et al.
Veröffentlicht: (2025)
Evaluating the Generation Capabilities of Large Chinese Language Models
von: Zeng, Hui, et al.
Veröffentlicht: (2023)
von: Zeng, Hui, et al.
Veröffentlicht: (2023)
NewsBench: A Systematic Evaluation Framework for Assessing Editorial Capabilities of Large Language Models in Chinese Journalism
von: Li, Miao, et al.
Veröffentlicht: (2024)
von: Li, Miao, et al.
Veröffentlicht: (2024)
Marco-Bench-MIF: On Multilingual Instruction-Following Capability of Large Language Models
von: Zeng, Bo, et al.
Veröffentlicht: (2025)
von: Zeng, Bo, et al.
Veröffentlicht: (2025)
Recurrent Confidence Chain: Temporal-Aware Uncertainty Quantification in Large Language Models
von: Mao, Zhenjiang, et al.
Veröffentlicht: (2026)
von: Mao, Zhenjiang, et al.
Veröffentlicht: (2026)
EquiBench: Benchmarking Large Language Models' Reasoning about Program Semantics via Equivalence Checking
von: Wei, Anjiang, et al.
Veröffentlicht: (2025)
von: Wei, Anjiang, et al.
Veröffentlicht: (2025)
Efficient Reasoning for Large Reasoning Language Models via Certainty-Guided Reflection Suppression
von: Huang, Jiameng, et al.
Veröffentlicht: (2025)
von: Huang, Jiameng, et al.
Veröffentlicht: (2025)
CodeIF-Bench: Evaluating Instruction-Following Capabilities of Large Language Models in Interactive Code Generation
von: Wang, Peiding, et al.
Veröffentlicht: (2025)
von: Wang, Peiding, et al.
Veröffentlicht: (2025)
Look Again, Think Slowly: Enhancing Visual Reflection in Vision-Language Models
von: Jian, Pu, et al.
Veröffentlicht: (2025)
von: Jian, Pu, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
HelloBench: Evaluating Long Text Generation Capabilities of Large Language Models
von: Que, Haoran, et al.
Veröffentlicht: (2024) -
ACE-RL: Adaptive Constraint-Enhanced Reward for Long-form Generation Reinforcement Learning
von: Chen, Jianghao, et al.
Veröffentlicht: (2025) -
Hit the Sweet Spot! Span-Level Ensemble for Large Language Models
von: Xu, Yangyifan, et al.
Veröffentlicht: (2024) -
FoundaBench: Evaluating Chinese Fundamental Knowledge Capabilities of Large Language Models
von: Li, Wei, et al.
Veröffentlicht: (2024) -
Evaluating Accounting Reasoning Capabilities of Large Language Models
von: Zhou, Jie, et al.
Veröffentlicht: (2026)