Guardado en:
| Autores principales: | Liu, Yang, Li, Hongming, Qin, Melissa Xiaohui, Liu, Qiankun, Huang, Chao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2604.16593 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Revisiting a Pain in the Neck: Semantic Phrase Processing Benchmark for Language Models
por: Liu, Yang, et al.
Publicado: (2024)
por: Liu, Yang, et al.
Publicado: (2024)
Entropy-Based Data Selection for Language Models
por: Li, Hongming, et al.
Publicado: (2026)
por: Li, Hongming, et al.
Publicado: (2026)
PJB: A Reasoning-Aware Benchmark for Person-Job Retrieval
por: Wang, Guangzhi, et al.
Publicado: (2026)
por: Wang, Guangzhi, et al.
Publicado: (2026)
MixRea: Benchmarking Explicit-Implicit Reasoning in Large Language Models
por: Cai, Yuanqing, et al.
Publicado: (2026)
por: Cai, Yuanqing, et al.
Publicado: (2026)
AstroMind: A High-Fidelity Benchmark for Spacecraft Behavior Reasoning Based on Large Language Models
por: Liu, Hao, et al.
Publicado: (2026)
por: Liu, Hao, et al.
Publicado: (2026)
DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models
por: Zhu, Yakun, et al.
Publicado: (2025)
por: Zhu, Yakun, et al.
Publicado: (2025)
GraCoRe: Benchmarking Graph Comprehension and Complex Reasoning in Large Language Models
por: Yuan, Zike, et al.
Publicado: (2024)
por: Yuan, Zike, et al.
Publicado: (2024)
Revisiting Model Interpolation for Efficient Reasoning
por: Wu, Taiqiang, et al.
Publicado: (2025)
por: Wu, Taiqiang, et al.
Publicado: (2025)
EquiBench: Benchmarking Large Language Models' Reasoning about Program Semantics via Equivalence Checking
por: Wei, Anjiang, et al.
Publicado: (2025)
por: Wei, Anjiang, et al.
Publicado: (2025)
TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models
por: Li, Ce, et al.
Publicado: (2025)
por: Li, Ce, et al.
Publicado: (2025)
SocREval: Large Language Models with the Socratic Method for Reference-Free Reasoning Evaluation
por: He, Hangfeng, et al.
Publicado: (2023)
por: He, Hangfeng, et al.
Publicado: (2023)
LightReasoner: Can Small Language Models Teach Large Language Models Reasoning?
por: Wang, Jingyuan, et al.
Publicado: (2025)
por: Wang, Jingyuan, et al.
Publicado: (2025)
Com$^2$: A Causal-Guided Benchmark for Exploring Complex Commonsense Reasoning in Large Language Models
por: Xiong, Kai, et al.
Publicado: (2025)
por: Xiong, Kai, et al.
Publicado: (2025)
Conceptual and Unbiased Reasoning in Language Models
por: Zhou, Ben, et al.
Publicado: (2024)
por: Zhou, Ben, et al.
Publicado: (2024)
AbsPyramid: Benchmarking the Abstraction Ability of Language Models with a Unified Entailment Graph
por: Wang, Zhaowei, et al.
Publicado: (2023)
por: Wang, Zhaowei, et al.
Publicado: (2023)
Abstraction-of-Thought Makes Language Models Better Reasoners
por: Hong, Ruixin, et al.
Publicado: (2024)
por: Hong, Ruixin, et al.
Publicado: (2024)
Evaluating Large Language Models for Financial Reasoning: A CFA-Based Benchmark Study
por: Yao, Xuan, et al.
Publicado: (2025)
por: Yao, Xuan, et al.
Publicado: (2025)
HyperGVL: Benchmarking and Improving Large Vision-Language Models in Hypergraph Understanding and Reasoning
por: Wei, Yanbin, et al.
Publicado: (2026)
por: Wei, Yanbin, et al.
Publicado: (2026)
MONICA: Real-Time Monitoring and Calibration of Chain-of-Thought Sycophancy in Large Reasoning Models
por: Hu, Jingyu, et al.
Publicado: (2025)
por: Hu, Jingyu, et al.
Publicado: (2025)
Large Language Models Are Cross-Lingual Knowledge-Free Reasoners
por: Hu, Peng, et al.
Publicado: (2024)
por: Hu, Peng, et al.
Publicado: (2024)
A Closer Look at the Self-Verification Abilities of Large Language Models in Logical Reasoning
por: Hong, Ruixin, et al.
Publicado: (2023)
por: Hong, Ruixin, et al.
Publicado: (2023)
LogicGame: Benchmarking Rule-Based Reasoning Abilities of Large Language Models
por: Gui, Jiayi, et al.
Publicado: (2024)
por: Gui, Jiayi, et al.
Publicado: (2024)
CLAMBER: A Benchmark of Identifying and Clarifying Ambiguous Information Needs in Large Language Models
por: Zhang, Tong, et al.
Publicado: (2024)
por: Zhang, Tong, et al.
Publicado: (2024)
Implicit Reasoning in Large Language Models: A Comprehensive Survey
por: Li, Jindong, et al.
Publicado: (2025)
por: Li, Jindong, et al.
Publicado: (2025)
Inference-Time Decontamination: Reusing Leaked Benchmarks for Large Language Model Evaluation
por: Zhu, Qin, et al.
Publicado: (2024)
por: Zhu, Qin, et al.
Publicado: (2024)
BaziQA-Benchmark: Evaluating Symbolic and Temporally Compositional Reasoning in Large Language Models
por: Chen, Jiangxi, et al.
Publicado: (2026)
por: Chen, Jiangxi, et al.
Publicado: (2026)
Revisiting Knowledge Distillation for Autoregressive Language Models
por: Zhong, Qihuang, et al.
Publicado: (2024)
por: Zhong, Qihuang, et al.
Publicado: (2024)
ECR-Chain: Advancing Generative Language Models to Better Emotion-Cause Reasoners through Reasoning Chains
por: Huang, Zhaopei, et al.
Publicado: (2024)
por: Huang, Zhaopei, et al.
Publicado: (2024)
UGMathBench: A Diverse and Dynamic Benchmark for Undergraduate-Level Mathematical Reasoning with Large Language Models
por: Xu, Xin, et al.
Publicado: (2025)
por: Xu, Xin, et al.
Publicado: (2025)
Revisiting the Reliability of Language Models in Instruction-Following
por: Dong, Jianshuo, et al.
Publicado: (2025)
por: Dong, Jianshuo, et al.
Publicado: (2025)
Meta-Reasoning: Semantics-Symbol Deconstruction for Large Language Models
por: Wang, Yiming, et al.
Publicado: (2023)
por: Wang, Yiming, et al.
Publicado: (2023)
Semantic Self-Consistency: Enhancing Language Model Reasoning via Semantic Weighting
por: Knappe, Tim, et al.
Publicado: (2024)
por: Knappe, Tim, et al.
Publicado: (2024)
StableToolBench: Towards Stable Large-Scale Benchmarking on Tool Learning of Large Language Models
por: Guo, Zhicheng, et al.
Publicado: (2024)
por: Guo, Zhicheng, et al.
Publicado: (2024)
EconLogicQA: A Question-Answering Benchmark for Evaluating Large Language Models in Economic Sequential Reasoning
por: Quan, Yinzhu, et al.
Publicado: (2024)
por: Quan, Yinzhu, et al.
Publicado: (2024)
MR-GSM8K: A Meta-Reasoning Benchmark for Large Language Model Evaluation
por: Zeng, Zhongshen, et al.
Publicado: (2023)
por: Zeng, Zhongshen, et al.
Publicado: (2023)
SpeechR: A Benchmark for Speech Reasoning in Large Audio-Language Models
por: Yang, Wanqi, et al.
Publicado: (2025)
por: Yang, Wanqi, et al.
Publicado: (2025)
LLMCBench: Benchmarking Large Language Model Compression for Efficient Deployment
por: Yang, Ge, et al.
Publicado: (2024)
por: Yang, Ge, et al.
Publicado: (2024)
GR-Ben: A General Reasoning Benchmark for Evaluating Process Reward Models
por: Sun, Zhouhao, et al.
Publicado: (2026)
por: Sun, Zhouhao, et al.
Publicado: (2026)
Socratic-PRMBench: Benchmarking Process Reward Models with Systematic Reasoning Patterns
por: Li, Xiang, et al.
Publicado: (2025)
por: Li, Xiang, et al.
Publicado: (2025)
LLMs can be Dangerous Reasoners: Analyzing-based Jailbreak Attack on Large Language Models
por: Lin, Shi, et al.
Publicado: (2024)
por: Lin, Shi, et al.
Publicado: (2024)
Ejemplares similares
-
Revisiting a Pain in the Neck: Semantic Phrase Processing Benchmark for Language Models
por: Liu, Yang, et al.
Publicado: (2024) -
Entropy-Based Data Selection for Language Models
por: Li, Hongming, et al.
Publicado: (2026) -
PJB: A Reasoning-Aware Benchmark for Person-Job Retrieval
por: Wang, Guangzhi, et al.
Publicado: (2026) -
MixRea: Benchmarking Explicit-Implicit Reasoning in Large Language Models
por: Cai, Yuanqing, et al.
Publicado: (2026) -
AstroMind: A High-Fidelity Benchmark for Spacecraft Behavior Reasoning Based on Large Language Models
por: Liu, Hao, et al.
Publicado: (2026)