ThinkBench: Dynamic Out-of-Distribution Evaluation for Robust LLM Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Huang, Shulin, Yang, Linyi, Song, Yan, Chen, Shuang, Cui, Leyang, Wan, Ziyu, Zeng, Qingcheng, Wen, Ying, Shao, Kun, Zhang, Weinan, Wang, Jun, Zhang, Yue |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Thinking Out Loud: Do Reasoning Models Know When They're Right?
di: Zeng, Qingcheng, et al.
Pubblicazione: (2025)
di: Zeng, Qingcheng, et al.
Pubblicazione: (2025)
Reinforcing Language Agents via Policy Optimization with Action Decomposition
di: Wen, Muning, et al.
Pubblicazione: (2024)
di: Wen, Muning, et al.
Pubblicazione: (2024)
MCEval: A Dynamic Framework for Fair Multilingual Cultural Evaluation of LLMs
di: Huang, Shulin, et al.
Pubblicazione: (2025)
di: Huang, Shulin, et al.
Pubblicazione: (2025)
Language Games as the Pathway to Artificial Superhuman Intelligence
di: Wen, Ying, et al.
Pubblicazione: (2025)
di: Wen, Ying, et al.
Pubblicazione: (2025)
ODP-Bench: Benchmarking Out-of-Distribution Performance Prediction
di: Yu, Han, et al.
Pubblicazione: (2025)
di: Yu, Han, et al.
Pubblicazione: (2025)
DeepReview: Improving LLM-based Paper Review with Human-like Deep Thinking Process
di: Zhu, Minjun, et al.
Pubblicazione: (2025)
di: Zhu, Minjun, et al.
Pubblicazione: (2025)
OpenR: An Open Source Framework for Advanced Reasoning with Large Language Models
di: Wang, Jun, et al.
Pubblicazione: (2024)
di: Wang, Jun, et al.
Pubblicazione: (2024)
ReMA: Learning to Meta-think for LLMs with Multi-Agent Reinforcement Learning
di: Wan, Ziyu, et al.
Pubblicazione: (2025)
di: Wan, Ziyu, et al.
Pubblicazione: (2025)
Direct Value Optimization: Improving Chain-of-Thought Reasoning in LLMs with Refined Values
di: Zhang, Hongbo, et al.
Pubblicazione: (2025)
di: Zhang, Hongbo, et al.
Pubblicazione: (2025)
Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training
di: Feng, Xidong, et al.
Pubblicazione: (2023)
di: Feng, Xidong, et al.
Pubblicazione: (2023)
LLM-based Multi-Agent Systems: Techniques and Business Perspectives
di: Yang, Yingxuan, et al.
Pubblicazione: (2024)
di: Yang, Yingxuan, et al.
Pubblicazione: (2024)
Leveraging Human Production-Interpretation Asymmetries to Test LLM Cognitive Plausibility
di: Lam, Suet-Ying, et al.
Pubblicazione: (2025)
di: Lam, Suet-Ying, et al.
Pubblicazione: (2025)
Fact or Facsimile? Evaluating the Factual Robustness of Modern Retrievers
di: Wu, Haoyu, et al.
Pubblicazione: (2025)
di: Wu, Haoyu, et al.
Pubblicazione: (2025)
TiViBench: Benchmarking Think-in-Video Reasoning for Video Generative Models
di: Chen, Harold Haodong, et al.
Pubblicazione: (2025)
di: Chen, Harold Haodong, et al.
Pubblicazione: (2025)
Federated Neural Radiance Field for Distributed Intelligence
di: Zhang, Yintian, et al.
Pubblicazione: (2024)
di: Zhang, Yintian, et al.
Pubblicazione: (2024)
Spotting AI's Touch: Identifying LLM-Paraphrased Spans in Text
di: Li, Yafu, et al.
Pubblicazione: (2024)
di: Li, Yafu, et al.
Pubblicazione: (2024)
Alleviating Hallucinations of Large Language Models through Induced Hallucinations
di: Zhang, Yue, et al.
Pubblicazione: (2023)
di: Zhang, Yue, et al.
Pubblicazione: (2023)
Demystifying Reasoning Dynamics with Mutual Information: Thinking Tokens are Information Peaks in LLM Reasoning
di: Qian, Chen, et al.
Pubblicazione: (2025)
di: Qian, Chen, et al.
Pubblicazione: (2025)
Cascade-KDE: Robust Time-Series Restoration under Out-of-Distribution Impulse Corruptions
di: Liu, Yuefeng, et al.
Pubblicazione: (2026)
di: Liu, Yuefeng, et al.
Pubblicazione: (2026)
MAGE: Machine-generated Text Detection in the Wild
di: Li, Yafu, et al.
Pubblicazione: (2023)
di: Li, Yafu, et al.
Pubblicazione: (2023)
Agent Exchange: Shaping the Future of AI Agent Economics
di: Yang, Yingxuan, et al.
Pubblicazione: (2025)
di: Yang, Yingxuan, et al.
Pubblicazione: (2025)
Linear Independence of Generalized Neurons and Related Functions
di: Zhang, Leyang
Pubblicazione: (2024)
di: Zhang, Leyang
Pubblicazione: (2024)
MAGIC: A Co-Evolving Attacker-Defender Adversarial Game for Robust LLM Safety
di: Wen, Xiaoyu, et al.
Pubblicazione: (2026)
di: Wen, Xiaoyu, et al.
Pubblicazione: (2026)
How Likely Do LLMs with CoT Mimic Human Reasoning?
di: Bao, Guangsheng, et al.
Pubblicazione: (2024)
di: Bao, Guangsheng, et al.
Pubblicazione: (2024)
Distributed Invariant Kalman Filter for Object-level Multi-robot Pose SLAM
di: Li, Haoying, et al.
Pubblicazione: (2024)
di: Li, Haoying, et al.
Pubblicazione: (2024)
TIR-Bench: A Comprehensive Benchmark for Agentic Thinking-with-Images Reasoning
di: Li, Ming, et al.
Pubblicazione: (2025)
di: Li, Ming, et al.
Pubblicazione: (2025)
MedAgentsBench: Benchmarking Thinking Models and Agent Frameworks for Complex Medical Reasoning
di: Tang, Xiangru, et al.
Pubblicazione: (2025)
di: Tang, Xiangru, et al.
Pubblicazione: (2025)
AgentEscapeBench: Evaluating Out-of-Domain Tool-Grounded Reasoning in LLM Agents
di: Guo, Zhengkang, et al.
Pubblicazione: (2026)
di: Guo, Zhengkang, et al.
Pubblicazione: (2026)
Thinking Short and Right Over Thinking Long: Serving LLM Reasoning Efficiently and Accurately
di: Wang, Yuhang, et al.
Pubblicazione: (2025)
di: Wang, Yuhang, et al.
Pubblicazione: (2025)
Gap Probability Distribution of Gaussian Unitary Ensembles and Painlevé V Equation
di: Zhang, Shengjie, et al.
Pubblicazione: (2024)
di: Zhang, Shengjie, et al.
Pubblicazione: (2024)
Beyond English-Centric Training: How Reinforcement Learning Improves Cross-Lingual Reasoning in LLMs
di: Huang, Shulin, et al.
Pubblicazione: (2025)
di: Huang, Shulin, et al.
Pubblicazione: (2025)
SenTSR-Bench: Thinking with Injected Knowledge for Time-Series Reasoning
di: He, Zelin, et al.
Pubblicazione: (2026)
di: He, Zelin, et al.
Pubblicazione: (2026)
Thinking Out of Order: When Output Order Stops Reflecting Reasoning Order in Diffusion Language Models
di: Yu, Longxuan, et al.
Pubblicazione: (2026)
di: Yu, Longxuan, et al.
Pubblicazione: (2026)
Embedding Trajectory for Out-of-Distribution Detection in Mathematical Reasoning
di: Wang, Yiming, et al.
Pubblicazione: (2024)
di: Wang, Yiming, et al.
Pubblicazione: (2024)
Retrieval-Augmented Process Reward Model for Generalizable Mathematical Reasoning
di: Zhu, Jiachen, et al.
Pubblicazione: (2025)
di: Zhu, Jiachen, et al.
Pubblicazione: (2025)
Mutual Theory of Mind in Human-AI Collaboration: An Empirical Study with LLM-driven AI Agents in a Real-time Shared Workspace Task
di: Zhang, Shao, et al.
Pubblicazione: (2024)
di: Zhang, Shao, et al.
Pubblicazione: (2024)
VarBench: Robust Language Model Benchmarking Through Dynamic Variable Perturbation
di: Qian, Kun, et al.
Pubblicazione: (2024)
di: Qian, Kun, et al.
Pubblicazione: (2024)
Entropy-Regularized Token-Level Policy Optimization for Language Agent Reinforcement
di: Wen, Muning, et al.
Pubblicazione: (2024)
di: Wen, Muning, et al.
Pubblicazione: (2024)
Robust Target Speaker Direction of Arrival Estimation
di: Li, Zixuan, et al.
Pubblicazione: (2024)
di: Li, Zixuan, et al.
Pubblicazione: (2024)
ZSC-Eval: An Evaluation Toolkit and Benchmark for Multi-agent Zero-shot Coordination
di: Wang, Xihuai, et al.
Pubblicazione: (2023)
di: Wang, Xihuai, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Thinking Out Loud: Do Reasoning Models Know When They're Right?
di: Zeng, Qingcheng, et al.
Pubblicazione: (2025) -
Reinforcing Language Agents via Policy Optimization with Action Decomposition
di: Wen, Muning, et al.
Pubblicazione: (2024) -
MCEval: A Dynamic Framework for Fair Multilingual Cultural Evaluation of LLMs
di: Huang, Shulin, et al.
Pubblicazione: (2025) -
Language Games as the Pathway to Artificial Superhuman Intelligence
di: Wen, Ying, et al.
Pubblicazione: (2025) -
ODP-Bench: Benchmarking Out-of-Distribution Performance Prediction
di: Yu, Han, et al.
Pubblicazione: (2025)