LLM CHESS: Benchmarking Reasoning and Instruction-Following in LLMs through Chess
Fuente:
arXiv
Guardado en:
| Autores principales: | Kolasani, Sai, Saplin, Maxim, Crispino, Nicholas, Montgomery, Kyle, Davis, Jared Quincy, Zaharia, Matei, Wang, Chi, Wang, Chenguang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Agent Instructs Large Language Models to be General Zero-Shot Reasoners
por: Crispino, Nicholas, et al.
Publicado: (2023)
por: Crispino, Nicholas, et al.
Publicado: (2023)
Are More LLM Calls All You Need? Towards Scaling Laws of Compound Inference Systems
por: Chen, Lingjiao, et al.
Publicado: (2024)
por: Chen, Lingjiao, et al.
Publicado: (2024)
Networks of Networks: Complexity Class Principles Applied to Compound AI Systems Design
por: Davis, Jared Quincy, et al.
Publicado: (2024)
por: Davis, Jared Quincy, et al.
Publicado: (2024)
Optimizing Model Selection for Compound AI Systems
por: Chen, Lingjiao, et al.
Publicado: (2025)
por: Chen, Lingjiao, et al.
Publicado: (2025)
BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation
por: Zhu, Alan, et al.
Publicado: (2025)
por: Zhu, Alan, et al.
Publicado: (2025)
Explore the Reasoning Capability of LLMs in the Chess Testbed
por: Wang, Shu, et al.
Publicado: (2024)
por: Wang, Shu, et al.
Publicado: (2024)
Multi-IF: Benchmarking LLMs on Multi-Turn and Multilingual Instructions Following
por: He, Yun, et al.
Publicado: (2024)
por: He, Yun, et al.
Publicado: (2024)
RAG over Thinking Traces Can Improve Reasoning Tasks
por: Arabzadeh, Negar, et al.
Publicado: (2026)
por: Arabzadeh, Negar, et al.
Publicado: (2026)
The Price Reversal Phenomenon: When Cheaper Reasoning Models Cost More
por: Chen, Lingjiao, et al.
Publicado: (2026)
por: Chen, Lingjiao, et al.
Publicado: (2026)
Peer-Preservation in Frontier Models
por: Potter, Yujin, et al.
Publicado: (2026)
por: Potter, Yujin, et al.
Publicado: (2026)
JudgeBench: A Benchmark for Evaluating LLM-based Judges
por: Tan, Sijun, et al.
Publicado: (2024)
por: Tan, Sijun, et al.
Publicado: (2024)
COSMIC: Generalized Refusal Direction Identification in LLM Activations
por: Siu, Vincent, et al.
Publicado: (2025)
por: Siu, Vincent, et al.
Publicado: (2025)
A Framework for Formalizing LLM Agent Security
por: Siu, Vincent, et al.
Publicado: (2026)
por: Siu, Vincent, et al.
Publicado: (2026)
SteeringSafety: A Systematic Safety Evaluation Framework of Representation Steering in LLMs
por: Siu, Vincent, et al.
Publicado: (2025)
por: Siu, Vincent, et al.
Publicado: (2025)
Re-Tuning: Overcoming the Compositionality Limits of Large Language Models with Recursive Tuning
por: Pasewark, Eric, et al.
Publicado: (2024)
por: Pasewark, Eric, et al.
Publicado: (2024)
SIEVE: Sample-Efficient Parametric Learning from Natural Language
por: Asawa, Parth, et al.
Publicado: (2026)
por: Asawa, Parth, et al.
Publicado: (2026)
Reasoning Models Can Be Effective Without Thinking
por: Ma, Wenjie, et al.
Publicado: (2025)
por: Ma, Wenjie, et al.
Publicado: (2025)
RepIt: Steering Language Models with Concept-Specific Refusal Vectors
por: Siu, Vincent, et al.
Publicado: (2025)
por: Siu, Vincent, et al.
Publicado: (2025)
ACORN: Performant and Predicate-Agnostic Search Over Vector Embeddings and Structured Data
por: Patel, Liana, et al.
Publicado: (2024)
por: Patel, Liana, et al.
Publicado: (2024)
World Model on Million-Length Video And Language With Blockwise RingAttention
por: Liu, Hao, et al.
Publicado: (2024)
por: Liu, Hao, et al.
Publicado: (2024)
Can QPP Choose the Right Query Variant? Evaluating Query Variant Selection for RAG Pipelines
por: Arabzadeh, Negar, et al.
Publicado: (2026)
por: Arabzadeh, Negar, et al.
Publicado: (2026)
ChessArena: A Chess Testbed for Evaluating Strategic Reasoning Capabilities of Large Language Models
por: Liu, Jincheng, et al.
Publicado: (2025)
por: Liu, Jincheng, et al.
Publicado: (2025)
Hierarchical Alignment: Enforcing Hierarchical Instruction-Following in LLMs through Logical Consistency
por: Yang, Shu, et al.
Publicado: (2026)
por: Yang, Shu, et al.
Publicado: (2026)
Specifications: The missing link to making the development of LLM systems an engineering discipline
por: Stoica, Ion, et al.
Publicado: (2024)
por: Stoica, Ion, et al.
Publicado: (2024)
MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models
por: Tu, Jianhong, et al.
Publicado: (2024)
por: Tu, Jianhong, et al.
Publicado: (2024)
Can LLMs Simulate Personas with Reversed Performance? A Systematic Investigation for Counterfactual Instruction Following in Math Reasoning Context
por: Kumar, Sai Adith Senthil, et al.
Publicado: (2025)
por: Kumar, Sai Adith Senthil, et al.
Publicado: (2025)
GRAID: Enhancing Spatial Reasoning of VLMs Through High-Fidelity Data Generation
por: Elmaaroufi, Karim, et al.
Publicado: (2025)
por: Elmaaroufi, Karim, et al.
Publicado: (2025)
CHESS Compact Wiggler construction report
por: Temnykh, Alexander, et al.
Publicado: (2025)
por: Temnykh, Alexander, et al.
Publicado: (2025)
When Thinking Fails: The Pitfalls of Reasoning for Instruction-Following in LLMs
por: Li, Xiaomin, et al.
Publicado: (2025)
por: Li, Xiaomin, et al.
Publicado: (2025)
Optimizing Instructions and Demonstrations for Multi-Stage Language Model Programs
por: Opsahl-Ong, Krista, et al.
Publicado: (2024)
por: Opsahl-Ong, Krista, et al.
Publicado: (2024)
Complete Chess Games Enable LLM Become A Chess Master
por: Zhang, Yinqi, et al.
Publicado: (2025)
por: Zhang, Yinqi, et al.
Publicado: (2025)
FollowTable: A Benchmark for Instruction-Following Table Retrieval
por: Jin, Rihui, et al.
Publicado: (2026)
por: Jin, Rihui, et al.
Publicado: (2026)
CHESS: Optimizing LLM Inference via Channel-Wise Thresholding and Selective Sparsification
por: He, Junhui, et al.
Publicado: (2024)
por: He, Junhui, et al.
Publicado: (2024)
GraphTool-Instruction: Revolutionizing Graph Reasoning in LLMs through Decomposed Subtask Instruction
por: Wang, Rongzheng, et al.
Publicado: (2024)
por: Wang, Rongzheng, et al.
Publicado: (2024)
VMDT: Decoding the Trustworthiness of Video Foundation Models
por: Potter, Yujin, et al.
Publicado: (2025)
por: Potter, Yujin, et al.
Publicado: (2025)
OfficeQA Pro: An Enterprise Benchmark for End-to-End Grounded Reasoning
por: Opsahl-Ong, Krista, et al.
Publicado: (2026)
por: Opsahl-Ong, Krista, et al.
Publicado: (2026)
ARES: An Automated Evaluation Framework for Retrieval-Augmented Generation Systems
por: Saad-Falcon, Jon, et al.
Publicado: (2023)
por: Saad-Falcon, Jon, et al.
Publicado: (2023)
DeepScholar-Bench: A Live Benchmark and Automated Evaluation for Generative Research Synthesis
por: Patel, Liana, et al.
Publicado: (2025)
por: Patel, Liana, et al.
Publicado: (2025)
Light-IF: Endowing LLMs with Generalizable Reasoning via Preview and Self-Checking for Complex Instruction Following
por: Wang, Chenyang, et al.
Publicado: (2025)
por: Wang, Chenyang, et al.
Publicado: (2025)
CHESS: Contextual Harnessing for Efficient SQL Synthesis
por: Talaei, Shayan, et al.
Publicado: (2024)
por: Talaei, Shayan, et al.
Publicado: (2024)
Ejemplares similares
-
Agent Instructs Large Language Models to be General Zero-Shot Reasoners
por: Crispino, Nicholas, et al.
Publicado: (2023) -
Are More LLM Calls All You Need? Towards Scaling Laws of Compound Inference Systems
por: Chen, Lingjiao, et al.
Publicado: (2024) -
Networks of Networks: Complexity Class Principles Applied to Compound AI Systems Design
por: Davis, Jared Quincy, et al.
Publicado: (2024) -
Optimizing Model Selection for Compound AI Systems
por: Chen, Lingjiao, et al.
Publicado: (2025) -
BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation
por: Zhu, Alan, et al.
Publicado: (2025)