The Importance of Being Statistically Earnest: A Critical Re-evaluation of GSM-Symbolic
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Długosz, Dominika Agnieszka, Oliveira, Arlindo, Díaz-Rodríguez, Natalia |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
GSM-SEM: Benchmark and Framework for Generating Semantically Variant Augmentations
par: Singh, Jyotika, et autres
Publié: (2026)
par: Singh, Jyotika, et autres
Publié: (2026)
Re-evaluating Theory of Mind evaluation in large language models
par: Hu, Jennifer, et autres
Publié: (2025)
par: Hu, Jennifer, et autres
Publié: (2025)
GSM-Infinite: How Do Your LLMs Behave over Infinitely Increasing Context Length and Reasoning Complexity?
par: Zhou, Yang, et autres
Publié: (2025)
par: Zhou, Yang, et autres
Publié: (2025)
Achieving >97% on GSM8K: Deeply Understanding the Problems Makes LLMs Better Solvers for Math Word Problems
par: Zhong, Qihuang, et autres
Publié: (2024)
par: Zhong, Qihuang, et autres
Publié: (2024)
ReIFE: Re-evaluating Instruction-Following Evaluation
par: Liu, Yixin, et autres
Publié: (2024)
par: Liu, Yixin, et autres
Publié: (2024)
Chain or tree? Re-evaluating complex reasoning from the perspective of a matrix of thought
par: Tang, Fengxiao, et autres
Publié: (2025)
par: Tang, Fengxiao, et autres
Publié: (2025)
Something's Fishy In The Data Lake: A Critical Re-evaluation of Table Union Search Benchmarks
par: Boutaleb, Allaa, et autres
Publié: (2025)
par: Boutaleb, Allaa, et autres
Publié: (2025)
The Illusion of Progress: Re-evaluating Hallucination Detection in LLMs
par: Janiak, Denis, et autres
Publié: (2025)
par: Janiak, Denis, et autres
Publié: (2025)
Symbol-LLM: Towards Foundational Symbol-centric Interface For Large Language Models
par: Xu, Fangzhi, et autres
Publié: (2023)
par: Xu, Fangzhi, et autres
Publié: (2023)
Re-evaluating the Need for Multimodal Signals in Unsupervised Grammar Induction
par: Li, Boyi, et autres
Publié: (2022)
par: Li, Boyi, et autres
Publié: (2022)
Re-evaluating Automatic LLM System Ranking for Alignment with Human Preference
par: Gao, Mingqi, et autres
Publié: (2024)
par: Gao, Mingqi, et autres
Publié: (2024)
ReCrit: Transition-Aware Reinforcement Learning for Scientific Critic Reasoning
par: Xu, Wanghan, et autres
Publié: (2026)
par: Xu, Wanghan, et autres
Publié: (2026)
ReAttn: Improving Attention-based Re-ranking via Attention Re-weighting
par: Tian, Yuxing, et autres
Publié: (2026)
par: Tian, Yuxing, et autres
Publié: (2026)
On the Importance and Evaluation of Narrativity in Natural Language AI Explanations
par: Cedro, Mateusz, et autres
Publié: (2026)
par: Cedro, Mateusz, et autres
Publié: (2026)
Predicting Training Re-evaluation Curves Enables Effective Data Curriculums for LLMs
par: Bergsma, Shane, et autres
Publié: (2025)
par: Bergsma, Shane, et autres
Publié: (2025)
Large Language Models Often Know When They Are Being Evaluated
par: Needham, Joe, et autres
Publié: (2025)
par: Needham, Joe, et autres
Publié: (2025)
GSM8K-V: Can Vision Language Models Solve Grade School Math Word Problems in Visual Contexts
par: Yuan, Fan, et autres
Publié: (2025)
par: Yuan, Fan, et autres
Publié: (2025)
How Large Language Models Need Symbolism
par: Deng, Xiaotie, et autres
Publié: (2025)
par: Deng, Xiaotie, et autres
Publié: (2025)
Reasoning Core: A Scalable RL Environment for LLM Symbolic Reasoning
par: Lacombe, Valentin, et autres
Publié: (2025)
par: Lacombe, Valentin, et autres
Publié: (2025)
A Novel Architecture for Symbolic Reasoning with Decision Trees and LLM Agents
par: Kiruluta, Andrew
Publié: (2025)
par: Kiruluta, Andrew
Publié: (2025)
Tokenization Constraints in LLMs: A Study of Symbolic and Arithmetic Reasoning Limits
par: Zhang, Xiang, et autres
Publié: (2025)
par: Zhang, Xiang, et autres
Publié: (2025)
ATA: A Neuro-Symbolic Approach to Implement Autonomous and Trustworthy Agents
par: Peer, David, et autres
Publié: (2025)
par: Peer, David, et autres
Publié: (2025)
LLM Self Defense: By Self Examination, LLMs Know They Are Being Tricked
par: Phute, Mansi, et autres
Publié: (2023)
par: Phute, Mansi, et autres
Publié: (2023)
Improving Symbolic Translation of Language Models for Logical Reasoning
par: Thatikonda, Ramya Keerthy, et autres
Publié: (2026)
par: Thatikonda, Ramya Keerthy, et autres
Publié: (2026)
Semi-automated Fact-checking in Portuguese: Corpora Enrichment using Retrieval with Claim extraction
par: Gomes, Juliana Resplande Sant'anna, et autres
Publié: (2025)
par: Gomes, Juliana Resplande Sant'anna, et autres
Publié: (2025)
RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation
par: Xu, Xinnuo, et autres
Publié: (2025)
par: Xu, Xinnuo, et autres
Publié: (2025)
Explainable Rule Application via Structured Prompting: A Neural-Symbolic Approach
par: Sadowski, Albert, et autres
Publié: (2025)
par: Sadowski, Albert, et autres
Publié: (2025)
Node Importance Estimation Leveraging LLMs for Semantic Augmentation in Knowledge Graphs
par: Lin, Xinyu, et autres
Publié: (2024)
par: Lin, Xinyu, et autres
Publié: (2024)
PIS: Linking Importance Sampling and Attention Mechanisms for Efficient Prompt Compression
par: Chen, Lizhe, et autres
Publié: (2025)
par: Chen, Lizhe, et autres
Publié: (2025)
Importance Weighting Can Help Large Language Models Self-Improve
par: Jiang, Chunyang, et autres
Publié: (2024)
par: Jiang, Chunyang, et autres
Publié: (2024)
Does Using Counterfactual Help LLMs Explain Textual Importance in Classification?
par: Tan, Nelvin, et autres
Publié: (2025)
par: Tan, Nelvin, et autres
Publié: (2025)
Entropy Meets Importance: A Unified Head Importance-Entropy Score for Stable and Efficient Transformer Pruning
par: Choi, Minsik, et autres
Publié: (2025)
par: Choi, Minsik, et autres
Publié: (2025)
Code-as-Symbolic-Planner: Foundation Model-Based Robot Planning via Symbolic Code Generation
par: Chen, Yongchao, et autres
Publié: (2025)
par: Chen, Yongchao, et autres
Publié: (2025)
Table-Critic: A Multi-Agent Framework for Collaborative Criticism and Refinement in Table Reasoning
par: Yu, Peiying, et autres
Publié: (2025)
par: Yu, Peiying, et autres
Publié: (2025)
Reliable Extraction of Clinical Follow-Up Instructions: A Hybrid Neural-Symbolic Pipeline
par: Laufer, Michal, et autres
Publié: (2026)
par: Laufer, Michal, et autres
Publié: (2026)
A Dynamic Atlas of Persian Poetic Symbolism: Families, Fields, and the Historical Rewiring of Meaning
par: Shahnazari, Kourosh, et autres
Publié: (2026)
par: Shahnazari, Kourosh, et autres
Publié: (2026)
The EpisTwin: A Knowledge Graph-Grounded Neuro-Symbolic Architecture for Personal AI
par: Servedio, Giovanni, et autres
Publié: (2026)
par: Servedio, Giovanni, et autres
Publié: (2026)
In Context Learning and Reasoning for Symbolic Regression with Large Language Models
par: Sharlin, Samiha, et autres
Publié: (2024)
par: Sharlin, Samiha, et autres
Publié: (2024)
Non-Interactive Symbolic-Aided Chain-of-Thought for Logical Reasoning
par: Nguyen, Phuong Minh, et autres
Publié: (2025)
par: Nguyen, Phuong Minh, et autres
Publié: (2025)
Advanced Deep Learning Approaches for Automated Recognition of Cuneiform Symbols
par: Elshehaby, Shahad, et autres
Publié: (2025)
par: Elshehaby, Shahad, et autres
Publié: (2025)
Documents similaires
-
GSM-SEM: Benchmark and Framework for Generating Semantically Variant Augmentations
par: Singh, Jyotika, et autres
Publié: (2026) -
Re-evaluating Theory of Mind evaluation in large language models
par: Hu, Jennifer, et autres
Publié: (2025) -
GSM-Infinite: How Do Your LLMs Behave over Infinitely Increasing Context Length and Reasoning Complexity?
par: Zhou, Yang, et autres
Publié: (2025) -
Achieving >97% on GSM8K: Deeply Understanding the Problems Makes LLMs Better Solvers for Math Word Problems
par: Zhong, Qihuang, et autres
Publié: (2024) -
ReIFE: Re-evaluating Instruction-Following Evaluation
par: Liu, Yixin, et autres
Publié: (2024)