VAR-MATH: Probing True Mathematical Reasoning in LLMS via Symbolic Multi-Instance Benchmarks
Fuente:
arXiv
Salvato in:
| Autori principali: | Yao, Jian, Cheng, Ran, Tan, Kay Chen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
FormalMATH: Benchmarking Formal Mathematical Reasoning of Large Language Models
di: Yu, Zhouliang, et al.
Pubblicazione: (2025)
di: Yu, Zhouliang, et al.
Pubblicazione: (2025)
Memorize Theorems, Not Instances: Probing SFT Generalization through Mathematical Reasoning
di: Peng, Ruiying, et al.
Pubblicazione: (2026)
di: Peng, Ruiying, et al.
Pubblicazione: (2026)
InfinityMATH: A Scalable Instruction Tuning Dataset in Programmatic Mathematical Reasoning
di: Zhang, Bo-Wen, et al.
Pubblicazione: (2024)
di: Zhang, Bo-Wen, et al.
Pubblicazione: (2024)
MATH-Perturb: Benchmarking LLMs' Math Reasoning Abilities against Hard Perturbations
di: Huang, Kaixuan, et al.
Pubblicazione: (2025)
di: Huang, Kaixuan, et al.
Pubblicazione: (2025)
Measuring Multimodal Mathematical Reasoning with MATH-Vision Dataset
di: Wang, Ke, et al.
Pubblicazione: (2024)
di: Wang, Ke, et al.
Pubblicazione: (2024)
MATH-Beyond: A Benchmark for RL to Expand Beyond the Base Model
di: Mayilvahanan, Prasanna, et al.
Pubblicazione: (2025)
di: Mayilvahanan, Prasanna, et al.
Pubblicazione: (2025)
Advanced Weakly-Supervised Formula Exploration for Neuro-Symbolic Mathematical Reasoning
di: Wu, Yuxuan, et al.
Pubblicazione: (2025)
di: Wu, Yuxuan, et al.
Pubblicazione: (2025)
GSM-Symbolic: Understanding the Limitations of Mathematical Reasoning in Large Language Models
di: Mirzadeh, Iman, et al.
Pubblicazione: (2024)
di: Mirzadeh, Iman, et al.
Pubblicazione: (2024)
An Investigation of Robustness of LLMs in Mathematical Reasoning: Benchmarking with Mathematically-Equivalent Transformation of Advanced Mathematical Problems
di: Hao, Yuren, et al.
Pubblicazione: (2025)
di: Hao, Yuren, et al.
Pubblicazione: (2025)
Label-free Node Classification on Graphs with Large Language Models (LLMS)
di: Chen, Zhikai, et al.
Pubblicazione: (2023)
di: Chen, Zhikai, et al.
Pubblicazione: (2023)
OptMATH: A Scalable Bidirectional Data Synthesis Framework for Optimization Modeling
di: Lu, Hongliang, et al.
Pubblicazione: (2025)
di: Lu, Hongliang, et al.
Pubblicazione: (2025)
The KANDY Benchmark: Incremental Neuro-Symbolic Learning and Reasoning with Kandinsky Patterns
di: Lorello, Luca Salvatore, et al.
Pubblicazione: (2024)
di: Lorello, Luca Salvatore, et al.
Pubblicazione: (2024)
A Neuro-Symbolic Benchmark Suite for Concept Quality and Reasoning Shortcuts
di: Bortolotti, Samuele, et al.
Pubblicazione: (2024)
di: Bortolotti, Samuele, et al.
Pubblicazione: (2024)
I-RAVEN-X: Benchmarking Generalization and Robustness of Analogical and Mathematical Reasoning in Large Language and Reasoning Models
di: Camposampiero, Giacomo, et al.
Pubblicazione: (2025)
di: Camposampiero, Giacomo, et al.
Pubblicazione: (2025)
FormInv: A Measurement Protocol for Semantic Invariance in Mathematical Reasoning Benchmarks
di: Thomas, Nishal, et al.
Pubblicazione: (2026)
di: Thomas, Nishal, et al.
Pubblicazione: (2026)
MV-MATH: Evaluating Multimodal Math Reasoning in Multi-Visual Contexts
di: Wang, Peijie, et al.
Pubblicazione: (2025)
di: Wang, Peijie, et al.
Pubblicazione: (2025)
Bias-Restrained Prefix Representation Finetuning for Mathematical Reasoning
di: Liang, Sirui, et al.
Pubblicazione: (2025)
di: Liang, Sirui, et al.
Pubblicazione: (2025)
Softened Symbol Grounding for Neuro-symbolic Systems
di: Li, Zenan, et al.
Pubblicazione: (2024)
di: Li, Zenan, et al.
Pubblicazione: (2024)
Symbolic Analysis of Grover Search Algorithm via Chain-of-Thought Reasoning and Quantum-Native Tokenization
di: Chen, Min, et al.
Pubblicazione: (2025)
di: Chen, Min, et al.
Pubblicazione: (2025)
MDPO: Multi-Granularity Direct Preference Optimization for Mathematical Reasoning
di: Lin, Yunze
Pubblicazione: (2025)
di: Lin, Yunze
Pubblicazione: (2025)
AXIOM: A Trust-First Neuro-Symbolic Execution Architecture for Verifiable Mathematical Reasoning
di: Bruno, Alessio
Pubblicazione: (2026)
di: Bruno, Alessio
Pubblicazione: (2026)
When Stability Fails: Hidden Failure Modes Of LLMS in Data-Constrained Scientific Decision-Making
di: Riasat, Nazia
Pubblicazione: (2026)
di: Riasat, Nazia
Pubblicazione: (2026)
Whatever Remains Must Be True: Filtering Drives Reasoning in LLMs, Shaping Diversity
di: Kruszewski, Germán, et al.
Pubblicazione: (2025)
di: Kruszewski, Germán, et al.
Pubblicazione: (2025)
The MUSE Benchmark: Probing Music Perception and Auditory Relational Reasoning in Audio LLMS
di: Carone, Brandon James, et al.
Pubblicazione: (2025)
di: Carone, Brandon James, et al.
Pubblicazione: (2025)
Learning for Long-Horizon Planning via Neuro-Symbolic Abductive Imitation
di: Shao, Jie-Jing, et al.
Pubblicazione: (2024)
di: Shao, Jie-Jing, et al.
Pubblicazione: (2024)
SLAT: Segment-Level Adaptive Trimming for Efficient CoT Reasoning
di: Yao, Jian, et al.
Pubblicazione: (2026)
di: Yao, Jian, et al.
Pubblicazione: (2026)
Symbol-Equivariant Recurrent Reasoning Models
di: Freinschlag, Richard, et al.
Pubblicazione: (2026)
di: Freinschlag, Richard, et al.
Pubblicazione: (2026)
SNIP: Bridging Mathematical Symbolic and Numeric Realms with Unified Pre-training
di: Meidani, Kazem, et al.
Pubblicazione: (2023)
di: Meidani, Kazem, et al.
Pubblicazione: (2023)
FinChain: A Symbolic Benchmark for Verifiable Chain-of-Thought Financial Reasoning
di: Xie, Zhuohan, et al.
Pubblicazione: (2025)
di: Xie, Zhuohan, et al.
Pubblicazione: (2025)
Symbol Grounding in Neuro-Symbolic AI: A Gentle Introduction to Reasoning Shortcuts
di: Marconato, Emanuele, et al.
Pubblicazione: (2025)
di: Marconato, Emanuele, et al.
Pubblicazione: (2025)
Neural Reasoning for Robust Instance Retrieval in $\mathcal{SHOIQ}$
di: Teyou, Louis Mozart Kamdem, et al.
Pubblicazione: (2025)
di: Teyou, Louis Mozart Kamdem, et al.
Pubblicazione: (2025)
Rethinking Fine-Tuning when Scaling Test-Time Compute: Limiting Confidence Improves Mathematical Reasoning
di: Chen, Feng, et al.
Pubblicazione: (2025)
di: Chen, Feng, et al.
Pubblicazione: (2025)
RESOLVE: Relational Reasoning with Symbolic and Object-Level Features Using Vector Symbolic Processing
di: Mejri, Mohamed, et al.
Pubblicazione: (2024)
di: Mejri, Mohamed, et al.
Pubblicazione: (2024)
EngTrace: A Symbolic Benchmark for Verifiable Process Supervision of Engineering Reasoning
di: Gull, Ayesha, et al.
Pubblicazione: (2025)
di: Gull, Ayesha, et al.
Pubblicazione: (2025)
A Mathematical Framework and a Suite of Learning Techniques for Neural-Symbolic Systems
di: Dickens, Charles, et al.
Pubblicazione: (2024)
di: Dickens, Charles, et al.
Pubblicazione: (2024)
Vector Symbolic Algebras for the Abstraction and Reasoning Corpus
di: Joffe, Isaac, et al.
Pubblicazione: (2025)
di: Joffe, Isaac, et al.
Pubblicazione: (2025)
Hyperdimensional Probe: Decoding LLM Representations via Vector Symbolic Architectures
di: Bronzini, Marco, et al.
Pubblicazione: (2025)
di: Bronzini, Marco, et al.
Pubblicazione: (2025)
Mathematics and Coding are Universal AI Benchmarks
di: Chojecki, Przemyslaw
Pubblicazione: (2025)
di: Chojecki, Przemyslaw
Pubblicazione: (2025)
The Quest for Efficient Reasoning: A Data-Centric Benchmark to CoT Distillation
di: Zhang, Ruichen, et al.
Pubblicazione: (2025)
di: Zhang, Ruichen, et al.
Pubblicazione: (2025)
DABstep: Data Agent Benchmark for Multi-step Reasoning
di: Egg, Alex, et al.
Pubblicazione: (2025)
di: Egg, Alex, et al.
Pubblicazione: (2025)
Documenti analoghi
-
FormalMATH: Benchmarking Formal Mathematical Reasoning of Large Language Models
di: Yu, Zhouliang, et al.
Pubblicazione: (2025) -
Memorize Theorems, Not Instances: Probing SFT Generalization through Mathematical Reasoning
di: Peng, Ruiying, et al.
Pubblicazione: (2026) -
InfinityMATH: A Scalable Instruction Tuning Dataset in Programmatic Mathematical Reasoning
di: Zhang, Bo-Wen, et al.
Pubblicazione: (2024) -
MATH-Perturb: Benchmarking LLMs' Math Reasoning Abilities against Hard Perturbations
di: Huang, Kaixuan, et al.
Pubblicazione: (2025) -
Measuring Multimodal Mathematical Reasoning with MATH-Vision Dataset
di: Wang, Ke, et al.
Pubblicazione: (2024)