AI4Math: A Native Spanish Benchmark for University-Level Mathematical Reasoning in Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Perez, Miguel Angel Peñaloza, Orozco, Bruno Lopez, Soto, Jesus Tadeo Cruz, Hernandez, Michelle Bruno, Gonzalez, Miguel Angel Alvarado, Malagon, Sandra |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Do Repetitions Matter? Strengthening Reliability in LLM Evaluations
par: Gonzalez, Miguel Angel Alvarado, et autres
Publié: (2025)
par: Gonzalez, Miguel Angel Alvarado, et autres
Publié: (2025)
Putnam-AXIOM: A Functional and Static Benchmark for Measuring Higher Level Mathematical Reasoning in LLMs
par: Gulati, Aryan, et autres
Publié: (2025)
par: Gulati, Aryan, et autres
Publié: (2025)
LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics
par: Peyronnet, Antoine, et autres
Publié: (2026)
par: Peyronnet, Antoine, et autres
Publié: (2026)
Thinking Machines: Mathematical Reasoning in the Age of LLMs
par: Asperti, Andrea, et autres
Publié: (2025)
par: Asperti, Andrea, et autres
Publié: (2025)
Evaluating Visual Mathematics in Multimodal LLMs: A Multilingual Benchmark Based on the Kangaroo Tests
par: Sáez, Arnau Igualde, et autres
Publié: (2025)
par: Sáez, Arnau Igualde, et autres
Publié: (2025)
CogniLoad: A Synthetic Natural Language Reasoning Benchmark With Tunable Length, Intrinsic Difficulty, and Distractor Density
par: Kaiser, Daniel, et autres
Publié: (2025)
par: Kaiser, Daniel, et autres
Publié: (2025)
Enhancing Mathematical Problem Solving in LLMs through Execution-Driven Reasoning Augmentation
par: Basarkar, Aditya, et autres
Publié: (2026)
par: Basarkar, Aditya, et autres
Publié: (2026)
Intersymbolic AI: Interlinking Symbolic AI and Subsymbolic AI
par: Platzer, André
Publié: (2024)
par: Platzer, André
Publié: (2024)
Scaling Accessible Mathematics on arXiv: HTML Conversion and MathML 4
par: Ginev, Deyan, et autres
Publié: (2026)
par: Ginev, Deyan, et autres
Publié: (2026)
PLUGH: A Benchmark for Spatial Understanding and Reasoning in Large Language Models
par: Tikhonov, Alexey
Publié: (2024)
par: Tikhonov, Alexey
Publié: (2024)
Formal Conjectures: An Open and Evolving Benchmark for Verified Discovery in Mathematics
par: Firsching, Moritz, et autres
Publié: (2026)
par: Firsching, Moritz, et autres
Publié: (2026)
Fact Grounded Attention: Eliminating Hallucination in Large Language Models Through Attention Level Knowledge Integration
par: Gupta, Aayush
Publié: (2025)
par: Gupta, Aayush
Publié: (2025)
Few-Class Arena: A Benchmark for Efficient Selection of Vision Models and Dataset Difficulty Measurement
par: Cao, Bryan Bo, et autres
Publié: (2024)
par: Cao, Bryan Bo, et autres
Publié: (2024)
The Geometry of Persona: Disentangling Personality from Reasoning in Large Language Models
par: Wang, Zhixiang
Publié: (2025)
par: Wang, Zhixiang
Publié: (2025)
Graph2Tac: Online Representation Learning of Formal Math Concepts
par: Blaauwbroek, Lasse, et autres
Publié: (2024)
par: Blaauwbroek, Lasse, et autres
Publié: (2024)
Math Natural Language Inference: this should be easy!
par: de Paiva, Valeria, et autres
Publié: (2025)
par: de Paiva, Valeria, et autres
Publié: (2025)
NeuroState-Bench: A Human-Calibrated Benchmark for Commitment Integrity in LLM Agent Profiles
par: Jia, Xiao
Publié: (2026)
par: Jia, Xiao
Publié: (2026)
ParaRNN: Unlocking Parallel Training of Nonlinear RNNs for Large Language Models
par: Danieli, Federico, et autres
Publié: (2025)
par: Danieli, Federico, et autres
Publié: (2025)
AgentDS Technical Report: Benchmarking the Future of Human-AI Collaboration in Domain-Specific Data Science
par: Luo, An, et autres
Publié: (2026)
par: Luo, An, et autres
Publié: (2026)
Conformal Path Reasoning: Trustworthy Knowledge Graph Question Answering via Path-Level Calibration
par: Lin, Shuhang, et autres
Publié: (2026)
par: Lin, Shuhang, et autres
Publié: (2026)
Agentic UAVs: LLM-Driven Autonomy with Integrated Tool-Calling and Cognitive Reasoning
par: Koubaa, Anis, et autres
Publié: (2025)
par: Koubaa, Anis, et autres
Publié: (2025)
QHackBench: Benchmarking Large Language Models for Quantum Code Generation Using PennyLane Hackathon Challenges
par: Basit, Abdul, et autres
Publié: (2025)
par: Basit, Abdul, et autres
Publié: (2025)
RCI: A Score for Evaluating Global and Local Reasoning in Multimodal Benchmarks
par: Agarwal, Amit, et autres
Publié: (2025)
par: Agarwal, Amit, et autres
Publié: (2025)
VisChainBench: A Benchmark for Multi-Turn, Multi-Image Visual Reasoning Beyond Language Priors
par: Lyu, Wenbo, et autres
Publié: (2025)
par: Lyu, Wenbo, et autres
Publié: (2025)
JAM: Controllable and Responsible Text Generation via Causal Reasoning and Latent Vector Manipulation
par: Huang, Yingbing, et autres
Publié: (2025)
par: Huang, Yingbing, et autres
Publié: (2025)
Perception-Consistency Multimodal Large Language Models Reasoning via Caption-Regularized Policy Optimization
par: Tu, Songjun, et autres
Publié: (2025)
par: Tu, Songjun, et autres
Publié: (2025)
Rethinking the Multilingual Reasoning Gap with Layer Swap
par: Lasbordes, Maxence, et autres
Publié: (2026)
par: Lasbordes, Maxence, et autres
Publié: (2026)
MedMemoryBench: Benchmarking Agent Memory in Personalized Healthcare
par: Wang, Yihao, et autres
Publié: (2026)
par: Wang, Yihao, et autres
Publié: (2026)
ProfileXAI: User-Adaptive Explainable AI
par: Corrales, Gilber A., et autres
Publié: (2025)
par: Corrales, Gilber A., et autres
Publié: (2025)
From Noise to Diversity: Random Embedding Injection in LLM Reasoning
par: Kim, Heejun, et autres
Publié: (2026)
par: Kim, Heejun, et autres
Publié: (2026)
Evaluating Model-Agnostic Meta-Learning on MetaWorld ML10 Benchmark: Fast Adaptation in Robotic Manipulation Tasks
par: Atamuradov, Sanjar
Publié: (2025)
par: Atamuradov, Sanjar
Publié: (2025)
CLMN: Concept based Language Models via Neural Symbolic Reasoning
par: Yang, Yibo
Publié: (2025)
par: Yang, Yibo
Publié: (2025)
Arithmetic Without Algorithms: Language Models Solve Math With a Bag of Heuristics
par: Nikankin, Yaniv, et autres
Publié: (2024)
par: Nikankin, Yaniv, et autres
Publié: (2024)
ThinkJEPA: Empowering Latent World Models with Large Vision-Language Reasoning Model
par: Zhang, Haichao, et autres
Publié: (2026)
par: Zhang, Haichao, et autres
Publié: (2026)
Banana Ripeness Level Classification using a Simple CNN Model Trained with Real and Synthetic Datasets
par: Chuquimarca, Luis, et autres
Publié: (2025)
par: Chuquimarca, Luis, et autres
Publié: (2025)
AI Agents: Evolution, Architecture, and Real-World Applications
par: Krishnan, Naveen
Publié: (2025)
par: Krishnan, Naveen
Publié: (2025)
Vis-CoT: A Human-in-the-Loop Framework for Interactive Visualization and Intervention in LLM Chain-of-Thought Reasoning
par: Pather, Kaviraj, et autres
Publié: (2025)
par: Pather, Kaviraj, et autres
Publié: (2025)
Enhancing Ultra-Low-Bit Quantization of Large Language Models Through Saliency-Aware Partial Retraining
par: Cao, Deyu, et autres
Publié: (2025)
par: Cao, Deyu, et autres
Publié: (2025)
Semantically Guided Adversarial Testing of Vision Models Using Language Models
par: Filus, Katarzyna, et autres
Publié: (2025)
par: Filus, Katarzyna, et autres
Publié: (2025)
AI Model for Predicting Binding Affinity of Antidiabetic Compounds Targeting PPAR
par: Aman, La Ode, et autres
Publié: (2024)
par: Aman, La Ode, et autres
Publié: (2024)
Documents similaires
-
Do Repetitions Matter? Strengthening Reliability in LLM Evaluations
par: Gonzalez, Miguel Angel Alvarado, et autres
Publié: (2025) -
Putnam-AXIOM: A Functional and Static Benchmark for Measuring Higher Level Mathematical Reasoning in LLMs
par: Gulati, Aryan, et autres
Publié: (2025) -
LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics
par: Peyronnet, Antoine, et autres
Publié: (2026) -
Thinking Machines: Mathematical Reasoning in the Age of LLMs
par: Asperti, Andrea, et autres
Publié: (2025) -
Evaluating Visual Mathematics in Multimodal LLMs: A Multilingual Benchmark Based on the Kangaroo Tests
par: Sáez, Arnau Igualde, et autres
Publié: (2025)