RoMath: A Mathematical Reasoning Benchmark in Romanian
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Cosma, Adrian, Bucur, Ana-Maria, Radoi, Emilian |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A Retrieval-Based Approach to Medical Procedure Matching in Romanian
par: Niculae, Andrei, et autres
Publié: (2025)
par: Niculae, Andrei, et autres
Publié: (2025)
Dr.Copilot: A Multi-Agent Prompt Optimized Assistant for Improving Patient-Doctor Communication in Romanian
par: Niculae, Andrei, et autres
Publié: (2025)
par: Niculae, Andrei, et autres
Publié: (2025)
What Makes a Good Doctor Response? A Study on Text-Based Telemedicine
par: Cosma, Adrian, et autres
Publié: (2026)
par: Cosma, Adrian, et autres
Publié: (2026)
RoMathExam: A Longitudinal Dataset of Romanian Math Exams (1895-2025) with a Seven-Decade Core (1957-2025)
par: Cuclea, Luca-Ncolae, et autres
Publié: (2026)
par: Cuclea, Luca-Ncolae, et autres
Publié: (2026)
Training Language Models with homotokens Leads to Delayed Overfitting
par: Cosma, Adrian, et autres
Publié: (2026)
par: Cosma, Adrian, et autres
Publié: (2026)
The Strawberry Problem: Emergence of Character-level Understanding in Tokenized Language Models
par: Cosma, Adrian, et autres
Publié: (2025)
par: Cosma, Adrian, et autres
Publié: (2025)
PsihoRo: Depression and Anxiety Romanian Text Corpus
par: Ciobotaru, Alexandra, et autres
Publié: (2026)
par: Ciobotaru, Alexandra, et autres
Publié: (2026)
An In-Vitro Study on Cross-Lingual Generalization in Language Models
par: Cosma, Adrian
Publié: (2026)
par: Cosma, Adrian
Publié: (2026)
PoPreRo: A New Dataset for Popularity Prediction of Romanian Reddit Posts
par: Rogoz, Ana-Cristina, et autres
Publié: (2024)
par: Rogoz, Ana-Cristina, et autres
Publié: (2024)
RoCode: A Dataset for Measuring Code Intelligence from Problem Definitions in Romanian
par: Cosma, Adrian, et autres
Publié: (2024)
par: Cosma, Adrian, et autres
Publié: (2024)
ConceptMath: A Bilingual Concept-wise Benchmark for Measuring Mathematical Reasoning of Large Language Models
par: Wu, Yanan, et autres
Publié: (2024)
par: Wu, Yanan, et autres
Publié: (2024)
CrossGaze: A Strong Method for 3D Gaze Estimation in the Wild
par: Cătrună, Andy, et autres
Publié: (2024)
par: Cătrună, Andy, et autres
Publié: (2024)
MatheMagic: Generating Dynamic Mathematics Benchmarks Robust to Memorization
par: O'Brien, Dayyán, et autres
Publié: (2025)
par: O'Brien, Dayyán, et autres
Publié: (2025)
VisAidMath: Benchmarking Visual-Aided Mathematical Reasoning
par: Ma, Jingkun, et autres
Publié: (2024)
par: Ma, Jingkun, et autres
Publié: (2024)
The Paradox of Motion: Evidence for Spurious Correlations in Skeleton-based Gait Recognition Models
par: Cătrună, Andy, et autres
Publié: (2024)
par: Cătrună, Andy, et autres
Publié: (2024)
MoME: Estimating Psychological Traits from Gait with Multi-Stage Mixture of Movement Experts
par: Cǎtrunǎ, Andy, et autres
Publié: (2025)
par: Cǎtrunǎ, Andy, et autres
Publié: (2025)
On Model and Data Scaling for Skeleton-based Self-Supervised Gait Recognition
par: Cosma, Adrian, et autres
Publié: (2025)
par: Cosma, Adrian, et autres
Publié: (2025)
MathOdyssey: Benchmarking Mathematical Problem-Solving Skills in Large Language Models Using Odyssey Math Data
par: Fang, Meng, et autres
Publié: (2024)
par: Fang, Meng, et autres
Publié: (2024)
MultiMath: Bridging Visual and Mathematical Reasoning for Large Language Models
par: Peng, Shuai, et autres
Publié: (2024)
par: Peng, Shuai, et autres
Publié: (2024)
TeleMath: A Benchmark for Large Language Models in Telecom Mathematical Problem Solving
par: Colle, Vincenzo, et autres
Publié: (2025)
par: Colle, Vincenzo, et autres
Publié: (2025)
SuperCLUE-Math6: Graded Multi-Step Math Reasoning Benchmark for LLMs in Chinese
par: Xu, Liang, et autres
Publié: (2024)
par: Xu, Liang, et autres
Publié: (2024)
MathFimer: Enhancing Mathematical Reasoning by Expanding Reasoning Steps through Fill-in-the-Middle Task
par: Yan, Yuchen, et autres
Publié: (2025)
par: Yan, Yuchen, et autres
Publié: (2025)
MathScale: Scaling Instruction Tuning for Mathematical Reasoning
par: Tang, Zhengyang, et autres
Publié: (2024)
par: Tang, Zhengyang, et autres
Publié: (2024)
GaitPT: Skeletons Are All You Need For Gait Recognition
par: Catruna, Andy, et autres
Publié: (2023)
par: Catruna, Andy, et autres
Publié: (2023)
DeepSeekMath-V2: Towards Self-Verifiable Mathematical Reasoning
par: Shao, Zhihong, et autres
Publié: (2025)
par: Shao, Zhihong, et autres
Publié: (2025)
MathAgent: Adversarial Evolution of Constraint Graphs for Mathematical Reasoning Data Synthesis
par: Yu, Zixiong, et autres
Publié: (2026)
par: Yu, Zixiong, et autres
Publié: (2026)
DynaMath: A Dynamic Visual Benchmark for Evaluating Mathematical Reasoning Robustness of Vision Language Models
par: Zou, Chengke, et autres
Publié: (2024)
par: Zou, Chengke, et autres
Publié: (2024)
FineMath: A Fine-Grained Mathematical Evaluation Benchmark for Chinese Large Language Models
par: Liu, Yan, et autres
Publié: (2024)
par: Liu, Yan, et autres
Publié: (2024)
MathGenie: Generating Synthetic Data with Question Back-translation for Enhancing Mathematical Reasoning of LLMs
par: Lu, Zimu, et autres
Publié: (2024)
par: Lu, Zimu, et autres
Publié: (2024)
RoLegalGEC: Legal Domain Grammatical Error Detection and Correction Dataset for Romanian
par: Timpuriu, Mircea, et autres
Publié: (2026)
par: Timpuriu, Mircea, et autres
Publié: (2026)
MetaMath: Bootstrap Your Own Mathematical Questions for Large Language Models
par: Yu, Longhui, et autres
Publié: (2023)
par: Yu, Longhui, et autres
Publié: (2023)
MathCoder2: Better Math Reasoning from Continued Pretraining on Model-translated Mathematical Code
par: Lu, Zimu, et autres
Publié: (2024)
par: Lu, Zimu, et autres
Publié: (2024)
DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning
par: He, Zhiwei, et autres
Publié: (2025)
par: He, Zhiwei, et autres
Publié: (2025)
Spatial Colour Mixing Illusions as a Perception Stress Test for Vision-Language Models
par: Basoc, Nicoleta-Nina, et autres
Publié: (2026)
par: Basoc, Nicoleta-Nina, et autres
Publié: (2026)
DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
par: Shao, Zhihong, et autres
Publié: (2024)
par: Shao, Zhihong, et autres
Publié: (2024)
DotaMath: Decomposition of Thought with Code Assistance and Self-correction for Mathematical Reasoning
par: Li, Chengpeng, et autres
Publié: (2024)
par: Li, Chengpeng, et autres
Publié: (2024)
Polymath: A Challenging Multi-modal Mathematical Reasoning Benchmark
par: Gupta, Himanshu, et autres
Publié: (2024)
par: Gupta, Himanshu, et autres
Publié: (2024)
TabularMath: Understanding Math Reasoning over Tables with Large Language Models
par: Tian, Shi-Yu, et autres
Publié: (2025)
par: Tian, Shi-Yu, et autres
Publié: (2025)
MathCoder-VL: Bridging Vision and Code for Enhanced Multimodal Mathematical Reasoning
par: Wang, Ke, et autres
Publié: (2025)
par: Wang, Ke, et autres
Publié: (2025)
MuMath-Code: Combining Tool-Use Large Language Models with Multi-perspective Data Augmentation for Mathematical Reasoning
par: Yin, Shuo, et autres
Publié: (2024)
par: Yin, Shuo, et autres
Publié: (2024)
Documents similaires
-
A Retrieval-Based Approach to Medical Procedure Matching in Romanian
par: Niculae, Andrei, et autres
Publié: (2025) -
Dr.Copilot: A Multi-Agent Prompt Optimized Assistant for Improving Patient-Doctor Communication in Romanian
par: Niculae, Andrei, et autres
Publié: (2025) -
What Makes a Good Doctor Response? A Study on Text-Based Telemedicine
par: Cosma, Adrian, et autres
Publié: (2026) -
RoMathExam: A Longitudinal Dataset of Romanian Math Exams (1895-2025) with a Seven-Decade Core (1957-2025)
par: Cuclea, Luca-Ncolae, et autres
Publié: (2026) -
Training Language Models with homotokens Leads to Delayed Overfitting
par: Cosma, Adrian, et autres
Publié: (2026)