Enregistré dans:
| Auteurs principaux: | Rastogi, Ritvik, Dharashivkar, Sachin, Varma, Sandeep |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2508.08665 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Aryabhata 2: Scaling Reinforcement Learning for Advanced STEM Reasoning
par: Rastogi, Ritvik, et autres
Publié: (2026)
par: Rastogi, Ritvik, et autres
Publié: (2026)
MathDivide: Improved mathematical reasoning by large language models
par: Srivastava, Saksham Sahai, et autres
Publié: (2024)
par: Srivastava, Saksham Sahai, et autres
Publié: (2024)
The potential -- and the pitfalls -- of using pre-trained language models as cognitive science theories
par: Shah, Raj Sanjay, et autres
Publié: (2025)
par: Shah, Raj Sanjay, et autres
Publié: (2025)
A Novel Approach to Image EEG Sleep Data for Improving Quality of Life in Patients Suffering From Brain Injuries Using DreamDiffusion
par: Fahim, David, et autres
Publié: (2024)
par: Fahim, David, et autres
Publié: (2024)
fact check AI at SemEval-2025 Task 7: Multilingual and Crosslingual Fact-checked Claim Retrieval
par: Rastogi, Pranshu
Publié: (2025)
par: Rastogi, Pranshu
Publié: (2025)
PROVEX: Enhancing SOC Analyst Trust with Explainable Provenance-Based IDS
par: Dhanuka, Devang, et autres
Publié: (2025)
par: Dhanuka, Devang, et autres
Publié: (2025)
DEI: Diversity in Evolutionary Inference for Quality-Diversity Search
par: Donaghy, John, et autres
Publié: (2026)
par: Donaghy, John, et autres
Publié: (2026)
MathArena: Evaluating LLMs on Uncontaminated Math Competitions
par: Balunović, Mislav, et autres
Publié: (2025)
par: Balunović, Mislav, et autres
Publié: (2025)
FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI
par: Glazer, Elliot, et autres
Publié: (2024)
par: Glazer, Elliot, et autres
Publié: (2024)
Domain Generalization In Robust Invariant Representation
par: Gupta, Gauri, et autres
Publié: (2023)
par: Gupta, Gauri, et autres
Publié: (2023)
ContraPrompt: Contrastive Prompt Optimization via Dyadic Reasoning Trace Analysis
par: Rishav, Rishav, et autres
Publié: (2026)
par: Rishav, Rishav, et autres
Publié: (2026)
CoDream: Exchanging dreams instead of models for federated aggregation with heterogeneous models
par: Singh, Abhishek, et autres
Publié: (2024)
par: Singh, Abhishek, et autres
Publié: (2024)
Orca-Math: Unlocking the potential of SLMs in Grade School Math
par: Mitra, Arindam, et autres
Publié: (2024)
par: Mitra, Arindam, et autres
Publié: (2024)
Chatsparent: An Interactive System for Detecting and Mitigating Cognitive Fatigue in LLMs
par: Marwah, Riju, et autres
Publié: (2025)
par: Marwah, Riju, et autres
Publié: (2025)
TimeSeriesExam: A time series understanding exam
par: Cai, Yifu, et autres
Publié: (2024)
par: Cai, Yifu, et autres
Publié: (2024)
MegaMath: Pushing the Limits of Open Math Corpora
par: Zhou, Fan, et autres
Publié: (2025)
par: Zhou, Fan, et autres
Publié: (2025)
Dissociating language and thought in large language models
par: Mahowald, Kyle, et autres
Publié: (2023)
par: Mahowald, Kyle, et autres
Publié: (2023)
TabularMath: Understanding Math Reasoning over Tables with Large Language Models
par: Tian, Shi-Yu, et autres
Publié: (2025)
par: Tian, Shi-Yu, et autres
Publié: (2025)
DOoM: Difficult Olympiads of Math
par: Kuleshov, Ilya, et autres
Publié: (2025)
par: Kuleshov, Ilya, et autres
Publié: (2025)
GamiBench: Evaluating Spatial Reasoning and 2D-to-3D Planning Capabilities of MLLMs with Origami Folding Tasks
par: Spencer, Ryan, et autres
Publié: (2025)
par: Spencer, Ryan, et autres
Publié: (2025)
AgenticMath: Enhancing LLM Reasoning via Agentic-based Math Data Generation
par: Liu, Xianyang, et autres
Publié: (2025)
par: Liu, Xianyang, et autres
Publié: (2025)
MathMistake Checker: A Comprehensive Demonstration for Step-by-Step Math Problem Mistake Finding by Prompt-Guided LLMs
par: Zhang, Tianyang, et autres
Publié: (2025)
par: Zhang, Tianyang, et autres
Publié: (2025)
The wall confronting large language models
par: Coveney, Peter V., et autres
Publié: (2025)
par: Coveney, Peter V., et autres
Publié: (2025)
Pessimistic Verification for Open Ended Math Questions
par: Huang, Yanxing, et autres
Publié: (2025)
par: Huang, Yanxing, et autres
Publié: (2025)
Neuro-Symbolic Data Generation for Math Reasoning
par: Li, Zenan, et autres
Publié: (2024)
par: Li, Zenan, et autres
Publié: (2024)
SuperCLUE-Math6: Graded Multi-Step Math Reasoning Benchmark for LLMs in Chinese
par: Xu, Liang, et autres
Publié: (2024)
par: Xu, Liang, et autres
Publié: (2024)
Math Neurosurgery: Isolating Language Models' Math Reasoning Abilities Using Only Forward Passes
par: Christ, Bryan R., et autres
Publié: (2024)
par: Christ, Bryan R., et autres
Publié: (2024)
MuggleMath: Assessing the Impact of Query and Response Augmentation on Math Reasoning
par: Li, Chengpeng, et autres
Publié: (2023)
par: Li, Chengpeng, et autres
Publié: (2023)
MathPile: A Billion-Token-Scale Pretraining Corpus for Math
par: Wang, Zengzhi, et autres
Publié: (2023)
par: Wang, Zengzhi, et autres
Publié: (2023)
ControlMath: Controllable Data Generation Promotes Math Generalist Models
par: Chen, Nuo, et autres
Publié: (2024)
par: Chen, Nuo, et autres
Publié: (2024)
Recovering implicit physics model under real-world constraints
par: Banerjee, Ayan, et autres
Publié: (2024)
par: Banerjee, Ayan, et autres
Publié: (2024)
MathBuddy: A Multimodal System for Affective Math Tutoring
par: Kar, Debanjana, et autres
Publié: (2025)
par: Kar, Debanjana, et autres
Publié: (2025)
The effect of fine-tuning on language model toxicity
par: Hawkins, Will, et autres
Publié: (2024)
par: Hawkins, Will, et autres
Publié: (2024)
ChatGPT as a Math Questioner? Evaluating ChatGPT on Generating Pre-university Math Questions
par: Van Long, Phuoc Pham, et autres
Publié: (2023)
par: Van Long, Phuoc Pham, et autres
Publié: (2023)
Fluent dreaming for language models
par: Thompson, T. Ben, et autres
Publié: (2024)
par: Thompson, T. Ben, et autres
Publié: (2024)
Algorithmic progress in language models
par: Ho, Anson, et autres
Publié: (2024)
par: Ho, Anson, et autres
Publié: (2024)
Adapting Large Language Models to Emerging Cybersecurity using Retrieval Augmented Generation
par: Borah, Arnabh, et autres
Publié: (2025)
par: Borah, Arnabh, et autres
Publié: (2025)
AceMath: Advancing Frontier Math Reasoning with Post-Training and Reward Modeling
par: Liu, Zihan, et autres
Publié: (2024)
par: Liu, Zihan, et autres
Publié: (2024)
MARGE: Improving Math Reasoning for LLMs with Guided Exploration
par: Gao, Jingyue, et autres
Publié: (2025)
par: Gao, Jingyue, et autres
Publié: (2025)
MathConstruct: Challenging LLM Reasoning with Constructive Proofs
par: Balunović, Mislav, et autres
Publié: (2025)
par: Balunović, Mislav, et autres
Publié: (2025)
Documents similaires
-
Aryabhata 2: Scaling Reinforcement Learning for Advanced STEM Reasoning
par: Rastogi, Ritvik, et autres
Publié: (2026) -
MathDivide: Improved mathematical reasoning by large language models
par: Srivastava, Saksham Sahai, et autres
Publié: (2024) -
The potential -- and the pitfalls -- of using pre-trained language models as cognitive science theories
par: Shah, Raj Sanjay, et autres
Publié: (2025) -
A Novel Approach to Image EEG Sleep Data for Improving Quality of Life in Patients Suffering From Brain Injuries Using DreamDiffusion
par: Fahim, David, et autres
Publié: (2024) -
fact check AI at SemEval-2025 Task 7: Multilingual and Crosslingual Fact-checked Claim Retrieval
par: Rastogi, Pranshu
Publié: (2025)