Salvato in:
| Autori principali: | Raimondi, Bianca, Pivi, Francesco, Evangelista, Davide, Gabbrielli, Maurizio |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2603.03334 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Mechanistic Interpretability of Cognitive Complexity in LLMs via Linear Probing using Bloom's Taxonomy
di: Raimondi, Bianca, et al.
Pubblicazione: (2026)
di: Raimondi, Bianca, et al.
Pubblicazione: (2026)
Exploiting Primacy Effect To Improve Large Language Models
di: Raimondi, Bianca, et al.
Pubblicazione: (2025)
di: Raimondi, Bianca, et al.
Pubblicazione: (2025)
Analysing Moral Bias in Finetuned LLMs through Mechanistic Interpretability
di: Raimondi, Bianca, et al.
Pubblicazione: (2025)
di: Raimondi, Bianca, et al.
Pubblicazione: (2025)
Affordably Fine-tuned LLMs Provide Better Answers to Course-specific MCQs
di: Raimondi, Bianca, et al.
Pubblicazione: (2025)
di: Raimondi, Bianca, et al.
Pubblicazione: (2025)
Improving Diffusion Posterior Samplers with Lagged Temporal Corrections for Image Restoration
di: Evangelista, Davide, et al.
Pubblicazione: (2026)
di: Evangelista, Davide, et al.
Pubblicazione: (2026)
On the flow matching interpretability
di: Pivi, Francesco, et al.
Pubblicazione: (2025)
di: Pivi, Francesco, et al.
Pubblicazione: (2025)
BlenderRAG: High-Fidelity 3D Object Generation via Retrieval-Augmented Code Synthesis
di: Rondelli, Massimo, et al.
Pubblicazione: (2026)
di: Rondelli, Massimo, et al.
Pubblicazione: (2026)
Learning Factors in AI-Augmented Education: A Comparative Study of Middle and High School Students
di: Ebli, Gaia, et al.
Pubblicazione: (2025)
di: Ebli, Gaia, et al.
Pubblicazione: (2025)
mAceReason-Math: A Dataset of High-Quality Multilingual Math Problems Ready For RLVR
di: Dobler, Konstantin, et al.
Pubblicazione: (2026)
di: Dobler, Konstantin, et al.
Pubblicazione: (2026)
From Reasoning to Code: GRPO Optimization for Underrepresented Languages
di: Pennino, Federico, et al.
Pubblicazione: (2025)
di: Pennino, Federico, et al.
Pubblicazione: (2025)
CoinMath: Harnessing the Power of Coding Instruction for Math LLMs
di: Wei, Chengwei, et al.
Pubblicazione: (2024)
di: Wei, Chengwei, et al.
Pubblicazione: (2024)
MathArena: Evaluating LLMs on Uncontaminated Math Competitions
di: Balunović, Mislav, et al.
Pubblicazione: (2025)
di: Balunović, Mislav, et al.
Pubblicazione: (2025)
DocMath-Eval: Evaluating Math Reasoning Capabilities of LLMs in Understanding Long and Specialized Documents
di: Zhao, Yilun, et al.
Pubblicazione: (2023)
di: Zhao, Yilun, et al.
Pubblicazione: (2023)
rStar-Math: Small LLMs Can Master Math Reasoning with Self-Evolved Deep Thinking
di: Guan, Xinyu, et al.
Pubblicazione: (2025)
di: Guan, Xinyu, et al.
Pubblicazione: (2025)
SuperCLUE-Math6: Graded Multi-Step Math Reasoning Benchmark for LLMs in Chinese
di: Xu, Liang, et al.
Pubblicazione: (2024)
di: Xu, Liang, et al.
Pubblicazione: (2024)
Utility-Preserving De-Identification for Math Tutoring: Investigating Numeric Ambiguity in the MathEd-PII Benchmark Dataset
di: Zhou, Zhuqian, et al.
Pubblicazione: (2026)
di: Zhou, Zhuqian, et al.
Pubblicazione: (2026)
CMM-Math: A Chinese Multimodal Math Dataset To Evaluate and Enhance the Mathematics Reasoning of Large Multimodal Models
di: Liu, Wentao, et al.
Pubblicazione: (2024)
di: Liu, Wentao, et al.
Pubblicazione: (2024)
Can LLMs Master Math? Investigating Large Language Models on Math Stack Exchange
di: Satpute, Ankit, et al.
Pubblicazione: (2024)
di: Satpute, Ankit, et al.
Pubblicazione: (2024)
SafeMath: Inference-time Safety improves Math Accuracy
di: Basu, Sagnik, et al.
Pubblicazione: (2026)
di: Basu, Sagnik, et al.
Pubblicazione: (2026)
FinanceMath: Knowledge-Intensive Math Reasoning in Finance Domains
di: Zhao, Yilun, et al.
Pubblicazione: (2023)
di: Zhao, Yilun, et al.
Pubblicazione: (2023)
OpenMathInstruct-1: A 1.8 Million Math Instruction Tuning Dataset
di: Toshniwal, Shubham, et al.
Pubblicazione: (2024)
di: Toshniwal, Shubham, et al.
Pubblicazione: (2024)
StreetMath: Study of LLMs' Approximation Behaviors
di: Tseng, Chiung-Yi, et al.
Pubblicazione: (2025)
di: Tseng, Chiung-Yi, et al.
Pubblicazione: (2025)
Automate Knowledge Concept Tagging on Math Questions with LLMs
di: Li, Hang, et al.
Pubblicazione: (2024)
di: Li, Hang, et al.
Pubblicazione: (2024)
What Makes Math Word Problems Challenging for LLMs?
di: Srivatsa, KV Aditya, et al.
Pubblicazione: (2024)
di: Srivatsa, KV Aditya, et al.
Pubblicazione: (2024)
Teaching LLMs for Step-Level Automatic Math Correction via Reinforcement Learning
di: Li, Junsong, et al.
Pubblicazione: (2025)
di: Li, Junsong, et al.
Pubblicazione: (2025)
ShoppingComp: Are LLMs Really Ready for Your Shopping Cart?
di: Tou, Huaixiao, et al.
Pubblicazione: (2025)
di: Tou, Huaixiao, et al.
Pubblicazione: (2025)
Orca-Math: Unlocking the potential of SLMs in Grade School Math
di: Mitra, Arindam, et al.
Pubblicazione: (2024)
di: Mitra, Arindam, et al.
Pubblicazione: (2024)
Nemotron-CC-Math: A 133 Billion-Token-Scale High Quality Math Pretraining Dataset
di: Mahabadi, Rabeeh Karimi, et al.
Pubblicazione: (2025)
di: Mahabadi, Rabeeh Karimi, et al.
Pubblicazione: (2025)
Big-Math: A Large-Scale, High-Quality Math Dataset for Reinforcement Learning in Language Models
di: Albalak, Alon, et al.
Pubblicazione: (2025)
di: Albalak, Alon, et al.
Pubblicazione: (2025)
MathBuddy: A Multimodal System for Affective Math Tutoring
di: Kar, Debanjana, et al.
Pubblicazione: (2025)
di: Kar, Debanjana, et al.
Pubblicazione: (2025)
MegaMath: Pushing the Limits of Open Math Corpora
di: Zhou, Fan, et al.
Pubblicazione: (2025)
di: Zhou, Fan, et al.
Pubblicazione: (2025)
MathDuels: Evaluating LLMs as Problem Posers and Solvers
di: Xu, Zhiqiu, et al.
Pubblicazione: (2026)
di: Xu, Zhiqiu, et al.
Pubblicazione: (2026)
Beyond Benchmarks: MathArena as an Evaluation Platform for Mathematics with LLMs
di: Dekoninck, Jasper, et al.
Pubblicazione: (2026)
di: Dekoninck, Jasper, et al.
Pubblicazione: (2026)
Proof or Bluff? Evaluating LLMs on 2025 USA Math Olympiad
di: Petrov, Ivo, et al.
Pubblicazione: (2025)
di: Petrov, Ivo, et al.
Pubblicazione: (2025)
Can LLMs Solve longer Math Word Problems Better?
di: Xu, Xin, et al.
Pubblicazione: (2024)
di: Xu, Xin, et al.
Pubblicazione: (2024)
MathChat: Converse to Tackle Challenging Math Problems with LLM Agents
di: Wu, Yiran, et al.
Pubblicazione: (2023)
di: Wu, Yiran, et al.
Pubblicazione: (2023)
Leveraging Online Olympiad-Level Math Problems for LLMs Training and Contamination-Resistant Evaluation
di: Mahdavi, Sadegh, et al.
Pubblicazione: (2025)
di: Mahdavi, Sadegh, et al.
Pubblicazione: (2025)
GeoMathCode: Understanding Interleaved Math-Code Reasoning for Geometry Problem Solving
di: Zhang, Yingji, et al.
Pubblicazione: (2026)
di: Zhang, Yingji, et al.
Pubblicazione: (2026)
InternLM-Math: Open Math Large Language Models Toward Verifiable Reasoning
di: Ying, Huaiyuan, et al.
Pubblicazione: (2024)
di: Ying, Huaiyuan, et al.
Pubblicazione: (2024)
RoMathExam: A Longitudinal Dataset of Romanian Math Exams (1895-2025) with a Seven-Decade Core (1957-2025)
di: Cuclea, Luca-Ncolae, et al.
Pubblicazione: (2026)
di: Cuclea, Luca-Ncolae, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Mechanistic Interpretability of Cognitive Complexity in LLMs via Linear Probing using Bloom's Taxonomy
di: Raimondi, Bianca, et al.
Pubblicazione: (2026) -
Exploiting Primacy Effect To Improve Large Language Models
di: Raimondi, Bianca, et al.
Pubblicazione: (2025) -
Analysing Moral Bias in Finetuned LLMs through Mechanistic Interpretability
di: Raimondi, Bianca, et al.
Pubblicazione: (2025) -
Affordably Fine-tuned LLMs Provide Better Answers to Course-specific MCQs
di: Raimondi, Bianca, et al.
Pubblicazione: (2025) -
Improving Diffusion Posterior Samplers with Lagged Temporal Corrections for Image Restoration
di: Evangelista, Davide, et al.
Pubblicazione: (2026)