Salvato in:
| Autori principali: | Tabib, H. M. Shadman, Deedar, Jaber Ahmed |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2501.04425 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Toward Trustworthy Difficulty Assessments: Large Language Models as Judges in Programming and Synthetic Tasks
di: Tabib, H. M. Shadman, et al.
Pubblicazione: (2025)
di: Tabib, H. M. Shadman, et al.
Pubblicazione: (2025)
Study on Locomotive Epidemic Dynamics in a Stochastic Spatio-Temporal Simulation Model on a Multiplex Network
di: Tabib, H. M. Shadman, et al.
Pubblicazione: (2025)
di: Tabib, H. M. Shadman, et al.
Pubblicazione: (2025)
Challenging the Boundaries of Reasoning: An Olympiad-Level Math Benchmark for Large Language Models
di: Sun, Haoxiang, et al.
Pubblicazione: (2025)
di: Sun, Haoxiang, et al.
Pubblicazione: (2025)
MathOdyssey: Benchmarking Mathematical Problem-Solving Skills in Large Language Models Using Odyssey Math Data
di: Fang, Meng, et al.
Pubblicazione: (2024)
di: Fang, Meng, et al.
Pubblicazione: (2024)
BanglaDialecto: An End-to-End AI-Powered Regional Speech Standardization
di: Samin, Md. Nazmus Sadat, et al.
Pubblicazione: (2024)
di: Samin, Md. Nazmus Sadat, et al.
Pubblicazione: (2024)
Leveraging Online Olympiad-Level Math Problems for LLMs Training and Contamination-Resistant Evaluation
di: Mahdavi, Sadegh, et al.
Pubblicazione: (2025)
di: Mahdavi, Sadegh, et al.
Pubblicazione: (2025)
Can Language Models Solve Olympiad Programming?
di: Shi, Quan, et al.
Pubblicazione: (2024)
di: Shi, Quan, et al.
Pubblicazione: (2024)
Leveraging Large Language Models for Bengali Math Word Problem Solving with Chain of Thought Reasoning
di: Paul, Bidyarthi, et al.
Pubblicazione: (2025)
di: Paul, Bidyarthi, et al.
Pubblicazione: (2025)
TeleMath: A Benchmark for Large Language Models in Telecom Mathematical Problem Solving
di: Colle, Vincenzo, et al.
Pubblicazione: (2025)
di: Colle, Vincenzo, et al.
Pubblicazione: (2025)
ChatGLM-Math: Improving Math Problem-Solving in Large Language Models with a Self-Critique Pipeline
di: Xu, Yifan, et al.
Pubblicazione: (2024)
di: Xu, Yifan, et al.
Pubblicazione: (2024)
Leveraging Graph Structures and Large Language Models for End-to-End Synthetic Task-Oriented Dialogues
di: Medjad, Maya, et al.
Pubblicazione: (2025)
di: Medjad, Maya, et al.
Pubblicazione: (2025)
Using Large Language Model for End-to-End Chinese ASR and NER
di: Li, Yuang, et al.
Pubblicazione: (2024)
di: Li, Yuang, et al.
Pubblicazione: (2024)
An End-to-End Speech Summarization Using Large Language Model
di: Shang, Hengchao, et al.
Pubblicazione: (2024)
di: Shang, Hengchao, et al.
Pubblicazione: (2024)
Improving Math Problem Solving in Large Language Models Through Categorization and Strategy Tailoring
di: Akella, Amogh
Pubblicazione: (2024)
di: Akella, Amogh
Pubblicazione: (2024)
Vashantor: A Large-scale Multilingual Benchmark Dataset for Automated Translation of Bangla Regional Dialects to Bangla Language
di: Faria, Fatema Tuj Johora, et al.
Pubblicazione: (2023)
di: Faria, Fatema Tuj Johora, et al.
Pubblicazione: (2023)
Automatic End-to-End Data Integration using Large Language Models
di: Steiner, Aaron, et al.
Pubblicazione: (2026)
di: Steiner, Aaron, et al.
Pubblicazione: (2026)
OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems
di: He, Chaoqun, et al.
Pubblicazione: (2024)
di: He, Chaoqun, et al.
Pubblicazione: (2024)
Proof or Bluff? Evaluating LLMs on 2025 USA Math Olympiad
di: Petrov, Ivo, et al.
Pubblicazione: (2025)
di: Petrov, Ivo, et al.
Pubblicazione: (2025)
MathLearner: A Large Language Model Agent Framework for Learning to Solve Mathematical Problems
di: Xie, Wenbei, et al.
Pubblicazione: (2024)
di: Xie, Wenbei, et al.
Pubblicazione: (2024)
Benchmarking Hallucination in Large Language Models based on Unanswerable Math Word Problem
di: Sun, Yuhong, et al.
Pubblicazione: (2024)
di: Sun, Yuhong, et al.
Pubblicazione: (2024)
MathGLM-Vision: Solving Mathematical Problems with Multi-Modal Large Language Model
di: Yang, Zhen, et al.
Pubblicazione: (2024)
di: Yang, Zhen, et al.
Pubblicazione: (2024)
End-to-End Ontology Learning with Large Language Models
di: Lo, Andy, et al.
Pubblicazione: (2024)
di: Lo, Andy, et al.
Pubblicazione: (2024)
Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models
di: Gao, Bofei, et al.
Pubblicazione: (2024)
di: Gao, Bofei, et al.
Pubblicazione: (2024)
Building Safe GenAI Applications: An End-to-End Overview of Red Teaming for Large Language Models
di: Purpura, Alberto, et al.
Pubblicazione: (2025)
di: Purpura, Alberto, et al.
Pubblicazione: (2025)
Long-horizon Reasoning Agent for Olympiad-Level Mathematical Problem Solving
di: Gao, Songyang, et al.
Pubblicazione: (2025)
di: Gao, Songyang, et al.
Pubblicazione: (2025)
E2Edev: Benchmarking Large Language Models in End-to-End Software Development Task
di: Liu, Jingyao, et al.
Pubblicazione: (2025)
di: Liu, Jingyao, et al.
Pubblicazione: (2025)
End-to-End Graph Flattening Method for Large Language Models
di: Hong, Bin, et al.
Pubblicazione: (2024)
di: Hong, Bin, et al.
Pubblicazione: (2024)
End-To-End Clinical Trial Matching with Large Language Models
di: Ferber, Dyke, et al.
Pubblicazione: (2024)
di: Ferber, Dyke, et al.
Pubblicazione: (2024)
Solving Math Word Problems via Cooperative Reasoning induced Language Models
di: Zhu, Xinyu, et al.
Pubblicazione: (2022)
di: Zhu, Xinyu, et al.
Pubblicazione: (2022)
Performance Evaluation of Large Language Models in Bangla Consumer Health Query Summarization
di: Abrar, Ajwad, et al.
Pubblicazione: (2025)
di: Abrar, Ajwad, et al.
Pubblicazione: (2025)
Large Language Models Struggle with Unreasonability in Math Problems
di: Ma, Jingyuan, et al.
Pubblicazione: (2024)
di: Ma, Jingyuan, et al.
Pubblicazione: (2024)
OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language Model
di: Chen, Qiguang, et al.
Pubblicazione: (2026)
di: Chen, Qiguang, et al.
Pubblicazione: (2026)
LLaST: Improved End-to-end Speech Translation System Leveraged by Large Language Models
di: Chen, Xi, et al.
Pubblicazione: (2024)
di: Chen, Xi, et al.
Pubblicazione: (2024)
MathMist: A Parallel Multilingual Benchmark Dataset for Mathematical Problem Solving and Reasoning
di: Sobhani, Mahbub E, et al.
Pubblicazione: (2025)
di: Sobhani, Mahbub E, et al.
Pubblicazione: (2025)
Can LLMs Generate and Solve Linguistic Olympiad Puzzles?
di: Majmudar, Neh, et al.
Pubblicazione: (2025)
di: Majmudar, Neh, et al.
Pubblicazione: (2025)
PromptCoT: Synthesizing Olympiad-level Problems for Mathematical Reasoning in Large Language Models
di: Zhao, Xueliang, et al.
Pubblicazione: (2025)
di: Zhao, Xueliang, et al.
Pubblicazione: (2025)
THaMES: An End-to-End Tool for Hallucination Mitigation and Evaluation in Large Language Models
di: Liang, Mengfei, et al.
Pubblicazione: (2024)
di: Liang, Mengfei, et al.
Pubblicazione: (2024)
Solving for X and Beyond: Can Large Language Models Solve Complex Math Problems with More-Than-Two Unknowns?
di: Kao, Kuei-Chun, et al.
Pubblicazione: (2024)
di: Kao, Kuei-Chun, et al.
Pubblicazione: (2024)
A Benchmark for End-to-End Zero-Shot Biomedical Relation Extraction with LLMs: Experiments with OpenAI Models
di: Brokman, Aviv, et al.
Pubblicazione: (2025)
di: Brokman, Aviv, et al.
Pubblicazione: (2025)
An End-to-End Approach for Child Reading Assessment in the Xhosa Language
di: Chevtchenko, Sergio, et al.
Pubblicazione: (2025)
di: Chevtchenko, Sergio, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Toward Trustworthy Difficulty Assessments: Large Language Models as Judges in Programming and Synthetic Tasks
di: Tabib, H. M. Shadman, et al.
Pubblicazione: (2025) -
Study on Locomotive Epidemic Dynamics in a Stochastic Spatio-Temporal Simulation Model on a Multiplex Network
di: Tabib, H. M. Shadman, et al.
Pubblicazione: (2025) -
Challenging the Boundaries of Reasoning: An Olympiad-Level Math Benchmark for Large Language Models
di: Sun, Haoxiang, et al.
Pubblicazione: (2025) -
MathOdyssey: Benchmarking Mathematical Problem-Solving Skills in Large Language Models Using Odyssey Math Data
di: Fang, Meng, et al.
Pubblicazione: (2024) -
BanglaDialecto: An End-to-End AI-Powered Regional Speech Standardization
di: Samin, Md. Nazmus Sadat, et al.
Pubblicazione: (2024)