LiveOIBench: Can Large Language Models Outperform Human Contestants in Informatics Olympiads?
Fuente:
arXiv
Salvato in:
| Autori principali: | Zou, Kaijian, Xiong, Aaron, Zhang, Yunxiang, Zhang, Frederick, Ren, Yueqi, Yang, Jirong, Lee, Ayoung, Bhushan, Shitanshu, Wang, Lu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics
di: Zhu, Yaoming, et al.
Pubblicazione: (2025)
di: Zhu, Yaoming, et al.
Pubblicazione: (2025)
MLRC-Bench: Can Language Agents Solve Machine Learning Research Challenges?
di: Zhang, Yunxiang, et al.
Pubblicazione: (2025)
di: Zhang, Yunxiang, et al.
Pubblicazione: (2025)
Can AI Assist in Olympiad Coding
di: Ren, Samuel
Pubblicazione: (2025)
di: Ren, Samuel
Pubblicazione: (2025)
Logit Arithmetic Elicits Long Reasoning Capabilities Without Training
di: Zhang, Yunxiang, et al.
Pubblicazione: (2025)
di: Zhang, Yunxiang, et al.
Pubblicazione: (2025)
Logit Arithmetic Elicits Long Reasoning Capabilities Without Training
di: Zhang, Yunxiang, et al.
Pubblicazione: (2025)
di: Zhang, Yunxiang, et al.
Pubblicazione: (2025)
On Many-Shot In-Context Learning for Long-Context Evaluation
di: Zou, Kaijian, et al.
Pubblicazione: (2024)
di: Zou, Kaijian, et al.
Pubblicazione: (2024)
Can Language Models Solve Olympiad Programming?
di: Shi, Quan, et al.
Pubblicazione: (2024)
di: Shi, Quan, et al.
Pubblicazione: (2024)
Can LLMs Generate and Solve Linguistic Olympiad Puzzles?
di: Majmudar, Neh, et al.
Pubblicazione: (2025)
di: Majmudar, Neh, et al.
Pubblicazione: (2025)
Can AI Outperform Human Experts in Creating Social Media Creatives?
di: Park, Eunkyung, et al.
Pubblicazione: (2024)
di: Park, Eunkyung, et al.
Pubblicazione: (2024)
Mastering Olympiad-Level Physics with Artificial Intelligence
di: Jian, Dong-Shan, et al.
Pubblicazione: (2025)
di: Jian, Dong-Shan, et al.
Pubblicazione: (2025)
Linguistics Olympiad
di: Neacșu, Vlad A.
Pubblicazione: (2024)
di: Neacșu, Vlad A.
Pubblicazione: (2024)
Proving Olympiad Algebraic Inequalities without Human Demonstrations
di: Wei, Chenrui, et al.
Pubblicazione: (2024)
di: Wei, Chenrui, et al.
Pubblicazione: (2024)
Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models
di: Gao, Bofei, et al.
Pubblicazione: (2024)
di: Gao, Bofei, et al.
Pubblicazione: (2024)
A sufficient condition for the height function to be constant in $ I_g\times_ρ\mathbb{P}^n $
di: Cao, Kaijian
Pubblicazione: (2024)
di: Cao, Kaijian
Pubblicazione: (2024)
Clinical Median Images and Deep Learning: Advancing Automated Detection of Ultrasound Transducer Uniformity Artifacts
di: Yang Kaijian
Pubblicazione: (2026)
di: Yang Kaijian
Pubblicazione: (2026)
Transcendence: Generative Models Can Outperform The Experts That Train Them
di: Zhang, Edwin, et al.
Pubblicazione: (2024)
di: Zhang, Edwin, et al.
Pubblicazione: (2024)
When Can Human-AI Teams Outperform Individuals? Tight Bounds with Impossibility Guarantees
di: Guo, Dongxin, et al.
Pubblicazione: (2026)
di: Guo, Dongxin, et al.
Pubblicazione: (2026)
OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems
di: He, Chaoqun, et al.
Pubblicazione: (2024)
di: He, Chaoqun, et al.
Pubblicazione: (2024)
When Less Is More: Binary Feedback Can Outperform Ordinal Comparisons in Ranking Recovery
di: Xu, Shirong, et al.
Pubblicazione: (2025)
di: Xu, Shirong, et al.
Pubblicazione: (2025)
LiveCodeBench Pro: How Do Olympiad Medalists Judge LLMs in Competitive Programming?
di: Zheng, Zihan, et al.
Pubblicazione: (2025)
di: Zheng, Zihan, et al.
Pubblicazione: (2025)
InsertGNN: Can Graph Neural Networks Outperform Humans in TOEFL Sentence Insertion Problem?
di: Wu, Fang, et al.
Pubblicazione: (2021)
di: Wu, Fang, et al.
Pubblicazione: (2021)
Can ChatGPT Outperform Humans in Faking a Personality Assessment While Avoiding Detection?
di: Chet Robie, et al.
Pubblicazione: (2025)
di: Chet Robie, et al.
Pubblicazione: (2025)
Adapted Large Language Models Can Outperform Medical Experts in Clinical Text Summarization
di: Van Veen, Dave, et al.
Pubblicazione: (2023)
di: Van Veen, Dave, et al.
Pubblicazione: (2023)
Evaluating Large Vision-and-Language Models on Children's Mathematical Olympiads
di: Cherian, Anoop, et al.
Pubblicazione: (2024)
di: Cherian, Anoop, et al.
Pubblicazione: (2024)
Evaluating Large Language Models on Multimodal Chemistry Olympiad Exams
di: Cui, Yiming, et al.
Pubblicazione: (2025)
di: Cui, Yiming, et al.
Pubblicazione: (2025)
Can a Single Tree Outperform an Entire Forest?
di: Mao, Qiangqiang, et al.
Pubblicazione: (2024)
di: Mao, Qiangqiang, et al.
Pubblicazione: (2024)
Can Competition Outperform Collaboration? The Role of Misbehaving Agents
di: Ballotta, Luca, et al.
Pubblicazione: (2022)
di: Ballotta, Luca, et al.
Pubblicazione: (2022)
Gaming the Judge: Unfaithful Chain-of-Thought Can Undermine Agent Evaluation
di: Khalifa, Muhammad, et al.
Pubblicazione: (2026)
di: Khalifa, Muhammad, et al.
Pubblicazione: (2026)
Row-Stochastic Matrices Can Provably Outperform Doubly Stochastic Matrices in Decentralized Learning
di: Liu, Bing, et al.
Pubblicazione: (2025)
di: Liu, Bing, et al.
Pubblicazione: (2025)
CogAtom: From Cognitive Atoms to Olympiad-level Mathematical Reasoning in Large Language Models
di: Chen, Zhuofan, et al.
Pubblicazione: (2025)
di: Chen, Zhuofan, et al.
Pubblicazione: (2025)
Audio Outperforms Text for Visual Decoding
di: Zhang, Zhengdi, et al.
Pubblicazione: (2026)
di: Zhang, Zhengdi, et al.
Pubblicazione: (2026)
Informative Object-centric Next Best View for Object-aware 3D Gaussian Splatting in Cluttered Scenes
di: Jeong, Seunghoon, et al.
Pubblicazione: (2026)
di: Jeong, Seunghoon, et al.
Pubblicazione: (2026)
Proving Olympiad Inequalities by Synergizing LLMs and Symbolic Reasoning
di: Li, Zenan, et al.
Pubblicazione: (2025)
di: Li, Zenan, et al.
Pubblicazione: (2025)
GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning
di: Agrawal, Lakshya A, et al.
Pubblicazione: (2025)
di: Agrawal, Lakshya A, et al.
Pubblicazione: (2025)
Language Models Coupled with Metacognition Can Outperform Reasoning Models
di: Khandelwal, Vedant, et al.
Pubblicazione: (2025)
di: Khandelwal, Vedant, et al.
Pubblicazione: (2025)
Can Decentralized Control Outperform Centralized? The Role of Communication Latency
di: Ballotta, Luca, et al.
Pubblicazione: (2021)
di: Ballotta, Luca, et al.
Pubblicazione: (2021)
Large Language Models Outperform Humans in Fraud Detection and Resistance to Motivated Investor Pressure
di: Powdthavee, Nattavudh
Pubblicazione: (2026)
di: Powdthavee, Nattavudh
Pubblicazione: (2026)
Multi-stage Large Language Model Pipelines Can Outperform GPT-4o in Relevance Assessment
di: Schnabel, Julian A., et al.
Pubblicazione: (2025)
di: Schnabel, Julian A., et al.
Pubblicazione: (2025)
DOoM: Difficult Olympiads of Math
di: Kuleshov, Ilya, et al.
Pubblicazione: (2025)
di: Kuleshov, Ilya, et al.
Pubblicazione: (2025)
Extreme Points and Large Contests
di: Bolgè, Giovanni Valvassori
Pubblicazione: (2026)
di: Bolgè, Giovanni Valvassori
Pubblicazione: (2026)
Documenti analoghi
-
OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics
di: Zhu, Yaoming, et al.
Pubblicazione: (2025) -
MLRC-Bench: Can Language Agents Solve Machine Learning Research Challenges?
di: Zhang, Yunxiang, et al.
Pubblicazione: (2025) -
Can AI Assist in Olympiad Coding
di: Ren, Samuel
Pubblicazione: (2025) -
Logit Arithmetic Elicits Long Reasoning Capabilities Without Training
di: Zhang, Yunxiang, et al.
Pubblicazione: (2025) -
Logit Arithmetic Elicits Long Reasoning Capabilities Without Training
di: Zhang, Yunxiang, et al.
Pubblicazione: (2025)