LiveOIBench: Can Large Language Models Outperform Human Contestants in Informatics Olympiads?
Fuente:
arXiv
Guardado en:
| Autores principales: | Zou, Kaijian, Xiong, Aaron, Zhang, Yunxiang, Zhang, Frederick, Ren, Yueqi, Yang, Jirong, Lee, Ayoung, Bhushan, Shitanshu, Wang, Lu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics
por: Zhu, Yaoming, et al.
Publicado: (2025)
por: Zhu, Yaoming, et al.
Publicado: (2025)
MLRC-Bench: Can Language Agents Solve Machine Learning Research Challenges?
por: Zhang, Yunxiang, et al.
Publicado: (2025)
por: Zhang, Yunxiang, et al.
Publicado: (2025)
Can AI Assist in Olympiad Coding
por: Ren, Samuel
Publicado: (2025)
por: Ren, Samuel
Publicado: (2025)
Logit Arithmetic Elicits Long Reasoning Capabilities Without Training
por: Zhang, Yunxiang, et al.
Publicado: (2025)
por: Zhang, Yunxiang, et al.
Publicado: (2025)
Logit Arithmetic Elicits Long Reasoning Capabilities Without Training
por: Zhang, Yunxiang, et al.
Publicado: (2025)
por: Zhang, Yunxiang, et al.
Publicado: (2025)
On Many-Shot In-Context Learning for Long-Context Evaluation
por: Zou, Kaijian, et al.
Publicado: (2024)
por: Zou, Kaijian, et al.
Publicado: (2024)
Can Language Models Solve Olympiad Programming?
por: Shi, Quan, et al.
Publicado: (2024)
por: Shi, Quan, et al.
Publicado: (2024)
Can LLMs Generate and Solve Linguistic Olympiad Puzzles?
por: Majmudar, Neh, et al.
Publicado: (2025)
por: Majmudar, Neh, et al.
Publicado: (2025)
Can AI Outperform Human Experts in Creating Social Media Creatives?
por: Park, Eunkyung, et al.
Publicado: (2024)
por: Park, Eunkyung, et al.
Publicado: (2024)
Mastering Olympiad-Level Physics with Artificial Intelligence
por: Jian, Dong-Shan, et al.
Publicado: (2025)
por: Jian, Dong-Shan, et al.
Publicado: (2025)
Linguistics Olympiad
por: Neacșu, Vlad A.
Publicado: (2024)
por: Neacșu, Vlad A.
Publicado: (2024)
Proving Olympiad Algebraic Inequalities without Human Demonstrations
por: Wei, Chenrui, et al.
Publicado: (2024)
por: Wei, Chenrui, et al.
Publicado: (2024)
Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models
por: Gao, Bofei, et al.
Publicado: (2024)
por: Gao, Bofei, et al.
Publicado: (2024)
A sufficient condition for the height function to be constant in $ I_g\times_ρ\mathbb{P}^n $
por: Cao, Kaijian
Publicado: (2024)
por: Cao, Kaijian
Publicado: (2024)
Clinical Median Images and Deep Learning: Advancing Automated Detection of Ultrasound Transducer Uniformity Artifacts
por: Yang Kaijian
Publicado: (2026)
por: Yang Kaijian
Publicado: (2026)
Transcendence: Generative Models Can Outperform The Experts That Train Them
por: Zhang, Edwin, et al.
Publicado: (2024)
por: Zhang, Edwin, et al.
Publicado: (2024)
When Can Human-AI Teams Outperform Individuals? Tight Bounds with Impossibility Guarantees
por: Guo, Dongxin, et al.
Publicado: (2026)
por: Guo, Dongxin, et al.
Publicado: (2026)
OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems
por: He, Chaoqun, et al.
Publicado: (2024)
por: He, Chaoqun, et al.
Publicado: (2024)
When Less Is More: Binary Feedback Can Outperform Ordinal Comparisons in Ranking Recovery
por: Xu, Shirong, et al.
Publicado: (2025)
por: Xu, Shirong, et al.
Publicado: (2025)
LiveCodeBench Pro: How Do Olympiad Medalists Judge LLMs in Competitive Programming?
por: Zheng, Zihan, et al.
Publicado: (2025)
por: Zheng, Zihan, et al.
Publicado: (2025)
InsertGNN: Can Graph Neural Networks Outperform Humans in TOEFL Sentence Insertion Problem?
por: Wu, Fang, et al.
Publicado: (2021)
por: Wu, Fang, et al.
Publicado: (2021)
Can ChatGPT Outperform Humans in Faking a Personality Assessment While Avoiding Detection?
por: Chet Robie, et al.
Publicado: (2025)
por: Chet Robie, et al.
Publicado: (2025)
Adapted Large Language Models Can Outperform Medical Experts in Clinical Text Summarization
por: Van Veen, Dave, et al.
Publicado: (2023)
por: Van Veen, Dave, et al.
Publicado: (2023)
Evaluating Large Vision-and-Language Models on Children's Mathematical Olympiads
por: Cherian, Anoop, et al.
Publicado: (2024)
por: Cherian, Anoop, et al.
Publicado: (2024)
Evaluating Large Language Models on Multimodal Chemistry Olympiad Exams
por: Cui, Yiming, et al.
Publicado: (2025)
por: Cui, Yiming, et al.
Publicado: (2025)
Can a Single Tree Outperform an Entire Forest?
por: Mao, Qiangqiang, et al.
Publicado: (2024)
por: Mao, Qiangqiang, et al.
Publicado: (2024)
Can Competition Outperform Collaboration? The Role of Misbehaving Agents
por: Ballotta, Luca, et al.
Publicado: (2022)
por: Ballotta, Luca, et al.
Publicado: (2022)
Gaming the Judge: Unfaithful Chain-of-Thought Can Undermine Agent Evaluation
por: Khalifa, Muhammad, et al.
Publicado: (2026)
por: Khalifa, Muhammad, et al.
Publicado: (2026)
Row-Stochastic Matrices Can Provably Outperform Doubly Stochastic Matrices in Decentralized Learning
por: Liu, Bing, et al.
Publicado: (2025)
por: Liu, Bing, et al.
Publicado: (2025)
CogAtom: From Cognitive Atoms to Olympiad-level Mathematical Reasoning in Large Language Models
por: Chen, Zhuofan, et al.
Publicado: (2025)
por: Chen, Zhuofan, et al.
Publicado: (2025)
Audio Outperforms Text for Visual Decoding
por: Zhang, Zhengdi, et al.
Publicado: (2026)
por: Zhang, Zhengdi, et al.
Publicado: (2026)
Informative Object-centric Next Best View for Object-aware 3D Gaussian Splatting in Cluttered Scenes
por: Jeong, Seunghoon, et al.
Publicado: (2026)
por: Jeong, Seunghoon, et al.
Publicado: (2026)
Proving Olympiad Inequalities by Synergizing LLMs and Symbolic Reasoning
por: Li, Zenan, et al.
Publicado: (2025)
por: Li, Zenan, et al.
Publicado: (2025)
GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning
por: Agrawal, Lakshya A, et al.
Publicado: (2025)
por: Agrawal, Lakshya A, et al.
Publicado: (2025)
Language Models Coupled with Metacognition Can Outperform Reasoning Models
por: Khandelwal, Vedant, et al.
Publicado: (2025)
por: Khandelwal, Vedant, et al.
Publicado: (2025)
Can Decentralized Control Outperform Centralized? The Role of Communication Latency
por: Ballotta, Luca, et al.
Publicado: (2021)
por: Ballotta, Luca, et al.
Publicado: (2021)
Large Language Models Outperform Humans in Fraud Detection and Resistance to Motivated Investor Pressure
por: Powdthavee, Nattavudh
Publicado: (2026)
por: Powdthavee, Nattavudh
Publicado: (2026)
Multi-stage Large Language Model Pipelines Can Outperform GPT-4o in Relevance Assessment
por: Schnabel, Julian A., et al.
Publicado: (2025)
por: Schnabel, Julian A., et al.
Publicado: (2025)
DOoM: Difficult Olympiads of Math
por: Kuleshov, Ilya, et al.
Publicado: (2025)
por: Kuleshov, Ilya, et al.
Publicado: (2025)
Extreme Points and Large Contests
por: Bolgè, Giovanni Valvassori
Publicado: (2026)
por: Bolgè, Giovanni Valvassori
Publicado: (2026)
Ejemplares similares
-
OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics
por: Zhu, Yaoming, et al.
Publicado: (2025) -
MLRC-Bench: Can Language Agents Solve Machine Learning Research Challenges?
por: Zhang, Yunxiang, et al.
Publicado: (2025) -
Can AI Assist in Olympiad Coding
por: Ren, Samuel
Publicado: (2025) -
Logit Arithmetic Elicits Long Reasoning Capabilities Without Training
por: Zhang, Yunxiang, et al.
Publicado: (2025) -
Logit Arithmetic Elicits Long Reasoning Capabilities Without Training
por: Zhang, Yunxiang, et al.
Publicado: (2025)