OlympicArena Medal Ranks: Who Is the Most Intelligent AI So Far?
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Huang, Zhen, Wang, Zengzhi, Xia, Shijie, Liu, Pengfei |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
OlympicArena: Benchmarking Multi-discipline Cognitive Reasoning for Superintelligent AI
par: Huang, Zhen, et autres
Publié: (2024)
par: Huang, Zhen, et autres
Publié: (2024)
Medal Matters: Probing LLMs' Failure Cases Through Olympic Rankings
par: Choi, Juhwan, et autres
Publié: (2024)
par: Choi, Juhwan, et autres
Publié: (2024)
MathPile: A Billion-Token-Scale Pretraining Corpus for Math
par: Wang, Zengzhi, et autres
Publié: (2023)
par: Wang, Zengzhi, et autres
Publié: (2023)
MegaScience: Pushing the Frontiers of Post-Training Datasets for Science Reasoning
par: Fan, Run-Ze, et autres
Publié: (2025)
par: Fan, Run-Ze, et autres
Publié: (2025)
OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling
par: Wang, Zengzhi, et autres
Publié: (2025)
par: Wang, Zengzhi, et autres
Publié: (2025)
Benchmarking Benchmark Leakage in Large Language Models
par: Xu, Ruijie, et autres
Publié: (2024)
par: Xu, Ruijie, et autres
Publié: (2024)
LIMO: Less is More for Reasoning
par: Ye, Yixin, et autres
Publié: (2025)
par: Ye, Yixin, et autres
Publié: (2025)
Programming Every Example: Lifting Pre-training Data Quality Like Experts at Scale
par: Zhou, Fan, et autres
Publié: (2024)
par: Zhou, Fan, et autres
Publié: (2024)
Ask Again, Then Fail: Large Language Models' Vacillations in Judgment
par: Xie, Qiming, et autres
Publié: (2023)
par: Xie, Qiming, et autres
Publié: (2023)
DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models
par: Zhu, Yakun, et autres
Publié: (2025)
par: Zhu, Yakun, et autres
Publié: (2025)
Is ChatGPT a Good Sentiment Analyzer? A Preliminary Study
par: Wang, Zengzhi, et autres
Publié: (2023)
par: Wang, Zengzhi, et autres
Publié: (2023)
SoLA: Leveraging Soft Activation Sparsity and Low-Rank Decomposition for Large Language Model Compression
par: Huang, Xinhao, et autres
Publié: (2026)
par: Huang, Xinhao, et autres
Publié: (2026)
O1 Replication Journey -- Part 2: Surpassing O1-preview through Simple Distillation, Big Progress or Bitter Lesson?
par: Huang, Zhen, et autres
Publié: (2024)
par: Huang, Zhen, et autres
Publié: (2024)
O1 Replication Journey: A Strategic Progress Report -- Part 1
par: Qin, Yiwei, et autres
Publié: (2024)
par: Qin, Yiwei, et autres
Publié: (2024)
Achieving Gold-Medal-Level Olympiad Reasoning via Simple and Unified Scaling
par: Li, Yafu, et autres
Publié: (2026)
par: Li, Yafu, et autres
Publié: (2026)
DialogStudio: Towards Richest and Most Diverse Unified Dataset Collection for Conversational AI
par: Zhang, Jianguo, et autres
Publié: (2023)
par: Zhang, Jianguo, et autres
Publié: (2023)
RankAdaptor: Hierarchical Rank Allocation for Efficient Fine-Tuning Pruned LLMs via Performance Model
par: Zhou, Changhai, et autres
Publié: (2024)
par: Zhou, Changhai, et autres
Publié: (2024)
ClawArena: Benchmarking AI Agents in Evolving Information Environments
par: Ji, Haonian, et autres
Publié: (2026)
par: Ji, Haonian, et autres
Publié: (2026)
Improving Your Model Ranking on Chatbot Arena by Vote Rigging
par: Min, Rui, et autres
Publié: (2025)
par: Min, Rui, et autres
Publié: (2025)
Generative AI Act II: Test Time Scaling Drives Cognition Engineering
par: Xia, Shijie, et autres
Publié: (2025)
par: Xia, Shijie, et autres
Publié: (2025)
LLM-as-a-Prophet: Understanding Predictive Intelligence with Prophet Arena
par: Yang, Qingchuan, et autres
Publié: (2025)
par: Yang, Qingchuan, et autres
Publié: (2025)
The AI Co-Ethnographer: How Far Can Automation Take Qualitative Research?
par: Retkowski, Fabian, et autres
Publié: (2025)
par: Retkowski, Fabian, et autres
Publié: (2025)
Ranking Unraveled: Recipes for LLM Rankings in Head-to-Head AI Combat
par: Daynauth, Roland, et autres
Publié: (2024)
par: Daynauth, Roland, et autres
Publié: (2024)
EgoSocialArena: Benchmarking the Social Intelligence of Large Language Models from a First-person Perspective
par: Hou, Guiyang, et autres
Publié: (2024)
par: Hou, Guiyang, et autres
Publié: (2024)
LLMs for Relational Reasoning: How Far are We?
par: Li, Zhiming, et autres
Publié: (2024)
par: Li, Zhiming, et autres
Publié: (2024)
Green AI: Which Programming Language Consumes the Most?
par: Marini, Niccolò, et autres
Publié: (2024)
par: Marini, Niccolò, et autres
Publié: (2024)
Who Are You Behind the Screen? Implicit MBTI and Gender Detection Using Artificial Intelligence
par: Shahnazari, Kourosh, et autres
Publié: (2025)
par: Shahnazari, Kourosh, et autres
Publié: (2025)
Benchmarking Foundation Models with Retrieval-Augmented Generation in Olympic-Level Physics Problem Solving
par: Zheng, Shunfeng, et autres
Publié: (2025)
par: Zheng, Shunfeng, et autres
Publié: (2025)
How Far Are We from Intelligent Visual Deductive Reasoning?
par: Zhang, Yizhe, et autres
Publié: (2024)
par: Zhang, Yizhe, et autres
Publié: (2024)
Scaling Test-Time Compute to Achieve IOI Gold Medal with Open-Weight Models
par: Samadi, Mehrzad, et autres
Publié: (2025)
par: Samadi, Mehrzad, et autres
Publié: (2025)
SoRFT: Issue Resolving with Subtask-oriented Reinforced Fine-Tuning
par: Ma, Zexiong, et autres
Publié: (2025)
par: Ma, Zexiong, et autres
Publié: (2025)
The 2021 Tokyo Olympics Multilingual News Article Dataset
par: Novak, Erik, et autres
Publié: (2025)
par: Novak, Erik, et autres
Publié: (2025)
Probabilistic Modeling of Intentions in Socially Intelligent LLM Agents
par: Xia, Feifan, et autres
Publié: (2025)
par: Xia, Feifan, et autres
Publié: (2025)
How Far Can In-Context Alignment Go? Exploring the State of In-Context Alignment
par: Huang, Heyan, et autres
Publié: (2024)
par: Huang, Heyan, et autres
Publié: (2024)
DSBench: How Far Are Data Science Agents from Becoming Data Science Experts?
par: Jing, Liqiang, et autres
Publié: (2024)
par: Jing, Liqiang, et autres
Publié: (2024)
RankLLM: Weighted Ranking of LLMs by Quantifying Question Difficulty
par: Zhang, Ziqian, et autres
Publié: (2026)
par: Zhang, Ziqian, et autres
Publié: (2026)
RAG-QA Arena: Evaluating Domain Robustness for Long-form Retrieval Augmented Question Answering
par: Han, Rujun, et autres
Publié: (2024)
par: Han, Rujun, et autres
Publié: (2024)
On the locality bias and results in the Long Range Arena
par: Miralles-González, Pablo, et autres
Publié: (2025)
par: Miralles-González, Pablo, et autres
Publié: (2025)
R-Horizon: How Far Can Your Large Reasoning Model Really Go in Breadth and Depth?
par: Lu, Yi, et autres
Publié: (2025)
par: Lu, Yi, et autres
Publié: (2025)
Span-level Detection of AI-generated Scientific Text via Contrastive Learning and Structural Calibration
par: Yin, Zhen, et autres
Publié: (2025)
par: Yin, Zhen, et autres
Publié: (2025)
Documents similaires
-
OlympicArena: Benchmarking Multi-discipline Cognitive Reasoning for Superintelligent AI
par: Huang, Zhen, et autres
Publié: (2024) -
Medal Matters: Probing LLMs' Failure Cases Through Olympic Rankings
par: Choi, Juhwan, et autres
Publié: (2024) -
MathPile: A Billion-Token-Scale Pretraining Corpus for Math
par: Wang, Zengzhi, et autres
Publié: (2023) -
MegaScience: Pushing the Frontiers of Post-Training Datasets for Science Reasoning
par: Fan, Run-Ze, et autres
Publié: (2025) -
OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling
par: Wang, Zengzhi, et autres
Publié: (2025)