LINGOLY: A Benchmark of Olympiad-Level Linguistic Reasoning Puzzles in Low-Resource and Extinct Languages
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Bean, Andrew M., Hellsten, Simi, Mayne, Harry, Magomere, Jabez, Chi, Ethan A., Chi, Ryan, Hale, Scott A., Kirk, Hannah Rose |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LINGOLY-TOO: Disentangling Reasoning from Knowledge with Templatised Orthographic Obfuscation
par: Khouja, Jude, et autres
Publié: (2025)
par: Khouja, Jude, et autres
Publié: (2025)
Scaling Crowdsourced Election Monitoring: Construction and Evaluation of Classification Models for Multilingual and Cross-Domain Classification Settings
par: Magomere, Jabez, et autres
Publié: (2025)
par: Magomere, Jabez, et autres
Publié: (2025)
When Claims Evolve: Evaluating and Enhancing the Robustness of Embedding Models Against Misinformation Edits
par: Magomere, Jabez, et autres
Publié: (2025)
par: Magomere, Jabez, et autres
Publié: (2025)
Can LLMs Generate and Solve Linguistic Olympiad Puzzles?
par: Majmudar, Neh, et autres
Publié: (2025)
par: Majmudar, Neh, et autres
Publié: (2025)
Indian-BhED: A Dataset for Measuring India-Centric Biases in Large Language Models
par: Khandelwal, Khyati, et autres
Publié: (2023)
par: Khandelwal, Khyati, et autres
Publié: (2023)
Linguistics Olympiad
par: Neacșu, Vlad A.
Publié: (2024)
par: Neacșu, Vlad A.
Publié: (2024)
UNVEILING: What Makes Linguistics Olympiad Puzzles Tricky for LLMs?
par: Choudhary, Mukund, et autres
Publié: (2025)
par: Choudhary, Mukund, et autres
Publié: (2025)
Multilingual != Multicultural: Evaluating Gaps Between Multilingual Capabilities and Cultural Alignment in LLMs
par: Rystrøm, Jonathan, et autres
Publié: (2025)
par: Rystrøm, Jonathan, et autres
Publié: (2025)
FinNLI: Novel Dataset for Multi-Genre Financial Natural Language Inference Benchmarking
par: Magomere, Jabez, et autres
Publié: (2025)
par: Magomere, Jabez, et autres
Publié: (2025)
modeLing: A Novel Dataset for Testing Linguistic Reasoning in Language Models
par: Chi, Nathan A., et autres
Publié: (2024)
par: Chi, Nathan A., et autres
Publié: (2024)
Known By Their Actions: Fingerprinting LLM Browser Agents via UI Traces
par: Lugoloobi, William, et autres
Publié: (2026)
par: Lugoloobi, William, et autres
Publié: (2026)
Why human-AI relationships need socioaffective alignment
par: Kirk, Hannah Rose, et autres
Publié: (2025)
par: Kirk, Hannah Rose, et autres
Publié: (2025)
Challenging the Boundaries of Reasoning: An Olympiad-Level Math Benchmark for Large Language Models
par: Sun, Haoxiang, et autres
Publié: (2025)
par: Sun, Haoxiang, et autres
Publié: (2025)
OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language Model
par: Chen, Qiguang, et autres
Publié: (2026)
par: Chen, Qiguang, et autres
Publié: (2026)
OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems
par: He, Chaoqun, et autres
Publié: (2024)
par: He, Chaoqun, et autres
Publié: (2024)
OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics
par: Zhu, Yaoming, et autres
Publié: (2025)
par: Zhu, Yaoming, et autres
Publié: (2025)
A Variational Approach for Mitigating Entity Bias in Relation Extraction
par: Mensah, Samuel, et autres
Publié: (2025)
par: Mensah, Samuel, et autres
Publié: (2025)
Establishing a Linguistic Olympiad in Spain, Year 1
par: Guillermo Latour
Publié: (2014)
par: Guillermo Latour
Publié: (2014)
EEFSUVA: A New Mathematical Olympiad Benchmark
par: Khatibi, Nicole N, et autres
Publié: (2025)
par: Khatibi, Nicole N, et autres
Publié: (2025)
Long-horizon Reasoning Agent for Olympiad-Level Mathematical Problem Solving
par: Gao, Songyang, et autres
Publié: (2025)
par: Gao, Songyang, et autres
Publié: (2025)
PRISM-X: Experiments on Personalised Fine-Tuning with Human and Simulated Users
par: Kirk, Hannah Rose, et autres
Publié: (2026)
par: Kirk, Hannah Rose, et autres
Publié: (2026)
Neural steering vectors reveal dose and exposure-dependent impacts of human-AI relationships
par: Kirk, Hannah Rose, et autres
Publié: (2025)
par: Kirk, Hannah Rose, et autres
Publié: (2025)
SimpleSafetyTests: a Test Suite for Identifying Critical Safety Risks in Large Language Models
par: Vidgen, Bertie, et autres
Publié: (2023)
par: Vidgen, Bertie, et autres
Publié: (2023)
MathSticks: A Benchmark for Visual Symbolic Compositional Reasoning with Matchstick Puzzles
par: Ji, Yuheng, et autres
Publié: (2025)
par: Ji, Yuheng, et autres
Publié: (2025)
PuzzlePlex: Benchmarking Foundation Models on Reasoning and Planning with Puzzles
par: Long, Yitao, et autres
Publié: (2025)
par: Long, Yitao, et autres
Publié: (2025)
Measuring what Matters: Construct Validity in Large Language Model Benchmarks
par: Bean, Andrew M., et autres
Publié: (2025)
par: Bean, Andrew M., et autres
Publié: (2025)
Achieving Gold-Medal-Level Olympiad Reasoning via Simple and Unified Scaling
par: Li, Yafu, et autres
Publié: (2026)
par: Li, Yafu, et autres
Publié: (2026)
LLMs Don't Know Their Own Decision Boundaries: The Unreliability of Self-Generated Counterfactual Explanations
par: Mayne, Harry, et autres
Publié: (2025)
par: Mayne, Harry, et autres
Publié: (2025)
RIMO: An Easy-to-Evaluate, Hard-to-Solve Olympiad Benchmark for Advanced Mathematical Reasoning
par: Chen, Ziye, et autres
Publié: (2025)
par: Chen, Ziye, et autres
Publié: (2025)
Cobordism and Concordance of Surfaces in 4-Manifolds
par: Hellsten, Simeon
Publié: (2026)
par: Hellsten, Simeon
Publié: (2026)
Probing Large Language Models in Reasoning and Translating Complex Linguistic Puzzles
par: Lin, Zheng-Lin, et autres
Publié: (2025)
par: Lin, Zheng-Lin, et autres
Publié: (2025)
Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models
par: Gao, Bofei, et autres
Publié: (2024)
par: Gao, Bofei, et autres
Publié: (2024)
The PRISM Alignment Dataset: What Participatory, Representative and Individualised Human Feedback Reveals About the Subjective and Multicultural Alignment of Large Language Models
par: Kirk, Hannah Rose, et autres
Publié: (2024)
par: Kirk, Hannah Rose, et autres
Publié: (2024)
Mastering Olympiad-Level Physics with Artificial Intelligence
par: Jian, Dong-Shan, et autres
Publié: (2025)
par: Jian, Dong-Shan, et autres
Publié: (2025)
CombiGraph-Vis: A Curated Multimodal Olympiad Benchmark for Discrete Mathematical Reasoning
par: Mahdavi, Hamed, et autres
Publié: (2025)
par: Mahdavi, Hamed, et autres
Publié: (2025)
PuzzleJAX: A Benchmark for Reasoning and Learning
par: Earle, Sam, et autres
Publié: (2025)
par: Earle, Sam, et autres
Publié: (2025)
LLaMA-Berry: Pairwise Optimization for O1-like Olympiad-Level Mathematical Reasoning
par: Zhang, Di, et autres
Publié: (2024)
par: Zhang, Di, et autres
Publié: (2024)
How Does DPO Reduce Toxicity? A Mechanistic Neuron-Level Analysis
par: Yang, Yushi, et autres
Publié: (2024)
par: Yang, Yushi, et autres
Publié: (2024)
Linguistic Organisation and Native Title
par: Hale, Ken, et autres
Publié: (2021)
par: Hale, Ken, et autres
Publié: (2021)
Proving Olympiad Inequalities by Synergizing LLMs and Symbolic Reasoning
par: Li, Zenan, et autres
Publié: (2025)
par: Li, Zenan, et autres
Publié: (2025)
Documents similaires
-
LINGOLY-TOO: Disentangling Reasoning from Knowledge with Templatised Orthographic Obfuscation
par: Khouja, Jude, et autres
Publié: (2025) -
Scaling Crowdsourced Election Monitoring: Construction and Evaluation of Classification Models for Multilingual and Cross-Domain Classification Settings
par: Magomere, Jabez, et autres
Publié: (2025) -
When Claims Evolve: Evaluating and Enhancing the Robustness of Embedding Models Against Misinformation Edits
par: Magomere, Jabez, et autres
Publié: (2025) -
Can LLMs Generate and Solve Linguistic Olympiad Puzzles?
par: Majmudar, Neh, et autres
Publié: (2025) -
Indian-BhED: A Dataset for Measuring India-Centric Biases in Large Language Models
par: Khandelwal, Khyati, et autres
Publié: (2023)