BIG-Bench Extra Hard
Fuente:
arXiv
Salvato in:
| Autori principali: | Kazemi, Mehran, Fatemi, Bahare, Bansal, Hritik, Palowitch, John, Anastasiou, Chrysovalantis, Mehta, Sanket Vaibhav, Jain, Lalit K., Aglietti, Virginia, Jindal, Disha, Chen, Peter, Dikkala, Nishanth, Tyen, Gladys, Liu, Xin, Shalit, Uri, Chiappa, Silvia, Olszewska, Kate, Tay, Yi, Tran, Vinh Q., Le, Quoc V., Firat, Orhan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ReMI: A Dataset for Reasoning with Multiple Images
di: Kazemi, Mehran, et al.
Pubblicazione: (2024)
di: Kazemi, Mehran, et al.
Pubblicazione: (2024)
Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning
di: Fatemi, Bahare, et al.
Pubblicazione: (2024)
di: Fatemi, Bahare, et al.
Pubblicazione: (2024)
Michelangelo: Long Context Evaluations Beyond Haystacks via Latent Structure Queries
di: Vodrahalli, Kiran, et al.
Pubblicazione: (2024)
di: Vodrahalli, Kiran, et al.
Pubblicazione: (2024)
Causal Language Modeling Can Elicit Search and Reasoning Capabilities on Logic Puzzles
di: Shah, Kulin, et al.
Pubblicazione: (2024)
di: Shah, Kulin, et al.
Pubblicazione: (2024)
Learning Neural Networks with Sparse Activations
di: Awasthi, Pranjal, et al.
Pubblicazione: (2024)
di: Awasthi, Pranjal, et al.
Pubblicazione: (2024)
Smaller, Weaker, Yet Better: Training LLM Reasoners via Compute-Optimal Sampling
di: Bansal, Hritik, et al.
Pubblicazione: (2024)
di: Bansal, Hritik, et al.
Pubblicazione: (2024)
CausalGraph2LLM: Evaluating LLMs for Causal Queries
di: Sheth, Ivaxi, et al.
Pubblicazione: (2024)
di: Sheth, Ivaxi, et al.
Pubblicazione: (2024)
TrajRoute: Rethinking Routing with a Simple Trajectory-Based Approach -- Forget the Maps and Traffic!
di: Siampou, Maria Despoina, et al.
Pubblicazione: (2024)
di: Siampou, Maria Despoina, et al.
Pubblicazione: (2024)
Benchmarks for Reinforcement Learning with Biased Offline Data and Imperfect Simulators
di: Linial, Ori, et al.
Pubblicazione: (2024)
di: Linial, Ori, et al.
Pubblicazione: (2024)
Set Valued Predictions For Robust Domain Generalization
di: Tsibulsky, Ron, et al.
Pubblicazione: (2025)
di: Tsibulsky, Ron, et al.
Pubblicazione: (2025)
Heterogeneous Treatment Effect in Time-to-Event Outcomes: Harnessing Censored Data with Recursively Imputed Trees
di: Meir, Tomer, et al.
Pubblicazione: (2025)
di: Meir, Tomer, et al.
Pubblicazione: (2025)
Reasoning with Latent Thoughts: On the Power of Looped Transformers
di: Saunshi, Nikunj, et al.
Pubblicazione: (2025)
di: Saunshi, Nikunj, et al.
Pubblicazione: (2025)
Aiming for Relevance
di: Porat, Bar Eini, et al.
Pubblicazione: (2024)
di: Porat, Bar Eini, et al.
Pubblicazione: (2024)
Let Your Graph Do the Talking: Encoding Structured Data for LLMs
di: Perozzi, Bryan, et al.
Pubblicazione: (2024)
di: Perozzi, Bryan, et al.
Pubblicazione: (2024)
Prompting Strategies for Enabling Large Language Models to Infer Causation from Correlation
di: Sgouritsa, Eleni, et al.
Pubblicazione: (2024)
di: Sgouritsa, Eleni, et al.
Pubblicazione: (2024)
SocialQuotes: Learning Contextual Roles of Social Media Quotes on the Web
di: Palowitch, John, et al.
Pubblicazione: (2024)
di: Palowitch, John, et al.
Pubblicazione: (2024)
StagFormer: Time Staggering Transformer Decoding for RunningLayers In Parallel
di: Cutler, Dylan, et al.
Pubblicazione: (2025)
di: Cutler, Dylan, et al.
Pubblicazione: (2025)
Scaling Sign Language Translation
di: Zhang, Biao, et al.
Pubblicazione: (2024)
di: Zhang, Biao, et al.
Pubblicazione: (2024)
Understanding Transformer Reasoning Capabilities via Graph Algorithms
di: Sanford, Clayton, et al.
Pubblicazione: (2024)
di: Sanford, Clayton, et al.
Pubblicazione: (2024)
Sums of Frames from the Weyl--Heisenberg Group and Applications to Frame Algorithm
di: Jindal, Divya, et al.
Pubblicazione: (2023)
di: Jindal, Divya, et al.
Pubblicazione: (2023)
On the ERM Principle in Meta-Learning
di: Alon, Yannay, et al.
Pubblicazione: (2024)
di: Alon, Yannay, et al.
Pubblicazione: (2024)
Preference-based Conditional Treatment Effects and Policy Learning
di: Parnas, Dovid, et al.
Pubblicazione: (2026)
di: Parnas, Dovid, et al.
Pubblicazione: (2026)
Malign Overfitting: Interpolation Can Provably Preclude Invariance
di: Wald, Yoav, et al.
Pubblicazione: (2022)
di: Wald, Yoav, et al.
Pubblicazione: (2022)
Structured Hybrid Mechanistic Models for Robust Estimation of Time-Dependent Intervention Outcomes
di: Meir, Tomer, et al.
Pubblicazione: (2026)
di: Meir, Tomer, et al.
Pubblicazione: (2026)
V.I.G VALADIS INFORMATION GEOMETRY. A Geometric World Without Pythagoras
di: Avgenikos, Chrysovalantis
Pubblicazione: (2026)
di: Avgenikos, Chrysovalantis
Pubblicazione: (2026)
Market power and income disparities: How can firms influence the gap between capital and labor earnings
di: Chrysovalantis Amountzias
Pubblicazione: (2024)
di: Chrysovalantis Amountzias
Pubblicazione: (2024)
A Implies B: Circuit Analysis in LLMs for Propositional Logical Reasoning
di: Hong, Guan Zhe, et al.
Pubblicazione: (2024)
di: Hong, Guan Zhe, et al.
Pubblicazione: (2024)
GradINN: Gradient Informed Neural Network
di: Aglietti, Filippo, et al.
Pubblicazione: (2024)
di: Aglietti, Filippo, et al.
Pubblicazione: (2024)
Development of Dual‐Functional Hydrogel‐Based Conductive Electrodes for Accelerated Wound Healing and Motion Sensing
di: Cihangir Boztepe, et al.
Pubblicazione: (2025)
di: Cihangir Boztepe, et al.
Pubblicazione: (2025)
INSIGHTS: Demonstration-Based Summaries of Time Series Predictors
di: Porat, Bar Eini, et al.
Pubblicazione: (2026)
di: Porat, Bar Eini, et al.
Pubblicazione: (2026)
Prompt sky localization of compact binary sources using a meshfree approximation
di: Pathak, Lalit, et al.
Pubblicazione: (2023)
di: Pathak, Lalit, et al.
Pubblicazione: (2023)
Cittadinanze nella storia dello Stato contemporaneo
di: Aglietti, Marcella, et al.
Pubblicazione: (2018)
di: Aglietti, Marcella, et al.
Pubblicazione: (2018)
When Scaling Meets LLM Finetuning: The Effect of Data, Model and Finetuning Method
di: Zhang, Biao, et al.
Pubblicazione: (2024)
di: Zhang, Biao, et al.
Pubblicazione: (2024)
Single‐Phase Blood Flow in a Stenosed Coronary Artery: A Clinical Model‐Based Experimental and Numerical Study
di: Orhan Yildirim, et al.
Pubblicazione: (2025)
di: Orhan Yildirim, et al.
Pubblicazione: (2025)
Don't Forget to Connect! Improving RAG with Graph-based Reranking
di: Dong, Jialin, et al.
Pubblicazione: (2024)
di: Dong, Jialin, et al.
Pubblicazione: (2024)
Clifford Strategies in Interactive Protocols are Classically Simulatable
di: Shalit, Itay
Pubblicazione: (2024)
di: Shalit, Itay
Pubblicazione: (2024)
El problema de la autopolinización en Prosopis tamarugo Phil (Mimosaceae)
di: E. Chiappa
Pubblicazione: (1996)
di: E. Chiappa
Pubblicazione: (1996)
Equidad y capital humano avanzado: Análisis sobre las políticas de formación de doctorado en Chile
di: Roxana Chiappa
Pubblicazione: (2015)
di: Roxana Chiappa
Pubblicazione: (2015)
Is merging worth it? Securely evaluating the information gain for causal dataset acquisition
di: Fawkes, Jake, et al.
Pubblicazione: (2024)
di: Fawkes, Jake, et al.
Pubblicazione: (2024)
Heavy quark mass effects in the Energy-Energy Correlation in the back-to-back region
di: Aglietti, Ugo Giuseppe, et al.
Pubblicazione: (2024)
di: Aglietti, Ugo Giuseppe, et al.
Pubblicazione: (2024)
Documenti analoghi
-
ReMI: A Dataset for Reasoning with Multiple Images
di: Kazemi, Mehran, et al.
Pubblicazione: (2024) -
Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning
di: Fatemi, Bahare, et al.
Pubblicazione: (2024) -
Michelangelo: Long Context Evaluations Beyond Haystacks via Latent Structure Queries
di: Vodrahalli, Kiran, et al.
Pubblicazione: (2024) -
Causal Language Modeling Can Elicit Search and Reasoning Capabilities on Logic Puzzles
di: Shah, Kulin, et al.
Pubblicazione: (2024) -
Learning Neural Networks with Sparse Activations
di: Awasthi, Pranjal, et al.
Pubblicazione: (2024)