Anticipatory Evaluation of Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Park, Jungsoo, Mendes, Ethan, Stanovsky, Gabriel, Ritter, Alan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Can LLMs Help Uncover Insights about LLMs? A Large-Scale, Evolving Literature Analysis of Frontier LLMs
par: Park, Jungsoo, et autres
Publié: (2025)
par: Park, Jungsoo, et autres
Publié: (2025)
Language Models can Self-Improve at State-Value Estimation for Better Search
par: Mendes, Ethan, et autres
Publié: (2025)
par: Mendes, Ethan, et autres
Publié: (2025)
Didactic to Constructive: Turning Expert Solutions into Learnable Reasoning
par: Mendes, Ethan, et autres
Publié: (2026)
par: Mendes, Ethan, et autres
Publié: (2026)
Distribution-Aware Reward: Reinforcement Learning over Predictive Distributions for LLM Regression
par: Park, Jungsoo, et autres
Publié: (2026)
par: Park, Jungsoo, et autres
Publié: (2026)
A Nurse is Blue and Elephant is Rugby: Cross Domain Alignment in Large Language Models Reveal Human-like Patterns
par: Yehudai, Asaf, et autres
Publié: (2024)
par: Yehudai, Asaf, et autres
Publié: (2024)
Planted in Pretraining, Swayed by Finetuning: A Case Study on the Origins of Cognitive Biases in LLMs
par: Itzhak, Itay, et autres
Publié: (2025)
par: Itzhak, Itay, et autres
Publié: (2025)
Beyond Benchmarks: On The False Promise of AI Regulation
par: Stanovsky, Gabriel, et autres
Publié: (2025)
par: Stanovsky, Gabriel, et autres
Publié: (2025)
From Feelings to Metrics: Understanding and Formalizing How Users Vibe-Test LLMs
par: Itzhak, Itay, et autres
Publié: (2026)
par: Itzhak, Itay, et autres
Publié: (2026)
Having Beer after Prayer? Measuring Cultural Bias in Large Language Models
par: Naous, Tarek, et autres
Publié: (2023)
par: Naous, Tarek, et autres
Publié: (2023)
Evaluating Robustness of Reward Models for Mathematical Reasoning
par: Kim, Sunghwan, et autres
Publié: (2024)
par: Kim, Sunghwan, et autres
Publié: (2024)
Cooking Up Creativity: Enhancing LLM Creativity through Structured Recombination
par: Mizrahi, Moran, et autres
Publié: (2025)
par: Mizrahi, Moran, et autres
Publié: (2025)
Evaluating and Enhancing Large Language Models for Novelty Assessment in Scholarly Publications
par: Lin, Ethan, et autres
Publié: (2024)
par: Lin, Ethan, et autres
Publié: (2024)
Instructed to Bias: Instruction-Tuned Language Models Exhibit Emergent Cognitive Bias
par: Itzhak, Itay, et autres
Publié: (2023)
par: Itzhak, Itay, et autres
Publié: (2023)
GeoRC: A Benchmark for Geolocation Reasoning Chains
par: Talreja, Mohit, et autres
Publié: (2026)
par: Talreja, Mohit, et autres
Publié: (2026)
Training Language Models with Language Feedback at Scale
par: Scheurer, Jérémy, et autres
Publié: (2023)
par: Scheurer, Jérémy, et autres
Publié: (2023)
Tree-based Dialogue Reinforced Policy Optimization for Red-Teaming Attacks
par: Guo, Ruohao, et autres
Publié: (2025)
par: Guo, Ruohao, et autres
Publié: (2025)
Elements of World Knowledge (EWoK): A Cognition-Inspired Framework for Evaluating Basic World Knowledge in Language Models
par: Ivanova, Anna A., et autres
Publié: (2024)
par: Ivanova, Anna A., et autres
Publié: (2024)
Causal Evaluation of Language Models
par: Chen, Sirui, et autres
Publié: (2024)
par: Chen, Sirui, et autres
Publié: (2024)
Toeplitz MLP Mixers are Low Complexity, Information-Rich Sequence Models
par: Badger, Benjamin L., et autres
Publié: (2026)
par: Badger, Benjamin L., et autres
Publié: (2026)
Omanic: Towards Step-wise Evaluation of Multi-hop Reasoning in Large Language Models
par: Gu, Xiaojie, et autres
Publié: (2026)
par: Gu, Xiaojie, et autres
Publié: (2026)
Upcycling Large Language Models into Mixture of Experts
par: He, Ethan, et autres
Publié: (2024)
par: He, Ethan, et autres
Publié: (2024)
Debate Helps Weak Judges Reward Stronger Models
par: Elasky, Ethan, et autres
Publié: (2026)
par: Elasky, Ethan, et autres
Publié: (2026)
The Linear Representation Hypothesis and the Geometry of Large Language Models
par: Park, Kiho, et autres
Publié: (2023)
par: Park, Kiho, et autres
Publié: (2023)
Benchmarking the Capabilities of Large Language Models in Transportation System Engineering: Accuracy, Consistency, and Reasoning Behaviors
par: Syed, Usman, et autres
Publié: (2024)
par: Syed, Usman, et autres
Publié: (2024)
Towards Acyclic Preference Evaluation of Language Models via Multiple Evaluators
par: Hu, Zhengyu, et autres
Publié: (2024)
par: Hu, Zhengyu, et autres
Publié: (2024)
Compositional Causal Reasoning Evaluation in Language Models
par: Maasch, Jacqueline R. M. A., et autres
Publié: (2025)
par: Maasch, Jacqueline R. M. A., et autres
Publié: (2025)
Evaluating the Goal-Directedness of Large Language Models
par: Everitt, Tom, et autres
Publié: (2025)
par: Everitt, Tom, et autres
Publié: (2025)
Structured Prompts Improve Evaluation of Language Models
par: Aali, Asad, et autres
Publié: (2025)
par: Aali, Asad, et autres
Publié: (2025)
Evaluating Language Model Agency through Negotiations
par: Davidson, Tim R., et autres
Publié: (2024)
par: Davidson, Tim R., et autres
Publié: (2024)
Scaling Sparse Fine-Tuning to Large Language Models
par: Ansell, Alan, et autres
Publié: (2024)
par: Ansell, Alan, et autres
Publié: (2024)
The Geometry of Categorical and Hierarchical Concepts in Large Language Models
par: Park, Kiho, et autres
Publié: (2024)
par: Park, Kiho, et autres
Publié: (2024)
Existing Large Language Model Unlearning Evaluations Are Inconclusive
par: Feng, Zhili, et autres
Publié: (2025)
par: Feng, Zhili, et autres
Publié: (2025)
Generative Evaluation of Complex Reasoning in Large Language Models
par: Lin, Haowei, et autres
Publié: (2025)
par: Lin, Haowei, et autres
Publié: (2025)
An Evaluation on Large Language Model Outputs: Discourse and Memorization
par: de Wynter, Adrian, et autres
Publié: (2023)
par: de Wynter, Adrian, et autres
Publié: (2023)
Evaluating Language-Model Agents on Realistic Autonomous Tasks
par: Kinniment, Megan, et autres
Publié: (2023)
par: Kinniment, Megan, et autres
Publié: (2023)
Evaluating the Robustness of Analogical Reasoning in Large Language Models
par: Lewis, Martha, et autres
Publié: (2024)
par: Lewis, Martha, et autres
Publié: (2024)
Paloma: A Benchmark for Evaluating Language Model Fit
par: Magnusson, Ian, et autres
Publié: (2023)
par: Magnusson, Ian, et autres
Publié: (2023)
Latxa: An Open Language Model and Evaluation Suite for Basque
par: Etxaniz, Julen, et autres
Publié: (2024)
par: Etxaniz, Julen, et autres
Publié: (2024)
Evaluating the Performance of Large Language Models via Debates
par: Moniri, Behrad, et autres
Publié: (2024)
par: Moniri, Behrad, et autres
Publié: (2024)
Report Cards: Qualitative Evaluation of Language Models Using Natural Language Summaries
par: Yang, Blair, et autres
Publié: (2024)
par: Yang, Blair, et autres
Publié: (2024)
Documents similaires
-
Can LLMs Help Uncover Insights about LLMs? A Large-Scale, Evolving Literature Analysis of Frontier LLMs
par: Park, Jungsoo, et autres
Publié: (2025) -
Language Models can Self-Improve at State-Value Estimation for Better Search
par: Mendes, Ethan, et autres
Publié: (2025) -
Didactic to Constructive: Turning Expert Solutions into Learnable Reasoning
par: Mendes, Ethan, et autres
Publié: (2026) -
Distribution-Aware Reward: Reinforcement Learning over Predictive Distributions for LLM Regression
par: Park, Jungsoo, et autres
Publié: (2026) -
A Nurse is Blue and Elephant is Rugby: Cross Domain Alignment in Large Language Models Reveal Human-like Patterns
par: Yehudai, Asaf, et autres
Publié: (2024)