Triangulating LLM Progress through Benchmarks, Games, and Cognitive Tests
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Momentè, Filippo, Suglia, Alessandro, Giulianelli, Mario, Ferrari, Ambra, Koller, Alexander, Lemon, Oliver, Schlangen, David, Fernández, Raquel, Bernardi, Raffaella |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Playpen: An Environment for Exploring Learning Through Conversational Interaction
par: Horst, Nicola, et autres
Publié: (2025)
par: Horst, Nicola, et autres
Publié: (2025)
A Dialogue Game for Eliciting Balanced Collaboration
par: Jeknić, Isidora, et autres
Publié: (2024)
par: Jeknić, Isidora, et autres
Publié: (2024)
Lost in Space: Probing Fine-grained Spatial Understanding in Vision and Language Resamplers
par: Pantazopoulos, Georgios, et autres
Publié: (2024)
par: Pantazopoulos, Georgios, et autres
Publié: (2024)
Shaking Up VLMs: Comparing Transformers and Structured State Space Models for Vision & Language Modeling
par: Pantazopoulos, Georgios, et autres
Publié: (2024)
par: Pantazopoulos, Georgios, et autres
Publié: (2024)
LLMs instead of Human Judges? A Large Scale Empirical Study across 20 NLP Evaluation Tasks
par: Bavaresco, Anna, et autres
Publié: (2024)
par: Bavaresco, Anna, et autres
Publié: (2024)
LLM Agents in Interaction: Measuring Personality Consistency and Linguistic Alignment in Interacting Populations of Large Language Models
par: Frisch, Ivar, et autres
Publié: (2024)
par: Frisch, Ivar, et autres
Publié: (2024)
VLM-RobustBench: A Comprehensive Benchmark for Robustness of Vision-Language Models
par: Saxena, Rohit, et autres
Publié: (2026)
par: Saxena, Rohit, et autres
Publié: (2026)
AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
par: Suglia, Alessandro, et autres
Publié: (2024)
par: Suglia, Alessandro, et autres
Publié: (2024)
Estudo comparativo do uso da minociclina sistêmica versus corticoterapia sistêmica no tratamento de vitiligo em atividade
par: Gabriela Momente Miquelin
Publié: (2019)
par: Gabriela Momente Miquelin
Publié: (2019)
Apresentação exuberante de caso de esclerose sistêmica
par: Gabriela Momente Miquelin
Publié: (2018)
par: Gabriela Momente Miquelin
Publié: (2018)
VoyagerVision: Investigating the Role of Multi-modal Information for Open-ended Learning Systems
par: Smyth, Ethan, et autres
Publié: (2025)
par: Smyth, Ethan, et autres
Publié: (2025)
Repairs in a Block World: A New Benchmark for Handling User Corrections with Multi-Modal Language Models
par: Chiyah-Garcia, Javier, et autres
Publié: (2024)
par: Chiyah-Garcia, Javier, et autres
Publié: (2024)
clem:todd: A Framework for the Systematic Benchmarking of LLM-Based Task-Oriented Dialogue System Realisations
par: Kranti, Chalamalasetti, et autres
Publié: (2025)
par: Kranti, Chalamalasetti, et autres
Publié: (2025)
Collaborative Problem-Solving in an Optimization Game
par: Jeknic, Isidora, et autres
Publié: (2025)
par: Jeknic, Isidora, et autres
Publié: (2025)
The Price of Thought: A Multilingual Analysis of Reasoning, Performance, and Cost of Negotiation in Large Language Models
par: Hakimov, Sherzod, et autres
Publié: (2025)
par: Hakimov, Sherzod, et autres
Publié: (2025)
All-in-one: Understanding and Generation in Multimodal Reasoning with the MAIA Benchmark
par: Testa, Davide, et autres
Publié: (2025)
par: Testa, Davide, et autres
Publié: (2025)
La Red ¿democrática? en la sociedad del aislamiento
par: Santiago Giulianelli
Publié: (2005)
par: Santiago Giulianelli
Publié: (2005)
AgriPath: A Systematic Exploration of Architectural Trade-offs for Crop Disease Classification
par: Mooraj, Hamza, et autres
Publié: (2026)
par: Mooraj, Hamza, et autres
Publié: (2026)
Non-planar Object Detection and Identification by Features Matching and Triangulation Growth
par: Leveni, Filippo
Publié: (2025)
par: Leveni, Filippo
Publié: (2025)
A Third Paradigm for LLM Evaluation: Dialogue Game-Based Evaluation using clembench
par: Schlangen, David, et autres
Publié: (2025)
par: Schlangen, David, et autres
Publié: (2025)
Fine-grained Controllable Text Generation through In-context Learning with Feedback
par: Thillainathan, Sarubi, et autres
Publié: (2024)
par: Thillainathan, Sarubi, et autres
Publié: (2024)
Learning Communication Policies for Different Follower Behaviors in a Collaborative Reference Game
par: Sadler, Philipp, et autres
Publié: (2024)
par: Sadler, Philipp, et autres
Publié: (2024)
Towards a Similarity-adjusted Surprisal Theory
par: Meister, Clara, et autres
Publié: (2024)
par: Meister, Clara, et autres
Publié: (2024)
Structure-Conditional Minimum Bayes Risk Decoding
par: Eikema, Bryan, et autres
Publié: (2025)
par: Eikema, Bryan, et autres
Publié: (2025)
Surprisal Minimisation over Goal-directed Alternatives Predicts Production Choice in Dialogue
par: Utting, Tom, et autres
Publié: (2026)
par: Utting, Tom, et autres
Publié: (2026)
Generalized Measures of Anticipation and Responsivity in Online Language Processing
par: Giulianelli, Mario, et autres
Publié: (2024)
par: Giulianelli, Mario, et autres
Publié: (2024)
Ad-hoc Concept Forming in the Game Codenames as a Means for Evaluating Large Language Models
par: Hakimov, Sherzod, et autres
Publié: (2025)
par: Hakimov, Sherzod, et autres
Publié: (2025)
FOSSIL: Harnessing Feedback on Suboptimal Samples for Data-Efficient Generalisation with Imitation Learning for Embodied Vision-and-Language Tasks
par: McCallum, Sabrina, et autres
Publié: (2025)
par: McCallum, Sabrina, et autres
Publié: (2025)
LLMs as Function Approximators: Terminology, Taxonomy, and Questions for Evaluation
par: Schlangen, David
Publié: (2024)
par: Schlangen, David
Publié: (2024)
Sharing the Cost of Success: A Game for Evaluating and Learning Collaborative Multi-Agent Instruction Giving and Following Policies
par: Sadler, Philipp, et autres
Publié: (2024)
par: Sadler, Philipp, et autres
Publié: (2024)
A Systematic Analysis of Large Language Models as Soft Reasoners: The Case of Syllogistic Inferences
par: Bertolazzi, Leonardo, et autres
Publié: (2024)
par: Bertolazzi, Leonardo, et autres
Publié: (2024)
How Language Models Conflate Logical Validity with Plausibility: A Representational Analysis of Content Effects
par: Bertolazzi, Leonardo, et autres
Publié: (2025)
par: Bertolazzi, Leonardo, et autres
Publié: (2025)
Learning to Ask Informative Questions: Enhancing LLMs with Preference Optimization and Expected Information Gain
par: Mazzaccara, Davide, et autres
Publié: (2024)
par: Mazzaccara, Davide, et autres
Publié: (2024)
The ‘How’ of Self-Care for Teachers
par: Lemon, Narelle
Publié: (2026)
par: Lemon, Narelle
Publié: (2026)
Building for Speech: Designing the Next Generation of Social Robots for Audio Interaction
par: Addlesee, Angus, et autres
Publié: (2023)
par: Addlesee, Angus, et autres
Publié: (2023)
Da 'città del silenzio' a città delle macchine
par: Bernardi, Alessandro
Publié: (2022)
par: Bernardi, Alessandro
Publié: (2022)
Investigating the Role of Instruction Variety and Task Difficulty in Robotic Manipulation Tasks
par: Parekh, Amit, et autres
Publié: (2024)
par: Parekh, Amit, et autres
Publié: (2024)
Learning To See But Forgetting To Follow: Visual Instruction Tuning Makes LLMs More Prone To Jailbreak Attacks
par: Pantazopoulos, Georgios, et autres
Publié: (2024)
par: Pantazopoulos, Georgios, et autres
Publié: (2024)
PIXAR: Auto-Regressive Language Modeling in Pixel Space
par: Tai, Yintao, et autres
Publié: (2024)
par: Tai, Yintao, et autres
Publié: (2024)
Enhancing Continual Learning in Visual Question Answering with Modality-Aware Feature Distillation
par: Nikandrou, Malvina, et autres
Publié: (2024)
par: Nikandrou, Malvina, et autres
Publié: (2024)
Documents similaires
-
Playpen: An Environment for Exploring Learning Through Conversational Interaction
par: Horst, Nicola, et autres
Publié: (2025) -
A Dialogue Game for Eliciting Balanced Collaboration
par: Jeknić, Isidora, et autres
Publié: (2024) -
Lost in Space: Probing Fine-grained Spatial Understanding in Vision and Language Resamplers
par: Pantazopoulos, Georgios, et autres
Publié: (2024) -
Shaking Up VLMs: Comparing Transformers and Structured State Space Models for Vision & Language Modeling
par: Pantazopoulos, Georgios, et autres
Publié: (2024) -
LLMs instead of Human Judges? A Large Scale Empirical Study across 20 NLP Evaluation Tasks
par: Bavaresco, Anna, et autres
Publié: (2024)