Parameterized Argumentation-based Reasoning Tasks for Benchmarking Generative Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Steging, Cor, Renooij, Silja, Verheij, Bart |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Confronting Label Indeterminacy in Automated Bail Decisions
by: Steging, Cor, et al.
Published: (2026)
by: Steging, Cor, et al.
Published: (2026)
Label Indeterminacy in AI & Law
by: Steging, Cor, et al.
Published: (2025)
by: Steging, Cor, et al.
Published: (2025)
I-RAVEN-X: Benchmarking Generalization and Robustness of Analogical and Mathematical Reasoning in Large Language and Reasoning Models
by: Camposampiero, Giacomo, et al.
Published: (2025)
by: Camposampiero, Giacomo, et al.
Published: (2025)
Benchmarking the Medical Understanding and Reasoning of Large Language Models in Arabic Healthcare Tasks
by: AlDahoul, Nouar, et al.
Published: (2025)
by: AlDahoul, Nouar, et al.
Published: (2025)
Neuro-Argumentative Learning with Case-Based Reasoning
by: Gould, Adam, et al.
Published: (2025)
by: Gould, Adam, et al.
Published: (2025)
Benchmarking Large Language Models with Integer Sequence Generation Tasks
by: O'Malley, Daniel, et al.
Published: (2024)
by: O'Malley, Daniel, et al.
Published: (2024)
Beyond Output Correctness: Benchmarking and Evaluating Large Language Model Reasoning in Coding Tasks
by: Li, Yuangang, et al.
Published: (2026)
by: Li, Yuangang, et al.
Published: (2026)
Model-based Reinforcement Learning for Parameterized Action Spaces
by: Zhang, Renhao, et al.
Published: (2024)
by: Zhang, Renhao, et al.
Published: (2024)
Principled Understanding of Generalization for Generative Transformer Models in Arithmetic Reasoning Tasks
by: Xu, Xingcheng, et al.
Published: (2024)
by: Xu, Xingcheng, et al.
Published: (2024)
Efficient Embedding-based Synthetic Data Generation for Complex Reasoning Tasks
by: Jayaraman, Srideepika, et al.
Published: (2026)
by: Jayaraman, Srideepika, et al.
Published: (2026)
FormalMATH: Benchmarking Formal Mathematical Reasoning of Large Language Models
by: Yu, Zhouliang, et al.
Published: (2025)
by: Yu, Zhouliang, et al.
Published: (2025)
Shopping MMLU: A Massive Multi-Task Online Shopping Benchmark for Large Language Models
by: Jin, Yilun, et al.
Published: (2024)
by: Jin, Yilun, et al.
Published: (2024)
Sample-Efficient Constrained Reinforcement Learning with General Parameterization
by: Mondal, Washim Uddin, et al.
Published: (2024)
by: Mondal, Washim Uddin, et al.
Published: (2024)
Generalizing Knowledge Graph Embedding with Universal Orthogonal Parameterization
by: Li, Rui, et al.
Published: (2024)
by: Li, Rui, et al.
Published: (2024)
Parallax: Parameterized Local Linear Attention for Language Modeling
by: Zuo, Yifei, et al.
Published: (2026)
by: Zuo, Yifei, et al.
Published: (2026)
COMET: Benchmark for Comprehensive Biological Multi-omics Evaluation Tasks and Language Models
by: Ren, Yuchen, et al.
Published: (2024)
by: Ren, Yuchen, et al.
Published: (2024)
Hints-In-Browser: Benchmarking Language Models for Programming Feedback Generation
by: Kotalwar, Nachiket, et al.
Published: (2024)
by: Kotalwar, Nachiket, et al.
Published: (2024)
ReasoningWeekly: A General Knowledge and Verbal Reasoning Challenge for Large Language Models
by: Wu, Zixuan, et al.
Published: (2025)
by: Wu, Zixuan, et al.
Published: (2025)
Optimal Sparsity of Mixture-of-Experts Language Models for Reasoning Tasks
by: Nakamura, Taishi, et al.
Published: (2025)
by: Nakamura, Taishi, et al.
Published: (2025)
On the Limits of Layer Pruning for Generative Reasoning in Large Language Models
by: Shrestha, Safal, et al.
Published: (2026)
by: Shrestha, Safal, et al.
Published: (2026)
Last-Iterate Convergence of General Parameterized Policies in Constrained MDPs
by: Mondal, Washim Uddin, et al.
Published: (2024)
by: Mondal, Washim Uddin, et al.
Published: (2024)
Can only LLMs do Reasoning?: Potential of Small Language Models in Task Planning
by: Choi, Gawon, et al.
Published: (2024)
by: Choi, Gawon, et al.
Published: (2024)
DyVal: Dynamic Evaluation of Large Language Models for Reasoning Tasks
by: Zhu, Kaijie, et al.
Published: (2023)
by: Zhu, Kaijie, et al.
Published: (2023)
The Geometry of Self-Verification in a Task-Specific Reasoning Model
by: Lee, Andrew, et al.
Published: (2025)
by: Lee, Andrew, et al.
Published: (2025)
CPL: Critical Plan Step Learning Boosts LLM Generalization in Reasoning Tasks
by: Wang, Tianlong, et al.
Published: (2024)
by: Wang, Tianlong, et al.
Published: (2024)
Limited Generalizability in Argument Mining: State-Of-The-Art Models Learn Datasets, Not Arguments
by: Feger, Marc, et al.
Published: (2025)
by: Feger, Marc, et al.
Published: (2025)
ArgRAG: Explainable Retrieval Augmented Generation using Quantitative Bipolar Argumentation
by: Zhu, Yuqicheng, et al.
Published: (2025)
by: Zhu, Yuqicheng, et al.
Published: (2025)
From Answers to Arguments: Toward Trustworthy Clinical Diagnostic Reasoning with Toulmin-Guided Curriculum Goal-Conditioned Learning
by: Zhan, Chen, et al.
Published: (2026)
by: Zhan, Chen, et al.
Published: (2026)
Native Reasoning Models: Training Language Models to Reason on Unverifiable Data
by: Wang, Yuanfu, et al.
Published: (2026)
by: Wang, Yuanfu, et al.
Published: (2026)
Parameterized Projected Bellman Operator
by: Vincent, Théo, et al.
Published: (2023)
by: Vincent, Théo, et al.
Published: (2023)
ARC-GEN: A Mimetic Procedural Benchmark Generator for the Abstraction and Reasoning Corpus
by: Moffitt, Michael D.
Published: (2025)
by: Moffitt, Michael D.
Published: (2025)
Recourse under Model Multiplicity via Argumentative Ensembling (Technical Report)
by: Jiang, Junqi, et al.
Published: (2023)
by: Jiang, Junqi, et al.
Published: (2023)
Subgoal Search For Complex Reasoning Tasks
by: Czechowski, Konrad, et al.
Published: (2021)
by: Czechowski, Konrad, et al.
Published: (2021)
The Argument is the Explanation: Structured Argumentation for Trust in Agents
by: Cakar, Ege, et al.
Published: (2025)
by: Cakar, Ege, et al.
Published: (2025)
Object-Centric Neuro-Argumentative Learning
by: Jacob, Abdul Rahman, et al.
Published: (2025)
by: Jacob, Abdul Rahman, et al.
Published: (2025)
CausalVLBench: Benchmarking Visual Causal Reasoning in Large Vision-Language Models
by: Komanduri, Aneesh, et al.
Published: (2025)
by: Komanduri, Aneesh, et al.
Published: (2025)
BioMaze: Benchmarking and Enhancing Large Language Models for Biological Pathway Reasoning
by: Zhao, Haiteng, et al.
Published: (2025)
by: Zhao, Haiteng, et al.
Published: (2025)
PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models
by: Xu, Yinggan, et al.
Published: (2025)
by: Xu, Yinggan, et al.
Published: (2025)
A2RBench: An Automatic Paradigm for Formally Verifiable Abstract Reasoning Benchmark Generation
by: Ma, Qingchuan, et al.
Published: (2026)
by: Ma, Qingchuan, et al.
Published: (2026)
Diffusion Controller: Framework, Algorithms and Parameterization
by: Yang, Tong, et al.
Published: (2026)
by: Yang, Tong, et al.
Published: (2026)
Similar Items
-
Confronting Label Indeterminacy in Automated Bail Decisions
by: Steging, Cor, et al.
Published: (2026) -
Label Indeterminacy in AI & Law
by: Steging, Cor, et al.
Published: (2025) -
I-RAVEN-X: Benchmarking Generalization and Robustness of Analogical and Mathematical Reasoning in Large Language and Reasoning Models
by: Camposampiero, Giacomo, et al.
Published: (2025) -
Benchmarking the Medical Understanding and Reasoning of Large Language Models in Arabic Healthcare Tasks
by: AlDahoul, Nouar, et al.
Published: (2025) -
Neuro-Argumentative Learning with Case-Based Reasoning
by: Gould, Adam, et al.
Published: (2025)