Evaluating Large Language Models for Causal Modeling
Fuente:
arXiv
Saved in:
| Main Authors: | Razouk, Houssam, Benischke, Leonie, Niess, Georg, Kern, Roman |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
ReFoRCE: A Text-to-SQL Agent with Self-Refinement, Consensus Enforcement, and Column Exploration
by: Deng, Minghang, et al.
Published: (2025)
by: Deng, Minghang, et al.
Published: (2025)
ChemPro: A Progressive Chemistry Benchmark for Large Language Models
by: Baranwal, Aaditya, et al.
Published: (2026)
by: Baranwal, Aaditya, et al.
Published: (2026)
Quo Vadis ChatGPT? From Large Language Models to Large Knowledge Models
by: Venkatasubramanian, Venkat, et al.
Published: (2024)
by: Venkatasubramanian, Venkat, et al.
Published: (2024)
Modeling Emotions and Ethics with Large Language Models
by: Chang, Edward Y.
Published: (2024)
by: Chang, Edward Y.
Published: (2024)
OG-RAG: Ontology-Grounded Retrieval-Augmented Generation For Large Language Models
by: Sharma, Kartik, et al.
Published: (2024)
by: Sharma, Kartik, et al.
Published: (2024)
Reducing Selection Bias in Large Language Models
by: Eicher, J. E., et al.
Published: (2024)
by: Eicher, J. E., et al.
Published: (2024)
Revisiting Parameter-Based Knowledge Editing in Large Language Models: Theoretical Limits and Empirical Evidence
by: Ren, Wanying, et al.
Published: (2026)
by: Ren, Wanying, et al.
Published: (2026)
Fanar: An Arabic-Centric Multimodal Generative AI Platform
by: Fanar Team, et al.
Published: (2025)
by: Fanar Team, et al.
Published: (2025)
LLMs and the Human Condition
by: Wallis, Peter
Published: (2024)
by: Wallis, Peter
Published: (2024)
Syntactic Blind Spots: How Misalignment Leads to LLMs Mathematical Errors
by: Williamson, Dane, et al.
Published: (2025)
by: Williamson, Dane, et al.
Published: (2025)
Training Language Models to Win Debates with Self-Play Improves Judge Accuracy
by: Arnesen, Samuel, et al.
Published: (2024)
by: Arnesen, Samuel, et al.
Published: (2024)
In-Context Learning May Not Elicit Trustworthy Reasoning: A-Not-B Errors in Pretrained Language Models
by: Han, Pengrui, et al.
Published: (2024)
by: Han, Pengrui, et al.
Published: (2024)
TwinVoice: A Multi-dimensional Benchmark Towards Digital Twins via LLM Persona Simulation
by: Du, Bangde, et al.
Published: (2025)
by: Du, Bangde, et al.
Published: (2025)
BabyReasoningBench: Generating Developmentally-Inspired Reasoning Tasks for Evaluating Baby Language Models
by: Dhole, Kaustubh D.
Published: (2026)
by: Dhole, Kaustubh D.
Published: (2026)
Graph Language Models
by: Plenz, Moritz, et al.
Published: (2024)
by: Plenz, Moritz, et al.
Published: (2024)
Rewarding Creativity: A Human-Aligned Generative Reward Model for Reinforcement Learning in Storytelling
by: Li, Zhaoyan, et al.
Published: (2026)
by: Li, Zhaoyan, et al.
Published: (2026)
Making High-Level AI Design Decisions Explicit Using a Binary Stream System-Designation Approach
by: Mossbridge, Julia
Published: (2024)
by: Mossbridge, Julia
Published: (2024)
Deploying Large Language Models With Retrieval Augmented Generation
by: Prabhune, Sonal, et al.
Published: (2024)
by: Prabhune, Sonal, et al.
Published: (2024)
ConCISE: A Reference-Free Conciseness Evaluation Metric for LLM-Generated Answers
by: Ghafari, Seyed Mohssen, et al.
Published: (2025)
by: Ghafari, Seyed Mohssen, et al.
Published: (2025)
Mining Large Language Models for Low-Resource Language Data: Comparing Elicitation Strategies for Hausa and Fongbe
by: Adjovi, Mahounan Pericles, et al.
Published: (2026)
by: Adjovi, Mahounan Pericles, et al.
Published: (2026)
The Democratic Paradox in Large Language Models' Underestimation of Press Freedom
by: Loaiza, I., et al.
Published: (2025)
by: Loaiza, I., et al.
Published: (2025)
CoMaPOI: A Collaborative Multi-Agent Framework for Next POI Prediction Bridging the Gap Between Trajectory and Language
by: Zhong, Lin, et al.
Published: (2025)
by: Zhong, Lin, et al.
Published: (2025)
QuickSilver -- Speeding up LLM Inference through Dynamic Token Halting, KV Skipping, Contextual Token Fusion, and Adaptive Matryoshka Quantization
by: Khanna, Danush, et al.
Published: (2025)
by: Khanna, Danush, et al.
Published: (2025)
OpenAI Cribbed Our Tax Example, But Can GPT-4 Really Do Tax?
by: Blair-Stanek, Andrew, et al.
Published: (2023)
by: Blair-Stanek, Andrew, et al.
Published: (2023)
MATH-PT: A Math Reasoning Benchmark for European and Brazilian Portuguese
by: Teixeira, Tiago, et al.
Published: (2026)
by: Teixeira, Tiago, et al.
Published: (2026)
Mutagenesis screen to map the functions of parameters of Large Language Models
by: Hu, Yue, et al.
Published: (2024)
by: Hu, Yue, et al.
Published: (2024)
Automated Circuit Interpretation via Probe Prompting
by: Birardi, Giuseppe
Published: (2025)
by: Birardi, Giuseppe
Published: (2025)
A Case-Based Persistent Memory for a Large Language Model
by: Watson, Ian
Published: (2023)
by: Watson, Ian
Published: (2023)
The Drill-Down and Fabricate Test (DDFT): A Protocol for Measuring Epistemic Robustness in Language Models
by: Baxi, Rahul
Published: (2025)
by: Baxi, Rahul
Published: (2025)
Future of AI Models: A Computational perspective on Model collapse
by: Satharasi, Trivikram, et al.
Published: (2025)
by: Satharasi, Trivikram, et al.
Published: (2025)
Large Language Models Report Subjective Experience Under Self-Referential Processing
by: Berg, Cameron, et al.
Published: (2025)
by: Berg, Cameron, et al.
Published: (2025)
Aspect-Based Sentiment Analysis for Future Tourism Experiences: A BERT-MoE Framework for Persian User Reviews
by: Taskooh, Hamidreza Kazemi, et al.
Published: (2026)
by: Taskooh, Hamidreza Kazemi, et al.
Published: (2026)
Do Chains-of-Thoughts of Large Language Models Suffer from Hallucinations, Cognitive Biases, or Phobias in Bayesian Reasoning?
by: Araya, Roberto
Published: (2025)
by: Araya, Roberto
Published: (2025)
ConciseRL: Conciseness-Guided Reinforcement Learning for Efficient Reasoning Models
by: Dumitru, Razvan-Gabriel, et al.
Published: (2025)
by: Dumitru, Razvan-Gabriel, et al.
Published: (2025)
CuentosIE: can a chatbot about "tales with a message" help to teach emotional intelligence?
by: Ferrández, Antonio, et al.
Published: (2024)
by: Ferrández, Antonio, et al.
Published: (2024)
Box Maze: A Process-Control Architecture for Reliable LLM Reasoning
by: Qiang, Zou
Published: (2026)
by: Qiang, Zou
Published: (2026)
Paging Dr. GPT: Extracting Information from Clinical Notes to Enhance Patient Predictions
by: Anderson, David, et al.
Published: (2025)
by: Anderson, David, et al.
Published: (2025)
Beyond Direct Generation: A Decomposed Approach to Well-Crafted Screenwriting with LLMs
by: Lei, Hang, et al.
Published: (2025)
by: Lei, Hang, et al.
Published: (2025)
Cognitively Inspired Components for Social Conversational Agents
by: Clay, Alex, et al.
Published: (2023)
by: Clay, Alex, et al.
Published: (2023)
How much can change in a year? Revisiting Evaluation in Multi-Agent Reinforcement Learning
by: Singh, Siddarth, et al.
Published: (2023)
by: Singh, Siddarth, et al.
Published: (2023)
Similar Items
-
ReFoRCE: A Text-to-SQL Agent with Self-Refinement, Consensus Enforcement, and Column Exploration
by: Deng, Minghang, et al.
Published: (2025) -
ChemPro: A Progressive Chemistry Benchmark for Large Language Models
by: Baranwal, Aaditya, et al.
Published: (2026) -
Quo Vadis ChatGPT? From Large Language Models to Large Knowledge Models
by: Venkatasubramanian, Venkat, et al.
Published: (2024) -
Modeling Emotions and Ethics with Large Language Models
by: Chang, Edward Y.
Published: (2024) -
OG-RAG: Ontology-Grounded Retrieval-Augmented Generation For Large Language Models
by: Sharma, Kartik, et al.
Published: (2024)