Evaluating LLM Understanding via Structured Tabular Decision Simulations
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Sichao, Xu, Xinyue, Li, Xiaomeng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ELF-Gym: Evaluating Large Language Models Generated Features for Tabular Prediction
por: Zhang, Yanlin, et al.
Publicado: (2024)
por: Zhang, Yanlin, et al.
Publicado: (2024)
LLM-as-a-Prophet: Understanding Predictive Intelligence with Prophet Arena
por: Yang, Qingchuan, et al.
Publicado: (2025)
por: Yang, Qingchuan, et al.
Publicado: (2025)
RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning
por: Wang, Zihan, et al.
Publicado: (2025)
por: Wang, Zihan, et al.
Publicado: (2025)
Tabular Transfer Learning via Prompting LLMs
por: Nam, Jaehyun, et al.
Publicado: (2024)
por: Nam, Jaehyun, et al.
Publicado: (2024)
GPTree: Towards Explainable Decision-Making via LLM-powered Decision Trees
por: Xiong, Sichao, et al.
Publicado: (2024)
por: Xiong, Sichao, et al.
Publicado: (2024)
DiagnoLLM: A Hybrid Bayesian Neural Language Framework for Interpretable Disease Diagnosis
por: Xu, Bowen, et al.
Publicado: (2025)
por: Xu, Bowen, et al.
Publicado: (2025)
Anomaly Detection of Tabular Data Using LLMs
por: Li, Aodong, et al.
Publicado: (2024)
por: Li, Aodong, et al.
Publicado: (2024)
Understanding the planning of LLM agents: A survey
por: Huang, Xu, et al.
Publicado: (2024)
por: Huang, Xu, et al.
Publicado: (2024)
Large Scale Transfer Learning for Tabular Data via Language Modeling
por: Gardner, Josh, et al.
Publicado: (2024)
por: Gardner, Josh, et al.
Publicado: (2024)
Bridging Human and LLM Judgments: Understanding and Narrowing the Gap
por: Polo, Felipe Maia, et al.
Publicado: (2025)
por: Polo, Felipe Maia, et al.
Publicado: (2025)
Understanding Generalization in Role-Playing Models via Information Theory
por: Li, Yongqi, et al.
Publicado: (2025)
por: Li, Yongqi, et al.
Publicado: (2025)
BPO: Staying Close to the Behavior LLM Creates Better Online LLM Alignment
por: Xu, Wenda, et al.
Publicado: (2024)
por: Xu, Wenda, et al.
Publicado: (2024)
Understanding LLM Embeddings for Regression
por: Tang, Eric, et al.
Publicado: (2024)
por: Tang, Eric, et al.
Publicado: (2024)
ReflAct: World-Grounded Decision Making in LLM Agents via Goal-State Reflection
por: Kim, Jeonghye, et al.
Publicado: (2025)
por: Kim, Jeonghye, et al.
Publicado: (2025)
Robust Checkpoint Selection for Multimodal LLMs via Agentic Evaluation and Stability-Aware Ranking
por: Xu, Qinwu, et al.
Publicado: (2026)
por: Xu, Qinwu, et al.
Publicado: (2026)
Survey on Evaluation of LLM-based Agents
por: Yehudai, Asaf, et al.
Publicado: (2025)
por: Yehudai, Asaf, et al.
Publicado: (2025)
Why Reasoning Fails to Plan: A Planning-Centric Analysis of Long-Horizon Decision Making in LLM Agents
por: Wang, Zehong, et al.
Publicado: (2026)
por: Wang, Zehong, et al.
Publicado: (2026)
Teaching Your Models to Understand Code via Focal Preference Alignment
por: Wu, Jie, et al.
Publicado: (2025)
por: Wu, Jie, et al.
Publicado: (2025)
Understanding and Mitigating Bias Inheritance in LLM-based Data Augmentation on Downstream Tasks
por: Li, Miaomiao, et al.
Publicado: (2025)
por: Li, Miaomiao, et al.
Publicado: (2025)
Predicting Decisions of AI Agents from Limited Interaction through Text-Tabular Modeling
por: Shapira, Eilam, et al.
Publicado: (2026)
por: Shapira, Eilam, et al.
Publicado: (2026)
Logical Structure as Knowledge: Enhancing LLM Reasoning via Structured Logical Knowledge Density Estimation
por: Bi, Zhen, et al.
Publicado: (2025)
por: Bi, Zhen, et al.
Publicado: (2025)
TabDLM: Free-Form Tabular Data Generation via Joint Numerical-Language Diffusion
por: Cai, Donghong, et al.
Publicado: (2026)
por: Cai, Donghong, et al.
Publicado: (2026)
Better LLM Reasoning via Dual-Play
por: Zhang, Zhengxin, et al.
Publicado: (2025)
por: Zhang, Zhengxin, et al.
Publicado: (2025)
Tuning LLM Judge Design Decisions for 1/1000 of the Cost
por: Salinas, David, et al.
Publicado: (2025)
por: Salinas, David, et al.
Publicado: (2025)
Is Escalation Worth It? A Decision-Theoretic Characterization of LLM Cascades
por: Bouchard, Dylan
Publicado: (2026)
por: Bouchard, Dylan
Publicado: (2026)
Understanding and Mitigating Dataset Corruption in LLM Steering
por: Anderson, Cullen, et al.
Publicado: (2026)
por: Anderson, Cullen, et al.
Publicado: (2026)
Understanding the Effects of RLHF on LLM Generalisation and Diversity
por: Kirk, Robert, et al.
Publicado: (2023)
por: Kirk, Robert, et al.
Publicado: (2023)
Pseudo-Siamese Network for Planning in Target-Oriented Proactive Dialogues
por: Kang, Xinyue, et al.
Publicado: (2026)
por: Kang, Xinyue, et al.
Publicado: (2026)
CreditAudit: 2$^\text{nd}$ Dimension for LLM Evaluation and Selection
por: Song, Yiliang, et al.
Publicado: (2026)
por: Song, Yiliang, et al.
Publicado: (2026)
Where Did It Go Wrong? Attributing Undesirable LLM Behaviors via Representation Gradient Tracing
por: Li, Zhe, et al.
Publicado: (2025)
por: Li, Zhe, et al.
Publicado: (2025)
CARE: Decoding Time Safety Alignment via Rollback and Introspection Intervention
por: Hu, Xiaomeng, et al.
Publicado: (2025)
por: Hu, Xiaomeng, et al.
Publicado: (2025)
GEAR: Granularity-Adaptive Advantage Reweighting for LLM Agents via Self-Distillation
por: Li, Sijia, et al.
Publicado: (2026)
por: Li, Sijia, et al.
Publicado: (2026)
LLM-Guided Indoor Navigation with Multimodal Map Understanding
por: Coffrini, Alberto, et al.
Publicado: (2025)
por: Coffrini, Alberto, et al.
Publicado: (2025)
HindSight: Evaluating LLM-Generated Research Ideas via Future Impact
por: Jiang, Bo
Publicado: (2026)
por: Jiang, Bo
Publicado: (2026)
Understanding the Performance and Estimating the Cost of LLM Fine-Tuning
por: Xia, Yuchen, et al.
Publicado: (2024)
por: Xia, Yuchen, et al.
Publicado: (2024)
Multimodal Tabular Reasoning with Privileged Structured Information
por: Jiang, Jun-Peng, et al.
Publicado: (2025)
por: Jiang, Jun-Peng, et al.
Publicado: (2025)
On Evaluating LLM Alignment by Evaluating LLMs as Judges
por: Liu, Yixin, et al.
Publicado: (2025)
por: Liu, Yixin, et al.
Publicado: (2025)
Towards Understanding Multi-Round Large Language Model Reasoning: Approximability, Learnability and Generalizability
por: Xu, Chenhui, et al.
Publicado: (2025)
por: Xu, Chenhui, et al.
Publicado: (2025)
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
por: Xi, Zhiheng, et al.
Publicado: (2025)
por: Xi, Zhiheng, et al.
Publicado: (2025)
RelayLLM: Efficient Reasoning via Collaborative Decoding
por: Huang, Chengsong, et al.
Publicado: (2026)
por: Huang, Chengsong, et al.
Publicado: (2026)
Ejemplares similares
-
ELF-Gym: Evaluating Large Language Models Generated Features for Tabular Prediction
por: Zhang, Yanlin, et al.
Publicado: (2024) -
LLM-as-a-Prophet: Understanding Predictive Intelligence with Prophet Arena
por: Yang, Qingchuan, et al.
Publicado: (2025) -
RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning
por: Wang, Zihan, et al.
Publicado: (2025) -
Tabular Transfer Learning via Prompting LLMs
por: Nam, Jaehyun, et al.
Publicado: (2024) -
GPTree: Towards Explainable Decision-Making via LLM-powered Decision Trees
por: Xiong, Sichao, et al.
Publicado: (2024)