LLM-Based World Models Can Make Decisions Solely, But Rigorous Evaluations are Needed
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yang, Chang, Wang, Xinrun, Jiang, Junzhe, Zhang, Qinggang, Huang, Xiao |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Nondeterministic Polynomial-time Problem Challenge: An Ever-Scaling Reasoning Benchmark for LLMs
par: Yang, Chang, et autres
Publié: (2025)
par: Yang, Chang, et autres
Publié: (2025)
Configurable Mirror Descent: Towards a Unification of Decision Making
par: Li, Pengdeng, et autres
Publié: (2024)
par: Li, Pengdeng, et autres
Publié: (2024)
Feedback-Induced Performance Decline in LLM-Based Decision-Making
par: Yang, Xiao, et autres
Publié: (2025)
par: Yang, Xiao, et autres
Publié: (2025)
FinMaster: A Holistic Benchmark for Mastering Full-Pipeline Financial Workflows with LLMs
par: Jiang, Junzhe, et autres
Publié: (2025)
par: Jiang, Junzhe, et autres
Publié: (2025)
Use Graph When It Needs: Efficiently and Adaptively Integrating Retrieval-Augmented Generation with Graphs
par: Dong, Su, et autres
Publié: (2026)
par: Dong, Su, et autres
Publié: (2026)
CLR-Bench: Evaluating Large Language Models in College-level Reasoning
par: Dong, Junnan, et autres
Publié: (2024)
par: Dong, Junnan, et autres
Publié: (2024)
Can AI Make Energy Retrofit Decisions? An Evaluation of Large Language Models
par: Shu, Lei, et autres
Publié: (2025)
par: Shu, Lei, et autres
Publié: (2025)
Large Language Models Can Solve Real-World Planning Rigorously with Formal Verification Tools
par: Hao, Yilun, et autres
Publié: (2024)
par: Hao, Yilun, et autres
Publié: (2024)
Model Tampering Attacks Enable More Rigorous Evaluations of LLM Capabilities
par: Che, Zora, et autres
Publié: (2025)
par: Che, Zora, et autres
Publié: (2025)
Reliable Reasoning Path: Distilling Effective Guidance for LLM Reasoning with Knowledge Graphs
par: Xiao, Yilin, et autres
Publié: (2025)
par: Xiao, Yilin, et autres
Publié: (2025)
Make Planning Research Rigorous Again!
par: Katz, Michael, et autres
Publié: (2025)
par: Katz, Michael, et autres
Publié: (2025)
Learning Multiple Probabilistic Decisions from Latent World Model in Autonomous Driving
par: Xiao, Lingyu, et autres
Publié: (2024)
par: Xiao, Lingyu, et autres
Publié: (2024)
Enhancing Decision-Making for LLM Agents via Step-Level Q-Value Models
par: Zhai, Yuanzhao, et autres
Publié: (2024)
par: Zhai, Yuanzhao, et autres
Publié: (2024)
XChoice: Explainable Evaluation of AI-Human Alignment in LLM-based Constrained Choice Decision Making
par: Qi, Weihong, et autres
Publié: (2026)
par: Qi, Weihong, et autres
Publié: (2026)
RetailBench: Evaluating Long-Horizon Autonomous Decision-Making and Strategy Stability of LLM Agents in Realistic Retail Environments
par: Zhang, Linghua, et autres
Publié: (2026)
par: Zhang, Linghua, et autres
Publié: (2026)
Character is Destiny: Can Role-Playing Language Agents Make Persona-Driven Decisions?
par: Xu, Rui, et autres
Publié: (2024)
par: Xu, Rui, et autres
Publié: (2024)
Reflecting with Two Voices: A Co-Adaptive Dual-Strategy Framework for LLM-Based Agent Decision Making
par: Zhang, Wentao, et autres
Publié: (2025)
par: Zhang, Wentao, et autres
Publié: (2025)
Graph-based Agent Memory: Taxonomy, Techniques, and Applications
par: Yang, Chang, et autres
Publié: (2026)
par: Yang, Chang, et autres
Publié: (2026)
AutoSG: LLM-Driven Solver Generation Solely from Task Prompts for Expensive Optimization
par: Gu, Haoran, et autres
Publié: (2026)
par: Gu, Haoran, et autres
Publié: (2026)
Logical Reasoning with Relation Network for Inductive Knowledge Graph Completion
par: Zhang, Qinggang, et autres
Publié: (2024)
par: Zhang, Qinggang, et autres
Publié: (2024)
LAG: Logic-Augmented Generation from a Cartesian Perspective
par: Xiao, Yilin, et autres
Publié: (2025)
par: Xiao, Yilin, et autres
Publié: (2025)
Next-Generation Database Interfaces: A Survey of LLM-based Text-to-SQL
par: Hong, Zijin, et autres
Publié: (2024)
par: Hong, Zijin, et autres
Publié: (2024)
Can Language Models Serve as Text-Based World Simulators?
par: Wang, Ruoyao, et autres
Publié: (2024)
par: Wang, Ruoyao, et autres
Publié: (2024)
Structure Guided Large Language Model for SQL Generation
par: Zhang, Qinggang, et autres
Publié: (2024)
par: Zhang, Qinggang, et autres
Publié: (2024)
MetaAgents: Large Language Model Based Agents for Decision-Making on Teaming
par: Li, Yuan, et autres
Publié: (2023)
par: Li, Yuan, et autres
Publié: (2023)
Can We Trust Embodied Agents? Exploring Backdoor Attacks against Embodied LLM-based Decision-Making Systems
par: Jiao, Ruochen, et autres
Publié: (2024)
par: Jiao, Ruochen, et autres
Publié: (2024)
Scaling LLM Planning: NL2FLOW for Parametric Problem Generation and Rigorous Evaluation
par: Kang, Jungkoo
Publié: (2025)
par: Kang, Jungkoo
Publié: (2025)
DSGBench: A Diverse Strategic Game Benchmark for Evaluating LLM-based Agents in Complex Decision-Making Environments
par: Tang, Wenjie, et autres
Publié: (2025)
par: Tang, Wenjie, et autres
Publié: (2025)
Can LLMs Make (Personalized) Access Control Decisions?
par: Groschupp, Friederike, et autres
Publié: (2025)
par: Groschupp, Friederike, et autres
Publié: (2025)
The Agent Use of Agent Beings: Agent Cybernetics Is the Missing Science of Foundation Agents
par: Wang, Xinrun, et autres
Publié: (2026)
par: Wang, Xinrun, et autres
Publié: (2026)
Expertise-aware Multi-LLM Recruitment and Collaboration for Medical Decision-Making
par: Bao, Liuxin, et autres
Publié: (2025)
par: Bao, Liuxin, et autres
Publié: (2025)
LoSemB: Logic-Guided Semantic Bridging for Inductive Tool Retrieval
par: Zhuang, Luyao, et autres
Publié: (2025)
par: Zhuang, Luyao, et autres
Publié: (2025)
Entity Alignment with Noisy Annotations from Large Language Models
par: Chen, Shengyuan, et autres
Publié: (2024)
par: Chen, Shengyuan, et autres
Publié: (2024)
MCCoder: Streamlining Motion Control with LLM-Assisted Code Generation and Rigorous Verification
par: Li, Yin, et autres
Publié: (2024)
par: Li, Yin, et autres
Publié: (2024)
Benchmarking LLM Privacy Recognition for Social Robot Decision Making
par: Sullivan, Dakota, et autres
Publié: (2025)
par: Sullivan, Dakota, et autres
Publié: (2025)
PriorZero: Bridging Language Priors and World Models for Decision Making
par: Xiong, Junyu, et autres
Publié: (2026)
par: Xiong, Junyu, et autres
Publié: (2026)
Cost-efficient Knowledge-based Question Answering with Large Language Models
par: Dong, Junnan, et autres
Publié: (2024)
par: Dong, Junnan, et autres
Publié: (2024)
KnowGPT: Knowledge Graph based Prompting for Large Language Models
par: Zhang, Qinggang, et autres
Publié: (2023)
par: Zhang, Qinggang, et autres
Publié: (2023)
Resolving Latency and Inventory Risk in Market Making with Reinforcement Learning
par: Jiang, Junzhe, et autres
Publié: (2025)
par: Jiang, Junzhe, et autres
Publié: (2025)
FinWorld: An All-in-One Open-Source Platform for End-to-End Financial AI Research and Deployment
par: Zhang, Wentao, et autres
Publié: (2025)
par: Zhang, Wentao, et autres
Publié: (2025)
Documents similaires
-
Nondeterministic Polynomial-time Problem Challenge: An Ever-Scaling Reasoning Benchmark for LLMs
par: Yang, Chang, et autres
Publié: (2025) -
Configurable Mirror Descent: Towards a Unification of Decision Making
par: Li, Pengdeng, et autres
Publié: (2024) -
Feedback-Induced Performance Decline in LLM-Based Decision-Making
par: Yang, Xiao, et autres
Publié: (2025) -
FinMaster: A Holistic Benchmark for Mastering Full-Pipeline Financial Workflows with LLMs
par: Jiang, Junzhe, et autres
Publié: (2025) -
Use Graph When It Needs: Efficiently and Adaptively Integrating Retrieval-Augmented Generation with Graphs
par: Dong, Su, et autres
Publié: (2026)