LLM-Based World Models Can Make Decisions Solely, But Rigorous Evaluations are Needed
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Chang, Wang, Xinrun, Jiang, Junzhe, Zhang, Qinggang, Huang, Xiao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Nondeterministic Polynomial-time Problem Challenge: An Ever-Scaling Reasoning Benchmark for LLMs
por: Yang, Chang, et al.
Publicado: (2025)
por: Yang, Chang, et al.
Publicado: (2025)
Configurable Mirror Descent: Towards a Unification of Decision Making
por: Li, Pengdeng, et al.
Publicado: (2024)
por: Li, Pengdeng, et al.
Publicado: (2024)
Feedback-Induced Performance Decline in LLM-Based Decision-Making
por: Yang, Xiao, et al.
Publicado: (2025)
por: Yang, Xiao, et al.
Publicado: (2025)
FinMaster: A Holistic Benchmark for Mastering Full-Pipeline Financial Workflows with LLMs
por: Jiang, Junzhe, et al.
Publicado: (2025)
por: Jiang, Junzhe, et al.
Publicado: (2025)
CLR-Bench: Evaluating Large Language Models in College-level Reasoning
por: Dong, Junnan, et al.
Publicado: (2024)
por: Dong, Junnan, et al.
Publicado: (2024)
Use Graph When It Needs: Efficiently and Adaptively Integrating Retrieval-Augmented Generation with Graphs
por: Dong, Su, et al.
Publicado: (2026)
por: Dong, Su, et al.
Publicado: (2026)
Can AI Make Energy Retrofit Decisions? An Evaluation of Large Language Models
por: Shu, Lei, et al.
Publicado: (2025)
por: Shu, Lei, et al.
Publicado: (2025)
Large Language Models Can Solve Real-World Planning Rigorously with Formal Verification Tools
por: Hao, Yilun, et al.
Publicado: (2024)
por: Hao, Yilun, et al.
Publicado: (2024)
Model Tampering Attacks Enable More Rigorous Evaluations of LLM Capabilities
por: Che, Zora, et al.
Publicado: (2025)
por: Che, Zora, et al.
Publicado: (2025)
Reliable Reasoning Path: Distilling Effective Guidance for LLM Reasoning with Knowledge Graphs
por: Xiao, Yilin, et al.
Publicado: (2025)
por: Xiao, Yilin, et al.
Publicado: (2025)
Make Planning Research Rigorous Again!
por: Katz, Michael, et al.
Publicado: (2025)
por: Katz, Michael, et al.
Publicado: (2025)
Learning Multiple Probabilistic Decisions from Latent World Model in Autonomous Driving
por: Xiao, Lingyu, et al.
Publicado: (2024)
por: Xiao, Lingyu, et al.
Publicado: (2024)
Enhancing Decision-Making for LLM Agents via Step-Level Q-Value Models
por: Zhai, Yuanzhao, et al.
Publicado: (2024)
por: Zhai, Yuanzhao, et al.
Publicado: (2024)
XChoice: Explainable Evaluation of AI-Human Alignment in LLM-based Constrained Choice Decision Making
por: Qi, Weihong, et al.
Publicado: (2026)
por: Qi, Weihong, et al.
Publicado: (2026)
RetailBench: Evaluating Long-Horizon Autonomous Decision-Making and Strategy Stability of LLM Agents in Realistic Retail Environments
por: Zhang, Linghua, et al.
Publicado: (2026)
por: Zhang, Linghua, et al.
Publicado: (2026)
Character is Destiny: Can Role-Playing Language Agents Make Persona-Driven Decisions?
por: Xu, Rui, et al.
Publicado: (2024)
por: Xu, Rui, et al.
Publicado: (2024)
Reflecting with Two Voices: A Co-Adaptive Dual-Strategy Framework for LLM-Based Agent Decision Making
por: Zhang, Wentao, et al.
Publicado: (2025)
por: Zhang, Wentao, et al.
Publicado: (2025)
Graph-based Agent Memory: Taxonomy, Techniques, and Applications
por: Yang, Chang, et al.
Publicado: (2026)
por: Yang, Chang, et al.
Publicado: (2026)
AutoSG: LLM-Driven Solver Generation Solely from Task Prompts for Expensive Optimization
por: Gu, Haoran, et al.
Publicado: (2026)
por: Gu, Haoran, et al.
Publicado: (2026)
Logical Reasoning with Relation Network for Inductive Knowledge Graph Completion
por: Zhang, Qinggang, et al.
Publicado: (2024)
por: Zhang, Qinggang, et al.
Publicado: (2024)
LAG: Logic-Augmented Generation from a Cartesian Perspective
por: Xiao, Yilin, et al.
Publicado: (2025)
por: Xiao, Yilin, et al.
Publicado: (2025)
Next-Generation Database Interfaces: A Survey of LLM-based Text-to-SQL
por: Hong, Zijin, et al.
Publicado: (2024)
por: Hong, Zijin, et al.
Publicado: (2024)
Can Language Models Serve as Text-Based World Simulators?
por: Wang, Ruoyao, et al.
Publicado: (2024)
por: Wang, Ruoyao, et al.
Publicado: (2024)
MetaAgents: Large Language Model Based Agents for Decision-Making on Teaming
por: Li, Yuan, et al.
Publicado: (2023)
por: Li, Yuan, et al.
Publicado: (2023)
Structure Guided Large Language Model for SQL Generation
por: Zhang, Qinggang, et al.
Publicado: (2024)
por: Zhang, Qinggang, et al.
Publicado: (2024)
Can We Trust Embodied Agents? Exploring Backdoor Attacks against Embodied LLM-based Decision-Making Systems
por: Jiao, Ruochen, et al.
Publicado: (2024)
por: Jiao, Ruochen, et al.
Publicado: (2024)
Scaling LLM Planning: NL2FLOW for Parametric Problem Generation and Rigorous Evaluation
por: Kang, Jungkoo
Publicado: (2025)
por: Kang, Jungkoo
Publicado: (2025)
DSGBench: A Diverse Strategic Game Benchmark for Evaluating LLM-based Agents in Complex Decision-Making Environments
por: Tang, Wenjie, et al.
Publicado: (2025)
por: Tang, Wenjie, et al.
Publicado: (2025)
Can LLMs Make (Personalized) Access Control Decisions?
por: Groschupp, Friederike, et al.
Publicado: (2025)
por: Groschupp, Friederike, et al.
Publicado: (2025)
The Agent Use of Agent Beings: Agent Cybernetics Is the Missing Science of Foundation Agents
por: Wang, Xinrun, et al.
Publicado: (2026)
por: Wang, Xinrun, et al.
Publicado: (2026)
Expertise-aware Multi-LLM Recruitment and Collaboration for Medical Decision-Making
por: Bao, Liuxin, et al.
Publicado: (2025)
por: Bao, Liuxin, et al.
Publicado: (2025)
LoSemB: Logic-Guided Semantic Bridging for Inductive Tool Retrieval
por: Zhuang, Luyao, et al.
Publicado: (2025)
por: Zhuang, Luyao, et al.
Publicado: (2025)
MCCoder: Streamlining Motion Control with LLM-Assisted Code Generation and Rigorous Verification
por: Li, Yin, et al.
Publicado: (2024)
por: Li, Yin, et al.
Publicado: (2024)
Entity Alignment with Noisy Annotations from Large Language Models
por: Chen, Shengyuan, et al.
Publicado: (2024)
por: Chen, Shengyuan, et al.
Publicado: (2024)
Benchmarking LLM Privacy Recognition for Social Robot Decision Making
por: Sullivan, Dakota, et al.
Publicado: (2025)
por: Sullivan, Dakota, et al.
Publicado: (2025)
PriorZero: Bridging Language Priors and World Models for Decision Making
por: Xiong, Junyu, et al.
Publicado: (2026)
por: Xiong, Junyu, et al.
Publicado: (2026)
Cost-efficient Knowledge-based Question Answering with Large Language Models
por: Dong, Junnan, et al.
Publicado: (2024)
por: Dong, Junnan, et al.
Publicado: (2024)
KnowGPT: Knowledge Graph based Prompting for Large Language Models
por: Zhang, Qinggang, et al.
Publicado: (2023)
por: Zhang, Qinggang, et al.
Publicado: (2023)
FOUNDER: Grounding Foundation Models in World Models for Open-Ended Embodied Decision Making
por: Wang, Yucen, et al.
Publicado: (2025)
por: Wang, Yucen, et al.
Publicado: (2025)
FinWorld: An All-in-One Open-Source Platform for End-to-End Financial AI Research and Deployment
por: Zhang, Wentao, et al.
Publicado: (2025)
por: Zhang, Wentao, et al.
Publicado: (2025)
Ejemplares similares
-
Nondeterministic Polynomial-time Problem Challenge: An Ever-Scaling Reasoning Benchmark for LLMs
por: Yang, Chang, et al.
Publicado: (2025) -
Configurable Mirror Descent: Towards a Unification of Decision Making
por: Li, Pengdeng, et al.
Publicado: (2024) -
Feedback-Induced Performance Decline in LLM-Based Decision-Making
por: Yang, Xiao, et al.
Publicado: (2025) -
FinMaster: A Holistic Benchmark for Mastering Full-Pipeline Financial Workflows with LLMs
por: Jiang, Junzhe, et al.
Publicado: (2025) -
CLR-Bench: Evaluating Large Language Models in College-level Reasoning
por: Dong, Junnan, et al.
Publicado: (2024)