Limits of Emergent Reasoning of Large Language Models in Agentic Frameworks for Deterministic Games
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Su, Chris, Li, Harrison, Marques, Matheus, Flint, George, Zhu, Kevin, Dev, Sunishchal |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Emergent Persuasion: Will LLMs Persuade Without Being Prompted?
par: Chang, Vincent, et autres
Publié: (2025)
par: Chang, Vincent, et autres
Publié: (2025)
Broken Chains: The Cost of Incomplete Reasoning in LLMs
par: Su, Ian, et autres
Publié: (2026)
par: Su, Ian, et autres
Publié: (2026)
ProMoral-Bench: Evaluating Prompting Strategies for Moral Reasoning and Safety in LLMs
par: Thomas, Rohan Subramanian, et autres
Publié: (2026)
par: Thomas, Rohan Subramanian, et autres
Publié: (2026)
Peek-a-Boo Reasoning: Contrastive Region Masking in MLLMs
par: Chaturvedi, Isha, et autres
Publié: (2025)
par: Chaturvedi, Isha, et autres
Publié: (2025)
PALADIN: Self-Correcting Language Model Agents to Cure Tool-Failure Cases
par: Vuddanti, Sri Vatsa, et autres
Publié: (2025)
par: Vuddanti, Sri Vatsa, et autres
Publié: (2025)
Visualizing and Benchmarking LLM Factual Hallucination Tendencies via Internal State Analysis and Clustering
par: Mao, Nathan, et autres
Publié: (2026)
par: Mao, Nathan, et autres
Publié: (2026)
Agentic Reasoning for Large Language Models
par: Wei, Tianxin, et autres
Publié: (2026)
par: Wei, Tianxin, et autres
Publié: (2026)
DuoLens: A Framework for Robust Detection of Machine-Generated Multilingual Text and Code
par: Agrawal, Shriyansh, et autres
Publié: (2025)
par: Agrawal, Shriyansh, et autres
Publié: (2025)
Judge Reliability Harness: Stress Testing the Reliability of LLM Judges
par: Dev, Sunishchal, et autres
Publié: (2026)
par: Dev, Sunishchal, et autres
Publié: (2026)
Sumudu Neural Operator for ODEs and PDEs
par: Zelenskiy, Ben, et autres
Publié: (2025)
par: Zelenskiy, Ben, et autres
Publié: (2025)
Think in Games: Learning to Reason in Games via Reinforcement Learning with Large Language Models
par: Liao, Yi, et autres
Publié: (2025)
par: Liao, Yi, et autres
Publié: (2025)
Enhance Reasoning for Large Language Models in the Game Werewolf
par: Wu, Shuang, et autres
Publié: (2024)
par: Wu, Shuang, et autres
Publié: (2024)
Amortized Latent Steering: Low-Cost Alternative to Test-Time Optimization
par: Egbuna, Nathan, et autres
Publié: (2025)
par: Egbuna, Nathan, et autres
Publié: (2025)
Distributed Interpretability and Control for Large Language Models
par: Desai, Dev Arpan, et autres
Publié: (2026)
par: Desai, Dev Arpan, et autres
Publié: (2026)
CA-BED: Conversation-Aware Bayesian Experimental Design
par: Arnould, Daniel, et autres
Publié: (2026)
par: Arnould, Daniel, et autres
Publié: (2026)
Emergent Symbolic Mechanisms Support Abstract Reasoning in Large Language Models
par: Yang, Yukang, et autres
Publié: (2025)
par: Yang, Yukang, et autres
Publié: (2025)
Rethinking Agentic Reinforcement Learning In Large Language Models
par: Cui, Fangming, et autres
Publié: (2026)
par: Cui, Fangming, et autres
Publié: (2026)
Agentic Reasoning: A Streamlined Framework for Enhancing LLM Reasoning with Agentic Tools
par: Wu, Junde, et autres
Publié: (2025)
par: Wu, Junde, et autres
Publié: (2025)
TableReasoner: Advancing Table Reasoning Framework with Large Language Models
par: Xiong, Sishi, et autres
Publié: (2025)
par: Xiong, Sishi, et autres
Publié: (2025)
A Survey of Reasoning and Agentic Systems in Time Series with Large Language Models
par: Chang, Ching, et autres
Publié: (2025)
par: Chang, Ching, et autres
Publié: (2025)
M2A: Synergizing Mathematical and Agentic Reasoning in Large Language Models
par: Wang, Junjian, et autres
Publié: (2026)
par: Wang, Junjian, et autres
Publié: (2026)
Reasoning Relay: Evaluating Stability and Interchangeability of Large Language Models in Mathematical Reasoning
par: Lu, Leo, et autres
Publié: (2025)
par: Lu, Leo, et autres
Publié: (2025)
Game Reasoning Arena: A Framework and Benchmark for Assessing Reasoning Capabilities of Large Language Models via Game Play
par: Cipolina-Kun, Lucia, et autres
Publié: (2025)
par: Cipolina-Kun, Lucia, et autres
Publié: (2025)
BALROG: Benchmarking Agentic LLM and VLM Reasoning On Games
par: Paglieri, Davide, et autres
Publié: (2024)
par: Paglieri, Davide, et autres
Publié: (2024)
AgentChangeBench: A Multi-Dimensional Evaluation Framework for Goal-Shift Robustness in Conversational AI
par: Rana, Manik, et autres
Publié: (2025)
par: Rana, Manik, et autres
Publié: (2025)
On the Self-Verification Limitations of Large Language Models on Reasoning and Planning Tasks
par: Stechly, Kaya, et autres
Publié: (2024)
par: Stechly, Kaya, et autres
Publié: (2024)
FinLLMs: A Framework for Financial Reasoning Dataset Generation with Large Language Models
par: Yuan, Ziqiang, et autres
Publié: (2024)
par: Yuan, Ziqiang, et autres
Publié: (2024)
GraphScout: Empowering Large Language Models with Intrinsic Exploration Ability for Agentic Graph Reasoning
par: Ying, Yuchen, et autres
Publié: (2026)
par: Ying, Yuchen, et autres
Publié: (2026)
Disentangling Reasoning and Knowledge in Medical Large Language Models
par: Thapa, Rahul, et autres
Publié: (2025)
par: Thapa, Rahul, et autres
Publié: (2025)
On the Limits of Layer Pruning for Generative Reasoning in Large Language Models
par: Shrestha, Safal, et autres
Publié: (2026)
par: Shrestha, Safal, et autres
Publié: (2026)
FRIT: Using Causal Importance to Improve Chain-of-Thought Faithfulness
par: Swaroop, Anand, et autres
Publié: (2025)
par: Swaroop, Anand, et autres
Publié: (2025)
AgenticEval: Toward Agentic and Self-Evolving Safety Evaluation of Large Language Models
par: Wang, Yixu, et autres
Publié: (2025)
par: Wang, Yixu, et autres
Publié: (2025)
TRUST: A Decentralized Framework for Auditing Large Language Model Reasoning
par: Huang, Morris Yu-Chao, et autres
Publié: (2025)
par: Huang, Morris Yu-Chao, et autres
Publié: (2025)
Evaluating Interactive Reasoning in Large Language Models: A Hierarchical Benchmark with Executable Games
par: Fan, Mingyuan, et autres
Publié: (2026)
par: Fan, Mingyuan, et autres
Publié: (2026)
WGSR-Bench: Wargame-based Game-theoretic Strategic Reasoning Benchmark for Large Language Models
par: Yin, Qiyue, et autres
Publié: (2025)
par: Yin, Qiyue, et autres
Publié: (2025)
Beyond Retrieval: Modeling Confidence Decay and Deterministic Agentic Platforms in Generative Engine Optimization
par: Zhao, XinYu, et autres
Publié: (2026)
par: Zhao, XinYu, et autres
Publié: (2026)
Solvita: Enhancing Large Language Models for Competitive Programming via Agentic Evolution
par: Li, Han, et autres
Publié: (2026)
par: Li, Han, et autres
Publié: (2026)
Agentmandering: A Game-Theoretic Framework for Fair Redistricting via Large Language Model Agents
par: Li, Hao, et autres
Publié: (2025)
par: Li, Hao, et autres
Publié: (2025)
SpotAgent: Grounding Visual Geo-localization in Large Vision-Language Models through Agentic Reasoning
par: Jia, Furong, et autres
Publié: (2026)
par: Jia, Furong, et autres
Publié: (2026)
RAVEN: An Agentic Framework for Multimodal Entity Discovery from Large-Scale Video Collections
par: Rosa, Kevin Dela
Publié: (2025)
par: Rosa, Kevin Dela
Publié: (2025)
Documents similaires
-
Emergent Persuasion: Will LLMs Persuade Without Being Prompted?
par: Chang, Vincent, et autres
Publié: (2025) -
Broken Chains: The Cost of Incomplete Reasoning in LLMs
par: Su, Ian, et autres
Publié: (2026) -
ProMoral-Bench: Evaluating Prompting Strategies for Moral Reasoning and Safety in LLMs
par: Thomas, Rohan Subramanian, et autres
Publié: (2026) -
Peek-a-Boo Reasoning: Contrastive Region Masking in MLLMs
par: Chaturvedi, Isha, et autres
Publié: (2025) -
PALADIN: Self-Correcting Language Model Agents to Cure Tool-Failure Cases
par: Vuddanti, Sri Vatsa, et autres
Publié: (2025)