LocationReasoner: Evaluating LLMs on Real-World Site Selection Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Koda, Miho, Zheng, Yu, Ma, Ruixian, Sun, Mingyang, Pansare, Devesh, Duarte, Fabio, Santi, Paolo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
seqBench: A Tunable Benchmark to Quantify Sequential Reasoning Limits of LLMs
di: Ramezanali, Mohammad, et al.
Pubblicazione: (2025)
di: Ramezanali, Mohammad, et al.
Pubblicazione: (2025)
OpenEstimate: Evaluating LLMs on Reasoning Under Uncertainty with Real-World Data
di: Renda, Alana, et al.
Pubblicazione: (2025)
di: Renda, Alana, et al.
Pubblicazione: (2025)
Reasoning-CV: Fine-tuning Powerful Reasoning LLMs for Knowledge-Assisted Claim Verification
di: Zheng, Zhi, et al.
Pubblicazione: (2025)
di: Zheng, Zhi, et al.
Pubblicazione: (2025)
RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios
di: Zhou, Ruiwen, et al.
Pubblicazione: (2024)
di: Zhou, Ruiwen, et al.
Pubblicazione: (2024)
On the Role of Model Prior in Real-World Inductive Reasoning
di: Liu, Zhuo, et al.
Pubblicazione: (2024)
di: Liu, Zhuo, et al.
Pubblicazione: (2024)
Thinking by Doing: Building Efficient World Model Reasoning in LLMs via Multi-turn Interaction
di: Shu, Bao, et al.
Pubblicazione: (2025)
di: Shu, Bao, et al.
Pubblicazione: (2025)
TIME: A Multi-level Benchmark for Temporal Reasoning of LLMs in Real-World Scenarios
di: Wei, Shaohang, et al.
Pubblicazione: (2025)
di: Wei, Shaohang, et al.
Pubblicazione: (2025)
Reframing Spatial Reasoning Evaluation in Language Models: A Real-World Simulation Benchmark for Qualitative Reasoning
di: Li, Fangjun, et al.
Pubblicazione: (2024)
di: Li, Fangjun, et al.
Pubblicazione: (2024)
Reasoning or Not? A Comprehensive Evaluation of Reasoning LLMs for Dialogue Summarization
di: Jin, Keyan, et al.
Pubblicazione: (2025)
di: Jin, Keyan, et al.
Pubblicazione: (2025)
CausalReasoningBenchmark: A Real-World Benchmark for Disentangled Evaluation of Causal Identification and Estimation
di: Sawarni, Ayush, et al.
Pubblicazione: (2026)
di: Sawarni, Ayush, et al.
Pubblicazione: (2026)
CAREBench: Evaluating LLMs' Emotion Understanding by Assessing Cognitive Appraisal Reasoning
di: Sun, Zhaoyue, et al.
Pubblicazione: (2026)
di: Sun, Zhaoyue, et al.
Pubblicazione: (2026)
Unmasking Reasoning Processes: A Process-aware Benchmark for Evaluating Structural Mathematical Reasoning in LLMs
di: Zheng, Xiang, et al.
Pubblicazione: (2026)
di: Zheng, Xiang, et al.
Pubblicazione: (2026)
Enhancing LLMs' Clinical Reasoning with Real-World Data from a Nationwide Sepsis Registry
di: Kim, Junu, et al.
Pubblicazione: (2025)
di: Kim, Junu, et al.
Pubblicazione: (2025)
Buffer Matters: Unleashing the Power of Off-Policy Reinforcement Learning in Large Language Model Reasoning
di: Wan, Xu, et al.
Pubblicazione: (2026)
di: Wan, Xu, et al.
Pubblicazione: (2026)
ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning
di: Chen, Mingyang, et al.
Pubblicazione: (2025)
di: Chen, Mingyang, et al.
Pubblicazione: (2025)
Evaluating Relational Reasoning in LLMs with REL
di: Fesser, Lukas, et al.
Pubblicazione: (2026)
di: Fesser, Lukas, et al.
Pubblicazione: (2026)
Can Agents Price a Reaction? Evaluating LLMs on Chemical Cost Reasoning
di: Wu, Yuyang, et al.
Pubblicazione: (2026)
di: Wu, Yuyang, et al.
Pubblicazione: (2026)
OMEGA: Can LLMs Reason Outside the Box in Math? Evaluating Exploratory, Compositional, and Transformative Generalization
di: Sun, Yiyou, et al.
Pubblicazione: (2025)
di: Sun, Yiyou, et al.
Pubblicazione: (2025)
ARCHE: A Novel Task to Evaluate LLMs on Latent Reasoning Chain Extraction
di: Li, Pengze, et al.
Pubblicazione: (2025)
di: Li, Pengze, et al.
Pubblicazione: (2025)
LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs
di: Zhou, Zenghui, et al.
Pubblicazione: (2026)
di: Zhou, Zenghui, et al.
Pubblicazione: (2026)
Effective Learning for Small Reasoning Models: An Empirical Study on 0.5B Reasoning LLMs
di: Zhuang, Xialie, et al.
Pubblicazione: (2025)
di: Zhuang, Xialie, et al.
Pubblicazione: (2025)
Inductive or Deductive? Rethinking the Fundamental Reasoning Abilities of LLMs
di: Cheng, Kewei, et al.
Pubblicazione: (2024)
di: Cheng, Kewei, et al.
Pubblicazione: (2024)
Teaching and Evaluating LLMs to Reason About Polymer Design Related Tasks
di: Mohanty, Dikshya, et al.
Pubblicazione: (2026)
di: Mohanty, Dikshya, et al.
Pubblicazione: (2026)
Evaluating Bias in Spoken Dialogue LLMs for Real-World Decisions and Recommendations
di: Wu, Yihao, et al.
Pubblicazione: (2025)
di: Wu, Yihao, et al.
Pubblicazione: (2025)
Flow of Reasoning: Training LLMs for Divergent Reasoning with Minimal Examples
di: Yu, Fangxu, et al.
Pubblicazione: (2024)
di: Yu, Fangxu, et al.
Pubblicazione: (2024)
CausalAbstain: Enhancing Multilingual LLMs with Causal Reasoning for Trustworthy Abstention
di: Sun, Yuxi, et al.
Pubblicazione: (2025)
di: Sun, Yuxi, et al.
Pubblicazione: (2025)
LingLanMiDian: Systematic Evaluation of LLMs on TCM Knowledge and Clinical Reasoning
di: Hua, Rui, et al.
Pubblicazione: (2026)
di: Hua, Rui, et al.
Pubblicazione: (2026)
Strategy-Aware Optimization Modeling with Reasoning LLMs
di: Zhao, Ruiqing, et al.
Pubblicazione: (2026)
di: Zhao, Ruiqing, et al.
Pubblicazione: (2026)
When Counterfactual Reasoning Fails: Chaos and Real-World Complexity
di: Aalaila, Yahya, et al.
Pubblicazione: (2025)
di: Aalaila, Yahya, et al.
Pubblicazione: (2025)
What Defines Good Reasoning in LLMs? Dissecting Reasoning Steps with Multi-Aspect Evaluation
di: Do, Heejin, et al.
Pubblicazione: (2025)
di: Do, Heejin, et al.
Pubblicazione: (2025)
CCR-Bench: A Comprehensive Benchmark for Evaluating LLMs on Complex Constraints, Control Flows, and Real-World Cases
di: Xue, Xiaona, et al.
Pubblicazione: (2026)
di: Xue, Xiaona, et al.
Pubblicazione: (2026)
ReasonAgain: Using Extractable Symbolic Programs to Evaluate Mathematical Reasoning
di: Yu, Xiaodong, et al.
Pubblicazione: (2024)
di: Yu, Xiaodong, et al.
Pubblicazione: (2024)
Faithful-First Reasoning, Planning, and Acting for Multimodal LLMs
di: Li, Junxian, et al.
Pubblicazione: (2025)
di: Li, Junxian, et al.
Pubblicazione: (2025)
InMind: Evaluating LLMs in Capturing and Applying Individual Human Reasoning Styles
di: Li, Zizhen, et al.
Pubblicazione: (2025)
di: Li, Zizhen, et al.
Pubblicazione: (2025)
MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs
di: Wang, Kevin, et al.
Pubblicazione: (2026)
di: Wang, Kevin, et al.
Pubblicazione: (2026)
Evidential Reasoning Advances Interpretable Real-World Disease Screening
di: Lian, Chenyu, et al.
Pubblicazione: (2026)
di: Lian, Chenyu, et al.
Pubblicazione: (2026)
On the Empirical Complexity of Reasoning and Planning in LLMs
di: Kang, Liwei, et al.
Pubblicazione: (2024)
di: Kang, Liwei, et al.
Pubblicazione: (2024)
Off-Trajectory Reasoning: Can LLMs Collaborate on Reasoning Trajectory?
di: Li, Aochong Oliver, et al.
Pubblicazione: (2025)
di: Li, Aochong Oliver, et al.
Pubblicazione: (2025)
LogReasoner: Empowering LLMs with Expert-like Coarse-to-Fine Reasoning for Automated Log Analysis
di: Ma, Lipeng, et al.
Pubblicazione: (2025)
di: Ma, Lipeng, et al.
Pubblicazione: (2025)
Navigating the Labyrinth: Evaluating LLMs' Ability to Reason About Search Problems
di: Borazjanizadeh, Nasim, et al.
Pubblicazione: (2024)
di: Borazjanizadeh, Nasim, et al.
Pubblicazione: (2024)
Documenti analoghi
-
seqBench: A Tunable Benchmark to Quantify Sequential Reasoning Limits of LLMs
di: Ramezanali, Mohammad, et al.
Pubblicazione: (2025) -
OpenEstimate: Evaluating LLMs on Reasoning Under Uncertainty with Real-World Data
di: Renda, Alana, et al.
Pubblicazione: (2025) -
Reasoning-CV: Fine-tuning Powerful Reasoning LLMs for Knowledge-Assisted Claim Verification
di: Zheng, Zhi, et al.
Pubblicazione: (2025) -
RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios
di: Zhou, Ruiwen, et al.
Pubblicazione: (2024) -
On the Role of Model Prior in Real-World Inductive Reasoning
di: Liu, Zhuo, et al.
Pubblicazione: (2024)