USTBench: Benchmarking and Dissecting Spatiotemporal Reasoning of LLMs as Urban Agents
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lai, Siqi, Ning, Yansong, Yuan, Zirui, Chen, Zhixi, Liu, Hao |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
UrbanKGent: A Unified Large Language Model Agent Framework for Urban Knowledge Graph Construction
par: Ning, Yansong, et autres
Publié: (2024)
par: Ning, Yansong, et autres
Publié: (2024)
TrafficClaw: A Generalizable LLM Agent in the Unified Physical Environment for Urban Traffic Control
par: Lai, Siqi, et autres
Publié: (2026)
par: Lai, Siqi, et autres
Publié: (2026)
CoLLMLight: Cooperative Large Language Model Agents for Network-Wide Traffic Signal Control
par: Yuan, Zirui, et autres
Publié: (2025)
par: Yuan, Zirui, et autres
Publié: (2025)
Large Language Model Powered Intelligent Urban Agents: Concepts, Capabilities, and Applications
par: Han, Jindong, et autres
Publié: (2025)
par: Han, Jindong, et autres
Publié: (2025)
HRBench: Benchmarking and Understanding Thinking-Mode Switch Strategies in Hybrid-Reasoning LLMs
par: Ning, Yansong, et autres
Publié: (2026)
par: Ning, Yansong, et autres
Publié: (2026)
Are LLMs Capable of Data-based Statistical and Causal Reasoning? Benchmarking Advanced Quantitative Reasoning with Data
par: Liu, Xiao, et autres
Publié: (2024)
par: Liu, Xiao, et autres
Publié: (2024)
AgentBalance: Backbone-then-Topology Design for Cost-Effective Multi-Agent Systems under Budget Constraints
par: Cai, Shuowei, et autres
Publié: (2025)
par: Cai, Shuowei, et autres
Publié: (2025)
Agent-Omit: Adaptive Context Omission for Efficient LLM Agents
par: Ning, Yansong, et autres
Publié: (2026)
par: Ning, Yansong, et autres
Publié: (2026)
RefTool: Reference-Guided Tool Creation for Knowledge-Intensive Reasoning
par: Liu, Xiao, et autres
Publié: (2025)
par: Liu, Xiao, et autres
Publié: (2025)
Benchmarking Spatiotemporal Reasoning in LLMs and Reasoning Models: Capabilities and Challenges
par: Quan, Pengrui, et autres
Publié: (2025)
par: Quan, Pengrui, et autres
Publié: (2025)
Strategy-Aware Optimization Modeling with Reasoning LLMs
par: Zhao, Ruiqing, et autres
Publié: (2026)
par: Zhao, Ruiqing, et autres
Publié: (2026)
Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning
par: Ning, Yansong, et autres
Publié: (2025)
par: Ning, Yansong, et autres
Publié: (2025)
LLMLight: Large Language Models as Traffic Signal Control Agents
par: Lai, Siqi, et autres
Publié: (2023)
par: Lai, Siqi, et autres
Publié: (2023)
CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts
par: Lin, Jiuheng, et autres
Publié: (2025)
par: Lin, Jiuheng, et autres
Publié: (2025)
Dissecting Tool-Integrated Reasoning: An Empirical Study and Analysis
par: Zhao, Yufeng, et autres
Publié: (2025)
par: Zhao, Yufeng, et autres
Publié: (2025)
Beyond Accuracy: Dissecting Mathematical Reasoning for LLMs Under Reinforcement Learning
par: Wang, Jiayu, et autres
Publié: (2025)
par: Wang, Jiayu, et autres
Publié: (2025)
Strat-Reasoner: Reinforcing Strategic Reasoning of LLMs in Multi-Agent Games
par: He, Yidong, et autres
Publié: (2026)
par: He, Yidong, et autres
Publié: (2026)
Dissecting Role Cognition in Medical LLMs via Neuronal Ablation
par: Liang, Xun, et autres
Publié: (2025)
par: Liang, Xun, et autres
Publié: (2025)
STAR: Failure-Aware Markovian Routing for Multi-Agent Spatiotemporal Reasoning
par: Yang, Ruiyi, et autres
Publié: (2026)
par: Yang, Ruiyi, et autres
Publié: (2026)
Are Your Reasoning Models Reasoning or Guessing? A Mechanistic Analysis of Hierarchical Reasoning Models
par: Ren, Zirui, et autres
Publié: (2026)
par: Ren, Zirui, et autres
Publié: (2026)
What Defines Good Reasoning in LLMs? Dissecting Reasoning Steps with Multi-Aspect Evaluation
par: Do, Heejin, et autres
Publié: (2025)
par: Do, Heejin, et autres
Publié: (2025)
DeepTravel: An End-to-End Agentic Reinforcement Learning Framework for Autonomous Travel Planning Agents
par: Ning, Yansong, et autres
Publié: (2025)
par: Ning, Yansong, et autres
Publié: (2025)
On the Empirical Complexity of Reasoning and Planning in LLMs
par: Kang, Liwei, et autres
Publié: (2024)
par: Kang, Liwei, et autres
Publié: (2024)
SafeRBench: Dissecting the Reasoning Safety of Large Language Models
par: Gao, Xin, et autres
Publié: (2025)
par: Gao, Xin, et autres
Publié: (2025)
Flow of Reasoning: Training LLMs for Divergent Reasoning with Minimal Examples
par: Yu, Fangxu, et autres
Publié: (2024)
par: Yu, Fangxu, et autres
Publié: (2024)
PaperArena: An Evaluation Benchmark for Tool-Augmented Agentic Reasoning on Scientific Literature
par: Wang, Daoyu, et autres
Publié: (2025)
par: Wang, Daoyu, et autres
Publié: (2025)
ORIGAMISPACE: Benchmarking Multimodal LLMs in Multi-Step Spatial Reasoning with Mathematical Constraints
par: Xu, Rui, et autres
Publié: (2025)
par: Xu, Rui, et autres
Publié: (2025)
An LLM-Powered Cooperative Framework for Large-Scale Multi-Vehicle Navigation
par: Zhou, Yuping, et autres
Publié: (2025)
par: Zhou, Yuping, et autres
Publié: (2025)
LLMSense: Harnessing LLMs for High-level Reasoning Over Spatiotemporal Sensor Traces
par: Ouyang, Xiaomin, et autres
Publié: (2024)
par: Ouyang, Xiaomin, et autres
Publié: (2024)
AgentSense: LLMs Empower Generalizable and Explainable Web-Based Participatory Urban Sensing
par: Guo, Xusen, et autres
Publié: (2025)
par: Guo, Xusen, et autres
Publié: (2025)
GeoGramBench: Benchmarking the Geometric Program Reasoning in Modern LLMs
par: Luo, Shixian, et autres
Publié: (2025)
par: Luo, Shixian, et autres
Publié: (2025)
HiBench: Benchmarking LLMs Capability on Hierarchical Structure Reasoning
par: Jiang, Zhuohang, et autres
Publié: (2025)
par: Jiang, Zhuohang, et autres
Publié: (2025)
HugAgent: Benchmarking LLMs for Simulation of Individualized Human Reasoning
par: Li, Chance Jiajie, et autres
Publié: (2025)
par: Li, Chance Jiajie, et autres
Publié: (2025)
Retro*: Optimizing LLMs for Reasoning-Intensive Document Retrieval
par: Lan, Junwei, et autres
Publié: (2025)
par: Lan, Junwei, et autres
Publié: (2025)
Under the Shadow of Babel: How Language Shapes Reasoning in LLMs
par: Wang, Chenxi, et autres
Publié: (2025)
par: Wang, Chenxi, et autres
Publié: (2025)
InterveneBench: Benchmarking LLMs for Intervention Reasoning and Causal Study Design in Real Social Systems
par: Shi, Shaojie, et autres
Publié: (2026)
par: Shi, Shaojie, et autres
Publié: (2026)
FeynmanBench: Benchmarking Multimodal LLMs on Diagrammatic Physics Reasoning
par: Wang, Zeyu, et autres
Publié: (2026)
par: Wang, Zeyu, et autres
Publié: (2026)
MARSHAL: Incentivizing Multi-Agent Reasoning via Self-Play with Strategic LLMs
par: Yuan, Huining, et autres
Publié: (2025)
par: Yuan, Huining, et autres
Publié: (2025)
Scaling, Benchmarking, and Reasoning of Vision-Language Agents for Mobile GUI Navigation
par: Qu, Heng, et autres
Publié: (2026)
par: Qu, Heng, et autres
Publié: (2026)
The Language Barrier: Dissecting Safety Challenges of LLMs in Multilingual Contexts
par: Shen, Lingfeng, et autres
Publié: (2024)
par: Shen, Lingfeng, et autres
Publié: (2024)
Documents similaires
-
UrbanKGent: A Unified Large Language Model Agent Framework for Urban Knowledge Graph Construction
par: Ning, Yansong, et autres
Publié: (2024) -
TrafficClaw: A Generalizable LLM Agent in the Unified Physical Environment for Urban Traffic Control
par: Lai, Siqi, et autres
Publié: (2026) -
CoLLMLight: Cooperative Large Language Model Agents for Network-Wide Traffic Signal Control
par: Yuan, Zirui, et autres
Publié: (2025) -
Large Language Model Powered Intelligent Urban Agents: Concepts, Capabilities, and Applications
par: Han, Jindong, et autres
Publié: (2025) -
HRBench: Benchmarking and Understanding Thinking-Mode Switch Strategies in Hybrid-Reasoning LLMs
par: Ning, Yansong, et autres
Publié: (2026)