Saved in:
| Main Authors: | Monti, Sebastiano, Nicolini, Carlo, Pellegrini, Gianni, Staiano, Jacopo, Lepri, Bruno |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2601.20856 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
The Garden of Forking Paths: Observing Dynamic Parameters Distribution in Large Language Models
by: Nicolini, Carlo, et al.
Published: (2024)
by: Nicolini, Carlo, et al.
Published: (2024)
Hyperdimensional Probe: Decoding LLM Representations via Vector Symbolic Architectures
by: Bronzini, Marco, et al.
Published: (2025)
by: Bronzini, Marco, et al.
Published: (2025)
Unveiling LLMs: The Evolution of Latent Representations in a Dynamic Knowledge Graph
by: Bronzini, Marco, et al.
Published: (2024)
by: Bronzini, Marco, et al.
Published: (2024)
Glitter or Gold? Deriving Structured Insights from Sustainability Reports via Large Language Models
by: Bronzini, Marco, et al.
Published: (2023)
by: Bronzini, Marco, et al.
Published: (2023)
The LLM Wears Prada: Analysing Gender Bias and Stereotypes through Online Shopping Data
by: Luca, Massimiliano, et al.
Published: (2025)
by: Luca, Massimiliano, et al.
Published: (2025)
Hopfield Networks for Asset Allocation
by: Nicolini, Carlo, et al.
Published: (2024)
by: Nicolini, Carlo, et al.
Published: (2024)
I Want to Break Free! Persuasion and Anti-Social Behavior of LLMs in Multi-Agent Settings with Social Hierarchy
by: Campedelli, Gian Maria, et al.
Published: (2024)
by: Campedelli, Gian Maria, et al.
Published: (2024)
Graph Hierarchical Recurrence for Long-Range Generalization
by: Carotti, Stefano, et al.
Published: (2026)
by: Carotti, Stefano, et al.
Published: (2026)
HeroBench: A Benchmark for Long-Horizon Planning and Structured Reasoning in Virtual Worlds
by: Anokhin, Petr, et al.
Published: (2025)
by: Anokhin, Petr, et al.
Published: (2025)
Large Language Models are Zero-Shot Next Location Predictors
by: Beneduce, Ciro, et al.
Published: (2024)
by: Beneduce, Ciro, et al.
Published: (2024)
Can LLMs Correct Physicians, Yet? Investigating Effective Interaction Methods in the Medical Domain
by: Sayin, Burcu, et al.
Published: (2024)
by: Sayin, Burcu, et al.
Published: (2024)
Urban Safety Perception Through the Lens of Large Multimodal Models: A Persona-based Approach
by: Beneduce, Ciro, et al.
Published: (2025)
by: Beneduce, Ciro, et al.
Published: (2025)
CLR-Bench: Evaluating Large Language Models in College-level Reasoning
by: Dong, Junnan, et al.
Published: (2024)
by: Dong, Junnan, et al.
Published: (2024)
Translating Under Pressure: Domain-Aware LLMs for Crisis Communication
by: Castaldo, Antonio, et al.
Published: (2026)
by: Castaldo, Antonio, et al.
Published: (2026)
AMA-Bench: Evaluating Long-Horizon Memory for Agentic Applications
by: Zhao, Yujie, et al.
Published: (2026)
by: Zhao, Yujie, et al.
Published: (2026)
HorizonBench: Long-Horizon Personalization with Evolving Preferences
by: Li, Shuyue Stella, et al.
Published: (2026)
by: Li, Shuyue Stella, et al.
Published: (2026)
FCRF: Flexible Constructivism Reflection for Long-Horizon Robotic Task Planning with Large Language Models
by: Song, Yufan, et al.
Published: (2025)
by: Song, Yufan, et al.
Published: (2025)
$π$-Bench: Evaluating Proactive Personal Assistant Agents in Long-Horizon Workflows
by: Zhang, Haoran, et al.
Published: (2026)
by: Zhang, Haoran, et al.
Published: (2026)
EXPLORE-Bench: Egocentric Scene Prediction with Long-Horizon Reasoning
by: Yu, Chengjun, et al.
Published: (2026)
by: Yu, Chengjun, et al.
Published: (2026)
UrbanPlanBench: A Comprehensive Urban Planning Benchmark for Evaluating Large Language Models
by: Zheng, Yu, et al.
Published: (2025)
by: Zheng, Yu, et al.
Published: (2025)
LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks
by: Chandwani, Abhishek, et al.
Published: (2026)
by: Chandwani, Abhishek, et al.
Published: (2026)
On Training Large Language Models for Long-Horizon Tasks: An Empirical Study of Horizon Length
by: Kim, Sunghwan, et al.
Published: (2026)
by: Kim, Sunghwan, et al.
Published: (2026)
Reason-Plan-ReAct: A Reasoner-Planner Supervising a ReAct Executor for Complex Enterprise Tasks
by: Molinari, Gianni, et al.
Published: (2025)
by: Molinari, Gianni, et al.
Published: (2025)
LogicBench: Towards Systematic Evaluation of Logical Reasoning Ability of Large Language Models
by: Parmar, Mihir, et al.
Published: (2024)
by: Parmar, Mihir, et al.
Published: (2024)
TimeBench: A Comprehensive Evaluation of Temporal Reasoning Abilities in Large Language Models
by: Chu, Zheng, et al.
Published: (2023)
by: Chu, Zheng, et al.
Published: (2023)
RoadmapBench: Evaluating Long-Horizon Agentic Software Development Across Version Upgrades
by: Xu, Xinbo, et al.
Published: (2026)
by: Xu, Xinbo, et al.
Published: (2026)
ChemVTS-Bench: Evaluating Visual-Textual-Symbolic Reasoning of Multimodal Large Language Models in Chemistry
by: Huang, Zhiyuan, et al.
Published: (2025)
by: Huang, Zhiyuan, et al.
Published: (2025)
MinePlanner: A Benchmark for Long-Horizon Planning in Large Minecraft Worlds
by: Hill, William, et al.
Published: (2023)
by: Hill, William, et al.
Published: (2023)
LPS-Bench: Benchmarking Safety Awareness of Computer-Use Agents in Long-Horizon Planning under Benign and Adversarial Scenarios
by: Chen, Tianyu, et al.
Published: (2026)
by: Chen, Tianyu, et al.
Published: (2026)
LifeBench: A Benchmark for Long-Horizon Multi-Source Memory
by: Cheng, Zihao, et al.
Published: (2026)
by: Cheng, Zihao, et al.
Published: (2026)
KellyBench: A Benchmark for Long-Horizon Sequential Decision Making
by: Grady, Thomas, et al.
Published: (2026)
by: Grady, Thomas, et al.
Published: (2026)
Reflection-Bench: Evaluating Epistemic Agency in Large Language Models
by: Li, Lingyu, et al.
Published: (2024)
by: Li, Lingyu, et al.
Published: (2024)
Beyond Entangled Planning: Task-Decoupled Planning for Long-Horizon Agents
by: Li, Yunfan, et al.
Published: (2026)
by: Li, Yunfan, et al.
Published: (2026)
CubeBench: Diagnosing Interactive, Long-Horizon Spatial Reasoning Under Partial Observations
by: Gao, Huan-ang, et al.
Published: (2025)
by: Gao, Huan-ang, et al.
Published: (2025)
STRUCTUREDAGENT: Planning with AND/OR Trees for Long-Horizon Web Tasks
by: Lobo, ELita, et al.
Published: (2026)
by: Lobo, ELita, et al.
Published: (2026)
Reflective Planning: Vision-Language Models for Multi-Stage Long-Horizon Robotic Manipulation
by: Feng, Yunhai, et al.
Published: (2025)
by: Feng, Yunhai, et al.
Published: (2025)
EcoGym: Evaluating LLMs for Long-Horizon Plan-and-Execute in Interactive Economies
by: Hu, Xavier, et al.
Published: (2026)
by: Hu, Xavier, et al.
Published: (2026)
EsoLang-Bench: Evaluating Genuine Reasoning in Large Language Models via Esoteric Programming Languages
by: Sharma, Aman, et al.
Published: (2026)
by: Sharma, Aman, et al.
Published: (2026)
ItinBench: Benchmarking Planning Across Multiple Cognitive Dimensions with Large Language Models
by: Wang, Tianlong, et al.
Published: (2026)
by: Wang, Tianlong, et al.
Published: (2026)
PlanU: Large Language Model Reasoning through Planning under Uncertainty
by: Deng, Ziwei, et al.
Published: (2025)
by: Deng, Ziwei, et al.
Published: (2025)
Similar Items
-
The Garden of Forking Paths: Observing Dynamic Parameters Distribution in Large Language Models
by: Nicolini, Carlo, et al.
Published: (2024) -
Hyperdimensional Probe: Decoding LLM Representations via Vector Symbolic Architectures
by: Bronzini, Marco, et al.
Published: (2025) -
Unveiling LLMs: The Evolution of Latent Representations in a Dynamic Knowledge Graph
by: Bronzini, Marco, et al.
Published: (2024) -
Glitter or Gold? Deriving Structured Insights from Sustainability Reports via Large Language Models
by: Bronzini, Marco, et al.
Published: (2023) -
The LLM Wears Prada: Analysing Gender Bias and Stereotypes through Online Shopping Data
by: Luca, Massimiliano, et al.
Published: (2025)