Wide-Horizon Thinking and Simulation-Based Evaluation for Real-World LLM Planning with Multifaceted Constraints
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Dongjie, Lu, Chengqiang, Wang, Qimeng, Ma, Xinbei, Gao, Yan, Hu, Yao, Zhao, Hai |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
How Deep is Love in LLMs' Hearts? Exploring Semantic Size in Human-like Cognition
por: Yao, Yao, et al.
Publicado: (2025)
por: Yao, Yao, et al.
Publicado: (2025)
RealBench: A Chinese Multi-image Understanding Benchmark Close to Real-world Scenarios
por: Zhao, Fei, et al.
Publicado: (2025)
por: Zhao, Fei, et al.
Publicado: (2025)
CoCo-Agent: A Comprehensive Cognitive MLLM Agent for Smartphone GUI Automation
por: Ma, Xinbei, et al.
Publicado: (2024)
por: Ma, Xinbei, et al.
Publicado: (2024)
PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM Inference
por: Yang, Dongjie, et al.
Publicado: (2024)
por: Yang, Dongjie, et al.
Publicado: (2024)
Caution for the Environment: Multimodal LLM Agents are Susceptible to Environmental Distractions
por: Ma, Xinbei, et al.
Publicado: (2024)
por: Ma, Xinbei, et al.
Publicado: (2024)
Aligning Large Language Models with Searcher Preferences
por: Wu, Wei, et al.
Publicado: (2026)
por: Wu, Wei, et al.
Publicado: (2026)
LESA: Learnable LLM Layer Scaling-Up
por: Yang, Yifei, et al.
Publicado: (2025)
por: Yang, Yifei, et al.
Publicado: (2025)
RAG-IGBench: Innovative Evaluation for RAG-based Interleaved Generation in Open-domain Question Answering
por: Zhang, Rongyang, et al.
Publicado: (2025)
por: Zhang, Rongyang, et al.
Publicado: (2025)
Textual-to-Visual Iterative Self-Verification for Slide Generation
por: Xu, Yunqing, et al.
Publicado: (2025)
por: Xu, Yunqing, et al.
Publicado: (2025)
Anti-Length Shift: Dynamic Outlier Truncation for Training Efficient Reasoning Models
por: Wu, Wei, et al.
Publicado: (2026)
por: Wu, Wei, et al.
Publicado: (2026)
MoDification: Mixture of Depths Made Easy
por: Zhang, Chen, et al.
Publicado: (2024)
por: Zhang, Chen, et al.
Publicado: (2024)
Are LLMs Aware that Some Questions are not Open-ended?
por: Yang, Dongjie, et al.
Publicado: (2024)
por: Yang, Dongjie, et al.
Publicado: (2024)
PROM: A Phrase-level Copying Mechanism with Pre-training for Abstractive Summarization
por: Ma, Xinbei, et al.
Publicado: (2023)
por: Ma, Xinbei, et al.
Publicado: (2023)
PGPO: Enhancing Agent Reasoning via Pseudocode-style Planning Guided Preference Optimization
por: Cao, Zouying, et al.
Publicado: (2025)
por: Cao, Zouying, et al.
Publicado: (2025)
SelfAug: Mitigating Catastrophic Forgetting in Retrieval-Augmented Generation via Distribution Self-Alignment
por: Huang, Yuqing, et al.
Publicado: (2025)
por: Huang, Yuqing, et al.
Publicado: (2025)
Vript: A Video Is Worth Thousands of Words
por: Yang, Dongjie, et al.
Publicado: (2024)
por: Yang, Dongjie, et al.
Publicado: (2024)
EdgeFlowerTune: Evaluating Federated LLM Fine-Tuning Under Realistic Edge System Constraints
por: Geng, Jiaxiang, et al.
Publicado: (2026)
por: Geng, Jiaxiang, et al.
Publicado: (2026)
WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation
por: Ding, Shuangrui, et al.
Publicado: (2026)
por: Ding, Shuangrui, et al.
Publicado: (2026)
BriLLM: Brain-inspired Large Language Model
por: Zhao, Hai, et al.
Publicado: (2025)
por: Zhao, Hai, et al.
Publicado: (2025)
SituatedThinker: Grounding LLM Reasoning with Real-World through Situated Thinking
por: Liu, Junnan, et al.
Publicado: (2025)
por: Liu, Junnan, et al.
Publicado: (2025)
MEGen: Generative Backdoor into Large Language Models via Model Editing
por: Qiu, Jiyang, et al.
Publicado: (2024)
por: Qiu, Jiyang, et al.
Publicado: (2024)
SirLLM: Streaming Infinite Retentive LLM
por: Yao, Yao, et al.
Publicado: (2024)
por: Yao, Yao, et al.
Publicado: (2024)
Plan-over-Graph: Towards Parallelable LLM Agent Schedule
por: Zhang, Shiqi, et al.
Publicado: (2025)
por: Zhang, Shiqi, et al.
Publicado: (2025)
Learning to Plan & Reason for Evaluation with Thinking-LLM-as-a-Judge
por: Saha, Swarnadeep, et al.
Publicado: (2025)
por: Saha, Swarnadeep, et al.
Publicado: (2025)
GKT: A Novel Guidance-Based Knowledge Transfer Framework For Efficient Cloud-edge Collaboration LLM Deployment
por: Yao, Yao, et al.
Publicado: (2024)
por: Yao, Yao, et al.
Publicado: (2024)
Can LLM Agents Generate Real-World Evidence? Evaluating Observational Studies in Medical Databases
por: Li, Dubai, et al.
Publicado: (2026)
por: Li, Dubai, et al.
Publicado: (2026)
DeepPlanning: Benchmarking Long-Horizon Agentic Planning with Verifiable Constraints
por: Zhang, Yinger, et al.
Publicado: (2026)
por: Zhang, Yinger, et al.
Publicado: (2026)
Benchmarking Large Language Models for Conversational Question Answering in Multi-instructional Documents
por: Wu, Shiwei, et al.
Publicado: (2024)
por: Wu, Shiwei, et al.
Publicado: (2024)
Thinking by Subtraction: Confidence-Driven Contrastive Decoding for LLM Reasoning
por: Tang, Lexiang, et al.
Publicado: (2026)
por: Tang, Lexiang, et al.
Publicado: (2026)
MultifacetEval: Multifaceted Evaluation to Probe LLMs in Mastering Medical Knowledge
por: Zhou, Yuxuan, et al.
Publicado: (2024)
por: Zhou, Yuxuan, et al.
Publicado: (2024)
On the Robustness of Editing Large Language Models
por: Ma, Xinbei, et al.
Publicado: (2024)
por: Ma, Xinbei, et al.
Publicado: (2024)
Flooding Spread of Manipulated Knowledge in LLM-Based Multi-Agent Communities
por: Ju, Tianjie, et al.
Publicado: (2024)
por: Ju, Tianjie, et al.
Publicado: (2024)
ATLAS: Constraints-Aware Multi-Agent Collaboration for Real-World Travel Planning
por: Choi, Jihye, et al.
Publicado: (2025)
por: Choi, Jihye, et al.
Publicado: (2025)
SocioVerse: A World Model for Social Simulation Powered by LLM Agents and A Pool of 10 Million Real-World Users
por: Zhang, Xinnong, et al.
Publicado: (2025)
por: Zhang, Xinnong, et al.
Publicado: (2025)
Exploring the Multilingual NLG Evaluation Abilities of LLM-Based Evaluators
por: Chang, Jiayi, et al.
Publicado: (2025)
por: Chang, Jiayi, et al.
Publicado: (2025)
PAN: A World Model for General, Interactable, and Long-Horizon World Simulation
por: PAN Team, et al.
Publicado: (2025)
por: PAN Team, et al.
Publicado: (2025)
AI Agents for Conversational Patient Triage: Preliminary Simulation-Based Evaluation with Real-World EHR Data
por: Rashidian, Sina, et al.
Publicado: (2025)
por: Rashidian, Sina, et al.
Publicado: (2025)
EcoGym: Evaluating LLMs for Long-Horizon Plan-and-Execute in Interactive Economies
por: Hu, Xavier, et al.
Publicado: (2026)
por: Hu, Xavier, et al.
Publicado: (2026)
Beyond Perfect APIs: A Comprehensive Evaluation of LLM Agents Under Real-World API Complexity
por: Kim, Doyoung, et al.
Publicado: (2026)
por: Kim, Doyoung, et al.
Publicado: (2026)
DSAEval: Evaluating Data Science Agents on a Wide Range of Real-World Data Science Problems
por: Sun, Maojun, et al.
Publicado: (2026)
por: Sun, Maojun, et al.
Publicado: (2026)
Ejemplares similares
-
How Deep is Love in LLMs' Hearts? Exploring Semantic Size in Human-like Cognition
por: Yao, Yao, et al.
Publicado: (2025) -
RealBench: A Chinese Multi-image Understanding Benchmark Close to Real-world Scenarios
por: Zhao, Fei, et al.
Publicado: (2025) -
CoCo-Agent: A Comprehensive Cognitive MLLM Agent for Smartphone GUI Automation
por: Ma, Xinbei, et al.
Publicado: (2024) -
PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM Inference
por: Yang, Dongjie, et al.
Publicado: (2024) -
Caution for the Environment: Multimodal LLM Agents are Susceptible to Environmental Distractions
por: Ma, Xinbei, et al.
Publicado: (2024)