Salvato in:
| Autori principali: | Xie, Jian, Zhang, Kai, Chen, Jiangjie, Zhu, Tinghui, Lou, Renze, Tian, Yuandong, Xiao, Yanghua, Su, Yu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2402.01622 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Flex-TravelPlanner: A Benchmark for Flexible Planning with Language Agents
di: Oh, Juhyun, et al.
Pubblicazione: (2025)
di: Oh, Juhyun, et al.
Pubblicazione: (2025)
Adaptive Chameleon or Stubborn Sloth: Revealing the Behavior of Large Language Models in Knowledge Conflicts
di: Xie, Jian, et al.
Pubblicazione: (2023)
di: Xie, Jian, et al.
Pubblicazione: (2023)
How Easily do Irrelevant Inputs Skew the Responses of Large Language Models?
di: Wu, Siye, et al.
Pubblicazione: (2024)
di: Wu, Siye, et al.
Pubblicazione: (2024)
TravelAgent: An AI Assistant for Personalized Travel Planning
di: Chen, Aili, et al.
Pubblicazione: (2024)
di: Chen, Aili, et al.
Pubblicazione: (2024)
Revealing the Barriers of Language Agents in Planning
di: Xie, Jian, et al.
Pubblicazione: (2024)
di: Xie, Jian, et al.
Pubblicazione: (2024)
Can LLMs Learn to Map the World from Local Descriptions?
di: Xia, Sirui, et al.
Pubblicazione: (2025)
di: Xia, Sirui, et al.
Pubblicazione: (2025)
Enhancing Language Agent Strategic Reasoning through Self-Play in Adversarial Games
di: Zhang, Yikai, et al.
Pubblicazione: (2025)
di: Zhang, Yikai, et al.
Pubblicazione: (2025)
Deductive Beam Search: Decoding Deducible Rationale for Chain-of-Thought Reasoning
di: Zhu, Tinghui, et al.
Pubblicazione: (2024)
di: Zhu, Tinghui, et al.
Pubblicazione: (2024)
MCiteBench: A Multimodal Benchmark for Generating Text with Citations
di: Hu, Caiyu, et al.
Pubblicazione: (2025)
di: Hu, Caiyu, et al.
Pubblicazione: (2025)
Can We Rely on LLM Agents to Draft Long-Horizon Plans? Let's Take TravelPlanner as an Example
di: Chen, Yanan, et al.
Pubblicazione: (2024)
di: Chen, Yanan, et al.
Pubblicazione: (2024)
Large Language Model Instruction Following: A Survey of Progresses and Challenges
di: Lou, Renze, et al.
Pubblicazione: (2023)
di: Lou, Renze, et al.
Pubblicazione: (2023)
TimeArena: Shaping Efficient Multitasking Language Agents in a Time-Aware Simulation
di: Zhang, Yikai, et al.
Pubblicazione: (2024)
di: Zhang, Yikai, et al.
Pubblicazione: (2024)
From Persona to Personalization: A Survey on Role-Playing Language Agents
di: Chen, Jiangjie, et al.
Pubblicazione: (2024)
di: Chen, Jiangjie, et al.
Pubblicazione: (2024)
ARIA: Training Language Agents with Intention-Driven Reward Aggregation
di: Yang, Ruihan, et al.
Pubblicazione: (2025)
di: Yang, Ruihan, et al.
Pubblicazione: (2025)
The Model Agreed, But Didn't Learn: Diagnosing Surface Compliance in Large Language Models
di: Gu, Xiaojie, et al.
Pubblicazione: (2026)
di: Gu, Xiaojie, et al.
Pubblicazione: (2026)
ChinaTravel: An Open-Ended Travel Planning Benchmark with Compositional Constraint Validation for Language Agents
di: Shao, Jie-Jing, et al.
Pubblicazione: (2024)
di: Shao, Jie-Jing, et al.
Pubblicazione: (2024)
GumbelSoft: Diversified Language Model Watermarking via the GumbelMax-trick
di: Fu, Jiayi, et al.
Pubblicazione: (2024)
di: Fu, Jiayi, et al.
Pubblicazione: (2024)
Toward Zero-Shot Instruction Following
di: Lou, Renze, et al.
Pubblicazione: (2023)
di: Lou, Renze, et al.
Pubblicazione: (2023)
SelfGoal: Your Language Agents Already Know How to Achieve High-level Goals
di: Yang, Ruihan, et al.
Pubblicazione: (2024)
di: Yang, Ruihan, et al.
Pubblicazione: (2024)
MUFFIN: Curating Multi-Faceted Instructions for Improving Instruction-Following
di: Lou, Renze, et al.
Pubblicazione: (2023)
di: Lou, Renze, et al.
Pubblicazione: (2023)
Is Extending Modality The Right Path Towards Omni-Modality?
di: Zhu, Tinghui, et al.
Pubblicazione: (2025)
di: Zhu, Tinghui, et al.
Pubblicazione: (2025)
ANALOGYKB: Unlocking Analogical Reasoning of Language Models with A Million-scale Knowledge Base
di: Yuan, Siyu, et al.
Pubblicazione: (2023)
di: Yuan, Siyu, et al.
Pubblicazione: (2023)
Piecing Together Clues: A Benchmark for Evaluating the Detective Skills of Large Language Models
di: Gu, Zhouhong, et al.
Pubblicazione: (2023)
di: Gu, Zhouhong, et al.
Pubblicazione: (2023)
ATLAS: Constraints-Aware Multi-Agent Collaboration for Real-World Travel Planning
di: Choi, Jihye, et al.
Pubblicazione: (2025)
di: Choi, Jihye, et al.
Pubblicazione: (2025)
To the Globe (TTG): Towards Language-Driven Guaranteed Travel Planning
di: JU, Da, et al.
Pubblicazione: (2024)
di: JU, Da, et al.
Pubblicazione: (2024)
ARM: Adaptive Reasoning Model
di: Wu, Siye, et al.
Pubblicazione: (2025)
di: Wu, Siye, et al.
Pubblicazione: (2025)
WorldTravel: A Realistic Multimodal Travel-Planning Benchmark with Tightly Coupled Constraints
di: Wang, Zexuan, et al.
Pubblicazione: (2026)
di: Wang, Zexuan, et al.
Pubblicazione: (2026)
Towards Full Delegation: Designing Ideal Agentic Behaviors for Travel Planning
di: Jiang, Song, et al.
Pubblicazione: (2024)
di: Jiang, Song, et al.
Pubblicazione: (2024)
SurveyAgent: A Conversational System for Personalized and Efficient Research Survey
di: Wang, Xintao, et al.
Pubblicazione: (2024)
di: Wang, Xintao, et al.
Pubblicazione: (2024)
TP-RAG: Benchmarking Retrieval-Augmented Large Language Model Agents for Spatiotemporal-Aware Travel Planning
di: Ni, Hang, et al.
Pubblicazione: (2025)
di: Ni, Hang, et al.
Pubblicazione: (2025)
GroupTravelBench: Benchmarking LLM Agents on Multi-Person Travel Planning
di: Cheng, Xiang, et al.
Pubblicazione: (2026)
di: Cheng, Xiang, et al.
Pubblicazione: (2026)
Past Meets Present: Creating Historical Analogy with Large Language Models
di: Li, Nianqi, et al.
Pubblicazione: (2024)
di: Li, Nianqi, et al.
Pubblicazione: (2024)
BookWorld: From Novels to Interactive Agent Societies for Creative Story Generation
di: Ran, Yiting, et al.
Pubblicazione: (2025)
di: Ran, Yiting, et al.
Pubblicazione: (2025)
Self-Reflection in LLM Agents: Effects on Problem-Solving Performance
di: Renze, Matthew, et al.
Pubblicazione: (2024)
di: Renze, Matthew, et al.
Pubblicazione: (2024)
Recent Advancement of Emotion Cognition in Large Language Models
di: Chen, Yuyan, et al.
Pubblicazione: (2024)
di: Chen, Yuyan, et al.
Pubblicazione: (2024)
DetectBench: Can Large Language Model Detect and Piece Together Implicit Evidence?
di: Gu, Zhouhong, et al.
Pubblicazione: (2024)
di: Gu, Zhouhong, et al.
Pubblicazione: (2024)
CODA: Difficulty-Aware Compute Allocation for Adaptive Reasoning
di: Wu, Siye, et al.
Pubblicazione: (2026)
di: Wu, Siye, et al.
Pubblicazione: (2026)
The Effect of Sampling Temperature on Problem Solving in Large Language Models
di: Renze, Matthew, et al.
Pubblicazione: (2024)
di: Renze, Matthew, et al.
Pubblicazione: (2024)
Ask-before-Plan: Proactive Language Agents for Real-World Planning
di: Zhang, Xuan, et al.
Pubblicazione: (2024)
di: Zhang, Xuan, et al.
Pubblicazione: (2024)
Curse of Knowledge: When Complex Evaluation Context Benefits yet Biases LLM Judges
di: Li, Weiyuan, et al.
Pubblicazione: (2025)
di: Li, Weiyuan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Flex-TravelPlanner: A Benchmark for Flexible Planning with Language Agents
di: Oh, Juhyun, et al.
Pubblicazione: (2025) -
Adaptive Chameleon or Stubborn Sloth: Revealing the Behavior of Large Language Models in Knowledge Conflicts
di: Xie, Jian, et al.
Pubblicazione: (2023) -
How Easily do Irrelevant Inputs Skew the Responses of Large Language Models?
di: Wu, Siye, et al.
Pubblicazione: (2024) -
TravelAgent: An AI Assistant for Personalized Travel Planning
di: Chen, Aili, et al.
Pubblicazione: (2024) -
Revealing the Barriers of Language Agents in Planning
di: Xie, Jian, et al.
Pubblicazione: (2024)