TCP: a Benchmark for Temporal Constraint-Based Planning
Fuente:
arXiv
Guardado en:
| Autores principales: | Ding, Zifeng, Yan, Sikuan, Yuan, Zhangdie, Hu, Xianglong, Lin, Fangru, Vlachos, Andreas |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
FOReCAst: The Future Outcome Reasoning and Confidence Assessment Benchmark
por: Yuan, Zhangdie, et al.
Publicado: (2025)
por: Yuan, Zhangdie, et al.
Publicado: (2025)
Do Language Models Update their Forecasts with New Information?
por: Yuan, Zhangdie, et al.
Publicado: (2025)
por: Yuan, Zhangdie, et al.
Publicado: (2025)
Self-Exploring Language Models for Explainable Link Forecasting on Temporal Graphs via Reinforcement Learning
por: Ding, Zifeng, et al.
Publicado: (2025)
por: Ding, Zifeng, et al.
Publicado: (2025)
Reasoning Compression with Mixed-Policy Distillation
por: Yang, Han, et al.
Publicado: (2026)
por: Yang, Han, et al.
Publicado: (2026)
Capturing Symmetry and Antisymmetry in Language Models through Symmetry-Aware Training Objectives
por: Yuan, Zhangdie, et al.
Publicado: (2025)
por: Yuan, Zhangdie, et al.
Publicado: (2025)
Multimodal Claim Extraction for Fact-Checking
por: Teo, Joycelyn, et al.
Publicado: (2026)
por: Teo, Joycelyn, et al.
Publicado: (2026)
Language Models as Hierarchy Encoders
por: He, Yuan, et al.
Publicado: (2024)
por: He, Yuan, et al.
Publicado: (2024)
LexiCon: a Benchmark for Planning under Temporal Constraints in Natural Language
por: Mantenoglou, Periklis, et al.
Publicado: (2025)
por: Mantenoglou, Periklis, et al.
Publicado: (2025)
Temporal Fact Reasoning over Hyper-Relational Knowledge Graphs
por: Ding, Zifeng, et al.
Publicado: (2023)
por: Ding, Zifeng, et al.
Publicado: (2023)
Conflict Detection for Temporal Knowledge Graphs:A Fast Constraint Mining Algorithm and New Benchmarks
por: Chen, Jianhao, et al.
Publicado: (2023)
por: Chen, Jianhao, et al.
Publicado: (2023)
DeepPlanning: Benchmarking Long-Horizon Agentic Planning with Verifiable Constraints
por: Zhang, Yinger, et al.
Publicado: (2026)
por: Zhang, Yinger, et al.
Publicado: (2026)
Graph-enhanced Large Language Models in Asynchronous Plan Reasoning
por: Lin, Fangru, et al.
Publicado: (2024)
por: Lin, Fangru, et al.
Publicado: (2024)
A Framework for Benchmarking and Aligning Task-Planning Safety in LLM-Based Embodied Agents
por: Huang, Yuting, et al.
Publicado: (2025)
por: Huang, Yuting, et al.
Publicado: (2025)
Mitigating Shortcut Learning with InterpoLated Learning
por: Korakakis, Michalis, et al.
Publicado: (2025)
por: Korakakis, Michalis, et al.
Publicado: (2025)
ALVIN: Active Learning Via INterpolation
por: Korakakis, Michalis, et al.
Publicado: (2024)
por: Korakakis, Michalis, et al.
Publicado: (2024)
Routing-Free Mixture-of-Experts
por: Liu, Yilun, et al.
Publicado: (2026)
por: Liu, Yilun, et al.
Publicado: (2026)
Can Knowledge Graphs Make Large Language Models More Trustworthy? An Empirical Study Over Open-ended Question Answering
por: Sui, Yuan, et al.
Publicado: (2024)
por: Sui, Yuan, et al.
Publicado: (2024)
Wide-Horizon Thinking and Simulation-Based Evaluation for Real-World LLM Planning with Multifaceted Constraints
por: Yang, Dongjie, et al.
Publicado: (2025)
por: Yang, Dongjie, et al.
Publicado: (2025)
DyGMamba: Efficiently Modeling Long-Term Temporal Dependency on Continuous-Time Dynamic Graphs with State Space Models
por: Ding, Zifeng, et al.
Publicado: (2024)
por: Ding, Zifeng, et al.
Publicado: (2024)
An LLM Feature-based Framework for Dialogue Constructiveness Assessment
por: Zhou, Lexin, et al.
Publicado: (2024)
por: Zhou, Lexin, et al.
Publicado: (2024)
WeatherReasonSeg: A Benchmark for Weather-Aware Reasoning Segmentation in Visual Language Models
por: Du, Wanjun, et al.
Publicado: (2026)
por: Du, Wanjun, et al.
Publicado: (2026)
BioDSA-1K: Benchmarking Data Science Agents for Biomedical Research
por: Wang, Zifeng, et al.
Publicado: (2025)
por: Wang, Zifeng, et al.
Publicado: (2025)
Segment-Level Diffusion: A Framework for Controllable Long-Form Generation with Diffusion Language Models
por: Zhu, Xiaochen, et al.
Publicado: (2024)
por: Zhu, Xiaochen, et al.
Publicado: (2024)
TCP-MCP: Landscape-Guided Co-Evolution of Prompts and Communication Topologies for Multi-Agent Systems
por: Ding, Yi, et al.
Publicado: (2026)
por: Ding, Yi, et al.
Publicado: (2026)
A Survey of Deep Learning: From Activations to Transformers
por: Schneider, Johannes, et al.
Publicado: (2023)
por: Schneider, Johannes, et al.
Publicado: (2023)
Reflective-Net: Learning from Explanations
por: Schneider, Johannes, et al.
Publicado: (2020)
por: Schneider, Johannes, et al.
Publicado: (2020)
The Role of Ambiguity in Error Prediction via Uncertainty Quantification
por: Staliūnaitė, Ieva Raminta, et al.
Publicado: (2026)
por: Staliūnaitė, Ieva Raminta, et al.
Publicado: (2026)
ET-Plan-Bench: Embodied Task-level Planning Benchmark Towards Spatial-Temporal Cognition with Foundation Models
por: Zhang, Lingfeng, et al.
Publicado: (2024)
por: Zhang, Lingfeng, et al.
Publicado: (2024)
Optimal Task Assignment and Path Planning using Conflict-Based Search with Precedence and Temporal Constraints
por: Chong, Yu Quan, et al.
Publicado: (2024)
por: Chong, Yu Quan, et al.
Publicado: (2024)
Ask-before-Plan: Proactive Language Agents for Real-World Planning
por: Zhang, Xuan, et al.
Publicado: (2024)
por: Zhang, Xuan, et al.
Publicado: (2024)
Ev2R: Evaluating Evidence Retrieval in Automated Fact-Checking
por: Akhtar, Mubashara, et al.
Publicado: (2024)
por: Akhtar, Mubashara, et al.
Publicado: (2024)
Open-Vocabulary Spatio-Temporal Scene Graph for Robot Perception and Teleoperation Planning
por: Wang, Yi, et al.
Publicado: (2025)
por: Wang, Yi, et al.
Publicado: (2025)
ConstraintBench: Benchmarking LLM Constraint Reasoning on Direct Optimization
por: Tso, Joseph, et al.
Publicado: (2026)
por: Tso, Joseph, et al.
Publicado: (2026)
TripCraft: A Benchmark for Spatio-Temporally Fine Grained Travel Planning
por: Chaudhuri, Soumyabrata, et al.
Publicado: (2025)
por: Chaudhuri, Soumyabrata, et al.
Publicado: (2025)
MATEO: A Multimodal Benchmark for Temporal Reasoning and Planning in LVLMs
por: Roccabruna, Gabriel, et al.
Publicado: (2026)
por: Roccabruna, Gabriel, et al.
Publicado: (2026)
Predicate-Conditional Conformalized Answer Sets for Knowledge Graph Embeddings
por: Zhu, Yuqicheng, et al.
Publicado: (2025)
por: Zhu, Yuqicheng, et al.
Publicado: (2025)
Temporal Numeric Planning with Patterns
por: Cardellini, Matteo, et al.
Publicado: (2024)
por: Cardellini, Matteo, et al.
Publicado: (2024)
PRobELM: Plausibility Ranking Evaluation for Language Models
por: Yuan, Zhangdie, et al.
Publicado: (2024)
por: Yuan, Zhangdie, et al.
Publicado: (2024)
Token Masking Improves Transformer-Based Text Classification
por: Xu, Xianglong, et al.
Publicado: (2025)
por: Xu, Xianglong, et al.
Publicado: (2025)
Generating Counterfactual Explanations Under Temporal Constraints
por: Buliga, Andrei, et al.
Publicado: (2025)
por: Buliga, Andrei, et al.
Publicado: (2025)
Ejemplares similares
-
FOReCAst: The Future Outcome Reasoning and Confidence Assessment Benchmark
por: Yuan, Zhangdie, et al.
Publicado: (2025) -
Do Language Models Update their Forecasts with New Information?
por: Yuan, Zhangdie, et al.
Publicado: (2025) -
Self-Exploring Language Models for Explainable Link Forecasting on Temporal Graphs via Reinforcement Learning
por: Ding, Zifeng, et al.
Publicado: (2025) -
Reasoning Compression with Mixed-Policy Distillation
por: Yang, Han, et al.
Publicado: (2026) -
Capturing Symmetry and Antisymmetry in Language Models through Symmetry-Aware Training Objectives
por: Yuan, Zhangdie, et al.
Publicado: (2025)