TripCraft: A Benchmark for Spatio-Temporally Fine Grained Travel Planning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chaudhuri, Soumyabrata, Purkar, Pranav, Raghav, Ritwik, Mallick, Shubhojit, Gupta, Manish, Jana, Abhik, Ghosh, Shreya |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
TripTide: A Benchmark for Adaptive Travel Planning under Disruptions
par: Karmakar, Priyanshu, et autres
Publié: (2025)
par: Karmakar, Priyanshu, et autres
Publié: (2025)
A Spatio-Temporal Point Process for Fine-Grained Modeling of Reading Behavior
par: Re, Francesco Ignazio, et autres
Publié: (2025)
par: Re, Francesco Ignazio, et autres
Publié: (2025)
mmJEE-Eval: A Bilingual Multimodal Benchmark for Evaluating Scientific Reasoning in Vision-Language Models
par: Mukherjee, Arka, et autres
Publié: (2025)
par: Mukherjee, Arka, et autres
Publié: (2025)
GroupTravelBench: Benchmarking LLM Agents on Multi-Person Travel Planning
par: Cheng, Xiang, et autres
Publié: (2026)
par: Cheng, Xiang, et autres
Publié: (2026)
WorldTravel: A Realistic Multimodal Travel-Planning Benchmark with Tightly Coupled Constraints
par: Wang, Zexuan, et autres
Publié: (2026)
par: Wang, Zexuan, et autres
Publié: (2026)
HistoryBankQA: Multilingual Temporal Question Answering on Historical Events
par: Mandal, Biswadip, et autres
Publié: (2025)
par: Mandal, Biswadip, et autres
Publié: (2025)
Automated Question Generation on Tabular Data for Conversational Data Exploration
par: Chaudhuri, Ritwik, et autres
Publié: (2024)
par: Chaudhuri, Ritwik, et autres
Publié: (2024)
Crafting In-context Examples according to LMs' Parametric Knowledge
par: Lee, Yoonsang, et autres
Publié: (2023)
par: Lee, Yoonsang, et autres
Publié: (2023)
OpenStaxQA: A multilingual dataset based on open-source college textbooks
par: Gupta, Pranav
Publié: (2025)
par: Gupta, Pranav
Publié: (2025)
ChinaTravel: An Open-Ended Travel Planning Benchmark with Compositional Constraint Validation for Language Agents
par: Shao, Jie-Jing, et autres
Publié: (2024)
par: Shao, Jie-Jing, et autres
Publié: (2024)
TravelPlanner: A Benchmark for Real-World Planning with Language Agents
par: Xie, Jian, et autres
Publié: (2024)
par: Xie, Jian, et autres
Publié: (2024)
Flex-TravelPlanner: A Benchmark for Flexible Planning with Language Agents
par: Oh, Juhyun, et autres
Publié: (2025)
par: Oh, Juhyun, et autres
Publié: (2025)
TripTailor: A Real-World Benchmark for Personalized Travel Planning
par: Shen, Yuanzhe, et autres
Publié: (2025)
par: Shen, Yuanzhe, et autres
Publié: (2025)
CrowdCounter: A benchmark type-specific multi-target counterspeech dataset
par: Saha, Punyajoy, et autres
Publié: (2024)
par: Saha, Punyajoy, et autres
Publié: (2024)
Text Takes Over: A Study of Modality Bias in Multimodal Intent Detection
par: Mullick, Ankan, et autres
Publié: (2025)
par: Mullick, Ankan, et autres
Publié: (2025)
CueBuddy: helping non-native English speakers navigate English-centric STEM education
par: Gupta, Pranav
Publié: (2025)
par: Gupta, Pranav
Publié: (2025)
Talk, Snap, Complain: Validation-Aware Multimodal Expert Framework for Fine-Grained Customer Grievances
par: Singh, Rishu Kumar, et autres
Publié: (2025)
par: Singh, Rishu Kumar, et autres
Publié: (2025)
EvolvTrip: Enhancing Literary Character Understanding with Temporal Theory-of-Mind Graphs
par: Yang, Bohao, et autres
Publié: (2025)
par: Yang, Bohao, et autres
Publié: (2025)
A Breadth-First Catalog of Text Processing, Speech Processing and Multimodal Research in South Asian Languages
par: Gupta, Pranav
Publié: (2024)
par: Gupta, Pranav
Publié: (2024)
Introducing Super RAGs in Mistral 8x7B-v1
par: Thakur, Ayush, et autres
Publié: (2024)
par: Thakur, Ayush, et autres
Publié: (2024)
rSDNet: Unified Robust Neural Learning against Label Noise and Adversarial Attacks
par: Jana, Suryasis, et autres
Publié: (2026)
par: Jana, Suryasis, et autres
Publié: (2026)
Robust Inference for Non-Linear Regression Models with Applications in Enzyme Kinetics
par: Jana, Suryasis, et autres
Publié: (2024)
par: Jana, Suryasis, et autres
Publié: (2024)
Provably robust learning of regression neural networks using $β$-divergences
par: Ghosh, Abhik, et autres
Publié: (2026)
par: Ghosh, Abhik, et autres
Publié: (2026)
Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation
par: Mukherjee, Arka, et autres
Publié: (2025)
par: Mukherjee, Arka, et autres
Publié: (2025)
TravelAgent: An AI Assistant for Personalized Travel Planning
par: Chen, Aili, et autres
Publié: (2024)
par: Chen, Aili, et autres
Publié: (2024)
TraceBack: Multi-Agent Decomposition for Fine-Grained Table Attribution
par: Anvekar, Tejas, et autres
Publié: (2026)
par: Anvekar, Tejas, et autres
Publié: (2026)
Round-Trip Translation Reveals What Frontier Multilingual Benchmarks Miss
par: Skorobogat, Ronald, et autres
Publié: (2026)
par: Skorobogat, Ronald, et autres
Publié: (2026)
ReXTrust: A Model for Fine-Grained Hallucination Detection in AI-Generated Radiology Reports
par: Hardy, Romain, et autres
Publié: (2024)
par: Hardy, Romain, et autres
Publié: (2024)
On Zero-Shot Counterspeech Generation by LLMs
par: Saha, Punyajoy, et autres
Publié: (2024)
par: Saha, Punyajoy, et autres
Publié: (2024)
TP-RAG: Benchmarking Retrieval-Augmented Large Language Model Agents for Spatiotemporal-Aware Travel Planning
par: Ni, Hang, et autres
Publié: (2025)
par: Ni, Hang, et autres
Publié: (2025)
Factcheck-Bench: Fine-Grained Evaluation Benchmark for Automatic Fact-checkers
par: Wang, Yuxia, et autres
Publié: (2023)
par: Wang, Yuxia, et autres
Publié: (2023)
FactLens: Benchmarking Fine-Grained Fact Verification
par: Mitra, Kushan, et autres
Publié: (2024)
par: Mitra, Kushan, et autres
Publié: (2024)
Simba: Mamba augmented U-ShiftGCN for Skeletal Action Recognition in Videos
par: Chaudhuri, Soumyabrata, et autres
Publié: (2024)
par: Chaudhuri, Soumyabrata, et autres
Publié: (2024)
Towards Temporal Knowledge-Base Creation for Fine-Grained Opinion Analysis with Language Models
par: Negi, Gaurav, et autres
Publié: (2025)
par: Negi, Gaurav, et autres
Publié: (2025)
FineMath: A Fine-Grained Mathematical Evaluation Benchmark for Chinese Large Language Models
par: Liu, Yan, et autres
Publié: (2024)
par: Liu, Yan, et autres
Publié: (2024)
ILSIC: Corpora for Identifying Indian Legal Statutes from Queries by Laypeople
par: Paul, Shounak, et autres
Publié: (2026)
par: Paul, Shounak, et autres
Publié: (2026)
TripScore: Benchmarking and rewarding real-world travel planning with fine-grained evaluation
par: Qu, Yincen, et autres
Publié: (2025)
par: Qu, Yincen, et autres
Publié: (2025)
Mapping Clinical Doubt: Locating Linguistic Uncertainty in LLMs
par: Sridhar, Srivarshinee, et autres
Publié: (2025)
par: Sridhar, Srivarshinee, et autres
Publié: (2025)
VeriTrip: A Verifiable Benchmark for Travel Planning Agents over Unstructured Web Corpora
par: Xu, Yuting, et autres
Publié: (2026)
par: Xu, Yuting, et autres
Publié: (2026)
A Comparison of LLM Finetuning Methods & Evaluation Metrics with Travel Chatbot Use Case
par: Meyer, Sonia, et autres
Publié: (2024)
par: Meyer, Sonia, et autres
Publié: (2024)
Documents similaires
-
TripTide: A Benchmark for Adaptive Travel Planning under Disruptions
par: Karmakar, Priyanshu, et autres
Publié: (2025) -
A Spatio-Temporal Point Process for Fine-Grained Modeling of Reading Behavior
par: Re, Francesco Ignazio, et autres
Publié: (2025) -
mmJEE-Eval: A Bilingual Multimodal Benchmark for Evaluating Scientific Reasoning in Vision-Language Models
par: Mukherjee, Arka, et autres
Publié: (2025) -
GroupTravelBench: Benchmarking LLM Agents on Multi-Person Travel Planning
par: Cheng, Xiang, et autres
Publié: (2026) -
WorldTravel: A Realistic Multimodal Travel-Planning Benchmark with Tightly Coupled Constraints
par: Wang, Zexuan, et autres
Publié: (2026)