TripScore: Benchmarking and rewarding real-world travel planning with fine-grained evaluation
Fuente:
arXiv
Saved in:
| Main Authors: | Qu, Yincen, Xiao, Huan, Li, Feng, Li, Gregory, Zhou, Hui, Dai, Xiangying, Dai, Xiaoru |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Deploying Multi-task Online Server with Large Language Model
by: Qu, Yincen, et al.
Published: (2024)
by: Qu, Yincen, et al.
Published: (2024)
UltraWiki: Ultra-fine-grained Entity Set Expansion with Negative Seed Entities
by: Li, Yangning, et al.
Published: (2024)
by: Li, Yangning, et al.
Published: (2024)
Fine-grained auxiliary learning for real-world product recommendation
by: Almagro, Mario, et al.
Published: (2025)
by: Almagro, Mario, et al.
Published: (2025)
TripTide: A Benchmark for Adaptive Travel Planning under Disruptions
by: Karmakar, Priyanshu, et al.
Published: (2025)
by: Karmakar, Priyanshu, et al.
Published: (2025)
Round-Trip Translation Reveals What Frontier Multilingual Benchmarks Miss
by: Skorobogat, Ronald, et al.
Published: (2026)
by: Skorobogat, Ronald, et al.
Published: (2026)
Magic Mushroom: A Customizable Benchmark for Fine-grained Analysis of Retrieval Noise Erosion in RAG Systems
by: Zhang, Yuxin, et al.
Published: (2025)
by: Zhang, Yuxin, et al.
Published: (2025)
PRMBench: A Fine-grained and Challenging Benchmark for Process-Level Reward Models
by: Song, Mingyang, et al.
Published: (2025)
by: Song, Mingyang, et al.
Published: (2025)
Silicon Bureaucracy and AI Test-Oriented Education: Contamination Sensitivity and Score Confidence in LLM Benchmarks
by: Song, Yiliang, et al.
Published: (2026)
by: Song, Yiliang, et al.
Published: (2026)
Development and multi-center evaluation of domain-adapted speech recognition for human-AI teaming in real-world gastrointestinal endoscopy
by: Yang, Ruijie, et al.
Published: (2026)
by: Yang, Ruijie, et al.
Published: (2026)
TripCraft: A Benchmark for Spatio-Temporally Fine Grained Travel Planning
by: Chaudhuri, Soumyabrata, et al.
Published: (2025)
by: Chaudhuri, Soumyabrata, et al.
Published: (2025)
MathOPEval: A Fine-grained Evaluation Benchmark for Visual Operations of MLLMs in Mathematical Reasoning
by: Li, Xiaoyuan, et al.
Published: (2025)
by: Li, Xiaoyuan, et al.
Published: (2025)
A Critical Look at Meta-evaluating Summarisation Evaluation Metrics
by: Dai, Xiang, et al.
Published: (2024)
by: Dai, Xiang, et al.
Published: (2024)
CFVBench: A Comprehensive Video Benchmark for Fine-grained Multimodal Retrieval-Augmented Generation
by: Wei, Kaiwen, et al.
Published: (2025)
by: Wei, Kaiwen, et al.
Published: (2025)
FAMMA: A Benchmark for Financial Domain Multilingual Multimodal Question Answering
by: Xue, Siqiao, et al.
Published: (2024)
by: Xue, Siqiao, et al.
Published: (2024)
Profile-LLM: Dynamic Profile Optimization for Realistic Personality Expression in LLMs
by: Dai, Shi-Wei, et al.
Published: (2025)
by: Dai, Shi-Wei, et al.
Published: (2025)
VeriFastScore: Speeding up long-form factuality evaluation
by: Rajendhran, Rishanth, et al.
Published: (2025)
by: Rajendhran, Rishanth, et al.
Published: (2025)
Self-rationalization improves LLM as a fine-grained judge
by: Trivedi, Prapti, et al.
Published: (2024)
by: Trivedi, Prapti, et al.
Published: (2024)
SSP-based construction of evaluation-annotated data for fine-grained aspect-based sentiment analysis
by: Choi, Suwon, et al.
Published: (2026)
by: Choi, Suwon, et al.
Published: (2026)
How Does Personalized Memory Shape LLM Behavior? Benchmarking Rational Preference Utilization in Personalized Assistants
by: Feng, Xueyang, et al.
Published: (2026)
by: Feng, Xueyang, et al.
Published: (2026)
MedFact: Benchmarking the Fact-Checking Capabilities of Large Language Models on Chinese Medical Texts
by: He, Jiayi, et al.
Published: (2025)
by: He, Jiayi, et al.
Published: (2025)
EvolvTrip: Enhancing Literary Character Understanding with Temporal Theory-of-Mind Graphs
by: Yang, Bohao, et al.
Published: (2025)
by: Yang, Bohao, et al.
Published: (2025)
Efficient Selection of Type Annotations for Performance Improvement in Gradual Typing
by: Li, Senxi, et al.
Published: (2026)
by: Li, Senxi, et al.
Published: (2026)
RealBench: A Chinese Multi-image Understanding Benchmark Close to Real-world Scenarios
by: Zhao, Fei, et al.
Published: (2025)
by: Zhao, Fei, et al.
Published: (2025)
From Word to World: Evaluate and Mitigate Culture Bias in LLMs via Word Association Test
by: Dai, Xunlian, et al.
Published: (2025)
by: Dai, Xunlian, et al.
Published: (2025)
GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization
by: Liu, Shih-Yang, et al.
Published: (2026)
by: Liu, Shih-Yang, et al.
Published: (2026)
CausalScore: An Automatic Reference-Free Metric for Assessing Response Relevance in Open-Domain Dialogue Systems
by: Feng, Tao, et al.
Published: (2024)
by: Feng, Tao, et al.
Published: (2024)
A production planning benchmark for real-world refinery-petrochemical complexes
by: Du, Wenli, et al.
Published: (2025)
by: Du, Wenli, et al.
Published: (2025)
Generating Diverse Training Samples for Relation Extraction with Large Language Models
by: Li, Zexuan, et al.
Published: (2025)
by: Li, Zexuan, et al.
Published: (2025)
M-BRe: Discovering Training Samples for Relation Extraction from Unlabeled Texts with Large Language Models
by: Li, Zexuan, et al.
Published: (2025)
by: Li, Zexuan, et al.
Published: (2025)
Steering diffusion models with quadratic rewards: a fine-grained analysis
by: Moitra, Ankur, et al.
Published: (2026)
by: Moitra, Ankur, et al.
Published: (2026)
Large Language Models Penetration in Scholarly Writing and Peer Review
by: Zhou, Li, et al.
Published: (2025)
by: Zhou, Li, et al.
Published: (2025)
Rethinking Meeting Effectiveness: A Benchmark and Framework for Temporal Fine-grained Automatic Meeting Effectiveness Evaluation
by: Li, Yihang, et al.
Published: (2026)
by: Li, Yihang, et al.
Published: (2026)
Plancraft: an evaluation dataset for planning with LLM agents
by: Dagan, Gautier, et al.
Published: (2024)
by: Dagan, Gautier, et al.
Published: (2024)
BLEUBERI: BLEU is a surprisingly effective reward for instruction following
by: Chang, Yapei, et al.
Published: (2025)
by: Chang, Yapei, et al.
Published: (2025)
RPC-Bench: A Fine-grained Benchmark for Research Paper Comprehension
by: Chen, Yelin, et al.
Published: (2026)
by: Chen, Yelin, et al.
Published: (2026)
LIRE: listwise reward enhancement for preference alignment
by: Zhu, Mingye, et al.
Published: (2024)
by: Zhu, Mingye, et al.
Published: (2024)
Look Before You Leap: Towards Decision-Aware and Generalizable Tool-Usage for Large Language Models
by: Gui, Anchun, et al.
Published: (2024)
by: Gui, Anchun, et al.
Published: (2024)
A self-evolving multi-role collaborative framework with fine-grained difficulty guidance for innovative mathematical problem generation
by: Sun, Yifei, et al.
Published: (2026)
by: Sun, Yifei, et al.
Published: (2026)
PredictaBoard: Benchmarking LLM Score Predictability
by: Pacchiardi, Lorenzo, et al.
Published: (2025)
by: Pacchiardi, Lorenzo, et al.
Published: (2025)
Beyond Imitation: Learning Key Reasoning Steps from Dual Chain-of-Thoughts in Reasoning Distillation
by: Dai, Chengwei, et al.
Published: (2024)
by: Dai, Chengwei, et al.
Published: (2024)
Similar Items
-
Deploying Multi-task Online Server with Large Language Model
by: Qu, Yincen, et al.
Published: (2024) -
UltraWiki: Ultra-fine-grained Entity Set Expansion with Negative Seed Entities
by: Li, Yangning, et al.
Published: (2024) -
Fine-grained auxiliary learning for real-world product recommendation
by: Almagro, Mario, et al.
Published: (2025) -
TripTide: A Benchmark for Adaptive Travel Planning under Disruptions
by: Karmakar, Priyanshu, et al.
Published: (2025) -
Round-Trip Translation Reveals What Frontier Multilingual Benchmarks Miss
by: Skorobogat, Ronald, et al.
Published: (2026)