DRIP-R: A Benchmark for Decision-Making and Reasoning Under Real-World Policy Ambiguity in the Retail Domain
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Borkakoty, Hsuvas, Pohl, Sebastian, Wang, Cheng, Chen, Bei, Hou, Yufang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Where Knowledge Collides: A Mechanistic Study of Intra-Memory Knowledge Conflict in Language Models
von: Pham, Minh Vu, et al.
Veröffentlicht: (2026)
von: Pham, Minh Vu, et al.
Veröffentlicht: (2026)
Hoaxpedia: A Unified Wikipedia Hoax Articles Dataset
von: Borkakoty, Hsuvas, et al.
Veröffentlicht: (2024)
von: Borkakoty, Hsuvas, et al.
Veröffentlicht: (2024)
CHEW: A Dataset of CHanging Events in Wikipedia
von: Borkakoty, Hsuvas, et al.
Veröffentlicht: (2024)
von: Borkakoty, Hsuvas, et al.
Veröffentlicht: (2024)
WiDe-analysis: Enabling One-click Content Moderation Analysis on Wikipedia's Articles for Deletion
von: Borkakoty, Hsuvas, et al.
Veröffentlicht: (2024)
von: Borkakoty, Hsuvas, et al.
Veröffentlicht: (2024)
Wikipedia is Not a Dictionary, Delete! Text Classification as a Proxy for Analysing Wiki Deletion Discussions
von: Borkakoty, Hsuvas, et al.
Veröffentlicht: (2025)
von: Borkakoty, Hsuvas, et al.
Veröffentlicht: (2025)
Beyond Outcome Verification: Verifiable Process Reward Models for Structured Reasoning
von: Pronesti, Massimiliano, et al.
Veröffentlicht: (2026)
von: Pronesti, Massimiliano, et al.
Veröffentlicht: (2026)
WikiContradict: A Benchmark for Evaluating LLMs on Real-World Knowledge Conflicts from Wikipedia
von: Hou, Yufang, et al.
Veröffentlicht: (2024)
von: Hou, Yufang, et al.
Veröffentlicht: (2024)
RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios
von: Zhou, Ruiwen, et al.
Veröffentlicht: (2024)
von: Zhou, Ruiwen, et al.
Veröffentlicht: (2024)
SubTokenTest: A Practical Benchmark for Real-World Sub-token Understanding
von: Hou, Shuyang, et al.
Veröffentlicht: (2026)
von: Hou, Shuyang, et al.
Veröffentlicht: (2026)
$τ$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains
von: Yao, Shunyu, et al.
Veröffentlicht: (2024)
von: Yao, Shunyu, et al.
Veröffentlicht: (2024)
TIME: A Multi-level Benchmark for Temporal Reasoning of LLMs in Real-World Scenarios
von: Wei, Shaohang, et al.
Veröffentlicht: (2025)
von: Wei, Shaohang, et al.
Veröffentlicht: (2025)
HalluMix: A Task-Agnostic, Multi-Domain Benchmark for Real-World Hallucination Detection
von: Emery, Deanna, et al.
Veröffentlicht: (2025)
von: Emery, Deanna, et al.
Veröffentlicht: (2025)
STAR: A Benchmark for Situated Reasoning in Real-World Videos
von: Wu, Bo, et al.
Veröffentlicht: (2024)
von: Wu, Bo, et al.
Veröffentlicht: (2024)
RealMem: Benchmarking LLMs in Real-World Memory-Driven Interaction
von: Bian, Haonan, et al.
Veröffentlicht: (2026)
von: Bian, Haonan, et al.
Veröffentlicht: (2026)
Reframing Spatial Reasoning Evaluation in Language Models: A Real-World Simulation Benchmark for Qualitative Reasoning
von: Li, Fangjun, et al.
Veröffentlicht: (2024)
von: Li, Fangjun, et al.
Veröffentlicht: (2024)
DeFine: Decision-Making with Analogical Reasoning over Factor Profiles
von: Hu, Yebowen, et al.
Veröffentlicht: (2024)
von: Hu, Yebowen, et al.
Veröffentlicht: (2024)
DSGBench: A Diverse Strategic Game Benchmark for Evaluating LLM-based Agents in Complex Decision-Making Environments
von: Tang, Wenjie, et al.
Veröffentlicht: (2025)
von: Tang, Wenjie, et al.
Veröffentlicht: (2025)
Scope Ambiguities in Large Language Models
von: Kamath, Gaurav, et al.
Veröffentlicht: (2024)
von: Kamath, Gaurav, et al.
Veröffentlicht: (2024)
Enhancing Study-Level Inference from Clinical Trial Papers via Reinforcement Learning-Based Numeric Reasoning
von: Pronesti, Massimiliano, et al.
Veröffentlicht: (2025)
von: Pronesti, Massimiliano, et al.
Veröffentlicht: (2025)
A$^2$Search: Ambiguity-Aware Question Answering with Reinforcement Learning
von: Zhang, Fengji, et al.
Veröffentlicht: (2025)
von: Zhang, Fengji, et al.
Veröffentlicht: (2025)
Evaluating Bias in Spoken Dialogue LLMs for Real-World Decisions and Recommendations
von: Wu, Yihao, et al.
Veröffentlicht: (2025)
von: Wu, Yihao, et al.
Veröffentlicht: (2025)
On the Role of Model Prior in Real-World Inductive Reasoning
von: Liu, Zhuo, et al.
Veröffentlicht: (2024)
von: Liu, Zhuo, et al.
Veröffentlicht: (2024)
Beyond MedQA: Towards Real-world Clinical Decision Making in the Era of LLMs
von: Xiao, Yunpeng, et al.
Veröffentlicht: (2025)
von: Xiao, Yunpeng, et al.
Veröffentlicht: (2025)
DeLLMa: Decision Making Under Uncertainty with Large Language Models
von: Liu, Ollie, et al.
Veröffentlicht: (2024)
von: Liu, Ollie, et al.
Veröffentlicht: (2024)
MCPVerse: An Expansive, Real-World Benchmark for Agentic Tool Use
von: Lei, Fei, et al.
Veröffentlicht: (2025)
von: Lei, Fei, et al.
Veröffentlicht: (2025)
Strategist: Self-improvement of LLM Decision Making via Bi-Level Tree Search
von: Light, Jonathan, et al.
Veröffentlicht: (2024)
von: Light, Jonathan, et al.
Veröffentlicht: (2024)
Who Annotates in NLP? A Large-scale Assessment of Human Annotation Reporting between 2018 and 2025
von: Kunilovskaya, Maria, et al.
Veröffentlicht: (2026)
von: Kunilovskaya, Maria, et al.
Veröffentlicht: (2026)
What Makes a Sale? Rethinking End-to-End Seller--Buyer Retail Dynamics with LLM Agents
von: Choi, Jeonghwan, et al.
Veröffentlicht: (2026)
von: Choi, Jeonghwan, et al.
Veröffentlicht: (2026)
SpeechR: A Benchmark for Speech Reasoning in Large Audio-Language Models
von: Yang, Wanqi, et al.
Veröffentlicht: (2025)
von: Yang, Wanqi, et al.
Veröffentlicht: (2025)
Answer, Refuse, or Guess? Investigating Risk-Aware Decision Making in Language Models
von: Wu, Cheng-Kuang, et al.
Veröffentlicht: (2025)
von: Wu, Cheng-Kuang, et al.
Veröffentlicht: (2025)
Benchmarking Cognitive Domains for LLMs: Insights from Taiwanese Hakka Culture
von: Chang, Chen-Chi, et al.
Veröffentlicht: (2024)
von: Chang, Chen-Chi, et al.
Veröffentlicht: (2024)
Beyond SELECT: A Comprehensive Taxonomy-Guided Benchmark for Real-World Text-to-SQL Translation
von: Wang, Hao, et al.
Veröffentlicht: (2025)
von: Wang, Hao, et al.
Veröffentlicht: (2025)
NoisyCausal: A Benchmark for Evaluating Causal Reasoning Under Structured Noise
von: Xu, Zhi, et al.
Veröffentlicht: (2026)
von: Xu, Zhi, et al.
Veröffentlicht: (2026)
FactReasoner: A Probabilistic Approach to Long-Form Factuality Assessment for Large Language Models
von: Marinescu, Radu, et al.
Veröffentlicht: (2025)
von: Marinescu, Radu, et al.
Veröffentlicht: (2025)
LLMs for Explainable Business Decision-Making: A Reinforcement Learning Fine-Tuning Approach
von: Cheng, Xiang, et al.
Veröffentlicht: (2025)
von: Cheng, Xiang, et al.
Veröffentlicht: (2025)
D-GARA: A Dynamic Benchmarking Framework for GUI Agent Robustness in Real-World Anomalies
von: Chen, Sen, et al.
Veröffentlicht: (2025)
von: Chen, Sen, et al.
Veröffentlicht: (2025)
Embodied Agent Interface: Benchmarking LLMs for Embodied Decision Making
von: Li, Manling, et al.
Veröffentlicht: (2024)
von: Li, Manling, et al.
Veröffentlicht: (2024)
nvBench 2.0: Resolving Ambiguity in Text-to-Visualization through Stepwise Reasoning
von: Luo, Tianqi, et al.
Veröffentlicht: (2025)
von: Luo, Tianqi, et al.
Veröffentlicht: (2025)
RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking
von: Yang, Shuo, et al.
Veröffentlicht: (2025)
von: Yang, Shuo, et al.
Veröffentlicht: (2025)
Cognitive Bias in Decision-Making with LLMs
von: Echterhoff, Jessica, et al.
Veröffentlicht: (2024)
von: Echterhoff, Jessica, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Where Knowledge Collides: A Mechanistic Study of Intra-Memory Knowledge Conflict in Language Models
von: Pham, Minh Vu, et al.
Veröffentlicht: (2026) -
Hoaxpedia: A Unified Wikipedia Hoax Articles Dataset
von: Borkakoty, Hsuvas, et al.
Veröffentlicht: (2024) -
CHEW: A Dataset of CHanging Events in Wikipedia
von: Borkakoty, Hsuvas, et al.
Veröffentlicht: (2024) -
WiDe-analysis: Enabling One-click Content Moderation Analysis on Wikipedia's Articles for Deletion
von: Borkakoty, Hsuvas, et al.
Veröffentlicht: (2024) -
Wikipedia is Not a Dictionary, Delete! Text Classification as a Proxy for Analysing Wiki Deletion Discussions
von: Borkakoty, Hsuvas, et al.
Veröffentlicht: (2025)