MDCR: A Dataset for Multi-Document Conditional Reasoning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Chen, Peter Baile, Zhang, Yi, Liu, Chunwei, Gupta, Sejal, Kim, Yoon, Cafarella, Michael |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Can we Retrieve Everything All at Once? ARM: An Alignment-Oriented LLM-based Retrieval Method
von: Chen, Peter Baile, et al.
Veröffentlicht: (2025)
von: Chen, Peter Baile, et al.
Veröffentlicht: (2025)
Log-Augmented Generation: Scaling Test-Time Reasoning with Reusable Computation
von: Chen, Peter Baile, et al.
Veröffentlicht: (2025)
von: Chen, Peter Baile, et al.
Veröffentlicht: (2025)
EnrichIndex: Using LLMs to Enrich Retrieval Indices Offline
von: Chen, Peter Baile, et al.
Veröffentlicht: (2025)
von: Chen, Peter Baile, et al.
Veröffentlicht: (2025)
CONCUR: A Framework for Continual Constrained and Unconstrained Routing
von: Chen, Peter Baile, et al.
Veröffentlicht: (2025)
von: Chen, Peter Baile, et al.
Veröffentlicht: (2025)
BEAVER: An Enterprise Benchmark for Text-to-SQL
von: Chen, Peter Baile, et al.
Veröffentlicht: (2024)
von: Chen, Peter Baile, et al.
Veröffentlicht: (2024)
Is Table Retrieval a Solved Problem? Exploring Join-Aware Multi-Table Retrieval
von: Chen, Peter Baile, et al.
Veröffentlicht: (2024)
von: Chen, Peter Baile, et al.
Veröffentlicht: (2024)
CHAMP: A Competition-level Dataset for Fine-Grained Analyses of LLMs' Mathematical Reasoning Capabilities
von: Mao, Yujun, et al.
Veröffentlicht: (2024)
von: Mao, Yujun, et al.
Veröffentlicht: (2024)
A Declarative System for Optimizing AI Workloads
von: Liu, Chunwei, et al.
Veröffentlicht: (2024)
von: Liu, Chunwei, et al.
Veröffentlicht: (2024)
From Query to Counsel: Structured Reasoning with a Multi-Agent Framework and Dataset for Legal Consultation
von: Lu, Mingfei, et al.
Veröffentlicht: (2026)
von: Lu, Mingfei, et al.
Veröffentlicht: (2026)
BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset
von: Xi, Zhiheng, et al.
Veröffentlicht: (2025)
von: Xi, Zhiheng, et al.
Veröffentlicht: (2025)
BaRDa: A Belief and Reasoning Dataset that Separates Factual Accuracy and Reasoning Ability
von: Clark, Peter, et al.
Veröffentlicht: (2023)
von: Clark, Peter, et al.
Veröffentlicht: (2023)
CCQA: Generating Question from Solution Can Improve Inference-Time Reasoning in SLMs
von: Kim, Jin Young, et al.
Veröffentlicht: (2025)
von: Kim, Jin Young, et al.
Veröffentlicht: (2025)
SAFE: Stepwise Atomic Feedback for Error correction in Multi-hop Reasoning
von: Kwon, Daeyong, et al.
Veröffentlicht: (2026)
von: Kwon, Daeyong, et al.
Veröffentlicht: (2026)
Reasoning Models Better Express Their Confidence
von: Yoon, Dongkeun, et al.
Veröffentlicht: (2025)
von: Yoon, Dongkeun, et al.
Veröffentlicht: (2025)
Paraphrase and Solve: Exploring and Exploiting the Impact of Surface Form on Mathematical Reasoning in Large Language Models
von: Zhou, Yue, et al.
Veröffentlicht: (2024)
von: Zhou, Yue, et al.
Veröffentlicht: (2024)
TIBSTC-CoT: A Multi-Domain Instruction Dataset for Chain-of-Thought Reasoning in Language Models
von: Gao, Fan, et al.
Veröffentlicht: (2025)
von: Gao, Fan, et al.
Veröffentlicht: (2025)
M3-SLU: Evaluating Speaker-Attributed Reasoning in Multimodal Large Language Models
von: Kwon, Yejin, et al.
Veröffentlicht: (2025)
von: Kwon, Yejin, et al.
Veröffentlicht: (2025)
Conditional Advantage Estimation for Reinforcement Learning in Large Reasoning Models
von: Chen, Guanxu, et al.
Veröffentlicht: (2025)
von: Chen, Guanxu, et al.
Veröffentlicht: (2025)
MDBench: A Synthetic Multi-Document Reasoning Benchmark Generated with Knowledge Guidance
von: Peper, Joseph J., et al.
Veröffentlicht: (2025)
von: Peper, Joseph J., et al.
Veröffentlicht: (2025)
Polymath: A Challenging Multi-modal Mathematical Reasoning Benchmark
von: Gupta, Himanshu, et al.
Veröffentlicht: (2024)
von: Gupta, Himanshu, et al.
Veröffentlicht: (2024)
A Survey on Feedback-based Multi-step Reasoning for Large Language Models on Mathematics
von: Wei, Ting-Ruen, et al.
Veröffentlicht: (2025)
von: Wei, Ting-Ruen, et al.
Veröffentlicht: (2025)
DeALOG: Decentralized Multi-Agents Log-Mediated Reasoning Framework
von: Chakraborty, Abhijit, et al.
Veröffentlicht: (2026)
von: Chakraborty, Abhijit, et al.
Veröffentlicht: (2026)
DocFinQA: A Long-Context Financial Reasoning Dataset
von: Reddy, Varshini, et al.
Veröffentlicht: (2024)
von: Reddy, Varshini, et al.
Veröffentlicht: (2024)
Reasoning or Reciting? Exploring the Capabilities and Limitations of Language Models Through Counterfactual Tasks
von: Wu, Zhaofeng, et al.
Veröffentlicht: (2023)
von: Wu, Zhaofeng, et al.
Veröffentlicht: (2023)
ReasonMed: A 370K Multi-Agent Generated Dataset for Advancing Medical Reasoning
von: Sun, Yu, et al.
Veröffentlicht: (2025)
von: Sun, Yu, et al.
Veröffentlicht: (2025)
From What to Why: A Multi-Agent System for Evidence-based Chemical Reaction Condition Reasoning
von: Yang, Cheng, et al.
Veröffentlicht: (2025)
von: Yang, Cheng, et al.
Veröffentlicht: (2025)
Skill-Conditioned Gated Self-Distillation for LLM Reasoning
von: Huang, Jiazhen, et al.
Veröffentlicht: (2026)
von: Huang, Jiazhen, et al.
Veröffentlicht: (2026)
How Do Answer Tokens Read Reasoning Traces? Self-Reading Patterns in Thinking LLMs for Quantitative Reasoning
von: Chen, Haoyang, et al.
Veröffentlicht: (2026)
von: Chen, Haoyang, et al.
Veröffentlicht: (2026)
Multimodal Cognitive Reframing Therapy via Multi-hop Psychotherapeutic Reasoning
von: Kim, Subin, et al.
Veröffentlicht: (2025)
von: Kim, Subin, et al.
Veröffentlicht: (2025)
IMAGINE: Integrating Multi-Agent System into One Model for Complex Reasoning and Planning
von: Zhang, Xikai, et al.
Veröffentlicht: (2025)
von: Zhang, Xikai, et al.
Veröffentlicht: (2025)
Bayesian Teaching Enables Probabilistic Reasoning in Large Language Models
von: Qiu, Linlu, et al.
Veröffentlicht: (2025)
von: Qiu, Linlu, et al.
Veröffentlicht: (2025)
Layer-Order Inversion: Rethinking Latent Multi-Hop Reasoning in Large Language Models
von: Liu, Xukai, et al.
Veröffentlicht: (2026)
von: Liu, Xukai, et al.
Veröffentlicht: (2026)
CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models
von: Liu, Guang, et al.
Veröffentlicht: (2025)
von: Liu, Guang, et al.
Veröffentlicht: (2025)
PVP: An Image Dataset for Personalized Visual Persuasion with Persuasion Strategies, Viewer Characteristics, and Persuasiveness Ratings
von: Kim, Junseo, et al.
Veröffentlicht: (2025)
von: Kim, Junseo, et al.
Veröffentlicht: (2025)
The Oracle Has Spoken: A Multi-Aspect Evaluation of Dialogue in Pythia
von: Chen, Zixun, et al.
Veröffentlicht: (2025)
von: Chen, Zixun, et al.
Veröffentlicht: (2025)
Extract Information from Hybrid Long Documents Leveraging LLMs: A Framework and Dataset
von: Yue, Chongjian, et al.
Veröffentlicht: (2024)
von: Yue, Chongjian, et al.
Veröffentlicht: (2024)
PLANTS: A Novel Problem and Dataset for Summarization of Planning-Like (PL) Tasks
von: Pallagani, Vishal, et al.
Veröffentlicht: (2024)
von: Pallagani, Vishal, et al.
Veröffentlicht: (2024)
Latent Self-Consistency for Reliable Majority-Set Selection in Short- and Long-Answer Reasoning
von: Oh, Jungsuk, et al.
Veröffentlicht: (2025)
von: Oh, Jungsuk, et al.
Veröffentlicht: (2025)
KoACD: The First Korean Adolescent Dataset for Cognitive Distortion Analysis via Role-Switching Multi-LLM Negotiation
von: Kim, JunSeo, et al.
Veröffentlicht: (2025)
von: Kim, JunSeo, et al.
Veröffentlicht: (2025)
MEXA: Towards General Multimodal Reasoning with Dynamic Multi-Expert Aggregation
von: Yu, Shoubin, et al.
Veröffentlicht: (2025)
von: Yu, Shoubin, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Can we Retrieve Everything All at Once? ARM: An Alignment-Oriented LLM-based Retrieval Method
von: Chen, Peter Baile, et al.
Veröffentlicht: (2025) -
Log-Augmented Generation: Scaling Test-Time Reasoning with Reusable Computation
von: Chen, Peter Baile, et al.
Veröffentlicht: (2025) -
EnrichIndex: Using LLMs to Enrich Retrieval Indices Offline
von: Chen, Peter Baile, et al.
Veröffentlicht: (2025) -
CONCUR: A Framework for Continual Constrained and Unconstrained Routing
von: Chen, Peter Baile, et al.
Veröffentlicht: (2025) -
BEAVER: An Enterprise Benchmark for Text-to-SQL
von: Chen, Peter Baile, et al.
Veröffentlicht: (2024)