Cofca: A Step-Wise Counterfactual Multi-hop QA benchmark
Fuente:
arXiv
Saved in:
| Main Authors: | Wu, Jian, Yang, Linyi, Wang, Zhen, Okumura, Manabu, Zhang, Yue |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
GenDec: A robust generative Question-decomposition method for Multi-hop reasoning
by: Wu, Jian, et al.
Published: (2024)
by: Wu, Jian, et al.
Published: (2024)
Medical Knowledge Graph QA for Drug-Drug Interaction Prediction based on Multi-hop Machine Reading Comprehension
by: Gao, Peng, et al.
Published: (2022)
by: Gao, Peng, et al.
Published: (2022)
A Rationale-centric Counterfactual Data Augmentation Method for Cross-Document Event Coreference Resolution
by: Ding, Bowen, et al.
Published: (2024)
by: Ding, Bowen, et al.
Published: (2024)
MoreHopQA: More Than Multi-hop Reasoning
by: Schnitzler, Julian, et al.
Published: (2024)
by: Schnitzler, Julian, et al.
Published: (2024)
Automatic Inter-document Multi-hop Scientific QA Generation
by: Lee, Seungmin, et al.
Published: (2026)
by: Lee, Seungmin, et al.
Published: (2026)
Reconsidering Degeneration of Token Embeddings with Definitions for Encoder-based Pre-trained Language Models
by: Zhang, Ying, et al.
Published: (2024)
by: Zhang, Ying, et al.
Published: (2024)
Automatic Answerability Evaluation for Question Generation
by: Wang, Zifan, et al.
Published: (2023)
by: Wang, Zifan, et al.
Published: (2023)
MCEval: A Dynamic Framework for Fair Multilingual Cultural Evaluation of LLMs
by: Huang, Shulin, et al.
Published: (2025)
by: Huang, Shulin, et al.
Published: (2025)
MFORT-QA: Multi-hop Few-shot Open Rich Table Question Answering
by: Guan, Che, et al.
Published: (2024)
by: Guan, Che, et al.
Published: (2024)
Masking in Multi-hop QA: An Analysis of How Language Models Perform with Context Permutation
by: Huang, Wenyu, et al.
Published: (2025)
by: Huang, Wenyu, et al.
Published: (2025)
UETQuintet at BioCreative IX -- MedHopQA: Enhancing Biomedical QA with Selective Multi-hop Reasoning and Contextual Retrieval
by: Nguyen, Quoc-An, et al.
Published: (2026)
by: Nguyen, Quoc-An, et al.
Published: (2026)
Suvach -- Generated Hindi QA benchmark
by: Narayanan, Vaishak, et al.
Published: (2024)
by: Narayanan, Vaishak, et al.
Published: (2024)
ReCoQA: A Benchmark for Tool-Augmented and Multi-Step Reasoning in Real Estate Question and Answering
by: Zhang, Yindong, et al.
Published: (2026)
by: Zhang, Yindong, et al.
Published: (2026)
LogicReward: Incentivizing LLM Reasoning via Step-Wise Logical Supervision
by: Xu, Jundong, et al.
Published: (2025)
by: Xu, Jundong, et al.
Published: (2025)
AI Scientists Fail Without Strong Implementation Capability
by: Zhu, Minjun, et al.
Published: (2025)
by: Zhu, Minjun, et al.
Published: (2025)
Exploring Performance Contrasts in TableQA: Step-by-Step Reasoning Boosts Bigger Language Models, Limits Smaller Language Models
by: Yang, Haoyan, et al.
Published: (2024)
by: Yang, Haoyan, et al.
Published: (2024)
ACE: Attribution-Controlled Knowledge Editing for Multi-hop Factual Recall
by: Yang, Jiayu, et al.
Published: (2025)
by: Yang, Jiayu, et al.
Published: (2025)
Faithfulness-QA: A Counterfactual Entity Substitution Dataset for Training Context-Faithful RAG Models
by: Ju, Li, et al.
Published: (2026)
by: Ju, Li, et al.
Published: (2026)
Personality Alignment of Large Language Models
by: Zhu, Minjun, et al.
Published: (2024)
by: Zhu, Minjun, et al.
Published: (2024)
Can we obtain significant success in RST discourse parsing by using Large Language Models?
by: Maekawa, Aru, et al.
Published: (2024)
by: Maekawa, Aru, et al.
Published: (2024)
StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy Optimization
by: Wang, Ziliang, et al.
Published: (2025)
by: Wang, Ziliang, et al.
Published: (2025)
AdParaphrase v2.0: Generating Attractive Ad Texts Using a Preference-Annotated Paraphrase Dataset
by: Murakami, Soichiro, et al.
Published: (2025)
by: Murakami, Soichiro, et al.
Published: (2025)
Replacing Multi-Step Assembly of Data Preparation Pipelines with One-Step LLM Pipeline Generation for Table QA
by: Li, Fengyu, et al.
Published: (2026)
by: Li, Fengyu, et al.
Published: (2026)
RJUA-QA: A Comprehensive QA Dataset for Urology
by: Lyu, Shiwei, et al.
Published: (2023)
by: Lyu, Shiwei, et al.
Published: (2023)
AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress
by: Xi, Zhiheng, et al.
Published: (2025)
by: Xi, Zhiheng, et al.
Published: (2025)
Locking Down the Finetuned LLMs Safety
by: Zhu, Minjun, et al.
Published: (2024)
by: Zhu, Minjun, et al.
Published: (2024)
Listening to the Wise Few: Select-and-Copy Attention Heads for Multiple-Choice QA
by: Tulchinskii, Eduard, et al.
Published: (2024)
by: Tulchinskii, Eduard, et al.
Published: (2024)
DeepReview: Improving LLM-based Paper Review with Human-like Deep Thinking Process
by: Zhu, Minjun, et al.
Published: (2025)
by: Zhu, Minjun, et al.
Published: (2025)
HANRAG: Heuristic Accurate Noise-resistant Retrieval-Augmented Generation for Multi-hop Question Answering
by: Sun, Duolin, et al.
Published: (2025)
by: Sun, Duolin, et al.
Published: (2025)
Fast-DetectGPT: Efficient Zero-Shot Detection of Machine-Generated Text via Conditional Probability Curvature
by: Bao, Guangsheng, et al.
Published: (2023)
by: Bao, Guangsheng, et al.
Published: (2023)
DiLM: Distilling Dataset into Language Model for Text-level Dataset Distillation
by: Maekawa, Aru, et al.
Published: (2024)
by: Maekawa, Aru, et al.
Published: (2024)
Unveiling the Power of Source: Source-based Minimum Bayes Risk Decoding for Neural Machine Translation
by: Lyu, Boxuan, et al.
Published: (2024)
by: Lyu, Boxuan, et al.
Published: (2024)
Who Laughs with Whom? Disentangling Influential Factors in Humor Preferences across User Clusters and LLMs
by: Murakami, Soichiro, et al.
Published: (2026)
by: Murakami, Soichiro, et al.
Published: (2026)
Oogiri-Master: Benchmarking Humor Understanding via Oogiri
by: Murakami, Soichiro, et al.
Published: (2025)
by: Murakami, Soichiro, et al.
Published: (2025)
MultiCube-RAG for Multi-hop Question Answering
by: Shi, Jimeng, et al.
Published: (2026)
by: Shi, Jimeng, et al.
Published: (2026)
Embedding-based In-Context Prompt Training for Enhancing LLMs as Text Encoders
by: Lin, Ailiang, et al.
Published: (2026)
by: Lin, Ailiang, et al.
Published: (2026)
Length Representations in Large Language Models
by: Moon, Sangjun, et al.
Published: (2025)
by: Moon, Sangjun, et al.
Published: (2025)
TRAD: Enhancing LLM Agents with Step-Wise Thought Retrieval and Aligned Decision
by: Zhou, Ruiwen, et al.
Published: (2024)
by: Zhou, Ruiwen, et al.
Published: (2024)
Enhancing Multi-hop Reasoning through Knowledge Erasure in Large Language Model Editing
by: Zhang, Mengqi, et al.
Published: (2024)
by: Zhang, Mengqi, et al.
Published: (2024)
GRADE: Generating multi-hop QA and fine-gRAined Difficulty matrix for RAG Evaluation
by: Lee, Jeongsoo, et al.
Published: (2025)
by: Lee, Jeongsoo, et al.
Published: (2025)
Similar Items
-
GenDec: A robust generative Question-decomposition method for Multi-hop reasoning
by: Wu, Jian, et al.
Published: (2024) -
Medical Knowledge Graph QA for Drug-Drug Interaction Prediction based on Multi-hop Machine Reading Comprehension
by: Gao, Peng, et al.
Published: (2022) -
A Rationale-centric Counterfactual Data Augmentation Method for Cross-Document Event Coreference Resolution
by: Ding, Bowen, et al.
Published: (2024) -
MoreHopQA: More Than Multi-hop Reasoning
by: Schnitzler, Julian, et al.
Published: (2024) -
Automatic Inter-document Multi-hop Scientific QA Generation
by: Lee, Seungmin, et al.
Published: (2026)