Towards Robust Temporal Reasoning of Large Language Models via a Multi-Hop QA Dataset and Pseudo-Instruction Tuning
Fuente:
arXiv
Saved in:
| Main Authors: | Tan, Qingyu, Ng, Hwee Tou, Bing, Lidong |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Unlocking Temporal Question Answering for Large Language Models with Tailor-Made Reasoning Logic
by: Li, Xingxuan, et al.
Published: (2023)
by: Li, Xingxuan, et al.
Published: (2023)
Reasoning Models Hallucinate More: Factuality-Aware Reinforcement Learning for Large Reasoning Models
by: Li, Junyi, et al.
Published: (2025)
by: Li, Junyi, et al.
Published: (2025)
Self-Judge: Selective Instruction Following with Alignment Self-Evaluation
by: Ye, Hai, et al.
Published: (2024)
by: Ye, Hai, et al.
Published: (2024)
Parametric Knowledge is Not All You Need: Toward Honest Large Language Models via Retrieval of Pretraining Data
by: Kusuma, Christopher Adrian, et al.
Published: (2026)
by: Kusuma, Christopher Adrian, et al.
Published: (2026)
Preference-Guided Reflective Sampling for Aligning Language Models
by: Ye, Hai, et al.
Published: (2024)
by: Ye, Hai, et al.
Published: (2024)
Game of Thought: Robust Information Seeking with Large Language Models Using Game Theory
by: Cui, Langyuan, et al.
Published: (2026)
by: Cui, Langyuan, et al.
Published: (2026)
Think&Cite: Improving Attributed Text Generation with Self-Guided Tree Search and Progress Reward Modeling
by: Li, Junyi, et al.
Published: (2024)
by: Li, Junyi, et al.
Published: (2024)
Just Go Parallel: Improving the Multilingual Capabilities of Large Language Models
by: Qorib, Muhammad Reza, et al.
Published: (2025)
by: Qorib, Muhammad Reza, et al.
Published: (2025)
Factorized Learning for Temporally Grounded Video-Language Models
by: Zeng, Wenzheng, et al.
Published: (2025)
by: Zeng, Wenzheng, et al.
Published: (2025)
DocHop-QA: Towards Multi-Hop Reasoning over Multimodal Document Collections
by: Park, Jiwon, et al.
Published: (2025)
by: Park, Jiwon, et al.
Published: (2025)
OpenSeal: Good, Fast, and Cheap Construction of an Open-Source Southeast Asian LLM via Parallel Data
by: Nguyen, Tan Sang, et al.
Published: (2026)
by: Nguyen, Tan Sang, et al.
Published: (2026)
Robust Knowledge Editing via Explicit Reasoning Chains for Distractor-Resilient Multi-Hop QA
by: Wu, Yuchen, et al.
Published: (2025)
by: Wu, Yuchen, et al.
Published: (2025)
Finding the Sweet Spot: Preference Data Construction for Scaling Preference Optimization
by: Xiao, Yao, et al.
Published: (2025)
by: Xiao, Yao, et al.
Published: (2025)
Multi-Agent Sampling: Scaling Inference Compute for Data Synthesis with Tree Search-Based Agentic Collaboration
by: Ye, Hai, et al.
Published: (2024)
by: Ye, Hai, et al.
Published: (2024)
NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts
by: Gupta, Abhay, et al.
Published: (2025)
by: Gupta, Abhay, et al.
Published: (2025)
MoreHopQA: More Than Multi-hop Reasoning
by: Schnitzler, Julian, et al.
Published: (2024)
by: Schnitzler, Julian, et al.
Published: (2024)
Towards Robust Instruction Tuning on Multimodal Large Language Models
by: Han, Wei, et al.
Published: (2024)
by: Han, Wei, et al.
Published: (2024)
Just What You Desire: Constrained Timeline Summarization with Self-Reflection for Enhanced Relevance
by: Qorib, Muhammad Reza, et al.
Published: (2024)
by: Qorib, Muhammad Reza, et al.
Published: (2024)
Lost in the Middle, and In-Between: Enhancing Language Models' Ability to Reason Over Long Contexts in Multi-Hop QA
by: Baker, George Arthur, et al.
Published: (2024)
by: Baker, George Arthur, et al.
Published: (2024)
Efficient and Interpretable Grammatical Error Correction with Mixture of Experts
by: Qorib, Muhammad Reza, et al.
Published: (2024)
by: Qorib, Muhammad Reza, et al.
Published: (2024)
Do Large Language Models Latently Perform Multi-Hop Reasoning?
by: Yang, Sohee, et al.
Published: (2024)
by: Yang, Sohee, et al.
Published: (2024)
Math-LLaVA: Bootstrapping Mathematical Reasoning for Multimodal Large Language Models
by: Shi, Wenhao, et al.
Published: (2024)
by: Shi, Wenhao, et al.
Published: (2024)
RELOOP: Recursive Retrieval with Multi-Hop Reasoner and Planners for Heterogeneous QA
by: Yang, Ruiyi, et al.
Published: (2025)
by: Yang, Ruiyi, et al.
Published: (2025)
Dual Instruction Tuning with Large Language Models for Mathematical Reasoning
by: Zhou, Yongwei, et al.
Published: (2024)
by: Zhou, Yongwei, et al.
Published: (2024)
BaziQA-Benchmark: Evaluating Symbolic and Temporally Compositional Reasoning in Large Language Models
by: Chen, Jiangxi, et al.
Published: (2026)
by: Chen, Jiangxi, et al.
Published: (2026)
FanOutQA: A Multi-Hop, Multi-Document Question Answering Benchmark for Large Language Models
by: Zhu, Andrew, et al.
Published: (2024)
by: Zhu, Andrew, et al.
Published: (2024)
Toward Graph-Tokenizing Large Language Models with Reconstructive Graph Instruction Tuning
by: Zhang, Zhongjian, et al.
Published: (2026)
by: Zhang, Zhongjian, et al.
Published: (2026)
DeepRAG: Integrating Hierarchical Reasoning and Process Supervision for Biomedical Multi-Hop QA
by: Ji, Yuelyu, et al.
Published: (2025)
by: Ji, Yuelyu, et al.
Published: (2025)
Back Attention: Understanding and Enhancing Multi-Hop Reasoning in Large Language Models
by: Yu, Zeping, et al.
Published: (2025)
by: Yu, Zeping, et al.
Published: (2025)
UETQuintet at BioCreative IX -- MedHopQA: Enhancing Biomedical QA with Selective Multi-hop Reasoning and Contextual Retrieval
by: Nguyen, Quoc-An, et al.
Published: (2026)
by: Nguyen, Quoc-An, et al.
Published: (2026)
SlideTailor: Personalized Presentation Slide Generation for Scientific Papers
by: Zeng, Wenzheng, et al.
Published: (2025)
by: Zeng, Wenzheng, et al.
Published: (2025)
Large Language Models Still Face Challenges in Multi-Hop Reasoning with External Knowledge
by: Zhang, Haotong
Published: (2024)
by: Zhang, Haotong
Published: (2024)
Multilingual Jailbreak Challenges in Large Language Models
by: Deng, Yue, et al.
Published: (2023)
by: Deng, Yue, et al.
Published: (2023)
Evaluating Prompt Engineering Techniques for RAG in Small Language Models: A Multi-Hop QA Approach
by: Mohammadi, Amir Hossein, et al.
Published: (2026)
by: Mohammadi, Amir Hossein, et al.
Published: (2026)
Building Instruction-Tuning Datasets from Human-Written Instructions with Open-Weight Large Language Models
by: Ma, Youmi, et al.
Published: (2025)
by: Ma, Youmi, et al.
Published: (2025)
Exploring the Potential of Large Language Models in Computational Argumentation
by: Chen, Guizhen, et al.
Published: (2023)
by: Chen, Guizhen, et al.
Published: (2023)
FocusUI: Efficient UI Grounding via Position-Preserving Visual Token Selection
by: Ouyang, Mingyu, et al.
Published: (2026)
by: Ouyang, Mingyu, et al.
Published: (2026)
Hopping Too Late: Exploring the Limitations of Large Language Models on Multi-Hop Queries
by: Biran, Eden, et al.
Published: (2024)
by: Biran, Eden, et al.
Published: (2024)
Do Large Language Models Perform Latent Multi-Hop Reasoning without Exploiting Shortcuts?
by: Yang, Sohee, et al.
Published: (2024)
by: Yang, Sohee, et al.
Published: (2024)
Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study
by: Khodadad, Mohammad, et al.
Published: (2025)
by: Khodadad, Mohammad, et al.
Published: (2025)
Similar Items
-
Unlocking Temporal Question Answering for Large Language Models with Tailor-Made Reasoning Logic
by: Li, Xingxuan, et al.
Published: (2023) -
Reasoning Models Hallucinate More: Factuality-Aware Reinforcement Learning for Large Reasoning Models
by: Li, Junyi, et al.
Published: (2025) -
Self-Judge: Selective Instruction Following with Alignment Self-Evaluation
by: Ye, Hai, et al.
Published: (2024) -
Parametric Knowledge is Not All You Need: Toward Honest Large Language Models via Retrieval of Pretraining Data
by: Kusuma, Christopher Adrian, et al.
Published: (2026) -
Preference-Guided Reflective Sampling for Aligning Language Models
by: Ye, Hai, et al.
Published: (2024)