Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study
Fuente:
arXiv
Saved in:
| Main Authors: | Khodadad, Mohammad, Kasmaee, Ali Shiraee, Astaraki, Mahdi, Sherck, Nicholas, Mahyar, Hamidreza, Samiee, Soheila |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
ChEmbed: Enhancing Chemical Literature Search Through Domain-Specific Text Embeddings
by: Kasmaee, Ali Shiraee, et al.
Published: (2025)
by: Kasmaee, Ali Shiraee, et al.
Published: (2025)
Towards Domain Specification of Embedding Models in Medicine
by: Khodadad, Mohammad, et al.
Published: (2025)
by: Khodadad, Mohammad, et al.
Published: (2025)
When Iterative RAG Beats Ideal Evidence: A Diagnostic Study in Scientific Multi-hop Question Answering
by: Astaraki, Mahdi, et al.
Published: (2026)
by: Astaraki, Mahdi, et al.
Published: (2026)
ChemTEB: Chemical Text Embedding Benchmark, an Overview of Embedding Models Performance & Efficiency on a Specific Domain
by: Kasmaee, Ali Shiraee, et al.
Published: (2024)
by: Kasmaee, Ali Shiraee, et al.
Published: (2024)
Towards Interpreting Language Models: A Case Study in Multi-Hop Reasoning
by: Sakarvadia, Mansi
Published: (2024)
by: Sakarvadia, Mansi
Published: (2024)
Do Large Language Models Latently Perform Multi-Hop Reasoning?
by: Yang, Sohee, et al.
Published: (2024)
by: Yang, Sohee, et al.
Published: (2024)
EPT Benchmark: Evaluation of Persian Trustworthiness in Large Language Models
by: Mirbagheri, Mohammad Reza, et al.
Published: (2025)
by: Mirbagheri, Mohammad Reza, et al.
Published: (2025)
Back Attention: Understanding and Enhancing Multi-Hop Reasoning in Large Language Models
by: Yu, Zeping, et al.
Published: (2025)
by: Yu, Zeping, et al.
Published: (2025)
ToolHop: A Query-Driven Benchmark for Evaluating Large Language Models in Multi-Hop Tool Use
by: Ye, Junjie, et al.
Published: (2025)
by: Ye, Junjie, et al.
Published: (2025)
Large Language Models Still Face Challenges in Multi-Hop Reasoning with External Knowledge
by: Zhang, Haotong
Published: (2024)
by: Zhang, Haotong
Published: (2024)
Hopping Too Late: Exploring the Limitations of Large Language Models on Multi-Hop Queries
by: Biran, Eden, et al.
Published: (2024)
by: Biran, Eden, et al.
Published: (2024)
Do Large Language Models Perform Latent Multi-Hop Reasoning without Exploiting Shortcuts?
by: Yang, Sohee, et al.
Published: (2024)
by: Yang, Sohee, et al.
Published: (2024)
ActiShade: Activating Overshadowed Knowledge to Guide Multi-Hop Reasoning in Large Language Models
by: Ma, Huipeng, et al.
Published: (2026)
by: Ma, Huipeng, et al.
Published: (2026)
Unleashing Multi-Hop Reasoning Potential in Large Language Models through Repetition of Misordered Context
by: Yu, Sangwon, et al.
Published: (2024)
by: Yu, Sangwon, et al.
Published: (2024)
Layer-Order Inversion: Rethinking Latent Multi-Hop Reasoning in Large Language Models
by: Liu, Xukai, et al.
Published: (2026)
by: Liu, Xukai, et al.
Published: (2026)
Scaling Reasoning Hop Exposes Weaknesses: Demystifying and Improving Hop Generalization in Large Language Models
by: Li, Zhaoyi, et al.
Published: (2026)
by: Li, Zhaoyi, et al.
Published: (2026)
Auto-Patching: Enhancing Multi-Hop Reasoning in Language Models
by: Jan, Aviv, et al.
Published: (2025)
by: Jan, Aviv, et al.
Published: (2025)
Making Long-Context Language Models Better Multi-Hop Reasoners
by: Li, Yanyang, et al.
Published: (2024)
by: Li, Yanyang, et al.
Published: (2024)
Effect of Document Packing on the Latent Multi-Hop Reasoning Capabilities of Large Language Models
by: Prato, Gabriele, et al.
Published: (2025)
by: Prato, Gabriele, et al.
Published: (2025)
Hop, Skip, and Overthink: Diagnosing Why Reasoning Models Fumble during Multi-Hop Analysis
by: Yadav, Anushka, et al.
Published: (2025)
by: Yadav, Anushka, et al.
Published: (2025)
Seemingly Plausible Distractors in Multi-Hop Reasoning: Are Large Language Models Attentive Readers?
by: Bhuiya, Neeladri, et al.
Published: (2024)
by: Bhuiya, Neeladri, et al.
Published: (2024)
Not All Jokes Land: Evaluating Large Language Models Understanding of Workplace Humor
by: Shafiei, Mohammadamin, et al.
Published: (2025)
by: Shafiei, Mohammadamin, et al.
Published: (2025)
A User-Centric Multi-Intent Benchmark for Evaluating Large Language Models
by: Wang, Jiayin, et al.
Published: (2024)
by: Wang, Jiayin, et al.
Published: (2024)
Structured Chemistry Reasoning with Large Language Models
by: Ouyang, Siru, et al.
Published: (2023)
by: Ouyang, Siru, et al.
Published: (2023)
Evaluating Prompt Engineering Techniques for RAG in Small Language Models: A Multi-Hop QA Approach
by: Mohammadi, Amir Hossein, et al.
Published: (2026)
by: Mohammadi, Amir Hossein, et al.
Published: (2026)
Cognitive Load Limits in Large Language Models: Benchmarking Multi-Hop Reasoning
by: Adapala, Sai Teja Reddy
Published: (2025)
by: Adapala, Sai Teja Reddy
Published: (2025)
FCMR: Robust Evaluation of Financial Cross-Modal Multi-Hop Reasoning
by: Kim, Seunghee, et al.
Published: (2024)
by: Kim, Seunghee, et al.
Published: (2024)
On the Efficiency of NLP-Inspired Methods for Tabular Deep Learning
by: Thielmann, Anton Frederik, et al.
Published: (2024)
by: Thielmann, Anton Frederik, et al.
Published: (2024)
HopChain: Multi-Hop Data Synthesis for Generalizable Vision-Language Reasoning
by: Wang, Shenzhi, et al.
Published: (2026)
by: Wang, Shenzhi, et al.
Published: (2026)
Investigating Multi-Hop Factual Shortcuts in Knowledge Editing of Large Language Models
by: Ju, Tianjie, et al.
Published: (2024)
by: Ju, Tianjie, et al.
Published: (2024)
Towards Robust Temporal Reasoning of Large Language Models via a Multi-Hop QA Dataset and Pseudo-Instruction Tuning
by: Tan, Qingyu, et al.
Published: (2023)
by: Tan, Qingyu, et al.
Published: (2023)
BioHopR: A Benchmark for Multi-Hop, Multi-Answer Reasoning in Biomedical Domain
by: Kim, Yunsoo, et al.
Published: (2025)
by: Kim, Yunsoo, et al.
Published: (2025)
Enhancing Multi-Hop Fact Verification with Structured Knowledge-Augmented Large Language Models
by: Cao, Han, et al.
Published: (2025)
by: Cao, Han, et al.
Published: (2025)
Right for Right Reasons: Large Language Models for Verifiable Commonsense Knowledge Graph Question Answering
by: Toroghi, Armin, et al.
Published: (2024)
by: Toroghi, Armin, et al.
Published: (2024)
Benchmarking Multi-Image Understanding in Vision and Language Models: Perception, Knowledge, Reasoning, and Multi-Hop Reasoning
by: Zhao, Bingchen, et al.
Published: (2024)
by: Zhao, Bingchen, et al.
Published: (2024)
DocHop-QA: Towards Multi-Hop Reasoning over Multimodal Document Collections
by: Park, Jiwon, et al.
Published: (2025)
by: Park, Jiwon, et al.
Published: (2025)
NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts
by: Gupta, Abhay, et al.
Published: (2025)
by: Gupta, Abhay, et al.
Published: (2025)
MedHopQA: A Disease-Centered Multi-Hop Reasoning Benchmark and Evaluation Framework for LLM-Based Biomedical Question Answering
by: Islamaj, Rezarta, et al.
Published: (2026)
by: Islamaj, Rezarta, et al.
Published: (2026)
HopRAG: Multi-Hop Reasoning for Logic-Aware Retrieval-Augmented Generation
by: Liu, Hao, et al.
Published: (2025)
by: Liu, Hao, et al.
Published: (2025)
Enhancing Reasoning Skills in Small Persian Medical Language Models Can Outperform Large-Scale Data Training
by: Ghassabi, Mehrdad, et al.
Published: (2025)
by: Ghassabi, Mehrdad, et al.
Published: (2025)
Similar Items
-
ChEmbed: Enhancing Chemical Literature Search Through Domain-Specific Text Embeddings
by: Kasmaee, Ali Shiraee, et al.
Published: (2025) -
Towards Domain Specification of Embedding Models in Medicine
by: Khodadad, Mohammad, et al.
Published: (2025) -
When Iterative RAG Beats Ideal Evidence: A Diagnostic Study in Scientific Multi-hop Question Answering
by: Astaraki, Mahdi, et al.
Published: (2026) -
ChemTEB: Chemical Text Embedding Benchmark, an Overview of Embedding Models Performance & Efficiency on a Specific Domain
by: Kasmaee, Ali Shiraee, et al.
Published: (2024) -
Towards Interpreting Language Models: A Case Study in Multi-Hop Reasoning
by: Sakarvadia, Mansi
Published: (2024)