Logic Haystacks: Probing LLMs Long-Context Logical Reasoning (Without Easily Identifiable Unrelated Padding)
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Sileo, Damien |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Scaling Synthetic Logical Reasoning Datasets with Context-Sensitive Declarative Grammars
par: Sileo, Damien
Publié: (2024)
par: Sileo, Damien
Publié: (2024)
Attention Overflow: Language Model Input Blur during Long-Context Missing Items Recommendation
par: Sileo, Damien
Publié: (2024)
par: Sileo, Damien
Publié: (2024)
BABILong: Testing the Limits of LLMs with Long Context Reasoning-in-a-Haystack
par: Kuratov, Yuri, et autres
Publié: (2024)
par: Kuratov, Yuri, et autres
Publié: (2024)
Losing Visual Needles in Image Haystacks: Vision Language Models are Easily Distracted in Short and Long Contexts
par: Sharma, Aditya, et autres
Publié: (2024)
par: Sharma, Aditya, et autres
Publié: (2024)
MortalMATH: Evaluating the Conflict Between Reasoning Objectives and Emergency Contexts
par: Lanzeray, Etienne, et autres
Publié: (2026)
par: Lanzeray, Etienne, et autres
Publié: (2026)
Saturation-Driven Dataset Generation for LLM Mathematical Reasoning in the TPTP Ecosystem
par: Quesnel, Valentin, et autres
Publié: (2025)
par: Quesnel, Valentin, et autres
Publié: (2025)
Reasoning Core: A Scalable RL Environment for LLM Symbolic Reasoning
par: Lacombe, Valentin, et autres
Publié: (2025)
par: Lacombe, Valentin, et autres
Publié: (2025)
Summary of a Haystack: A Challenge to Long-Context LLMs and RAG Systems
par: Laban, Philippe, et autres
Publié: (2024)
par: Laban, Philippe, et autres
Publié: (2024)
Reasoning Core: A Scalable Procedural Data Generation Suite for Symbolic Pre-training and Post-Training
par: Lacombe, Valentin, et autres
Publié: (2026)
par: Lacombe, Valentin, et autres
Publié: (2026)
Boosting Logical Fallacy Reasoning in LLMs via Logical Structure Tree
par: Lei, Yuanyuan, et autres
Publié: (2024)
par: Lei, Yuanyuan, et autres
Publié: (2024)
Logic-of-Thought: Injecting Logic into Contexts for Full Reasoning in Large Language Models
par: Liu, Tongxuan, et autres
Publié: (2024)
par: Liu, Tongxuan, et autres
Publié: (2024)
ZebraLogic: On the Scaling Limits of LLMs for Logical Reasoning
par: Lin, Bill Yuchen, et autres
Publié: (2025)
par: Lin, Bill Yuchen, et autres
Publié: (2025)
Where Reasoning Breaks: Logic-Aware Path Selection by Controlling Logical Connectives in LLMs Reasoning Chains
par: Park, Seunghyun, et autres
Publié: (2026)
par: Park, Seunghyun, et autres
Publié: (2026)
Are LLMs Stable Formal Logic Translators in Logical Reasoning Across Linguistically Diversified Texts?
par: Li, Qingchuan, et autres
Publié: (2025)
par: Li, Qingchuan, et autres
Publié: (2025)
Last Layer Logits to Logic: Empowering LLMs with Logic-Consistent Structured Knowledge Reasoning
par: Li, Songze, et autres
Publié: (2025)
par: Li, Songze, et autres
Publié: (2025)
GOLD PANNING: Strategic Context Shuffling for Needle-in-Haystack Reasoning
par: Byerly, Adam, et autres
Publié: (2025)
par: Byerly, Adam, et autres
Publié: (2025)
Problem-Solving Logic Guided Curriculum In-Context Learning for LLMs Complex Reasoning
par: Ma, Xuetao, et autres
Publié: (2025)
par: Ma, Xuetao, et autres
Publié: (2025)
LLMEval-Logic: A Solver-Verified Chinese Benchmark for Logical Reasoning of LLMs with Adversarial Hardening
par: Zhang, Ming, et autres
Publié: (2026)
par: Zhang, Ming, et autres
Publié: (2026)
LogicVista: Multimodal LLM Logical Reasoning Benchmark in Visual Contexts
par: Xiao, Yijia, et autres
Publié: (2024)
par: Xiao, Yijia, et autres
Publié: (2024)
Haystack Engineering: Context Engineering for Heterogeneous and Agentic Long-Context Evaluation
par: Li, Mufei, et autres
Publié: (2025)
par: Li, Mufei, et autres
Publié: (2025)
NumeroLogic: Number Encoding for Enhanced LLMs' Numerical Reasoning
par: Schwartz, Eli, et autres
Publié: (2024)
par: Schwartz, Eli, et autres
Publié: (2024)
Can LLMs Reason with Rules? Logic Scaffolding for Stress-Testing and Improving LLMs
par: Wang, Siyuan, et autres
Publié: (2024)
par: Wang, Siyuan, et autres
Publié: (2024)
Empowering LLMs with Logical Reasoning: A Comprehensive Survey
par: Cheng, Fengxiang, et autres
Publié: (2025)
par: Cheng, Fengxiang, et autres
Publié: (2025)
Logic-Regularized Verifier Elicits Reasoning from LLMs
par: Wang, Xinyu, et autres
Publié: (2026)
par: Wang, Xinyu, et autres
Publié: (2026)
A Closer Look at Logical Reasoning with LLMs: The Choice of Tool Matters
par: Lam, Long Hei Matthew, et autres
Publié: (2024)
par: Lam, Long Hei Matthew, et autres
Publié: (2024)
Tau-Eval: A Unified Evaluation Framework for Useful and Private Text Anonymization
par: Loiseau, Gabriel, et autres
Publié: (2025)
par: Loiseau, Gabriel, et autres
Publié: (2025)
TAROT: Task-Oriented Authorship Obfuscation Using Policy Optimization Methods
par: Loiseau, Gabriel, et autres
Publié: (2024)
par: Loiseau, Gabriel, et autres
Publié: (2024)
Adaptive Text Anonymization: Learning Privacy-Utility Trade-offs via Prompt Optimization
par: Loiseau, Gabriel, et autres
Publié: (2026)
par: Loiseau, Gabriel, et autres
Publié: (2026)
Distilling Human-Aligned Privacy Sensitivity Assessment from Large Language Models
par: Loiseau, Gabriel, et autres
Publié: (2026)
par: Loiseau, Gabriel, et autres
Publié: (2026)
Michelangelo: Long Context Evaluations Beyond Haystacks via Latent Structure Queries
par: Vodrahalli, Kiran, et autres
Publié: (2024)
par: Vodrahalli, Kiran, et autres
Publié: (2024)
RULEBREAKERS: Challenging LLMs at the Crossroads between Formal Logic and Human-like Reasoning
par: Chan, Jason, et autres
Publié: (2024)
par: Chan, Jason, et autres
Publié: (2024)
LogicReward: Incentivizing LLM Reasoning via Step-Wise Logical Supervision
par: Xu, Jundong, et autres
Publié: (2025)
par: Xu, Jundong, et autres
Publié: (2025)
LogicPro: Improving Complex Logical Reasoning via Program-Guided Learning
par: Jiang, Jin, et autres
Publié: (2024)
par: Jiang, Jin, et autres
Publié: (2024)
MultiZebraLogic: A Multilingual Logical Reasoning Benchmark
par: Bruun, Sofie Helene, et autres
Publié: (2025)
par: Bruun, Sofie Helene, et autres
Publié: (2025)
How susceptible are LLMs to Logical Fallacies?
par: Payandeh, Amirreza, et autres
Publié: (2023)
par: Payandeh, Amirreza, et autres
Publié: (2023)
Reasoning on Multiple Needles In A Haystack
par: Wang, Yidong
Publié: (2025)
par: Wang, Yidong
Publié: (2025)
U-NIAH: Unified RAG and LLM Evaluation for Long Context Needle-In-A-Haystack
par: Gao, Yunfan, et autres
Publié: (2025)
par: Gao, Yunfan, et autres
Publié: (2025)
Logical Phase Transitions: Understanding Collapse in LLM Logical Reasoning
par: Zhang, Xinglang, et autres
Publié: (2026)
par: Zhang, Xinglang, et autres
Publié: (2026)
From Query to Logic: Ontology-Driven Multi-Hop Reasoning in LLMs
par: Bian, Haonan, et autres
Publié: (2025)
par: Bian, Haonan, et autres
Publié: (2025)
SynLogic: Synthesizing Verifiable Reasoning Data at Scale for Learning Logical Reasoning and Beyond
par: Liu, Junteng, et autres
Publié: (2025)
par: Liu, Junteng, et autres
Publié: (2025)
Documents similaires
-
Scaling Synthetic Logical Reasoning Datasets with Context-Sensitive Declarative Grammars
par: Sileo, Damien
Publié: (2024) -
Attention Overflow: Language Model Input Blur during Long-Context Missing Items Recommendation
par: Sileo, Damien
Publié: (2024) -
BABILong: Testing the Limits of LLMs with Long Context Reasoning-in-a-Haystack
par: Kuratov, Yuri, et autres
Publié: (2024) -
Losing Visual Needles in Image Haystacks: Vision Language Models are Easily Distracted in Short and Long Contexts
par: Sharma, Aditya, et autres
Publié: (2024) -
MortalMATH: Evaluating the Conflict Between Reasoning Objectives and Emergency Contexts
par: Lanzeray, Etienne, et autres
Publié: (2026)