Evaluating Robustness of Reasoning Models on Parameterized Logical Problems
Fuente:
arXiv
Salvato in:
| Autori principali: | Es-sebbani, Naïm, Marquer, Esteban, Salhi, Yakoub, Bouraoui, Zied |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Variable Occurrence-Centric Framework for Inconsistency Handling (Extended Version)
di: Salhi, Yakoub
Pubblicazione: (2024)
di: Salhi, Yakoub
Pubblicazione: (2024)
REFINE-LM: Mitigating Language Model Stereotypes via Reinforcement Learning
di: Qureshi, Rameez, et al.
Pubblicazione: (2024)
di: Qureshi, Rameez, et al.
Pubblicazione: (2024)
Towards a Neurosymbolic Reasoning System Grounded in Schematic Representations
di: Olivier, François, et al.
Pubblicazione: (2025)
di: Olivier, François, et al.
Pubblicazione: (2025)
Grounding Agent Reasoning in Image Schemas: A Neurosymbolic Approach to Embodied Cognition
di: Olivier, François, et al.
Pubblicazione: (2025)
di: Olivier, François, et al.
Pubblicazione: (2025)
Skim-Aware Contrastive Learning for Efficient Document Representation
di: Abro, Waheed Ahmed, et al.
Pubblicazione: (2025)
di: Abro, Waheed Ahmed, et al.
Pubblicazione: (2025)
Credal Concept Bottleneck Models for Epistemic-Aleatoric Uncertainty Decomposition
di: Mukherjee, Tanmoy, et al.
Pubblicazione: (2026)
di: Mukherjee, Tanmoy, et al.
Pubblicazione: (2026)
MODE: Multi-Objective Adaptive Coreset Selection
di: Mukherjee, Tanmoy, et al.
Pubblicazione: (2025)
di: Mukherjee, Tanmoy, et al.
Pubblicazione: (2025)
Solving morphological analogies: from retrieval to generation
di: Marquer, Esteban, et al.
Pubblicazione: (2023)
di: Marquer, Esteban, et al.
Pubblicazione: (2023)
Credal Concept Bottleneck Models: Structural Separation of Epistemic and Aleatoric Uncertainty
di: Mukherjee, Tanmoy, et al.
Pubblicazione: (2026)
di: Mukherjee, Tanmoy, et al.
Pubblicazione: (2026)
Vector Field Oriented Diffusion Model for Crystal Material Generation
di: Klipfel, Astrid, et al.
Pubblicazione: (2023)
di: Klipfel, Astrid, et al.
Pubblicazione: (2023)
Generalizing Analogical Inference from Boolean to Continuous Domains
di: Cunha, Francisco, et al.
Pubblicazione: (2025)
di: Cunha, Francisco, et al.
Pubblicazione: (2025)
Modelling Commonsense Commonalities with Multi-Facet Concept Embeddings
di: Kteich, Hanane, et al.
Pubblicazione: (2024)
di: Kteich, Hanane, et al.
Pubblicazione: (2024)
Explanation Quality Assessment as Ranking with Listwise Rewards
di: Bailleux, Thomas, et al.
Pubblicazione: (2026)
di: Bailleux, Thomas, et al.
Pubblicazione: (2026)
Why Deep Jacobian Spectra Separate: Depth-Induced Scaling and Singular-Vector Alignment
di: Haas, Nathanaël, et al.
Pubblicazione: (2026)
di: Haas, Nathanaël, et al.
Pubblicazione: (2026)
Fourier Transformers for Latent Crystallographic Diffusion and Generative Modeling
di: Duersch, Jed A., et al.
Pubblicazione: (2026)
di: Duersch, Jed A., et al.
Pubblicazione: (2026)
Evaluating the Logical Reasoning Abilities of Large Reasoning Models
di: Liu, Hanmeng, et al.
Pubblicazione: (2025)
di: Liu, Hanmeng, et al.
Pubblicazione: (2025)
Cytochemical responses of Hediste diversicolor (Nereidae, Polychaete) sampled from polluted sites along the Tunisian coast
di: Zied Bouraoui
Pubblicazione: (2014)
di: Zied Bouraoui
Pubblicazione: (2014)
Enhancing DR Classification with Swin Transformer and Shifted Window Attention
di: Boulaabi, Meher, et al.
Pubblicazione: (2025)
di: Boulaabi, Meher, et al.
Pubblicazione: (2025)
Dynamical Systems Theory Behind a Hierarchical Reasoning Model
di: Es'kin, Vasiliy A., et al.
Pubblicazione: (2026)
di: Es'kin, Vasiliy A., et al.
Pubblicazione: (2026)
LogicBench: Towards Systematic Evaluation of Logical Reasoning Ability of Large Language Models
di: Parmar, Mihir, et al.
Pubblicazione: (2024)
di: Parmar, Mihir, et al.
Pubblicazione: (2024)
Lost in the Logic: An Evaluation of Large Language Models' Reasoning Capabilities on LSAT Logic Games
di: Malik, Saumya
Pubblicazione: (2024)
di: Malik, Saumya
Pubblicazione: (2024)
Episodic Memories Generation and Evaluation Benchmark for Large Language Models
di: Huet, Alexis, et al.
Pubblicazione: (2025)
di: Huet, Alexis, et al.
Pubblicazione: (2025)
Logic Contrastive Reasoning with Lightweight Large Language Model for Math Word Problems
di: Kai, Ding, et al.
Pubblicazione: (2024)
di: Kai, Ding, et al.
Pubblicazione: (2024)
GLoRE: Evaluating Logical Reasoning of Large Language Models
di: liu, Hanmeng, et al.
Pubblicazione: (2023)
di: liu, Hanmeng, et al.
Pubblicazione: (2023)
Understanding Enthymemes in Argument Maps: Bridging Argument Mining and Logic-based Argumentation
di: Ben-Naim, Jonathan, et al.
Pubblicazione: (2024)
di: Ben-Naim, Jonathan, et al.
Pubblicazione: (2024)
Robust Answers, Fragile Logic: Probing the Decoupling Hypothesis in LLM Reasoning
di: Jiang, Enyi, et al.
Pubblicazione: (2025)
di: Jiang, Enyi, et al.
Pubblicazione: (2025)
$R^2$-Guard: Robust Reasoning Enabled LLM Guardrail via Knowledge-Enhanced Logical Reasoning
di: Kang, Mintong, et al.
Pubblicazione: (2024)
di: Kang, Mintong, et al.
Pubblicazione: (2024)
Assessing and Enhancing the Robustness of Large Language Models with Task Structure Variations for Logical Reasoning
di: Bao, Qiming, et al.
Pubblicazione: (2023)
di: Bao, Qiming, et al.
Pubblicazione: (2023)
MetaLogic: Robustness Evaluation of Text-to-Image Models via Logically Equivalent Prompts
di: Shen, Yifan, et al.
Pubblicazione: (2025)
di: Shen, Yifan, et al.
Pubblicazione: (2025)
Towards Robust Legal Reasoning: Harnessing Logical LLMs in Law
di: Kant, Manuj, et al.
Pubblicazione: (2025)
di: Kant, Manuj, et al.
Pubblicazione: (2025)
PricingLogic: Evaluating LLMs Reasoning on Complex Tourism Pricing Tasks
di: Liu, Yunuo, et al.
Pubblicazione: (2025)
di: Liu, Yunuo, et al.
Pubblicazione: (2025)
HardcoreLogic: Challenging Large Reasoning Models with Long-tail Logic Puzzle Games
di: Liang, Jingcong, et al.
Pubblicazione: (2025)
di: Liang, Jingcong, et al.
Pubblicazione: (2025)
ChatLogic: Integrating Logic Programming with Large Language Models for Multi-Step Reasoning
di: Wang, Zhongsheng, et al.
Pubblicazione: (2024)
di: Wang, Zhongsheng, et al.
Pubblicazione: (2024)
Instantiation-based Formalization of Logical Reasoning Tasks using Language Models and Logical Solvers
di: Raza, Mohammad, et al.
Pubblicazione: (2025)
di: Raza, Mohammad, et al.
Pubblicazione: (2025)
Parameterized Argumentation-based Reasoning Tasks for Benchmarking Generative Language Models
di: Steging, Cor, et al.
Pubblicazione: (2025)
di: Steging, Cor, et al.
Pubblicazione: (2025)
DivLogicEval: A Framework for Benchmarking Logical Reasoning Evaluation in Large Language Models
di: Chung, Tsz Ting, et al.
Pubblicazione: (2025)
di: Chung, Tsz Ting, et al.
Pubblicazione: (2025)
Towards Unifying Perceptual Reasoning and Logical Reasoning
di: Kido, Hiroyuki
Pubblicazione: (2022)
di: Kido, Hiroyuki
Pubblicazione: (2022)
DeltaLogic: Minimal Premise Edits Reveal Belief-Revision Failures in Logical Reasoning Models
di: Dhanda, Amit
Pubblicazione: (2026)
di: Dhanda, Amit
Pubblicazione: (2026)
Problem-Solving Logic Guided Curriculum In-Context Learning for LLMs Complex Reasoning
di: Ma, Xuetao, et al.
Pubblicazione: (2025)
di: Ma, Xuetao, et al.
Pubblicazione: (2025)
Are Large Language Models Really Good Logical Reasoners? A Comprehensive Evaluation and Beyond
di: Xu, Fangzhi, et al.
Pubblicazione: (2023)
di: Xu, Fangzhi, et al.
Pubblicazione: (2023)
Documenti analoghi
-
A Variable Occurrence-Centric Framework for Inconsistency Handling (Extended Version)
di: Salhi, Yakoub
Pubblicazione: (2024) -
REFINE-LM: Mitigating Language Model Stereotypes via Reinforcement Learning
di: Qureshi, Rameez, et al.
Pubblicazione: (2024) -
Towards a Neurosymbolic Reasoning System Grounded in Schematic Representations
di: Olivier, François, et al.
Pubblicazione: (2025) -
Grounding Agent Reasoning in Image Schemas: A Neurosymbolic Approach to Embodied Cognition
di: Olivier, François, et al.
Pubblicazione: (2025) -
Skim-Aware Contrastive Learning for Efficient Document Representation
di: Abro, Waheed Ahmed, et al.
Pubblicazione: (2025)