Unpacking the Resilience of SNLI Contradiction Examples to Attacks
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Verma, Chetan, Agarwal, Archit |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Atomic-SNLI: Fine-Grained Natural Language Inference through Atomic Fact Decomposition
par: Huang, Minghui
Publié: (2026)
par: Huang, Minghui
Publié: (2026)
Securing Genomic Data Against Inference Attacks in Federated Learning Environments
par: Pathade, Chetan, et autres
Publié: (2025)
par: Pathade, Chetan, et autres
Publié: (2025)
Explanation Generation for Contradiction Reconciliation with LLMs
par: Chan, Jason, et autres
Publié: (2026)
par: Chan, Jason, et autres
Publié: (2026)
The Best Defense is Attack: Repairing Semantics in Textual Adversarial Examples
par: Yang, Heng, et autres
Publié: (2023)
par: Yang, Heng, et autres
Publié: (2023)
Attacking Misinformation Detection Using Adversarial Examples Generated by Language Models
par: Przybyła, Piotr, et autres
Publié: (2024)
par: Przybyła, Piotr, et autres
Publié: (2024)
Robustness of Misinformation Classification Systems to Adversarial Examples Through BeamAttack
par: Fazla, Arnisa, et autres
Publié: (2025)
par: Fazla, Arnisa, et autres
Publié: (2025)
destroR: Attacking Transfer Models with Obfuscous Examples to Discard Perplexity
par: Ahmed, Saadat Rafid, et autres
Publié: (2025)
par: Ahmed, Saadat Rafid, et autres
Publié: (2025)
A Straightforward Pipeline for Targeted Entailment and Contradiction Detection
par: Sulc, Antonin
Publié: (2025)
par: Sulc, Antonin
Publié: (2025)
ContraDoc: Understanding Self-Contradictions in Documents with Large Language Models
par: Li, Jierui, et autres
Publié: (2023)
par: Li, Jierui, et autres
Publié: (2023)
SparseCL: Sparse Contrastive Learning for Contradiction Retrieval
par: Xu, Haike, et autres
Publié: (2024)
par: Xu, Haike, et autres
Publié: (2024)
ContraSolver: Self-Alignment of Language Models by Resolving Internal Preference Contradictions
par: Zhang, Xu, et autres
Publié: (2024)
par: Zhang, Xu, et autres
Publié: (2024)
Red Teaming the Mind of the Machine: A Systematic Evaluation of Prompt Injection and Jailbreak Vulnerabilities in LLMs
par: Pathade, Chetan
Publié: (2025)
par: Pathade, Chetan
Publié: (2025)
HealthContradict: Evaluating Biomedical Knowledge Conflicts in Language Models
par: Zhang, Boya, et autres
Publié: (2025)
par: Zhang, Boya, et autres
Publié: (2025)
Cracking the Code of Juxtaposition: Can AI Models Understand the Humorous Contradictions
par: Hu, Zhe, et autres
Publié: (2024)
par: Hu, Zhe, et autres
Publié: (2024)
Measuring and Mitigating Toxicity in Large Language Models: A Comprehensive Replication Study
par: Surana, Mokshit, et autres
Publié: (2026)
par: Surana, Mokshit, et autres
Publié: (2026)
Large Language Models as an Indirect Reasoner: Contrapositive and Contradiction for Automated Reasoning
par: Zhang, Yanfang, et autres
Publié: (2024)
par: Zhang, Yanfang, et autres
Publié: (2024)
Unpacking Ambiguity: The Interaction of Polysemous Discourse Markers and Non-DM Signals
par: Wu, Jingni, et autres
Publié: (2025)
par: Wu, Jingni, et autres
Publié: (2025)
Homograph Attacks on Maghreb Sentiment Analyzers
par: Qachfar, Fatima Zahra, et autres
Publié: (2024)
par: Qachfar, Fatima Zahra, et autres
Publié: (2024)
When Reviews Disagree: Fine-Grained Contradiction Analysis in Scientific Peer Reviews
par: Kumar, Sandeep, et autres
Publié: (2026)
par: Kumar, Sandeep, et autres
Publié: (2026)
LLM-based Extraction of Contradictions from Patents
par: Trapp, Stefan, et autres
Publié: (2024)
par: Trapp, Stefan, et autres
Publié: (2024)
Unpacking DPO and PPO: Disentangling Best Practices for Learning from Preference Feedback
par: Ivison, Hamish, et autres
Publié: (2024)
par: Ivison, Hamish, et autres
Publié: (2024)
Framing Social Movements on Social Media: Unpacking Diagnostic, Prognostic, and Motivational Strategies
par: Mendelsohn, Julia, et autres
Publié: (2024)
par: Mendelsohn, Julia, et autres
Publié: (2024)
Arithmetics-Based Decomposition of Numeral Words -- Arithmetic Conditions give the Unpacking Strategy
par: Maier, Isidor Konrad, et autres
Publié: (2023)
par: Maier, Isidor Konrad, et autres
Publié: (2023)
Reasoning Trajectories for Socratic Debugging of Student Code: From Misconceptions to Contradictions and Updated Beliefs
par: Al-Hossami, Erfan, et autres
Publié: (2025)
par: Al-Hossami, Erfan, et autres
Publié: (2025)
Contradiction Detection in RAG Systems: Evaluating LLMs as Context Validators for Improved Information Consistency
par: Gokul, Vignesh, et autres
Publié: (2025)
par: Gokul, Vignesh, et autres
Publié: (2025)
Not All Demonstration Examples are Equally Beneficial: Reweighting Demonstration Examples for In-Context Learning
par: Yang, Zhe, et autres
Publié: (2023)
par: Yang, Zhe, et autres
Publié: (2023)
Contradiction to Consensus: Dual Perspective, Multi Source Retrieval Based Claim Verification with Source Level Disagreement using LLM
par: Biswas, Md Badsha, et autres
Publié: (2026)
par: Biswas, Md Badsha, et autres
Publié: (2026)
Unpacking Robustness in Inflectional Languages: Adversarial Evaluation and Mechanistic Insights
par: Walkowiak, Paweł, et autres
Publié: (2025)
par: Walkowiak, Paweł, et autres
Publié: (2025)
Tailored Truths: Optimizing LLM Persuasion with Personalization and Fabricated Statistics
par: Timm, Jasper, et autres
Publié: (2025)
par: Timm, Jasper, et autres
Publié: (2025)
On the Overscaling Curse of Parallel Thinking: System Efficacy Contradicts Sample Efficiency
par: Wang, Yiming, et autres
Publié: (2026)
par: Wang, Yiming, et autres
Publié: (2026)
Residual Drift Dominates Contradiction in Multi-Turn Constraint Reasoning
par: Kawada, Sebastien
Publié: (2026)
par: Kawada, Sebastien
Publié: (2026)
Model Editing with Canonical Examples
par: Hewitt, John, et autres
Publié: (2024)
par: Hewitt, John, et autres
Publié: (2024)
Towards Data-Centric RLHF: Simple Metrics for Preference Dataset Comparison
par: Shen, Judy Hanwen, et autres
Publié: (2024)
par: Shen, Judy Hanwen, et autres
Publié: (2024)
IM-Unpack: Training and Inference with Arbitrarily Low Precision Integers
par: Zeng, Zhanpeng, et autres
Publié: (2024)
par: Zeng, Zhanpeng, et autres
Publié: (2024)
Unpacking Human Preference for LLMs: Demographically Aware Evaluation with the HUMAINE Framework
par: Petrova, Nora, et autres
Publié: (2026)
par: Petrova, Nora, et autres
Publié: (2026)
GraphemeAug: A Systematic Approach to Synthesized Hard Negative Keyword Spotting Examples
par: Zhang, Harry, et autres
Publié: (2025)
par: Zhang, Harry, et autres
Publié: (2025)
Not the Example, but the Process: How Self-Generated Examples Enhance LLM Reasoning
par: Gwak, Daehoon, et autres
Publié: (2026)
par: Gwak, Daehoon, et autres
Publié: (2026)
Identification of Entailment and Contradiction Relations between Natural Language Sentences: A Neurosymbolic Approach
par: Feng, Xuyao, et autres
Publié: (2024)
par: Feng, Xuyao, et autres
Publié: (2024)
Towards LLM Unlearning Resilient to Relearning Attacks: A Sharpness-Aware Minimization Perspective and Beyond
par: Fan, Chongyu, et autres
Publié: (2025)
par: Fan, Chongyu, et autres
Publié: (2025)
In-Context Example Ordering Guided by Label Distributions
par: Xu, Zhichao, et autres
Publié: (2024)
par: Xu, Zhichao, et autres
Publié: (2024)
Documents similaires
-
Atomic-SNLI: Fine-Grained Natural Language Inference through Atomic Fact Decomposition
par: Huang, Minghui
Publié: (2026) -
Securing Genomic Data Against Inference Attacks in Federated Learning Environments
par: Pathade, Chetan, et autres
Publié: (2025) -
Explanation Generation for Contradiction Reconciliation with LLMs
par: Chan, Jason, et autres
Publié: (2026) -
The Best Defense is Attack: Repairing Semantics in Textual Adversarial Examples
par: Yang, Heng, et autres
Publié: (2023) -
Attacking Misinformation Detection Using Adversarial Examples Generated by Language Models
par: Przybyła, Piotr, et autres
Publié: (2024)