Battling Misinformation: An Empirical Study on Adversarial Factuality in Open-Source Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Sakib, Shahnewaz Karim, Das, Anindya Bijoy, Ahmed, Shibbir |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Hallucinations and Key Information Extraction in Medical Texts: A Comprehensive Assessment of Open-Source Large Language Models
von: Das, Anindya Bijoy, et al.
Veröffentlicht: (2025)
von: Das, Anindya Bijoy, et al.
Veröffentlicht: (2025)
Trustworthy Medical Imaging with Large Language Models: A Study of Hallucinations Across Modalities
von: Das, Anindya Bijoy, et al.
Veröffentlicht: (2025)
von: Das, Anindya Bijoy, et al.
Veröffentlicht: (2025)
Can Large Language Models Challenge CNNs in Medical Image Analysis?
von: Ahmed, Shibbir, et al.
Veröffentlicht: (2025)
von: Ahmed, Shibbir, et al.
Veröffentlicht: (2025)
Unveiling and Mitigating Bias in Large Language Model Recommendations: A Path to Fairness
von: Das, Anindya Bijoy, et al.
Veröffentlicht: (2024)
von: Das, Anindya Bijoy, et al.
Veröffentlicht: (2024)
SOS! Soft Prompt Attack Against Open-Source Large Language Models
von: Yang, Ziqing, et al.
Veröffentlicht: (2024)
von: Yang, Ziqing, et al.
Veröffentlicht: (2024)
FakeZero: Real-Time, Privacy-Preserving Misinformation Detection for Facebook and X
von: Essahli, Soufiane, et al.
Veröffentlicht: (2025)
von: Essahli, Soufiane, et al.
Veröffentlicht: (2025)
Learning-Based Automated Adversarial Red-Teaming for Robustness Evaluation of Large Language Models
von: Wei, Zhang, et al.
Veröffentlicht: (2025)
von: Wei, Zhang, et al.
Veröffentlicht: (2025)
SequentialBreak: Large Language Models Can be Fooled by Embedding Jailbreak Prompts into Sequential Prompt Chains
von: Saiem, Bijoy Ahmed, et al.
Veröffentlicht: (2024)
von: Saiem, Bijoy Ahmed, et al.
Veröffentlicht: (2024)
Provably Robust Watermarks for Open-Source Language Models
von: Christ, Miranda, et al.
Veröffentlicht: (2024)
von: Christ, Miranda, et al.
Veröffentlicht: (2024)
OpenGuardrails: A Configurable, Unified, and Scalable Guardrails Platform for Large Language Models
von: Wang, Thomas, et al.
Veröffentlicht: (2025)
von: Wang, Thomas, et al.
Veröffentlicht: (2025)
Injecting Falsehoods: Adversarial Man-in-the-Middle Attacks Undermining Factual Recall in LLMs
von: Fastowski, Alina, et al.
Veröffentlicht: (2025)
von: Fastowski, Alina, et al.
Veröffentlicht: (2025)
Lateral Phishing With Large Language Models: A Large Organization Comparative Study
von: Bethany, Mazal, et al.
Veröffentlicht: (2024)
von: Bethany, Mazal, et al.
Veröffentlicht: (2024)
Large Language Model Sentinel: LLM Agent for Adversarial Purification
von: Lin, Guang, et al.
Veröffentlicht: (2024)
von: Lin, Guang, et al.
Veröffentlicht: (2024)
Hijacking Large Language Models via Adversarial In-Context Learning
von: Zhou, Xiangyu, et al.
Veröffentlicht: (2023)
von: Zhou, Xiangyu, et al.
Veröffentlicht: (2023)
Data Defenses Against Large Language Models
von: Agnew, William, et al.
Veröffentlicht: (2024)
von: Agnew, William, et al.
Veröffentlicht: (2024)
Factuality Beyond Coherence: Evaluating LLM Watermarking Methods for Medical Texts
von: Hastuti, Rochana Prih, et al.
Veröffentlicht: (2025)
von: Hastuti, Rochana Prih, et al.
Veröffentlicht: (2025)
FFT: Towards Harmlessness Evaluation and Analysis for LLMs with Factuality, Fairness, Toxicity
von: Cui, Shiyao, et al.
Veröffentlicht: (2023)
von: Cui, Shiyao, et al.
Veröffentlicht: (2023)
Adversarial Attack on Large Language Models using Exponentiated Gradient Descent
von: Biswas, Sajib, et al.
Veröffentlicht: (2025)
von: Biswas, Sajib, et al.
Veröffentlicht: (2025)
Advancing Adversarial Suffix Transfer Learning on Aligned Large Language Models
von: Liu, Hongfu, et al.
Veröffentlicht: (2024)
von: Liu, Hongfu, et al.
Veröffentlicht: (2024)
Multi-Granularity Tibetan Textual Adversarial Attack Method Based on Masked Language Model
von: Cao, Xi, et al.
Veröffentlicht: (2024)
von: Cao, Xi, et al.
Veröffentlicht: (2024)
PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts
von: Zhu, Kaijie, et al.
Veröffentlicht: (2023)
von: Zhu, Kaijie, et al.
Veröffentlicht: (2023)
Towards Safe AI Clinicians: A Comprehensive Study on Large Language Model Jailbreaking in Healthcare
von: Zhang, Hang, et al.
Veröffentlicht: (2025)
von: Zhang, Hang, et al.
Veröffentlicht: (2025)
Copyright Traps for Large Language Models
von: Meeus, Matthieu, et al.
Veröffentlicht: (2024)
von: Meeus, Matthieu, et al.
Veröffentlicht: (2024)
Jailbreaking Large Language Models Through Content Concretization
von: Wahréus, Johan, et al.
Veröffentlicht: (2025)
von: Wahréus, Johan, et al.
Veröffentlicht: (2025)
Is Your Prompt Safe? Investigating Prompt Injection Attacks Against Open-Source LLMs
von: Wang, Jiawen, et al.
Veröffentlicht: (2025)
von: Wang, Jiawen, et al.
Veröffentlicht: (2025)
Security and Privacy Challenges of Large Language Models: A Survey
von: Das, Badhan Chandra, et al.
Veröffentlicht: (2024)
von: Das, Badhan Chandra, et al.
Veröffentlicht: (2024)
Mark Your LLM: Detecting the Misuse of Open-Source Large Language Models via Watermarking
von: Xu, Yijie, et al.
Veröffentlicht: (2025)
von: Xu, Yijie, et al.
Veröffentlicht: (2025)
Imposter.AI: Adversarial Attacks with Hidden Intentions towards Aligned Large Language Models
von: Liu, Xiao, et al.
Veröffentlicht: (2024)
von: Liu, Xiao, et al.
Veröffentlicht: (2024)
Yet Another Watermark for Large Language Models
von: Bao, Siyuan, et al.
Veröffentlicht: (2025)
von: Bao, Siyuan, et al.
Veröffentlicht: (2025)
Token-Level Privacy in Large Language Models
von: Harel, Re'em, et al.
Veröffentlicht: (2025)
von: Harel, Re'em, et al.
Veröffentlicht: (2025)
Large Language Models as Carriers of Hidden Messages
von: Hoscilowicz, Jakub, et al.
Veröffentlicht: (2024)
von: Hoscilowicz, Jakub, et al.
Veröffentlicht: (2024)
Pay Attention to the Robustness of Chinese Minority Language Models! Syllable-level Textual Adversarial Attack on Tibetan Script
von: Cao, Xi, et al.
Veröffentlicht: (2024)
von: Cao, Xi, et al.
Veröffentlicht: (2024)
Majority Bit-Aware Watermarking For Large Language Models
von: Xu, Jiahao, et al.
Veröffentlicht: (2025)
von: Xu, Jiahao, et al.
Veröffentlicht: (2025)
Privacy-Preserving Instructions for Aligning Large Language Models
von: Yu, Da, et al.
Veröffentlicht: (2024)
von: Yu, Da, et al.
Veröffentlicht: (2024)
Prompt Stealing Attacks Against Large Language Models
von: Sha, Zeyang, et al.
Veröffentlicht: (2024)
von: Sha, Zeyang, et al.
Veröffentlicht: (2024)
Empirical Analysis of Large Vision-Language Models against Goal Hijacking via Visual Prompt Injection
von: Kimura, Subaru, et al.
Veröffentlicht: (2024)
von: Kimura, Subaru, et al.
Veröffentlicht: (2024)
Resource Consumption Red-Teaming for Large Vision-Language Models
von: Gao, Haoran, et al.
Veröffentlicht: (2025)
von: Gao, Haoran, et al.
Veröffentlicht: (2025)
EPT Benchmark: Evaluation of Persian Trustworthiness in Large Language Models
von: Mirbagheri, Mohammad Reza, et al.
Veröffentlicht: (2025)
von: Mirbagheri, Mohammad Reza, et al.
Veröffentlicht: (2025)
InfoFlood: Jailbreaking Large Language Models with Information Overload
von: Yadav, Advait, et al.
Veröffentlicht: (2025)
von: Yadav, Advait, et al.
Veröffentlicht: (2025)
garak: A Framework for Security Probing Large Language Models
von: Derczynski, Leon, et al.
Veröffentlicht: (2024)
von: Derczynski, Leon, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Hallucinations and Key Information Extraction in Medical Texts: A Comprehensive Assessment of Open-Source Large Language Models
von: Das, Anindya Bijoy, et al.
Veröffentlicht: (2025) -
Trustworthy Medical Imaging with Large Language Models: A Study of Hallucinations Across Modalities
von: Das, Anindya Bijoy, et al.
Veröffentlicht: (2025) -
Can Large Language Models Challenge CNNs in Medical Image Analysis?
von: Ahmed, Shibbir, et al.
Veröffentlicht: (2025) -
Unveiling and Mitigating Bias in Large Language Model Recommendations: A Path to Fairness
von: Das, Anindya Bijoy, et al.
Veröffentlicht: (2024) -
SOS! Soft Prompt Attack Against Open-Source Large Language Models
von: Yang, Ziqing, et al.
Veröffentlicht: (2024)