Topological Signatures of Adversaries in Multimodal Alignments
Fuente:
arXiv
Salvato in:
| Autori principali: | Vu, Minh, Zollicoffer, Geigh, Mai, Huy, Nebgen, Ben, Alexandrov, Boian, Bhattarai, Manish |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LoRID: Low-Rank Iterative Diffusion for Adversarial Purification
di: Zollicoffer, Geigh, et al.
Pubblicazione: (2024)
di: Zollicoffer, Geigh, et al.
Pubblicazione: (2024)
LaFA: Latent Feature Attacks on Non-negative Matrix Factorization
di: Vu, Minh, et al.
Pubblicazione: (2024)
di: Vu, Minh, et al.
Pubblicazione: (2024)
MTRE: Multi-Token Reliability Estimation for Hallucination Detection in VLMs
di: Zollicoffer, Geigh, et al.
Pubblicazione: (2025)
di: Zollicoffer, Geigh, et al.
Pubblicazione: (2025)
HalluField: Detecting LLM Hallucinations via Field-Theoretic Modeling
di: Vu, Minh, et al.
Pubblicazione: (2025)
di: Vu, Minh, et al.
Pubblicazione: (2025)
Trustworthy Agentic AI Requires Deterministic Architectural Boundaries
di: Bhattarai, Manish, et al.
Pubblicazione: (2026)
di: Bhattarai, Manish, et al.
Pubblicazione: (2026)
Frequency-Domain Regularized Adversarial Alignment for Transferable Attacks against Closed-Source MLLMs
di: Yuan, Leitao, et al.
Pubblicazione: (2026)
di: Yuan, Leitao, et al.
Pubblicazione: (2026)
Medusa: Cross-Modal Transferable Adversarial Attacks on Multimodal Medical Retrieval-Augmented Generation
di: Shang, Yingjia, et al.
Pubblicazione: (2025)
di: Shang, Yingjia, et al.
Pubblicazione: (2025)
Sanity Checks for Long-Form Hallucination Detection
di: Zollicoffer, Geigh, et al.
Pubblicazione: (2026)
di: Zollicoffer, Geigh, et al.
Pubblicazione: (2026)
Unforgeable Watermarks for Language Models via Robust Signatures
di: Lin, Huijia, et al.
Pubblicazione: (2026)
di: Lin, Huijia, et al.
Pubblicazione: (2026)
Vision Transformer with Adversarial Indicator Token against Adversarial Attacks in Radio Signal Classifications
di: Zhang, Lu, et al.
Pubblicazione: (2025)
di: Zhang, Lu, et al.
Pubblicazione: (2025)
Self-interpreting Adversarial Images
di: Zhang, Tingwei, et al.
Pubblicazione: (2024)
di: Zhang, Tingwei, et al.
Pubblicazione: (2024)
Large Empirical Case Study: Go-Explore adapted for AI Red Team Testing
di: Bhatt, Manish, et al.
Pubblicazione: (2025)
di: Bhatt, Manish, et al.
Pubblicazione: (2025)
From Federated Learning to Quantum Federated Learning for Space-Air-Ground Integrated Networks
di: Quy, Vu Khanh, et al.
Pubblicazione: (2024)
di: Quy, Vu Khanh, et al.
Pubblicazione: (2024)
Are Robust LLM Fingerprints Adversarially Robust?
di: Nasery, Anshul, et al.
Pubblicazione: (2025)
di: Nasery, Anshul, et al.
Pubblicazione: (2025)
Investigating the Impact of Quantization on Adversarial Robustness
di: Li, Qun, et al.
Pubblicazione: (2024)
di: Li, Qun, et al.
Pubblicazione: (2024)
Adversarial Illusions in Multi-Modal Embeddings
di: Zhang, Tingwei, et al.
Pubblicazione: (2023)
di: Zhang, Tingwei, et al.
Pubblicazione: (2023)
Adversarial Machine Learning Threats to Spacecraft
di: Thummala, Rajiv, et al.
Pubblicazione: (2024)
di: Thummala, Rajiv, et al.
Pubblicazione: (2024)
Mitigating the Structural Bias in Graph Adversarial Defenses
di: Fang, Junyuan, et al.
Pubblicazione: (2025)
di: Fang, Junyuan, et al.
Pubblicazione: (2025)
Untargeted Adversarial Attack on Knowledge Graph Embeddings
di: Zhao, Tianzhe, et al.
Pubblicazione: (2024)
di: Zhao, Tianzhe, et al.
Pubblicazione: (2024)
On the Robustness of Bayesian Neural Networks to Adversarial Attacks
di: Bortolussi, Luca, et al.
Pubblicazione: (2022)
di: Bortolussi, Luca, et al.
Pubblicazione: (2022)
Adversarial Attacks on Transformers-Based Malware Detectors
di: Jakhotiya, Yash, et al.
Pubblicazione: (2022)
di: Jakhotiya, Yash, et al.
Pubblicazione: (2022)
Relationship between Uncertainty in DNNs and Adversarial Attacks
di: Ogonna, Mabel, et al.
Pubblicazione: (2024)
di: Ogonna, Mabel, et al.
Pubblicazione: (2024)
Diffusion-based Adversarial Purification for Intrusion Detection
di: Merzouk, Mohamed Amine, et al.
Pubblicazione: (2024)
di: Merzouk, Mohamed Amine, et al.
Pubblicazione: (2024)
Extending XReason: Formal Explanations for Adversarial Detection
di: Jemaa, Amira, et al.
Pubblicazione: (2024)
di: Jemaa, Amira, et al.
Pubblicazione: (2024)
Adversaries Can Misuse Combinations of Safe Models
di: Jones, Erik, et al.
Pubblicazione: (2024)
di: Jones, Erik, et al.
Pubblicazione: (2024)
Generating Adversarial Point Clouds Using Diffusion Model
di: Zhao, Ruiyang, et al.
Pubblicazione: (2025)
di: Zhao, Ruiyang, et al.
Pubblicazione: (2025)
FlowPure: Continuous Normalizing Flows for Adversarial Purification
di: Collaert, Elias, et al.
Pubblicazione: (2025)
di: Collaert, Elias, et al.
Pubblicazione: (2025)
Quantifying the Noise of Structural Perturbations on Graph Adversarial Attacks
di: Fang, Junyuan, et al.
Pubblicazione: (2025)
di: Fang, Junyuan, et al.
Pubblicazione: (2025)
PEAS: A Strategy for Crafting Transferable Adversarial Examples
di: Avraham, Bar, et al.
Pubblicazione: (2024)
di: Avraham, Bar, et al.
Pubblicazione: (2024)
Information Theoretic Adversarial Training of Large Language Models
di: Zhang, Yiwei, et al.
Pubblicazione: (2026)
di: Zhang, Yiwei, et al.
Pubblicazione: (2026)
Variational Randomized Smoothing for Sample-Wise Adversarial Robustness
di: Hase, Ryo, et al.
Pubblicazione: (2024)
di: Hase, Ryo, et al.
Pubblicazione: (2024)
No More, No Less: Task Alignment in Terminal Agents
di: Mavali, Sina, et al.
Pubblicazione: (2026)
di: Mavali, Sina, et al.
Pubblicazione: (2026)
Leveraging RAG for Training-Free Alignment of LLMs
di: Halloran, John T.
Pubblicazione: (2026)
di: Halloran, John T.
Pubblicazione: (2026)
Attacks and Defenses for Generative Diffusion Models: A Comprehensive Survey
di: Truong, Vu Tuan, et al.
Pubblicazione: (2024)
di: Truong, Vu Tuan, et al.
Pubblicazione: (2024)
Embedding Hidden Adversarial Capabilities in Pre-Trained Diffusion Models
di: Beerens, Lucas, et al.
Pubblicazione: (2025)
di: Beerens, Lucas, et al.
Pubblicazione: (2025)
Explainable Transformer-Based Email Phishing Classification with Adversarial Robustness
di: P, Sajad U
Pubblicazione: (2025)
di: P, Sajad U
Pubblicazione: (2025)
Perturbation Towards Easy Samples Improves Targeted Adversarial Transferability
di: Gao, Junqi, et al.
Pubblicazione: (2024)
di: Gao, Junqi, et al.
Pubblicazione: (2024)
Disttack: Graph Adversarial Attacks Toward Distributed GNN Training
di: Zhang, Yuxiang, et al.
Pubblicazione: (2024)
di: Zhang, Yuxiang, et al.
Pubblicazione: (2024)
Empirical Analysis of Adversarial Robustness and Explainability Drift in Cybersecurity Classifiers
di: Rajhans, Mona, et al.
Pubblicazione: (2026)
di: Rajhans, Mona, et al.
Pubblicazione: (2026)
Privacy-Preserving Federated Learning via Homomorphic Adversarial Networks
di: Dong, Wenhan, et al.
Pubblicazione: (2024)
di: Dong, Wenhan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
LoRID: Low-Rank Iterative Diffusion for Adversarial Purification
di: Zollicoffer, Geigh, et al.
Pubblicazione: (2024) -
LaFA: Latent Feature Attacks on Non-negative Matrix Factorization
di: Vu, Minh, et al.
Pubblicazione: (2024) -
MTRE: Multi-Token Reliability Estimation for Hallucination Detection in VLMs
di: Zollicoffer, Geigh, et al.
Pubblicazione: (2025) -
HalluField: Detecting LLM Hallucinations via Field-Theoretic Modeling
di: Vu, Minh, et al.
Pubblicazione: (2025) -
Trustworthy Agentic AI Requires Deterministic Architectural Boundaries
di: Bhattarai, Manish, et al.
Pubblicazione: (2026)