Guardado en:
| Autores principales: | Thaker, Pratiksha, Maurya, Yash, Hu, Shengyuan, Wu, Zhiwei Steven, Smith, Virginia |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2403.03329 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Position: LLM Unlearning Benchmarks are Weak Measures of Progress
por: Thaker, Pratiksha, et al.
Publicado: (2024)
por: Thaker, Pratiksha, et al.
Publicado: (2024)
BLUR: A Benchmark for LLM Unlearning Robust to Forget-Retain Overlap
por: Hu, Shengyuan, et al.
Publicado: (2025)
por: Hu, Shengyuan, et al.
Publicado: (2025)
SAEs $\textit{Can}$ Improve Unlearning: Dynamic Sparse Autoencoder Guardrails for Precision Unlearning in LLMs
por: Muhamed, Aashiq, et al.
Publicado: (2025)
por: Muhamed, Aashiq, et al.
Publicado: (2025)
Unlearning or Obfuscating? Jogging the Memory of Unlearned LLMs via Benign Relearning
por: Hu, Shengyuan, et al.
Publicado: (2024)
por: Hu, Shengyuan, et al.
Publicado: (2024)
Membership Inference Attacks for Unseen Classes
por: Thaker, Pratiksha, et al.
Publicado: (2025)
por: Thaker, Pratiksha, et al.
Publicado: (2025)
On the Benefits of Public Representations for Private Transfer Learning under Distribution Shift
por: Thaker, Pratiksha, et al.
Publicado: (2023)
por: Thaker, Pratiksha, et al.
Publicado: (2023)
Enhancing One-run Privacy Auditing with Quantile Regression-Based Membership Inference
por: Liu, Terrance, et al.
Publicado: (2025)
por: Liu, Terrance, et al.
Publicado: (2025)
PARALLELPROMPT: Extracting Parallelism from Large Language Model Queries
por: Kolawole, Steven, et al.
Publicado: (2025)
por: Kolawole, Steven, et al.
Publicado: (2025)
Unlearned but Not Forgotten: Data Extraction after Exact Unlearning in LLM
por: Wu, Xiaoyu, et al.
Publicado: (2025)
por: Wu, Xiaoyu, et al.
Publicado: (2025)
No Free Lunch in LLM Watermarking: Trade-offs in Watermarking Design Choices
por: Pang, Qi, et al.
Publicado: (2024)
por: Pang, Qi, et al.
Publicado: (2024)
Generate-then-Verify: Reconstructing Data from Limited Published Statistics
por: Liu, Terrance, et al.
Publicado: (2025)
por: Liu, Terrance, et al.
Publicado: (2025)
UnStar: Unlearning with Self-Taught Anti-Sample Reasoning for LLMs
por: Sinha, Yash, et al.
Publicado: (2024)
por: Sinha, Yash, et al.
Publicado: (2024)
AI Governance and Accountability: An Analysis of Anthropic's Claude
por: Priyanshu, Aman, et al.
Publicado: (2024)
por: Priyanshu, Aman, et al.
Publicado: (2024)
Bypassing Safety Guardrails in LLMs Using Humor
por: Cisneros-Velarde, Pedro
Publicado: (2025)
por: Cisneros-Velarde, Pedro
Publicado: (2025)
LLM-Based Persuasion Enables Guardrail Override in Frontier LLMs
por: Nogueira, Rodrigo, et al.
Publicado: (2026)
por: Nogueira, Rodrigo, et al.
Publicado: (2026)
Knowledge Distillation with Structured Chain-of-Thought for Text-to-SQL
por: Thaker, Khushboo, et al.
Publicado: (2025)
por: Thaker, Khushboo, et al.
Publicado: (2025)
Unlearning Isn't Deletion: Investigating Reversibility of Machine Unlearning in LLMs
por: Xu, Xiaoyu, et al.
Publicado: (2025)
por: Xu, Xiaoyu, et al.
Publicado: (2025)
Is Safer Better? The Impact of Guardrails on the Argumentative Strength of LLMs in Hate Speech Countering
por: Bonaldi, Helena, et al.
Publicado: (2024)
por: Bonaldi, Helena, et al.
Publicado: (2024)
Gradient-Controlled Decoding: A Safety Guardrail for LLMs with Dual-Anchor Steering
por: Chiniya, Purva, et al.
Publicado: (2026)
por: Chiniya, Purva, et al.
Publicado: (2026)
Learning-Time Encoding Shapes Unlearning in LLMs
por: Wu, Ruihan, et al.
Publicado: (2025)
por: Wu, Ruihan, et al.
Publicado: (2025)
Semantic Agreement Enables Efficient Open-Ended LLM Cascades
por: Soiffer, Duncan, et al.
Publicado: (2025)
por: Soiffer, Duncan, et al.
Publicado: (2025)
Building Guardrails for Large Language Models
por: Dong, Yi, et al.
Publicado: (2024)
por: Dong, Yi, et al.
Publicado: (2024)
Trust-Oriented Adaptive Guardrails for Large Language Models
por: Hu, Jinwei, et al.
Publicado: (2024)
por: Hu, Jinwei, et al.
Publicado: (2024)
Persona-Augmented Benchmarking: Evaluating LLMs Across Diverse Writing Styles
por: Truong, Kimberly Le, et al.
Publicado: (2025)
por: Truong, Kimberly Le, et al.
Publicado: (2025)
Leverage Unlearning to Sanitize LLMs
por: Boutet, Antoine, et al.
Publicado: (2025)
por: Boutet, Antoine, et al.
Publicado: (2025)
Intrinsic Guardrails: How Semantic Geometry of Personality Interacts with Emergent Misalignment in LLMs
por: Aneja, Krishak, et al.
Publicado: (2026)
por: Aneja, Krishak, et al.
Publicado: (2026)
Everybody Prune Now: Structured Pruning of LLMs with only Forward Passes
por: Kolawole, Steven, et al.
Publicado: (2024)
por: Kolawole, Steven, et al.
Publicado: (2024)
Eight Methods to Evaluate Robust Unlearning in LLMs
por: Lynch, Aengus, et al.
Publicado: (2024)
por: Lynch, Aengus, et al.
Publicado: (2024)
Unlearning in LLMs: Methods, Evaluation, and Open Challenges
por: Lizzo, Tyler, et al.
Publicado: (2026)
por: Lizzo, Tyler, et al.
Publicado: (2026)
Alto: Orchestrating Distributed Compound AI Systems with Nested Ancestry
por: Raghavan, Deepti, et al.
Publicado: (2024)
por: Raghavan, Deepti, et al.
Publicado: (2024)
OpenGuardrails: A Configurable, Unified, and Scalable Guardrails Platform for Large Language Models
por: Wang, Thomas, et al.
Publicado: (2025)
por: Wang, Thomas, et al.
Publicado: (2025)
RAG Makes Guardrails Unsafe? Investigating Robustness of Guardrails under RAG-style Contexts
por: She, Yining, et al.
Publicado: (2025)
por: She, Yining, et al.
Publicado: (2025)
Catastrophic Failure of LLM Unlearning via Quantization
por: Zhang, Zhiwei, et al.
Publicado: (2024)
por: Zhang, Zhiwei, et al.
Publicado: (2024)
Uncovering the Potential Risks in Unlearning: Danger of English-only Unlearning in Multilingual LLMs
por: Hwang, Kyomin, et al.
Publicado: (2025)
por: Hwang, Kyomin, et al.
Publicado: (2025)
Position: Enough of Scaling LLMs! Lets Focus on Downscaling
por: Goel, Yash, et al.
Publicado: (2025)
por: Goel, Yash, et al.
Publicado: (2025)
Triaging Threats to Specialized Guardrails
por: Mo, Wenjie Jacky, et al.
Publicado: (2026)
por: Mo, Wenjie Jacky, et al.
Publicado: (2026)
WHBench: Evaluating Frontier LLMs with Expert-in-the-Loop Validation on Women's Health Topics
por: Maurya, Sneha, et al.
Publicado: (2026)
por: Maurya, Sneha, et al.
Publicado: (2026)
SEPS: A Separability Measure for Robust Unlearning in LLMs
por: Jeung, Wonje, et al.
Publicado: (2025)
por: Jeung, Wonje, et al.
Publicado: (2025)
Benchmarking LLM Guardrails in Handling Multilingual Toxicity
por: Yang, Yahan, et al.
Publicado: (2024)
por: Yang, Yahan, et al.
Publicado: (2024)
KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs
por: Liang, Buyun, et al.
Publicado: (2025)
por: Liang, Buyun, et al.
Publicado: (2025)
Ejemplares similares
-
Position: LLM Unlearning Benchmarks are Weak Measures of Progress
por: Thaker, Pratiksha, et al.
Publicado: (2024) -
BLUR: A Benchmark for LLM Unlearning Robust to Forget-Retain Overlap
por: Hu, Shengyuan, et al.
Publicado: (2025) -
SAEs $\textit{Can}$ Improve Unlearning: Dynamic Sparse Autoencoder Guardrails for Precision Unlearning in LLMs
por: Muhamed, Aashiq, et al.
Publicado: (2025) -
Unlearning or Obfuscating? Jogging the Memory of Unlearned LLMs via Benign Relearning
por: Hu, Shengyuan, et al.
Publicado: (2024) -
Membership Inference Attacks for Unseen Classes
por: Thaker, Pratiksha, et al.
Publicado: (2025)