Large Language Models can be Strong Self-Detoxifiers
Fuente:
arXiv
Saved in:
| Main Authors: | Ko, Ching-Yun, Chen, Pin-Yu, Das, Payel, Mroueh, Youssef, Dan, Soham, Kollias, Georgios, Chaudhury, Subhajit, Pedapati, Tejaswini, Daniel, Luca |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Needle in the Haystack for Memory Based Large Language Models
by: Nelson, Elliot, et al.
Published: (2024)
by: Nelson, Elliot, et al.
Published: (2024)
Generation Constraint Scaling Can Mitigate Hallucination
by: Kollias, Georgios, et al.
Published: (2024)
by: Kollias, Georgios, et al.
Published: (2024)
NeuroPrune: A Neuro-inspired Topological Sparse Training Algorithm for Large Language Models
by: Dhurandhar, Amit, et al.
Published: (2024)
by: Dhurandhar, Amit, et al.
Published: (2024)
Can Memory-Augmented Language Models Generalize on Reasoning-in-a-Haystack Tasks?
by: Das, Payel, et al.
Published: (2025)
by: Das, Payel, et al.
Published: (2025)
EpMAN: Episodic Memory AttentioN for Generalizing to Longer Contexts
by: Chaudhury, Subhajit, et al.
Published: (2025)
by: Chaudhury, Subhajit, et al.
Published: (2025)
Sparse Gradient Compression for Fine-Tuning Large Language Models
by: Yang, David H., et al.
Published: (2025)
by: Yang, David H., et al.
Published: (2025)
Larimar: Large Language Models with Episodic Memory Control
by: Das, Payel, et al.
Published: (2024)
by: Das, Payel, et al.
Published: (2024)
Large Language Model Confidence Estimation via Black-Box Access
by: Pedapati, Tejaswini, et al.
Published: (2024)
by: Pedapati, Tejaswini, et al.
Published: (2024)
Intermediate Representations are Strong AI-Generated Image Detectors
by: Huang, Zhenhan, et al.
Published: (2026)
by: Huang, Zhenhan, et al.
Published: (2026)
Information Theoretic Guarantees For Policy Alignment In Large Language Models
by: Mroueh, Youssef
Published: (2024)
by: Mroueh, Youssef
Published: (2024)
ZoomR: Memory Efficient Reasoning through Multi-Granularity Key Value Retrieval
by: Yang, David H., et al.
Published: (2026)
by: Yang, David H., et al.
Published: (2026)
From PEFT to DEFT: Parameter Efficient Finetuning for Reducing Activation Density in Transformers
by: Runwal, Bharat, et al.
Published: (2024)
by: Runwal, Bharat, et al.
Published: (2024)
Differentiable Prompt Learning for Vision Language Models
by: Huang, Zhenhan, et al.
Published: (2024)
by: Huang, Zhenhan, et al.
Published: (2024)
Modular Prompt Learning Improves Vision-Language Models
by: Huang, Zhenhan, et al.
Published: (2025)
by: Huang, Zhenhan, et al.
Published: (2025)
On the Effects of Fine-tuning Language Models for Text-Based Reinforcement Learning
by: Gruppi, Mauricio, et al.
Published: (2024)
by: Gruppi, Mauricio, et al.
Published: (2024)
Patching LLM Like Software: A Lightweight Method for Improving Safety Policy in Large Language Models
by: Arif, Huzaifa, et al.
Published: (2025)
by: Arif, Huzaifa, et al.
Published: (2025)
STAR: Spectral Truncation and Rescale for Model Merging
by: Lee, Yu-Ang, et al.
Published: (2025)
by: Lee, Yu-Ang, et al.
Published: (2025)
LongFuncEval: Measuring the effectiveness of long context models for function calling
by: Kate, Kiran, et al.
Published: (2025)
by: Kate, Kiran, et al.
Published: (2025)
Reinforcement Learning with Verifiable Rewards: GRPO's Effective Loss, Dynamics, and Success Amplification
by: Mroueh, Youssef
Published: (2025)
by: Mroueh, Youssef
Published: (2025)
Graph is all you need? Lightweight data-agnostic neural architecture search without training
by: Huang, Zhenhan, et al.
Published: (2024)
by: Huang, Zhenhan, et al.
Published: (2024)
Fundamental Safety-Capability Trade-offs in Fine-tuning Large Language Models
by: Chen, Pin-Yu, et al.
Published: (2025)
by: Chen, Pin-Yu, et al.
Published: (2025)
vLLM Hook v0: A Plug-in for Programming Model Internals on vLLM
by: Ko, Ching-Yun, et al.
Published: (2026)
by: Ko, Ching-Yun, et al.
Published: (2026)
TabSketchFM: Sketch-based Tabular Representation Learning for Data Discovery over Data Lakes
by: Khatiwada, Aamod, et al.
Published: (2024)
by: Khatiwada, Aamod, et al.
Published: (2024)
GP-MoLFormer: A Foundation Model For Molecular Generation
by: Ross, Jerret, et al.
Published: (2024)
by: Ross, Jerret, et al.
Published: (2024)
GP-MoLFormer-Sim: Test Time Molecular Optimization through Contextual Similarity Guidance
by: Navratil, Jiri, et al.
Published: (2025)
by: Navratil, Jiri, et al.
Published: (2025)
OjaKV: Context-Aware Online Low-Rank KV Cache Compression
by: Zhu, Yuxuan, et al.
Published: (2025)
by: Zhu, Yuxuan, et al.
Published: (2025)
Verify when Uncertain: Beyond Self-Consistency in Black Box Hallucination Detection
by: Xue, Yihao, et al.
Published: (2025)
by: Xue, Yihao, et al.
Published: (2025)
Steering Externalities: Benign Activation Steering Unintentionally Increases Jailbreak Risk for Large Language Models
by: Xiong, Chen, et al.
Published: (2026)
by: Xiong, Chen, et al.
Published: (2026)
Detoxifying Large Language Models via Knowledge Editing
by: Wang, Mengru, et al.
Published: (2024)
by: Wang, Mengru, et al.
Published: (2024)
SEAL: Safety-enhanced Aligned LLM Fine-tuning via Bilevel Data Selection
by: Shen, Han, et al.
Published: (2024)
by: Shen, Han, et al.
Published: (2024)
Guided Speculative Inference for Efficient Test-Time Alignment of LLMs
by: Geuter, Jonathan, et al.
Published: (2025)
by: Geuter, Jonathan, et al.
Published: (2025)
Contrastive Perplexity for Controlled Generation: An Application in Detoxifying Large Language Models
by: Klein, Tassilo, et al.
Published: (2024)
by: Klein, Tassilo, et al.
Published: (2024)
Detoxifying Large Language Models via Autoregressive Reward Guided Representation Editing
by: Xiao, Yisong, et al.
Published: (2025)
by: Xiao, Yisong, et al.
Published: (2025)
CliffSearch: Structured Agentic Co-Evolution over Theory and Code for Scientific Algorithm Discovery
by: Mroueh, Youssef, et al.
Published: (2026)
by: Mroueh, Youssef, et al.
Published: (2026)
Evaluation of medication adherence among Lebanese diabetic patients
by: Lara Mroueh
Published: (2018)
by: Lara Mroueh
Published: (2018)
Learning Rate Matters: Vanilla LoRA May Suffice for LLM Fine-tuning
by: Lee, Yu-Ang, et al.
Published: (2026)
by: Lee, Yu-Ang, et al.
Published: (2026)
PEEL the Layers and Find Yourself: Revisiting Inference-time Data Leakage for Residual Neural Networks
by: Arif, Huzaifa, et al.
Published: (2025)
by: Arif, Huzaifa, et al.
Published: (2025)
Transformation-Augmented GRPO for Enhancing Exploration in Reasoning of Large Language Models
by: Le, Khiem, et al.
Published: (2026)
by: Le, Khiem, et al.
Published: (2026)
AI Steerability 360: A Toolkit for Steering Large Language Models
by: Miehling, Erik, et al.
Published: (2026)
by: Miehling, Erik, et al.
Published: (2026)
Risk Aware Benchmarking of Large Language Models
by: Nitsure, Apoorva, et al.
Published: (2023)
by: Nitsure, Apoorva, et al.
Published: (2023)
Similar Items
-
Needle in the Haystack for Memory Based Large Language Models
by: Nelson, Elliot, et al.
Published: (2024) -
Generation Constraint Scaling Can Mitigate Hallucination
by: Kollias, Georgios, et al.
Published: (2024) -
NeuroPrune: A Neuro-inspired Topological Sparse Training Algorithm for Large Language Models
by: Dhurandhar, Amit, et al.
Published: (2024) -
Can Memory-Augmented Language Models Generalize on Reasoning-in-a-Haystack Tasks?
by: Das, Payel, et al.
Published: (2025) -
EpMAN: Episodic Memory AttentioN for Generalizing to Longer Contexts
by: Chaudhury, Subhajit, et al.
Published: (2025)