Where Does Toxicity Live? Mechanistic Localization and Targeted Suppression in Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Beniwal, Himanshu, Singh, Mayank |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Remember This Event That Year? Assessing Temporal Information and Reasoning in Large Language Models
par: Beniwal, Himanshu, et autres
Publié: (2024)
par: Beniwal, Himanshu, et autres
Publié: (2024)
Cross-lingual Editing in Multilingual Language Models
par: Beniwal, Himanshu, et autres
Publié: (2024)
par: Beniwal, Himanshu, et autres
Publié: (2024)
COMI-LINGUA: Expert Annotated Large-Scale Dataset for Multitask NLP in Hindi-English Code-Mixing
par: Sheth, Rajvee, et autres
Publié: (2025)
par: Sheth, Rajvee, et autres
Publié: (2025)
PythonSaga: Redefining the Benchmark to Evaluate Code Generating LLMs
par: Yadav, Ankit, et autres
Publié: (2024)
par: Yadav, Ankit, et autres
Publié: (2024)
Char-mander Use mBackdoor! A Study of Cross-lingual Backdoor Attacks in Multilingual LLMs
par: Beniwal, Himanshu, et autres
Publié: (2025)
par: Beniwal, Himanshu, et autres
Publié: (2025)
UNITYAI-GUARD: Pioneering Toxicity Detection Across Low-Resource Indian Languages
par: Beniwal, Himanshu, et autres
Publié: (2025)
par: Beniwal, Himanshu, et autres
Publié: (2025)
COMMENTATOR: A Code-mixed Multilingual Text Annotation Framework
par: Sheth, Rajvee, et autres
Publié: (2024)
par: Sheth, Rajvee, et autres
Publié: (2024)
One Instruction Does Not Fit All: How Well Do Embeddings Align Personas and Instructions in Low-Resource Indian Languages?
par: Shah, Arya, et autres
Publié: (2026)
par: Shah, Arya, et autres
Publié: (2026)
TRIM: Hybrid Inference via Targeted Stepwise Routing in Multi-Step Reasoning Tasks
par: Kapoor, Vansh, et autres
Publié: (2026)
par: Kapoor, Vansh, et autres
Publié: (2026)
Fragile Thoughts: How Large Language Models Handle Chain-of-Thought Perturbations
par: Aravindan, Ashwath Vaithinathan, et autres
Publié: (2026)
par: Aravindan, Ashwath Vaithinathan, et autres
Publié: (2026)
Binary Autoencoder for Mechanistic Interpretability of Large Language Models
par: Cho, Hakaze, et autres
Publié: (2025)
par: Cho, Hakaze, et autres
Publié: (2025)
Error Taxonomy-Guided Prompt Optimization
par: Singh, Mayank, et autres
Publié: (2026)
par: Singh, Mayank, et autres
Publié: (2026)
Reasoning Circuits in Language Models: A Mechanistic Interpretation of Syllogistic Inference
par: Kim, Geonhee, et autres
Publié: (2024)
par: Kim, Geonhee, et autres
Publié: (2024)
LOLAMEME: Logic, Language, Memory, Mechanistic Framework
par: Desai, Jay, et autres
Publié: (2024)
par: Desai, Jay, et autres
Publié: (2024)
Steering Without Breaking: Mechanistically Informed Interventions for Discrete Diffusion Language Models
par: Zhou, Hanhan, et autres
Publié: (2026)
par: Zhou, Hanhan, et autres
Publié: (2026)
DLM-Scope: Mechanistic Interpretability of Diffusion Language Models via Sparse Autoencoders
par: Wang, Xu, et autres
Publié: (2026)
par: Wang, Xu, et autres
Publié: (2026)
Characterizing Large Language Model Geometry Helps Solve Toxicity Detection and Generation
par: Balestriero, Randall, et autres
Publié: (2023)
par: Balestriero, Randall, et autres
Publié: (2023)
Minimal and Mechanistic Conditions for Behavioral Self-Awareness in LLMs
par: Bozoukov, Matthew, et autres
Publié: (2025)
par: Bozoukov, Matthew, et autres
Publié: (2025)
Where Do Reasoning Models Refuse?
par: Yamaguchi, Kureha, et autres
Publié: (2025)
par: Yamaguchi, Kureha, et autres
Publié: (2025)
BiSup: Bidirectional Quantization Error Suppression for Large Language Models
par: Zou, Minghui, et autres
Publié: (2024)
par: Zou, Minghui, et autres
Publié: (2024)
Mechanistic?
par: Saphra, Naomi, et autres
Publié: (2024)
par: Saphra, Naomi, et autres
Publié: (2024)
Efficient Reasoning for Large Reasoning Language Models via Certainty-Guided Reflection Suppression
par: Huang, Jiameng, et autres
Publié: (2025)
par: Huang, Jiameng, et autres
Publié: (2025)
Promote, Suppress, Iterate: How Language Models Answer One-to-Many Factual Queries
par: Yan, Tianyi Lorena, et autres
Publié: (2025)
par: Yan, Tianyi Lorena, et autres
Publié: (2025)
Mechanistic Interpretability of GPT-like Models on Summarization Tasks
par: Mishra, Anurag
Publié: (2025)
par: Mishra, Anurag
Publié: (2025)
Selective Self-Rehearsal: A Fine-Tuning Approach to Improve Generalization in Large Language Models
par: Gupta, Sonam, et autres
Publié: (2024)
par: Gupta, Sonam, et autres
Publié: (2024)
Dense Training, Sparse Inference: Rethinking Training of Mixture-of-Experts Language Models
par: Pan, Bowen, et autres
Publié: (2024)
par: Pan, Bowen, et autres
Publié: (2024)
How to Connect Speech Foundation Models and Large Language Models? What Matters and What Does Not
par: Verdini, Francesco, et autres
Publié: (2024)
par: Verdini, Francesco, et autres
Publié: (2024)
Multi-Attribute Steering of Language Models via Targeted Intervention
par: Nguyen, Duy, et autres
Publié: (2025)
par: Nguyen, Duy, et autres
Publié: (2025)
LiveOIBench: Can Large Language Models Outperform Human Contestants in Informatics Olympiads?
par: Zou, Kaijian, et autres
Publié: (2025)
par: Zou, Kaijian, et autres
Publié: (2025)
Personas within Parameters: Fine-Tuning Small Language Models with Low-Rank Adapters to Mimic User Behaviors
par: Thakur, Himanshu, et autres
Publié: (2025)
par: Thakur, Himanshu, et autres
Publié: (2025)
Chem42: a Family of chemical Language Models for Target-aware Ligand Generation
par: Singh, Aahan, et autres
Publié: (2025)
par: Singh, Aahan, et autres
Publié: (2025)
When Benchmarks are Targets: Revealing the Sensitivity of Large Language Model Leaderboards
par: Alzahrani, Norah, et autres
Publié: (2024)
par: Alzahrani, Norah, et autres
Publié: (2024)
Does Pre-trained Language Model Actually Infer Unseen Links in Knowledge Graph Completion?
par: Sakai, Yusuke, et autres
Publié: (2023)
par: Sakai, Yusuke, et autres
Publié: (2023)
Parallax: Parameterized Local Linear Attention for Language Modeling
par: Zuo, Yifei, et autres
Publié: (2026)
par: Zuo, Yifei, et autres
Publié: (2026)
Locally Coherent Parallel Decoding in Diffusion Language Models
par: Hersche, Michael, et autres
Publié: (2026)
par: Hersche, Michael, et autres
Publié: (2026)
PSK@EEUCA 2026: Fine-Tuning Large Language Models with Synthetic Data Augmentation for Multi-Class Toxicity Detection in Gaming Chat
par: Pulipaka, Srikar Kashyap
Publié: (2026)
par: Pulipaka, Srikar Kashyap
Publié: (2026)
Where Reliability Lives in Vision-Language Models: A Mechanistic Study of Attention, Hidden States, and Causal Circuits
par: Mann, Logan, et autres
Publié: (2026)
par: Mann, Logan, et autres
Publié: (2026)
Are LLMs Ready for Neural-integrated Mechanistic Modeling? A Benchmark and Agentic Framework
par: Guan, Zihan, et autres
Publié: (2026)
par: Guan, Zihan, et autres
Publié: (2026)
Does Visual Rendering Bypass Tokenization? Investigating Script-Tokenizer Misalignment in Pixel-Based Language Models
par: Susanto, Lucky, et autres
Publié: (2026)
par: Susanto, Lucky, et autres
Publié: (2026)
When Does a Language Model Commit? A Finite-Answer Theory of Pre-Verbalization Commitment
par: Zhang, Long, et autres
Publié: (2026)
par: Zhang, Long, et autres
Publié: (2026)
Documents similaires
-
Remember This Event That Year? Assessing Temporal Information and Reasoning in Large Language Models
par: Beniwal, Himanshu, et autres
Publié: (2024) -
Cross-lingual Editing in Multilingual Language Models
par: Beniwal, Himanshu, et autres
Publié: (2024) -
COMI-LINGUA: Expert Annotated Large-Scale Dataset for Multitask NLP in Hindi-English Code-Mixing
par: Sheth, Rajvee, et autres
Publié: (2025) -
PythonSaga: Redefining the Benchmark to Evaluate Code Generating LLMs
par: Yadav, Ankit, et autres
Publié: (2024) -
Char-mander Use mBackdoor! A Study of Cross-lingual Backdoor Attacks in Multilingual LLMs
par: Beniwal, Himanshu, et autres
Publié: (2025)