Detoxifying Large Language Models via Knowledge Editing
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Mengru, Zhang, Ningyu, Xu, Ziwen, Xi, Zekun, Deng, Shumin, Yao, Yunzhi, Zhang, Qishen, Yang, Linyi, Wang, Jindong, Chen, Huajun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
EasyEdit2: An Easy-to-use Steering Framework for Editing Large Language Models
di: Xu, Ziwen, et al.
Pubblicazione: (2025)
di: Xu, Ziwen, et al.
Pubblicazione: (2025)
A Comprehensive Study of Knowledge Editing for Large Language Models
di: Zhang, Ningyu, et al.
Pubblicazione: (2024)
di: Zhang, Ningyu, et al.
Pubblicazione: (2024)
Knowledge Mechanisms in Large Language Models: A Survey and Perspective
di: Wang, Mengru, et al.
Pubblicazione: (2024)
di: Wang, Mengru, et al.
Pubblicazione: (2024)
Knowledge Circuits in Pretrained Transformers
di: Yao, Yunzhi, et al.
Pubblicazione: (2024)
di: Yao, Yunzhi, et al.
Pubblicazione: (2024)
ReLearn: Unlearning via Learning for Large Language Models
di: Xu, Haoming, et al.
Pubblicazione: (2025)
di: Xu, Haoming, et al.
Pubblicazione: (2025)
How Do LLMs Acquire New Knowledge? A Knowledge Circuits Perspective on Continual Pre-Training
di: Ou, Yixin, et al.
Pubblicazione: (2025)
di: Ou, Yixin, et al.
Pubblicazione: (2025)
Illusions of Confidence? Diagnosing LLM Truthfulness via Neighborhood Consistency
di: Xu, Haoming, et al.
Pubblicazione: (2026)
di: Xu, Haoming, et al.
Pubblicazione: (2026)
How Controllable Are Large Language Models? A Unified Evaluation across Behavioral Granularities
di: Xu, Ziwen, et al.
Pubblicazione: (2026)
di: Xu, Ziwen, et al.
Pubblicazione: (2026)
InstructEdit: Instruction-based Knowledge Editing for Large Language Models
di: Zhang, Ningyu, et al.
Pubblicazione: (2024)
di: Zhang, Ningyu, et al.
Pubblicazione: (2024)
Unveiling the Pitfalls of Knowledge Editing for Large Language Models
di: Li, Zhoubo, et al.
Pubblicazione: (2023)
di: Li, Zhoubo, et al.
Pubblicazione: (2023)
KnowAgent: Knowledge-Augmented Planning for LLM-Based Agents
di: Zhu, Yuqi, et al.
Pubblicazione: (2024)
di: Zhu, Yuqi, et al.
Pubblicazione: (2024)
OmniThink: Expanding Knowledge Boundaries in Machine Writing through Thinking
di: Xi, Zekun, et al.
Pubblicazione: (2025)
di: Xi, Zekun, et al.
Pubblicazione: (2025)
Integrating Large Language Models into Text Animation: An Intelligent Editing System with Inline and Chat Interaction
di: Zhang, Bao, et al.
Pubblicazione: (2025)
di: Zhang, Bao, et al.
Pubblicazione: (2025)
EasyEdit: An Easy-to-use Knowledge Editing Framework for Large Language Models
di: Wang, Peng, et al.
Pubblicazione: (2023)
di: Wang, Peng, et al.
Pubblicazione: (2023)
EasyInstruct: An Easy-to-use Instruction Processing Framework for Large Language Models
di: Ou, Yixin, et al.
Pubblicazione: (2024)
di: Ou, Yixin, et al.
Pubblicazione: (2024)
Natural Language Interaction for Editing Visual Knowledge Graphs
di: Shahriari, Reza, et al.
Pubblicazione: (2025)
di: Shahriari, Reza, et al.
Pubblicazione: (2025)
KEditVis: A Visual Analytics System for Knowledge Editing of Large Language Models
di: Chen, Zhenning, et al.
Pubblicazione: (2026)
di: Chen, Zhenning, et al.
Pubblicazione: (2026)
Knowledge Prompting: How Knowledge Engineers Use Large Language Models
di: Koutsiana, Elisavet, et al.
Pubblicazione: (2024)
di: Koutsiana, Elisavet, et al.
Pubblicazione: (2024)
Leveraging Large Language Models for Identifying Knowledge Components
di: Wang, Canwen, et al.
Pubblicazione: (2025)
di: Wang, Canwen, et al.
Pubblicazione: (2025)
Figame: A Family Digital Game Based on JME for Shaping Parent-Child Healthy Gaming Relationship
di: Zhang, Liyi, et al.
Pubblicazione: (2025)
di: Zhang, Liyi, et al.
Pubblicazione: (2025)
Exploring Model Kinship for Merging Large Language Models
di: Hu, Yedi, et al.
Pubblicazione: (2024)
di: Hu, Yedi, et al.
Pubblicazione: (2024)
Exploring Text-based Realistic Building Facades Editing Applicaiton
di: Wang, Jing, et al.
Pubblicazione: (2024)
di: Wang, Jing, et al.
Pubblicazione: (2024)
Exploring Stress among International College Students in China
di: Morake, Omogolo Omaatla, et al.
Pubblicazione: (2025)
di: Morake, Omogolo Omaatla, et al.
Pubblicazione: (2025)
RuleAlign: Making Large Language Models Better Physicians with Diagnostic Rule Alignment
di: Wang, Xiaohan, et al.
Pubblicazione: (2024)
di: Wang, Xiaohan, et al.
Pubblicazione: (2024)
Making Language Models Better Tool Learners with Execution Feedback
di: Qiao, Shuofei, et al.
Pubblicazione: (2023)
di: Qiao, Shuofei, et al.
Pubblicazione: (2023)
Sample-Efficient Human Evaluation of Large Language Models via Maximum Discrepancy Competition
di: Feng, Kehua, et al.
Pubblicazione: (2024)
di: Feng, Kehua, et al.
Pubblicazione: (2024)
Beyond Preset Identities: How Agents Form Stances and Boundaries in Generative Societies
di: Zhang, Hanzhong, et al.
Pubblicazione: (2026)
di: Zhang, Hanzhong, et al.
Pubblicazione: (2026)
From Data to Behavior: Predicting Unintended Model Behaviors Before Training
di: Wang, Mengru, et al.
Pubblicazione: (2026)
di: Wang, Mengru, et al.
Pubblicazione: (2026)
ColorBrowserAgent: Complex Long-Horizon Browser Agent with Adaptive Knowledge Evolution
di: Wang, Jihong, et al.
Pubblicazione: (2026)
di: Wang, Jihong, et al.
Pubblicazione: (2026)
Editing Conceptual Knowledge for Large Language Models
di: Wang, Xiaohan, et al.
Pubblicazione: (2024)
di: Wang, Xiaohan, et al.
Pubblicazione: (2024)
DALL: Data Labeling via Data Programming and Active Learning Enhanced by Large Language Models
di: Li, Guozheng, et al.
Pubblicazione: (2026)
di: Li, Guozheng, et al.
Pubblicazione: (2026)
Multimodal Road Network Generation Based on Large Language Model
di: Chen, Jiajing, et al.
Pubblicazione: (2024)
di: Chen, Jiajing, et al.
Pubblicazione: (2024)
"I Always Felt that SomethingWasWrong.": Understanding Compliance Risks and Mitigation Strategies when Highly-Skilled Compliance Knowledge Workers Use Large Language Models
di: Hu, Siying, et al.
Pubblicazione: (2024)
di: Hu, Siying, et al.
Pubblicazione: (2024)
Workshop on Aesthetics of Connectivity for Empowerment at ACM Designing Interactive Systems 2024
di: Hu, Jun, et al.
Pubblicazione: (2025)
di: Hu, Jun, et al.
Pubblicazione: (2025)
Evaluation of Large Language Model-Driven AutoML in Data and Model Management from Human-Centered Perspective
di: Yao, Jiapeng, et al.
Pubblicazione: (2025)
di: Yao, Jiapeng, et al.
Pubblicazione: (2025)
A Unified Editing Method for Co-Speech Gesture Generation via Diffusion Inversion
di: Zhao, Zeyu, et al.
Pubblicazione: (2024)
di: Zhao, Zeyu, et al.
Pubblicazione: (2024)
MindChat: Enhancing BCI Spelling with Large Language Models in Realistic Scenarios
di: Wang, JIaheng, et al.
Pubblicazione: (2025)
di: Wang, JIaheng, et al.
Pubblicazione: (2025)
FinFlier: Automating Graphical Overlays for Financial Visualizations with Knowledge-Grounding Large Language Model
di: Hao, Jianing, et al.
Pubblicazione: (2024)
di: Hao, Jianing, et al.
Pubblicazione: (2024)
WISE: Rethinking the Knowledge Memory for Lifelong Model Editing of Large Language Models
di: Wang, Peng, et al.
Pubblicazione: (2024)
di: Wang, Peng, et al.
Pubblicazione: (2024)
Exploring the Impact of Personality Traits on Conversational Recommender Systems: A Simulation with Large Language Models
di: Zhao, Xiaoyan, et al.
Pubblicazione: (2025)
di: Zhao, Xiaoyan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
EasyEdit2: An Easy-to-use Steering Framework for Editing Large Language Models
di: Xu, Ziwen, et al.
Pubblicazione: (2025) -
A Comprehensive Study of Knowledge Editing for Large Language Models
di: Zhang, Ningyu, et al.
Pubblicazione: (2024) -
Knowledge Mechanisms in Large Language Models: A Survey and Perspective
di: Wang, Mengru, et al.
Pubblicazione: (2024) -
Knowledge Circuits in Pretrained Transformers
di: Yao, Yunzhi, et al.
Pubblicazione: (2024) -
ReLearn: Unlearning via Learning for Large Language Models
di: Xu, Haoming, et al.
Pubblicazione: (2025)