Enhancing Semantic Consistency of Large Language Models through Model Editing: An Interpretability-Oriented Approach
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Yang, Jingyuan, Chen, Dapeng, Sun, Yajing, Li, Rongjun, Feng, Zhiyong, Peng, Wei |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
LF-Steering: Latent Feature Activation Steering for Enhancing Semantic Consistency in Large Language Models
von: Yang, Jingyuan, et al.
Veröffentlicht: (2025)
von: Yang, Jingyuan, et al.
Veröffentlicht: (2025)
Gradient Co-occurrence Analysis for Detecting Unsafe Prompts in Large Language Models
von: Yang, Jingyuan, et al.
Veröffentlicht: (2025)
von: Yang, Jingyuan, et al.
Veröffentlicht: (2025)
A Survey on Hallucination in Large Vision-Language Models
von: Liu, Hanchao, et al.
Veröffentlicht: (2024)
von: Liu, Hanchao, et al.
Veröffentlicht: (2024)
Crafting Large Language Models for Enhanced Interpretability
von: Sun, Chung-En, et al.
Veröffentlicht: (2024)
von: Sun, Chung-En, et al.
Veröffentlicht: (2024)
DPN-LE: Dual Personality Neuron Localization and Editing for Large Language Models
von: Zheng, Lifan, et al.
Veröffentlicht: (2026)
von: Zheng, Lifan, et al.
Veröffentlicht: (2026)
Robust and Scalable Model Editing for Large Language Models
von: Chen, Yingfa, et al.
Veröffentlicht: (2024)
von: Chen, Yingfa, et al.
Veröffentlicht: (2024)
SDGO: Self-Discrimination-Guided Optimization for Consistent Safety in Large Language Models
von: Ding, Peng, et al.
Veröffentlicht: (2025)
von: Ding, Peng, et al.
Veröffentlicht: (2025)
Enhancing Multi-hop Reasoning through Knowledge Erasure in Large Language Model Editing
von: Zhang, Mengqi, et al.
Veröffentlicht: (2024)
von: Zhang, Mengqi, et al.
Veröffentlicht: (2024)
Semantic and Structural Analysis of Implicit Biases in Large Language Models: An Interpretable Approach
von: Zhang, Renhan, et al.
Veröffentlicht: (2025)
von: Zhang, Renhan, et al.
Veröffentlicht: (2025)
Knowledge Graph Enhanced Large Language Model Editing
von: Zhang, Mengqi, et al.
Veröffentlicht: (2024)
von: Zhang, Mengqi, et al.
Veröffentlicht: (2024)
Semantic Self-Consistency: Enhancing Language Model Reasoning via Semantic Weighting
von: Knappe, Tim, et al.
Veröffentlicht: (2024)
von: Knappe, Tim, et al.
Veröffentlicht: (2024)
LVPruning: An Effective yet Simple Language-Guided Vision Token Pruning Approach for Multi-modal Large Language Models
von: Sun, Yizheng, et al.
Veröffentlicht: (2025)
von: Sun, Yizheng, et al.
Veröffentlicht: (2025)
KnowledgeNavigator: Leveraging Large Language Models for Enhanced Reasoning over Knowledge Graph
von: Guo, Tiezheng, et al.
Veröffentlicht: (2023)
von: Guo, Tiezheng, et al.
Veröffentlicht: (2023)
Incremental Comprehension of Garden-Path Sentences by Large Language Models: Semantic Interpretation, Syntactic Re-Analysis, and Attention
von: Li, Andrew, et al.
Veröffentlicht: (2024)
von: Li, Andrew, et al.
Veröffentlicht: (2024)
Semantic Consistency Regularization with Large Language Models for Semi-supervised Sentiment Analysis
von: Li, Kunrong, et al.
Veröffentlicht: (2025)
von: Li, Kunrong, et al.
Veröffentlicht: (2025)
Semantics-Adaptive Activation Intervention for LLMs via Dynamic Steering Vectors
von: Wang, Weixuan, et al.
Veröffentlicht: (2024)
von: Wang, Weixuan, et al.
Veröffentlicht: (2024)
WisdomBot: Tuning Large Language Models with Artificial Intelligence Knowledge
von: Chen, Jingyuan, et al.
Veröffentlicht: (2025)
von: Chen, Jingyuan, et al.
Veröffentlicht: (2025)
STEAM: A Semantic-Level Knowledge Editing Framework for Large Language Models
von: Jeong, Geunyeong, et al.
Veröffentlicht: (2025)
von: Jeong, Geunyeong, et al.
Veröffentlicht: (2025)
Enhancing Multilingual Capabilities of Large Language Models through Self-Distillation from Resource-Rich Languages
von: Zhang, Yuanchi, et al.
Veröffentlicht: (2024)
von: Zhang, Yuanchi, et al.
Veröffentlicht: (2024)
Model Editing Harms General Abilities of Large Language Models: Regularization to the Rescue
von: Gu, Jia-Chen, et al.
Veröffentlicht: (2024)
von: Gu, Jia-Chen, et al.
Veröffentlicht: (2024)
Interpreting Bias in Large Language Models: A Feature-Based Approach
von: Prakash, Nirmalendu, et al.
Veröffentlicht: (2024)
von: Prakash, Nirmalendu, et al.
Veröffentlicht: (2024)
Semantic Consistency for Assuring Reliability of Large Language Models
von: Raj, Harsh, et al.
Veröffentlicht: (2023)
von: Raj, Harsh, et al.
Veröffentlicht: (2023)
Enhancing Data Privacy in Large Language Models through Private Association Editing
von: Venditti, Davide, et al.
Veröffentlicht: (2024)
von: Venditti, Davide, et al.
Veröffentlicht: (2024)
V-SEAM: Visual Semantic Editing and Attention Modulating for Causal Interpretability of Vision-Language Models
von: Wang, Qidong, et al.
Veröffentlicht: (2025)
von: Wang, Qidong, et al.
Veröffentlicht: (2025)
LightReasoner: Can Small Language Models Teach Large Language Models Reasoning?
von: Wang, Jingyuan, et al.
Veröffentlicht: (2025)
von: Wang, Jingyuan, et al.
Veröffentlicht: (2025)
Precision Knowledge Editing: Enhancing Safety in Large Language Models
von: Li, Xuying, et al.
Veröffentlicht: (2024)
von: Li, Xuying, et al.
Veröffentlicht: (2024)
Is Large Language Model Good at Triple Set Prediction? An Empirical Study
von: Yuan, Yuan, et al.
Veröffentlicht: (2024)
von: Yuan, Yuan, et al.
Veröffentlicht: (2024)
Evaluating the Generation Capabilities of Large Chinese Language Models
von: Zeng, Hui, et al.
Veröffentlicht: (2023)
von: Zeng, Hui, et al.
Veröffentlicht: (2023)
Stable Knowledge Editing in Large Language Models
von: Wei, Zihao, et al.
Veröffentlicht: (2024)
von: Wei, Zihao, et al.
Veröffentlicht: (2024)
Editing the Mind of Giants: An In-Depth Exploration of Pitfalls of Knowledge Editing in Large Language Models
von: Hsueh, Cheng-Hsun, et al.
Veröffentlicht: (2024)
von: Hsueh, Cheng-Hsun, et al.
Veröffentlicht: (2024)
Evaluating the Effectiveness of Black-Box Prompt Optimization as the Scale of LLMs Continues to Grow
von: Zhou, Ziyu, et al.
Veröffentlicht: (2025)
von: Zhou, Ziyu, et al.
Veröffentlicht: (2025)
Exploring the Role of Explicit Temporal Modeling in Multimodal Large Language Models for Video Understanding
von: Li, Yun, et al.
Veröffentlicht: (2025)
von: Li, Yun, et al.
Veröffentlicht: (2025)
Self-Evolutionary Large Language Models through Uncertainty-Enhanced Preference Optimization
von: Wang, Jianing, et al.
Veröffentlicht: (2024)
von: Wang, Jianing, et al.
Veröffentlicht: (2024)
Benchmarking and Rethinking Knowledge Editing for Large Language Models
von: He, Guoxiu, et al.
Veröffentlicht: (2025)
von: He, Guoxiu, et al.
Veröffentlicht: (2025)
TokenSmith: Streamlining Data Editing, Search, and Inspection for Large-Scale Language Model Training and Interpretability
von: Khan, Mohammad Aflah, et al.
Veröffentlicht: (2025)
von: Khan, Mohammad Aflah, et al.
Veröffentlicht: (2025)
Consistency-Aware Editing for Entity-level Unlearning in Language Models
von: Han, Xiaoqi, et al.
Veröffentlicht: (2025)
von: Han, Xiaoqi, et al.
Veröffentlicht: (2025)
Uncovering Overfitting in Large Language Model Editing
von: Zhang, Mengqi, et al.
Veröffentlicht: (2024)
von: Zhang, Mengqi, et al.
Veröffentlicht: (2024)
Judge as A Judge: Improving the Evaluation of Retrieval-Augmented Generation through the Judge-Consistency of Large Language Models
von: Liu, Shuliang, et al.
Veröffentlicht: (2025)
von: Liu, Shuliang, et al.
Veröffentlicht: (2025)
Making Large Language Models Perform Better in Knowledge Graph Completion
von: Zhang, Yichi, et al.
Veröffentlicht: (2023)
von: Zhang, Yichi, et al.
Veröffentlicht: (2023)
Rich Semantic Knowledge Enhanced Large Language Models for Few-shot Chinese Spell Checking
von: Dong, Ming, et al.
Veröffentlicht: (2024)
von: Dong, Ming, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
LF-Steering: Latent Feature Activation Steering for Enhancing Semantic Consistency in Large Language Models
von: Yang, Jingyuan, et al.
Veröffentlicht: (2025) -
Gradient Co-occurrence Analysis for Detecting Unsafe Prompts in Large Language Models
von: Yang, Jingyuan, et al.
Veröffentlicht: (2025) -
A Survey on Hallucination in Large Vision-Language Models
von: Liu, Hanchao, et al.
Veröffentlicht: (2024) -
Crafting Large Language Models for Enhanced Interpretability
von: Sun, Chung-En, et al.
Veröffentlicht: (2024) -
DPN-LE: Dual Personality Neuron Localization and Editing for Large Language Models
von: Zheng, Lifan, et al.
Veröffentlicht: (2026)