EAMET: Robust Massive Model Editing via Embedding Alignment Optimization
Fuente:
arXiv
Saved in:
| Main Authors: | Dai, Yanbo, Ji, Zhenlan, Li, Zongjie, Wang, Shuai |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Disabling Self-Correction in Retrieval-Augmented Generation via Stealthy Retriever Poisoning
by: Dai, Yanbo, et al.
Published: (2025)
by: Dai, Yanbo, et al.
Published: (2025)
SEAL: Subspace-Anchored Watermarks for LLM Ownership
by: Dai, Yanbo, et al.
Published: (2025)
by: Dai, Yanbo, et al.
Published: (2025)
STShield: Single-Token Sentinel for Real-Time Jailbreak Detection in Large Language Models
by: Wang, Xunguang, et al.
Published: (2025)
by: Wang, Xunguang, et al.
Published: (2025)
Testing and Understanding Erroneous Planning in LLM Agents through Synthesized User Inputs
by: Ji, Zhenlan, et al.
Published: (2024)
by: Ji, Zhenlan, et al.
Published: (2024)
InstructTA: Instruction-Tuned Targeted Attack for Large Vision-Language Models
by: Wang, Xunguang, et al.
Published: (2023)
by: Wang, Xunguang, et al.
Published: (2023)
IP Leakage Attacks Targeting LLM-Based Multi-Agent Systems
by: Wang, Liwen, et al.
Published: (2025)
by: Wang, Liwen, et al.
Published: (2025)
An Empirical Study on Large Language Models in Accuracy and Robustness under Chinese Industrial Scenarios
by: Li, Zongjie, et al.
Published: (2024)
by: Li, Zongjie, et al.
Published: (2024)
GuidedBench: Measuring and Mitigating the Evaluation Discrepancies of In-the-wild LLM Jailbreak Methods
by: Huang, Ruixuan, et al.
Published: (2025)
by: Huang, Ruixuan, et al.
Published: (2025)
Massive Editing for Large Language Models via Meta Learning
by: Tan, Chenmien, et al.
Published: (2023)
by: Tan, Chenmien, et al.
Published: (2023)
Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation
by: Zhang, Zhibo, et al.
Published: (2025)
by: Zhang, Zhibo, et al.
Published: (2025)
Massive Sound Embedding Benchmark (MSEB)
by: Heigold, Georg, et al.
Published: (2026)
by: Heigold, Georg, et al.
Published: (2026)
Evaluating LLMs on Sequential API Call Through Automated Test Generation
by: Huang, Yuheng, et al.
Published: (2025)
by: Huang, Yuheng, et al.
Published: (2025)
Causal Path Alignment: Anchoring the Optimization Trajectory for Controllable In-Parameter Knowledge Editing
by: Liu, Xiyu, et al.
Published: (2025)
by: Liu, Xiyu, et al.
Published: (2025)
On the Robustness of Editing Large Language Models
by: Ma, Xinbei, et al.
Published: (2024)
by: Ma, Xinbei, et al.
Published: (2024)
SoK: Evaluating Jailbreak Guardrails for Large Language Models
by: Wang, Xunguang, et al.
Published: (2025)
by: Wang, Xunguang, et al.
Published: (2025)
ToolkenGPT: Augmenting Frozen Language Models with Massive Tools via Tool Embeddings
by: Hao, Shibo, et al.
Published: (2023)
by: Hao, Shibo, et al.
Published: (2023)
Improving the Robustness of Large Language Models via Consistency Alignment
by: Zhao, Yukun, et al.
Published: (2024)
by: Zhao, Yukun, et al.
Published: (2024)
EvoEdit: Evolving Null-space Alignment for Robust and Efficient Knowledge Editing
by: Lyu, Sicheng, et al.
Published: (2025)
by: Lyu, Sicheng, et al.
Published: (2025)
Towards Efficient Exact Optimization of Language Model Alignment
by: Ji, Haozhe, et al.
Published: (2024)
by: Ji, Haozhe, et al.
Published: (2024)
Unifying Dual-Space Embedding for Entity Alignment via Contrastive Learning
by: Wang, Cunda, et al.
Published: (2024)
by: Wang, Cunda, et al.
Published: (2024)
Split and Merge: Aligning Position Biases in LLM-based Evaluators
by: Li, Zongjie, et al.
Published: (2023)
by: Li, Zongjie, et al.
Published: (2023)
Rethinking Residual Distribution in Locate-then-Edit Model Editing
by: Li, Xiaopeng, et al.
Published: (2025)
by: Li, Xiaopeng, et al.
Published: (2025)
Contrastive Knowledge Transfer and Robust Optimization for Secure Alignment of Large Language Models
by: Zheng, Jiasen, et al.
Published: (2025)
by: Zheng, Jiasen, et al.
Published: (2025)
REPAIR: Robust Editing via Progressive Adaptive Intervention and Reintegration
by: Wang, Yisu, et al.
Published: (2025)
by: Wang, Yisu, et al.
Published: (2025)
LANGALIGN: Enhancing Non-English Language Models via Cross-Lingual Embedding Alignment
by: Kim, Jong Myoung, et al.
Published: (2025)
by: Kim, Jong Myoung, et al.
Published: (2025)
Following the Autoregressive Nature of LLM Embeddings via Compression and Alignment
by: Deng, Jingcheng, et al.
Published: (2025)
by: Deng, Jingcheng, et al.
Published: (2025)
Robust and Scalable Model Editing for Large Language Models
by: Chen, Yingfa, et al.
Published: (2024)
by: Chen, Yingfa, et al.
Published: (2024)
MELAC: Massive Evaluation of Large Language Models with Alignment of Culture in Persian Language
by: Farsi, Farhan, et al.
Published: (2025)
by: Farsi, Farhan, et al.
Published: (2025)
Not Everything is All You Need: Toward Low-Redundant Optimization for Large Language Model Alignment
by: Chen, Zhipeng, et al.
Published: (2024)
by: Chen, Zhipeng, et al.
Published: (2024)
Mitigating the Safety-utility Trade-off in LLM Alignment via Adaptive Safe Context Learning
by: Wang, Yanbo, et al.
Published: (2026)
by: Wang, Yanbo, et al.
Published: (2026)
Model-Based Quality Assessment for Massively Multilingual Parallel Data
by: Ibrahim, Abdelaziz M. A., et al.
Published: (2026)
by: Ibrahim, Abdelaziz M. A., et al.
Published: (2026)
Leveraging Robust Optimization for LLM Alignment under Distribution Shifts
by: Zhu, Mingye, et al.
Published: (2025)
by: Zhu, Mingye, et al.
Published: (2025)
MIEB: Massive Image Embedding Benchmark
by: Xiao, Chenghao, et al.
Published: (2025)
by: Xiao, Chenghao, et al.
Published: (2025)
PL-MTEB: Polish Massive Text Embedding Benchmark
by: Poświata, Rafał, et al.
Published: (2024)
by: Poświata, Rafał, et al.
Published: (2024)
On the Robustness of Knowledge Editing for Detoxification
by: Dong, Ming, et al.
Published: (2026)
by: Dong, Ming, et al.
Published: (2026)
Scalable Model Editing via Customized Expert Networks
by: Yao, Zihan, et al.
Published: (2024)
by: Yao, Zihan, et al.
Published: (2024)
EVEDIT: Event-based Knowledge Editing with Deductive Editing Boundaries
by: Liu, Jiateng, et al.
Published: (2024)
by: Liu, Jiateng, et al.
Published: (2024)
Robust Knowledge Editing via Explicit Reasoning Chains for Distractor-Resilient Multi-Hop QA
by: Wu, Yuchen, et al.
Published: (2025)
by: Wu, Yuchen, et al.
Published: (2025)
Decoding Knowledge in Large Language Models: A Framework for Categorization and Comprehension
by: Fang, Yanbo, et al.
Published: (2025)
by: Fang, Yanbo, et al.
Published: (2025)
An Information-Theoretic Framework for Robust Large Language Model Editing
by: Chen, Qizhou, et al.
Published: (2025)
by: Chen, Qizhou, et al.
Published: (2025)
Similar Items
-
Disabling Self-Correction in Retrieval-Augmented Generation via Stealthy Retriever Poisoning
by: Dai, Yanbo, et al.
Published: (2025) -
SEAL: Subspace-Anchored Watermarks for LLM Ownership
by: Dai, Yanbo, et al.
Published: (2025) -
STShield: Single-Token Sentinel for Real-Time Jailbreak Detection in Large Language Models
by: Wang, Xunguang, et al.
Published: (2025) -
Testing and Understanding Erroneous Planning in LLM Agents through Synthesized User Inputs
by: Ji, Zhenlan, et al.
Published: (2024) -
InstructTA: Instruction-Tuned Targeted Attack for Large Vision-Language Models
by: Wang, Xunguang, et al.
Published: (2023)