Should We Really Edit Language Models? On the Evaluation of Edited Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Qi, Liu, Xiang, Tang, Zhenheng, Dong, Peijie, Li, Zeyu, Pan, Xinglin, Chu, Xiaowen |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
The Lottery LLM Hypothesis, Rethinking What Abilities Should LLM Compression Preserve?
por: Tang, Zhenheng, et al.
Publicado: (2025)
por: Tang, Zhenheng, et al.
Publicado: (2025)
Reasoning Language Model Inference Serving Unveiled: An Empirical Study
por: Li, Qi, et al.
Publicado: (2025)
por: Li, Qi, et al.
Publicado: (2025)
Mediator: Memory-efficient LLM Merging with Less Parameter Conflicts and Uncertainty Based Routing
por: Lai, Kunfeng, et al.
Publicado: (2025)
por: Lai, Kunfeng, et al.
Publicado: (2025)
Pruner-Zero: Evolving Symbolic Pruning Metric from scratch for Large Language Models
por: Dong, Peijie, et al.
Publicado: (2024)
por: Dong, Peijie, et al.
Publicado: (2024)
Semantic Integrity Matters: Benchmarking and Preserving High-Density Reasoning in KV Cache Compression
por: Liu, Xiang, et al.
Publicado: (2025)
por: Liu, Xiang, et al.
Publicado: (2025)
Are We Evaluating the Edit Locality of LLM Model Editing Properly?
por: Liu, Wei, et al.
Publicado: (2026)
por: Liu, Wei, et al.
Publicado: (2026)
LongGenBench: Long-context Generation Benchmark
por: Liu, Xiang, et al.
Publicado: (2024)
por: Liu, Xiang, et al.
Publicado: (2024)
Efficient MoE Inference with Fine-Grained Scheduling of Disaggregated Expert Parallelism
por: Pan, Xinglin, et al.
Publicado: (2025)
por: Pan, Xinglin, et al.
Publicado: (2025)
Are Dilemmas and Conflicts in LLM Alignment Solvable? A View from Priority Graph
por: Tang, Zhenheng, et al.
Publicado: (2026)
por: Tang, Zhenheng, et al.
Publicado: (2026)
WikiTableEdit: A Benchmark for Table Editing by Natural Language Instruction
por: Li, Zheng, et al.
Publicado: (2024)
por: Li, Zheng, et al.
Publicado: (2024)
LPZero: Language Model Zero-cost Proxy Search from Zero
por: Dong, Peijie, et al.
Publicado: (2024)
por: Dong, Peijie, et al.
Publicado: (2024)
Position: LLM Inference Should Be Evaluated as Energy-to-Token Production
por: Liu, Xiang, et al.
Publicado: (2026)
por: Liu, Xiang, et al.
Publicado: (2026)
Perovskite-LLM: Knowledge-Enhanced Large Language Models for Perovskite Solar Cell Research
por: Liu, Xiang, et al.
Publicado: (2025)
por: Liu, Xiang, et al.
Publicado: (2025)
FuseFL: One-Shot Federated Learning through the Lens of Causality with Progressive Model Fusion
por: Tang, Zhenheng, et al.
Publicado: (2024)
por: Tang, Zhenheng, et al.
Publicado: (2024)
AlphaEdit: Null-Space Constrained Knowledge Editing for Language Models
por: Fang, Junfeng, et al.
Publicado: (2024)
por: Fang, Junfeng, et al.
Publicado: (2024)
The Butterfly Effect of Model Editing: Few Edits Can Trigger Large Language Models Collapse
por: Yang, Wanli, et al.
Publicado: (2024)
por: Yang, Wanli, et al.
Publicado: (2024)
K-Edit: Language Model Editing with Contextual Knowledge Awareness
por: Markowitz, Elan, et al.
Publicado: (2025)
por: Markowitz, Elan, et al.
Publicado: (2025)
Resolving UnderEdit & OverEdit with Iterative & Neighbor-Assisted Model Editing
por: Baghel, Bhiman Kumar, et al.
Publicado: (2025)
por: Baghel, Bhiman Kumar, et al.
Publicado: (2025)
Can Compressed LLMs Truly Act? An Empirical Evaluation of Agentic Capabilities in LLM Compression
por: Dong, Peijie, et al.
Publicado: (2025)
por: Dong, Peijie, et al.
Publicado: (2025)
Can It Edit? Evaluating the Ability of Large Language Models to Follow Code Editing Instructions
por: Cassano, Federico, et al.
Publicado: (2023)
por: Cassano, Federico, et al.
Publicado: (2023)
ChartEditBench: Evaluating Grounded Multi-Turn Chart Editing in Multimodal Language Models
por: Kapadnis, Manav Nitin, et al.
Publicado: (2026)
por: Kapadnis, Manav Nitin, et al.
Publicado: (2026)
Has this Fact been Edited? Detecting Knowledge Edits in Language Models
por: Youssef, Paul, et al.
Publicado: (2024)
por: Youssef, Paul, et al.
Publicado: (2024)
Can We Edit Multimodal Large Language Models?
por: Cheng, Siyuan, et al.
Publicado: (2023)
por: Cheng, Siyuan, et al.
Publicado: (2023)
OmniReview: A Large-scale Benchmark and LLM-enhanced Framework for Realistic Reviewer Recommendation
por: Huang, Yehua, et al.
Publicado: (2026)
por: Huang, Yehua, et al.
Publicado: (2026)
Token Signature: Predicting Chain-of-Thought Gains with Token Decoding Feature in Large Language Models
por: Liu, Peijie, et al.
Publicado: (2025)
por: Liu, Peijie, et al.
Publicado: (2025)
BiasEdit: Debiasing Stereotyped Language Models via Model Editing
por: Xu, Xin, et al.
Publicado: (2025)
por: Xu, Xin, et al.
Publicado: (2025)
Large Language Models Assume People are More Rational than We Really are
por: Liu, Ryan, et al.
Publicado: (2024)
por: Liu, Ryan, et al.
Publicado: (2024)
ReasonEdit: Editing Vision-Language Models using Human Reasoning
por: Qiu, Jiaxing, et al.
Publicado: (2026)
por: Qiu, Jiaxing, et al.
Publicado: (2026)
DualEdit: Dual Editing for Knowledge Updating in Vision-Language Models
por: Shi, Zhiyi, et al.
Publicado: (2025)
por: Shi, Zhiyi, et al.
Publicado: (2025)
StruEdit: Structured Outputs Enable the Fast and Accurate Knowledge Editing for Large Language Models
por: Bi, Baolong, et al.
Publicado: (2024)
por: Bi, Baolong, et al.
Publicado: (2024)
UltraEdit: Training-, Subject-, and Memory-Free Lifelong Editing in Language Models
por: Gu, Xiaojie, et al.
Publicado: (2025)
por: Gu, Xiaojie, et al.
Publicado: (2025)
ExpressEdit: Video Editing with Natural Language and Sketching
por: Tilekbay, Bekzat, et al.
Publicado: (2024)
por: Tilekbay, Bekzat, et al.
Publicado: (2024)
CogLM: Tracking Cognitive Development of Large Language Models
por: Wang, Xinglin, et al.
Publicado: (2024)
por: Wang, Xinglin, et al.
Publicado: (2024)
Do Multimodal Language Models Really Understand Direction? A Benchmark for Compass Direction Reasoning
por: Yin, Hang, et al.
Publicado: (2024)
por: Yin, Hang, et al.
Publicado: (2024)
RouteMark: A Fingerprint for Intellectual Property Attribution in Routing-based Model Merging
por: He, Xin, et al.
Publicado: (2025)
por: He, Xin, et al.
Publicado: (2025)
Consistency-Aware Editing for Entity-level Unlearning in Language Models
por: Han, Xiaoqi, et al.
Publicado: (2025)
por: Han, Xiaoqi, et al.
Publicado: (2025)
Are Large Language Models Really Good Logical Reasoners? A Comprehensive Evaluation and Beyond
por: Xu, Fangzhi, et al.
Publicado: (2023)
por: Xu, Fangzhi, et al.
Publicado: (2023)
ChunkKV: Semantic-Preserving KV Cache Compression for Efficient Long-Context LLM Inference
por: Liu, Xiang, et al.
Publicado: (2025)
por: Liu, Xiang, et al.
Publicado: (2025)
Is the System Message Really Important to Jailbreaks in Large Language Models?
por: Zou, Xiaotian, et al.
Publicado: (2024)
por: Zou, Xiaotian, et al.
Publicado: (2024)
EditFollower: Tunable Car Following Models for Customizable Adaptive Cruise Control Systems
por: Chen, Xianda, et al.
Publicado: (2024)
por: Chen, Xianda, et al.
Publicado: (2024)
Ejemplares similares
-
The Lottery LLM Hypothesis, Rethinking What Abilities Should LLM Compression Preserve?
por: Tang, Zhenheng, et al.
Publicado: (2025) -
Reasoning Language Model Inference Serving Unveiled: An Empirical Study
por: Li, Qi, et al.
Publicado: (2025) -
Mediator: Memory-efficient LLM Merging with Less Parameter Conflicts and Uncertainty Based Routing
por: Lai, Kunfeng, et al.
Publicado: (2025) -
Pruner-Zero: Evolving Symbolic Pruning Metric from scratch for Large Language Models
por: Dong, Peijie, et al.
Publicado: (2024) -
Semantic Integrity Matters: Benchmarking and Preserving High-Density Reasoning in KV Cache Compression
por: Liu, Xiang, et al.
Publicado: (2025)