Is Bigger Edit Batch Size Always Better? -- An Empirical Study on Model Editing with Llama-3
Fuente:
arXiv
Guardado en:
| Autores principales: | Yoon, Junsang, Gupta, Akshat, Anumanchipalli, Gopala |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
A Unified Framework for Model Editing
por: Gupta, Akshat, et al.
Publicado: (2024)
por: Gupta, Akshat, et al.
Publicado: (2024)
Lifelong Knowledge Editing requires Better Regularization
por: Gupta, Akshat, et al.
Publicado: (2025)
por: Gupta, Akshat, et al.
Publicado: (2025)
Geometric Interpretation of Layer Normalization and a Comparative Analysis with RMSNorm
por: Gupta, Akshat, et al.
Publicado: (2024)
por: Gupta, Akshat, et al.
Publicado: (2024)
Rebuilding ROME : Resolving Model Collapse during Sequential Model Editing
por: Gupta, Akshat, et al.
Publicado: (2024)
por: Gupta, Akshat, et al.
Publicado: (2024)
Model Editing at Scale leads to Gradual and Catastrophic Forgetting
por: Gupta, Akshat, et al.
Publicado: (2024)
por: Gupta, Akshat, et al.
Publicado: (2024)
Efficient Knowledge Editing via Minimal Precomputation
por: Gupta, Akshat, et al.
Publicado: (2025)
por: Gupta, Akshat, et al.
Publicado: (2025)
Evolutionary Strategies lead to Catastrophic Forgetting in LLMs
por: Abdi, Immanuel, et al.
Publicado: (2026)
por: Abdi, Immanuel, et al.
Publicado: (2026)
Self-Assessment Tests are Unreliable Measures of LLM Personality
por: Gupta, Akshat, et al.
Publicado: (2023)
por: Gupta, Akshat, et al.
Publicado: (2023)
FineZip : Pushing the Limits of Large Language Models for Practical Lossless Text Compression
por: Mittu, Fazal, et al.
Publicado: (2024)
por: Mittu, Fazal, et al.
Publicado: (2024)
How Do LLMs Use Their Depth?
por: Gupta, Akshat, et al.
Publicado: (2025)
por: Gupta, Akshat, et al.
Publicado: (2025)
Norm Growth and Stability Challenges in Localized Sequential Knowledge Editing
por: Gupta, Akshat, et al.
Publicado: (2025)
por: Gupta, Akshat, et al.
Publicado: (2025)
The Oracle Has Spoken: A Multi-Aspect Evaluation of Dialogue in Pythia
por: Chen, Zixun, et al.
Publicado: (2025)
por: Chen, Zixun, et al.
Publicado: (2025)
Resolving UnderEdit & OverEdit with Iterative & Neighbor-Assisted Model Editing
por: Baghel, Bhiman Kumar, et al.
Publicado: (2025)
por: Baghel, Bhiman Kumar, et al.
Publicado: (2025)
Unsupervised TTS Acoustic Modeling for TTS with Conditional Disentangled Sequential VAE
por: Lian, Jiachen, et al.
Publicado: (2022)
por: Lian, Jiachen, et al.
Publicado: (2022)
FLEKE: Federated Locate-then-Edit Knowledge Editing
por: Zhao, Zongkai, et al.
Publicado: (2025)
por: Zhao, Zongkai, et al.
Publicado: (2025)
PokerBench: Training Large Language Models to become Professional Poker Players
por: Zhuang, Richard, et al.
Publicado: (2025)
por: Zhuang, Richard, et al.
Publicado: (2025)
UltraEdit: Training-, Subject-, and Memory-Free Lifelong Editing in Language Models
por: Gu, Xiaojie, et al.
Publicado: (2025)
por: Gu, Xiaojie, et al.
Publicado: (2025)
BiasEdit: Debiasing Stereotyped Language Models via Model Editing
por: Xu, Xin, et al.
Publicado: (2025)
por: Xu, Xin, et al.
Publicado: (2025)
Llama-Nemotron: Efficient Reasoning Models
por: Bercovich, Akhiad, et al.
Publicado: (2025)
por: Bercovich, Akhiad, et al.
Publicado: (2025)
Open Llama2 Model for the Lithuanian Language
por: Nakvosas, Artūras, et al.
Publicado: (2024)
por: Nakvosas, Artūras, et al.
Publicado: (2024)
Identifying Multiple Personalities in Large Language Models with External Evaluation
por: Song, Xiaoyang, et al.
Publicado: (2024)
por: Song, Xiaoyang, et al.
Publicado: (2024)
Lugha-Llama: Adapting Large Language Models for African Languages
por: Buzaaba, Happy, et al.
Publicado: (2025)
por: Buzaaba, Happy, et al.
Publicado: (2025)
Always Learning, Always Mixing: Efficient and Simple Data Mixing All The Time
por: Hu, Michael Y., et al.
Publicado: (2026)
por: Hu, Michael Y., et al.
Publicado: (2026)
Power Scheduler: A Batch Size and Token Number Agnostic Learning Rate Scheduler
por: Shen, Yikang, et al.
Publicado: (2024)
por: Shen, Yikang, et al.
Publicado: (2024)
Power Lines: Scaling Laws for Weight Decay and Batch Size in LLM Pre-training
por: Bergsma, Shane, et al.
Publicado: (2025)
por: Bergsma, Shane, et al.
Publicado: (2025)
Reasoning Models Don't Always Say What They Think
por: Chen, Yanda, et al.
Publicado: (2025)
por: Chen, Yanda, et al.
Publicado: (2025)
BanglaLlama: LLaMA for Bangla Language
por: Zehady, Abdullah Khan, et al.
Publicado: (2024)
por: Zehady, Abdullah Khan, et al.
Publicado: (2024)
Steering Llama 2 via Contrastive Activation Addition
por: Panickssery, Nina, et al.
Publicado: (2023)
por: Panickssery, Nina, et al.
Publicado: (2023)
Fragile Knowledge, Robust Instruction-Following: The Width Pruning Dichotomy in Llama-3.2
por: Martra, Pere
Publicado: (2025)
por: Martra, Pere
Publicado: (2025)
MultiMedEdit: A Scenario-Aware Benchmark for Evaluating Knowledge Editing in Medical VQA
por: Wen, Shengtao, et al.
Publicado: (2025)
por: Wen, Shengtao, et al.
Publicado: (2025)
Inspection and Control of Self-Generated-Text Recognition Ability in Llama3-8b-Instruct
por: Ackerman, Christopher, et al.
Publicado: (2024)
por: Ackerman, Christopher, et al.
Publicado: (2024)
Batched Low-Rank Adaptation of Foundation Models
por: Wen, Yeming, et al.
Publicado: (2023)
por: Wen, Yeming, et al.
Publicado: (2023)
Domain Adaptation of Llama3-70B-Instruct through Continual Pre-Training and Model Merging: A Comprehensive Evaluation
por: Siriwardhana, Shamane, et al.
Publicado: (2024)
por: Siriwardhana, Shamane, et al.
Publicado: (2024)
Chain-of-Thought Reasoning In The Wild Is Not Always Faithful
por: Arcuschin, Iván, et al.
Publicado: (2025)
por: Arcuschin, Iván, et al.
Publicado: (2025)
RSQ: Learning from Important Tokens Leads to Better Quantized LLMs
por: Sung, Yi-Lin, et al.
Publicado: (2025)
por: Sung, Yi-Lin, et al.
Publicado: (2025)
Perplexity Cannot Always Tell Right from Wrong
por: Veličković, Petar, et al.
Publicado: (2026)
por: Veličković, Petar, et al.
Publicado: (2026)
Improving Summarization with Human Edits
por: Yao, Zonghai, et al.
Publicado: (2023)
por: Yao, Zonghai, et al.
Publicado: (2023)
A Practice of Post-Training on Llama-3 70B with Optimal Selection of Additional Language Mixture Ratio
por: Xi, Ningyuan, et al.
Publicado: (2024)
por: Xi, Ningyuan, et al.
Publicado: (2024)
OneEdit: A Neural-Symbolic Collaboratively Knowledge Editing System
por: Zhang, Ningyu, et al.
Publicado: (2024)
por: Zhang, Ningyu, et al.
Publicado: (2024)
Constraining Sequential Model Editing with Editing Anchor Compression
por: Xu, Hao-Xiang, et al.
Publicado: (2025)
por: Xu, Hao-Xiang, et al.
Publicado: (2025)
Ejemplares similares
-
A Unified Framework for Model Editing
por: Gupta, Akshat, et al.
Publicado: (2024) -
Lifelong Knowledge Editing requires Better Regularization
por: Gupta, Akshat, et al.
Publicado: (2025) -
Geometric Interpretation of Layer Normalization and a Comparative Analysis with RMSNorm
por: Gupta, Akshat, et al.
Publicado: (2024) -
Rebuilding ROME : Resolving Model Collapse during Sequential Model Editing
por: Gupta, Akshat, et al.
Publicado: (2024) -
Model Editing at Scale leads to Gradual and Catastrophic Forgetting
por: Gupta, Akshat, et al.
Publicado: (2024)