MERIT: Maximum-normalized Element-wise Ratio for Language Model Large-batch Training
Fuente:
arXiv
Salvato in:
| Autori principali: | Luo, Yang, Zheng, Zangwei, Qin, Ziheng, Zhu, Zirui, Liu, Yong, You, Yang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
How Does the Textual Information Affect the Retrieval of Multimodal In-Context Learning?
di: Luo, Yang, et al.
Pubblicazione: (2024)
di: Luo, Yang, et al.
Pubblicazione: (2024)
CAMEL: Confidence-Gated Reflection for Reward Modeling
di: Zhu, Zirui, et al.
Pubblicazione: (2026)
di: Zhu, Zirui, et al.
Pubblicazione: (2026)
OpenMoE: An Early Effort on Open Mixture-of-Experts Language Models
di: Xue, Fuzhao, et al.
Pubblicazione: (2024)
di: Xue, Fuzhao, et al.
Pubblicazione: (2024)
Mini-batch Coresets for Memory-efficient Language Model Training on Data Mixtures
di: Nguyen, Dang, et al.
Pubblicazione: (2024)
di: Nguyen, Dang, et al.
Pubblicazione: (2024)
Helen: Optimizing CTR Prediction Models with Frequency-wise Hessian Eigenvalue Regularization
di: Zhu, Zirui, et al.
Pubblicazione: (2024)
di: Zhu, Zirui, et al.
Pubblicazione: (2024)
WARDEN: Endangered Indigenous Language Transcription and Translation with 6 Hours of Training Data
di: Zhang, Ziheng, et al.
Pubblicazione: (2026)
di: Zhang, Ziheng, et al.
Pubblicazione: (2026)
MERIT: Memory-Enhanced Retrieval for Interpretable Knowledge Tracing
di: Li, Runze, et al.
Pubblicazione: (2026)
di: Li, Runze, et al.
Pubblicazione: (2026)
Listwise Preference Optimization with Element-wise Confusions for Aspect Sentiment Quad Prediction
di: Lai, Wenna, et al.
Pubblicazione: (2025)
di: Lai, Wenna, et al.
Pubblicazione: (2025)
Layer-wise Regularized Dropout for Neural Language Models
di: Ni, Shiwen, et al.
Pubblicazione: (2024)
di: Ni, Shiwen, et al.
Pubblicazione: (2024)
Cognitive Memory in Large Language Models
di: Shan, Lianlei, et al.
Pubblicazione: (2025)
di: Shan, Lianlei, et al.
Pubblicazione: (2025)
OFFSIDE: Benchmarking Unlearning Misinformation in Multimodal Large Language Models
di: Zheng, Hao, et al.
Pubblicazione: (2025)
di: Zheng, Hao, et al.
Pubblicazione: (2025)
Token-wise Influential Training Data Retrieval for Large Language Models
di: Lin, Huawei, et al.
Pubblicazione: (2024)
di: Lin, Huawei, et al.
Pubblicazione: (2024)
ConceptMath: A Bilingual Concept-wise Benchmark for Measuring Mathematical Reasoning of Large Language Models
di: Wu, Yanan, et al.
Pubblicazione: (2024)
di: Wu, Yanan, et al.
Pubblicazione: (2024)
Train Small, Infer Large: Memory-Efficient LoRA Training for Large Language Models
di: Zhang, Jun, et al.
Pubblicazione: (2025)
di: Zhang, Jun, et al.
Pubblicazione: (2025)
Evaluating Large Language Models on Financial Report Summarization: An Empirical Study
di: Yang, Xinqi, et al.
Pubblicazione: (2024)
di: Yang, Xinqi, et al.
Pubblicazione: (2024)
Boosting LLM via Learning from Data Iteratively and Selectively
di: Jia, Qi, et al.
Pubblicazione: (2024)
di: Jia, Qi, et al.
Pubblicazione: (2024)
Sparse MeZO: Less Parameters for Better Performance in Zeroth-Order LLM Fine-Tuning
di: Liu, Yong, et al.
Pubblicazione: (2024)
di: Liu, Yong, et al.
Pubblicazione: (2024)
MCP-Universe: Benchmarking Large Language Models with Real-World Model Context Protocol Servers
di: Luo, Ziyang, et al.
Pubblicazione: (2025)
di: Luo, Ziyang, et al.
Pubblicazione: (2025)
Improve Decoding Factuality by Token-wise Cross Layer Entropy of Large Language Models
di: Wu, Jialiang, et al.
Pubblicazione: (2025)
di: Wu, Jialiang, et al.
Pubblicazione: (2025)
Editing Factual Knowledge and Explanatory Ability of Medical Large Language Models
di: Xu, Derong, et al.
Pubblicazione: (2024)
di: Xu, Derong, et al.
Pubblicazione: (2024)
Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding
di: Wang, Ye, et al.
Pubblicazione: (2025)
di: Wang, Ye, et al.
Pubblicazione: (2025)
Understanding Privacy Risks of Embeddings Induced by Large Language Models
di: Zhu, Zhihao, et al.
Pubblicazione: (2024)
di: Zhu, Zhihao, et al.
Pubblicazione: (2024)
A Survey on Model Compression for Large Language Models
di: Zhu, Xunyu, et al.
Pubblicazione: (2023)
di: Zhu, Xunyu, et al.
Pubblicazione: (2023)
Towards Inference-time Category-wise Safety Steering for Large Language Models
di: Bhattacharjee, Amrita, et al.
Pubblicazione: (2024)
di: Bhattacharjee, Amrita, et al.
Pubblicazione: (2024)
Evolving Subnetwork Training for Large Language Models
di: Li, Hanqi, et al.
Pubblicazione: (2024)
di: Li, Hanqi, et al.
Pubblicazione: (2024)
Survey of Specialized Large Language Model
di: Yang, Chenghan, et al.
Pubblicazione: (2025)
di: Yang, Chenghan, et al.
Pubblicazione: (2025)
A Large Language Model-Empowered Agent for Reliable and Robust Structural Analysis
di: Liu, Jiachen, et al.
Pubblicazione: (2025)
di: Liu, Jiachen, et al.
Pubblicazione: (2025)
Training-Free Test-Time Contrastive Learning for Large Language Models
di: Zheng, Kaiwen, et al.
Pubblicazione: (2026)
di: Zheng, Kaiwen, et al.
Pubblicazione: (2026)
CoLLMLight: Cooperative Large Language Model Agents for Network-Wide Traffic Signal Control
di: Yuan, Zirui, et al.
Pubblicazione: (2025)
di: Yuan, Zirui, et al.
Pubblicazione: (2025)
A Survey of Process Reward Models: From Outcome Signals to Process Supervisions for Large Language Models
di: Zheng, Congmin, et al.
Pubblicazione: (2025)
di: Zheng, Congmin, et al.
Pubblicazione: (2025)
SOD: Step-wise On-policy Distillation for Small Language Model Agents
di: Zhong, Qiyong, et al.
Pubblicazione: (2026)
di: Zhong, Qiyong, et al.
Pubblicazione: (2026)
Data Management For Training Large Language Models: A Survey
di: Wang, Zige, et al.
Pubblicazione: (2023)
di: Wang, Zige, et al.
Pubblicazione: (2023)
Binary Neural Networks for Large Language Model: A Survey
di: Liu, Liangdong, et al.
Pubblicazione: (2025)
di: Liu, Liangdong, et al.
Pubblicazione: (2025)
Regurgitative Training: The Value of Real Data in Training Large Language Models
di: Zhang, Jinghui, et al.
Pubblicazione: (2024)
di: Zhang, Jinghui, et al.
Pubblicazione: (2024)
Inconsistencies in Masked Language Models
di: Young, Tom, et al.
Pubblicazione: (2022)
di: Young, Tom, et al.
Pubblicazione: (2022)
Ontology-Enhanced Knowledge Graph Completion using Large Language Models
di: Guo, Wenbin, et al.
Pubblicazione: (2025)
di: Guo, Wenbin, et al.
Pubblicazione: (2025)
Special Characters Attack: Toward Scalable Training Data Extraction From Large Language Models
di: Bai, Yang, et al.
Pubblicazione: (2024)
di: Bai, Yang, et al.
Pubblicazione: (2024)
Breaking the Trade-Off Between Faithfulness and Expressiveness for Large Language Models
di: Yang, Chenxu, et al.
Pubblicazione: (2025)
di: Yang, Chenxu, et al.
Pubblicazione: (2025)
Sensitivity Meets Sparsity: The Impact of Extremely Sparse Parameter Patterns on Theory-of-Mind of Large Language Models
di: Wu, Yuheng, et al.
Pubblicazione: (2025)
di: Wu, Yuheng, et al.
Pubblicazione: (2025)
LLMCBench: Benchmarking Large Language Model Compression for Efficient Deployment
di: Yang, Ge, et al.
Pubblicazione: (2024)
di: Yang, Ge, et al.
Pubblicazione: (2024)
Documenti analoghi
-
How Does the Textual Information Affect the Retrieval of Multimodal In-Context Learning?
di: Luo, Yang, et al.
Pubblicazione: (2024) -
CAMEL: Confidence-Gated Reflection for Reward Modeling
di: Zhu, Zirui, et al.
Pubblicazione: (2026) -
OpenMoE: An Early Effort on Open Mixture-of-Experts Language Models
di: Xue, Fuzhao, et al.
Pubblicazione: (2024) -
Mini-batch Coresets for Memory-efficient Language Model Training on Data Mixtures
di: Nguyen, Dang, et al.
Pubblicazione: (2024) -
Helen: Optimizing CTR Prediction Models with Frequency-wise Hessian Eigenvalue Regularization
di: Zhu, Zirui, et al.
Pubblicazione: (2024)