Training Dynamics of a 1.7B LLaMa Model: A Data-Efficient Approach
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Miles Q., Fung, Benjamin C. M., Huang, Shih-Chia |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
On the Effectiveness of Incremental Training of Large Language Models
di: Li, Miles Q., et al.
Pubblicazione: (2024)
di: Li, Miles Q., et al.
Pubblicazione: (2024)
Benchmarking quantized LLaMa-based models on the Brazilian Secondary School Exam
di: Santos, Matheus L. O., et al.
Pubblicazione: (2023)
di: Santos, Matheus L. O., et al.
Pubblicazione: (2023)
A Deep User Interface for Exploring LLaMa
di: Perumal, Divya, et al.
Pubblicazione: (2025)
di: Perumal, Divya, et al.
Pubblicazione: (2025)
LLaMa-SciQ: An Educational Chatbot for Answering Science MCQ
di: Allard, Marc-Antoine, et al.
Pubblicazione: (2024)
di: Allard, Marc-Antoine, et al.
Pubblicazione: (2024)
Accessing GPT-4 level Mathematical Olympiad Solutions via Monte Carlo Tree Self-refine with LLaMa-3 8B
di: Zhang, Di, et al.
Pubblicazione: (2024)
di: Zhang, Di, et al.
Pubblicazione: (2024)
Security Concerns for Large Language Models: A Survey
di: Li, Miles Q., et al.
Pubblicazione: (2025)
di: Li, Miles Q., et al.
Pubblicazione: (2025)
Evaluating LLMs for Quotation Attribution in Literary Texts: A Case Study of LLaMa3
di: Michel, Gaspard, et al.
Pubblicazione: (2024)
di: Michel, Gaspard, et al.
Pubblicazione: (2024)
Systematic Analysis for Pretrained Language Model Priming for Parameter-Efficient Fine-tuning
di: Huang, Shih-Cheng, et al.
Pubblicazione: (2022)
di: Huang, Shih-Cheng, et al.
Pubblicazione: (2022)
LLaMP: Large Language Model Made Powerful for High-fidelity Materials Knowledge Retrieval and Distillation
di: Chiang, Yuan, et al.
Pubblicazione: (2024)
di: Chiang, Yuan, et al.
Pubblicazione: (2024)
Annotation-Efficient Vision-Language Model Adaptation to the Polish Language Using the LLaVA Framework
di: Statkiewicz, Grzegorz, et al.
Pubblicazione: (2026)
di: Statkiewicz, Grzegorz, et al.
Pubblicazione: (2026)
LLaMAs Have Feelings Too: Unveiling Sentiment and Emotion Representations in LLaMA Models Through Probing
di: Di Palma, Dario, et al.
Pubblicazione: (2025)
di: Di Palma, Dario, et al.
Pubblicazione: (2025)
Resource-Efficient Fine-Tuning of LLaMA-3.2-3B for Medical Chain-of-Thought Reasoning
di: Mansha, Imran
Pubblicazione: (2025)
di: Mansha, Imran
Pubblicazione: (2025)
LLaDA2.0: Scaling Up Diffusion Language Models to 100B
di: Bie, Tiwei, et al.
Pubblicazione: (2025)
di: Bie, Tiwei, et al.
Pubblicazione: (2025)
LLaMA-Berry: Pairwise Optimization for O1-like Olympiad-Level Mathematical Reasoning
di: Zhang, Di, et al.
Pubblicazione: (2024)
di: Zhang, Di, et al.
Pubblicazione: (2024)
Me LLaMA: Foundation Large Language Models for Medical Applications
di: Xie, Qianqian, et al.
Pubblicazione: (2024)
di: Xie, Qianqian, et al.
Pubblicazione: (2024)
Dynamic-LLaVA: Efficient Multimodal Large Language Models via Dynamic Vision-language Context Sparsification
di: Huang, Wenxuan, et al.
Pubblicazione: (2024)
di: Huang, Wenxuan, et al.
Pubblicazione: (2024)
Prompt Compression in Diffusion Large Language Models: Evaluating LLMLingua-2 on LLaDA
di: Huang, Sterling, et al.
Pubblicazione: (2026)
di: Huang, Sterling, et al.
Pubblicazione: (2026)
LLaDA-MoE: A Sparse MoE Diffusion Language Model
di: Zhu, Fengqi, et al.
Pubblicazione: (2025)
di: Zhu, Fengqi, et al.
Pubblicazione: (2025)
R&B: Domain Regrouping and Data Mixture Balancing for Efficient Foundation Model Training
di: Ge, Albert, et al.
Pubblicazione: (2025)
di: Ge, Albert, et al.
Pubblicazione: (2025)
How Vocabulary Sharing Facilitates Multilingualism in LLaMA?
di: Yuan, Fei, et al.
Pubblicazione: (2023)
di: Yuan, Fei, et al.
Pubblicazione: (2023)
LLaSA: Large Language and Structured Data Assistant
di: Xu, Yao, et al.
Pubblicazione: (2024)
di: Xu, Yao, et al.
Pubblicazione: (2024)
AVG-LLaVA: An Efficient Large Multimodal Model with Adaptive Visual Granularity
di: Lan, Zhibin, et al.
Pubblicazione: (2024)
di: Lan, Zhibin, et al.
Pubblicazione: (2024)
How to Train Data-Efficient LLMs
di: Sachdeva, Noveen, et al.
Pubblicazione: (2024)
di: Sachdeva, Noveen, et al.
Pubblicazione: (2024)
Crowdsourcing with Enhanced Data Quality Assurance: An Efficient Approach to Mitigate Resource Scarcity Challenges in Training Large Language Models for Healthcare
di: Barai, P., et al.
Pubblicazione: (2024)
di: Barai, P., et al.
Pubblicazione: (2024)
LLaMandement: Large Language Models for Summarization of French Legislative Proposals
di: Gesnouin, Joseph, et al.
Pubblicazione: (2024)
di: Gesnouin, Joseph, et al.
Pubblicazione: (2024)
LLaMA Beyond English: An Empirical Study on Language Capability Transfer
di: Zhao, Jun, et al.
Pubblicazione: (2024)
di: Zhao, Jun, et al.
Pubblicazione: (2024)
Anti-Length Shift: Dynamic Outlier Truncation for Training Efficient Reasoning Models
di: Wu, Wei, et al.
Pubblicazione: (2026)
di: Wu, Wei, et al.
Pubblicazione: (2026)
LLaVA-Gemma: Accelerating Multimodal Foundation Models with a Compact Language Model
di: Hinck, Musashi, et al.
Pubblicazione: (2024)
di: Hinck, Musashi, et al.
Pubblicazione: (2024)
DSL-LLaDA: Scaling Continuous Denoising to 8B Masked Diffusion LMs
di: Yu, Longxuan, et al.
Pubblicazione: (2026)
di: Yu, Longxuan, et al.
Pubblicazione: (2026)
UltraLLaDA: Scaling the Context Length to 128K for Diffusion Large Language Models
di: He, Guangxin, et al.
Pubblicazione: (2025)
di: He, Guangxin, et al.
Pubblicazione: (2025)
StatLLaMA: Multi-Stage training for domain-optimized statistical large language models
di: Zeng, Jing-Yi, et al.
Pubblicazione: (2025)
di: Zeng, Jing-Yi, et al.
Pubblicazione: (2025)
Unifying Structured Data as Graph for Data-to-Text Pre-Training
di: Li, Shujie, et al.
Pubblicazione: (2024)
di: Li, Shujie, et al.
Pubblicazione: (2024)
HyperLLaVA: Dynamic Visual and Language Expert Tuning for Multimodal Large Language Models
di: Zhang, Wenqiao, et al.
Pubblicazione: (2024)
di: Zhang, Wenqiao, et al.
Pubblicazione: (2024)
"According to ...": Prompting Language Models Improves Quoting from Pre-Training Data
di: Weller, Orion, et al.
Pubblicazione: (2023)
di: Weller, Orion, et al.
Pubblicazione: (2023)
D$^3$: Dynamic Directional Graph-Constrained Data Scheduling for LLM Training
di: Xu, Yuanjian, et al.
Pubblicazione: (2026)
di: Xu, Yuanjian, et al.
Pubblicazione: (2026)
An Efficient and Precise Training Data Construction Framework for Process-supervised Reward Model in Mathematical Reasoning
di: Sun, Wei, et al.
Pubblicazione: (2025)
di: Sun, Wei, et al.
Pubblicazione: (2025)
Untie the Knots: An Efficient Data Augmentation Strategy for Long-Context Pre-Training in Language Models
di: Tian, Junfeng, et al.
Pubblicazione: (2024)
di: Tian, Junfeng, et al.
Pubblicazione: (2024)
Empowering Smaller Models: Tuning LLaMA and Gemma with Chain-of-Thought for Ukrainian Exam Tasks
di: Syromiatnikov, Mykyta, et al.
Pubblicazione: (2025)
di: Syromiatnikov, Mykyta, et al.
Pubblicazione: (2025)
Data Efficacy for Language Model Training
di: Dai, Yalun, et al.
Pubblicazione: (2025)
di: Dai, Yalun, et al.
Pubblicazione: (2025)
Adaptive Prompt Embedding Optimization for LLM Jailbreaking
di: Li, Miles Q., et al.
Pubblicazione: (2026)
di: Li, Miles Q., et al.
Pubblicazione: (2026)
Documenti analoghi
-
On the Effectiveness of Incremental Training of Large Language Models
di: Li, Miles Q., et al.
Pubblicazione: (2024) -
Benchmarking quantized LLaMa-based models on the Brazilian Secondary School Exam
di: Santos, Matheus L. O., et al.
Pubblicazione: (2023) -
A Deep User Interface for Exploring LLaMa
di: Perumal, Divya, et al.
Pubblicazione: (2025) -
LLaMa-SciQ: An Educational Chatbot for Answering Science MCQ
di: Allard, Marc-Antoine, et al.
Pubblicazione: (2024) -
Accessing GPT-4 level Mathematical Olympiad Solutions via Monte Carlo Tree Self-refine with LLaMa-3 8B
di: Zhang, Di, et al.
Pubblicazione: (2024)