Efficient Construction of Model Family through Progressive Training Using Model Expansion
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Yano, Kazuki, Takase, Sho, Kobayashi, Sosuke, Kiyono, Shun, Suzuki, Jun |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Pre-training LLM without Learning Rate Decay Enhances Supervised Fine-Tuning
von: Yano, Kazuki, et al.
Veröffentlicht: (2026)
von: Yano, Kazuki, et al.
Veröffentlicht: (2026)
Spike No More: Stabilizing the Pre-training of Large Language Models
von: Takase, Sho, et al.
Veröffentlicht: (2023)
von: Takase, Sho, et al.
Veröffentlicht: (2023)
Self-Translate-Train: Enhancing Cross-Lingual Transfer of Large Language Models via Inherent Capability
von: Ri, Ryokan, et al.
Veröffentlicht: (2024)
von: Ri, Ryokan, et al.
Veröffentlicht: (2024)
Large Vocabulary Size Improves Large Language Models
von: Takase, Sho, et al.
Veröffentlicht: (2024)
von: Takase, Sho, et al.
Veröffentlicht: (2024)
STEP: Staged Parameter-Efficient Pre-training for Large Language Models
von: Yano, Kazuki, et al.
Veröffentlicht: (2025)
von: Yano, Kazuki, et al.
Veröffentlicht: (2025)
Natural Fingerprints of Large Language Models
von: Suzuki, Teppei, et al.
Veröffentlicht: (2025)
von: Suzuki, Teppei, et al.
Veröffentlicht: (2025)
Adapting Text LLMs to Speech via Multimodal Depth Up-Scaling
von: Yano, Kazuki, et al.
Veröffentlicht: (2026)
von: Yano, Kazuki, et al.
Veröffentlicht: (2026)
TimeMachine-bench: A Benchmark for Evaluating Model Capabilities in Repository-Level Migration Tasks
von: Fujii, Ryo, et al.
Veröffentlicht: (2026)
von: Fujii, Ryo, et al.
Veröffentlicht: (2026)
Layerwise Importance Analysis of Feed-Forward Networks in Transformer-based Language Models
von: Ikeda, Wataru, et al.
Veröffentlicht: (2025)
von: Ikeda, Wataru, et al.
Veröffentlicht: (2025)
Toward LLMs Beyond English-Centric Development
von: Takase, Sho, et al.
Veröffentlicht: (2026)
von: Takase, Sho, et al.
Veröffentlicht: (2026)
Scaling Laws for Upcycling Mixture-of-Experts Language Models
von: Liew, Seng Pei, et al.
Veröffentlicht: (2025)
von: Liew, Seng Pei, et al.
Veröffentlicht: (2025)
Suppressing Final Layer Hidden State Jumps in Transformer Pretraining
von: Shibata, Keigo, et al.
Veröffentlicht: (2026)
von: Shibata, Keigo, et al.
Veröffentlicht: (2026)
When Does Metadata Conditioning (NOT) Work for Language Model Pre-Training? A Study with Context-Free Grammars
von: Higuchi, Rei, et al.
Veröffentlicht: (2025)
von: Higuchi, Rei, et al.
Veröffentlicht: (2025)
Revisiting the Capacity Gap in Chain-of-Thought Distillation from a Practical Perspective
von: Kajitsuka, Tokio, et al.
Veröffentlicht: (2026)
von: Kajitsuka, Tokio, et al.
Veröffentlicht: (2026)
Analyzing Feed-Forward Blocks in Transformers through the Lens of Attention Maps
von: Kobayashi, Goro, et al.
Veröffentlicht: (2023)
von: Kobayashi, Goro, et al.
Veröffentlicht: (2023)
AIx Speed: Playback Speed Optimization Using Listening Comprehension of Speech Recognition Models
von: Kawamura, Kazuki, et al.
Veröffentlicht: (2024)
von: Kawamura, Kazuki, et al.
Veröffentlicht: (2024)
Can Large Language Models Invent Algorithms to Improve Themselves?: Algorithm Discovery for Recursive Self-Improvement through Reinforcement Learning
von: Ishibashi, Yoichi, et al.
Veröffentlicht: (2024)
von: Ishibashi, Yoichi, et al.
Veröffentlicht: (2024)
Training Large Reasoning Models Efficiently via Progressive Thought Encoding
von: Zhang, Zeliang, et al.
Veröffentlicht: (2026)
von: Zhang, Zeliang, et al.
Veröffentlicht: (2026)
Reconsidering Positional Supervision in Masked Diffusion Language Model Training
von: Ye, Mengyu, et al.
Veröffentlicht: (2026)
von: Ye, Mengyu, et al.
Veröffentlicht: (2026)
Language Model Maps for Prompt-Response Distributions via Log-Likelihood Vectors
von: Takase, Yusuke, et al.
Veröffentlicht: (2026)
von: Takase, Yusuke, et al.
Veröffentlicht: (2026)
Advantageous Parameter Expansion Training Makes Better Large Language Models
von: Gu, Naibin, et al.
Veröffentlicht: (2025)
von: Gu, Naibin, et al.
Veröffentlicht: (2025)
Drop-Upcycling: Training Sparse Mixture of Experts with Partial Re-initialization
von: Nakamura, Taishi, et al.
Veröffentlicht: (2025)
von: Nakamura, Taishi, et al.
Veröffentlicht: (2025)
Do Large Language Models Advocate for Inferentialism?
von: Arai, Yuzuki, et al.
Veröffentlicht: (2024)
von: Arai, Yuzuki, et al.
Veröffentlicht: (2024)
Can Input Attributions Explain Inductive Reasoning in In-Context Learning?
von: Ye, Mengyu, et al.
Veröffentlicht: (2024)
von: Ye, Mengyu, et al.
Veröffentlicht: (2024)
Mapping 1,000+ Language Models via the Log-Likelihood Vector
von: Oyama, Momose, et al.
Veröffentlicht: (2025)
von: Oyama, Momose, et al.
Veröffentlicht: (2025)
OpenELM: An Efficient Language Model Family with Open Training and Inference Framework
von: Mehta, Sachin, et al.
Veröffentlicht: (2024)
von: Mehta, Sachin, et al.
Veröffentlicht: (2024)
FastPerson: Enhancing Video Learning through Effective Video Summarization that Preserves Linguistic and Visual Contexts
von: Kawamura, Kazuki, et al.
Veröffentlicht: (2024)
von: Kawamura, Kazuki, et al.
Veröffentlicht: (2024)
Refactoring Programs Using Large Language Models with Few-Shot Examples
von: Shirafuji, Atsushi, et al.
Veröffentlicht: (2023)
von: Shirafuji, Atsushi, et al.
Veröffentlicht: (2023)
Construction of Hyper-Relational Knowledge Graphs Using Pre-Trained Large Language Models
von: Datta, Preetha, et al.
Veröffentlicht: (2024)
von: Datta, Preetha, et al.
Veröffentlicht: (2024)
ProST: Progressive Sub-task Training for Pareto-Optimal Multi-agent Systems Using Small Language Models
von: Bijoy, Biddut Sarker, et al.
Veröffentlicht: (2025)
von: Bijoy, Biddut Sarker, et al.
Veröffentlicht: (2025)
An Efficient and Precise Training Data Construction Framework for Process-supervised Reward Model in Mathematical Reasoning
von: Sun, Wei, et al.
Veröffentlicht: (2025)
von: Sun, Wei, et al.
Veröffentlicht: (2025)
SpatialLadder: Progressive Training for Spatial Reasoning in Vision-Language Models
von: Li, Hongxing, et al.
Veröffentlicht: (2025)
von: Li, Hongxing, et al.
Veröffentlicht: (2025)
Disambiguating Reference in Visually Grounded Dialogues through Joint Modeling of Textual and Multimodal Semantic Structures
von: Inadumi, Shun, et al.
Veröffentlicht: (2025)
von: Inadumi, Shun, et al.
Veröffentlicht: (2025)
Establishing a Scale for Kullback-Leibler Divergence in Language Models Across Various Settings
von: Kishino, Ryo, et al.
Veröffentlicht: (2025)
von: Kishino, Ryo, et al.
Veröffentlicht: (2025)
LLaMA Pro: Progressive LLaMA with Block Expansion
von: Wu, Chengyue, et al.
Veröffentlicht: (2024)
von: Wu, Chengyue, et al.
Veröffentlicht: (2024)
Summarization of Investment Reports Using Pre-trained Model
von: Sakaji, Hiroki, et al.
Veröffentlicht: (2024)
von: Sakaji, Hiroki, et al.
Veröffentlicht: (2024)
Efficient and Effective Vocabulary Expansion Towards Multilingual Large Language Models
von: Kim, Seungduk, et al.
Veröffentlicht: (2024)
von: Kim, Seungduk, et al.
Veröffentlicht: (2024)
LaMDAgent: An Autonomous Framework for Post-Training Pipeline Optimization via LLM Agents
von: Yano, Taro, et al.
Veröffentlicht: (2025)
von: Yano, Taro, et al.
Veröffentlicht: (2025)
Pruning Multilingual Large Language Models for Multilingual Inference
von: Kim, Hwichan, et al.
Veröffentlicht: (2024)
von: Kim, Hwichan, et al.
Veröffentlicht: (2024)
Second Language (Arabic) Acquisition of LLMs via Progressive Vocabulary Expansion
von: Zhu, Jianqing, et al.
Veröffentlicht: (2024)
von: Zhu, Jianqing, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Pre-training LLM without Learning Rate Decay Enhances Supervised Fine-Tuning
von: Yano, Kazuki, et al.
Veröffentlicht: (2026) -
Spike No More: Stabilizing the Pre-training of Large Language Models
von: Takase, Sho, et al.
Veröffentlicht: (2023) -
Self-Translate-Train: Enhancing Cross-Lingual Transfer of Large Language Models via Inherent Capability
von: Ri, Ryokan, et al.
Veröffentlicht: (2024) -
Large Vocabulary Size Improves Large Language Models
von: Takase, Sho, et al.
Veröffentlicht: (2024) -
STEP: Staged Parameter-Efficient Pre-training for Large Language Models
von: Yano, Kazuki, et al.
Veröffentlicht: (2025)