Nemotron-CLIMB: CLustering-based Iterative Data Mixture Bootstrapping for Language Model Pre-training
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Diao, Shizhe, Yang, Yu, Fu, Yonggan, Dong, Xin, Su, Dan, Kliegl, Markus, Chen, Zijia, Belcak, Peter, Suhara, Yoshi, Yin, Hongxu, Patwary, Mostofa, Yingyan, Lin, Kautz, Jan, Molchanov, Pavlo |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Small Language Models are the Future of Agentic AI
von: Belcak, Peter, et al.
Veröffentlicht: (2025)
von: Belcak, Peter, et al.
Veröffentlicht: (2025)
Nemotron Elastic: Towards Efficient Many-in-One Reasoning LLMs
von: Taghibakhshi, Ali, et al.
Veröffentlicht: (2025)
von: Taghibakhshi, Ali, et al.
Veröffentlicht: (2025)
Hymba: A Hybrid-head Architecture for Small Language Models
von: Dong, Xin, et al.
Veröffentlicht: (2024)
von: Dong, Xin, et al.
Veröffentlicht: (2024)
Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset
von: Su, Dan, et al.
Veröffentlicht: (2024)
von: Su, Dan, et al.
Veröffentlicht: (2024)
Universal Deep Research: Bring Your Own Model and Strategy
von: Belcak, Peter, et al.
Veröffentlicht: (2025)
von: Belcak, Peter, et al.
Veröffentlicht: (2025)
Nemotron-Flash: Towards Latency-Optimal Hybrid Small Language Models
von: Fu, Yonggan, et al.
Veröffentlicht: (2025)
von: Fu, Yonggan, et al.
Veröffentlicht: (2025)
Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation
von: Belcak, Peter, et al.
Veröffentlicht: (2025)
von: Belcak, Peter, et al.
Veröffentlicht: (2025)
LongMamba: Enhancing Mamba's Long Context Capabilities via Training-Free Receptive Field Enlargement
von: Ye, Zhifan, et al.
Veröffentlicht: (2025)
von: Ye, Zhifan, et al.
Veröffentlicht: (2025)
ToolOrchestra: Elevating Intelligence via Efficient Model and Tool Orchestration
von: Su, Hongjin, et al.
Veröffentlicht: (2025)
von: Su, Hongjin, et al.
Veröffentlicht: (2025)
VILA: On Pre-training for Visual Language Models
von: Lin, Ji, et al.
Veröffentlicht: (2023)
von: Lin, Ji, et al.
Veröffentlicht: (2023)
LLM Pruning and Distillation in Practice: The Minitron Approach
von: Sreenivas, Sharath Turuvekere, et al.
Veröffentlicht: (2024)
von: Sreenivas, Sharath Turuvekere, et al.
Veröffentlicht: (2024)
Minitron-SSM: Efficient Hybrid Language Model Compression through Group-Aware SSM Pruning
von: Taghibakhshi, Ali, et al.
Veröffentlicht: (2025)
von: Taghibakhshi, Ali, et al.
Veröffentlicht: (2025)
Compact Language Models via Pruning and Knowledge Distillation
von: Muralidharan, Saurav, et al.
Veröffentlicht: (2024)
von: Muralidharan, Saurav, et al.
Veröffentlicht: (2024)
Nemotron-CC-Math: A 133 Billion-Token-Scale High Quality Math Pretraining Dataset
von: Mahabadi, Rabeeh Karimi, et al.
Veröffentlicht: (2025)
von: Mahabadi, Rabeeh Karimi, et al.
Veröffentlicht: (2025)
Efficient-DLM: From Autoregressive to Diffusion Language Models, and Beyond in Speed
von: Fu, Yonggan, et al.
Veröffentlicht: (2025)
von: Fu, Yonggan, et al.
Veröffentlicht: (2025)
GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization
von: Liu, Shih-Yang, et al.
Veröffentlicht: (2026)
von: Liu, Shih-Yang, et al.
Veröffentlicht: (2026)
Source Identification in Abstractive Summarization
von: Suhara, Yoshi, et al.
Veröffentlicht: (2024)
von: Suhara, Yoshi, et al.
Veröffentlicht: (2024)
LaCache: Ladder-Shaped KV Caching for Efficient Long-Context Modeling of Large Language Models
von: Shi, Dachuan, et al.
Veröffentlicht: (2025)
von: Shi, Dachuan, et al.
Veröffentlicht: (2025)
Fast-dLLM v2: Efficient Block-Diffusion LLM
von: Wu, Chengyue, et al.
Veröffentlicht: (2025)
von: Wu, Chengyue, et al.
Veröffentlicht: (2025)
Nemotron-CrossThink: Scaling Self-Learning beyond Math Reasoning
von: Akter, Syeda Nahida, et al.
Veröffentlicht: (2025)
von: Akter, Syeda Nahida, et al.
Veröffentlicht: (2025)
LITA: Language Instructed Temporal-Localization Assistant
von: Huang, De-An, et al.
Veröffentlicht: (2024)
von: Huang, De-An, et al.
Veröffentlicht: (2024)
Flextron: Many-in-One Flexible Large Language Model
von: Cai, Ruisi, et al.
Veröffentlicht: (2024)
von: Cai, Ruisi, et al.
Veröffentlicht: (2024)
AM-RADIO: Agglomerative Vision Foundation Model -- Reduce All Domains Into One
von: Ranzinger, Mike, et al.
Veröffentlicht: (2023)
von: Ranzinger, Mike, et al.
Veröffentlicht: (2023)
Noisy Pairing and Partial Supervision for Stylized Opinion Summarization
von: Iso, Hayate, et al.
Veröffentlicht: (2022)
von: Iso, Hayate, et al.
Veröffentlicht: (2022)
Large Language Models are Inconsistent and Biased Evaluators
von: Stureborg, Rickard, et al.
Veröffentlicht: (2024)
von: Stureborg, Rickard, et al.
Veröffentlicht: (2024)
ProfBench: Multi-Domain Rubrics requiring Professional Knowledge to Answer and Judge
von: Wang, Zhilin, et al.
Veröffentlicht: (2025)
von: Wang, Zhilin, et al.
Veröffentlicht: (2025)
FasterViT: Fast Vision Transformers with Hierarchical Attention
von: Hatamizadeh, Ali, et al.
Veröffentlicht: (2023)
von: Hatamizadeh, Ali, et al.
Veröffentlicht: (2023)
$R^2$-dLLM: Accelerating Diffusion Large Language Models via Spatio-Temporal Redundancy Reduction
von: Du, Zhenbang, et al.
Veröffentlicht: (2026)
von: Du, Zhenbang, et al.
Veröffentlicht: (2026)
Scaling Vision Pre-Training to 4K Resolution
von: Shi, Baifeng, et al.
Veröffentlicht: (2025)
von: Shi, Baifeng, et al.
Veröffentlicht: (2025)
Adaptive Sharpness-Aware Pruning for Robust Sparse Networks
von: Bair, Anna, et al.
Veröffentlicht: (2023)
von: Bair, Anna, et al.
Veröffentlicht: (2023)
RADIOv2.5: Improved Baselines for Agglomerative Vision Foundation Models
von: Heinrich, Greg, et al.
Veröffentlicht: (2024)
von: Heinrich, Greg, et al.
Veröffentlicht: (2024)
MaskLLM: Learnable Semi-Structured Sparsity for Large Language Models
von: Fang, Gongfan, et al.
Veröffentlicht: (2024)
von: Fang, Gongfan, et al.
Veröffentlicht: (2024)
When2Call: When (not) to Call Tools
von: Ross, Hayley, et al.
Veröffentlicht: (2025)
von: Ross, Hayley, et al.
Veröffentlicht: (2025)
BroRL: Scaling Reinforcement Learning via Broadened Exploration
von: Hu, Jian, et al.
Veröffentlicht: (2025)
von: Hu, Jian, et al.
Veröffentlicht: (2025)
TiDAR: Think in Diffusion, Talk in Autoregression
von: Liu, Jingyu, et al.
Veröffentlicht: (2025)
von: Liu, Jingyu, et al.
Veröffentlicht: (2025)
DLER: Doing Length pEnalty Right - Incentivizing More Intelligence per Token via Reinforcement Learning
von: Liu, Shih-Yang, et al.
Veröffentlicht: (2025)
von: Liu, Shih-Yang, et al.
Veröffentlicht: (2025)
Nemotron-4 15B Technical Report
von: Parmar, Jupinder, et al.
Veröffentlicht: (2024)
von: Parmar, Jupinder, et al.
Veröffentlicht: (2024)
Step Out and Seek Around: On Warm-Start Training with Incremental Data
von: Shen, Maying, et al.
Veröffentlicht: (2024)
von: Shen, Maying, et al.
Veröffentlicht: (2024)
Agent Explorative Policy Optimization for Multimodal Agentic Reasoning
von: Kang, Minki, et al.
Veröffentlicht: (2026)
von: Kang, Minki, et al.
Veröffentlicht: (2026)
Entropy-Regularized Process Reward Model
von: Zhang, Hanning, et al.
Veröffentlicht: (2024)
von: Zhang, Hanning, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Small Language Models are the Future of Agentic AI
von: Belcak, Peter, et al.
Veröffentlicht: (2025) -
Nemotron Elastic: Towards Efficient Many-in-One Reasoning LLMs
von: Taghibakhshi, Ali, et al.
Veröffentlicht: (2025) -
Hymba: A Hybrid-head Architecture for Small Language Models
von: Dong, Xin, et al.
Veröffentlicht: (2024) -
Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset
von: Su, Dan, et al.
Veröffentlicht: (2024) -
Universal Deep Research: Bring Your Own Model and Strategy
von: Belcak, Peter, et al.
Veröffentlicht: (2025)