Nemotron-Cascade 2: Post-Training LLMs with Cascade RL and Multi-Domain On-Policy Distillation
Fuente:
arXiv
Salvato in:
| Autori principali: | Yang, Zhuolin, Liu, Zihan, Chen, Yang, Dai, Wenliang, Wang, Boxin, Lin, Sheng-Chieh, Lee, Chankyu, Chen, Yangyi, Jiang, Dongfu, He, Jiafan, Pi, Renjie, Lam, Grace, Lee, Nayeon, Bukharin, Alexander, Shoeybi, Mohammad, Catanzaro, Bryan, Ping, Wei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Nemotron-Cascade: Scaling Cascaded Reinforcement Learning for General-Purpose Reasoning Models
di: Wang, Boxin, et al.
Pubblicazione: (2025)
di: Wang, Boxin, et al.
Pubblicazione: (2025)
AceReason-Nemotron 1.1: Advancing Math and Code Reasoning through SFT and RL Synergy
di: Liu, Zihan, et al.
Pubblicazione: (2025)
di: Liu, Zihan, et al.
Pubblicazione: (2025)
AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning
di: Chen, Yang, et al.
Pubblicazione: (2025)
di: Chen, Yang, et al.
Pubblicazione: (2025)
NVLM: Open Frontier-Class Multimodal LLMs
di: Dai, Wenliang, et al.
Pubblicazione: (2024)
di: Dai, Wenliang, et al.
Pubblicazione: (2024)
On Data Engineering for Scaling LLM Terminal Capabilities
di: Pi, Renjie, et al.
Pubblicazione: (2026)
di: Pi, Renjie, et al.
Pubblicazione: (2026)
MM-Embed: Universal Multimodal Retrieval with Multimodal LLMs
di: Lin, Sheng-Chieh, et al.
Pubblicazione: (2024)
di: Lin, Sheng-Chieh, et al.
Pubblicazione: (2024)
ChatQA: Surpassing GPT-4 on Conversational QA and RAG
di: Liu, Zihan, et al.
Pubblicazione: (2024)
di: Liu, Zihan, et al.
Pubblicazione: (2024)
AceMath: Advancing Frontier Math Reasoning with Post-Training and Reward Modeling
di: Liu, Zihan, et al.
Pubblicazione: (2024)
di: Liu, Zihan, et al.
Pubblicazione: (2024)
NV-Embed: Improved Techniques for Training LLMs as Generalist Embedding Models
di: Lee, Chankyu, et al.
Pubblicazione: (2024)
di: Lee, Chankyu, et al.
Pubblicazione: (2024)
Nemotron-CC-Math: A 133 Billion-Token-Scale High Quality Math Pretraining Dataset
di: Mahabadi, Rabeeh Karimi, et al.
Pubblicazione: (2025)
di: Mahabadi, Rabeeh Karimi, et al.
Pubblicazione: (2025)
Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset
di: Su, Dan, et al.
Pubblicazione: (2024)
di: Su, Dan, et al.
Pubblicazione: (2024)
Nemotron-CrossThink: Scaling Self-Learning beyond Math Reasoning
di: Akter, Syeda Nahida, et al.
Pubblicazione: (2025)
di: Akter, Syeda Nahida, et al.
Pubblicazione: (2025)
RankRAG: Unifying Context Ranking with Retrieval-Augmented Generation in LLMs
di: Yu, Yue, et al.
Pubblicazione: (2024)
di: Yu, Yue, et al.
Pubblicazione: (2024)
From 128K to 4M: Efficient Training of Ultra-Long Context Large Language Models
di: Xu, Chejian, et al.
Pubblicazione: (2025)
di: Xu, Chejian, et al.
Pubblicazione: (2025)
InstructRetro: Instruction Tuning post Retrieval-Augmented Pretraining
di: Wang, Boxin, et al.
Pubblicazione: (2023)
di: Wang, Boxin, et al.
Pubblicazione: (2023)
Nemotron Elastic: Towards Efficient Many-in-One Reasoning LLMs
di: Taghibakhshi, Ali, et al.
Pubblicazione: (2025)
di: Taghibakhshi, Ali, et al.
Pubblicazione: (2025)
Nemotron-4 15B Technical Report
di: Parmar, Jupinder, et al.
Pubblicazione: (2024)
di: Parmar, Jupinder, et al.
Pubblicazione: (2024)
ChatQA 2: Bridging the Gap to Proprietary LLMs in Long Context and RAG Capabilities
di: Xu, Peng, et al.
Pubblicazione: (2024)
di: Xu, Peng, et al.
Pubblicazione: (2024)
Reuse, Don't Retrain: A Recipe for Continued Pretraining of Language Models
di: Parmar, Jupinder, et al.
Pubblicazione: (2024)
di: Parmar, Jupinder, et al.
Pubblicazione: (2024)
Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning
di: Zhang, Shaokun, et al.
Pubblicazione: (2025)
di: Zhang, Shaokun, et al.
Pubblicazione: (2025)
Compact Language Models via Pruning and Knowledge Distillation
di: Muralidharan, Saurav, et al.
Pubblicazione: (2024)
di: Muralidharan, Saurav, et al.
Pubblicazione: (2024)
CascadeDebate: Multi-Agent Deliberation for Cost-Aware LLM Cascades
di: Chang, Raeyoung, et al.
Pubblicazione: (2026)
di: Chang, Raeyoung, et al.
Pubblicazione: (2026)
RAVEN: In-Context Learning with Retrieval-Augmented Encoder-Decoder Language Models
di: Huang, Jie, et al.
Pubblicazione: (2023)
di: Huang, Jie, et al.
Pubblicazione: (2023)
All Nanozyme‐Based Cascade Reactions for Biomedical Applications: from Self‐Cascading Nanozyme to Immobilized Cascade Nanozyme
di: Caixia Zhu, et al.
Pubblicazione: (2025)
di: Caixia Zhu, et al.
Pubblicazione: (2025)
NVIDIA Nemotron Nano V2 VL
di: NVIDIA, et al.
Pubblicazione: (2025)
di: NVIDIA, et al.
Pubblicazione: (2025)
On the Runway Cascade of Transformers for Language Modeling
di: Lee, Hunjae, et al.
Pubblicazione: (2026)
di: Lee, Hunjae, et al.
Pubblicazione: (2026)
UALM: Unified Audio Language Model for Understanding, Generation and Reasoning
di: Tian, Jinchuan, et al.
Pubblicazione: (2025)
di: Tian, Jinchuan, et al.
Pubblicazione: (2025)
NVIDIA Nemotron Parse 1.1
di: Chumachenko, Kateryna, et al.
Pubblicazione: (2025)
di: Chumachenko, Kateryna, et al.
Pubblicazione: (2025)
Regret Bounds for Noise-Free Cascaded Kernelized Bandits
di: Li, Zihan, et al.
Pubblicazione: (2022)
di: Li, Zihan, et al.
Pubblicazione: (2022)
Hidden costs for inference with deep network on embedded system devices
di: Lee, Chankyu, et al.
Pubblicazione: (2026)
di: Lee, Chankyu, et al.
Pubblicazione: (2026)
CasPoinTr: Point Cloud Completion with Cascaded Networks and Knowledge Distillation
di: Yang, Yifan, et al.
Pubblicazione: (2025)
di: Yang, Yifan, et al.
Pubblicazione: (2025)
ODIN: Disentangled Reward Mitigates Hacking in RLHF
di: Chen, Lichang, et al.
Pubblicazione: (2024)
di: Chen, Lichang, et al.
Pubblicazione: (2024)
Retrieval meets Long Context Large Language Models
di: Xu, Peng, et al.
Pubblicazione: (2023)
di: Xu, Peng, et al.
Pubblicazione: (2023)
ACECODER: Acing Coder RL via Automated Test-Case Synthesis
di: Zeng, Huaye, et al.
Pubblicazione: (2025)
di: Zeng, Huaye, et al.
Pubblicazione: (2025)
Cascading Reinforcement Learning
di: Du, Yihan, et al.
Pubblicazione: (2024)
di: Du, Yihan, et al.
Pubblicazione: (2024)
Nemotron-4 340B Technical Report
di: Nvidia, et al.
Pubblicazione: (2024)
di: Nvidia, et al.
Pubblicazione: (2024)
AnyMAC: Cascading Flexible Multi-Agent Collaboration via Next-Agent Prediction
di: Wang, Song, et al.
Pubblicazione: (2025)
di: Wang, Song, et al.
Pubblicazione: (2025)
Maximize Your Data's Potential: Enhancing LLM Accuracy with Two-Phase Pretraining
di: Feng, Steven, et al.
Pubblicazione: (2024)
di: Feng, Steven, et al.
Pubblicazione: (2024)
A Convergent Radical Cascade for the Synthesis of Azaindanes
di: Chelsea D. Grace, et al.
Pubblicazione: (2025)
di: Chelsea D. Grace, et al.
Pubblicazione: (2025)
TRIDENT: A Trimodal Cascade Generative Framework for Drug and RNA-Conditioned Cellular Morphology Synthesis
di: Peng, Rui, et al.
Pubblicazione: (2025)
di: Peng, Rui, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Nemotron-Cascade: Scaling Cascaded Reinforcement Learning for General-Purpose Reasoning Models
di: Wang, Boxin, et al.
Pubblicazione: (2025) -
AceReason-Nemotron 1.1: Advancing Math and Code Reasoning through SFT and RL Synergy
di: Liu, Zihan, et al.
Pubblicazione: (2025) -
AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning
di: Chen, Yang, et al.
Pubblicazione: (2025) -
NVLM: Open Frontier-Class Multimodal LLMs
di: Dai, Wenliang, et al.
Pubblicazione: (2024) -
On Data Engineering for Scaling LLM Terminal Capabilities
di: Pi, Renjie, et al.
Pubblicazione: (2026)