Llama-Nemotron: Efficient Reasoning Models

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Bercovich, Akhiad, Levy, Itay, Golan, Izik, Dabbah, Mohammad, El-Yaniv, Ran, Puny, Omri, Galil, Ido, Moshe, Zach, Ronen, Tomer, Nabwani, Najeeb, Shahaf, Ido, Tropp, Oren, Karpas, Ehud, Zilberstein, Ran, Zeng, Jiaqi, Singhal, Soumye, Bukharin, Alexander, Zhang, Yian, Konuk, Tugrul, Shen, Gerald, Mahabaleshwarkar, Ameya Sunil, Kartal, Bilal, Suhara, Yoshi, Delalleau, Olivier, Chen, Zijia, Wang, Zhilin, Mosallanezhad, David, Renduchintala, Adi, Qian, Haifeng, Rekesh, Dima, Jia, Fei, Majumdar, Somshubra, Noroozi, Vahid, Ahmad, Wasi Uddin, Narenthiran, Sean, Ficek, Aleksander, Samadi, Mehrzad, Huang, Jocelyn, Jain, Siddhartha, Gitman, Igor, Moshkov, Ivan, Du, Wei, Toshniwal, Shubham, Armstrong, George, Kisacanin, Branislav, Novikov, Matvei, Gitman, Daria, Bakhturina, Evelina, Varshney, Prasoon, Narsimhan, Makesh, Scowcroft, Jane Polak, Kamalu, John, Su, Dan, Kong, Kezhi, Kliegl, Markus, Mahabadi, Rabeeh Karimi, Lin, Ying, Satheesh, Sanjeev, Parmar, Jupinder, Gundecha, Pritam, Norick, Brandon, Jennings, Joseph, Prabhumoye, Shrimai, Akter, Syeda Nahida, Patwary, Mostofa, Khattar, Abhinav, Narayanan, Deepak, Waleffe, Roger, Zhang, Jimmy, Su, Bor-Yiing, Huang, Guyue, Kong, Terry, Chadha, Parth, Jain, Sahil, Harvey, Christine, Segal, Elad, Huang, Jining, Kashirsky, Sergey, McQueen, Robert, Putterman, Izzy, Lam, George, Venkatesan, Arun, Wu, Sherry, Nguyen, Vinh, Kilaru, Manoj, Wang, Andrew, Warno, Anna, Somasamudramath, Abhilash, Bhaskar, Sandip, Dong, Maka, Assaf, Nave, Mor, Shahar, Argov, Omer Ullman, Junkin, Scot, Romanenko, Oleksandr, Larroy, Pedro, Katariya, Monika, Rovinelli, Marco, Balas, Viji, Edelman, Nicholas, Bhiwandiwalla, Anahita, Subramaniam, Muthu, Ithape, Smita, Ramamoorthy, Karthik, Wu, Yuting, Velury, Suguna Varshini, Almog, Omri, Daw, Joyjit, Fridman, Denys, Galinkin, Erick, Evans, Michael, Ghosh, Shaona, Luna, Katherine, Derczynski, Leon, Pope, Nikki, Long, Eileen, Schneider, Seth, Siman, Guillermo, Grzegorzek, Tomasz, Ribalta, Pablo, Alexiuk, Chris, Conway, Joey, Saar, Trisha, Guan, Ann, Pawelec, Krzysztof, Prayaga, Shyamala, Kuchaiev, Oleksii, Ginsburg, Boris, Olabiyi, Oluwatobi, Briski, Kari, Cohen, Jonathan, Catanzaro, Bryan, Alben, Jonah, Geifman, Yonatan, Chung, Eric
Natura: Preprint
Pubblicazione: 2025
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
_version_ 1866915484994109440
author Bercovich, Akhiad
Levy, Itay
Golan, Izik
Dabbah, Mohammad
El-Yaniv, Ran
Puny, Omri
Galil, Ido
Moshe, Zach
Ronen, Tomer
Nabwani, Najeeb
Shahaf, Ido
Tropp, Oren
Karpas, Ehud
Zilberstein, Ran
Zeng, Jiaqi
Singhal, Soumye
Bukharin, Alexander
Zhang, Yian
Konuk, Tugrul
Shen, Gerald
Mahabaleshwarkar, Ameya Sunil
Kartal, Bilal
Suhara, Yoshi
Delalleau, Olivier
Chen, Zijia
Wang, Zhilin
Mosallanezhad, David
Renduchintala, Adi
Qian, Haifeng
Rekesh, Dima
Jia, Fei
Majumdar, Somshubra
Noroozi, Vahid
Ahmad, Wasi Uddin
Narenthiran, Sean
Ficek, Aleksander
Samadi, Mehrzad
Huang, Jocelyn
Jain, Siddhartha
Gitman, Igor
Moshkov, Ivan
Du, Wei
Toshniwal, Shubham
Armstrong, George
Kisacanin, Branislav
Novikov, Matvei
Gitman, Daria
Bakhturina, Evelina
Varshney, Prasoon
Narsimhan, Makesh
Scowcroft, Jane Polak
Kamalu, John
Su, Dan
Kong, Kezhi
Kliegl, Markus
Mahabadi, Rabeeh Karimi
Lin, Ying
Satheesh, Sanjeev
Parmar, Jupinder
Gundecha, Pritam
Norick, Brandon
Jennings, Joseph
Prabhumoye, Shrimai
Akter, Syeda Nahida
Patwary, Mostofa
Khattar, Abhinav
Narayanan, Deepak
Waleffe, Roger
Zhang, Jimmy
Su, Bor-Yiing
Huang, Guyue
Kong, Terry
Chadha, Parth
Jain, Sahil
Harvey, Christine
Segal, Elad
Huang, Jining
Kashirsky, Sergey
McQueen, Robert
Putterman, Izzy
Lam, George
Venkatesan, Arun
Wu, Sherry
Nguyen, Vinh
Kilaru, Manoj
Wang, Andrew
Warno, Anna
Somasamudramath, Abhilash
Bhaskar, Sandip
Dong, Maka
Assaf, Nave
Mor, Shahar
Argov, Omer Ullman
Junkin, Scot
Romanenko, Oleksandr
Larroy, Pedro
Katariya, Monika
Rovinelli, Marco
Balas, Viji
Edelman, Nicholas
Bhiwandiwalla, Anahita
Subramaniam, Muthu
Ithape, Smita
Ramamoorthy, Karthik
Wu, Yuting
Velury, Suguna Varshini
Almog, Omri
Daw, Joyjit
Fridman, Denys
Galinkin, Erick
Evans, Michael
Ghosh, Shaona
Luna, Katherine
Derczynski, Leon
Pope, Nikki
Long, Eileen
Schneider, Seth
Siman, Guillermo
Grzegorzek, Tomasz
Ribalta, Pablo
Katariya, Monika
Alexiuk, Chris
Conway, Joey
Saar, Trisha
Guan, Ann
Pawelec, Krzysztof
Prayaga, Shyamala
Kuchaiev, Oleksii
Ginsburg, Boris
Olabiyi, Oluwatobi
Briski, Kari
Cohen, Jonathan
Catanzaro, Bryan
Alben, Jonah
Geifman, Yonatan
Chung, Eric
author_facet Bercovich, Akhiad
Levy, Itay
Golan, Izik
Dabbah, Mohammad
El-Yaniv, Ran
Puny, Omri
Galil, Ido
Moshe, Zach
Ronen, Tomer
Nabwani, Najeeb
Shahaf, Ido
Tropp, Oren
Karpas, Ehud
Zilberstein, Ran
Zeng, Jiaqi
Singhal, Soumye
Bukharin, Alexander
Zhang, Yian
Konuk, Tugrul
Shen, Gerald
Mahabaleshwarkar, Ameya Sunil
Kartal, Bilal
Suhara, Yoshi
Delalleau, Olivier
Chen, Zijia
Wang, Zhilin
Mosallanezhad, David
Renduchintala, Adi
Qian, Haifeng
Rekesh, Dima
Jia, Fei
Majumdar, Somshubra
Noroozi, Vahid
Ahmad, Wasi Uddin
Narenthiran, Sean
Ficek, Aleksander
Samadi, Mehrzad
Huang, Jocelyn
Jain, Siddhartha
Gitman, Igor
Moshkov, Ivan
Du, Wei
Toshniwal, Shubham
Armstrong, George
Kisacanin, Branislav
Novikov, Matvei
Gitman, Daria
Bakhturina, Evelina
Varshney, Prasoon
Narsimhan, Makesh
Scowcroft, Jane Polak
Kamalu, John
Su, Dan
Kong, Kezhi
Kliegl, Markus
Mahabadi, Rabeeh Karimi
Lin, Ying
Satheesh, Sanjeev
Parmar, Jupinder
Gundecha, Pritam
Norick, Brandon
Jennings, Joseph
Prabhumoye, Shrimai
Akter, Syeda Nahida
Patwary, Mostofa
Khattar, Abhinav
Narayanan, Deepak
Waleffe, Roger
Zhang, Jimmy
Su, Bor-Yiing
Huang, Guyue
Kong, Terry
Chadha, Parth
Jain, Sahil
Harvey, Christine
Segal, Elad
Huang, Jining
Kashirsky, Sergey
McQueen, Robert
Putterman, Izzy
Lam, George
Venkatesan, Arun
Wu, Sherry
Nguyen, Vinh
Kilaru, Manoj
Wang, Andrew
Warno, Anna
Somasamudramath, Abhilash
Bhaskar, Sandip
Dong, Maka
Assaf, Nave
Mor, Shahar
Argov, Omer Ullman
Junkin, Scot
Romanenko, Oleksandr
Larroy, Pedro
Katariya, Monika
Rovinelli, Marco
Balas, Viji
Edelman, Nicholas
Bhiwandiwalla, Anahita
Subramaniam, Muthu
Ithape, Smita
Ramamoorthy, Karthik
Wu, Yuting
Velury, Suguna Varshini
Almog, Omri
Daw, Joyjit
Fridman, Denys
Galinkin, Erick
Evans, Michael
Ghosh, Shaona
Luna, Katherine
Derczynski, Leon
Pope, Nikki
Long, Eileen
Schneider, Seth
Siman, Guillermo
Grzegorzek, Tomasz
Ribalta, Pablo
Katariya, Monika
Alexiuk, Chris
Conway, Joey
Saar, Trisha
Guan, Ann
Pawelec, Krzysztof
Prayaga, Shyamala
Kuchaiev, Oleksii
Ginsburg, Boris
Olabiyi, Oluwatobi
Briski, Kari
Cohen, Jonathan
Catanzaro, Bryan
Alben, Jonah
Geifman, Yonatan
Chung, Eric
contents We introduce the Llama-Nemotron series of models, an open family of heterogeneous reasoning models that deliver exceptional reasoning capabilities, inference efficiency, and an open license for enterprise use. The family comes in three sizes -- Nano (8B), Super (49B), and Ultra (253B) -- and performs competitively with state-of-the-art reasoning models such as DeepSeek-R1 while offering superior inference throughput and memory efficiency. In this report, we discuss the training procedure for these models, which entails using neural architecture search from Llama 3 models for accelerated inference, knowledge distillation, and continued pretraining, followed by a reasoning-focused post-training stage consisting of two main parts: supervised fine-tuning and large scale reinforcement learning. Llama-Nemotron models are the first open-source models to support a dynamic reasoning toggle, allowing users to switch between standard chat and reasoning modes during inference. To further support open research and facilitate model development, we provide the following resources: 1. We release the Llama-Nemotron reasoning models -- LN-Nano, LN-Super, and LN-Ultra -- under the commercially permissive NVIDIA Open Model License Agreement. 2. We release the complete post-training dataset: Llama-Nemotron-Post-Training-Dataset. 3. We also release our training codebases: NeMo, NeMo-Aligner, and Megatron-LM.
format Preprint
id arxiv_https___arxiv_org_abs_2505_00949
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle Llama-Nemotron: Efficient Reasoning Models
Bercovich, Akhiad
Levy, Itay
Golan, Izik
Dabbah, Mohammad
El-Yaniv, Ran
Puny, Omri
Galil, Ido
Moshe, Zach
Ronen, Tomer
Nabwani, Najeeb
Shahaf, Ido
Tropp, Oren
Karpas, Ehud
Zilberstein, Ran
Zeng, Jiaqi
Singhal, Soumye
Bukharin, Alexander
Zhang, Yian
Konuk, Tugrul
Shen, Gerald
Mahabaleshwarkar, Ameya Sunil
Kartal, Bilal
Suhara, Yoshi
Delalleau, Olivier
Chen, Zijia
Wang, Zhilin
Mosallanezhad, David
Renduchintala, Adi
Qian, Haifeng
Rekesh, Dima
Jia, Fei
Majumdar, Somshubra
Noroozi, Vahid
Ahmad, Wasi Uddin
Narenthiran, Sean
Ficek, Aleksander
Samadi, Mehrzad
Huang, Jocelyn
Jain, Siddhartha
Gitman, Igor
Moshkov, Ivan
Du, Wei
Toshniwal, Shubham
Armstrong, George
Kisacanin, Branislav
Novikov, Matvei
Gitman, Daria
Bakhturina, Evelina
Varshney, Prasoon
Narsimhan, Makesh
Scowcroft, Jane Polak
Kamalu, John
Su, Dan
Kong, Kezhi
Kliegl, Markus
Mahabadi, Rabeeh Karimi
Lin, Ying
Satheesh, Sanjeev
Parmar, Jupinder
Gundecha, Pritam
Norick, Brandon
Jennings, Joseph
Prabhumoye, Shrimai
Akter, Syeda Nahida
Patwary, Mostofa
Khattar, Abhinav
Narayanan, Deepak
Waleffe, Roger
Zhang, Jimmy
Su, Bor-Yiing
Huang, Guyue
Kong, Terry
Chadha, Parth
Jain, Sahil
Harvey, Christine
Segal, Elad
Huang, Jining
Kashirsky, Sergey
McQueen, Robert
Putterman, Izzy
Lam, George
Venkatesan, Arun
Wu, Sherry
Nguyen, Vinh
Kilaru, Manoj
Wang, Andrew
Warno, Anna
Somasamudramath, Abhilash
Bhaskar, Sandip
Dong, Maka
Assaf, Nave
Mor, Shahar
Argov, Omer Ullman
Junkin, Scot
Romanenko, Oleksandr
Larroy, Pedro
Katariya, Monika
Rovinelli, Marco
Balas, Viji
Edelman, Nicholas
Bhiwandiwalla, Anahita
Subramaniam, Muthu
Ithape, Smita
Ramamoorthy, Karthik
Wu, Yuting
Velury, Suguna Varshini
Almog, Omri
Daw, Joyjit
Fridman, Denys
Galinkin, Erick
Evans, Michael
Ghosh, Shaona
Luna, Katherine
Derczynski, Leon
Pope, Nikki
Long, Eileen
Schneider, Seth
Siman, Guillermo
Grzegorzek, Tomasz
Ribalta, Pablo
Katariya, Monika
Alexiuk, Chris
Conway, Joey
Saar, Trisha
Guan, Ann
Pawelec, Krzysztof
Prayaga, Shyamala
Kuchaiev, Oleksii
Ginsburg, Boris
Olabiyi, Oluwatobi
Briski, Kari
Cohen, Jonathan
Catanzaro, Bryan
Alben, Jonah
Geifman, Yonatan
Chung, Eric
Computation and Language
Artificial Intelligence
Machine Learning
We introduce the Llama-Nemotron series of models, an open family of heterogeneous reasoning models that deliver exceptional reasoning capabilities, inference efficiency, and an open license for enterprise use. The family comes in three sizes -- Nano (8B), Super (49B), and Ultra (253B) -- and performs competitively with state-of-the-art reasoning models such as DeepSeek-R1 while offering superior inference throughput and memory efficiency. In this report, we discuss the training procedure for these models, which entails using neural architecture search from Llama 3 models for accelerated inference, knowledge distillation, and continued pretraining, followed by a reasoning-focused post-training stage consisting of two main parts: supervised fine-tuning and large scale reinforcement learning. Llama-Nemotron models are the first open-source models to support a dynamic reasoning toggle, allowing users to switch between standard chat and reasoning modes during inference. To further support open research and facilitate model development, we provide the following resources: 1. We release the Llama-Nemotron reasoning models -- LN-Nano, LN-Super, and LN-Ultra -- under the commercially permissive NVIDIA Open Model License Agreement. 2. We release the complete post-training dataset: Llama-Nemotron-Post-Training-Dataset. 3. We also release our training codebases: NeMo, NeMo-Aligner, and Megatron-LM.
title Llama-Nemotron: Efficient Reasoning Models
topic Computation and Language
Artificial Intelligence
Machine Learning
url https://arxiv.org/abs/2505.00949