Weiter zum Inhalt
Universidad del Mar SIBUMAR Descubridor Institucional UMAR
  • Inicio
  • Búsqueda avanzada
  • Explorar
  • Login
    • English
    • Deutsch
    • Español
    • Français
    • Italiano
Erweitert
  • A Survey of Reinforcement Learning for Large Reasoning Models
Buchumschlag

A Survey of Reinforcement Learning for Large Reasoning Models

Fuente: arXiv
Gespeichert in:
Bibliographische Detailangaben
Hauptverfasser: Zhang, Kaiyan, Zuo, Yuxin, He, Bingxiang, Sun, Youbang, Liu, Runze, Jiang, Che, Fan, Yuchen, Tian, Kai, Jia, Guoli, Li, Pengfei, Fu, Yu, Lv, Xingtai, Zhang, Yuchen, Zeng, Sihang, Qu, Shang, Li, Haozhan, Wang, Shijie, Wang, Yuru, Long, Xinwei, Liu, Fangfu, Xu, Xiang, Ma, Jiaze, Zhu, Xuekai, Hua, Ermo, Liu, Yihao, Li, Zonglin, Chen, Huayu, Qu, Xiaoye, Li, Yafu, Chen, Weize, Yuan, Zhenzhao, Gao, Junqi, Li, Dong, Ma, Zhiyuan, Cui, Ganqu, Liu, Zhiyuan, Qi, Biqing, Ding, Ning, Zhou, Bowen
Format: Preprint
Veröffentlicht: 2025
Schlagworte:
Computation and Language
Artificial Intelligence
Machine Learning
Online-Zugang:
Acceder al recurso
Tags: Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
  • Zitieren
  • SMS versenden
  • Als E-Mail versenden
  • Drucken
  • Datensatz exportieren
    • Exportieren nach RefWorks
    • Exportieren nach EndNoteWeb
    • Exportieren nach EndNote
  • Zu den Favoriten
  • Persistenter Link
  • Exemplare
  • Beschreibung
  • Kommentare
  • Ähnliche Einträge
  • Internformat
Beschreibung
Keine Beschreibung verfügbar.

Ähnliche Einträge

  • TTRL: Test-Time Reinforcement Learning
    von: Zuo, Yuxin, et al.
    Veröffentlicht: (2025)
  • UltraMedical: Building Specialized Generalists in Biomedicine
    von: Zhang, Kaiyan, et al.
    Veröffentlicht: (2024)
  • Fourier Position Embedding: Enhancing Attention's Periodic Extension for Length Generalization
    von: Hua, Ermo, et al.
    Veröffentlicht: (2024)
  • Technologies on Effectiveness and Efficiency: A Survey of State Spaces Models
    von: Lv, Xingtai, et al.
    Veröffentlicht: (2025)
  • How Far Can Unsupervised RLVR Scale LLM Training?
    von: He, Bingxiang, et al.
    Veröffentlicht: (2026)
Universidad del Mar
Universidad del MarSistema Bibliotecario de la Universidad del MarDescubridor Institucional UMARImplementación y desarrollo: Mtro. Carlos Alonso Albores Pérez
InicioBúsqueda avanzadaExplorar
Visitas al Descubridor: 42,474© 2026 Universidad del Mar