Why Larger Models Learn More: Effects of Capacity, Interference, and Rare-Task Retention

Fuente: arXiv
Guardado en:
Detalles Bibliográficos
Autores principales: Huang, Jing, Wurgaft, Daniel, Bansal, Rachit, Ruis, Laura, Saphra, Naomi, Alvarez-Melis, David, Lampinen, Andrew Kyle, Potts, Christopher, Lubana, Ekdeep Singh
Formato: Preprint
Publicado: 2026
Materias:
Acceso en línea:
Etiquetas: Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!

Ejemplares similares