Collapse of Self-trained Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Herel, David, Mikolov, Tomas |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Thinking Tokens for Language Modeling
von: Herel, David, et al.
Veröffentlicht: (2024)
von: Herel, David, et al.
Veröffentlicht: (2024)
Time Awareness in Large Language Models: Benchmarking Fact Recall Across Time
von: Herel, David, et al.
Veröffentlicht: (2024)
von: Herel, David, et al.
Veröffentlicht: (2024)
Large Language Models: A Survey
von: Minaee, Shervin, et al.
Veröffentlicht: (2024)
von: Minaee, Shervin, et al.
Veröffentlicht: (2024)
Self-training Language Models for Arithmetic Reasoning
von: Kadlčík, Marek, et al.
Veröffentlicht: (2024)
von: Kadlčík, Marek, et al.
Veröffentlicht: (2024)
Detecting Mode Collapse in Language Models via Narration
von: Hamilton, Sil
Veröffentlicht: (2024)
von: Hamilton, Sil
Veröffentlicht: (2024)
Aggregation Artifacts in Subjective Tasks Collapse Large Language Models' Posteriors
von: Chochlakis, Georgios, et al.
Veröffentlicht: (2024)
von: Chochlakis, Georgios, et al.
Veröffentlicht: (2024)
LaCo: Large Language Model Pruning via Layer Collapse
von: Yang, Yifei, et al.
Veröffentlicht: (2024)
von: Yang, Yifei, et al.
Veröffentlicht: (2024)
Cross-lingual Collapse: How Language-Centric Foundation Models Shape Reasoning in Large Language Models
von: Park, Cheonbok, et al.
Veröffentlicht: (2025)
von: Park, Cheonbok, et al.
Veröffentlicht: (2025)
Dual Debiasing: Remove Stereotypes and Keep Factual Gender for Fair Language Modeling and Translation
von: Limisiewicz, Tomasz, et al.
Veröffentlicht: (2025)
von: Limisiewicz, Tomasz, et al.
Veröffentlicht: (2025)
Understanding the Collapse of LLMs in Model Editing
von: Yang, Wanli, et al.
Veröffentlicht: (2024)
von: Yang, Wanli, et al.
Veröffentlicht: (2024)
Internal Safety Collapse in Frontier Large Language Models
von: Wu, Yutao, et al.
Veröffentlicht: (2026)
von: Wu, Yutao, et al.
Veröffentlicht: (2026)
Understanding Performance Collapse in Layer-Pruned Large Language Models via Decision Representation Transitions
von: Shi, Boyu, et al.
Veröffentlicht: (2026)
von: Shi, Boyu, et al.
Veröffentlicht: (2026)
Probing Language Models for Pre-training Data Detection
von: Liu, Zhenhua, et al.
Veröffentlicht: (2024)
von: Liu, Zhenhua, et al.
Veröffentlicht: (2024)
A Survey on Post-training of Large Language Models
von: Tie, Guiyao, et al.
Veröffentlicht: (2025)
von: Tie, Guiyao, et al.
Veröffentlicht: (2025)
Can Pre-trained Language Models Understand Chinese Humor?
von: Chen, Yuyan, et al.
Veröffentlicht: (2024)
von: Chen, Yuyan, et al.
Veröffentlicht: (2024)
Pre-trained Large Language Models for Financial Sentiment Analysis
von: Luo, Wei, et al.
Veröffentlicht: (2024)
von: Luo, Wei, et al.
Veröffentlicht: (2024)
Spike No More: Stabilizing the Pre-training of Large Language Models
von: Takase, Sho, et al.
Veröffentlicht: (2023)
von: Takase, Sho, et al.
Veröffentlicht: (2023)
Self-Rewarding Language Models
von: Yuan, Weizhe, et al.
Veröffentlicht: (2024)
von: Yuan, Weizhe, et al.
Veröffentlicht: (2024)
Self-Steering Language Models
von: Grand, Gabriel, et al.
Veröffentlicht: (2025)
von: Grand, Gabriel, et al.
Veröffentlicht: (2025)
Fluent Alignment with Disfluent Judges: Post-training for Lower-resource Languages
von: Samuel, David, et al.
Veröffentlicht: (2025)
von: Samuel, David, et al.
Veröffentlicht: (2025)
Rebuilding ROME : Resolving Model Collapse during Sequential Model Editing
von: Gupta, Akshat, et al.
Veröffentlicht: (2024)
von: Gupta, Akshat, et al.
Veröffentlicht: (2024)
From N-grams to Pre-trained Multilingual Models For Language Identification
von: Sindane, Thapelo, et al.
Veröffentlicht: (2024)
von: Sindane, Thapelo, et al.
Veröffentlicht: (2024)
RegMix: Data Mixture as Regression for Language Model Pre-training
von: Liu, Qian, et al.
Veröffentlicht: (2024)
von: Liu, Qian, et al.
Veröffentlicht: (2024)
Understanding Data Temporality Impact on Large Language Models Pre-training
von: Pilchen, Hippolyte, et al.
Veröffentlicht: (2026)
von: Pilchen, Hippolyte, et al.
Veröffentlicht: (2026)
Boosting Explainability through Selective Rationalization in Pre-trained Language Models
von: Yuan, Libing, et al.
Veröffentlicht: (2025)
von: Yuan, Libing, et al.
Veröffentlicht: (2025)
DataMan: Data Manager for Pre-training Large Language Models
von: Peng, Ru, et al.
Veröffentlicht: (2025)
von: Peng, Ru, et al.
Veröffentlicht: (2025)
Post-training Large Language Models for Diverse High-Quality Responses
von: Chen, Yilei, et al.
Veröffentlicht: (2025)
von: Chen, Yilei, et al.
Veröffentlicht: (2025)
Efficient Language Adaptive Pre-training: Extending State-of-the-Art Large Language Models for Polish
von: Ruciński, Szymon
Veröffentlicht: (2024)
von: Ruciński, Szymon
Veröffentlicht: (2024)
Escaping Collapse: The Strength of Weak Data for Large Language Model Training
von: Amin, Kareem, et al.
Veröffentlicht: (2025)
von: Amin, Kareem, et al.
Veröffentlicht: (2025)
Learning by Surprise: Surplexity for Mitigating Model Collapse in Generative AI
von: Gambetta, Daniele, et al.
Veröffentlicht: (2024)
von: Gambetta, Daniele, et al.
Veröffentlicht: (2024)
Self-Challenging Language Model Agents
von: Zhou, Yifei, et al.
Veröffentlicht: (2025)
von: Zhou, Yifei, et al.
Veröffentlicht: (2025)
Pre-training Distillation for Large Language Models: A Design Space Exploration
von: Peng, Hao, et al.
Veröffentlicht: (2024)
von: Peng, Hao, et al.
Veröffentlicht: (2024)
Efficient Data Learning for Open Information Extraction with Pre-trained Language Models
von: Fan, Zhiyuan, et al.
Veröffentlicht: (2023)
von: Fan, Zhiyuan, et al.
Veröffentlicht: (2023)
Adaptive Few-shot Prompting for Machine Translation with Pre-trained Language Models
von: Tang, Lei, et al.
Veröffentlicht: (2025)
von: Tang, Lei, et al.
Veröffentlicht: (2025)
Self-Specialization: Uncovering Latent Expertise within Large Language Models
von: Kang, Junmo, et al.
Veröffentlicht: (2023)
von: Kang, Junmo, et al.
Veröffentlicht: (2023)
Self-Discover: Large Language Models Self-Compose Reasoning Structures
von: Zhou, Pei, et al.
Veröffentlicht: (2024)
von: Zhou, Pei, et al.
Veröffentlicht: (2024)
Reward Collapse in Aligning Large Language Models
von: Song, Ziang, et al.
Veröffentlicht: (2023)
von: Song, Ziang, et al.
Veröffentlicht: (2023)
Small Language Model Can Self-correct
von: Han, Haixia, et al.
Veröffentlicht: (2024)
von: Han, Haixia, et al.
Veröffentlicht: (2024)
Language Models Represent Beliefs of Self and Others
von: Zhu, Wentao, et al.
Veröffentlicht: (2024)
von: Zhu, Wentao, et al.
Veröffentlicht: (2024)
Process-based Self-Rewarding Language Models
von: Zhang, Shimao, et al.
Veröffentlicht: (2025)
von: Zhang, Shimao, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Thinking Tokens for Language Modeling
von: Herel, David, et al.
Veröffentlicht: (2024) -
Time Awareness in Large Language Models: Benchmarking Fact Recall Across Time
von: Herel, David, et al.
Veröffentlicht: (2024) -
Large Language Models: A Survey
von: Minaee, Shervin, et al.
Veröffentlicht: (2024) -
Self-training Language Models for Arithmetic Reasoning
von: Kadlčík, Marek, et al.
Veröffentlicht: (2024) -
Detecting Mode Collapse in Language Models via Narration
von: Hamilton, Sil
Veröffentlicht: (2024)