TinyHelen's First Curriculum: Training and Evaluating Tiny Language Models in a Simpler Language Environment
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Ke, Kindratenko, Volodymyr, Zhai, ChengXiang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ORBIT: Cost-Effective Dataset Curation for Large Language Model Domain Adaptation with an Astronomy Case Study
por: Modesitt, Eric, et al.
Publicado: (2024)
por: Modesitt, Eric, et al.
Publicado: (2024)
Super Tiny Language Models
por: Hillier, Dylan, et al.
Publicado: (2024)
por: Hillier, Dylan, et al.
Publicado: (2024)
TinyLlama: An Open-Source Small Language Model
por: Zhang, Peiyuan, et al.
Publicado: (2024)
por: Zhang, Peiyuan, et al.
Publicado: (2024)
Chinese Tiny LLM: Pretraining a Chinese-Centric Large Language Model
por: Du, Xinrun, et al.
Publicado: (2024)
por: Du, Xinrun, et al.
Publicado: (2024)
Tiny Reward Models
por: Pan, Sarah
Publicado: (2025)
por: Pan, Sarah
Publicado: (2025)
Accelerating Training Speed of Tiny Recursive Models with Curriculum Guided Adaptive Recursion
por: Qasim, Kaleem Ullah, et al.
Publicado: (2025)
por: Qasim, Kaleem Ullah, et al.
Publicado: (2025)
An Investigation of Robustness of LLMs in Mathematical Reasoning: Benchmarking with Mathematically-Equivalent Transformation of Advanced Mathematical Problems
por: Hao, Yuren, et al.
Publicado: (2025)
por: Hao, Yuren, et al.
Publicado: (2025)
Regional Tiny Stories: Using Small Models to Compare Language Learning and Tokenizer Performance
por: Patil, Nirvan, et al.
Publicado: (2025)
por: Patil, Nirvan, et al.
Publicado: (2025)
Beyond Reactive Safety: Risk-Aware LLM Alignment via Long-Horizon Simulation
por: Sun, Chenkai, et al.
Publicado: (2025)
por: Sun, Chenkai, et al.
Publicado: (2025)
Sigma-MoE-Tiny Technical Report
por: Hu, Qingguo, et al.
Publicado: (2025)
por: Hu, Qingguo, et al.
Publicado: (2025)
Persona-DB: Efficient Large Language Model Personalization for Response Prediction with Collaborative Data Refinement
por: Sun, Chenkai, et al.
Publicado: (2024)
por: Sun, Chenkai, et al.
Publicado: (2024)
PanGu-$π$ Pro:Rethinking Optimization and Architecture for Tiny Language Models
por: Tang, Yehui, et al.
Publicado: (2024)
por: Tang, Yehui, et al.
Publicado: (2024)
Ten Principles of AI Agent Economics
por: Yang, Ke, et al.
Publicado: (2025)
por: Yang, Ke, et al.
Publicado: (2025)
Ayn: A Tiny yet Competitive Indian Legal Language Model Pretrained from Scratch
por: Niyogi, Mitodru, et al.
Publicado: (2024)
por: Niyogi, Mitodru, et al.
Publicado: (2024)
User Simulation for Evaluating Information Access Systems
por: Balog, Krisztian, et al.
Publicado: (2023)
por: Balog, Krisztian, et al.
Publicado: (2023)
Tiny Recursive Reasoning with Mamba-2 Attention Hybrid
por: Wang, Wenlong, et al.
Publicado: (2026)
por: Wang, Wenlong, et al.
Publicado: (2026)
Tina: Tiny Reasoning Models via LoRA
por: Wang, Shangshang, et al.
Publicado: (2025)
por: Wang, Shangshang, et al.
Publicado: (2025)
User Simulation in the Era of Generative AI: User Modeling, Synthetic Data Generation, and System Evaluation
por: Balog, Krisztian, et al.
Publicado: (2025)
por: Balog, Krisztian, et al.
Publicado: (2025)
Globally Optimal Training of Spiking Neural Networks via Parameter Reconstruction
por: Udupi, Himanshu, et al.
Publicado: (2026)
por: Udupi, Himanshu, et al.
Publicado: (2026)
Competence-Based Analysis of Language Models
por: Davies, Adam, et al.
Publicado: (2023)
por: Davies, Adam, et al.
Publicado: (2023)
QED-Nano: Teaching a Tiny Model to Prove Hard Theorems
por: LM-Provers, et al.
Publicado: (2026)
por: LM-Provers, et al.
Publicado: (2026)
Pre-Training Curriculum for Multi-Token Prediction in Language Models
por: Aynetdinov, Ansar, et al.
Publicado: (2025)
por: Aynetdinov, Ansar, et al.
Publicado: (2025)
Tiny Refinements Elicit Resilience: Toward Efficient Prefix-Model Against LLM Red-Teaming
por: Liu, Jiaxu, et al.
Publicado: (2024)
por: Liu, Jiaxu, et al.
Publicado: (2024)
TinyR1-32B-Preview: Boosting Accuracy with Branch-Merge Distillation
por: Sun, Lin, et al.
Publicado: (2025)
por: Sun, Lin, et al.
Publicado: (2025)
Bias and Volatility: A Statistical Framework for Evaluating Large Language Model's Stereotypes and the Associated Generation Inconsistency
por: Liu, Yiran, et al.
Publicado: (2024)
por: Liu, Yiran, et al.
Publicado: (2024)
Training Next Generation AI Users and Developers at NCSA
por: Katz, Daniel S., et al.
Publicado: (2024)
por: Katz, Daniel S., et al.
Publicado: (2024)
PlugMem: A Task-Agnostic Plugin Memory Module for LLM Agents
por: Yang, Ke, et al.
Publicado: (2026)
por: Yang, Ke, et al.
Publicado: (2026)
An Axiomatic Benchmark for Evaluation of Scientific Novelty Metrics
por: Liu, Miri, et al.
Publicado: (2026)
por: Liu, Miri, et al.
Publicado: (2026)
User Preference Modeling for Conversational LLM Agents: Weak Rewards from Retrieval-Augmented Interaction
por: Hao, Yuren, et al.
Publicado: (2026)
por: Hao, Yuren, et al.
Publicado: (2026)
A Post-Training Enhanced Optimization Approach for Small Language Models
por: Zhai, Keke
Publicado: (2024)
por: Zhai, Keke
Publicado: (2024)
Defining and Evaluating Decision and Composite Risk in Language Models Applied to Natural Language Inference
por: Shen, Ke, et al.
Publicado: (2024)
por: Shen, Ke, et al.
Publicado: (2024)
Tiny Model, Big Logic: Diversity-Driven Optimization Elicits Large-Model Reasoning Ability in VibeThinker-1.5B
por: Xu, Sen, et al.
Publicado: (2025)
por: Xu, Sen, et al.
Publicado: (2025)
LogTinyLLM: Tiny Large Language Models Based Contextual Log Anomaly Detection
por: Ocansey, Isaiah Thompson, et al.
Publicado: (2025)
por: Ocansey, Isaiah Thompson, et al.
Publicado: (2025)
RL-Pruner: Structured Pruning Using Reinforcement Learning for CNN Compression and Acceleration
por: Wang, Boyao, et al.
Publicado: (2024)
por: Wang, Boyao, et al.
Publicado: (2024)
TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning
por: Xu, Zhangchen, et al.
Publicado: (2025)
por: Xu, Zhangchen, et al.
Publicado: (2025)
HSKBenchmark: Modeling and Benchmarking Chinese Second Language Acquisition in Large Language Models through Curriculum Tuning
por: Yang, Qihao, et al.
Publicado: (2025)
por: Yang, Qihao, et al.
Publicado: (2025)
Small Language Models for Curriculum-based Guidance
por: Katharakis, Konstantinos, et al.
Publicado: (2025)
por: Katharakis, Konstantinos, et al.
Publicado: (2025)
Multilingual Training and Evaluation Resources for Vision-Language Models
por: Baiamonte, Daniela, et al.
Publicado: (2026)
por: Baiamonte, Daniela, et al.
Publicado: (2026)
Evaluating from Benign to Dynamic Adversarial: A Squid Game for Large Language Models
por: Chen, Zijian, et al.
Publicado: (2025)
por: Chen, Zijian, et al.
Publicado: (2025)
TreeEval: Benchmark-Free Evaluation of Large Language Models through Tree Planning
por: Li, Xiang, et al.
Publicado: (2024)
por: Li, Xiang, et al.
Publicado: (2024)
Ejemplares similares
-
ORBIT: Cost-Effective Dataset Curation for Large Language Model Domain Adaptation with an Astronomy Case Study
por: Modesitt, Eric, et al.
Publicado: (2024) -
Super Tiny Language Models
por: Hillier, Dylan, et al.
Publicado: (2024) -
TinyLlama: An Open-Source Small Language Model
por: Zhang, Peiyuan, et al.
Publicado: (2024) -
Chinese Tiny LLM: Pretraining a Chinese-Centric Large Language Model
por: Du, Xinrun, et al.
Publicado: (2024) -
Tiny Reward Models
por: Pan, Sarah
Publicado: (2025)