Towards Optimal Learning of Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Gu, Yuxian, Dong, Li, Hao, Yaru, Dong, Qingxiu, Huang, Minlie, Wei, Furu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Data Selection via Optimal Control for Language Models
di: Gu, Yuxian, et al.
Pubblicazione: (2024)
di: Gu, Yuxian, et al.
Pubblicazione: (2024)
MiniLLM: On-Policy Distillation of Large Language Models
di: Gu, Yuxian, et al.
Pubblicazione: (2023)
di: Gu, Yuxian, et al.
Pubblicazione: (2023)
The Era of Agentic Organization: Learning to Organize with Language Models
di: Chi, Zewen, et al.
Pubblicazione: (2025)
di: Chi, Zewen, et al.
Pubblicazione: (2025)
Multiplex Thinking: Reasoning via Token-wise Branch-and-Merge
di: Tang, Yao, et al.
Pubblicazione: (2026)
di: Tang, Yao, et al.
Pubblicazione: (2026)
Instruction Pre-Training: Language Models are Supervised Multitask Learners
di: Cheng, Daixuan, et al.
Pubblicazione: (2024)
di: Cheng, Daixuan, et al.
Pubblicazione: (2024)
Online Experiential Learning for Language Models
di: Ye, Tianzhu, et al.
Pubblicazione: (2026)
di: Ye, Tianzhu, et al.
Pubblicazione: (2026)
Self-Boosting Large Language Models with Synthetic Preference Data
di: Dong, Qingxiu, et al.
Pubblicazione: (2024)
di: Dong, Qingxiu, et al.
Pubblicazione: (2024)
Direct Preference Knowledge Distillation for Large Language Models
di: Li, Yixing, et al.
Pubblicazione: (2024)
di: Li, Yixing, et al.
Pubblicazione: (2024)
MiniPLM: Knowledge Distillation for Pre-Training Language Models
di: Gu, Yuxian, et al.
Pubblicazione: (2024)
di: Gu, Yuxian, et al.
Pubblicazione: (2024)
On-Policy RL with Optimal Reward Baseline
di: Hao, Yaru, et al.
Pubblicazione: (2025)
di: Hao, Yaru, et al.
Pubblicazione: (2025)
Reward Reasoning Model
di: Guo, Jiaxin, et al.
Pubblicazione: (2025)
di: Guo, Jiaxin, et al.
Pubblicazione: (2025)
Optimizing Prompts for Text-to-Image Generation
di: Hao, Yaru, et al.
Pubblicazione: (2022)
di: Hao, Yaru, et al.
Pubblicazione: (2022)
Reinforcement Pre-Training
di: Dong, Qingxiu, et al.
Pubblicazione: (2025)
di: Dong, Qingxiu, et al.
Pubblicazione: (2025)
Towards Stable and Effective Reinforcement Learning for Mixture-of-Experts
di: Zhang, Di, et al.
Pubblicazione: (2025)
di: Zhang, Di, et al.
Pubblicazione: (2025)
Synthetic Data (Almost) from Scratch: Generalized Instruction Tuning for Language Models
di: Li, Haoran, et al.
Pubblicazione: (2024)
di: Li, Haoran, et al.
Pubblicazione: (2024)
Think Only When You Need with Large Hybrid-Reasoning Models
di: Jiang, Lingjie, et al.
Pubblicazione: (2025)
di: Jiang, Lingjie, et al.
Pubblicazione: (2025)
On-Policy Context Distillation for Language Models
di: Ye, Tianzhu, et al.
Pubblicazione: (2026)
di: Ye, Tianzhu, et al.
Pubblicazione: (2026)
Scaling Laws of Synthetic Data for Language Models
di: Qin, Zeyu, et al.
Pubblicazione: (2025)
di: Qin, Zeyu, et al.
Pubblicazione: (2025)
Black-Box On-Policy Distillation of Large Language Models
di: Ye, Tianzhu, et al.
Pubblicazione: (2025)
di: Ye, Tianzhu, et al.
Pubblicazione: (2025)
Kosmos-G: Generating Images in Context with Multimodal Large Language Models
di: Pan, Xichen, et al.
Pubblicazione: (2023)
di: Pan, Xichen, et al.
Pubblicazione: (2023)
Computer Environments Elicit General Agentic Intelligence in LLMs
di: Cheng, Daixuan, et al.
Pubblicazione: (2026)
di: Cheng, Daixuan, et al.
Pubblicazione: (2026)
Multilingual Machine Translation with Large Language Models: Empirical Results and Analysis
di: Zhu, Wenhao, et al.
Pubblicazione: (2023)
di: Zhu, Wenhao, et al.
Pubblicazione: (2023)
Can Large Multimodal Models Uncover Deep Semantics Behind Images?
di: Yang, Yixin, et al.
Pubblicazione: (2024)
di: Yang, Yixin, et al.
Pubblicazione: (2024)
Adapting Large Language Models to Domains via Reading Comprehension
di: Cheng, Daixuan, et al.
Pubblicazione: (2023)
di: Cheng, Daixuan, et al.
Pubblicazione: (2023)
AutoDetect: Towards a Unified Framework for Automated Weakness Detection in Large Language Models
di: Cheng, Jiale, et al.
Pubblicazione: (2024)
di: Cheng, Jiale, et al.
Pubblicazione: (2024)
Language Models Hallucinate, but May Excel at Fact Verification
di: Guan, Jian, et al.
Pubblicazione: (2023)
di: Guan, Jian, et al.
Pubblicazione: (2023)
Large Language Models Are Not Robust Multiple Choice Selectors
di: Zheng, Chujie, et al.
Pubblicazione: (2023)
di: Zheng, Chujie, et al.
Pubblicazione: (2023)
Language Models as Inductive Reasoners
di: Yang, Zonglin, et al.
Pubblicazione: (2022)
di: Yang, Zonglin, et al.
Pubblicazione: (2022)
Learning to Retrieve In-Context Examples for Large Language Models
di: Wang, Liang, et al.
Pubblicazione: (2023)
di: Wang, Liang, et al.
Pubblicazione: (2023)
ASETF: A Novel Method for Jailbreak Attack on LLMs through Translate Suffix Embeddings
di: Wang, Hao, et al.
Pubblicazione: (2024)
di: Wang, Hao, et al.
Pubblicazione: (2024)
Language Model Decoding as Direct Metrics Optimization
di: Ji, Haozhe, et al.
Pubblicazione: (2023)
di: Ji, Haozhe, et al.
Pubblicazione: (2023)
Towards Thinking-Optimal Scaling of Test-Time Compute for LLM Reasoning
di: Yang, Wenkai, et al.
Pubblicazione: (2025)
di: Yang, Wenkai, et al.
Pubblicazione: (2025)
Mind's Eye of LLMs: Visualization-of-Thought Elicits Spatial Reasoning in Large Language Models
di: Wu, Wenshan, et al.
Pubblicazione: (2024)
di: Wu, Wenshan, et al.
Pubblicazione: (2024)
SocialSim: Towards Socialized Simulation of Emotional Support Conversation
di: Chen, Zhuang, et al.
Pubblicazione: (2025)
di: Chen, Zhuang, et al.
Pubblicazione: (2025)
Benefits and Pitfalls of Reinforcement Learning for Language Model Planning: A Theoretical Perspective
di: Wang, Siwei, et al.
Pubblicazione: (2025)
di: Wang, Siwei, et al.
Pubblicazione: (2025)
Towards Efficient Exact Optimization of Language Model Alignment
di: Ji, Haozhe, et al.
Pubblicazione: (2024)
di: Ji, Haozhe, et al.
Pubblicazione: (2024)
Black-Box Prompt Optimization: Aligning Large Language Models without Model Training
di: Cheng, Jiale, et al.
Pubblicazione: (2023)
di: Cheng, Jiale, et al.
Pubblicazione: (2023)
You Only Cache Once: Decoder-Decoder Architectures for Language Models
di: Sun, Yutao, et al.
Pubblicazione: (2024)
di: Sun, Yutao, et al.
Pubblicazione: (2024)
LogicGame: Benchmarking Rule-Based Reasoning Abilities of Large Language Models
di: Gui, Jiayi, et al.
Pubblicazione: (2024)
di: Gui, Jiayi, et al.
Pubblicazione: (2024)
Unlocking Efficiency in Large Language Model Inference: A Comprehensive Survey of Speculative Decoding
di: Xia, Heming, et al.
Pubblicazione: (2024)
di: Xia, Heming, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Data Selection via Optimal Control for Language Models
di: Gu, Yuxian, et al.
Pubblicazione: (2024) -
MiniLLM: On-Policy Distillation of Large Language Models
di: Gu, Yuxian, et al.
Pubblicazione: (2023) -
The Era of Agentic Organization: Learning to Organize with Language Models
di: Chi, Zewen, et al.
Pubblicazione: (2025) -
Multiplex Thinking: Reasoning via Token-wise Branch-and-Merge
di: Tang, Yao, et al.
Pubblicazione: (2026) -
Instruction Pre-Training: Language Models are Supervised Multitask Learners
di: Cheng, Daixuan, et al.
Pubblicazione: (2024)