RecycleGPT: An Autoregressive Language Model with Recyclable Module
Fuente:
arXiv
Saved in:
| Main Authors: | Jiang, Yufan, He, Qiaozhi, Zhuang, Xiaomin, Wu, Zhihua, Wang, Kunpeng, Zhao, Wenlai, Yang, Guangwen |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Code Comparison Tuning for Code Large Language Models
by: Jiang, Yufan, et al.
Published: (2024)
by: Jiang, Yufan, et al.
Published: (2024)
ChuXin: 1.6B Technical Report
by: Zhuang, Xiaomin, et al.
Published: (2024)
by: Zhuang, Xiaomin, et al.
Published: (2024)
Exploring Scaling Laws for Local SGD in Large Language Model Training
by: He, Qiaozhi, et al.
Published: (2024)
by: He, Qiaozhi, et al.
Published: (2024)
GPT-SW3: An Autoregressive Language Model for the Nordic Languages
by: Ekgren, Ariel, et al.
Published: (2023)
by: Ekgren, Ariel, et al.
Published: (2023)
Semantic Aware Linear Transfer by Recycling Pre-trained Language Models for Cross-lingual Transfer
by: Lee, Seungyoon, et al.
Published: (2025)
by: Lee, Seungyoon, et al.
Published: (2025)
Recycling the Web: A Method to Enhance Pre-training Data Quality and Quantity for Language Models
by: Nguyen, Thao, et al.
Published: (2025)
by: Nguyen, Thao, et al.
Published: (2025)
Efficient LLM Inference with Kcache
by: He, Qiaozhi, et al.
Published: (2024)
by: He, Qiaozhi, et al.
Published: (2024)
EyeGPT: Ophthalmic Assistant with Large Language Models
by: Chen, Xiaolan, et al.
Published: (2024)
by: Chen, Xiaolan, et al.
Published: (2024)
Agent AI with LangGraph: A Modular Framework for Enhancing Machine Translation Using Large Language Models
by: Wang, Jialin, et al.
Published: (2024)
by: Wang, Jialin, et al.
Published: (2024)
Differences in Text Generated by Diffusion and Autoregressive Language Models
by: Zhang, Zeyang, et al.
Published: (2026)
by: Zhang, Zeyang, et al.
Published: (2026)
Selective Reflection-Tuning: Student-Selected Data Recycling for LLM Instruction-Tuning
by: Li, Ming, et al.
Published: (2024)
by: Li, Ming, et al.
Published: (2024)
Optimizing Transformer based on high-performance optimizer for predicting employment sentiment in American social media content
by: Wang, Feiyang, et al.
Published: (2024)
by: Wang, Feiyang, et al.
Published: (2024)
Position: Pause Recycling LoRAs and Prioritize Mechanisms to Uncover Limits and Effectiveness
by: Chen, Mei-Yen, et al.
Published: (2025)
by: Chen, Mei-Yen, et al.
Published: (2025)
Mitigating Shortcut Reasoning in Language Models: A Gradient-Aware Training Approach
by: Cao, Hongyu, et al.
Published: (2026)
by: Cao, Hongyu, et al.
Published: (2026)
If You Can't Use Them, Recycle Them: Optimizing Merging at Scale Mitigates Performance Tradeoffs
by: Khalifa, Muhammad, et al.
Published: (2024)
by: Khalifa, Muhammad, et al.
Published: (2024)
RuleR: Improving LLM Controllability by Rule-based Data Recycling
by: Li, Ming, et al.
Published: (2024)
by: Li, Ming, et al.
Published: (2024)
Recycling Failures: Salvaging Exploration in RLVR via Fine-Grained Off-Policy Guidance
by: Ren, Yanwei, et al.
Published: (2026)
by: Ren, Yanwei, et al.
Published: (2026)
DESTEIN: Navigating Detoxification of Language Models via Universal Steering Pairs and Head-wise Activation Fusion
by: Li, Yu, et al.
Published: (2024)
by: Li, Yu, et al.
Published: (2024)
Radiology-GPT: A Large Language Model for Radiology
by: Liu, Zhengliang, et al.
Published: (2023)
by: Liu, Zhengliang, et al.
Published: (2023)
Data Contamination Can Cross Language Barriers
by: Yao, Feng, et al.
Published: (2024)
by: Yao, Feng, et al.
Published: (2024)
A Survey on Model MoErging: Recycling and Routing Among Specialized Experts for Collaborative Learning
by: Yadav, Prateek, et al.
Published: (2024)
by: Yadav, Prateek, et al.
Published: (2024)
SDoH-GPT: Using Large Language Models to Extract Social Determinants of Health (SDoH)
by: Consoli, Bernardo, et al.
Published: (2024)
by: Consoli, Bernardo, et al.
Published: (2024)
Expert Threshold Routing for Autoregressive Language Modeling with Dynamic Computation Allocation and Load Balancing
by: Sun, Hanchi, et al.
Published: (2026)
by: Sun, Hanchi, et al.
Published: (2026)
GRAM: A Generative Foundation Reward Model for Reward Generalization
by: Wang, Chenglong, et al.
Published: (2025)
by: Wang, Chenglong, et al.
Published: (2025)
Continuous Autoregressive Language Models
by: Shao, Chenze, et al.
Published: (2025)
by: Shao, Chenze, et al.
Published: (2025)
LawGPT: A Chinese Legal Knowledge-Enhanced Large Language Model
by: Zhou, Zhi, et al.
Published: (2024)
by: Zhou, Zhi, et al.
Published: (2024)
Exploring the Reversal Curse and Other Deductive Logical Reasoning in BERT and GPT-Based Large Language Models
by: Wu, Da, et al.
Published: (2023)
by: Wu, Da, et al.
Published: (2023)
Autoregressive Models Rival Diffusion Models at ANY-ORDER Generation
by: Du, Tianqi, et al.
Published: (2026)
by: Du, Tianqi, et al.
Published: (2026)
Enhancing Multi-Agent Consensus through Third-Party LLM Integration: Analyzing Uncertainty and Mitigating Hallucinations in Large Language Models
by: Duan, Zhihua, et al.
Published: (2024)
by: Duan, Zhihua, et al.
Published: (2024)
ShizishanGPT: An Agricultural Large Language Model Integrating Tools and Resources
by: Yang, Shuting, et al.
Published: (2024)
by: Yang, Shuting, et al.
Published: (2024)
GraphGPT: Graph Instruction Tuning for Large Language Models
by: Tang, Jiabin, et al.
Published: (2023)
by: Tang, Jiabin, et al.
Published: (2023)
From Bytes to Ideas: Language Modeling with Autoregressive U-Nets
by: Videau, Mathurin, et al.
Published: (2025)
by: Videau, Mathurin, et al.
Published: (2025)
Survey of Specialized Large Language Model
by: Yang, Chenghan, et al.
Published: (2025)
by: Yang, Chenghan, et al.
Published: (2025)
GP-GPT: Large Language Model for Gene-Phenotype Mapping
by: Lyu, Yanjun, et al.
Published: (2024)
by: Lyu, Yanjun, et al.
Published: (2024)
Enhancing Robustness of Autoregressive Language Models against Orthographic Attacks via Pixel-based Approach
by: Yang, Han, et al.
Published: (2025)
by: Yang, Han, et al.
Published: (2025)
Improving Chain-of-Thought Efficiency for Autoregressive Image Generation
by: Gu, Zeqi, et al.
Published: (2025)
by: Gu, Zeqi, et al.
Published: (2025)
Analyzing Diffusion and Autoregressive Vision Language Models in Multimodal Embedding Space
by: Wang, Zihang, et al.
Published: (2026)
by: Wang, Zihang, et al.
Published: (2026)
NepaliGPT: A Generative Language Model for the Nepali Language
by: Pudasaini, Shushanta, et al.
Published: (2025)
by: Pudasaini, Shushanta, et al.
Published: (2025)
Efficient Post-Training Refinement of Latent Reasoning in Large Language Models
by: Wang, Xinyuan, et al.
Published: (2025)
by: Wang, Xinyuan, et al.
Published: (2025)
PharmaGPT: Domain-Specific Large Language Models for Bio-Pharmaceutical and Chemistry
by: Chen, Linqing, et al.
Published: (2024)
by: Chen, Linqing, et al.
Published: (2024)
Similar Items
-
Code Comparison Tuning for Code Large Language Models
by: Jiang, Yufan, et al.
Published: (2024) -
ChuXin: 1.6B Technical Report
by: Zhuang, Xiaomin, et al.
Published: (2024) -
Exploring Scaling Laws for Local SGD in Large Language Model Training
by: He, Qiaozhi, et al.
Published: (2024) -
GPT-SW3: An Autoregressive Language Model for the Nordic Languages
by: Ekgren, Ariel, et al.
Published: (2023) -
Semantic Aware Linear Transfer by Recycling Pre-trained Language Models for Cross-lingual Transfer
by: Lee, Seungyoon, et al.
Published: (2025)