READ: Recurrent Adaptation of Large Transformers
Fuente:
arXiv
Salvato in:
| Autori principali: | Nguyen, John, Wang, Sid, Li, Ke, Wu, Carole-Jean |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Stable-LoRA: Stabilizing Feature Learning of Low-Rank Adaptation
di: Wu, Yize, et al.
Pubblicazione: (2026)
di: Wu, Yize, et al.
Pubblicazione: (2026)
Recurrent Action Transformer with Memory
di: Cherepanov, Egor, et al.
Pubblicazione: (2023)
di: Cherepanov, Egor, et al.
Pubblicazione: (2023)
Recurrent Diffusion for Large-Scale Parameter Generation
di: Wang, Kai, et al.
Pubblicazione: (2025)
di: Wang, Kai, et al.
Pubblicazione: (2025)
Interpreting Affine Recurrence Learning in GPT-style Transformers
di: Bhargav, Samarth, et al.
Pubblicazione: (2024)
di: Bhargav, Samarth, et al.
Pubblicazione: (2024)
Adaptation and Fine-tuning with TabPFN for Travelling Salesman Problem
di: Vu, Nguyen Gia Hien, et al.
Pubblicazione: (2025)
di: Vu, Nguyen Gia Hien, et al.
Pubblicazione: (2025)
TalkLoRA: Communication-Aware Mixture of Low-Rank Adaptation for Large Language Models
di: Mu, Lin, et al.
Pubblicazione: (2026)
di: Mu, Lin, et al.
Pubblicazione: (2026)
RingFormer: Rethinking Recurrent Transformer with Adaptive Level Signals
di: Heo, Jaemu, et al.
Pubblicazione: (2025)
di: Heo, Jaemu, et al.
Pubblicazione: (2025)
Renaissance of RNNs in Streaming Clinical Time Series: Compact Recurrence Remains Competitive with Transformers
di: Tong, Ran, et al.
Pubblicazione: (2025)
di: Tong, Ran, et al.
Pubblicazione: (2025)
Understanding Dynamic Compute Allocation in Recurrent Transformers
di: Moosa, Ibraheem Muhammad, et al.
Pubblicazione: (2026)
di: Moosa, Ibraheem Muhammad, et al.
Pubblicazione: (2026)
Attention Saturation and Gradient Suppression at Inflection Layers: Diagnosing and Mitigating Bottlenecks in Transformer Adaptation
di: Zixian, Wang
Pubblicazione: (2025)
di: Zixian, Wang
Pubblicazione: (2025)
Latent Chain-of-Thought? Decoding the Depth-Recurrent Transformer
di: Lu, Wenquan, et al.
Pubblicazione: (2025)
di: Lu, Wenquan, et al.
Pubblicazione: (2025)
CAPS: Unifying Attention, Recurrence, and Alignment in Transformer-based Time Series Forecasting
di: Pati, Viresh, et al.
Pubblicazione: (2026)
di: Pati, Viresh, et al.
Pubblicazione: (2026)
CoSA: Compressed Sensing-Based Adaptation of Large Language Models
di: Wei, Songtao, et al.
Pubblicazione: (2026)
di: Wei, Songtao, et al.
Pubblicazione: (2026)
Plug-and-Play Transformer Modules for Test-Time Adaptation
di: Chang, Xiangyu, et al.
Pubblicazione: (2024)
di: Chang, Xiangyu, et al.
Pubblicazione: (2024)
GPU Memory Requirement Prediction for Deep Learning Task Based on Bidirectional Gated Recurrent Unit Optimization Transformer
di: Wang, Chao, et al.
Pubblicazione: (2025)
di: Wang, Chao, et al.
Pubblicazione: (2025)
SeqBattNet: A Discrete-State Physics-Informed Neural Network with Aging Adaptation for Battery Modeling
di: Tran, Khoa, et al.
Pubblicazione: (2025)
di: Tran, Khoa, et al.
Pubblicazione: (2025)
How Transformers Learn In-Context Recall Tasks? Optimality, Training Dynamics and Generalization
di: Nguyen, Quan, et al.
Pubblicazione: (2025)
di: Nguyen, Quan, et al.
Pubblicazione: (2025)
Mixture-of-Subspaces in Low-Rank Adaptation
di: Wu, Taiqiang, et al.
Pubblicazione: (2024)
di: Wu, Taiqiang, et al.
Pubblicazione: (2024)
Decision Transformer vs. Decision Mamba: Analysing the Complexity of Sequential Decision Making in Atari Games
di: Yan, Ke
Pubblicazione: (2024)
di: Yan, Ke
Pubblicazione: (2024)
PETAH: Parameter Efficient Task Adaptation for Hybrid Transformers in a resource-limited Context
di: Augustin, Maximilian, et al.
Pubblicazione: (2024)
di: Augustin, Maximilian, et al.
Pubblicazione: (2024)
Train at Moving Edge: Online-Verified Prompt Selection for Efficient RL Training of Large Reasoning Model
di: Wu, Jiahao, et al.
Pubblicazione: (2026)
di: Wu, Jiahao, et al.
Pubblicazione: (2026)
CorDA: Context-Oriented Decomposition Adaptation of Large Language Models for Task-Aware Parameter-Efficient Fine-tuning
di: Yang, Yibo, et al.
Pubblicazione: (2024)
di: Yang, Yibo, et al.
Pubblicazione: (2024)
Neural Organ Transplantation (NOT): Checkpoint-Based Modular Adaptation for Transformer Models
di: Al-Zuraiqi, Ahmad
Pubblicazione: (2026)
di: Al-Zuraiqi, Ahmad
Pubblicazione: (2026)
Investigating Recurrent Transformers with Dynamic Halt
di: Chowdhury, Jishnu Ray, et al.
Pubblicazione: (2024)
di: Chowdhury, Jishnu Ray, et al.
Pubblicazione: (2024)
PiSSA: Principal Singular Values and Singular Vectors Adaptation of Large Language Models
di: Meng, Fanxu, et al.
Pubblicazione: (2024)
di: Meng, Fanxu, et al.
Pubblicazione: (2024)
Recurrent Stochastic Configuration Networks with Incremental Blocks
di: Dang, Gang, et al.
Pubblicazione: (2024)
di: Dang, Gang, et al.
Pubblicazione: (2024)
Gate Recurrent Unit for Efficient Industrial Gas Identification
di: Wang, Ding
Pubblicazione: (2024)
di: Wang, Ding
Pubblicazione: (2024)
LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training
di: Wu, Bo, et al.
Pubblicazione: (2025)
di: Wu, Bo, et al.
Pubblicazione: (2025)
Amortized Planning with Large-Scale Transformers: A Case Study on Chess
di: Ruoss, Anian, et al.
Pubblicazione: (2024)
di: Ruoss, Anian, et al.
Pubblicazione: (2024)
LoCA: Location-Aware Cosine Adaptation for Parameter-Efficient Fine-Tuning
di: Du, Zhekai, et al.
Pubblicazione: (2025)
di: Du, Zhekai, et al.
Pubblicazione: (2025)
Outlier-Efficient Hopfield Layers for Large Transformer-Based Models
di: Hu, Jerry Yao-Chieh, et al.
Pubblicazione: (2024)
di: Hu, Jerry Yao-Chieh, et al.
Pubblicazione: (2024)
Singular Value Decomposition on Kronecker Adaptation for Large Language Model
di: Chong, Yee Hin, et al.
Pubblicazione: (2025)
di: Chong, Yee Hin, et al.
Pubblicazione: (2025)
Large EEG-U-Transformer for Time-Step Level Detection Without Pre-Training
di: Wu, Kerui, et al.
Pubblicazione: (2025)
di: Wu, Kerui, et al.
Pubblicazione: (2025)
Bridging Source and Target Domains via Link Prediction for Unsupervised Domain Adaptation on Graphs
di: Wang, Yilong, et al.
Pubblicazione: (2025)
di: Wang, Yilong, et al.
Pubblicazione: (2025)
Thinking Deeper, Not Longer: Depth-Recurrent Transformers for Compositional Generalization
di: Chen, Hung-Hsuan
Pubblicazione: (2026)
di: Chen, Hung-Hsuan
Pubblicazione: (2026)
Loop, Think, & Generalize: Implicit Reasoning in Recurrent-Depth Transformers
di: Kohli, Harsh, et al.
Pubblicazione: (2026)
di: Kohli, Harsh, et al.
Pubblicazione: (2026)
Collaborate to Adapt: Source-Free Graph Domain Adaptation via Bi-directional Adaptation
di: Zhang, Zhen, et al.
Pubblicazione: (2024)
di: Zhang, Zhen, et al.
Pubblicazione: (2024)
A Large Recurrent Action Model: xLSTM enables Fast Inference for Robotics Tasks
di: Schmied, Thomas, et al.
Pubblicazione: (2024)
di: Schmied, Thomas, et al.
Pubblicazione: (2024)
From Small to Large: Generalization Bounds for Transformers on Variable-Size Inputs
di: Alokhina, Anastasiia, et al.
Pubblicazione: (2025)
di: Alokhina, Anastasiia, et al.
Pubblicazione: (2025)
CTR-LoRA: Curvature-Aware and Trust-Region Guided Low-Rank Adaptation for Large Language Models
di: Wang, Zhuxuanzi, et al.
Pubblicazione: (2025)
di: Wang, Zhuxuanzi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Stable-LoRA: Stabilizing Feature Learning of Low-Rank Adaptation
di: Wu, Yize, et al.
Pubblicazione: (2026) -
Recurrent Action Transformer with Memory
di: Cherepanov, Egor, et al.
Pubblicazione: (2023) -
Recurrent Diffusion for Large-Scale Parameter Generation
di: Wang, Kai, et al.
Pubblicazione: (2025) -
Interpreting Affine Recurrence Learning in GPT-style Transformers
di: Bhargav, Samarth, et al.
Pubblicazione: (2024) -
Adaptation and Fine-tuning with TabPFN for Travelling Salesman Problem
di: Vu, Nguyen Gia Hien, et al.
Pubblicazione: (2025)