SUS backprop: linear backpropagation algorithm for long inputs in transformers
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Pankov, Sergey, Harik, Georges |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Quiet-STaR: Language Models Can Teach Themselves to Think Before Speaking
par: Zelikman, Eric, et autres
Publié: (2024)
par: Zelikman, Eric, et autres
Publié: (2024)
CAMPHOR: Collaborative Agents for Multi-input Planning and High-Order Reasoning On Device
par: Fu, Yicheng, et autres
Publié: (2024)
par: Fu, Yicheng, et autres
Publié: (2024)
An explainable transformer circuit for compositional generalization
par: Tang, Cheng, et autres
Publié: (2025)
par: Tang, Cheng, et autres
Publié: (2025)
When can transformers reason with abstract symbols?
par: Boix-Adsera, Enric, et autres
Publié: (2023)
par: Boix-Adsera, Enric, et autres
Publié: (2023)
ReflectivePrompt: Reflective evolution in autoprompting algorithms
par: Zhuravlev, Viktor N., et autres
Publié: (2025)
par: Zhuravlev, Viktor N., et autres
Publié: (2025)
Non-linear Interventions on Large Language Models
par: Kim, Sangwoo
Publié: (2026)
par: Kim, Sangwoo
Publié: (2026)
Pretraining with hierarchical memories: separating long-tail and common knowledge
par: Pouransari, Hadi, et autres
Publié: (2025)
par: Pouransari, Hadi, et autres
Publié: (2025)
XLGoBench: Detecting cross-lingual skill gaps with algorithmic tasks
par: Jain, Purvam, et autres
Publié: (2026)
par: Jain, Purvam, et autres
Publié: (2026)
Clinical ModernBERT: An efficient and long context encoder for biomedical text
par: Lee, Simon A., et autres
Publié: (2025)
par: Lee, Simon A., et autres
Publié: (2025)
Adjoint sharding for very long context training of state space models
par: Xu, Xingzi, et autres
Publié: (2025)
par: Xu, Xingzi, et autres
Publié: (2025)
Tiny-Toxic-Detector: A compact transformer-based model for toxic content detection
par: Kamphuis, Michiel
Publié: (2024)
par: Kamphuis, Michiel
Publié: (2024)
Cartridges: Lightweight and general-purpose long context representations via self-study
par: Eyuboglu, Sabri, et autres
Publié: (2025)
par: Eyuboglu, Sabri, et autres
Publié: (2025)
ProdRev: A DNN framework for empowering customers using generative pre-trained transformers
par: Gupta, Aakash, et autres
Publié: (2025)
par: Gupta, Aakash, et autres
Publié: (2025)
Q-SFT: Q-Learning for Language Models via Supervised Fine-Tuning
par: Hong, Joey, et autres
Publié: (2024)
par: Hong, Joey, et autres
Publié: (2024)
Fresh in memory: Training-order recency is linearly encoded in language model activations
par: Krasheninnikov, Dmitrii, et autres
Publié: (2025)
par: Krasheninnikov, Dmitrii, et autres
Publié: (2025)
Reinforce-Ada: An Adaptive Sampling Framework under Non-linear RL Objectives
par: Xiong, Wei, et autres
Publié: (2025)
par: Xiong, Wei, et autres
Publié: (2025)
Zero-shot data citation function classification using transformer-based large language models (LLMs)
par: Byers, Neil, et autres
Publié: (2025)
par: Byers, Neil, et autres
Publié: (2025)
CaLMQA: Exploring culturally specific long-form question answering across 23 languages
par: Arora, Shane, et autres
Publié: (2024)
par: Arora, Shane, et autres
Publié: (2024)
Interactive Dialogue Agents via Reinforcement Learning on Hindsight Regenerations
par: Hong, Joey, et autres
Publié: (2024)
par: Hong, Joey, et autres
Publié: (2024)
RLAC: Reinforcement Learning with Adversarial Critic for Free-Form Generation Tasks
par: Wu, Mian, et autres
Publié: (2025)
par: Wu, Mian, et autres
Publié: (2025)
Unfamiliar Finetuning Examples Control How Language Models Hallucinate
par: Kang, Katie, et autres
Publié: (2024)
par: Kang, Katie, et autres
Publié: (2024)
ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL
par: Zhou, Yifei, et autres
Publié: (2024)
par: Zhou, Yifei, et autres
Publié: (2024)
Zero-Overhead Introspection for Adaptive Test-Time Compute
par: Manvi, Rohin, et autres
Publié: (2025)
par: Manvi, Rohin, et autres
Publié: (2025)
Evaluating & Reducing Deceptive Dialogue From Language Models with Multi-turn RL
par: Abdulhai, Marwa, et autres
Publié: (2025)
par: Abdulhai, Marwa, et autres
Publié: (2025)
Control the Temperature: Selective Sampling for Diverse and High-Quality LLM Outputs
par: Troshin, Sergey, et autres
Publié: (2025)
par: Troshin, Sergey, et autres
Publié: (2025)
Evaluating Very Long-Term Conversational Memory of LLM Agents
par: Maharana, Adyasha, et autres
Publié: (2024)
par: Maharana, Adyasha, et autres
Publié: (2024)
ReplaceMe: Network Simplification via Depth Pruning and Transformer Block Linearization
par: Shopkhoev, Dmitriy, et autres
Publié: (2025)
par: Shopkhoev, Dmitriy, et autres
Publié: (2025)
Quantifying artificial intelligence through algorithmic generalization
par: Ito, Takuya, et autres
Publié: (2024)
par: Ito, Takuya, et autres
Publié: (2024)
code_transformed: The Influence of Large Language Models on Code
par: Xu, Yuliang, et autres
Publié: (2025)
par: Xu, Yuliang, et autres
Publié: (2025)
Enhanced QKNorm normalization for neural transformers with the Lp norm
par: Lopez-Rubio, Ezequiel, et autres
Publié: (2026)
par: Lopez-Rubio, Ezequiel, et autres
Publié: (2026)
Physical models realizing the transformer architecture of large language models
par: Chen, Zeqian
Publié: (2025)
par: Chen, Zeqian
Publié: (2025)
Fact-Checking the Output of Large Language Models via Token-Level Uncertainty Quantification
par: Fadeeva, Ekaterina, et autres
Publié: (2024)
par: Fadeeva, Ekaterina, et autres
Publié: (2024)
RCT Rejection Sampling for Causal Estimation Evaluation
par: Keith, Katherine A., et autres
Publié: (2023)
par: Keith, Katherine A., et autres
Publié: (2023)
Language Guided Skill Discovery
par: Rho, Seungeun, et autres
Publié: (2024)
par: Rho, Seungeun, et autres
Publié: (2024)
Evaluating Named Entity Recognition: A comparative analysis of mono- and multilingual transformer models on a novel Brazilian corporate earnings call transcripts dataset
par: Abilio, Ramon, et autres
Publié: (2024)
par: Abilio, Ramon, et autres
Publié: (2024)
LLM as Attention-Informed NTM and Topic Modeling as long-input Generation: Interpretability and long-Context Capability
par: Xu, Xuan, et autres
Publié: (2025)
par: Xu, Xuan, et autres
Publié: (2025)
Doctorina MedBench: End-to-End Evaluation of Agent-Based Medical AI
par: Kozlova, Anna, et autres
Publié: (2026)
par: Kozlova, Anna, et autres
Publié: (2026)
Chain of Code: Reasoning with a Language Model-Augmented Code Emulator
par: Li, Chengshu, et autres
Publié: (2023)
par: Li, Chengshu, et autres
Publié: (2023)
Carrying over algorithm in transformers
par: Kruthoff, Jorrit
Publié: (2024)
par: Kruthoff, Jorrit
Publié: (2024)
Llama-Nemotron: Efficient Reasoning Models
par: Bercovich, Akhiad, et autres
Publié: (2025)
par: Bercovich, Akhiad, et autres
Publié: (2025)
Documents similaires
-
Quiet-STaR: Language Models Can Teach Themselves to Think Before Speaking
par: Zelikman, Eric, et autres
Publié: (2024) -
CAMPHOR: Collaborative Agents for Multi-input Planning and High-Order Reasoning On Device
par: Fu, Yicheng, et autres
Publié: (2024) -
An explainable transformer circuit for compositional generalization
par: Tang, Cheng, et autres
Publié: (2025) -
When can transformers reason with abstract symbols?
par: Boix-Adsera, Enric, et autres
Publié: (2023) -
ReflectivePrompt: Reflective evolution in autoprompting algorithms
par: Zhuravlev, Viktor N., et autres
Publié: (2025)