Adjoint sharding for very long context training of state space models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xu, Xingzi, Tavanaei, Amir, Asadi, Kavosh, Bouyarmane, Karim |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
C2-DPO: Constrained Controlled Direct Preference Optimization
par: Asadi, Kavosh, et autres
Publié: (2025)
par: Asadi, Kavosh, et autres
Publié: (2025)
Confidence-Aware Sub-Structure Beam Search (CABS): Mitigating Hallucination in Structured Data Generation with Large Language Models
par: Wei, Chengwei, et autres
Publié: (2024)
par: Wei, Chengwei, et autres
Publié: (2024)
InstructVTON: Optimal Auto-Masking and Natural-Language-Guided Interactive Style Control for Inpainting-Based Virtual Try-On
par: Han, Julien, et autres
Publié: (2025)
par: Han, Julien, et autres
Publié: (2025)
Learning to Reason Efficiently with Discounted Reinforcement Learning
par: Ayoub, Alex, et autres
Publié: (2025)
par: Ayoub, Alex, et autres
Publié: (2025)
Clinical ModernBERT: An efficient and long context encoder for biomedical text
par: Lee, Simon A., et autres
Publié: (2025)
par: Lee, Simon A., et autres
Publié: (2025)
Cartridges: Lightweight and general-purpose long context representations via self-study
par: Eyuboglu, Sabri, et autres
Publié: (2025)
par: Eyuboglu, Sabri, et autres
Publié: (2025)
Can large language models explore in-context?
par: Krishnamurthy, Akshay, et autres
Publié: (2024)
par: Krishnamurthy, Akshay, et autres
Publié: (2024)
Self-Improving Pretraining: using post-trained models to pretrain better models
par: Tan, Ellen Xiaoqing, et autres
Publié: (2026)
par: Tan, Ellen Xiaoqing, et autres
Publié: (2026)
Implicit In-context Learning
par: Li, Zhuowei, et autres
Publié: (2024)
par: Li, Zhuowei, et autres
Publié: (2024)
Learning the Target Network in Function Space
par: Asadi, Kavosh, et autres
Publié: (2024)
par: Asadi, Kavosh, et autres
Publié: (2024)
On the generalization of language models from in-context learning and finetuning: a controlled study
par: Lampinen, Andrew K., et autres
Publié: (2025)
par: Lampinen, Andrew K., et autres
Publié: (2025)
Why Larger Language Models Do In-context Learning Differently?
par: Shi, Zhenmei, et autres
Publié: (2024)
par: Shi, Zhenmei, et autres
Publié: (2024)
Negation Neglect: When models fail to learn negations in training
par: Mayne, Harry, et autres
Publié: (2026)
par: Mayne, Harry, et autres
Publié: (2026)
When Rubrics Fail: Error Enumeration as Reward in Reference-Free RL Post-Training for Virtual Try-On
par: Ikezogwo, Wisdom, et autres
Publié: (2026)
par: Ikezogwo, Wisdom, et autres
Publié: (2026)
Post-training makes large language models less human-like
par: Binz, Marcel, et autres
Publié: (2026)
par: Binz, Marcel, et autres
Publié: (2026)
DETAIL: Task DEmonsTration Attribution for Interpretable In-context Learning
par: Zhou, Zijian, et autres
Publié: (2024)
par: Zhou, Zijian, et autres
Publié: (2024)
In-context Time Series Predictor
par: Lu, Jiecheng, et autres
Publié: (2024)
par: Lu, Jiecheng, et autres
Publié: (2024)
Salient Information Prompting to Steer Content in Prompt-based Abstractive Summarization
par: Xu, Lei, et autres
Publié: (2024)
par: Xu, Lei, et autres
Publié: (2024)
Mechanistic Fine-tuning for In-context Learning
par: Cho, Hakaze, et autres
Publié: (2025)
par: Cho, Hakaze, et autres
Publié: (2025)
A Study on the Calibration of In-context Learning
par: Zhang, Hanlin, et autres
Publié: (2023)
par: Zhang, Hanlin, et autres
Publié: (2023)
Pre-trained Language Models Improve the Few-shot Prompt Ability of Decision Transformer
par: Yang, Yu, et autres
Publié: (2024)
par: Yang, Yu, et autres
Publié: (2024)
HelpSteer2: Open-source dataset for training top-performing reward models
par: Wang, Zhilin, et autres
Publié: (2024)
par: Wang, Zhilin, et autres
Publié: (2024)
Efficient data selection employing Semantic Similarity-based Graph Structures for model training
par: Petcu, Roxana, et autres
Publié: (2024)
par: Petcu, Roxana, et autres
Publié: (2024)
On the Relation between Sensitivity and Accuracy in In-context Learning
par: Chen, Yanda, et autres
Publié: (2022)
par: Chen, Yanda, et autres
Publié: (2022)
Automatic Pair Construction for Contrastive Post-training
par: Xu, Canwen, et autres
Publié: (2023)
par: Xu, Canwen, et autres
Publié: (2023)
Understanding In-context Learning of Addition via Activation Subspaces
par: Hu, Xinyan, et autres
Publié: (2025)
par: Hu, Xinyan, et autres
Publié: (2025)
Mechanism of Task-oriented Information Removal in In-context Learning
par: Cho, Hakaze, et autres
Publié: (2025)
par: Cho, Hakaze, et autres
Publié: (2025)
Scaling sparse feature circuit finding for in-context learning
par: Kharlapenko, Dmitrii, et autres
Publié: (2025)
par: Kharlapenko, Dmitrii, et autres
Publié: (2025)
In-context Pretraining: Language Modeling Beyond Document Boundaries
par: Shi, Weijia, et autres
Publié: (2023)
par: Shi, Weijia, et autres
Publié: (2023)
A Decomposition Perspective to Long-context Reasoning for LLMs
par: Xiao, Yanling, et autres
Publié: (2026)
par: Xiao, Yanling, et autres
Publié: (2026)
Token-based Decision Criteria Are Suboptimal in In-context Learning
par: Cho, Hakaze, et autres
Publié: (2024)
par: Cho, Hakaze, et autres
Publié: (2024)
Enhancing In-context Learning via Linear Probe Calibration
par: Abbas, Momin, et autres
Publié: (2024)
par: Abbas, Momin, et autres
Publié: (2024)
In-context Continual Learning Assisted by an External Continual Learner
par: Momeni, Saleh, et autres
Publié: (2024)
par: Momeni, Saleh, et autres
Publié: (2024)
StateX: Enhancing RNN Recall via Post-training State Expansion
par: Shen, Xingyu, et autres
Publié: (2025)
par: Shen, Xingyu, et autres
Publié: (2025)
Enhancing Frame Detection with Retrieval Augmented Generation
par: Diallo, Papa Abdou Karim Karou, et autres
Publié: (2025)
par: Diallo, Papa Abdou Karim Karou, et autres
Publié: (2025)
Retrieval Enhanced Feedback via In-context Neural Error-book
par: Hyun, Jongyeop, et autres
Publié: (2025)
par: Hyun, Jongyeop, et autres
Publié: (2025)
Probing the Decision Boundaries of In-context Learning in Large Language Models
par: Zhao, Siyan, et autres
Publié: (2024)
par: Zhao, Siyan, et autres
Publié: (2024)
Revisiting In-context Learning Inference Circuit in Large Language Models
par: Cho, Hakaze, et autres
Publié: (2024)
par: Cho, Hakaze, et autres
Publié: (2024)
In-context Autoencoder for Context Compression in a Large Language Model
par: Ge, Tao, et autres
Publié: (2023)
par: Ge, Tao, et autres
Publié: (2023)
player2vec: A Language Modeling Approach to Understand Player Behavior in Games
par: Wang, Tianze, et autres
Publié: (2024)
par: Wang, Tianze, et autres
Publié: (2024)
Documents similaires
-
C2-DPO: Constrained Controlled Direct Preference Optimization
par: Asadi, Kavosh, et autres
Publié: (2025) -
Confidence-Aware Sub-Structure Beam Search (CABS): Mitigating Hallucination in Structured Data Generation with Large Language Models
par: Wei, Chengwei, et autres
Publié: (2024) -
InstructVTON: Optimal Auto-Masking and Natural-Language-Guided Interactive Style Control for Inpainting-Based Virtual Try-On
par: Han, Julien, et autres
Publié: (2025) -
Learning to Reason Efficiently with Discounted Reinforcement Learning
par: Ayoub, Alex, et autres
Publié: (2025) -
Clinical ModernBERT: An efficient and long context encoder for biomedical text
par: Lee, Simon A., et autres
Publié: (2025)