Overflow Prevention Enhances Long-Context Recurrent LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ben-Kish, Assaf, Zimerman, Itamar, Mirza, M. Jehanzeb, Wolf, Lior, Glass, James, Karlinsky, Leonid, Giryes, Raja |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DeciMamba: Exploring the Length Extrapolation Potential of Mamba
par: Ben-Kish, Assaf, et autres
Publié: (2024)
par: Ben-Kish, Assaf, et autres
Publié: (2024)
Overclocking LLM Reasoning: Monitoring and Controlling Thinking Path Lengths in LLMs
par: Eisenstadt, Roy, et autres
Publié: (2025)
par: Eisenstadt, Roy, et autres
Publié: (2025)
Faithfulness Serum: Mitigating the Faithfulness Gap in Textual Explanations of LLM Decisions via Attribution Guidance
par: Alon, Bar, et autres
Publié: (2026)
par: Alon, Bar, et autres
Publié: (2026)
Meta-Prompting for Automating Zero-shot Visual Recognition with LLMs
par: Mirza, M. Jehanzeb, et autres
Publié: (2024)
par: Mirza, M. Jehanzeb, et autres
Publié: (2024)
Revisiting Glorot Initialization for Long-Range Linear Recurrences
par: Bar, Noga, et autres
Publié: (2025)
par: Bar, Noga, et autres
Publié: (2025)
Mitigating Open-Vocabulary Caption Hallucinations
par: Ben-Kish, Assaf, et autres
Publié: (2023)
par: Ben-Kish, Assaf, et autres
Publié: (2023)
Differential Mamba
par: Schneider, Nadav, et autres
Publié: (2025)
par: Schneider, Nadav, et autres
Publié: (2025)
Multimodal Task Vectors Enable Many-Shot Multimodal In-Context Learning
par: Huang, Brandon, et autres
Publié: (2024)
par: Huang, Brandon, et autres
Publié: (2024)
Explaining Modern Gated-Linear RNNs via a Unified Implicit Attention Formulation
par: Zimerman, Itamar, et autres
Publié: (2024)
par: Zimerman, Itamar, et autres
Publié: (2024)
The Hidden Attention of Mamba Models
par: Ali, Ameen, et autres
Publié: (2024)
par: Ali, Ameen, et autres
Publié: (2024)
Diverse Subset Selection via Norm-Based Sampling and Orthogonality
par: Bar, Noga, et autres
Publié: (2024)
par: Bar, Noga, et autres
Publié: (2024)
CARES: Context-Aware Resolution Selector for VLMs
par: Kimhi, Moshe, et autres
Publié: (2025)
par: Kimhi, Moshe, et autres
Publié: (2025)
Bridging the Visual Gap: Fine-Tuning Multimodal Models with Knowledge-Adapted Captions
par: Yanuka, Moran, et autres
Publié: (2024)
par: Yanuka, Moran, et autres
Publié: (2024)
Comparison Visual Instruction Tuning
par: Lin, Wei, et autres
Publié: (2024)
par: Lin, Wei, et autres
Publié: (2024)
Efficient Decoding Methods for Language Models on Encrypted Data
par: Avitan, Matan, et autres
Publié: (2025)
par: Avitan, Matan, et autres
Publié: (2025)
On the Relation Between Linear Diffusion and Power Iteration
par: Weitzner, Dana, et autres
Publié: (2024)
par: Weitzner, Dana, et autres
Publié: (2024)
Revisiting LRP: Positional Attribution as the Missing Ingredient for Transformer Explainability
par: Bakish, Yarden, et autres
Publié: (2025)
par: Bakish, Yarden, et autres
Publié: (2025)
CALM: Class-Conditional Sparse Attention Vectors for Large Audio-Language Models
par: Mehta, Videet, et autres
Publié: (2026)
par: Mehta, Videet, et autres
Publié: (2026)
3VL: Using Trees to Improve Vision-Language Models' Interpretability
par: Yellinek, Nir, et autres
Publié: (2023)
par: Yellinek, Nir, et autres
Publié: (2023)
Neural Brain Fields: A NeRF-Inspired Approach for Generating Nonexistent EEG Electrodes
par: Kedem, Shahar Ain, et autres
Publié: (2025)
par: Kedem, Shahar Ain, et autres
Publié: (2025)
KV Cache Steering for Controlling Frozen LLMs
par: Belitsky, Max, et autres
Publié: (2025)
par: Belitsky, Max, et autres
Publié: (2025)
Teaching VLMs to Localize Specific Objects from In-context Examples
par: Doveh, Sivan, et autres
Publié: (2024)
par: Doveh, Sivan, et autres
Publié: (2024)
LongSafety: Enhance Safety for Long-Context LLMs
par: Huang, Mianqiu, et autres
Publié: (2024)
par: Huang, Mianqiu, et autres
Publié: (2024)
State-Space Large Audio Language Models
par: Bhati, Saurabhchand, et autres
Publié: (2024)
par: Bhati, Saurabhchand, et autres
Publié: (2024)
TensorLens: End-to-End Transformer Analysis via High-Order Attention Tensors
par: Atad, Ido Andrew, et autres
Publié: (2026)
par: Atad, Ido Andrew, et autres
Publié: (2026)
Can Diffusion Models Disentangle? A Theoretical Perspective
par: Wang, Liming, et autres
Publié: (2025)
par: Wang, Liming, et autres
Publié: (2025)
CLIMP: Contrastive Language-Image Mamba Pretraining
par: Shabtay, Nimrod, et autres
Publié: (2026)
par: Shabtay, Nimrod, et autres
Publié: (2026)
Entropy-Preserving Reinforcement Learning
par: Petrenko, Aleksei, et autres
Publié: (2026)
par: Petrenko, Aleksei, et autres
Publié: (2026)
Dynamic Layer Tying for Parameter-Efficient Transformers
par: Hay, Tamir David, et autres
Publié: (2024)
par: Hay, Tamir David, et autres
Publié: (2024)
Factor Graph Optimization of Error-Correcting Codes for Belief Propagation Decoding
par: Choukroun, Yoni, et autres
Publié: (2024)
par: Choukroun, Yoni, et autres
Publié: (2024)
VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes
par: Gavrikov, Paul, et autres
Publié: (2025)
par: Gavrikov, Paul, et autres
Publié: (2025)
PISanitizer: Preventing Prompt Injection to Long-Context LLMs via Prompt Sanitization
par: Geng, Runpeng, et autres
Publié: (2025)
par: Geng, Runpeng, et autres
Publié: (2025)
Navigating the Labyrinth: Evaluating LLMs' Ability to Reason About Search Problems
par: Borazjanizadeh, Nasim, et autres
Publié: (2024)
par: Borazjanizadeh, Nasim, et autres
Publié: (2024)
$\textit{Trans-LoRA}$: towards data-free Transferable Parameter Efficient Finetuning
par: Wang, Runqian, et autres
Publié: (2024)
par: Wang, Runqian, et autres
Publié: (2024)
Hierarchical Context Merging: Better Long Context Understanding for Pre-trained LLMs
par: Song, Woomin, et autres
Publié: (2024)
par: Song, Woomin, et autres
Publié: (2024)
Towards Multimodal In-Context Learning for Vision & Language Models
par: Doveh, Sivan, et autres
Publié: (2024)
par: Doveh, Sivan, et autres
Publié: (2024)
Accelerating Error Correction Code Transformers
par: Levy, Matan, et autres
Publié: (2024)
par: Levy, Matan, et autres
Publié: (2024)
DifuzCam: Replacing Camera Lens with a Mask and a Diffusion Model
par: Yosef, Erez, et autres
Publié: (2024)
par: Yosef, Erez, et autres
Publié: (2024)
Implicit Bias of Policy Gradient in Linear Quadratic Control: Extrapolation to Unseen Initial States
par: Razin, Noam, et autres
Publié: (2024)
par: Razin, Noam, et autres
Publié: (2024)
Training Long-Context LLMs Efficiently via Chunk-wise Optimization
par: Li, Wenhao, et autres
Publié: (2025)
par: Li, Wenhao, et autres
Publié: (2025)
Documents similaires
-
DeciMamba: Exploring the Length Extrapolation Potential of Mamba
par: Ben-Kish, Assaf, et autres
Publié: (2024) -
Overclocking LLM Reasoning: Monitoring and Controlling Thinking Path Lengths in LLMs
par: Eisenstadt, Roy, et autres
Publié: (2025) -
Faithfulness Serum: Mitigating the Faithfulness Gap in Textual Explanations of LLM Decisions via Attribution Guidance
par: Alon, Bar, et autres
Publié: (2026) -
Meta-Prompting for Automating Zero-shot Visual Recognition with LLMs
par: Mirza, M. Jehanzeb, et autres
Publié: (2024) -
Revisiting Glorot Initialization for Long-Range Linear Recurrences
par: Bar, Noga, et autres
Publié: (2025)