Stress-Testing Long-Context Language Models with Lifelong ICL and Task Haystack
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Xu, Xiaoyue, Ye, Qinyuan, Ren, Xiang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Function Induction and Task Generalization: An Interpretability Study with Off-by-One Addition
von: Ye, Qinyuan, et al.
Veröffentlicht: (2025)
von: Ye, Qinyuan, et al.
Veröffentlicht: (2025)
GPTQT: Quantize Large Language Models Twice to Push the Efficiency
von: Guo, Yipin, et al.
Veröffentlicht: (2024)
von: Guo, Yipin, et al.
Veröffentlicht: (2024)
Multimodal Needle in a Haystack: Benchmarking Long-Context Capability of Multimodal Large Language Models
von: Wang, Hengyi, et al.
Veröffentlicht: (2024)
von: Wang, Hengyi, et al.
Veröffentlicht: (2024)
Auto-ICL: In-Context Learning without Human Supervision
von: Yang, Jinghan, et al.
Veröffentlicht: (2023)
von: Yang, Jinghan, et al.
Veröffentlicht: (2023)
Needle in the Haystack for Memory Based Large Language Models
von: Nelson, Elliot, et al.
Veröffentlicht: (2024)
von: Nelson, Elliot, et al.
Veröffentlicht: (2024)
RetICL: Sequential Retrieval of In-Context Examples with Reinforcement Learning
von: Scarlatos, Alexander, et al.
Veröffentlicht: (2023)
von: Scarlatos, Alexander, et al.
Veröffentlicht: (2023)
DENIAHL: In-Context Features Influence LLM Needle-In-A-Haystack Abilities
von: Dai, Hui, et al.
Veröffentlicht: (2024)
von: Dai, Hui, et al.
Veröffentlicht: (2024)
Revisiting In-Context Learning with Long Context Language Models
von: Baek, Jinheon, et al.
Veröffentlicht: (2024)
von: Baek, Jinheon, et al.
Veröffentlicht: (2024)
Document Haystack: A Long Context Multimodal Image/Document Understanding Vision LLM Benchmark
von: Huybrechts, Goeric, et al.
Veröffentlicht: (2025)
von: Huybrechts, Goeric, et al.
Veröffentlicht: (2025)
Revisiting the Test-Time Scaling of o1-like Models: Do they Truly Possess Test-Time Scaling Capabilities?
von: Zeng, Zhiyuan, et al.
Veröffentlicht: (2025)
von: Zeng, Zhiyuan, et al.
Veröffentlicht: (2025)
CoT-ICL Lab: A Synthetic Framework for Studying Chain-of-Thought Learning from In-Context Demonstrations
von: Kothapalli, Vignesh, et al.
Veröffentlicht: (2025)
von: Kothapalli, Vignesh, et al.
Veröffentlicht: (2025)
Jailbreaking in the Haystack
von: Shah, Rishi Rajesh, et al.
Veröffentlicht: (2025)
von: Shah, Rishi Rajesh, et al.
Veröffentlicht: (2025)
Stress Testing Factual Consistency Metrics for Long-Document Summarization
von: Mujahid, Zain Muhammad, et al.
Veröffentlicht: (2025)
von: Mujahid, Zain Muhammad, et al.
Veröffentlicht: (2025)
Artificial Hippocampus Networks for Efficient Long-Context Modeling
von: Fang, Yunhao, et al.
Veröffentlicht: (2025)
von: Fang, Yunhao, et al.
Veröffentlicht: (2025)
BABILong: Testing the Limits of LLMs with Long Context Reasoning-in-a-Haystack
von: Kuratov, Yuri, et al.
Veröffentlicht: (2024)
von: Kuratov, Yuri, et al.
Veröffentlicht: (2024)
Hidden in the Haystack: Smaller Needles are More Difficult for LLMs to Find
von: Bianchi, Owen, et al.
Veröffentlicht: (2025)
von: Bianchi, Owen, et al.
Veröffentlicht: (2025)
LongLoRA: Efficient Fine-tuning of Long-Context Large Language Models
von: Chen, Yukang, et al.
Veröffentlicht: (2023)
von: Chen, Yukang, et al.
Veröffentlicht: (2023)
Lifelong Safety Alignment for Language Models
von: Wang, Haoyu, et al.
Veröffentlicht: (2025)
von: Wang, Haoyu, et al.
Veröffentlicht: (2025)
Prompt Engineering a Prompt Engineer
von: Ye, Qinyuan, et al.
Veröffentlicht: (2023)
von: Ye, Qinyuan, et al.
Veröffentlicht: (2023)
From 128K to 4M: Efficient Training of Ultra-Long Context Large Language Models
von: Xu, Chejian, et al.
Veröffentlicht: (2025)
von: Xu, Chejian, et al.
Veröffentlicht: (2025)
UltraEdit: Training-, Subject-, and Memory-Free Lifelong Editing in Language Models
von: Gu, Xiaojie, et al.
Veröffentlicht: (2025)
von: Gu, Xiaojie, et al.
Veröffentlicht: (2025)
IA2: Alignment with ICL Activations Improves Supervised Fine-Tuning
von: Mishra, Aayush, et al.
Veröffentlicht: (2025)
von: Mishra, Aayush, et al.
Veröffentlicht: (2025)
From Haystack to Needle: Label Space Reduction for Zero-shot Classification
von: Vandemoortele, Nathan, et al.
Veröffentlicht: (2025)
von: Vandemoortele, Nathan, et al.
Veröffentlicht: (2025)
MMLU-SR: A Benchmark for Stress-Testing Reasoning Capability of Large Language Models
von: Wang, Wentian, et al.
Veröffentlicht: (2024)
von: Wang, Wentian, et al.
Veröffentlicht: (2024)
MiniCPM-SALA: Hybridizing Sparse and Linear Attention for Efficient Long-Context Modeling
von: MiniCPM Team, et al.
Veröffentlicht: (2026)
von: MiniCPM Team, et al.
Veröffentlicht: (2026)
ELITR-Bench: A Meeting Assistant Benchmark for Long-Context Language Models
von: Thonet, Thibaut, et al.
Veröffentlicht: (2024)
von: Thonet, Thibaut, et al.
Veröffentlicht: (2024)
Retrieval meets Long Context Large Language Models
von: Xu, Peng, et al.
Veröffentlicht: (2023)
von: Xu, Peng, et al.
Veröffentlicht: (2023)
Latent Context Compilation: Distilling Long Context into Compact Portable Memory
von: Li, Zeju, et al.
Veröffentlicht: (2026)
von: Li, Zeju, et al.
Veröffentlicht: (2026)
The Impossibility Triangle of Long-Context Modeling
von: Zhou, Yan
Veröffentlicht: (2026)
von: Zhou, Yan
Veröffentlicht: (2026)
LifeAlign: Lifelong Alignment for Large Language Models with Memory-Augmented Focalized Preference Optimization
von: Li, Junsong, et al.
Veröffentlicht: (2025)
von: Li, Junsong, et al.
Veröffentlicht: (2025)
Cost-Optimal Grouped-Query Attention for Long-Context Modeling
von: Chen, Yingfa, et al.
Veröffentlicht: (2025)
von: Chen, Yingfa, et al.
Veröffentlicht: (2025)
MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models
von: Zhang, Junyang, et al.
Veröffentlicht: (2025)
von: Zhang, Junyang, et al.
Veröffentlicht: (2025)
Test-Time Scaling in Reasoning Models Is Not Effective for Knowledge-Intensive Tasks Yet
von: Zhao, James Xu, et al.
Veröffentlicht: (2025)
von: Zhao, James Xu, et al.
Veröffentlicht: (2025)
LaCache: Ladder-Shaped KV Caching for Efficient Long-Context Modeling of Large Language Models
von: Shi, Dachuan, et al.
Veröffentlicht: (2025)
von: Shi, Dachuan, et al.
Veröffentlicht: (2025)
Goal-Directed Search Outperforms Goal-Agnostic Memory Compression in Long-Context Memory Tasks
von: Zheng, Yicong, et al.
Veröffentlicht: (2025)
von: Zheng, Yicong, et al.
Veröffentlicht: (2025)
HiCI: Hierarchical Construction-Integration for Long-Context Attention
von: Zeng, Xiangyu, et al.
Veröffentlicht: (2026)
von: Zeng, Xiangyu, et al.
Veröffentlicht: (2026)
In Search of Needles in a 11M Haystack: Recurrent Memory Finds What LLMs Miss
von: Kuratov, Yuri, et al.
Veröffentlicht: (2024)
von: Kuratov, Yuri, et al.
Veröffentlicht: (2024)
From Artificial Needles to Real Haystacks: Improving Retrieval Capabilities in LLMs by Finetuning on Synthetic Data
von: Xiong, Zheyang, et al.
Veröffentlicht: (2024)
von: Xiong, Zheyang, et al.
Veröffentlicht: (2024)
ELDER: Enhancing Lifelong Model Editing with Mixture-of-LoRA
von: Li, Jiaang, et al.
Veröffentlicht: (2024)
von: Li, Jiaang, et al.
Veröffentlicht: (2024)
Large Visual-Language Models Are Also Good Classifiers: A Study of In-Context Multimodal Fake News Detection
von: Jiang, Ye, et al.
Veröffentlicht: (2024)
von: Jiang, Ye, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Function Induction and Task Generalization: An Interpretability Study with Off-by-One Addition
von: Ye, Qinyuan, et al.
Veröffentlicht: (2025) -
GPTQT: Quantize Large Language Models Twice to Push the Efficiency
von: Guo, Yipin, et al.
Veröffentlicht: (2024) -
Multimodal Needle in a Haystack: Benchmarking Long-Context Capability of Multimodal Large Language Models
von: Wang, Hengyi, et al.
Veröffentlicht: (2024) -
Auto-ICL: In-Context Learning without Human Supervision
von: Yang, Jinghan, et al.
Veröffentlicht: (2023) -
Needle in the Haystack for Memory Based Large Language Models
von: Nelson, Elliot, et al.
Veröffentlicht: (2024)