BABILong: Testing the Limits of LLMs with Long Context Reasoning-in-a-Haystack
Fuente:
arXiv
Salvato in:
| Autori principali: | Kuratov, Yuri, Bulatov, Aydar, Anokhin, Petr, Rodkin, Ivan, Sorokin, Dmitry, Sorokin, Artyom, Burtsev, Mikhail |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
In Search of Needles in a 11M Haystack: Recurrent Memory Finds What LLMs Miss
di: Kuratov, Yuri, et al.
Pubblicazione: (2024)
di: Kuratov, Yuri, et al.
Pubblicazione: (2024)
Associative Recurrent Memory Transformer
di: Rodkin, Ivan, et al.
Pubblicazione: (2024)
di: Rodkin, Ivan, et al.
Pubblicazione: (2024)
Wikontic: Constructing Wikidata-Aligned, Ontology-Aware Knowledge Graphs with Large Language Models
di: Chepurova, Alla, et al.
Pubblicazione: (2025)
di: Chepurova, Alla, et al.
Pubblicazione: (2025)
Scaling Transformer to 1M tokens and beyond with RMT
di: Bulatov, Aydar, et al.
Pubblicazione: (2023)
di: Bulatov, Aydar, et al.
Pubblicazione: (2023)
Cramming 1568 Tokens into a Single Vector and Back Again: Exploring the Limits of Embedding Space Capacity
di: Kuratov, Yuri, et al.
Pubblicazione: (2025)
di: Kuratov, Yuri, et al.
Pubblicazione: (2025)
AriGraph: Learning Knowledge Graph World Models with Episodic Memory for LLM Agents
di: Anokhin, Petr, et al.
Pubblicazione: (2024)
di: Anokhin, Petr, et al.
Pubblicazione: (2024)
Beyond Memorization: Extending Reasoning Depth with Recurrence, Memory and Test-Time Compute Scaling
di: Rodkin, Ivan, et al.
Pubblicazione: (2025)
di: Rodkin, Ivan, et al.
Pubblicazione: (2025)
Long Input Benchmark for Russian Analysis
di: Churin, Igor, et al.
Pubblicazione: (2024)
di: Churin, Igor, et al.
Pubblicazione: (2024)
HeroBench: A Benchmark for Long-Horizon Planning and Structured Reasoning in Virtual Worlds
di: Anokhin, Petr, et al.
Pubblicazione: (2025)
di: Anokhin, Petr, et al.
Pubblicazione: (2025)
Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts
di: Sivtsov, Danil, et al.
Pubblicazione: (2025)
di: Sivtsov, Danil, et al.
Pubblicazione: (2025)
SRMT: Shared Memory for Multi-agent Lifelong Pathfinding
di: Sagirova, Alsu, et al.
Pubblicazione: (2025)
di: Sagirova, Alsu, et al.
Pubblicazione: (2025)
Learning Elementary Cellular Automata with Transformers
di: Burtsev, Mikhail
Pubblicazione: (2024)
di: Burtsev, Mikhail
Pubblicazione: (2024)
Limitations of Normalization in Attention Mechanism
di: Mudarisov, Timur, et al.
Pubblicazione: (2025)
di: Mudarisov, Timur, et al.
Pubblicazione: (2025)
Q-RAG: Long Context Multi-step Retrieval via Value-based Embedder Training
di: Sorokin, Artyom, et al.
Pubblicazione: (2025)
di: Sorokin, Artyom, et al.
Pubblicazione: (2025)
Stress-Testing Long-Context Language Models with Lifelong ICL and Task Haystack
di: Xu, Xiaoyue, et al.
Pubblicazione: (2024)
di: Xu, Xiaoyue, et al.
Pubblicazione: (2024)
Haystack Engineering: Context Engineering for Heterogeneous and Agentic Long-Context Evaluation
di: Li, Mufei, et al.
Pubblicazione: (2025)
di: Li, Mufei, et al.
Pubblicazione: (2025)
AIMO-2 Winning Solution: Building State-of-the-Art Mathematical Reasoning Models with OpenMathReasoning dataset
di: Moshkov, Ivan, et al.
Pubblicazione: (2025)
di: Moshkov, Ivan, et al.
Pubblicazione: (2025)
Reasoning on Multiple Needles In A Haystack
di: Wang, Yidong
Pubblicazione: (2025)
di: Wang, Yidong
Pubblicazione: (2025)
Self-Guided Plan Extraction for Instruction-Following Tasks with Goal-Conditional Reinforcement Learning
di: Volovikova, Zoya, et al.
Pubblicazione: (2026)
di: Volovikova, Zoya, et al.
Pubblicazione: (2026)
Winning Amazon KDD Cup'24
di: Deotte, Chris, et al.
Pubblicazione: (2024)
di: Deotte, Chris, et al.
Pubblicazione: (2024)
CURIE: Evaluating LLMs On Multitask Scientific Long Context Understanding and Reasoning
di: Cui, Hao, et al.
Pubblicazione: (2025)
di: Cui, Hao, et al.
Pubblicazione: (2025)
DeepTest Tool Competition 2026: Benchmarking an LLM-Based Automotive Assistant
di: Sorokin, Lev, et al.
Pubblicazione: (2026)
di: Sorokin, Lev, et al.
Pubblicazione: (2026)
InftyThink: Breaking the Length Limits of Long-Context Reasoning in Large Language Models
di: Yan, Yuchen, et al.
Pubblicazione: (2025)
di: Yan, Yuchen, et al.
Pubblicazione: (2025)
Losing Visual Needles in Image Haystacks: Vision Language Models are Easily Distracted in Short and Long Contexts
di: Sharma, Aditya, et al.
Pubblicazione: (2024)
di: Sharma, Aditya, et al.
Pubblicazione: (2024)
Automated Factual Benchmarking for In-Car Conversational Systems using Large Language Models
di: Giebisch, Rafael, et al.
Pubblicazione: (2025)
di: Giebisch, Rafael, et al.
Pubblicazione: (2025)
Hidden in the Haystack: Smaller Needles are More Difficult for LLMs to Find
di: Bianchi, Owen, et al.
Pubblicazione: (2025)
di: Bianchi, Owen, et al.
Pubblicazione: (2025)
Testing the Limits of Truth Directions in LLMs
di: Poulis, Angelos, et al.
Pubblicazione: (2026)
di: Poulis, Angelos, et al.
Pubblicazione: (2026)
DENIAHL: In-Context Features Influence LLM Needle-In-A-Haystack Abilities
di: Dai, Hui, et al.
Pubblicazione: (2024)
di: Dai, Hui, et al.
Pubblicazione: (2024)
Are Long-LLMs A Necessity For Long-Context Tasks?
di: Qian, Hongjin, et al.
Pubblicazione: (2024)
di: Qian, Hongjin, et al.
Pubblicazione: (2024)
RuCCoD: Towards Automated ICD Coding in Russian
di: Nesterov, Aleksandr, et al.
Pubblicazione: (2025)
di: Nesterov, Aleksandr, et al.
Pubblicazione: (2025)
Multimodal Needle in a Haystack: Benchmarking Long-Context Capability of Multimodal Large Language Models
di: Wang, Hengyi, et al.
Pubblicazione: (2024)
di: Wang, Hengyi, et al.
Pubblicazione: (2024)
Document Haystack: A Long Context Multimodal Image/Document Understanding Vision LLM Benchmark
di: Huybrechts, Goeric, et al.
Pubblicazione: (2025)
di: Huybrechts, Goeric, et al.
Pubblicazione: (2025)
LiteLong: Resource-Efficient Long-Context Data Synthesis for LLMs
di: Jia, Junlong, et al.
Pubblicazione: (2025)
di: Jia, Junlong, et al.
Pubblicazione: (2025)
Systematic Evaluation of Long-Context LLMs on Financial Concepts
di: Gupta, Lavanya, et al.
Pubblicazione: (2024)
di: Gupta, Lavanya, et al.
Pubblicazione: (2024)
Jailbreaking in the Haystack
di: Shah, Rishi Rajesh, et al.
Pubblicazione: (2025)
di: Shah, Rishi Rajesh, et al.
Pubblicazione: (2025)
Oolong: Evaluating Long Context Reasoning and Aggregation Capabilities
di: Bertsch, Amanda, et al.
Pubblicazione: (2025)
di: Bertsch, Amanda, et al.
Pubblicazione: (2025)
QUITO: Accelerating Long-Context Reasoning through Query-Guided Context Compression
di: Wang, Wenshan, et al.
Pubblicazione: (2024)
di: Wang, Wenshan, et al.
Pubblicazione: (2024)
How to Evaluate Medical AI
di: Kopanichuk, Ilia, et al.
Pubblicazione: (2025)
di: Kopanichuk, Ilia, et al.
Pubblicazione: (2025)
DYCP: Dynamic Context Pruning for Long-Form Dialogue with LLMs
di: Choi, Nayoung, et al.
Pubblicazione: (2026)
di: Choi, Nayoung, et al.
Pubblicazione: (2026)
Shifting Long-Context LLMs Research from Input to Output
di: Wu, Yuhao, et al.
Pubblicazione: (2025)
di: Wu, Yuhao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
In Search of Needles in a 11M Haystack: Recurrent Memory Finds What LLMs Miss
di: Kuratov, Yuri, et al.
Pubblicazione: (2024) -
Associative Recurrent Memory Transformer
di: Rodkin, Ivan, et al.
Pubblicazione: (2024) -
Wikontic: Constructing Wikidata-Aligned, Ontology-Aware Knowledge Graphs with Large Language Models
di: Chepurova, Alla, et al.
Pubblicazione: (2025) -
Scaling Transformer to 1M tokens and beyond with RMT
di: Bulatov, Aydar, et al.
Pubblicazione: (2023) -
Cramming 1568 Tokens into a Single Vector and Back Again: Exploring the Limits of Embedding Space Capacity
di: Kuratov, Yuri, et al.
Pubblicazione: (2025)