Long Input Benchmark for Russian Analysis
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Churin, Igor, Apishev, Murat, Tikhonova, Maria, Shevelev, Denis, Bulatov, Aydar, Kuratov, Yuri, Averkiev, Sergej, Fenogenova, Alena |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
The Russian-focused embedders' exploration: ruMTEB benchmark and Russian embedding model design
par: Snegirev, Artem, et autres
Publié: (2024)
par: Snegirev, Artem, et autres
Publié: (2024)
Wikontic: Constructing Wikidata-Aligned, Ontology-Aware Knowledge Graphs with Large Language Models
par: Chepurova, Alla, et autres
Publié: (2025)
par: Chepurova, Alla, et autres
Publié: (2025)
Scaling Transformer to 1M tokens and beyond with RMT
par: Bulatov, Aydar, et autres
Publié: (2023)
par: Bulatov, Aydar, et autres
Publié: (2023)
DRAGOn: Designing RAG On Periodically Updated Corpus
par: Chernogorskii, Fedor, et autres
Publié: (2025)
par: Chernogorskii, Fedor, et autres
Publié: (2025)
Associative Recurrent Memory Transformer
par: Rodkin, Ivan, et autres
Publié: (2024)
par: Rodkin, Ivan, et autres
Publié: (2024)
BABILong: Testing the Limits of LLMs with Long Context Reasoning-in-a-Haystack
par: Kuratov, Yuri, et autres
Publié: (2024)
par: Kuratov, Yuri, et autres
Publié: (2024)
In Search of Needles in a 11M Haystack: Recurrent Memory Finds What LLMs Miss
par: Kuratov, Yuri, et autres
Publié: (2024)
par: Kuratov, Yuri, et autres
Publié: (2024)
MERA: A Comprehensive LLM Evaluation in Russian
par: Fenogenova, Alena, et autres
Publié: (2024)
par: Fenogenova, Alena, et autres
Publié: (2024)
Multimodal Evaluation of Russian-language Architectures
par: Chervyakov, Artem, et autres
Publié: (2025)
par: Chervyakov, Artem, et autres
Publié: (2025)
Cramming 1568 Tokens into a Single Vector and Back Again: Exploring the Limits of Embedding Space Capacity
par: Kuratov, Yuri, et autres
Publié: (2025)
par: Kuratov, Yuri, et autres
Publié: (2025)
Eye of Judgement: Dissecting the Evaluation of Russian-speaking LLMs with POLLUX
par: Martynov, Nikita, et autres
Publié: (2025)
par: Martynov, Nikita, et autres
Publié: (2025)
GigaChat Family: Efficient Russian Language Modeling Through Mixture of Experts Architecture
par: GigaChat team, et autres
Publié: (2025)
par: GigaChat team, et autres
Publié: (2025)
SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineering Tasks
par: Adamenko, Pavel, et autres
Publié: (2025)
par: Adamenko, Pavel, et autres
Publié: (2025)
RuBLiMP: Russian Benchmark of Linguistic Minimal Pairs
par: Taktasheva, Ekaterina, et autres
Publié: (2024)
par: Taktasheva, Ekaterina, et autres
Publié: (2024)
REPA: Russian Error Types Annotation for Evaluating Text Generation and Judgment Capabilities
par: Pugachev, Alexander, et autres
Publié: (2025)
par: Pugachev, Alexander, et autres
Publié: (2025)
A Family of Pretrained Transformer Language Models for Russian
par: Zmitrovich, Dmitry, et autres
Publié: (2023)
par: Zmitrovich, Dmitry, et autres
Publié: (2023)
RusCode: Russian Cultural Code Benchmark for Text-to-Image Generation
par: Vasilev, Viacheslav, et autres
Publié: (2025)
par: Vasilev, Viacheslav, et autres
Publié: (2025)
PARALLAX: Separating Genuine Hallucination Detection from Benchmark Construction Artifacts
par: Hussain, Khizar, et autres
Publié: (2026)
par: Hussain, Khizar, et autres
Publié: (2026)
LIFT: Improving Long Context Understanding Through Long Input Fine-Tuning
par: Mao, Yansheng, et autres
Publié: (2024)
par: Mao, Yansheng, et autres
Publié: (2024)
Vikhr: The Family of Open-Source Instruction-Tuned Large Language Models for Russian
par: Nikolich, Aleksandr, et autres
Publié: (2024)
par: Nikolich, Aleksandr, et autres
Publié: (2024)
Shifting Long-Context LLMs Research from Input to Output
par: Wu, Yuhao, et autres
Publié: (2025)
par: Wu, Yuhao, et autres
Publié: (2025)
OWL: Overcoming Window Length-Dependence in Speculative Decoding for Long-Context Inputs
par: Lee, Jaeseong, et autres
Publié: (2025)
par: Lee, Jaeseong, et autres
Publié: (2025)
Uncertainty Quantification in Large Language Models Through Convex Hull Analysis
par: Catak, Ferhat Ozgur, et autres
Publié: (2024)
par: Catak, Ferhat Ozgur, et autres
Publié: (2024)
LongGenBench: Long-context Generation Benchmark
par: Liu, Xiang, et autres
Publié: (2024)
par: Liu, Xiang, et autres
Publié: (2024)
Detecting value-expressive text posts in Russian social media
par: Milkova, Maria, et autres
Publié: (2023)
par: Milkova, Maria, et autres
Publié: (2023)
GeoBenchX: Benchmarking LLMs in Agent Solving Multistep Geospatial Tasks
par: Krechetova, Varvara, et autres
Publié: (2025)
par: Krechetova, Varvara, et autres
Publié: (2025)
Evaluating Retrieval-Augmented Generation vs. Long-Context Input for Clinical Reasoning over EHRs
par: Myers, Skatje, et autres
Publié: (2025)
par: Myers, Skatje, et autres
Publié: (2025)
Long-Context LLMs Meet RAG: Overcoming Challenges for Long Inputs in RAG
par: Jin, Bowen, et autres
Publié: (2024)
par: Jin, Bowen, et autres
Publié: (2024)
Safe Inputs but Unsafe Output: Benchmarking Cross-modality Safety Alignment of Large Vision-Language Model
par: Wang, Siyin, et autres
Publié: (2024)
par: Wang, Siyin, et autres
Publié: (2024)
Memorization or Interpolation ? Detecting LLM Memorization through Input Perturbation Analysis
par: Djiré, Albérick Euraste, et autres
Publié: (2025)
par: Djiré, Albérick Euraste, et autres
Publié: (2025)
MuLD: The Multitask Long Document Benchmark
par: Hudson, G Thomas, et autres
Publié: (2022)
par: Hudson, G Thomas, et autres
Publié: (2022)
LongReasonArena: A Long Reasoning Benchmark for Large Language Models
par: Ding, Jiayu, et autres
Publié: (2025)
par: Ding, Jiayu, et autres
Publié: (2025)
A Benchmark for Long-Form Medical Question Answering
par: Hosseini, Pedram, et autres
Publié: (2024)
par: Hosseini, Pedram, et autres
Publié: (2024)
LongBench Pro: A More Realistic and Comprehensive Bilingual Long-Context Evaluation Benchmark
par: Chen, Ziyang, et autres
Publié: (2026)
par: Chen, Ziyang, et autres
Publié: (2026)
LongWeave: A Long-Form Generation Benchmark Bridging Real-World Relevance and Verifiability
par: Xiao, Zikai, et autres
Publié: (2025)
par: Xiao, Zikai, et autres
Publié: (2025)
Beyond Memorization: Extending Reasoning Depth with Recurrence, Memory and Test-Time Compute Scaling
par: Rodkin, Ivan, et autres
Publié: (2025)
par: Rodkin, Ivan, et autres
Publié: (2025)
Characterizing Knowledge Manipulation in a Russian Wikipedia Fork
par: Trokhymovych, Mykola, et autres
Publié: (2025)
par: Trokhymovych, Mykola, et autres
Publié: (2025)
Connecting the Dots: Benchmarking Reflective Memory in Long-Horizon Dialogue
par: Lin, Jingjie, et autres
Publié: (2026)
par: Lin, Jingjie, et autres
Publié: (2026)
EnigmaEval: A Benchmark of Long Multimodal Reasoning Challenges
par: Wang, Clinton J., et autres
Publié: (2025)
par: Wang, Clinton J., et autres
Publié: (2025)
AnaloBench: Benchmarking the Identification of Abstract and Long-context Analogies
par: Ye, Xiao, et autres
Publié: (2024)
par: Ye, Xiao, et autres
Publié: (2024)
Documents similaires
-
The Russian-focused embedders' exploration: ruMTEB benchmark and Russian embedding model design
par: Snegirev, Artem, et autres
Publié: (2024) -
Wikontic: Constructing Wikidata-Aligned, Ontology-Aware Knowledge Graphs with Large Language Models
par: Chepurova, Alla, et autres
Publié: (2025) -
Scaling Transformer to 1M tokens and beyond with RMT
par: Bulatov, Aydar, et autres
Publié: (2023) -
DRAGOn: Designing RAG On Periodically Updated Corpus
par: Chernogorskii, Fedor, et autres
Publié: (2025) -
Associative Recurrent Memory Transformer
par: Rodkin, Ivan, et autres
Publié: (2024)