One ruler to measure them all: Benchmarking multilingual long-context language models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kim, Yekyung, Russell, Jenna, Karpinska, Marzena, Iyyer, Mohit |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
One Thousand and One Pairs: A "novel" challenge for long-context language models
par: Karpinska, Marzena, et autres
Publié: (2024)
par: Karpinska, Marzena, et autres
Publié: (2024)
People who frequently use ChatGPT for writing tasks are accurate and robust detectors of AI-generated text
par: Russell, Jenna, et autres
Publié: (2025)
par: Russell, Jenna, et autres
Publié: (2025)
Does quantization affect models' performance on long-context tasks?
par: Mekala, Anmol, et autres
Publié: (2025)
par: Mekala, Anmol, et autres
Publié: (2025)
VERISCORE: Evaluating the factuality of verifiable claims in long-form text generation
par: Song, Yixiao, et autres
Publié: (2024)
par: Song, Yixiao, et autres
Publié: (2024)
FABLES: Evaluating faithfulness and content selection in book-length summarization
par: Kim, Yekyung, et autres
Publié: (2024)
par: Kim, Yekyung, et autres
Publié: (2024)
AI use in American newspapers is widespread, uneven, and rarely disclosed
par: Russell, Jenna, et autres
Publié: (2025)
par: Russell, Jenna, et autres
Publié: (2025)
CaLMQA: Exploring culturally specific long-form question answering across 23 languages
par: Arora, Shane, et autres
Publié: (2024)
par: Arora, Shane, et autres
Publié: (2024)
Frankentext: Stitching random text fragments into long-form narratives
par: Pham, Chau Minh, et autres
Publié: (2025)
par: Pham, Chau Minh, et autres
Publié: (2025)
Argument Collapse: LLMs Flatten Long-Form Public Debate
par: Kim, Yekyung, et autres
Publié: (2026)
par: Kim, Yekyung, et autres
Publié: (2026)
CLIPPER: Compression enables long-context synthetic data generation
par: Pham, Chau Minh, et autres
Publié: (2025)
par: Pham, Chau Minh, et autres
Publié: (2025)
OWL: Probing Cross-Lingual Recall of Memorized Texts via World Literature
par: Srivastava, Alisha, et autres
Publié: (2025)
par: Srivastava, Alisha, et autres
Publié: (2025)
StoryScope: Investigating idiosyncrasies in AI fiction
par: Russell, Jenna, et autres
Publié: (2026)
par: Russell, Jenna, et autres
Publié: (2026)
BLEUBERI: BLEU is a surprisingly effective reward for instruction following
par: Chang, Yapei, et autres
Publié: (2025)
par: Chang, Yapei, et autres
Publié: (2025)
Literary Evidence Retrieval via Long-Context Language Models
par: Thai, Katherine, et autres
Publié: (2025)
par: Thai, Katherine, et autres
Publié: (2025)
VeriFastScore: Speeding up long-form factuality evaluation
par: Rajendhran, Rishanth, et autres
Publié: (2025)
par: Rajendhran, Rishanth, et autres
Publié: (2025)
Beyond Precision: Importance-Aware Recall for Factuality Evaluation in Long-Form LLM Generation
par: Jafari, Nazanin, et autres
Publié: (2026)
par: Jafari, Nazanin, et autres
Publié: (2026)
Recovering Diversity Without Losing Alignment: A DPO Recipe for Post-Trained LLMs
par: Samuel, Vinay, et autres
Publié: (2026)
par: Samuel, Vinay, et autres
Publié: (2026)
Suri: Multi-constraint Instruction Following for Long-form Text Generation
par: Pham, Chau Minh, et autres
Publié: (2024)
par: Pham, Chau Minh, et autres
Publié: (2024)
Can LLMs reason over extended multilingual contexts? Towards long-context evaluation beyond retrieval and haystacks
par: Hengle, Amey, et autres
Publié: (2025)
par: Hengle, Amey, et autres
Publié: (2025)
EditLens: Quantifying the Extent of AI Editing in Text
par: Thai, Katherine, et autres
Publié: (2025)
par: Thai, Katherine, et autres
Publié: (2025)
Localizing and Mitigating Errors in Long-form Question Answering
par: Sachdeva, Rachneet, et autres
Publié: (2024)
par: Sachdeva, Rachneet, et autres
Publié: (2024)
Effective vocabulary expanding of multilingual language models for extremely low-resource languages
par: Zheng, Jianyu
Publié: (2026)
par: Zheng, Jianyu
Publié: (2026)
NarrativeTime: Dense Temporal Annotation on a Timeline
par: Rogers, Anna, et autres
Publié: (2019)
par: Rogers, Anna, et autres
Publié: (2019)
EuroGEST: Investigating gender stereotypes in multilingual language models
par: Rowe, Jacqueline, et autres
Publié: (2025)
par: Rowe, Jacqueline, et autres
Publié: (2025)
Continuous sentiment scores for literary and multilingual contexts
par: Lyngbaek, Laurits, et autres
Publié: (2025)
par: Lyngbaek, Laurits, et autres
Publié: (2025)
Whose story is it? Personalizing story generation by inferring author styles
par: Kumar, Nischal Ashok, et autres
Publié: (2025)
par: Kumar, Nischal Ashok, et autres
Publié: (2025)
Iteratively Prompting Multimodal LLMs to Reproduce Natural and AI-Generated Images
par: Naseh, Ali, et autres
Publié: (2024)
par: Naseh, Ali, et autres
Publié: (2024)
BooookScore: A systematic exploration of book-length summarization in the era of LLMs
par: Chang, Yapei, et autres
Publié: (2023)
par: Chang, Yapei, et autres
Publié: (2023)
TopicGPT: A Prompt-based Topic Modeling Framework
par: Pham, Chau Minh, et autres
Publié: (2023)
par: Pham, Chau Minh, et autres
Publié: (2023)
Error Span Annotation: A Balanced Approach for Human Evaluation of Machine Translation
par: Kocmi, Tom, et autres
Publié: (2024)
par: Kocmi, Tom, et autres
Publié: (2024)
Empirical study of pretrained multilingual language models for zero-shot cross-lingual knowledge transfer in generation
par: Chirkova, Nadezhda, et autres
Publié: (2023)
par: Chirkova, Nadezhda, et autres
Publié: (2023)
OverThink: Slowdown Attacks on Reasoning LLMs
par: Kumar, Abhinav, et autres
Publié: (2025)
par: Kumar, Abhinav, et autres
Publié: (2025)
SRS-Stories: Vocabulary-constrained multilingual story generation for language learning
par: Kamzela, Wiktor, et autres
Publié: (2025)
par: Kamzela, Wiktor, et autres
Publié: (2025)
Understanding the effects of language-specific class imbalance in multilingual fine-tuning
par: Jung, Vincent, et autres
Publié: (2024)
par: Jung, Vincent, et autres
Publié: (2024)
Investigating the interaction of linguistic and mathematical reasoning in language models using multilingual number puzzles
par: Bhattacharya, Antara Raaghavi, et autres
Publié: (2025)
par: Bhattacharya, Antara Raaghavi, et autres
Publié: (2025)
Contextualized Evaluations: Judging Language Model Responses to Underspecified Queries
par: Malaviya, Chaitanya, et autres
Publié: (2024)
par: Malaviya, Chaitanya, et autres
Publié: (2024)
Training language models to be warm and empathetic makes them less reliable and more sycophantic
par: Ibrahim, Lujain, et autres
Publié: (2025)
par: Ibrahim, Lujain, et autres
Publié: (2025)
Symbol tuning improves in-context learning in language models
par: Wei, Jerry, et autres
Publié: (2023)
par: Wei, Jerry, et autres
Publié: (2023)
WorldMedQA-V: a multilingual, multimodal medical examination dataset for multimodal language models evaluation
par: Matos, João, et autres
Publié: (2024)
par: Matos, João, et autres
Publié: (2024)
Information availability in different languages and various technological constraints related to multilinguism on the Internet
par: Khosla, Sonal, et autres
Publié: (2025)
par: Khosla, Sonal, et autres
Publié: (2025)
Documents similaires
-
One Thousand and One Pairs: A "novel" challenge for long-context language models
par: Karpinska, Marzena, et autres
Publié: (2024) -
People who frequently use ChatGPT for writing tasks are accurate and robust detectors of AI-generated text
par: Russell, Jenna, et autres
Publié: (2025) -
Does quantization affect models' performance on long-context tasks?
par: Mekala, Anmol, et autres
Publié: (2025) -
VERISCORE: Evaluating the factuality of verifiable claims in long-form text generation
par: Song, Yixiao, et autres
Publié: (2024) -
FABLES: Evaluating faithfulness and content selection in book-length summarization
par: Kim, Yekyung, et autres
Publié: (2024)