Who Gets Cited Most? Benchmarking Long-Context Numerical Reasoning on Scientific Articles
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Miao, Gurung, Alexander, Saparina, Irina, Lapata, Mirella |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Long-Context Reasoning Through Proxy-Based Chain-of-Thought Tuning
par: Li, Miao, et autres
Publié: (2026)
par: Li, Miao, et autres
Publié: (2026)
Reasoning about Intent for Ambiguous Requests
par: Saparina, Irina, et autres
Publié: (2025)
par: Saparina, Irina, et autres
Publié: (2025)
Disambiguate First, Parse Later: Generating Interpretations for Ambiguity Resolution in Semantic Parsing
par: Saparina, Irina, et autres
Publié: (2025)
par: Saparina, Irina, et autres
Publié: (2025)
AMBROSIA: A Benchmark for Parsing Ambiguous Questions into Database Queries
par: Saparina, Irina, et autres
Publié: (2024)
par: Saparina, Irina, et autres
Publié: (2024)
Improving Generalization in Semantic Parsing by Increasing Natural Language Variation
par: Saparina, Irina, et autres
Publié: (2024)
par: Saparina, Irina, et autres
Publié: (2024)
Learning to Reason for Long-Form Story Generation
par: Gurung, Alexander, et autres
Publié: (2025)
par: Gurung, Alexander, et autres
Publié: (2025)
Debating for Better Reasoning: An Unsupervised Multimodal Approach
par: Adhikari, Ashutosh, et autres
Publié: (2025)
par: Adhikari, Ashutosh, et autres
Publié: (2025)
CHIRON: Rich Character Representations in Long-Form Narratives
par: Gurung, Alexander, et autres
Publié: (2024)
par: Gurung, Alexander, et autres
Publié: (2024)
K*-Means: A Parameter-free Clustering Algorithm
par: Mahon, Louis, et autres
Publié: (2025)
par: Mahon, Louis, et autres
Publié: (2025)
Lightweight Latent Reasoning for Narrative Tasks
par: Gurung, Alexander, et autres
Publié: (2025)
par: Gurung, Alexander, et autres
Publié: (2025)
Long-Form Information Alignment Evaluation Beyond Atomic Facts
par: Zheng, Danna, et autres
Publié: (2025)
par: Zheng, Danna, et autres
Publié: (2025)
Think Before you Write: QA-Guided Reasoning for Character Descriptions in Books
par: Papoudakis, Argyrios, et autres
Publié: (2026)
par: Papoudakis, Argyrios, et autres
Publié: (2026)
ScreenWriter: Automatic Screenplay Generation and Movie Summarisation
par: Mahon, Louis, et autres
Publié: (2024)
par: Mahon, Louis, et autres
Publié: (2024)
Who Gets Cited? Gender- and Majority-Bias in LLM-Driven Reference Selection
par: He, Jiangen
Publié: (2025)
par: He, Jiangen
Publié: (2025)
Generating Visual Stories with Grounded and Coreferent Characters
par: Liu, Danyang, et autres
Publié: (2024)
par: Liu, Danyang, et autres
Publié: (2024)
How Reliable are LLMs as Knowledge Bases? Re-thinking Facutality and Consistency
par: Zheng, Danna, et autres
Publié: (2024)
par: Zheng, Danna, et autres
Publié: (2024)
BookWorm: A Dataset for Character Description and Analysis
par: Papoudakis, Argyrios, et autres
Publié: (2024)
par: Papoudakis, Argyrios, et autres
Publié: (2024)
What Gets Cited: Competitive GEO in AI Answer Engines
par: Vishwakarma, Rahul, et autres
Publié: (2026)
par: Vishwakarma, Rahul, et autres
Publié: (2026)
SimLM: Can Language Models Infer Parameters of Physical Systems?
par: Memery, Sean, et autres
Publié: (2023)
par: Memery, Sean, et autres
Publié: (2023)
Meta-Adaptive Prompt Distillation for Few-Shot Visual Question Answering
par: Gupta, Akash, et autres
Publié: (2025)
par: Gupta, Akash, et autres
Publié: (2025)
Explanatory Summarization with Discourse-Driven Planning
par: Liu, Dongqi, et autres
Publié: (2025)
par: Liu, Dongqi, et autres
Publié: (2025)
Context-Aware Hierarchical Merging for Long Document Summarization
par: Ou, Litu, et autres
Publié: (2025)
par: Ou, Litu, et autres
Publié: (2025)
CiteME: Can Language Models Accurately Cite Scientific Claims?
par: Press, Ori, et autres
Publié: (2024)
par: Press, Ori, et autres
Publié: (2024)
Long Context In-Context Compression by Getting to the Gist of Gisting
par: Petrov, Aleksandar, et autres
Publié: (2025)
par: Petrov, Aleksandar, et autres
Publié: (2025)
CiteCheck: Retrieval-Grounded Detection of LLM Citation Hallucinations in Scientific Text
par: Khajavi, Khashayar, et autres
Publié: (2026)
par: Khajavi, Khashayar, et autres
Publié: (2026)
CURIE: Evaluating LLMs On Multitask Scientific Long Context Understanding and Reasoning
par: Cui, Hao, et autres
Publié: (2025)
par: Cui, Hao, et autres
Publié: (2025)
Incentivizing In-depth Reasoning over Long Contexts with Process Advantage Shaping
par: Peng, Miao, et autres
Publié: (2026)
par: Peng, Miao, et autres
Publié: (2026)
What Is That Talk About? A Video-to-Text Summarization Dataset for Scientific Presentations
par: Liu, Dongqi, et autres
Publié: (2025)
par: Liu, Dongqi, et autres
Publié: (2025)
DocPuzzle: A Process-Aware Benchmark for Evaluating Realistic Long-Context Reasoning Capabilities
par: Zhuang, Tianyi, et autres
Publié: (2025)
par: Zhuang, Tianyi, et autres
Publié: (2025)
PRELUDE: A Benchmark Designed to Require Global Comprehension and Reasoning over Long Contexts
par: Yu, Mo, et autres
Publié: (2025)
par: Yu, Mo, et autres
Publié: (2025)
Context Selection for Hypothesis and Statistical Evidence Extraction from Full-Text Scientific Articles
par: Koneru, Sai, et autres
Publié: (2026)
par: Koneru, Sai, et autres
Publié: (2026)
LABSHIELD: A Multimodal Benchmark for Safety-Critical Reasoning and Planning in Scientific Laboratories
par: Sun, Qianpu, et autres
Publié: (2026)
par: Sun, Qianpu, et autres
Publié: (2026)
YABLoCo: Yet Another Benchmark for Long Context Code Generation
par: Valeev, Aidar, et autres
Publié: (2025)
par: Valeev, Aidar, et autres
Publié: (2025)
PaperArena: An Evaluation Benchmark for Tool-Augmented Agentic Reasoning on Scientific Literature
par: Wang, Daoyu, et autres
Publié: (2025)
par: Wang, Daoyu, et autres
Publié: (2025)
Reasoning BO: Enhancing Bayesian Optimization with Long-Context Reasoning Power of LLMs
par: Yang, Zhuo, et autres
Publié: (2025)
par: Yang, Zhuo, et autres
Publié: (2025)
Low-Rank Adaptation for Multilingual Summarization: An Empirical Study
par: Whitehouse, Chenxi, et autres
Publié: (2023)
par: Whitehouse, Chenxi, et autres
Publié: (2023)
CGBench: Benchmarking Language Model Scientific Reasoning for Clinical Genetics Research
par: Queen, Owen, et autres
Publié: (2025)
par: Queen, Owen, et autres
Publié: (2025)
Tanner Awards for the Most‐Cited Articles of 2022
Publié: (2025)
Publié: (2025)
Who Gets the Reward, Who Gets the Blame? Evaluation-Aligned Training Signals for Multi-LLM Agents
par: Yang, Chih-Hsuan, et autres
Publié: (2025)
par: Yang, Chih-Hsuan, et autres
Publié: (2025)
OlympicArena Medal Ranks: Who Is the Most Intelligent AI So Far?
par: Huang, Zhen, et autres
Publié: (2024)
par: Huang, Zhen, et autres
Publié: (2024)
Documents similaires
-
Long-Context Reasoning Through Proxy-Based Chain-of-Thought Tuning
par: Li, Miao, et autres
Publié: (2026) -
Reasoning about Intent for Ambiguous Requests
par: Saparina, Irina, et autres
Publié: (2025) -
Disambiguate First, Parse Later: Generating Interpretations for Ambiguity Resolution in Semantic Parsing
par: Saparina, Irina, et autres
Publié: (2025) -
AMBROSIA: A Benchmark for Parsing Ambiguous Questions into Database Queries
par: Saparina, Irina, et autres
Publié: (2024) -
Improving Generalization in Semantic Parsing by Increasing Natural Language Variation
par: Saparina, Irina, et autres
Publié: (2024)