DetectiveQA: Evaluating Long-Context Reasoning on Detective Novels
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xu, Zhe, Ye, Jiasheng, Liu, Xiaoran, Liu, Xiangyang, Sun, Tianxiang, Liu, Zhigeng, Guo, Qipeng, Li, Linlin, Liu, Qun, Huang, Xuanjing, Qiu, Xipeng |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LongLLaDA: Unlocking Long Context Capabilities in Diffusion LLMs
par: Liu, Xiaoran, et autres
Publié: (2025)
par: Liu, Xiaoran, et autres
Publié: (2025)
Thus Spake Long-Context Large Language Model
par: Liu, Xiaoran, et autres
Publié: (2025)
par: Liu, Xiaoran, et autres
Publié: (2025)
ReAttention: Training-Free Infinite Context with Finite Attention Scope
par: Liu, Xiaoran, et autres
Publié: (2024)
par: Liu, Xiaoran, et autres
Publié: (2024)
Beyond Real: Imaginary Extension of Rotary Position Embeddings for Long-Context LLMs
par: Liu, Xiaoran, et autres
Publié: (2025)
par: Liu, Xiaoran, et autres
Publié: (2025)
LongSafety: Enhance Safety for Long-Context LLMs
par: Huang, Mianqiu, et autres
Publié: (2024)
par: Huang, Mianqiu, et autres
Publié: (2024)
Sparse-dLLM: Accelerating Diffusion LLMs with Dynamic Cache Eviction
par: Song, Yuerong, et autres
Publié: (2025)
par: Song, Yuerong, et autres
Publié: (2025)
Beyond Homogeneous Attention: Memory-Efficient LLMs via Fourier-Approximated KV Cache
par: Liu, Xiaoran, et autres
Publié: (2025)
par: Liu, Xiaoran, et autres
Publié: (2025)
ARISE: An Adaptive Resolution-Aware Metric for Test-Time Scaling Evaluation in Large Reasoning Models
par: Yin, Zhangyue, et autres
Publié: (2025)
par: Yin, Zhangyue, et autres
Publié: (2025)
LongWanjuan: Towards Systematic Measurement for Long Text Quality
par: Lv, Kai, et autres
Publié: (2024)
par: Lv, Kai, et autres
Publié: (2024)
AgentLongBench: A Controllable Long Benchmark For Long-Contexts Agents via Environment Rollouts
par: Fang, Shicheng, et autres
Publié: (2026)
par: Fang, Shicheng, et autres
Publié: (2026)
Data Mixing Laws: Optimizing Data Mixtures by Predicting Language Modeling Performance
par: Ye, Jiasheng, et autres
Publié: (2024)
par: Ye, Jiasheng, et autres
Publié: (2024)
Making Large Language Models Better Reasoners with Orchestrated Streaming Experiences
par: Liu, Xiangyang, et autres
Publié: (2025)
par: Liu, Xiangyang, et autres
Publié: (2025)
Beyond Attention Magnitude: Leveraging Inter-layer Rank Consistency for Efficient Vision-Language-Action Models
par: Liu, Peiju, et autres
Publié: (2026)
par: Liu, Peiju, et autres
Publié: (2026)
LLM can Achieve Self-Regulation via Hyperparameter Aware Generation
par: Wang, Siyin, et autres
Publié: (2024)
par: Wang, Siyin, et autres
Publié: (2024)
Emergent Structured Representations Support Flexible In-Context Inference in Large Language Models
par: Xu, Ningyu, et autres
Publié: (2026)
par: Xu, Ningyu, et autres
Publié: (2026)
F-Eval: Assessing Fundamental Abilities with Refined Evaluation Methods
par: Sun, Yu, et autres
Publié: (2024)
par: Sun, Yu, et autres
Publié: (2024)
Identifying Semantic Induction Heads to Understand In-Context Learning
par: Ren, Jie, et autres
Publié: (2024)
par: Ren, Jie, et autres
Publié: (2024)
AstroReason-Bench: Evaluating Unified Agentic Planning across Heterogeneous Space Planning Problems
par: Wang, Weiyi, et autres
Publié: (2026)
par: Wang, Weiyi, et autres
Publié: (2026)
DuoDecoding: Hardware-aware Heterogeneous Speculative Decoding with Dynamic Multi-Sequence Drafting
par: Lv, Kai, et autres
Publié: (2025)
par: Lv, Kai, et autres
Publié: (2025)
RepoQA: Evaluating Long Context Code Understanding
par: Liu, Jiawei, et autres
Publié: (2024)
par: Liu, Jiawei, et autres
Publié: (2024)
Full Parameter Fine-tuning for Large Language Models with Limited Resources
par: Lv, Kai, et autres
Publié: (2023)
par: Lv, Kai, et autres
Publié: (2023)
How to Set the Learning Rate for Large-Scale Pre-training?
par: Zhou, Yunhua, et autres
Publié: (2026)
par: Zhou, Yunhua, et autres
Publié: (2026)
Aggregation of Reasoning: A Hierarchical Framework for Enhancing Answer Selection in Large Language Models
par: Yin, Zhangyue, et autres
Publié: (2024)
par: Yin, Zhangyue, et autres
Publié: (2024)
Error Classification of Large Language Models on Math Word Problems: A Dynamically Adaptive Framework
par: Sun, Yuhong, et autres
Publié: (2025)
par: Sun, Yuhong, et autres
Publié: (2025)
Inference-Time Decontamination: Reusing Leaked Benchmarks for Large Language Model Evaluation
par: Zhu, Qin, et autres
Publié: (2024)
par: Zhu, Qin, et autres
Publié: (2024)
AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling
par: Zhan, Jun, et autres
Publié: (2024)
par: Zhan, Jun, et autres
Publié: (2024)
LongHalQA: Long-Context Hallucination Evaluation for MultiModal Large Language Models
par: Qiu, Han, et autres
Publié: (2024)
par: Qiu, Han, et autres
Publié: (2024)
Scaling of Search and Learning: A Roadmap to Reproduce o1 from Reinforcement Learning Perspective
par: Zeng, Zhiyuan, et autres
Publié: (2024)
par: Zeng, Zhiyuan, et autres
Publié: (2024)
Agent Alignment in Evolving Social Norms
par: Li, Shimin, et autres
Publié: (2024)
par: Li, Shimin, et autres
Publié: (2024)
Scaling Laws of RoPE-based Extrapolation
par: Liu, Xiaoran, et autres
Publié: (2023)
par: Liu, Xiaoran, et autres
Publié: (2023)
NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts
par: Gupta, Abhay, et autres
Publié: (2025)
par: Gupta, Abhay, et autres
Publié: (2025)
Can Language Models Learn to Skip Steps?
par: Liu, Tengxiao, et autres
Publié: (2024)
par: Liu, Tengxiao, et autres
Publié: (2024)
Flames: Benchmarking Value Alignment of LLMs in Chinese
par: Huang, Kexin, et autres
Publié: (2023)
par: Huang, Kexin, et autres
Publié: (2023)
AutoLogi: Automated Generation of Logic Puzzles for Evaluating Reasoning Abilities of Large Language Models
par: Zhu, Qin, et autres
Publié: (2025)
par: Zhu, Qin, et autres
Publié: (2025)
Model Utility Law: Evaluating LLMs beyond Performance through Mechanism Interpretable Metric
par: Cao, Yixin, et autres
Publié: (2025)
par: Cao, Yixin, et autres
Publié: (2025)
Prism: Spectral-Aware Block-Sparse Attention
par: Wang, Xinghao, et autres
Publié: (2026)
par: Wang, Xinghao, et autres
Publié: (2026)
Multi-hop Reasoning via Early Knowledge Alignment
par: Wang, Yuxin, et autres
Publié: (2025)
par: Wang, Yuxin, et autres
Publié: (2025)
AdaLomo: Low-memory Optimization with Adaptive Learning Rate
par: Lv, Kai, et autres
Publié: (2023)
par: Lv, Kai, et autres
Publié: (2023)
Benchmarking Hallucination in Large Language Models based on Unanswerable Math Word Problem
par: Sun, Yuhong, et autres
Publié: (2024)
par: Sun, Yuhong, et autres
Publié: (2024)
Can AI Assistants Know What They Don't Know?
par: Cheng, Qinyuan, et autres
Publié: (2024)
par: Cheng, Qinyuan, et autres
Publié: (2024)
Documents similaires
-
LongLLaDA: Unlocking Long Context Capabilities in Diffusion LLMs
par: Liu, Xiaoran, et autres
Publié: (2025) -
Thus Spake Long-Context Large Language Model
par: Liu, Xiaoran, et autres
Publié: (2025) -
ReAttention: Training-Free Infinite Context with Finite Attention Scope
par: Liu, Xiaoran, et autres
Publié: (2024) -
Beyond Real: Imaginary Extension of Rotary Position Embeddings for Long-Context LLMs
par: Liu, Xiaoran, et autres
Publié: (2025) -
LongSafety: Enhance Safety for Long-Context LLMs
par: Huang, Mianqiu, et autres
Publié: (2024)