ATLAS: All-round Testing of Long-context Abilities across Scales
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Huang, Deli, Wang, Cunguang, Tang, Hongyin, Tang, Zhe, Guo, Linsen, Ru, Dongyu, Yuan, Ruoshi, Zhu, Ziyue, Li, Xiaoyu, Wang, Ziwen, Zhang, Chen, Gui, Anchun, Zan, Wen, Zhang, Jiaqi, Cao, Xuezhi, Wang, Jingang, Cai, Xunliang, Cao, Yixin |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
R-Horizon: How Far Can Your Large Reasoning Model Really Go in Breadth and Depth?
par: Lu, Yi, et autres
Publié: (2025)
par: Lu, Yi, et autres
Publié: (2025)
NeedleInATable: Exploring Long-Context Capability of Large Language Models towards Long-Structured Tables
par: Wang, Lanrui, et autres
Publié: (2025)
par: Wang, Lanrui, et autres
Publié: (2025)
Ltri-LLM: Streaming Long Context Inference for LLMs with Training-Free Dynamic Triangular Attention Pattern
par: Tang, Hongyin, et autres
Publié: (2024)
par: Tang, Hongyin, et autres
Publié: (2024)
AMemGym: Interactive Memory Benchmarking for Assistants in Long-Horizon Conversations
par: Jiayang, Cheng, et autres
Publié: (2026)
par: Jiayang, Cheng, et autres
Publié: (2026)
A Preliminary Study on the Promises and Challenges of Native Top-$k$ Sparse Attention
par: Xiu, Di, et autres
Publié: (2025)
par: Xiu, Di, et autres
Publié: (2025)
Length Desensitization in Direct Preference Optimization
par: Liu, Wei, et autres
Publié: (2024)
par: Liu, Wei, et autres
Publié: (2024)
AgentEscapeBench: Evaluating Out-of-Domain Tool-Grounded Reasoning in LLM Agents
par: Guo, Zhengkang, et autres
Publié: (2026)
par: Guo, Zhengkang, et autres
Publié: (2026)
Sibyl: Empowering Empathetic Dialogue Generation in Large Language Models via Sensible and Visionary Commonsense Inference
par: Wang, Lanrui, et autres
Publié: (2023)
par: Wang, Lanrui, et autres
Publié: (2023)
Making Mathematical Reasoning Adaptive
par: Lai, Zhejian, et autres
Publié: (2025)
par: Lai, Zhejian, et autres
Publié: (2025)
Speculative Decoding via Early-exiting for Faster LLM Inference with Thompson Sampling Control Mechanism
par: Liu, Jiahao, et autres
Publié: (2024)
par: Liu, Jiahao, et autres
Publié: (2024)
Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese
par: Wang, Xihuai, et autres
Publié: (2025)
par: Wang, Xihuai, et autres
Publié: (2025)
UNO-Bench: A Unified Benchmark for Exploring the Compositional Law Between Uni-modal and Omni-modal in Omni Models
par: Chen, Chen, et autres
Publié: (2025)
par: Chen, Chen, et autres
Publié: (2025)
AMO-Bench: Large Language Models Still Struggle in High School Math Competitions
par: An, Shengnan, et autres
Publié: (2025)
par: An, Shengnan, et autres
Publié: (2025)
LongCat-Flash-Prover: Advancing Native Formal Reasoning via Agentic Tool-Integrated Reinforcement Learning
par: Wang, Jianing, et autres
Publié: (2026)
par: Wang, Jianing, et autres
Publié: (2026)
Graph-Structured Speculative Decoding
par: Gong, Zhuocheng, et autres
Publié: (2024)
par: Gong, Zhuocheng, et autres
Publié: (2024)
Why Not Act on What You Know? Unleashing Safety Potential of LLMs via Self-Aware Guard Enhancement
par: Ding, Peng, et autres
Publié: (2025)
par: Ding, Peng, et autres
Publié: (2025)
Efficient Context Scaling with LongCat ZigZag Attention
par: Zhang, Chen, et autres
Publié: (2025)
par: Zhang, Chen, et autres
Publié: (2025)
Microbial Memory of Drought Reshapes Root‐Associated Communities to Enhance Plant Resilience
par: Hongyin Qi, et autres
Publié: (2025)
par: Hongyin Qi, et autres
Publié: (2025)
General365: Benchmarking General Reasoning in Large Language Models Across Diverse and Challenging Tasks
par: Liu, Junlin, et autres
Publié: (2026)
par: Liu, Junlin, et autres
Publié: (2026)
FIRE: Flexible Integration of Data Quality Ratings for Effective Pre-Training
par: Xu, Liangyu, et autres
Publié: (2025)
par: Xu, Liangyu, et autres
Publié: (2025)
Chiral Binaphthyl[n]arene Gel: Controlled Gelation Ability and Stepwise Amplification of Circularly Polarized Luminescence
par: Zhihong Sun, et autres
Publié: (2024)
par: Zhihong Sun, et autres
Publié: (2024)
TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models
par: Wang, Zeqing, et autres
Publié: (2025)
par: Wang, Zeqing, et autres
Publié: (2025)
Friend or Foe: How LLMs' Safety Mind Gets Fooled by Intent Shift Attack
par: Ding, Peng, et autres
Publié: (2025)
par: Ding, Peng, et autres
Publié: (2025)
Dynamic Fisher-weighted Model Merging via Bayesian Optimization
par: Lee, Sanwoo, et autres
Publié: (2025)
par: Lee, Sanwoo, et autres
Publié: (2025)
C-ICL: Contrastive In-context Learning for Information Extraction
par: Mo, Ying, et autres
Publié: (2024)
par: Mo, Ying, et autres
Publié: (2024)
Oscillating Dispersion for Maximal Light-throughput Spectral Imaging
par: Zhang, Jiuyun, et autres
Publié: (2026)
par: Zhang, Jiuyun, et autres
Publié: (2026)
SALT-V: Lightweight Authentication for 5G V2X Broadcasting
par: Cao, Liu, et autres
Publié: (2025)
par: Cao, Liu, et autres
Publié: (2025)
CoSpace: Benchmarking Continuous Space Perception Ability for Vision-Language Models
par: Zhu, Yiqi, et autres
Publié: (2025)
par: Zhu, Yiqi, et autres
Publié: (2025)
Towards Reasoning Ability of Small Language Models
par: Srivastava, Gaurav, et autres
Publié: (2025)
par: Srivastava, Gaurav, et autres
Publié: (2025)
Minimum Sum Set Cover: Structures and Algorithm
par: Zhang, Zhongyi, et autres
Publié: (2026)
par: Zhang, Zhongyi, et autres
Publié: (2026)
Meeseeks: A Feedback-Driven, Iterative Self-Correction Benchmark evaluating LLMs' Instruction Following Capability
par: wang, Jiaming, et autres
Publié: (2025)
par: wang, Jiaming, et autres
Publié: (2025)
ReMamba: Equip Mamba with Effective Long-Sequence Modeling
par: Yuan, Danlong, et autres
Publié: (2024)
par: Yuan, Danlong, et autres
Publié: (2024)
LinkQA: Synthesizing Diverse QA from Multiple Seeds Strongly Linked by Knowledge Points
par: Zhang, Xuemiao, et autres
Publié: (2025)
par: Zhang, Xuemiao, et autres
Publié: (2025)
Large-Scale Diverse Synthesis for Mid-Training
par: Zhang, Xuemiao, et autres
Publié: (2025)
par: Zhang, Xuemiao, et autres
Publié: (2025)
IIET: Efficient Numerical Transformer via Implicit Iterative Euler Method
par: Liu, Xinyu, et autres
Publié: (2025)
par: Liu, Xinyu, et autres
Publié: (2025)
LARY: A Latent Action Representation Yielding Benchmark for Generalizable Vision-to-Action Alignment
par: Nie, Dujun, et autres
Publié: (2026)
par: Nie, Dujun, et autres
Publié: (2026)
Rethinking the Sampling Criteria in Reinforcement Learning for LLM Reasoning: A Competence-Difficulty Alignment Perspective
par: Kong, Deyang, et autres
Publié: (2025)
par: Kong, Deyang, et autres
Publié: (2025)
Preference Curriculum: LLMs Should Always Be Pretrained on Their Preferred Data
par: Zhang, Xuemiao, et autres
Publié: (2025)
par: Zhang, Xuemiao, et autres
Publié: (2025)
FRAME: Boosting LLMs with A Four-Quadrant Multi-Stage Pretraining Strategy
par: Zhang, Xuemiao, et autres
Publié: (2025)
par: Zhang, Xuemiao, et autres
Publié: (2025)
Expanding Reasoning Potential in Foundation Model by Learning Diverse Chains of Thought Patterns
par: Zhang, Xuemiao, et autres
Publié: (2025)
par: Zhang, Xuemiao, et autres
Publié: (2025)
Documents similaires
-
R-Horizon: How Far Can Your Large Reasoning Model Really Go in Breadth and Depth?
par: Lu, Yi, et autres
Publié: (2025) -
NeedleInATable: Exploring Long-Context Capability of Large Language Models towards Long-Structured Tables
par: Wang, Lanrui, et autres
Publié: (2025) -
Ltri-LLM: Streaming Long Context Inference for LLMs with Training-Free Dynamic Triangular Attention Pattern
par: Tang, Hongyin, et autres
Publié: (2024) -
AMemGym: Interactive Memory Benchmarking for Assistants in Long-Horizon Conversations
par: Jiayang, Cheng, et autres
Publié: (2026) -
A Preliminary Study on the Promises and Challenges of Native Top-$k$ Sparse Attention
par: Xiu, Di, et autres
Publié: (2025)