Capability Ceilings in Autoregressive Language Models: Empirical Evidence from Knowledge-Intensive Tasks
Fuente:
arXiv
Guardado en:
| Autor principal: | Marín, Javier |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LoRA-Augmented Generation (LAG) for Knowledge-Intensive Language Tasks
por: Fleshman, William, et al.
Publicado: (2025)
por: Fleshman, William, et al.
Publicado: (2025)
Multilingual Retrieval-Augmented Generation for Knowledge-Intensive Task
por: Ranaldi, Leonardo, et al.
Publicado: (2025)
por: Ranaldi, Leonardo, et al.
Publicado: (2025)
Breaking the Capability Ceiling of LLM Post-Training by Reintroducing Markov States
por: Yuan, Yurun, et al.
Publicado: (2026)
por: Yuan, Yurun, et al.
Publicado: (2026)
ALPINE: Unveiling the Planning Capability of Autoregressive Learning in Language Models
por: Wang, Siwei, et al.
Publicado: (2024)
por: Wang, Siwei, et al.
Publicado: (2024)
Empirical Characterization of Temporal Constraint Processing in LLMs
por: Marín, Javier
Publicado: (2025)
por: Marín, Javier
Publicado: (2025)
Automatic Dataset Generation for Knowledge Intensive Question Answering Tasks
por: Yuen, Sizhe, et al.
Publicado: (2025)
por: Yuen, Sizhe, et al.
Publicado: (2025)
Autoregressive Models for Knowledge Graph Generation
por: Thanapalasingam, Thiviyan, et al.
Publicado: (2026)
por: Thanapalasingam, Thiviyan, et al.
Publicado: (2026)
Beyond Autoregression: An Empirical Study of Diffusion Large Language Models for Code Generation
por: Li, Chengze, et al.
Publicado: (2025)
por: Li, Chengze, et al.
Publicado: (2025)
Beyond Elicitation: Provision-based Prompt Optimization for Knowledge-Intensive Tasks
por: Xu, Yunzhe, et al.
Publicado: (2025)
por: Xu, Yunzhe, et al.
Publicado: (2025)
Test-Time Scaling in Reasoning Models Is Not Effective for Knowledge-Intensive Tasks Yet
por: Zhao, James Xu, et al.
Publicado: (2025)
por: Zhao, James Xu, et al.
Publicado: (2025)
Reasoning Capabilities of Large Language Models on Dynamic Tasks
por: Wong, Annie, et al.
Publicado: (2025)
por: Wong, Annie, et al.
Publicado: (2025)
An Empirical Study on Capability of Large Language Models in Understanding Code Semantics
por: Nguyen, Thu-Trang, et al.
Publicado: (2024)
por: Nguyen, Thu-Trang, et al.
Publicado: (2024)
The Depth Ceiling: On the Limits of Large Language Models in Discovering Latent Planning
por: Xu, Yi, et al.
Publicado: (2026)
por: Xu, Yi, et al.
Publicado: (2026)
Knowledge-Driven Hallucination in Large Language Models: An Empirical Study on Process Modeling
por: Kourani, Humam, et al.
Publicado: (2025)
por: Kourani, Humam, et al.
Publicado: (2025)
An Empirical Study of Knowledge Distillation for Code Understanding Tasks
por: Wang, Ruiqi, et al.
Publicado: (2025)
por: Wang, Ruiqi, et al.
Publicado: (2025)
Towards Building a Robust Knowledge Intensive Question Answering Model with Large Language Models
por: Hong, Xingyun, et al.
Publicado: (2024)
por: Hong, Xingyun, et al.
Publicado: (2024)
KaLM: Knowledge-aligned Autoregressive Language Modeling via Dual-view Knowledge Graph Contrastive Learning
por: Yu, Peng, et al.
Publicado: (2024)
por: Yu, Peng, et al.
Publicado: (2024)
Evaluating Large Language Models for Abstract Evaluation Tasks: An Empirical Study
por: Liu, Yinuo, et al.
Publicado: (2026)
por: Liu, Yinuo, et al.
Publicado: (2026)
LLaMA Beyond English: An Empirical Study on Language Capability Transfer
por: Zhao, Jun, et al.
Publicado: (2024)
por: Zhao, Jun, et al.
Publicado: (2024)
Reasoning or Reciting? Exploring the Capabilities and Limitations of Language Models Through Counterfactual Tasks
por: Wu, Zhaofeng, et al.
Publicado: (2023)
por: Wu, Zhaofeng, et al.
Publicado: (2023)
KGARevion: An AI Agent for Knowledge-Intensive Biomedical QA
por: Su, Xiaorui, et al.
Publicado: (2024)
por: Su, Xiaorui, et al.
Publicado: (2024)
Process Reward Agents for Steering Knowledge-Intensive Reasoning
por: Sohn, Jiwoong, et al.
Publicado: (2026)
por: Sohn, Jiwoong, et al.
Publicado: (2026)
Enhancing the Capabilities of Large Language Models for API calls through Knowledge Graphs
por: Yang, Ye, et al.
Publicado: (2025)
por: Yang, Ye, et al.
Publicado: (2025)
FoundaBench: Evaluating Chinese Fundamental Knowledge Capabilities of Large Language Models
por: Li, Wei, et al.
Publicado: (2024)
por: Li, Wei, et al.
Publicado: (2024)
APE: Selective Fine-tuning with Acceptance Criteria for Language Model Adaptation
por: Marín, Javier
Publicado: (2025)
por: Marín, Javier
Publicado: (2025)
Controllable and Reliable Knowledge-Intensive Task-Oriented Conversational Agents with Declarative Genie Worksheets
por: Joshi, Harshit, et al.
Publicado: (2024)
por: Joshi, Harshit, et al.
Publicado: (2024)
Knowledge Graph Structure as Prompt: Improving Small Language Models Capabilities for Knowledge-based Causal Discovery
por: Susanti, Yuni, et al.
Publicado: (2024)
por: Susanti, Yuni, et al.
Publicado: (2024)
An Empirical Study of Autoregressive Pre-training from Videos
por: Rajasegaran, Jathushan, et al.
Publicado: (2025)
por: Rajasegaran, Jathushan, et al.
Publicado: (2025)
Inferring Capabilities from Task Performance with Bayesian Triangulation
por: Burden, John, et al.
Publicado: (2023)
por: Burden, John, et al.
Publicado: (2023)
A non-ergodic framework for understanding emergent capabilities in Large Language Models
por: Marín, Javier
Publicado: (2025)
por: Marín, Javier
Publicado: (2025)
CityBench: Evaluating the Capabilities of Large Language Models for Urban Tasks
por: Feng, Jie, et al.
Publicado: (2024)
por: Feng, Jie, et al.
Publicado: (2024)
Do All Individual Layers Help? An Empirical Study of Task-Interfering Layers in Vision-Language Models
por: Liu, Zhiming, et al.
Publicado: (2026)
por: Liu, Zhiming, et al.
Publicado: (2026)
Explaining and Breaking the Safety-Helpfulness Ceiling via Preference Dimensional Expansion
por: Huang, ShiYing, et al.
Publicado: (2026)
por: Huang, ShiYing, et al.
Publicado: (2026)
Ensembling Tabular Foundation Models - A Diversity Ceiling And A Calibration Trap
por: Tanna, Aditya, et al.
Publicado: (2026)
por: Tanna, Aditya, et al.
Publicado: (2026)
Knowledge-Intensive Video Generation
por: Wang, Chenxu, et al.
Publicado: (2026)
por: Wang, Chenxu, et al.
Publicado: (2026)
WorkArena: How Capable Are Web Agents at Solving Common Knowledge Work Tasks?
por: Drouin, Alexandre, et al.
Publicado: (2024)
por: Drouin, Alexandre, et al.
Publicado: (2024)
Diagnosing Spectral Ceilings in Equivariant Neural Force Fields
por: Kim, Hyunmog
Publicado: (2026)
por: Kim, Hyunmog
Publicado: (2026)
Small Models, Big Tasks: An Exploratory Empirical Study on Small Language Models for Function Calling
por: Kavathekar, Ishan, et al.
Publicado: (2025)
por: Kavathekar, Ishan, et al.
Publicado: (2025)
Revisiting Parameter-Based Knowledge Editing in Large Language Models: Theoretical Limits and Empirical Evidence
por: Ren, Wanying, et al.
Publicado: (2026)
por: Ren, Wanying, et al.
Publicado: (2026)
Investigating Language Model Capabilities to Represent and Process Formal Knowledge: A Preliminary Study to Assist Ontology Engineering
por: Akl, Hanna Abi
Publicado: (2025)
por: Akl, Hanna Abi
Publicado: (2025)
Ejemplares similares
-
LoRA-Augmented Generation (LAG) for Knowledge-Intensive Language Tasks
por: Fleshman, William, et al.
Publicado: (2025) -
Multilingual Retrieval-Augmented Generation for Knowledge-Intensive Task
por: Ranaldi, Leonardo, et al.
Publicado: (2025) -
Breaking the Capability Ceiling of LLM Post-Training by Reintroducing Markov States
por: Yuan, Yurun, et al.
Publicado: (2026) -
ALPINE: Unveiling the Planning Capability of Autoregressive Learning in Language Models
por: Wang, Siwei, et al.
Publicado: (2024) -
Empirical Characterization of Temporal Constraint Processing in LLMs
por: Marín, Javier
Publicado: (2025)