The Geometric Anatomy of Capability Acquisition in Transformers
Fuente:
arXiv
Salvato in:
| Autore principale: | Billa, Jayadev |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Modality Collapse as Mismatched Decoding: Information-Theoretic Limits of Multimodal LLMs
di: Billa, Jayadev
Pubblicazione: (2026)
di: Billa, Jayadev
Pubblicazione: (2026)
Predicting Where Steering Vectors Succeed
di: Billa, Jayadev
Pubblicazione: (2026)
di: Billa, Jayadev
Pubblicazione: (2026)
The Cascade Equivalence Hypothesis: When Do Speech LLMs Behave Like ASR$\rightarrow$LLM Pipelines?
di: Billa, Jayadev
Pubblicazione: (2026)
di: Billa, Jayadev
Pubblicazione: (2026)
Algorithmic Capabilities of Random Transformers
di: Zhong, Ziqian, et al.
Pubblicazione: (2024)
di: Zhong, Ziqian, et al.
Pubblicazione: (2024)
MorphNAS: Differentiable Architecture Search for Morphologically-Aware Multilingual NER
di: Devadiga, Prathamesh, et al.
Pubblicazione: (2025)
di: Devadiga, Prathamesh, et al.
Pubblicazione: (2025)
AcquisitionSynthesis: Targeted Data Generation using Acquisition Functions
di: Agarwal, Ishika, et al.
Pubblicazione: (2026)
di: Agarwal, Ishika, et al.
Pubblicazione: (2026)
Schoenfeld's Anatomy of Mathematical Reasoning by Language Models
di: Li, Ming, et al.
Pubblicazione: (2025)
di: Li, Ming, et al.
Pubblicazione: (2025)
Anatomy of an Idiom: Tracing Non-Compositionality in Language Models
di: Gomes, Andrew
Pubblicazione: (2025)
di: Gomes, Andrew
Pubblicazione: (2025)
Decomposing the Depth Profile of Fine-Tuning
di: Billa, Jayadev
Pubblicazione: (2026)
di: Billa, Jayadev
Pubblicazione: (2026)
Data Mixing Can Induce Phase Transitions in Knowledge Acquisition
di: Gu, Xinran, et al.
Pubblicazione: (2025)
di: Gu, Xinran, et al.
Pubblicazione: (2025)
Human Inspired Progressive Alignment and Comparative Learning for Grounded Word Acquisition
di: Bao, Yuwei, et al.
Pubblicazione: (2023)
di: Bao, Yuwei, et al.
Pubblicazione: (2023)
When Audio-LLMs Don't Listen: A Cross-Linguistic Study of Modality Arbitration
di: Billa, Jayadev
Pubblicazione: (2026)
di: Billa, Jayadev
Pubblicazione: (2026)
Peering Through Preferences: Unraveling Feedback Acquisition for Aligning Large Language Models
di: Bansal, Hritik, et al.
Pubblicazione: (2023)
di: Bansal, Hritik, et al.
Pubblicazione: (2023)
Geometric-disentangelment Unlearning
di: Zhou, Duo, et al.
Pubblicazione: (2025)
di: Zhou, Duo, et al.
Pubblicazione: (2025)
Quantifying the Capabilities of LLMs across Scale and Precision
di: Badshah, Sher, et al.
Pubblicazione: (2024)
di: Badshah, Sher, et al.
Pubblicazione: (2024)
On Calibration of Large Language Models: From Response To Capability
di: Yang, Sin-Han, et al.
Pubblicazione: (2026)
di: Yang, Sin-Han, et al.
Pubblicazione: (2026)
Prescriptive Scaling Reveals the Evolution of Language Model Capabilities
di: Zhang, Hanlin, et al.
Pubblicazione: (2026)
di: Zhang, Hanlin, et al.
Pubblicazione: (2026)
AI Scientists Fail Without Strong Implementation Capability
di: Zhu, Minjun, et al.
Pubblicazione: (2025)
di: Zhu, Minjun, et al.
Pubblicazione: (2025)
Exploring and Benchmarking the Planning Capabilities of Large Language Models
di: Bohnet, Bernd, et al.
Pubblicazione: (2024)
di: Bohnet, Bernd, et al.
Pubblicazione: (2024)
Bridging the Knowledge Void: Inference-time Acquisition of Unfamiliar Programming Languages for Coding Tasks
di: Shen, Chen, et al.
Pubblicazione: (2026)
di: Shen, Chen, et al.
Pubblicazione: (2026)
Unlocking Reasoning Capabilities in LLMs via Reinforcement Learning Exploration
di: Deng, Wenhao, et al.
Pubblicazione: (2025)
di: Deng, Wenhao, et al.
Pubblicazione: (2025)
ALPINE: Unveiling the Planning Capability of Autoregressive Learning in Language Models
di: Wang, Siwei, et al.
Pubblicazione: (2024)
di: Wang, Siwei, et al.
Pubblicazione: (2024)
Automated Capability Discovery via Foundation Model Self-Exploration
di: Lu, Cong, et al.
Pubblicazione: (2025)
di: Lu, Cong, et al.
Pubblicazione: (2025)
ForecastBench: A Dynamic Benchmark of AI Forecasting Capabilities
di: Karger, Ezra, et al.
Pubblicazione: (2024)
di: Karger, Ezra, et al.
Pubblicazione: (2024)
ModelGPT: Unleashing LLM's Capabilities for Tailored Model Generation
di: Tang, Zihao, et al.
Pubblicazione: (2024)
di: Tang, Zihao, et al.
Pubblicazione: (2024)
What is it for a Machine Learning Model to Have a Capability?
di: Harding, Jacqueline, et al.
Pubblicazione: (2024)
di: Harding, Jacqueline, et al.
Pubblicazione: (2024)
How Numerical Precision Affects Arithmetical Reasoning Capabilities of LLMs
di: Feng, Guhao, et al.
Pubblicazione: (2024)
di: Feng, Guhao, et al.
Pubblicazione: (2024)
Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation
di: Padarha, Shreyansh
Pubblicazione: (2025)
di: Padarha, Shreyansh
Pubblicazione: (2025)
Assessing the Impact of Prompting Methods on ChatGPT's Mathematical Capabilities
di: Chen, Yuhao, et al.
Pubblicazione: (2023)
di: Chen, Yuhao, et al.
Pubblicazione: (2023)
Bringing Up a Bilingual BabyLM: Investigating Multilingual Language Acquisition Using Small-Scale Models
di: Zeng, Linda, et al.
Pubblicazione: (2026)
di: Zeng, Linda, et al.
Pubblicazione: (2026)
Breaking the Capability Ceiling of LLM Post-Training by Reintroducing Markov States
di: Yuan, Yurun, et al.
Pubblicazione: (2026)
di: Yuan, Yurun, et al.
Pubblicazione: (2026)
EffGen: Enabling Small Language Models as Capable Autonomous Agents
di: Srivastava, Gaurav, et al.
Pubblicazione: (2026)
di: Srivastava, Gaurav, et al.
Pubblicazione: (2026)
Language Diffusion Models are Associative Memories Capable of Retrieving Unseen Data
di: Pham, Bao, et al.
Pubblicazione: (2026)
di: Pham, Bao, et al.
Pubblicazione: (2026)
Counterfactual Evaluation Reveals Hidden Capability Profiles in Clinical LLMs and Agents
di: Turk, Matt
Pubblicazione: (2026)
di: Turk, Matt
Pubblicazione: (2026)
LimiX: Unleashing Structured-Data Modeling Capability for Generalist Intelligence
di: Zhang, Xingxuan, et al.
Pubblicazione: (2025)
di: Zhang, Xingxuan, et al.
Pubblicazione: (2025)
CityBench: Evaluating the Capabilities of Large Language Models for Urban Tasks
di: Feng, Jie, et al.
Pubblicazione: (2024)
di: Feng, Jie, et al.
Pubblicazione: (2024)
Disentangling Logic: The Role of Context in Large Language Model Reasoning Capabilities
di: Hua, Wenyue, et al.
Pubblicazione: (2024)
di: Hua, Wenyue, et al.
Pubblicazione: (2024)
Capability Instruction Tuning: A New Paradigm for Dynamic LLM Routing
di: Zhang, Yi-Kai, et al.
Pubblicazione: (2025)
di: Zhang, Yi-Kai, et al.
Pubblicazione: (2025)
STEM: Efficient Relative Capability Evaluation of LLMs through Structured Transition Samples
di: Hu, Haiquan, et al.
Pubblicazione: (2025)
di: Hu, Haiquan, et al.
Pubblicazione: (2025)
Scalpel vs. Hammer: GRPO Amplifies Existing Capabilities, SFT Replaces Them
di: Rajani, Neel, et al.
Pubblicazione: (2025)
di: Rajani, Neel, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Modality Collapse as Mismatched Decoding: Information-Theoretic Limits of Multimodal LLMs
di: Billa, Jayadev
Pubblicazione: (2026) -
Predicting Where Steering Vectors Succeed
di: Billa, Jayadev
Pubblicazione: (2026) -
The Cascade Equivalence Hypothesis: When Do Speech LLMs Behave Like ASR$\rightarrow$LLM Pipelines?
di: Billa, Jayadev
Pubblicazione: (2026) -
Algorithmic Capabilities of Random Transformers
di: Zhong, Ziqian, et al.
Pubblicazione: (2024) -
MorphNAS: Differentiable Architecture Search for Morphologically-Aware Multilingual NER
di: Devadiga, Prathamesh, et al.
Pubblicazione: (2025)