Scaling Granite Code Models to 128K Context
Fuente:
arXiv
Saved in:
| Main Authors: | Stallone, Matt, Saxena, Vaibhav, Karlinsky, Leonid, McGinn, Bridget, Bula, Tim, Mishra, Mayank, Soria, Adriana Meza, Zhang, Gaoyuan, Prasad, Aditya, Shen, Yikang, Surendran, Saptha, Guttula, Shanmukha, Patel, Hima, Selvam, Parameswaran, Dang, Xuan-Hong, Koyfman, Yan, Sood, Atin, Feris, Rogerio, Desai, Nirmit, Cox, David D., Puri, Ruchir, Panda, Rameswar |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
CIFE: Code Instruction-Following Evaluation
by: Gunnu, Sravani, et al.
Published: (2025)
by: Gunnu, Sravani, et al.
Published: (2025)
Granite Code Models: A Family of Open Foundation Models for Code Intelligence
by: Mishra, Mayank, et al.
Published: (2024)
by: Mishra, Mayank, et al.
Published: (2024)
Power Scheduler: A Batch Size and Token Number Agnostic Learning Rate Scheduler
by: Shen, Yikang, et al.
Published: (2024)
by: Shen, Yikang, et al.
Published: (2024)
La planeación educativa: ¿ciencia o política?
by: Noel McGinn
Published: (2006)
by: Noel McGinn
Published: (2006)
El Sistema Educativo Mexicano (un modelo de simulación de escenarios)
by: Noel McGinn
Published: (2014)
by: Noel McGinn
Published: (2014)
Information Networking and Economic Development.
by: McGinn, Howard
Published: (1987)
by: McGinn, Howard
Published: (1987)
El supuesto fracaso de la planificación educativa en América Latina
by: Noel McGinn
Published: (2005)
by: Noel McGinn
Published: (2005)
Hacia la evaluación de políticas financieras para incrementar el acceso a la educación terciaria
by: Noel McGinn
Published: (2007)
by: Noel McGinn
Published: (2007)
Dense Training, Sparse Inference: Rethinking Training of Mixture-of-Experts Language Models
by: Pan, Bowen, et al.
Published: (2024)
by: Pan, Bowen, et al.
Published: (2024)
The Automation of Technical Services in Venezuela's National Library: Aspects of a Transfer of Library Technology.
by: McGinn, Thomas P.
Published: (1982)
by: McGinn, Thomas P.
Published: (1982)
Diversity Measurement and Subset Selection for Instruction Tuning Datasets
by: Wang, Peiqi, et al.
Published: (2024)
by: Wang, Peiqi, et al.
Published: (2024)
Sexual and reproductive health services in New Zealand primary care settings: A mixed‐methods survey
by: Orna McGinn, et al.
Published: (2024)
by: Orna McGinn, et al.
Published: (2024)
Why Waste Your Vote? Informal Voting in Compulsory Elections in Australia
by: Eamon McGinn, et al.
Published: (2025)
by: Eamon McGinn, et al.
Published: (2025)
Bibliographic Databases Outside of the United States.
by: McGinn, Thomas P., et al.
Published: (1988)
by: McGinn, Thomas P., et al.
Published: (1988)
Sakura: An Approach for Generating Complex Tests from Natural Language Test Descriptions
by: Stennett, Tyler, et al.
Published: (2026)
by: Stennett, Tyler, et al.
Published: (2026)
Data-Prep-Kit: getting your data ready for LLM application development
by: Wood, David, et al.
Published: (2024)
by: Wood, David, et al.
Published: (2024)
Generating Verifiable Chain of Thoughts from Exection-Traces
by: Thakur, Shailja, et al.
Published: (2025)
by: Thakur, Shailja, et al.
Published: (2025)
Granite-Function Calling Model: Introducing Function Calling Abilities via Multi-task Learning of Granular Tasks
by: Abdelaziz, Ibrahim, et al.
Published: (2024)
by: Abdelaziz, Ibrahim, et al.
Published: (2024)
Self-MoE: Towards Compositional Large Language Models with Self-Specialized Experts
by: Kang, Junmo, et al.
Published: (2024)
by: Kang, Junmo, et al.
Published: (2024)
Navigating the Labyrinth: Evaluating LLMs' Ability to Reason About Search Problems
by: Borazjanizadeh, Nasim, et al.
Published: (2024)
by: Borazjanizadeh, Nasim, et al.
Published: (2024)
Aging in Nationhood: Everyday Nationalism and Belonging Among Seniors in Old‐Age Homes in Québec
by: Jessica Stallone
Published: (2025)
by: Jessica Stallone
Published: (2025)
Scattered Mixture-of-Experts Implementation
by: Tan, Shawn, et al.
Published: (2024)
by: Tan, Shawn, et al.
Published: (2024)
$\texttt{BATCLIP}$: Bimodal Online Test-Time Adaptation for CLIP
by: Maharana, Sarthak Kumar, et al.
Published: (2024)
by: Maharana, Sarthak Kumar, et al.
Published: (2024)
Agent Factories for High Level Synthesis: How Far Can General-Purpose Coding Agents Go in Hardware Optimization?
by: Bhandwaldar, Abhishek, et al.
Published: (2026)
by: Bhandwaldar, Abhishek, et al.
Published: (2026)
FlashFormer: Whole-Model Kernels for Efficient Low-Batch Inference
by: Nrusimha, Aniruddha, et al.
Published: (2025)
by: Nrusimha, Aniruddha, et al.
Published: (2025)
State-Space Large Audio Language Models
by: Bhati, Saurabhchand, et al.
Published: (2024)
by: Bhati, Saurabhchand, et al.
Published: (2024)
Visualizing Thought: Conceptual Diagrams Enable Robust Planning in LMMs
by: Borazjanizadeh, Nasim, et al.
Published: (2025)
by: Borazjanizadeh, Nasim, et al.
Published: (2025)
Latent Implicit Visual Reasoning
by: Li, Kelvin, et al.
Published: (2025)
by: Li, Kelvin, et al.
Published: (2025)
DASS: Distilled Audio State Space Models Are Stronger and More Duration-Scalable Learners
by: Bhati, Saurabhchand, et al.
Published: (2024)
by: Bhati, Saurabhchand, et al.
Published: (2024)
PaTH Attention: Position Encoding via Accumulating Householder Transformations
by: Yang, Songlin, et al.
Published: (2025)
by: Yang, Songlin, et al.
Published: (2025)
CAMELoT: Towards Large Language Models with Training-Free Consolidated Associative Memory
by: He, Zexue, et al.
Published: (2024)
by: He, Zexue, et al.
Published: (2024)
Scaling Stick-Breaking Attention: An Efficient Implementation and In-depth Study
by: Tan, Shawn, et al.
Published: (2024)
by: Tan, Shawn, et al.
Published: (2024)
Gated Linear Attention Transformers with Hardware-Efficient Training
by: Yang, Songlin, et al.
Published: (2023)
by: Yang, Songlin, et al.
Published: (2023)
Ask-EDA: A Design Assistant Empowered by LLM, Hybrid RAG and Abbreviation De-hallucination
by: Shi, Luyao, et al.
Published: (2024)
by: Shi, Luyao, et al.
Published: (2024)
A Systematic Approach for Large Language Models Debugging
by: Shbita, Basel, et al.
Published: (2026)
by: Shbita, Basel, et al.
Published: (2026)
Correcting exponentiality test for binned earthquake magnitudes
by: Stallone, Angela, et al.
Published: (2025)
by: Stallone, Angela, et al.
Published: (2025)
Whisper-Flamingo: Integrating Visual Features into Whisper for Audio-Visual Speech Recognition and Translation
by: Rouditchenko, Andrew, et al.
Published: (2024)
by: Rouditchenko, Andrew, et al.
Published: (2024)
$\textit{Trans-LoRA}$: towards data-free Transferable Parameter Efficient Finetuning
by: Wang, Runqian, et al.
Published: (2024)
by: Wang, Runqian, et al.
Published: (2024)
API Pack: A Massive Multi-Programming Language Dataset for API Call Generation
by: Guo, Zhen, et al.
Published: (2024)
by: Guo, Zhen, et al.
Published: (2024)
ScarfBench: A Benchmark for Cross-Framework Application Migration in Enterprise Java
by: Pavuluri, Advait, et al.
Published: (2026)
by: Pavuluri, Advait, et al.
Published: (2026)
Similar Items
-
CIFE: Code Instruction-Following Evaluation
by: Gunnu, Sravani, et al.
Published: (2025) -
Granite Code Models: A Family of Open Foundation Models for Code Intelligence
by: Mishra, Mayank, et al.
Published: (2024) -
Power Scheduler: A Batch Size and Token Number Agnostic Learning Rate Scheduler
by: Shen, Yikang, et al.
Published: (2024) -
La planeación educativa: ¿ciencia o política?
by: Noel McGinn
Published: (2006) -
El Sistema Educativo Mexicano (un modelo de simulación de escenarios)
by: Noel McGinn
Published: (2014)